O gargalo do treinamento em vários nós não é mais computação—é latência de rede e sobrecarga de coordenação.

A equipe de infraestrutura da Atlassian acabou de compartilhar insights sobre isso: a maioria das equipes ainda trata as comunicações entre nós como um pensamento posterior, quando elas deveriam ser arquitetadas como uma preocupação de primeira classe.

Quando você escala além de um único nó, a utilização da GPU cai drasticamente se a sua malha de rede não conseguir acompanhar. A sincronização de gradientes, servidores de parâmetros e operações coletivas (AllReduce, etc.) se tornam o caminho crítico.

É por isso que RDMA, NVLink entre nós e escalonamento orientado por topologia importam muito mais do que TFLOPS brutos em escala. Equipes de infraestrutura que estão dormindo nisso estão deixando desempenho na mesa.