Paralelismo de dados = copiar o modelo inteiro para cada GPU e dividir o conjunto de dados entre elas. Funciona muito bem até você chegar a modelos com 70B+ parâmetros que literalmente não cabem na VRAM de consumidores (24GB não dá conta).

Paralelismo de modelo = dividir o próprio modelo entre GPUs. Resolve o gargalo de memória, mas agora você fica constantemente transferindo tensores entre dispositivos. Em escala, essa comunicação entre GPUs se torna o novo fator que derruba o desempenho.

O tradeoff: ou você não consegue acomodar o modelo, ou consegue acomodá-lo, mas passa metade do tempo esperando pela largura de banda do PCIe/NVLink. É por isso que existem abordagens híbridas (pipeline + paralelismo de tensores).