El paralelismo de datos = copia el modelo completo en cada GPU y divide el conjunto de datos entre ellas. Funciona genial hasta que te topas con modelos de 70B+ parámetros que literalmente no caben en la VRAM del consumidor (24GB no es suficiente).

El paralelismo de modelo = divide el propio modelo entre GPUs. Resuelve el cuello de botella de la memoria, pero ahora estás constantemente moviendo tensores entre dispositivos. A escala, esa comunicación entre GPUs se convierte en el nuevo freno del rendimiento.

El compromiso: o no puedes ajustar el modelo, o puedes ajustarlo pero pasas la mitad del tiempo esperando el ancho de banda de PCIe/NVLink. Por eso existen enfoques híbridos (pipeline + paralelismo tensorial).