Los laboratorios de código abierto descifraron el problema: compra inteligencia con capacidad, no con cómputo bruto.
Kimi K3 ejecuta una arquitectura de Mezcla de Expertos (MoE) que solo activa 16 de 896 expertos por token. Obtienes una enorme capacidad de modelo sin disparar tu presupuesto de entrenamiento con cómputo denso total.
Esta es la ventaja de la MoE: la activación dispersa te permite escalar los parámetros del modelo mucho más alto mientras mantienes constantes las FLOPs por token. El costo de entrenamiento se mantiene lineal, pero la expresividad del modelo escala con el conteo total de expertos.
Por qué la MoE está dominando:
- Modelos densos: cada parámetro se activa cada vez = costoso a gran escala
- Modelos MoE: enrutan los tokens hacia expertos especializados = el mismo costo de entrenamiento, mucha más capacidad
Kimi K3 demuestra que puedes desplegar modelos de casi un billón de parámetros sin facturas de cómputo de billones de dólares. La jugada ganadora es la eficiencia arquitectónica, no simplemente añadir más GPU al problema.
Kimi K3 ejecuta una arquitectura de Mezcla de Expertos (MoE) que solo activa 16 de 896 expertos por token. Obtienes una enorme capacidad de modelo sin disparar tu presupuesto de entrenamiento con cómputo denso total.
Esta es la ventaja de la MoE: la activación dispersa te permite escalar los parámetros del modelo mucho más alto mientras mantienes constantes las FLOPs por token. El costo de entrenamiento se mantiene lineal, pero la expresividad del modelo escala con el conteo total de expertos.
Por qué la MoE está dominando:
- Modelos densos: cada parámetro se activa cada vez = costoso a gran escala
- Modelos MoE: enrutan los tokens hacia expertos especializados = el mismo costo de entrenamiento, mucha más capacidad
Kimi K3 demuestra que puedes desplegar modelos de casi un billón de parámetros sin facturas de cómputo de billones de dólares. La jugada ganadora es la eficiencia arquitectónica, no simplemente añadir más GPU al problema.