Los “cuatro grandes” modelos nativos de China: son tan potentes que da miedo; todos siguieron su propio camino

Cada casa logró el extremo en una dimensión distinta y encontró su propio foso defensivo.

1. Kimi: el dios del preentrenamiento
Moon’s Dark Side llevó los parámetros hasta 2.8 billones; sus capacidades están justo por debajo de Fable5 y es, de momento, el límite más alto entre los modelos nacionales. Sus ingresos superan los 20 millones de dólares, pero las alianzas requieren reparto de ganancias; gana gracias a la prima tecnológica, no a pelear por cuota con precios bajos. 2.8 billones de parámetros, incluso a escala global, lo colocan en el primer escalón. Kimi invirtió fuerte tanto en tamaño de parámetros como en la calidad de los datos de preentrenamiento.

2. DeepSeek: el dios de la eficiencia de costos
A igual precio, no tiene rival; en la industria se le llama “línea de exterminio”. Si otros modelos se ponen por encima del precio de DeepSeek, básicamente ya no les queda margen. El hardware se recupera en 10 meses; tras el aumento de precio, se estima que se recupera en solo tres meses. DeepSeek usa una arquitectura MoE para llevar el costo de inferencia al extremo: con el mismo precio por token, los demás pierden dinero mientras que él gana. Toda la industria está mirando su estrategia de precios para ajustar la suya.

3. GLM: el dios del postentrenamiento
Zhipu tomó un camino completamente distinto. El modelo base GLM5 entrenó una versión más pequeña; en cada generación, mejora aún más que la anterior. El salto de versión en la versión pequeña es comparable al de una versión grande. Con solo más de 700 mil millones de parámetros, su nivel de inteligencia alcanza el de Opus 4.8. Con el mismo modelo base, otros entrenan a 70 puntos y GLM puede entrenar a 90. Las barreras técnicas del postentrenamiento son más difíciles de replicar que simplemente “apilar parámetros”. Lo que se acumula aquí es know-how; simplemente gastar dinero no basta.

4. MiniMax: el dios de los videos multimodales
Los tres anteriores se dedican a “exprimir” en el carril de los modelos de lenguaje, pero MiniMax cambió directamente de pista. Modelos de video de código abierto alcanzaron un nivel completamente nuevo; en capacidades multimodales, es el más destacado de las cuatro. La generación de video apenas está empezando: el espacio de mercado podría ser incluso mayor que el de los modelos de lenguaje. No se queda en el mar rojo a la fuerza, sino que construye fortificaciones en el mar azul; esa estrategia es muy inteligente.

Los modelos de gran escala de China ya pasaron la etapa de compararse de forma integral con GPT y, ahora, comienzan a diferenciarse. Al final, ganará quien logre ser insustituible en su propio nicho ecológico.