OpenClaw encendió la chispa, GLM-5.2 le echó leña

OpenClaw hizo que las empresas de modelos sintieran por primera vez el sabor dulce de la economía Token: ¡10.4 billones de llamadas en un solo mes, la curva de ingresos se disparó verticalmente!

El 17 de junio, GLM-5.2 fue open source. Esta vez es diferente.

Licencia MIT: puedes modificar, vender, y los derechos de propiedad intelectual se anulan. Las empresas pueden integrarlo sin preocupaciones en sus productos comerciales, si lo modifican no tienen que compartirlo. Comparado con la licencia GPL, que es contagiosa, esto es como quitar las barreras.

Lo más importante es que—la IA entra en la era del razonamiento prolongado.

Antes era un sprint. Cada ventana de tarea era limitada, la ejecución se terminaba, el KV Cache era controlable, y la presión recaía en la capacidad de cómputo.

Después de GLM-5.2, estamos en un maratón. 1M de contexto sin pérdida, una sola tarea contiene todo el código, todo el historial de decisiones, y todas las condiciones de restricción. En pruebas, se procesaron 880,000 tokens en una sola vez, la ventana casi se llena por completo.

El agente ya no es solo una máquina de preguntas y respuestas. Descompone el objetivo → planificación en múltiples rondas → validación repetida → ajuste de herramientas → escritura de código y ejecución → replanificación basada en la retroalimentación. Una tarea activa cientos de ciclos de razonamiento, el consumo de tokens pasa de lineal a exponencial.

En cada ciclo, todo el contexto se carga en memoria y se recalcula. Cálculo continuo, comunicación continua, lectura y escritura continua. Estos tres continuos, cambiaron drásticamente la lógica de precios del hardware.

¿A quién beneficia el razonamiento de largo alcance del agente?

HBM
El KV Cache aumenta linealmente con cada ronda y contexto, llenando rápidamente la HBM de la GPU. Una vez que sales de lo local, el ancho de banda cae de TB/s a cientos de GB/s. El problema pasa de ser la capacidad de cómputo a ser el ancho de banda de memoria. Las capacidades de las tres grandes están agotadas, con una brecha del 50%-60%, el mercado alcanzará los 54.6 mil millones de dólares en 2026.

Chip óptico/InP
El razonamiento de largo alcance en clústeres tiene un volumen de comunicación aterrador. Los módulos ópticos alcanzarán un incremento anual del 60% en 2026, con una brecha del 70%+ en sustratos de InP, y el precio del indio subiendo un 90% interanual.

CPU
La programación a largo plazo, la descomposición de tareas, y la gestión del KV Cache dependen de la CPU. La proporción de GPU de 1:8 se acerca a 1:1. El CEO de Intel menciona que varios CEOs de empresas están llamando para apurar el suministro.

Refrigeración líquida
El uso prolongado a plena carga, el mismo chip consume de 3 a 5 veces más que el razonamiento corto. El consumo de energía del rack salta de 36 kW a 200 kW. La refrigeración por aire no puede soportarlo.

Switches
La demanda de ancho de banda para clústeres de razonamiento salta de 100G a 400G, cientos de miles de tarjetas necesitan ser gestionadas, IB y Ethernet se benefician en toda la línea.

Placas ABF
Los clústeres pasan de miles a decenas de miles de tarjetas, cada chip necesita ser empaquetado. Ajinomoto monopoliza más del 90% de la película ABF, con una brecha del 42% para 2028. El precio de la harina sube, el pan solo será más caro.

CCL M9
Las placas madre y los backplanes requieren materiales de alta velocidad. El precio de M9 es 10 veces más que el de FR4, el mercado alcanzará los 18.7 mil millones de dólares en 2027, con una tasa de crecimiento que supera a la de los módulos ópticos.

OpenClaw encendió el fuego, GLM-5.2 le echó leña. El primero permitió que las empresas de modelos ganaran su primer barril de Tokens, y el segundo llevó al mercado de los laboratorios a la industria.

Quédate en el almacenamiento, quédate en la luz, disfruta de la burbuja.
$MU
$SKHYNIX
$LITE