A OpenClaw acendeu o fogo, e o GLM-5.2 deu a lenha
A OpenClaw fez as empresas de modelos provarem pela primeira vez o sabor do Token Economy — 104 trilhões de chamadas no mês, com a curva de receita subindo em linha reta.
Em 17 de junho, o GLM-5.2 foi open-source. Desta vez, é diferente.
Protocolo MIT: pode alterar à vontade, vender à vontade, com a propriedade intelectual zerada. As empresas ficam tranquilas para integrar em produtos comerciais; se alterarem, não precisam entregá-las. Em comparação com o protocolo contagioso da GPL, é como desmontar a barreira.
O mais importante é que — a IA entra na era da inferência de longo raciocínio.
Antes era corrida de curta distância. A janela de execução de cada tarefa era limitada; ao terminar o planejamento e a execução, o KV Cache ficava sob controle, e a pressão estava no poder de computação.
Depois do GLM-5.2 é uma maratona. Contexto de 1M sem perdas: uma única tarefa segura todo o código, todo o histórico de decisões e todas as restrições. Na prática, processa 880 mil tokens em uma única execução, com a janela quase totalmente ocupada.
O Agent não é mais uma máquina de perguntas e respostas. Ele decompõe o objetivo → planejamento em múltiplas rodadas → verificação repetida → usa ferramentas → escreve código e roda o código → replaneja com base no feedback. Uma tarefa dispara centenas de ciclos de inferência; o consumo de Tokens sai de linear e vira exponencial.
Em cada ciclo, o contexto completo é carregado novamente na memória para ser recalculado. Computação contínua, comunicação contínua, leitura e escrita contínuas. Esses três “contínuos” mudam completamente a lógica de precificação do hardware.
Inferência longa beneficia o quê?
HBM
O KV Cache cresce de forma linear com as rodadas e com o contexto, enchendo rapidamente a memória HBM da GPU. Assim que sair do ambiente local, a largura de banda cai de TB/s para centenas de GB/s. O problema deixa de ser poder de computação e passa a ser a largura de banda da memória. Com três grandes fabricantes sem capacidade, a lacuna é de 50%-60%; em 2026, o mercado chega a US$ 54,6 bilhões.
Cipros/optoeletrônica/InP
Rodar inferência de longo alcance em clusters faz o volume de comunicação entre placas ser assustador. Módulos ópticos: crescimento anual de 60% em 2026, chegando a US$ 26 bilhões; falta de substrato InP de 70%+; preço do índio sobe 90% ano contra ano.
CPU
Escalonamento de longo alcance, decomposição de tarefas e gerenciamento de KV Cache dependem da CPU. A proporção de GPUs sai de 1:8 para se aproximar de 1:1. O CEO da Intel disse que CEOs de várias empresas telefonaram para apressar pedidos de entrega.
Resfriamento líquido
Inferência longa fica carregada o tempo todo; com a mesma placa, o consumo de energia é 3-5 vezes o de inferência curta. A potência dos racks sai de 36kW para 200kW. Resfriamento a ar não dá conta.
Switches
A demanda de largura de banda dos clusters de inferência sai de 100G para 400G; com centenas de milhares de placas para escalonar, IB e Ethernet se beneficiam em toda a linha.
Placas ABF
O cluster vai de centenas de chips para milhares de chips, e cada chip precisa ser encapsulado. A Ajinomoto monopoliza mais de 90% das membranas ABF; em 2028, a falta será de 42%. Preço do “farinha” sobe, e o pão só fica mais caro.
CCL M9
O backplane da placa-mãe inteira precisa de material de base de alta velocidade. O preço unitário do M9 é 10 vezes o do FR4; em 2027, o mercado será de US$ 18,7 bilhões, com crescimento acima dos módulos ópticos.
A OpenClaw acendeu o fogo, e o GLM-5.2 deu a lenha. A primeira fez as empresas de modelos ganharem o primeiro barril de Token; a segunda levou o mercado dos laboratórios para a indústria.
Nos armazenamento de estação, na fibra óptica de estação, aproveite a espuma.
$MU
$SKHYNIX
$LITE
A OpenClaw fez as empresas de modelos provarem pela primeira vez o sabor do Token Economy — 104 trilhões de chamadas no mês, com a curva de receita subindo em linha reta.
Em 17 de junho, o GLM-5.2 foi open-source. Desta vez, é diferente.
Protocolo MIT: pode alterar à vontade, vender à vontade, com a propriedade intelectual zerada. As empresas ficam tranquilas para integrar em produtos comerciais; se alterarem, não precisam entregá-las. Em comparação com o protocolo contagioso da GPL, é como desmontar a barreira.
O mais importante é que — a IA entra na era da inferência de longo raciocínio.
Antes era corrida de curta distância. A janela de execução de cada tarefa era limitada; ao terminar o planejamento e a execução, o KV Cache ficava sob controle, e a pressão estava no poder de computação.
Depois do GLM-5.2 é uma maratona. Contexto de 1M sem perdas: uma única tarefa segura todo o código, todo o histórico de decisões e todas as restrições. Na prática, processa 880 mil tokens em uma única execução, com a janela quase totalmente ocupada.
O Agent não é mais uma máquina de perguntas e respostas. Ele decompõe o objetivo → planejamento em múltiplas rodadas → verificação repetida → usa ferramentas → escreve código e roda o código → replaneja com base no feedback. Uma tarefa dispara centenas de ciclos de inferência; o consumo de Tokens sai de linear e vira exponencial.
Em cada ciclo, o contexto completo é carregado novamente na memória para ser recalculado. Computação contínua, comunicação contínua, leitura e escrita contínuas. Esses três “contínuos” mudam completamente a lógica de precificação do hardware.
Inferência longa beneficia o quê?
HBM
O KV Cache cresce de forma linear com as rodadas e com o contexto, enchendo rapidamente a memória HBM da GPU. Assim que sair do ambiente local, a largura de banda cai de TB/s para centenas de GB/s. O problema deixa de ser poder de computação e passa a ser a largura de banda da memória. Com três grandes fabricantes sem capacidade, a lacuna é de 50%-60%; em 2026, o mercado chega a US$ 54,6 bilhões.
Cipros/optoeletrônica/InP
Rodar inferência de longo alcance em clusters faz o volume de comunicação entre placas ser assustador. Módulos ópticos: crescimento anual de 60% em 2026, chegando a US$ 26 bilhões; falta de substrato InP de 70%+; preço do índio sobe 90% ano contra ano.
CPU
Escalonamento de longo alcance, decomposição de tarefas e gerenciamento de KV Cache dependem da CPU. A proporção de GPUs sai de 1:8 para se aproximar de 1:1. O CEO da Intel disse que CEOs de várias empresas telefonaram para apressar pedidos de entrega.
Resfriamento líquido
Inferência longa fica carregada o tempo todo; com a mesma placa, o consumo de energia é 3-5 vezes o de inferência curta. A potência dos racks sai de 36kW para 200kW. Resfriamento a ar não dá conta.
Switches
A demanda de largura de banda dos clusters de inferência sai de 100G para 400G; com centenas de milhares de placas para escalonar, IB e Ethernet se beneficiam em toda a linha.
Placas ABF
O cluster vai de centenas de chips para milhares de chips, e cada chip precisa ser encapsulado. A Ajinomoto monopoliza mais de 90% das membranas ABF; em 2028, a falta será de 42%. Preço do “farinha” sobe, e o pão só fica mais caro.
CCL M9
O backplane da placa-mãe inteira precisa de material de base de alta velocidade. O preço unitário do M9 é 10 vezes o do FR4; em 2027, o mercado será de US$ 18,7 bilhões, com crescimento acima dos módulos ópticos.
A OpenClaw acendeu o fogo, e o GLM-5.2 deu a lenha. A primeira fez as empresas de modelos ganharem o primeiro barril de Token; a segunda levou o mercado dos laboratórios para a indústria.
Nos armazenamento de estação, na fibra óptica de estação, aproveite a espuma.
$MU
$SKHYNIX
$LITE
