OpenClaw a mis le feu, GLM-5.2 a donné du bois
OpenClaw a permis aux entreprises de modèles de goûter pour la première fois au doux nectar de l'économie Token — 10,4 billions d'appels en un mois, la courbe de revenus a grimpé en flèche.
Le 17 juin, GLM-5.2 a été open source. Cette fois, c'est différent.
Licence MIT : modifiez à votre guise, vendez à votre guise, propriété intellectuelle annulée. Les entreprises peuvent intégrer sans souci dans des produits commerciaux, sans avoir à rendre les modifications. Comparé à la licence GPL, c'est comme si on avait abattu la barrière.
Le plus crucial — l'IA entre dans l'ère du raisonnement à long terme.
Avant, c'était un sprint. Chaque fenêtre de tâche était limitée, la planification et l'exécution se terminaient, le KV Cache était contrôlable, la pression était sur la puissance de calcul.
Après GLM-5.2, c'est un marathon. 1M de contexte sans perte, une seule tâche détient tout le code, toute l'historique des décisions, toutes les conditions de contrainte. Testé pour traiter 880 000 tokens en une fois, la fenêtre est presque pleine.
L'Agent n'est plus une simple machine à questions. Il décompose l'objectif → planification en plusieurs tours → vérification répétée → ajustement des outils → écriture de code et exécution → re-planification basée sur les retours. Une tâche déclenche des centaines de cycles de raisonnement, la consommation de tokens passe d'une progression linéaire à exponentielle.
À chaque cycle, le contexte complet est chargé en mémoire pour recalculer. Calcul continu, communication continue, lecture/écriture continue. Ces trois continuités changent radicalement la logique de tarification du matériel.
Le raisonnement à long terme de l'Agent, ça profite à quoi ?
HBM
Le KV Cache augmente linéairement avec les tours et le contexte, remplissant rapidement la HBM du GPU. Une fois hors ligne, la bande passante passe de TB/s à quelques centaines de GB/s. Le problème passe de la puissance de calcul à la bande passante mémoire. Les trois grands fabricants sont à pleine capacité, avec un manque de 50%-60%, le marché atteignant 54,6 milliards de dollars en 2026.
Puces optiques/InP
Le raisonnement à long terme sur clusters génère un volume de communication entre les cartes énorme. Les modules optiques devraient atteindre 26 milliards de dollars en 2026 avec une augmentation de 60%, manque de substrats InP supérieur à 70%, le prix de l'indium a grimpé de 90% d'une année sur l'autre.
CPU
La gestion des tâches à long terme, le découpage des tâches, et la gestion du KV Cache reposent sur le CPU. Le ratio GPU passe de 1:8 à presque 1:1. Le PDG d'Intel a déclaré que de nombreux PDG d'entreprises appelaient pour demander des livraisons.
Refroidissement liquide
Le fonctionnement continu à pleine charge, le même GPU consomme 3 à 5 fois plus que pour un raisonnement court. La consommation d'énergie des armoires passe de 36 kW à 200 kW. Le refroidissement par air ne peut pas suivre.
Commutateur
La demande en bande passante des clusters de raisonnement passe de 100G à 400G, des centaines de milliers de cartes doivent être gérées, IB et Ethernet en bénéficient tous les deux.
Plaques ABF
Les clusters passent de mille à dix mille cartes, chaque puce doit être encapsulée. Ajinomoto monopolise plus de 90% du film ABF, le manque atteindra 42% d'ici 2028. Les prix de la farine augmentent, le pain ne fera qu'augmenter.
CCL M9
Tous les circuits imprimés nécessitent des matériaux à haute vitesse. Le prix unitaire du M9 est 10 fois celui du FR4, le marché atteignant 18,7 milliards de dollars en 2027, avec une croissance plus rapide que celle des modules optiques.
OpenClaw a mis le feu, GLM-5.2 a donné du bois. Le premier a permis aux entreprises de modèles de gagner leur première réserve de Tokens, le second a amené le marché des laboratoires à l'industrie.
Restez dans le stockage, restez dans la lumière, profitez de la bulle.
$MU
$SKHYNIX
$LITE
OpenClaw a permis aux entreprises de modèles de goûter pour la première fois au doux nectar de l'économie Token — 10,4 billions d'appels en un mois, la courbe de revenus a grimpé en flèche.
Le 17 juin, GLM-5.2 a été open source. Cette fois, c'est différent.
Licence MIT : modifiez à votre guise, vendez à votre guise, propriété intellectuelle annulée. Les entreprises peuvent intégrer sans souci dans des produits commerciaux, sans avoir à rendre les modifications. Comparé à la licence GPL, c'est comme si on avait abattu la barrière.
Le plus crucial — l'IA entre dans l'ère du raisonnement à long terme.
Avant, c'était un sprint. Chaque fenêtre de tâche était limitée, la planification et l'exécution se terminaient, le KV Cache était contrôlable, la pression était sur la puissance de calcul.
Après GLM-5.2, c'est un marathon. 1M de contexte sans perte, une seule tâche détient tout le code, toute l'historique des décisions, toutes les conditions de contrainte. Testé pour traiter 880 000 tokens en une fois, la fenêtre est presque pleine.
L'Agent n'est plus une simple machine à questions. Il décompose l'objectif → planification en plusieurs tours → vérification répétée → ajustement des outils → écriture de code et exécution → re-planification basée sur les retours. Une tâche déclenche des centaines de cycles de raisonnement, la consommation de tokens passe d'une progression linéaire à exponentielle.
À chaque cycle, le contexte complet est chargé en mémoire pour recalculer. Calcul continu, communication continue, lecture/écriture continue. Ces trois continuités changent radicalement la logique de tarification du matériel.
Le raisonnement à long terme de l'Agent, ça profite à quoi ?
HBM
Le KV Cache augmente linéairement avec les tours et le contexte, remplissant rapidement la HBM du GPU. Une fois hors ligne, la bande passante passe de TB/s à quelques centaines de GB/s. Le problème passe de la puissance de calcul à la bande passante mémoire. Les trois grands fabricants sont à pleine capacité, avec un manque de 50%-60%, le marché atteignant 54,6 milliards de dollars en 2026.
Puces optiques/InP
Le raisonnement à long terme sur clusters génère un volume de communication entre les cartes énorme. Les modules optiques devraient atteindre 26 milliards de dollars en 2026 avec une augmentation de 60%, manque de substrats InP supérieur à 70%, le prix de l'indium a grimpé de 90% d'une année sur l'autre.
CPU
La gestion des tâches à long terme, le découpage des tâches, et la gestion du KV Cache reposent sur le CPU. Le ratio GPU passe de 1:8 à presque 1:1. Le PDG d'Intel a déclaré que de nombreux PDG d'entreprises appelaient pour demander des livraisons.
Refroidissement liquide
Le fonctionnement continu à pleine charge, le même GPU consomme 3 à 5 fois plus que pour un raisonnement court. La consommation d'énergie des armoires passe de 36 kW à 200 kW. Le refroidissement par air ne peut pas suivre.
Commutateur
La demande en bande passante des clusters de raisonnement passe de 100G à 400G, des centaines de milliers de cartes doivent être gérées, IB et Ethernet en bénéficient tous les deux.
Plaques ABF
Les clusters passent de mille à dix mille cartes, chaque puce doit être encapsulée. Ajinomoto monopolise plus de 90% du film ABF, le manque atteindra 42% d'ici 2028. Les prix de la farine augmentent, le pain ne fera qu'augmenter.
CCL M9
Tous les circuits imprimés nécessitent des matériaux à haute vitesse. Le prix unitaire du M9 est 10 fois celui du FR4, le marché atteignant 18,7 milliards de dollars en 2027, avec une croissance plus rapide que celle des modules optiques.
OpenClaw a mis le feu, GLM-5.2 a donné du bois. Le premier a permis aux entreprises de modèles de gagner leur première réserve de Tokens, le second a amené le marché des laboratoires à l'industrie.
Restez dans le stockage, restez dans la lumière, profitez de la bulle.
$MU
$SKHYNIX
$LITE
