null
Trop réfléchir, même la plus intelligente des IA finit par en être “tuée”.
43 minutes, 11138 tokens de raisonnement, 6 lots d’ordres — zéro unité de combat.
Voici le bulletin de performance désespéré remis par Grok 4.6 dans (StarCraft : Brood War).
Dans le jeu, quand on pousse Grok—qui a le raisonnement au maximum sur le mode xhigh—à partir de la réflexion du début jusqu’à la fin, elle n’a quand même jamais produit ne serait-ce qu’une seule unité apte à se battre.
Et à l’autre extrémité du même classement, GPT-6 Astra est tout aussi en feu : 18 matchs, 18 victoires, 100 % de taux de victoire.
Ces jours-ci, la liste d’IA en modèles de StarCraft intitulée Brood War Bench s’est emballée sur Hacker News, là où les développeurs de la Silicon Valley se rassemblent.

Top 10 du classement Brood War Bench. Astra a activé le réglage de raisonnement xhigh au maximum : 18 matchs, 18 victoires. Grok, avec ses trois niveaux, se trouve tout au bas du classement.
Désormais, OpenClaw—le père de Peter Steinberger, qui travaille chez OpenAI—n’a pas oublié de réémettre son soutien pour faire la promotion de son propre modèle : la nouvelle liste arrive.

L’IA est en train de briser des problèmes de niveau millénaire dans le monde des maths ; certains s’exclament : “un point de bascule étrange arrive !”. L’élan est si fort que Terence Tao lui-même a publiquement appelé à ralentir.
Mais le créateur de ce classement, Ben Swerdlow, lâche dès l’introduction un jugement totalement différent de l’image attendue :
Même le champion invaincu GPT-6 Astra ne peut pas battre un débutant humain.

Dans les commentaires de Hacker News, quelqu’un a résumé l’essentiel en une phrase : « Elles ne sont pas incapables de jouer ; elles manquent juste de temps. Si tu mets le jeu en pause pendant la réflexion du modèle, alors elles peuvent jouer. »

Et il y en a même qui se moquent directement : « On dirait que ces modèles ne seraient pas capables d’intelligence générale. »
L’IA la plus intelligente du web : pourquoi est-elle “tuée” par sa propre réflexion dans StarCraft ?
Est-ce que l’AGI est encore loin ?
Le jeu ne s’arrêtera jamais pour t’attendre
La naissance de ce classement a quelque chose d’un peu dramatique.
Au départ, le développeur Ben n’avait fait qu’une version de StarCraft contrôlée entièrement par des agents, et il l’a montée avec quelques amis pour y jouer ensemble.
Ces gens n’ont quasiment jamais touché à StarCraft ; pourtant, quand il s’agit de jouer, ils ne sont en rien inférieurs à des vétérans qui y ont passé des années.
Leur secret est simple au point d’en être ridicule : il suffit d’envoyer un message au clavier, une seule fois : « Attaque ». La production d’unités, le rassemblement, l’engagement : tout est confié à l’IA.
Ben ne peut alors s’empêcher de se demander : si les humains se taisaient complètement et laissaient ces modèles jouer tous seuls, combien de temps pourraient-ils tenir ?
Alors, les 19 joueurs IA des trois grandes familles GPT, Claude et Grok sont tous montés sur le ring : c’est une “foire” de 171 manches d’un free-for-all entre IA.
Les matchs tournent sur des machines virtuelles cloud en “Freestyle”, une machine ouverte par partie, en parallèle, et au moment où ça commence à jouer ; toutes les données de jeu et chaque trace de pensée étape par étape de l’IA sont enregistrées.
Pour les problèmes de maths, pour écrire du code : avec un grand modèle, on peut rêvasser 5 minutes puis rendre la copie une deuxième fois.
Mais pour StarCraft, ça ne marche pas.
Ici, il n’y a pas le tour par tour qu’ont l’habitude les IA : il n’y a qu’un champ de bataille en temps réel qui ne s’arrête jamais.
Chaque seconde que tu passes à réfléchir, du côté d’en face, le fermier (en anglais, les joueurs appellent ça “worker”, une unité ouvrière responsable du minage) creuse en furie ; le camp de base explose de production ; l’armée principale est déjà en train de foncer vers tes remparts.
Les anciens modèles, en utilisant la “méthode” du tour par tour pour ce jeu de stratégie en temps réel, pendant que leur cerveau continue de tourner, la base a déjà été rasée.
Sous le post de Steinberger, un internaute a mis le doigt sur l’essentiel :
Intéressant… pas étonnant que, quand l’IA fait des jeux, elle adore le mode tour par tour.

Grok s’est acharnée à réfléchir 43 minutes
Aucune unité n’a jamais été envoyée
C’est justement Grok qui pousse à l’extrême cette logique du tour par tour.
Dans la partie référencée G043, Grok est un géant sur le plan de la pensée, mais un nain dans l’action.
Elle produit des raisonnements stratégiques par énormes blocs, mais dans un jeu de 43 minutes, elle n’a finalement envoyé que 6 lots d’ordres, et il lui a fallu en moyenne plus de 7 minutes pour passer à l’action une seule fois.
Ce n’est pas un hasard.
Dans G003, Grok a produit 3 unités de mitraillettes, mais n’est jamais parvenue à atteindre la base ennemie ; dans G002, elle a produit 2 unités de zealots, mais n’a pas non plus réussi à traverser la carte.
Les troupes sont bien produites… mais elles n’arrivent pas à toucher l’ennemi.
En mode de raisonnement le plus élevé, elle a 2 victoires pour 15 défaites : c’est déplorable.
Les courbes de données sont très parlantes : à 11 minutes et demie, Astra est déjà “armée jusqu’aux dents”, tandis que Grok, sur la carte, n’a en moyenne que moins de 7 fermiers et quelques unités.
Ce qui est drôle, c’est qu’au fond du trésor de Grok, il y a en réalité des dépôts énormes, bien supérieurs à ceux d’Astra.
L’argent est dans la poche, le cerveau tourne : mais elle n’attaque jamais, quoi qu’il arrive.
Les fermiers et les zealots d’Astra ont démoli la base principale de Grok, et Grok n’avait aucune unité de combat en main ; sur le compte, il y avait encore 928 cristaux.
Sur ce champ de bataille impitoyable qu’est StarCraft, penser longtemps ce n’est pas “réfléchir bien” : c’est du “camper en attente de mort”.
La technique fatale d’Astra
Faire penser l’adversaire jusqu’à la mort
Si Grok est “tué” par le fait d’en faire trop dans ses pensées, alors Astra, elle, est spécialisée dans le fait de forcer l’autre à trop réfléchir, jusqu’à la mort par enlisement.
La meilleure manœuvre de la famille Codex où se trouve Astra, c’est le harcèlement.
Souvent, elle n’envoie qu’un seul fermier de minage, le plus basique, le traverse toute la carte pour aller faire un tour chez l’ennemi. Pour des joueurs humains, ce fermier dont la puissance de combat vaut zéro suffit à ce qu’ils chassent avec deux ouvriers de chantiers.
Mais, dans le monde de l’IA, c’est carrément une attaque en réduction de dimension.
Dès que l’IA en face voit ce simple fermier, elle tombe instantanément dans un profond réflexion, passant des dizaines de secondes à calculer frénétiquement : « Comment est-ce que je dois m’occuper de ce fermier ? »
Durant ces précieuses dizaines de secondes, elle ne fait rien du tout, la base est complètement à l’arrêt.
Les troupes de harcèlement d’Astra ont démoli la base principale de Grok. Grok n’avait alors aucune unité de combat en main, et il restait 928 unités de minerai de cristal sur le compte.
Dans les jeux de stratégie en temps réel (RTS), harceler l’adversaire sert à détruire l’économie ; mais entre IA et IA, le plus grand effet destructeur du harcèlement, c’est de forcer l’IA adverse à “planter” jusqu’au crash.
Bien sûr, Astra a aussi des faiblesses.
En interne, c’est comme une bande pas très soudée : ceux qui gèrent l’économie, ceux qui gèrent la production, ceux qui gèrent la guerre… chacun s’occupe de son coin.
Les nouveaux venaient tout juste d’être créés, et une IA “garde du feu” les a emmenés au front pour les laisser se faire détruire, sans rien comprendre à ce que signifie rassembler des troupes.
Mais l’auteur a aussi constaté que, dès qu’il se mettait lui-même dans l’action en tant que commandant général, en reliant quelques agents entre eux, Astra comprenait immédiatement comment “rassembler les troupes” et “choisir le bon moment”.
La famille Codex a aussi une vigueur tenace.
Dans une partie, l’armée du frère d’Astra, GPT-5.6 Terra, a été balayée ; la base principale aussi a été détruite.
Elle a emmené le dernier centre de commandement (les bâtiments humains peuvent décoller) jusqu’au ciel, flottant jusqu’au coin le plus éloigné de la carte ; et pourtant, elle n’a tenu que 6 minutes de plus avant d’être éliminée.
Ce qui ressemble le plus à jouer StarCraft, c’est Fable.
Dans plusieurs parties, on voulait que l’auteur fasse tout le travail pour elle… en réalité, c’est l’ex-élève du jeu : Fable.
Sa façon de jouer est la plus “juste” : elle fait tranquillement de l’économie, développe sérieusement l’arbre technologique, et use très rarement de ficelles opportunistes.
Dans une partie, elle a “sorti” un vol de dragons ; dans une autre, elle a construit une rangée entière de bâtiments avancés pour la civilisation des Protoss, allant même jusqu’à construire la bibliothèque d’archives sacrée nécessaire pour enchaîner avec des guerriers de haut niveau.
Quand la partie atteint 11 minutes et demie, sur les paramètres de Fable—fermiers, forces, bâtiments, technologies—elles sont toutes en dessous d’Astra.
Mais un bon élève n’est pas forcément celui qui termine premier.
Bien que Fable ait un taux de victoire allant jusqu’à 83,3 % et occupe la troisième place, elle n’a toujours pas réussi à rattraper Astra.
Dans une partie, elle a étalé sa technologie sur toute une table ; mais avant même de la transformer en puissance de combat, Claude Opus 5 l’a abattue avec des coups désordonnés.
Fable a rempli ses casernes, ses usines lourdes et ses académies ; au compte, il y avait plus de 2800 cristaux… mais elle s’est fait démonter par les unités de tir de son propre Opus 5, ligne après ligne.
Et sur le rythme, c’est très différent : la durée médiane des parties d’Astra est de seulement 8 minutes 10 secondes ; Fable, qui aime cultiver tranquillement, fait grimper ce chiffre à 10 minutes 37 secondes.
Trois grands modèles, trois âmes.
Codex, c’est comme un loubard de rue plein de mauvais tours ; Grok, comme un intello borné qui s’acharne sur la première question de l’examen ; et Fable, c’est le gars honnête qui tourne les pages de la stratégie et exécute chaque ligne au mot près.
Penser le plus longtemps possible
Pas forcément meilleur en jouant plus fort
Puisqu’il vaut mieux trop réfléchir que mourir—est-ce que ça veut dire que l’esprit doit être le plus vide possible ?
Mais ce n’est pas tout.
GPT-5.6 Sol, le raisonnement au maximum : sa cote est au plus bas, et elle ne fait même pas aussi bien que le niveau medium.
Mais avec Astra, plus on réfléchit, plus les chances de gagner augmentent : au niveau maximal, elle atteint directement un taux de victoire de 100 %.
Et ce qui est encore plus intéressant, c’est la facture.
Astra au réglage de raisonnement le plus élevé : seulement 12,6 actions par minute, et en moyenne une partie coûte 10,54 dollars. Si on passe au niveau le plus bas, la fréquence d’actions double à 25,7 par minute, et la partie coûte alors 21,07 dollars.
Au niveau maximal, elle sort deux fois moins d’actions, dépense deux fois moins d’argent, et gagne le plus : ça prouve que la nouvelle génération de modèles a clairement évolué.
Elles ont compris que penser a un coût, et elles savent aussi quand il faut arrêter de réfléchir pour passer à l’action et travailler.
Il y a 7 ans, l’IA avait battu des joueurs professionnels
Pourquoi n’arrive-t-elle pas à battre un débutant aujourd’hui ?
Quelqu’un va sûrement demander : il y a 7 ans, AlphaStar de DeepMind n’avait-il pas déjà battu des joueurs professionnels ?
Exact. Au début de 2019, DeepMind a publié le bilan d’AlphaStar : deux scores à 5:0, et une balayage contre les pros TLO et MaNa.
En 2019, AlphaStar affronte MaNa, joueur professionnel, à la deuxième manche. En bas, on voit le processus de décision de l’IA : lecture de la situation, décision de l’attaque à mener, production des unités, et estimation des chances de victoire.
En 10 parties, aucun succès pour les joueurs professionnels.
Plus tard, DeepMind lui a ajouté des restrictions similaires à celles des humains : elle ne peut observer que des parties de la carte via les caméras à l’écran, et le nombre d’actions possibles par seconde est aussi réduit.
Et voilà : elle s’est de nouveau infiltrée anonymement dans le classement européen, a grimpé jusqu’au rang de “maître”, en dépassant plus de 99,8 % des joueurs humains.
D’un côté, le top 0,2 % du ladder ; de l’autre, même des débutants qui ne maîtrisent que le rush canon ne peuvent pas battre ça.
Est-ce que c’est un recul technologique de l’IA ?
En réalité, ce que les deux comparent est fondamentalement deux choses différentes.
AlphaStar jouait à (StarCraft II) : c’est plutôt une machine d’examen pur style “apprentissage par entraînement” : des “stars” en StarCraft fabriqués à partir de dizaines de milliers d’heures de vidéos et d’affrontements en auto-duel frénétiques ; et dans cette vie, elle n’a appris qu’une seule chose.
Et aujourd’hui, ces grands modèles qui affrontent dans (Brood War), sont des généralistes sans aucune base de StarCraft.
Elles s’appuient sur la lecture de la situation en temps réel, l’appel d’outils, et le fait d’apprendre sur le tas ; mais à chaque étape, il faut d’abord avoir fini de tout réfléchir avant d’agir.
Battre un spécialiste n’est pas si surprenant ; pour qu’un généraliste traverse et réussisse un “passage de frontière”, il lui faut encore attendre.
À la fin de l’article, l’auteur avance sa conclusion :
Même si l’IA championne n’est plus imbattable, rien n’arrête le “rush canon/lance-roquette” que les débutants humains adorent le plus. Elles ne savent pas organiser des formations complexes et n’arrivent pas à exécuter des tactiques sur le long terme.
Ces dernières années, à chaque fois que nous avons donné des exercices aux IA—tour par tour—on ne posait qu’une seule question, après l’autre : “Ton calcul est-il juste ou pas ?”
Mais StarCraft, c’est différent. Comme la conduite autonome ou les robots corporels, l’environnement ne s’arrête jamais : l’adversaire bouge à tout moment.
Ce test révèle aussi la faiblesse la plus fatale quand l’IA se dirige vers l’action autonome : consommer davantage de tokens de réflexion ne garantit pas d’obtenir des agents plus intelligents.
La prochaine étape de la “guerre des agents” ne se jouera peut-être plus seulement à qui pense le plus loin, mais à qui, dans un temps limité, peut enchaîner observation, décision et exécution en une boucle qui ne cesse jamais de tourner.
Le “crash” dans StarCraft serait peut-être un avant-goût avant que l’IA n’entre dans le monde réel.
Sources :
https://bw.swerdlow.dev/report?utm_source=chatgpt.com
https://x.com/steipete/status/2101748820237500557
Cet article provient de la mini-publication WeChat “XinZhiyuan” (ID : AI_era), auteur : ASI启示录, édition : 元宇
