null
想太多,就连最聪明的AI也会被拖死。
43分钟、11138个推理token、6批指令——0个作战单位。
这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。
游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。
而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。
这两天,这份名为Brood War Bench的星际大模型榜单,在硅谷程序员扎堆的Hacker News上火了。

Brood War Bench榜单前10名。Astra开最高推理档xhigh,18战全胜,Grok三个档位全在榜尾。
如今已是OpenAI员工的OpenClaw之父Peter Steinberger,不忘转发为自家模型造势:新榜单来了。

AI正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。
可这份榜单的作者Ben Swerdlow,一开篇就甩出一个画风完全不同的判断:
就连全胜冠军GPT-6 Astra,也打不过一个人类新手。

Hacker News评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」

还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」
全网最聪明的AI,为什么会在星际里被自己的思考拖死?
是不是离AGI还远着呢?
游戏永远不会停下来等你
这个榜单的诞生,有点戏剧性。
起初,开发者Ben只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。
这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。
他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给AI。
这让Ben不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久?
于是,GPT、Claude、Grok三大家族的19名AI选手悉数登场,一场171局的AI大乱斗就此开打。
比赛跑在Freestyle的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和AI的每一步思考记录全都留了底。
做数学题、写代码,大模型可以发呆5分钟再一次性交卷。
但打星际不行。
这里没有AI习惯的回合制,只有一刻不停的实时战场。
你思考的每一秒钟,对面的农民(英文玩家叫worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。
老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。
Steinberger的帖子下,有网友一语道破:
有意思,难怪AI做游戏的时候,总爱做回合制的。

Grok苦想43分钟
一个兵也没上场
把这种回合制思维演绎到极致的正是Grok。
在编号G043的对局里,Grok堪称思想上的巨人、行动上的矮子。
它疯狂输出大段大段的战略推理,但43分钟的游戏里,总共只发出了6批指令,平均7分多钟才动一次手。
这不是偶然。
G003里,Grok造了3个机枪兵,始终没走到敌人基地;G002里,它造了2个狂热者,同样没能穿过地图。
兵是造出来了,就是打不到对面。
最高推理档位下它2胜15负,惨不忍睹。
数据曲线很直观:比赛打到11分半,Astra早就兵强马壮,而Grok场上平均只有不到7个农民和几个兵。
搞笑的是,Grok的国库里,其实躺着远超Astra的巨额存款。
钱在兜里,大脑在运转,就是死活不动手。
Astra的农民和狂热者拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。
在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。
Astra的必杀技
让对手想到死
如果说Grok是被自己想太多拖死的,那Astra就是专门逼别人想太多,把对手活活拖死。
Astra所在的Codex家族,最绝的一招是骚扰。
它经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。
但在AI局里,这招简直是降维打击。
对面的AI只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。
在这宝贵的几十秒里它什么都不干,基地彻底停摆。
Astra的骚扰部队拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。
在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了AI对AI,骚扰的最大杀伤力,是把对面的AI直接拖到宕机。
当然,Astra也有弱点。
它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。
新兵刚造出来就被管打仗的AI拉去前线白给,完全不懂什么叫集结部队。
不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来,Astra立刻就懂得攒兵、挑时机了。
Codex家族还有一股顽强劲儿。
有一局,Astra的兄弟GPT-5.6 Terra部队全军覆没,主基地也被拆了。
它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了6分钟才被消灭。
最像在打星际的是Fable
全场好几局都想让作者替它使劲儿的,其实是游戏优等生Fable。
它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。
有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。
比赛打到11分半时,农民、兵力、建筑、科技,Fable几项数据都压着Astra。
可好学生未必能拿第一。
Fable虽然胜率高达83.3%排在第三,却依然追不上Astra。
有一局它科技摆满了一桌子,还没等转化成战斗力,就被Claude Opus 5乱拳打死。
Fable盖满了兵营、重工厂和学院,账上还躺着2800多块晶矿,却被自家Opus 5的枪兵一路推平。
节奏上也差得很远:Astra的对局时长中位数只有8分10秒,爱慢慢种田的Fable,这个数字被拖到了10分37秒。
三个大模型,三种灵魂。
Codex像个满肚子坏招儿的街痞,Grok像考场上死磕第一题的轴学霸,而Fable则是那个翻着攻略逐字逐句照做的老实人。
想得越久
不一定打得越好
既然想太多会死,那是不是脑子越空越好?
也不全是。
GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如medium档。
可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。
更有趣的是账单。
Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而要烧掉21.07美元。
最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。
它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。
7年前AI赢过职业选手
今天为何打不过新手?
有人肯定会问:7年前,DeepMind的AlphaStar不是早就击败过职业选手了吗?
没错。2019年初,DeepMind公布了AlphaStar的战绩:两个5:0,横扫职业选手TLO和MaNa。
2019年,AlphaStar对阵职业选手MaNa第二局。下方是AI的决策过程:读取局面、判断往哪打、造什么兵,同时预估胜负。
10局比赛,职业选手一局没赢。
后来,DeepMind给它加上了和人类一样的限制:只能通过屏幕镜头看局部地图,每秒能做的操作次数也被压低。
就这样,它又匿名混进欧洲天梯,一路打上宗师段位,超过99.8%的人类玩家。
一边是天梯前0.2%,一边连会光炮快攻的新手都打不过。
难道是AI的技术倒退了?
其实,两者比的根本是两码事。
AlphaStar打的是《星际争霸II》,更像是纯粹的应试机器:靠吃海量录像和疯狂自我对战堆出来的星际特长生,这辈子只学了这一件事。
而今天这些在初代《母巢之战》里对战的大模型,是没有任何星际基础的通才。
它们全靠临场读题、调用工具、现学现卖,而且每一步都得先想完才能出手。
专才打败职业选手并不稀奇,通才想要跨界通关,还要再等等。
文章最后,作者抛出自己的结论:
AI冠军再无敌,也防不住人类新手最爱用的光炮快攻。它们组织不起复杂的阵型,也执行不了长远的战术。
过去几年,我们给AI出的都是回合制考题,问来问去只有一句:你算得对不对?
可星际不一样。它和自动驾驶、具身机器人一样,身处一个不会暂停的世界,对手随时在动。
这场测试,也暴露了AI走向自主行动时最要命的短板:烧掉更多思考token,未必换来更强的智能体。
下一阶段的Agent之争,比的可能不再只是谁想得更深,而是谁能在有限的时间里,把观察、决策、执行连成一个不停转动的闭环。
星际里的翻车,或许就是AI进入真实世界前的一次预演。
参考资料:
https://bw.swerdlow.dev/report?utm_source=chatgpt.com
https://x.com/steipete/status/2101748820237500557
本文来自微信公众号“新智元”(ID:AI_era),作者:ASI启示录,编辑:元宇
