19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

栏目:游戏 | 来源:新智元 | 2026-09-23 10:20

新智元报道

想太多,就连最聪明的AI也会被拖死。

43分钟、11138个推理token、6批指令——0个作战单位。

这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。

游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。

而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。

这两天,这份名为Brood War Bench的星际大模型榜单,在硅谷程序员扎堆的Hacker News上火了。

Brood War Bench榜单前10名。Astra开最高推理档xhigh,18战全胜,Grok三个档位全在榜尾。

如今已是OpenAI员工的OpenClaw之父Peter Steinberger,不忘转发为自家模型造势:新榜单来了。

AI正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。

可这份榜单的作者Ben Swerdlow,一开篇就甩出一个画风完全不同的判断:

就连全胜冠军GPT-6 Astra,也打不过一个人类新手。

Hacker News评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」

还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」

全网最聪明的AI,为什么会在星际里被自己的思考拖死?

是不是离AGI还远着呢?

游戏永远不会停下来等你

这个榜单的诞生,有点戏剧性。

起初,开发者Ben只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。

这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。

他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给AI。

这让Ben不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久?

于是,GPT、Claude、Grok三大家族的19名AI选手悉数登场,一场171局的AI大乱斗就此开打。

比赛跑在Freestyle的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和AI的每一步思考记录全都留了底。

做数学题、写代码,大模型可以发呆5分钟再一次性交卷。

但打星际不行。

这里没有AI习惯的回合制,只有一刻不停的实时战场。

你思考的每一秒钟,对面的农民(英文玩家叫worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。

老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。

Steinberger的帖子下,有网友一语道破:

有意思,难怪AI做游戏的时候,总爱做回合制的。

Grok苦想43分钟

一个兵也没上场

把这种回合制思维演绎到极致的正是Grok。

在编号G043的对局里,Grok堪称思想上的巨人、行动上的矮子。

它疯狂输出大段大段的战略推理,但43分钟的游戏里,总共只发出了6批指令,平均7分多钟才动一次手。

这不是偶然。

G003里,Grok造了3个机枪兵,始终没走到敌人基地;G002里,它造了2个狂热者,同样没能穿过地图。

兵是造出来了,就是打不到对面。

最高推理档位下它2胜15负,惨不忍睹。

数据曲线很直观:比赛打到11分半,Astra早就兵强马壮,而Grok场上平均只有不到7个农民和几个兵。

搞笑的是,Grok的国库里,其实躺着远超Astra的巨额存款。

钱在兜里,大脑在运转,就是死活不动手。


Astra的农民和狂热者拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。

在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。

Astra的必杀技

让对手想到死

如果说Grok是被自己想太多拖死的,那Astra就是专门逼别人想太多,把对手活活拖死。

Astra所在的Codex家族,最绝的一招是骚扰。

它经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。

但在AI局里,这招简直是降维打击。

对面的AI只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。

在这宝贵的几十秒里它什么都不干,基地彻底停摆。


Astra的骚扰部队拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。

在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了AI对AI,骚扰的最大杀伤力,是把对面的AI直接拖到宕机。

当然,Astra也有弱点。

它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。

新兵刚造出来就被管打仗的AI拉去前线白给,完全不懂什么叫集结部队。

不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来,Astra立刻就懂得攒兵、挑时机了。

Codex家族还有一股顽强劲儿。

有一局,Astra的兄弟GPT-5.6 Terra部队全军覆没,主基地也被拆了。

它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了6分钟才被消灭。

最像在打星际的是Fable

全场好几局都想让作者替它使劲儿的,其实是游戏优等生Fable。

它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。

有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。

比赛打到11分半时,农民、兵力、建筑、科技,Fable几项数据都压着Astra。

可好学生未必能拿第一。

Fable虽然胜率高达83.3%排在第三,却依然追不上Astra。

有一局它科技摆满了一桌子,还没等转化成战斗力,就被Claude Opus 5乱拳打死。


Fable盖满了兵营、重工厂和学院,账上还躺着2800多块晶矿,却被自家Opus 5的枪兵一路推平。

节奏上也差得很远:Astra的对局时长中位数只有8分10秒,爱慢慢种田的Fable,这个数字被拖到了10分37秒。

三个大模型,三种灵魂。

Codex像个满肚子坏招儿的街痞,Grok像考场上死磕第一题的轴学霸,而Fable则是那个翻着攻略逐字逐句照做的老实人。

想得越久

不一定打得越好

既然想太多会死,那是不是脑子越空越好?

也不全是。

GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如medium档。

可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。

更有趣的是账单。

Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而要烧掉21.07美元。

最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。

它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。

7年前AI赢过职业选手

今天为何打不过新手?

有人肯定会问:7年前,DeepMind的AlphaStar不是早就击败过职业选手了吗?

没错。2019年初,DeepMind公布了AlphaStar的战绩:两个5:0,横扫职业选手TLO和MaNa。


2019年,AlphaStar对阵职业选手MaNa第二局。下方是AI的决策过程:读取局面、判断往哪打、造什么兵,同时预估胜负。

10局比赛,职业选手一局没赢。

后来,DeepMind给它加上了和人类一样的限制:只能通过屏幕镜头看局部地图,每秒能做的操作次数也被压低。

就这样,它又匿名混进欧洲天梯,一路打上宗师段位,超过99.8%的人类玩家。

一边是天梯前0.2%,一边连会光炮快攻的新手都打不过。

难道是AI的技术倒退了?

其实,两者比的根本是两码事。

AlphaStar打的是《星际争霸II》,更像是纯粹的应试机器:靠吃海量录像和疯狂自我对战堆出来的星际特长生,这辈子只学了这一件事。

而今天这些在初代《母巢之战》里对战的大模型,是没有任何星际基础的通才。

它们全靠临场读题、调用工具、现学现卖,而且每一步都得先想完才能出手。

专才打败职业选手并不稀奇,通才想要跨界通关,还要再等等。

文章最后,作者抛出自己的结论:

AI冠军再无敌,也防不住人类新手最爱用的光炮快攻。它们组织不起复杂的阵型,也执行不了长远的战术。

过去几年,我们给AI出的都是回合制考题,问来问去只有一句:你算得对不对?

可星际不一样。它和自动驾驶、具身机器人一样,身处一个不会暂停的世界,对手随时在动。

这场测试,也暴露了AI走向自主行动时最要命的短板:烧掉更多思考token,未必换来更强的智能体。

下一阶段的Agent之争,比的可能不再只是谁想得更深,而是谁能在有限的时间里,把观察、决策、执行连成一个不停转动的闭环。

星际里的翻车,或许就是AI进入真实世界前的一次预演。

参考资料:

https://bw.swerdlow.dev/report?utm_source=chatgpt.com

https://x.com/steipete/status/2101748820237500557

编辑:元宇

了解更多

猜你想看

← 返回首页