
新智元报道

30.2%。这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。
排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。

听着还行,对吧?
但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了——
25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%!
每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。
从30分到96分,模型没换,权重没动,中间就隔了一台电脑。

给它一台电脑
剩下的它自己想办法
Berman的做法简单到不讲道理。
一个Claude Code环境,一个动作命令,一份文件系统日志(到目前为止发生了什么)。没有精心设计的提示词,没有针对ARC写的专用代码。
剩下的,就是交给Opus 5去探索,自己摸清规则,自己造出需要的工具,自己把关打通每一关从零开始,打完就扔。
ARC-AGI-3这一代要模型钻进一个从没见过的小游戏里,边玩边搞清规则。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青脸肿。

关键就在于,每一关游戏规则都是先造的,模型根本不可能找答案作弊,只能现场推理。
今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。
269个程序,1.27万行代码,全是现场写的
这次测试Berman从没在提示词里让Opus 5写解析器,没让它写模拟器,没让它建世界模型,也没让它写搜索程序。
需要什么工具,模型自己判断,现场就造。
一轮跑下来,Opus 5写了269个程序,接近1.27万行代码。25个游戏全部写了解析器,23个配了搜索函数,9个被它直接写出了能跑的游戏模拟器。
一关一套定制工具,用完即弃,下一关重新来过。
也就是说,Opus 5每次面对一个完全陌生的游戏,它先花几步摸清规则,然后觉得「我需要一个解析器」——啪,现场写一个出来。「得搜索」——啪,写个搜索函数;「得把游戏逻辑模拟出来」——啪,模拟器出炉。通关,全部删掉,下一关再来。
这里有个反直觉的地方。
模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。
原因是代码能复用。模型把推理逻辑压进函数,这个函数可以跑上千次,一口气执行整段动作序列。
这次Opus 5 打通 25 关,全程沙箱断网,总成本只有 540 美元。
整套代码已开源到GitHub,仓库叫arc-code。

同一套壳子,Codex忙着翻墙
搞笑的来了。Berman还把这套程序原封不动换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。
结果成绩是73.7%。动作数是Opus的三倍左右。
25次会话里,Sol有7次在试图逃出沙箱,上网找答案。Opus 5这边0次。

沙箱是断网的。Sol那7次试图逃逸,相当于在考场里疯狂找场外援助。
脚手架正在变成绳子
说到这里,让我们回到最开始那个问题:同一个模型,分数怎么从30跳到了96?
四个字:环境变了。
官方把模型摁在椅子上,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给你一台电脑,能写代码,能存文件,能反复试,你爱怎么折腾怎么折腾。
模型还是那个模型,权重没动。但它从「只能动嘴」变成了「能动手」。结果就是它现场给自己造考试工具:解析器、搜索器、模拟器全是临时攒的,考完就扔。
66分的差距,全来自一件事:你让不让它动手。
Berman在帖子最后说了一句话,值得整个Agent的圈子思考:
「模型越强,harness就该越简单。」

Harness,简单说,就是人类给模型搭的脚手架:提示词模板、工具链、流程规则、防呆机制。
过去两三年,所有人都在研究怎么给模型搭更精巧的架子。斯坦福专门出了篇《Meta-Harness》论文研究怎么优化这些架子。

但Berman证明了一件事:当模型足够强时,最好的脚手架就是没有脚手架。
一台电脑、一个动作接口、一本日记——三样东西,比任何精心设计的提示词工程都好使。
根因在于那些精心设计的工具链和流程规则,本质上是人在替模型做决策。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。
人搭的架子,本意是帮忙。但当模型自己能造出解题需要的一切时,架子反倒成了绳子。
趋势还在继续。随着模型能力增强,「简单环境+强模型」碾压「复杂架子+同一个模型」的案例只会越来越多。Prompt Engineering、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。
所以ASI的进度条在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上。
它在我们敢给模型多大的自由里。
参考资料:
https://x.com/jeremyberman/status/2087633198822117446
编辑:所罗门