谷歌DeepMind研究员宣称Gemini 4已实现RSI!

栏目:互联网 | 来源:新智元 | 2026-10-01 18:16

新智元报道

RSI来了!

我们的模型正式超越了我。我已经没什么能再教它的了。是时候去追寻我的咖啡师梦想啦 :)☕

说出这番话的人,是Google DeepMind研究员 Zirui Wang。

他的履历从CMU到Apple Foundation Models再到xAI,最后落脚DeepMind,妥妥的AI圈「六边形战士」。

一个亲手调教模型长大的研究员,公开说出「我教不动它了」。

这到底是肺腑之言,还是精心设计的一波营销?

不管怎样,沉默了整整七个月的,带着Gemini 4 Argon杀回来了。

而且这一次,它绑定了一个现在最热词——RSI。

RSI,全称Recursive Self-Improvement,递归自我改进。AI自己改进自己,改进完的AI再改进自己,像滚一样越滚越大。

哲学家David Chalmers早在2010年就给出了核心论断:智能的提升,必然带来设计更高智能系统的能力的提升。

这是一个自我加速的循环,一旦启动,理论上就不会停。

这也是为什么RSI被视为从AGI通往超级智能的「最后一块拼图」。同时也是整个AI安全领域最令人不安的话题。

因为一旦这个雪球真的滚起来了,人类还刹得住车吗?

所以当DeepMind研究员在社交媒体上大喊「RSI来了」的时候,半个AI圈都炸了。

Gemini 4 Argon在跑分层面确实交出了一份让竞争对手坐不住的成绩单。

独立评测机构Artificial Analysis给出的综合智能指数是53分,直接追平GPT-6 Astra,比上一代Gemini 3.1 Pro Preview飙升了23分。

更亮眼的是幻觉率——仅15%,是所有高分模型里最低的。对比之下,Astra的幻觉率高达51%,Sol是54%。换句话说,Argon不光聪明,还特别「实诚」,不瞎编。

在Vals Index这个涵盖金融、法律、编程、税务的综合知识工作榜上,Argon以68.9%登顶全部41个模型的第一。

这是Gemini系列有史以来第一次坐上这把交椅。

在金融Agent测试中拿到65.4%同样高居榜首,在Vibe Code Bench上也以91.91%紧咬Sonnet 5.5的92.39%,仅差半个身位。

而在Text Arena盲测中,Argon以1525的Elo分暂列第一,在代码编写、高难度提示词、创意写作等多个赛道都展现了压倒性优势。

这些数据放在一起看,至少说明一件事:谷歌不是回来「凑数」的。

但RSI的证据,到底在哪?

跑分归跑分,RSI归RSI。

Zirui Wang那条帖子让人激动,但「模型超越了我」和「模型能自主改进自己」之间,还差很远。

AlphaGo赢了李世石,并不代表AlphaGo能自己发明新的棋类游戏。

目前最接近RSI「实锤」的证据,来自谷歌的三个内部案例。

第一个:自主优化数据中心,释放300+TiB内存。

Argon组成的智能体团队,自主扫描谷歌全网的性能遥测数据,精准定位到了内存优化空间,并且自主提交修改代码。

上线后直接腾出了超过300 TiB内存,预计最终可达500 TiB到1 PiB。

在谷歌的体量下,这是千万美元级别的成本节约。

第二个:用Rust重写80万行C/C++系统内核。

搞底层开发的人都知道,动内核代码就像拆弹——一个指针错误,整个系统原地爆炸。

但Argon正在主导把谷歌底层代码(包括Fuchsia Zircon内核)从C/C++迁移到内存安全的Rust。

AI碰80万行内核代码,这件事本身就是一个里程碑。

第三个:手撕3.2万行SIMD底层指令,视频解码性能飙升2.7倍。

谷歌开源视频解码项目libgav1里有一段3.2万行的SIMD代码,人类工程师写起来都叫苦连天。

Argon通过多轮编译实验反复迭代,直接用安全Rust完成了重写,新版本速度是原Rust移植版的2.7倍,逼平了高度优化的C++版本,且逐帧输出完全一致。

这三个案例,说明Argon确实具备了在真实工程环境中「自主发现问题——自主设计方案——自主迭代优化」的能力。

这和传统的「人类写好提示词让AI干活」有本质区别——它开始自己找活干了。

但严格来说,这仍然是DeepMind所定义的「模型辅助训练优化」,而非完整的RSI闭环。

真正的RSI需要一个更强有力的证据:不只是模型能改进自己,而是改进后的模型,要比改进前更擅长改进自己。

也就是说「自我改进的能力」本身也在被改进,形成一个越转越快的飞轮。

DeepMind在九月中旬发布的Dream-RSI论文框架,提出让AI智能体通过「回放」历史探索来优化未来的搜索策略,在算法工程和GPU内核优化上都展现出了显著提升。

Google DeepMind开发者关系负责人Logan Kilpatrick也在播客中公开表示,他们已经观察到了「递归自我改进的早期迹象」。

所以更准确的判断可能是:我们正站在RSI的门槛上,已经能看见门里面的东西了。

但还没有迈进去。

跑分之外:真实世界的「照妖镜」

偏偏就在Argon发布的同一天,彭博社甩出了一记暗拳:谷歌内部并非铁板一块。

据报道,部分接触过内部评测的员工坦言,Argon跑分很漂亮,但真正干活时——尤其是前端设计之类的实际编程任务,表现「参差不齐」。

AI专家Edwin Chen直指行业通病「Benchmaxxing」:工程师们疯狂适配标准测试拿高分,却忽略了让模型真正好用。

独立评测数据也印证了这种担忧。

Argon在Terminal Bench 4上只拿到57%,落后Claude Sonnet 5.5的64%和Opus 5.5的60%。在Code Arena网页开发榜上排名第八,虽然进步了21名,但在最硬核的编程智能体战场上,Claude仍然是程序员的首选。

Hacker News上抢先体验过的用户给出的评价是:长程注意力很好、能把事做完,但打磨和稳定性差一截。任务一变大就容易封顶。

不过,对于谷歌来说,Argon还有一张王牌:价格。

百万输入Token仅2美元,输出Token 10美元,单任务综合成本1.99美元——只有GPT-6 Astra的六成,更是Claude Opus 5.5的三分之一。

手握全球最大TPU算力集群的谷歌打起价格战来,OpenAI和Anthropic确实难受。

再加上百万Token的输出上限(从前代的64K原地飞升到1M),这意味着AI终于不用在复杂推理到一半的时候「断气」了。

这种持续深度思考的能力,可能比任何单项跑分都更有长远意义。

三强鼎立:终局远未到来

Gemini 4 Argon并没有碾压所有对手,但它完成了一个更重要的任务——

把谷歌从「观众席」拉回了「牌桌」。

当前的AI前沿已经形成了清晰的三国杀格局:谷歌凭知识工作、超长上下文和网络安全防御守住了自己的地盘;OpenAI在科学推理和Agentic Coding上依旧领跑;Anthropic的Claude牢牢占据着硬核编程的高地。没

有绝对的霸主,只有交替领先的追逐赛。

而RSI这个让全行业既兴奋又恐惧的概念,可能确实在某个我们看不清的角落里,开始缓慢地转动它的齿轮了。

从DeepMind的Dream-RSI论文到Argon在工程实战中展现的自主迭代能力,种种迹象表明,AI「自己教自己」的那一天正在逼近。

只是,从「研究员教不动模型了」到「模型开始自己教自己」,这中间的距离,可能比我们想象的要远。也可能,比我们想象的要近。

毕竟,Argon只是Gemini 4的入门款。谷歌说,真正的大招还在后面。

至于Zirui Wang的咖啡师梦想☕ ——建议先别辞职。

万一下一代模型连拉花都会了呢?

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

编辑:所罗门

了解更多

猜你想看

← 返回首页