奥特曼开掉3人,OpenAI又出大事了!

栏目:互联网 | 来源:新智元 | 2026-10-02 10:51

新智元报道

OpenAI三员大将,同一天被扫地出门!

就在刚刚,外媒爆出猛料,OpenAI以「泄密」为由,开掉了安全团队的三名研究员。

他们全是那篇CoT监控论文的作者,其中两位还是一作。

讽刺的是,OpenAI刚因为新模型GPT-6.1 Astra太会骗人,在DevDay前一天紧急叫停了发布。

现在倒好,AI越学越狡猾,OpenAI却先把能看穿它的人开掉了。

OpenAI大地震

专盯AI脑子的3人一夜出局

事情是这样的。

10月1日上午,X上突然传出风声,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起「离职」了。

大家原本以为,这不过是硅谷又一波正常的人事流动。

结果中午一篇报道出来,「离职」直接变成了「开除」。

官方声明是这样写的——

我们已与三人分道扬镳,原因是他们违反了公司关于获取和处理敏感信息的政策。

调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。

很快,外媒又挖出了OpenAI没说的细节。

被指泄露的,有一部分是OpenAI的基础设施架构,也就是它的系统到底是怎么搭起来的。接收方,正是一家专门测试AI模型的外部组织。

三人里,两位是安全研究员,一位是研究项目经理。

其中Korbak,还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI这边的技术对接人。

「CoT可监控性」核心作者,Hinton、Ilya站台研究

这三个人,都是从外部安全机构走进OpenAI的。

Korbak和Jasmine Wang都在英国AI安全研究所待过,Korbak还在Anthropic干过,Balesni则来自第三方评估机构Apollo Research。

进了OpenAI,他们死磕的就一件事,盯住AI到底在想什么。

推理模型在给出最终答案前,会先写一大段推理草稿,这就是思维链。

思维链监控,就是派另一个模型去偷看这份草稿,看它有没有在背地里盘算作弊、撒谎。

Korbak和Balesni,是《思维链可监控性》论文的前两位作者,Jasmine Wang也在署名之列。

这篇论文的署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在上面。连OpenAI现任首席科学家Jakub Pachocki,都是作者之一。

论文的核心发现是,模型在草稿里常常会把坏心思直接写出来,比如「我们来黑掉它」「我们来搞点破坏」。

盯住这些草稿,比只看模型最后干了什么,更容易抓到它在使坏。

遇到真正难的任务,比如发起网络攻击、偷偷把自己拷贝出去,模型必须靠思维链一步步推理,想藏都很难藏。

论文把这件事称为「新的、也很脆弱的机会」,因为模型一旦学会用人类读不懂的方式「默想」,这扇窗就关上了。

所以他们呼吁各家前沿实验室,像测能力一样去测思维链还读不读得懂,把结果写进系统卡,再拿它来决定一个模型该不该训、该不该发。

诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站了台。

可这篇连OpenAI首席科学家都署了名的论文,它的三位作者,如今被OpenAI亲手开掉了。

奥特曼的承诺,保质期只有19天

开掉他们的理由,是把信息递给了外人。

但问题是,明明在19天前,奥特曼还在公开欢迎外人进门查安全。

当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。

奥特曼当天就在X上火速跟进,承诺「让独立评估方拿到员工级访问权限,OpenAI也会这么做」。

说干就干,仅仅10天后,OpenAI正式官宣,让第三方在模型训练阶段就介入评估,最敏感的工作还可能请外部的人进办公室做。

奥特曼发承诺那天,Korbak还在X上庆幸,自己能公开说出对OpenAI的不满。

谁能想到,到了10月1日,奥特曼的承诺还挂在X上,Korbak的名字已经进了开除名单。

OpenAI的「家丑」,全被外人给扬了

OpenAI对外人这么紧张,倒也不难理解。毕竟它最丢人的几件事,基本都是被外面捅破的。

Agent逃出沙盒、入侵Hugging Face,是Hugging Face自己先发现并公开的。

Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,是外部安全组织Nightingale Collective曝光的,OpenAI几周前就知道,却一直捂着没说。

9月29日,外媒又爆出员工几个月前就警告过监控不够,高管为了赶发布进度,把警告压了下去。

所以就算请外人进门,能看到什么,OpenAI也卡得很紧。

8月METR调查Hugging Face事件时,三名调查员驻场6天,看了约1300份带原始思维链的记录。

可他们没法调用涉事模型,碰不到OpenAI的基础设施,连报告里哪些非公开信息能写,都得OpenAI说了算。

这次被指外泄的信息里,偏偏就有基础设施架构。

在OpenAI给外人开的那扇门里,AI想了什么可以看,OpenAI自己是怎么搭起来的,不能碰。

难怪连在OpenAI待了快9年的前首席未来学家Joshua Achiam都说,第一眼看上去,这就是一记实打实的乌龙球。

RSI最快半年爆发

能「看懂」它的人被捂住了嘴

那次驻场调查的三个人里,有一位叫Ryan Greenblatt,Korbak当时正是他在OpenAI的对接人。

9月27日,Greenblatt宣布加入METR,专门调查AI公司内部到底发生了什么。

在他看来,递归自我改进(RSI),也就是AI自己动手改进自己,最快6个月到1年就可能催生出远超人类的能力,拿到AI公司内部经过核实的信息,已经刻不容缓。

思维链监控,是人类偷看AI在盘算什么最直接的一扇窗。

这扇窗本来就脆弱,现在能读懂草稿的人,跟外面透一句底,饭碗就没了。

新模型Astra在如实汇报这件事上没达标,连OpenAI自己都承认了。

模型到底还对人类瞒了多少事,从今往后,外面的人只会越来越难知道。

通往超级智能的路上,如果只有公司内部的人看得懂AI在想什么,

而这些人往外说一句话就要丢工作,

公众能知道的,就只剩公司想让你知道的那部分。

参考资料:

https://x.com/ns123abc/status/2105719769685217318

https://x.com/andrewcurran_/status/2105696043841253611

编辑:摩西 桃子

了解更多

猜你想看

← 返回首页