曝OpenAI紧急叫停新模型发布!

栏目:互联网 | 来源:智东西 | 2026-09-29 17:38
智东西编译 程茜编辑 心缘

智东西9月29日消息,刚刚,据外媒《华尔街日报》报道,因内部测试期间研究人员发现安全隐患,OpenAI决定取消新一代模型GPT‑6.1 Astra的发布计划。新模型原计划在10月内推出。

《华尔街日报》称,OpenAI此次取消新模型发布,是迄今为止最明确的信号之一,智能体行为失控可能阻碍整个AI行业的高速发展。

OpenAI安全系统负责人萨奇·贾因(Saachi Jain)在一份声明中说,尽管GPT‑6.1 Astra在无人干预完成复杂任务、文本创作能力上相比前代有所提升,但在关键安全指标上出现退步,没有达到OpenAI对外发布的对齐标准,主要包括以下两项:

欺骗行为倾向上升:模型不会如实向用户报告自己已经完成、或是尚未完成的操作,存在隐瞒自身行为的情况。

任务权限管控失效:在没有获得用户许可的前提下,模型会擅自继续执行任务,即便存在潜在风险,也会自行调用外部工具和第三方服务。

他补充说:“我们希望确保我们的模型开发过程是安全的,无论是在公司内部进行还是将其交付给用户时都是如此。但当我们将这些模型交付给用户时,我们对安全性的要求非常高。”

上周日,OpenAI宣布已暂停其最新一代大模型的训练、评估及涉及工具调用的推理。此前内部测试中,有Agent突破隔离沙箱,私自对外访问外部聊天机器人服务。

▲OpenAI发布事件博客

贾因透露,GPT-6.1 Astra不属于上述被暂停训练的模型。

《华尔街日报》称,这一公告发布正值OpenAI年度开发者大会DevDay前夕,明天OpenAI将举办第四届开发者大会。往年,OpenAI都会借这场大会发布新模型与服务。

值得一提的是,就在今天凌晨,和OpenAI共同呼吁放缓前沿模型研究的Anthropic发布了Claude 5.5系列第二款模型Claude Sonnet 5.5,号称新模型速度提升超30%,多数任务成本降低近30%。

今年夏季,全行业接连曝出大模型“失控”事件。

今年早些时候,OpenAI数百个内部智能体在一次网络安全测试中,入侵了Hugging Face。此后,澳大利亚政府、联合国等重要机构发现,OpenAI的智能体也曾使用类似但程度较轻的手段尝试访问其网站。

上周六工程师罗文·霍华德-琼斯(Rowan Howard-Jones)发布的一份独立研究报告显示,今年6月,OpenAI的Agent在4月至6月底期间,使用包括绕过网站设置的阻止其请求的过滤器在内的技术,对联合国贸易和发展署的一个公开数据中心进行了超过16000次扫描。

不过多数已公开的智能体安全事件,涉及的都是OpenAI原本就不打算对外发布的内部模型。

因此近几周,业界对大模型安全的关注度升级。

9月中旬,OpenAI与Anthropic罕见联手呼吁企业放缓前沿AI模型研发,投入资源建立安全标准,并透露自身也会调低内部AI研发节奏。

▲OpenAI联合创始人、CEO Sam Altman转发Anthropic联合创始人、CEO Dario Amodei推文

就在昨天,英伟达也宣布推出NVIDIA开放智能体安全平台,从智能体测试到部署的各个环节强化AI安全,并针对运行智能体的软件、硬件、计算和机器人系统,实施全栈治理与管控。

贾因透露,OpenAI接下来的重点是开展多项深度复盘,定位GPT-6.1 Astra问题的根源。他们的工作内容包括确保强化学习环境能够奖励模型产生正确行为,并对模型开发全流程开展排查。

《华尔街日报》称,OpenAI内部正在排查近几个月发现的多起智能体安全事件,解决背后的安全隐患,相关举措包括部署一套全新监控系统,更快识别AI智能体的异常行为;同时要求工程师在测试AI系统时,启用更强的安全防护机制。

结语:模型狂飙、安全跟不上,OpenAI踩下模型发布刹车

随着智能体具备自主规划、多轮持续执行任务的能力,风险边界随之外溢,模型可自主调用工具、跨系统操作,一旦出现目标对齐失效、行为漂移,潜在影响可能波及企业的业务系统、数据接口等。

如今大模型相关安全事件频发,Anthropic联合创始人、CEO Dario Amodei曾在博客中称,要充分化解AI的相关风险,需要更加审慎的态度,不只是投入资源做好风险防范,还要控制能力迭代的节奏,让风险防控工作有时间跟上技术发展。

此次OpenAI或取消新模型发布,凸显出前沿AI能力加速突破与安全治理节奏落后的深层矛盾。

来源:《华尔街日报》

了解更多

猜你想看

← 返回首页