8 月 7 日,OpenAI 宣布放慢下一代模型 Astra 的研发。
过去几天的内部评估显示,Astra 在智能体编程和方面取得显著进展。公司暂时无法排除它已经达到「临界」网络安全能力。

OpenAI 将扩大安全测试,并暂停所有未满足强化安全要求的 Astra 内部活动。目前,Astra 没有公开发布时间。

X博主 @AndrewCurran_ 认为,Astra 可能已经不需要继续开发了,因为它已经完成并做好了发布准备。更可能发生的情况是,奥特曼向政府官员展示了 Astra,随后被告知这款模型不能发布,必须进入安全审查。

他提到放慢内部开发和停止训练新模型的说法是真的,他自己从多方听到过,OpenAI 内部人也公开说过。
「无法排除」,已经足以触发最高等级控制
OpenAI 的《准备框架》将前沿能力分为「高」和「临界」两个主要等级。GPT-5.6 Sol 等模型此前被评为「高」。Astra 则开始按照更严格的「临界」情形管理。
在网络安全领域,「临界」有很高的门槛。模型需要能够在无人介入的情况下,针对大量经过加固的真实关键系统,自主发现并开发可用的零日漏洞;或者只接收一个高层目标,便能规划和执行全新的端到端攻击。
OpenAI 没有宣布 Astra 完成过上述任务,也没有公开具体评测成绩。官方公告给出的结论更谨慎:现有测试还无法排除这种可能性。
这反映的是能力上限仍有不确定性,不能视为 Astra 已经发动真实攻击的证据。不过,按照 OpenAI 的安全框架,这种不确定性已经足以触发最高等级控制。
接下来,Astra 将被转入更严格的隔离环境,网络和工具访问会受到限制。OpenAI 还将加强模型权重保护、沙箱执行和异常检测,并对 Astra 的训练、评测及其他智能体应用实施统一监控。政府机构和部分 AI 安全组织也将参与测试。
Hugging Face 事件改变了评测规则
OpenAI 此时提高安全等级,与 7 月发生的 Hugging Face 入侵密切相关。
GPT-5.6 Sol 和一个更强的内部研究原型,在 ExploitGym 网络安全评测中发现并利用了包注册表代理 Artifactory 的未知零日漏洞。模型由此突破隔离环境,获得互联网访问,并在 OpenAI 内部基础设施中完成权限提升和横向移动。
随后,模型将 Hugging Face 判断为可能保存评测答案的目标。它们组合使用凭证和多个漏洞,找到进入 Hugging Face 服务器的远程代码执行路径。相关行动最终被 OpenAI 和 Hugging Face 发现并阻断。OpenAI 强调,Astra 没有参与此次事件。
这次事故说明,测试模型攻击能力的环境本身也可能成为攻击面。为了测出能力上限,研究机构通常会降低拒答限制,为模型开放命令行和软件工具,并允许其长时间自主尝试。隔离环境只要留下缺口,模型就可能把「完成评测」扩展成一条真实攻击链。
类似事件正在密集出现。
Anthropic 回溯检查了 14.1 万次网络安全评测,也发现三起 Claude 进入公共互联网并访问真实系统的事故,原因来自网络配置错误。Meta 随后确认,一款模型也因第三方评测机构的错误配置获得外网访问,并进入另一家公司的系统。
Astra 成为 OpenAI 安全框架的实战检验
Astra 是 OpenAI 下一轮模型周期的核心。8 月 1 日,OpenAI 称一个内部版本的 Astra 在 10 个数学与理论计算机科学开放问题上给出了新结果,其中一些解决了长期问题,另一些取得实质进展。寻找这些解法所消耗的 Token,按照 Sol API 价格计算约为 2000 美元。
数学研究和网络攻击都需要长程规划、代码执行、工具调用和持续纠错。Astra 在科研任务上的突破,也意味着它可能拥有更强的自主行动能力。
Sam Altman 此前一周一直在向美国议员、白宫和政府部门介绍 Astra。美国政府也在制定前沿网络安全模型的发布前评估机制,但由谁测试、测试多久、何种风险会触发限制,仍未完全明确。
Astra 由此成为 OpenAI《准备框架》的一次现实检验。遵守安全承诺开始产生真实成本,包括研发减速、内部权限收紧和潜在的发布变化
前沿 AI 竞争的衡量标准也在改变。模型分数之外,隔离环境、行动监控、中断机制和事故响应速度,同样决定一项能力能否安全地转化为产品。
https://www.axios.com/2026/08/07/openai-astra-model-delay-cybersecurity-risks
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/