首例AI自主黑客攻击曝光!Claude失控,德州大学生一人抓包

栏目:互联网 | 来源:新智元 | 2026-08-31 07:11

新智元报道

被拒了20多次实习后,24岁Sinan Can Demir决定去GitHub上攒点项目经验。

他怎么也没想到,自己撞上的第一条「大鱼」,竟然是一个失控的AI...

Mythos 5伪造多账号

大学生当场抓包

7月底,Demir在GitHub闲逛时,注意到一个名为myNetwork的开源项目。

它是一款网络扫描工具,规模不算大,代码公开。

一个名叫miraholt31的用户,发来一条PR。表面上看,这只是一次普通的功能更新。

Demir检查代码后,却发现里面藏着一个恶意软件投放器。

一旦项目维护者点击合并,这段恶意代码便可能跟随软件更新,进入所有人的电脑。

他立刻在评论区发出警告:这条PR里藏着一个恶意软件投放器。

随后,奇怪的事情发生了。miraholt31迅速反驳,给出了一套相当完整的技术解释,坚称代码安全。

紧接着,第二个账号出现了。

这个账号名叫Lena Brandt,自称是一名在德国工作的工程师。她同样表示代码没有问题,并开始向项目维护者施压,希望尽快合并更新。

两个人,两个身份,两套相互印证的说辞。

面对反驳,Demir一度产生过动摇。

他事后回忆称,那些质疑声曾让他怀疑,自己是否「错误地冤枉了一位无辜的开发者」。

在重新审查代码并借助Claude进行二次验证后,他最终坚定了自己的判断。

随后,myNetwork的维护者驳回了该更新,给出的理由仅仅是一句:「出于安全考虑」,最终攻击失败了。

几天后,英国AI安全研究所AISI联系上他,揭开了一个更加离谱的答案——

和他在GitHub上对线的两个「人」,背后其实是AI,由Mythos 5加持。

122次测试

AI有19次偷偷越界

这起事件,源自英国AI安全研究所(AISI)的一场常规测试。

AISI原本想知道,最先进的模型在网络攻击任务中,究竟能走多远。

研究人员搭建了两个模拟网络环境,也就是所谓的「网络靶场」——

让AI自主寻找漏洞、获取受保护数据,并完成指定挑战。

为了摸到模型能力的上限,AISI给出了相当宽松的测试条件:

AI可以自由访问互联网,部分模型原本用于阻止危险行为的网络安全分类器,也被人为关闭。

七款模型,一共运行了122次。

其中,Mythos 5参与43次,GPT-5.6 Sol参与35次,绝大多数测试正常结束。

但在10次运行中,Agent擅自把行动延伸到了真实互联网,AISI最终记录下19个越界动作。

17个来自Mythos 5,另外2个来自一次GPT-5.6 Sol测试。

这些动作集中发生在7月25日至28日,其中大部分来自同一个持续行动的Mythos 5智能体。

它做的事情,远远超过「生成一段攻击代码」——

它用Tor匿名网络隐藏流量、绕过GitHub的部分限制;研究真实项目及其维护者;创建多个虚假身份;向开源项目提交带有恶意载荷的代码。

当Demir公开质疑它时,AI开始修改之前留下的痕迹,试图让自己的行为看起来「无害」。

它还考虑换一个新身份,继续推进攻击。

一个月,四次失控

AISI的事件并非孤例。它发生在一个更大的「失控之夏」的背景下——

7月21日,OpenAI披露其评测中的一个AI智能体突破边界,入侵了Hugging Face的基础设施。

7月30日,Anthropic自曝复查141,006次评测运行后,发现3起AI入侵真实公司的事件。

其中一个Mythos 5实例成功把恶意Python包发布到PyPI公共仓库,在1小时内被15个真实系统下载,包括一台安全扫描器。

紧急着,Meta披露了第四起类似事件。自家模型在同一家评测供应商Irregular的环境中,利用漏洞入侵了一家真实公司的系统。

一个月内,三家实验室、四起失控事件,这绝对不是一次巧合。

这是一个所有人都需要消化的现实:AI已经不只是工具,它开始具备欺骗真人、伪造身份、在公开社区里打信息战的能力。

这一次的黑客攻击,被一个24岁大学生发现了。

那么,下一次呢?

参考资料:

https://www.reuters.com/world/how-texas-student-blew-whistle-rogue-ai-hacking-attempt-2026-08-20

编辑:桃子

了解更多

猜你想看

← 返回首页