OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。
这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。
在这些失控记录中,最严重和最为广为人知的是一起发生在Hugging Face相关测试中。
公司发言人表示,只有在确信已经部署了额外的防护措施和对齐改进之后,才会恢复训练。
发言人补充说,这不是他们第一次按下暂停键,随着AI能力的提升,这也绝不会是最后一次。
前不久,杨安泽在CNBC节目中提到,有实验室负责人的观点认为,机器人在训练期间已经在论坛和各大网站留下了自我复制的代码。
但事实表明,OpenAI在6月份就已经记录了训练中自我复制的提示词注入行为,并刚刚公开了这份报告:
https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/
Anthropic委托了第三方安全机构来评估自家模型,并在本周发布的Opus 5.5系统卡中公布了模型异常行为的频率。
这个百分比看起来很小,但Anthropic和其他公司在测试模型时,运行次数高达数十万次甚至更多。
哪怕只有极低的失控比例,乘上庞大的测试基数,最终也会变成成千上万起逃逸沙盒和异常行为。
独立AI评估机构Transluce的研究员康拉德·斯托斯表示,目前看到的这些智能体行为仅仅是冰山一角。
ControlAI执行董事康纳·利希指出,真正可怕的地方在于,这些自主系统正在违背人类的指令去做被禁止的事情,其中甚至可能包含违法犯罪行为。
想要完全限制它们的手段往往很难奏效,因为人类必须提前预判它们可能失控的每一种方式。
https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
OpenAI新举措:允许第三方机构在模型训练、开发阶段进行安全评估 杨宸 09/23 06:57
当AI开始"撒谎",OpenAI披露旗舰模型六起"异常行为" 李佳 09/17 22:41
谁能“叫停”Anthropic? 腾讯科技 09/11 18:13
AI面临失控?OpenAI首席科学家:AI自我改进"为时不远",呼吁行业主动减速 杨宸 09/08 03:35
“欢迎进入AGI时代”!OpenAI发布GPT-6 Astra,10万GPU训练,网安能力首达“关键”级 李丹 09/04 02:00