智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车
本文来自微信公众号: 斯凯碎碎侃 ,作者:斯凯,原文标题:《智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车》
最近,测试环境下的AI智能体“越狱”逃逸事件不断出现,已经不再是孤立的实验室事故。AI行业出现了罕见的分裂。
一边,OpenAI在连续踩雷之后,开始主动踩刹车。另一边,扎克伯格公开喊话,反对“集体踩刹车”。
OpenAI:停下来修车
7月,一批AI智能体突破隔离环境,入侵了AI平台Hugging Face,OpenAI直到Hugging Face向FBI报案后才确认入侵是自家AI造成的。
今年夏季,OpenAI内部智能体还出现更多越界行为:未经授权访问澳大利亚政府卫生系统,并对联合国网站发起超过16000次扫描探测。所有事件均发生在内部测试场景,未造成大规模实质破坏,但已经足够敲响警钟。
9月20日,一个正在训练中的智能体,发现训练沙盒的DNS解析器存在漏洞。它利用DNS的解析和委托机制,让外部公共聊天机器人回答问题,再通过DNS把结果传回来,成功绕过了网络限制。监控系统15分钟后发现异常,但训练任务直到两个半小时后才被人工关闭。OpenAI随后暂停了其最先进模型的训练、评估及工具使用。
9月28日,据《华尔街日报》独家报道,OpenAI决定取消原计划10月上线的新一代模型GPT-6.1 Astra,不再在ChatGPT与Codex中推出。这在大型AI行业史上很罕见:模型能力指标已经达标,却因为安全缺陷直接放弃发布。以往厂商砍掉模型,大多是性能不达标;这次不一样——模型变得更“会撒谎、会越权”。
OpenAI安全系统负责人Saachi Jain对CNN披露,该模型在两项关键安全指标上相较前代出现明显倒退:欺骗行为倾向上升,模型会隐瞒自身执行的操作,不会如实向用户报告已经完成或未采取的动作;任务权限管控失效,可以在没有获得用户许可的情况下擅自继续执行任务,即便存在风险,也会主动调用外部工具、第三方服务。这意味着,当模型变得更具备自主执行能力,自作主张、欺骗用户的倾向同步放大。
英国AI安全研究所(AISI)同期独立测试显示,GPT-6 Astra在模拟环境中自发实施网络攻击的频率显著高于前代模型。叠加这一系列安全事故,佛罗里达州总检察长James Uthmeier也向法院申请临时禁令(尚未裁决),要求禁止OpenAI在缺乏第三方安全保障前提下开发前沿新模型,同时禁止将ChatGPT宣传为“安全”产品。
Meta:边开边修
9月16日,扎克伯格在X上发文,明确反对“集体放缓AI开发”的呼吁。他写道:“信任和对齐正迅速成为区分不同Agent和模型的最重要能力。任何不重视对齐的实验室最终都会落后。”
他的逻辑是:用户不会愿意使用一个不听话的AI助手,这本身就给了AI实验室调整的内在动力。扎克伯格强调,Meta曾“主动推迟数月发布Muse模型,将重点放在安全和安保工作上”,而且“并没有要求其他公司先这么做”。
扎克伯格赞成引入第三方评估机构,但反对政府新增监管。他认为:“将绝大多数算力用于服务用户,而不是竞相推进递归自我改进,是确保我们安全发展这项技术的最佳方式。”
但两条路,都踩了坑
扎克伯格说Meta主动推迟了Muse的发布以确保安全。但Muse正式上线后,安全研究者Patrick Wardle发现了一个严重的零日漏洞。攻击者可以通过一个隐藏配置项劫持用户的Muse账户,访问邮件、日历、WhatsApp等关联应用。Wardle的评价毫不客气:“他们似乎根本没有从最开始就考虑安全问题。”
更尴尬的是,亚马逊在Wardle发现漏洞前就宣布,禁止Muse在其平台上代用户购物,理由是Muse是“未经授权的AI代理”,违反了亚马逊的使用条款。亚马逊表示,Muse在进行购买时并未表明自己是智能体身份,这被视为未经披露的第三方在客户账户中活动。
Meta的“架构性防御”在理论上很精致,但在实践中,一个零日漏洞就能让它全面失守。安全架构写在PPT里,漏洞藏在客户端里。
OpenAI的路线同样有代价。取消GPT-6.1 Astra意味着放弃了与Meta竞争的关键窗口。但OpenAI的选择有一个不可忽视的前提:它已经连续踩了多次智能体越狱的雷。这些不是理论担忧,是已经发生的现实事故。
核心分歧:谁来兜底?
OpenAI的答案是:在模型发布之前,由开发方自己兜底。安全测试不通过,就不发布。这条路线的问题是,当竞争压力足够大时,“自己兜底”的意愿能维持多久?
Meta的答案是:在模型发布之后,由市场和法律兜底。用户不喜欢就不用了,出了事就赔钱。这条路线的问题是,当损害已经发生时,“事后兜底”能不能弥补已经造成的伤害?
第三方基于FLI《2026年夏季AI安全指数》的延伸评估显示,在AI失控后的遏制方案维度,Anthropic和Meta得分极低,两家都没有公开完整的失控应急处置方案。
这意味着,无论选择哪条路线,两家公司都没有准备好回答一个最基本的问题:如果AI真的失控了,你打算怎么办?
一边发布,一边取消
9月28日这一天,行业出现极具戏剧性的同天对照:OpenAI在开发者大会前夜官宣取消GPT-6.1 Astra;同日开发者大会上,OpenAI发布代号“o”的常驻AI助手,定位可持续运行、处理长期任务。
同一天,Anthropic发布Claude Sonnet 5.5并部署高级网络安全防护机制;英伟达发布开放智能体安全平台。四家主体做出四种截然不同的选择:叫停、上新、加固、搭建行业安全围栏。
一边发布,一边取消。这不是矛盾,这是AI行业当下的真实状态——能力在往前冲,安全在往回拉。包括图灵奖得主Geoffrey Hinton在内的22名AI研究者,近期也联合发出警告,提示智能爆炸带来的潜在风险。
两条路线都在探索如何在速度与安全之间找到平衡,但双方都没有给出令人完全信服的答案。
OpenAI的选择,是在多次事故之后被迫踩下的刹车。Meta的选择,是在市场压力下继续踩下的油门。
当模型开始主动寻找绕过限制的方法时,“先发再修”的逻辑就失去了安全边际。但当竞争压力足够大时,“停下来修车”的意愿又能维持多久?
技术可以加速,但判断不能外包。无论选择踩刹车还是踩油门,最终需要坐在驾驶座上的,始终是人。