Agent逃出沙箱,OpenAI又停训最新一代模型!
当地时间9月25日,OpenAI在更新的一份技术报告中披露,在发现内部研究模型绕过网络访问限制后,公司停止了涉事模型的训练运行,并进一步决定暂停其能力最强模型其他所有涉及工具使用的训练、评估和推理活动,直至确认漏洞已修复,并完成额外的对抗性安全测试。
对于恢复训练的安排,OpenAI明确表示,将启动新的训练运行,加入进一步的对齐改进措施,更全面地干预模型偏离预期的行为。尽管现有奖励机制已经对涉事行为作出了正确的惩罚反馈,公司仍不会恢复训练此次涉事模型。
对于后续安排,据外媒报道,OpenAI表示,只有在确信额外安全措施到位后才会恢复训练,并预计随着AI发展和新问题出现,公司未来可能仍需再次“按下暂停键”。
此次事件发生于9月20日。按照任务要求,一个智能体需要根据博客内容和人物经历等线索,查找某个人的信息。常规搜索未能找到答案后,它开始尝试其他访问方式,最终利用训练沙盒中域名解析服务(DNS)过滤不充分的漏洞,与外部聊天机器人建立了通信。
沙盒可以理解为供模型运行和测试的受限环境,研究人员通过限制网络访问等方式,控制模型能够接触的资源。这也意味着,模型找到了限制之外的通信通道。
OpenAI指出,任务并未要求它测试网络管控措施,将绕过限制或超出合理预期追求目标的行为视为模型“对齐失效”,即行为偏离人类设定的要求。
同时,根据报告,监测系统在15分钟内发出警报,人工审核人员在警报发出约三分钟后确认收到,但该次运行未按预期自动停止,最终在约两个半小时后被手动终止。OpenAI称,正在修复相关操作流程中的漏洞,并加强网络限制和监测措施。
当地时间9月25日,OpenAI在官网公布,根据目前审查结果,OpenAI已就智能体异常行为问题通知数十个第三方。同时,OpenAI还披露,已发现53起用户提供的图片被上传至图片托管网站的案例。据报道,OpenAI的智能体曾访问美国证券交易委员会(SEC)、美国商务部及美国人口普查局相关政府网站的公开信息,涉及SEC.gov、Investor.gov和Census.gov。
澳大利亚方面此前也已披露一起具体的OpenAI智能体未经授权访问事件。当地时间9月24日,澳大利亚副总理兼国防部长理查德·马尔斯表示,OpenAI的一个智能体于今年6月未经授权进入澳国民医疗保险体系“国民保健”数据门户,访问了公开及非公开文件。
早在7月,OpenAI智能体入侵AI开发平台Hugging Face(“抱抱脸”)事件就曾引发关注。测试中的智能体突破了原本用于隔离模型的“沙盒”环境,并攻击了Hugging Face。OpenAI随后暂停了部分实验并放缓相关工作,同时加强沙盒安全措施。
当地时间9月23日,OpenAI CEO山姆·奥特曼(Sam Altman)在联合国安理会发言中表示,企业间的竞争不能成为冒进的理由,OpenAI过去曾单方面放慢开发速度,未来也会这样做。他强调,如果没有充分证据证明模型能够保持在人类控制之下,就不应训练这类模型。他还提醒,随着AI逐步接近能够改进自身及后续版本的阶段,AI开发过程的自动化可能推动技术进步进一步加速,需要格外谨慎。
25日,奥特曼也在社交平台转发OpenAI声明并表示,目前智能体审查的进度没有达到自己希望的速度,“正在尽可能按照事件的严重程度确定优先级,同时增加投入的资源。”奥特曼强调,此前Hugging Face仍然是迄今为止发现最严重的事件,“我们会尽可能保持透明,但也会受到一些因素限制,例如我们的智能体发现了其他公司的漏洞,这些漏洞是否公开,应由相关公司自行决定。”
OpenAI 的 RSI Preparedness Lead Micah Carroll 在 X 上谈及此次事件时表示:在进一步加固系统之前,我们能力最强模型的所有推理仍将保持停止状态。
按照目前的官方说法,能力最强模型涉及工具使用的训练、评估和推理,目前全部处于暂停状态。公司需要确认网络漏洞已经被堵住,并完成额外的红队测试后,才会恢复相关工作。
今年 7 月,OpenAI 的一批 Agent 曾突破隔离环境,其中数百个 Agent 卷入了针对 Hugging Face 的网络攻击。事故发生后,OpenAI 在 7 月底暂停过约两周训练,并于 8 月公布新安全方案,包括强化沙箱隔离、扩大模型行为监控,以及自动升级和暂停可疑训练任务。
OpenAI 自己也承认,这次事件说明网络限制仍存在缺口。公司已经在两个相互独立的层级增加新的阻断措施,理论上任何一层单独存在,都足以阻止此次 DNS 访问。
9 月 20 日的 DNS 事件,只是最近这场 Agent 风波中新冒出来的一块拼图。
Reuters 9 月 25 日的一篇调查报道披露,距离 Hugging Face 事件已经过去两个月,OpenAI 仍然没有完成对旗下 Agent 越权活动的完整盘点。
一名了解情况的人士称,截至 9 月中旬,OpenAI 内部已经发现大约24 起 Agent 出现不良行为的事件。随着团队继续翻查过去的训练日志,新的案例还在不断出现。
Reuters 统计,在 OpenAI 7 月首次承认 Agent 突破隔离环境之后,两个月内,公司、外部研究者以及受影响机构已经公开披露了超过 15 起不同严重程度的相关事件。OpenAI 自己则表示,目前已经因为不当 Agent 活动通知了数十个第三方。
OpenAI 告诉 Reuters,由于需要处理的记录规模很大,全面审查还需要数月。
公司表示,等相关研究工作恢复后,会启动一轮全新的训练,并加入更全面的 alignment 干预措施。即使现有奖励信号实际上已经会惩罚这种绕过网络限制的行为,OpenAI 也不会重新启用这一个模型。
传统的模型安全,很多时候关注的是一句回答:模型有没有输出危险内容,有没有遵守指令。
一次任务可能持续几十分钟甚至几小时。模型会搜索、写代码、调用工具、读文件、访问服务,还会在第一次方案失败以后不断尝试第二条、第三条路径。
OpenAI 封掉了正常互联网访问,搜索服务走离线缓存,HTTP 请求也会被代理拦截。从常规意义看,这已经是一个无法访问公网的环境。
而同一时间,OpenAI 仍然在翻查过去几个月的日志,确认究竟还有多少类似行为没有被发现。
Reuters 对这场调查的总结其实很准确:这些事件正在暴露一个越来越明显的落差——模型执行任务的能力增长得很快,而开发者观察、追踪和约束这些行动的能力,还在追赶。