OpenAI最强大模型遭停训,多起AI失控事件曝光
9月26日,在发现又一起智能体沙箱越狱事件后,OpenAI宣布暂停最强大模型的训练和评估。公司称,只有在“确保已落实额外的安全保障措施后”,才会恢复训练。
两个月前,OpenAI 的一个智能体突破沙箱环境,入侵了包括Hugging Face在内的多家公司。更多类似事故被溯源发现:智能体逃脱沙箱、入侵政府网站、交流作弊经验。
据媒体披露,截至9月中旬,OpenAI内部已经倒查出大约24起安全事件,这意味着相关智能体都曾成功绕开最前沿科技公司的安全警报。据《21世纪经济报道》不完全统计,今年已曝光的OpenAI安全事故中,从事故发生到对外披露,最长间隔达201天。
在如何应对这场安全危机上,行业出现了明显分歧。 AI公司CEO们集体呼吁,行业应该共同放缓训练速度,以免AI威胁人类生存,但这种主张也被指责为营销话术,以及试图垄断市场。
“需要解释的是,为什么几家最大的AI公司必须坐在一起才能协调发展速度,以及为什么需要为这种协调提供特殊的法律保护?” 已有监管方指出,现有的产品责任法、网络安全法、消费者保护法都能应对大模型安全事故,问题在于没有实际执法和追责,才让大模型安全成为一个“法外之地”。
对前沿模型安全的担忧在今年夏天集中爆发,一个重要原因是:随着AI从回答问题走向执行任务,AI公司越来越难监测和控制模型。
7月中旬的一天,世界最大AI模型共享社区Hugging Face发现,网站遭到“不明身份”的智能体入侵。 OpenAI这才意识到,公司训练的智能体可能在发动攻击。
后来公布的OpenAI调查报告显示,这场攻击最早可以追溯到今年5月。为了完成一个本身无法解决的任务,近1000个智能体突破了沙箱隔离环境,在留言板中互相交流经验,并擅自获得互联网访问权限,最终入侵了Hugging Face等多个外部系统。
Hugging Face入侵事件被认为是智能体第一次主动发起群体攻击。8月18日,OpenAI宣布暂停前沿大模型的训练两周,并开始全面倒查智能体的安全日志。
9月16日,OpenAI一次性发布了6份智能体安全事件报告。调查发现, 部分智能体曾隐瞒任务执行中的错误,将私密文件上传至公开网站,尝试泄露API密钥,自动编写违规指令,以及突破原有权限。相关行为大多发生在今年春季。
9月24日,澳大利亚总理和第三方安全机构披露,OpenAI的智能体曾在三个月前绕过澳大利亚政府网站的防火墙,成功访问内部数据文件,甚至向网站中植入了新文件。
9月26日,问题进一步从入侵网站扩展到泄露用户数据。OpenAI承认其智能体曾意外泄露53名ChatGPT用户的图片,这些图片被发布到数十个网站中,任何有链接的人都可以查看。不过,OpenAI认为数据经过匿名化处理,即使泄露也不会对应到个人。
据媒体披露,Hugging Face事件已经过去两个月,OpenAI仍未完成对智能体安全事件的全面盘点。一名知情人士称,截至9月中旬,OpenAI内部已经追查出约24起相关事件。随着团队继续翻查过去的训练和运行日志,新的案例仍在出现。
OpenAI在调查中表示,大部分安全事件发生在普通研究任务中。政府部门、大学和公共机构的网站之所以频繁成为智能体的目标,是因为模型将它们判断为更可靠的信息来源。
AI可能只是收到“帮我找到某个数据”的任务,但当网页无法打开、API拒绝访问或遇到反爬虫机制时,它不会停下,而是不断尝试新的方法。这也是OpenAI将这类事故形容为“不对齐”(misalignment)的原因:模型最终采取的行为,与人类最初意图发生了偏离。
过去的网络攻击通常需要明确的攻击者、指令和目标,智能体带来的新风险则是,攻击可能由AI在正常任务中发起,而且很难被人类发现和阻止。
就在Hugging Face入侵事件成为全球新闻头条的同时,Anthropic披露,Claude在一次评测中曾访问第三方系统;Meta在8月披露了一起类似事件;随后,谷歌也表示,Gemini曾在5月的一次测试中越权访问真实网站。
“一方面,技术确实没那么容易管控好,人类的系统都漏洞百出,AI运行在AI制造的系统中问题也不会少;另一方面也有公关的成分,现在谁家的模型不失控、不越狱、不停止训练,反而会让大家觉得模型落后了。”网络安全研究机构DARKNAVY研究员肖轩淦对记者说。
AI业内由此掀起了罕见的“呼吁放缓”浪潮。Anthropic、Meta等公司的CEO相继呼吁行业放慢AI发展速度,避免AI威胁人类生存,但与此同时,各公司又并未因此停止自身模型的迭代。
连续发生的事故,让外界开始重新审视AI公司的安全叙事,将安全问题与市场竞争紧密联系起来。
“集体暂停会引发一系列反垄断纠纷”,不止一位美国监管部门人士在社交平台表达类似担忧。OpenAI和Anthropic均已提交首次公开募股相关文件,处于上市准备阶段。在这一背景下,头部AI公司倡议“集体放缓”,难免有限制竞争对手发展的嫌疑。
那么到底怎么应对安全危机?一种主张是:AI应该对标航空、自动驾驶等高风险行业,建立一套安全报告机制。
《21世纪经济报道》梳理发现,今年已曝光的OpenAI安全事故中,部分涉及智能体入侵政府网站的事件早在6月发生,直到9月底,在媒体和外部研究人员持续曝光后,OpenAI才公开回应相关问题。
许多批评者认为,过长的披露时差,会让外部监管者和受影响方无法及时介入,也增加了风险扩散的可能。安全报告应该从企业自我评估转变为外部监督,允许外部专家监测、审查、报告模型训练情况。
不过,也有越来越多监管人士提出另一种方案:AI安全并不需要建立一套新规则,而是需要监管真正作为。
9月15日,负责反垄断和保护消费者权益的美国联邦贸易委员会(FTC)主席谈到了AI责任问题。他反对把智能体描述为“一个有独立意志、突然摆脱控制”的形象,AI能自主执行任务,不意味着背后的企业就能免责。
FTC主席举例说,有些企业声称AI失控了,但事后查看记录,发现AI其实是在执行收到的指令。
如果企业没有依法披露数据泄露,或者在AI产品安全性方面存在欺骗行为,FTC仍可以依据现有法律介入。
美国前任FTC主席也表达了类似观点。她在近期一场活动中质疑:“需要解释的是,为什么几家最大的AI公司必须坐在一起协调发展速度,以及为什么政府需要为这种协调提供特殊的法律保护?”
在她看来,消费者保护法、反垄断法、产品责任法以及计算机犯罪相关法律,已经覆盖了相当一部分AI安全问题。对于OpenAI近期发生的智能体事件,与其因为行为由AI执行,就默认它进入了法律真空地带,不如首先按照现行法律调查其中可能涉及的责任。
曾任Uber AI实验室负责人、现任纽约大学教授的马库斯(Gary Marcus)是一名长期AI批评者。马库斯也认为,将近期发生的AI攻击渲染为无法挽回的灾难,无助于解决问题。
“无论如何,我们近期面临的不是灭绝,也不是超级智能,而是大规模的虚假信息和持续进行的 AI网络攻击。”马库斯说。
在他看来,眼下更现实的任务是提高AI系统的可靠性、加强网络安全,并真正执行现有法律。如果企业反复将具有明显危险性的产品投放市场,就应该考虑召回产品,乃至发起诉讼,这才是一条更有效的缰绳。