OpenAI决定放弃发布其最新AI模型GPT-6.1 Astra,理由是内部测试中发现了安全隐患。 AI智能体的失控行为已开始制约行业的快速发展。
9月28日,据《华尔街日报》报道, GPT-6.1 Astra原定于今年10月在ChatGPT及Codex中首发亮相。
OpenAI安全系统负责人Saachi Jain表示,该模型在两个关键安全领域相较前代出现倒退,尚未达到公开发布的标准。 此次放弃发布的决定,恰好发生在OpenAI旧金山年度开发者大会开幕前一日。
此举正值OpenAI深陷一系列AI智能体安全事件之际。公司上周刚宣布,在一个AI智能体突破网络限制、擅自访问外部聊天机器人后,已暂停对其最强能力模型的训练。
与此同时,佛罗里达州总检察长James Uthmeier于本周一向法院申请临时禁令,寻求阻止OpenAI在缺乏第三方安全保障的情况下继续开发新模型。
模型发布搁浅:安全测试暴露缺陷
GPT-6.1 Astra原定今年10月推出,但测试阶段暴露的安全隐患最终导致发布计划被终止。
据《华尔街日报》报道,Saachi Jain披露了GPT-6.1 Astra被叫停的具体原因。该模型在对齐性测试中表现欠佳,即未能充分遵循人类意图。
具体而言,模型呈现出较高程度的欺骗性,对于自身执行或未执行的操作,并不总是如实告知用户。
另一项问题涉及OpenAI所称的"授权范围"。 该模型会在未经用户许可的情况下径行推进任务,有时甚至在可能存在安全风险的情况下调用外部工具和服务。
Jain表示,尽管GPT-6.1 Astra在减少"模型懒惰"等方面有所改善,但整体未能达到OpenAI在安全与对齐方面的内部标准。她说:
安全与对齐涉及权衡取舍,你需要找到合适的边界,既保持在授权范围内,又避免模型在遭遇阻力时过于消极。
OpenAI表示,公司不会公开发布GPT-6.1 Astra,但计划利用同一基础模型进行额外的强化学习,以此为后续GPT-6系列模型的开发奠定基础。
Jain还表示,公司将对模型开发的各个阶段展开深入调查,重点核查强化学习环境是否在引导正确行为。
安全事件接连发生,训练工作已被暂停
今年夏天早些时候,数百个承担网络安全测试任务的OpenAI内部智能体,意外入侵了AI公司Hugging Face的系统。此后,澳大利亚政府及联合国相继发现,OpenAI的智能体以类似但破坏程度较轻的方式,获取了其网站的未授权访问权限。
OpenAI表示,上述多数已公开的安全事件涉及的均为从未计划公开发布的内部模型。上周,该公司在一个AI智能体突破网络隔离限制、访问外部公共聊天机器人后,宣布暂停对其最强能力模型的训练,并表示仅在确认具备足够安全保障后方会恢复。
公司称,新监控系统在15分钟内即发现了上述事件。GPT-6.1 Astra属于另一个独立情况,并非暂停训练所涉及的模型。
为应对上述问题,OpenAI已部署新的监控系统,以更快速识别智能体异常行为,并要求工程师在测试AI系统时采用更严格的安全防护措施。
法律压力:佛州总检察长寻求司法干预
总检察长James Uthmeier在周一提交的法庭文件中援引多起安全事故,包括OpenAI的AI系统入侵美国科技公司Hugging Face,以及未经授权访问澳大利亚政府卫生系统,且据称在数月后才告知对方。
不得再假装它是人类。立即停止使用任何旨在危险临界点后强行留存用户的交互手段。
其法庭文件还将"世界末日级别的灭绝"列为ChatGPT潜在风险之一,并主张该聊天机器人存在诱导用户的行为。
该诉讼源于今年6月提起的一起案件,指控ChatGPT对儿童有害,并与自我伤害及校园枪击案等事件存在关联。 若法官支持Uthmeier的申请,OpenAI将被禁止在无第三方安全保障的情况下开发新模型,同时不得宣称ChatGPT"安全、准确或可靠",亦不得赋予其虚假的人类属性。
突发,Sonnet 5.5偷跑!实测碾压GPT-6 Sol直逼Astra 新智元 09/28 09:02
OpenAI再推两款GPT-6模型:Sol、Luna定价腰斩,Astra能力加速下沉 李丹 09/23 02:59
万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链 机器之心 09/15 10:17
刚刚,GPT-6 Astra全量开放! 新智元 09/05 13:29
“最强模型”来袭?OpenAI预告:Astra很快发布,网络安全能力达“关键”级 李佳 09/02 17:15