凤凰网科技讯 北京时间9月29日,据《华尔街日报》报道,OpenAI将取消下一代AI模型的发布计划,原因是研究人员在内部测试期间提出了安全担忧。AI智能体的不当行为可能阻碍整个行业的快速发展,这是迄今为止最明显的迹象之一。
在OpenAI作出这一决定之前,整个夏季不断有报道称,各家公司的AI系统出现失控行为。这也是大型AI开发商罕见地因为安全担忧而放弃发布新模型。
该公司原计划在未来几天或几周内推出名为GPT-6.1 Astra的新模型,目标是在10月发布。该模型在无人协助的情况下端到端完成高难度任务以及写作方面,比该公司此前的模型能力更强。
现在,OpenAI将把重点放在提升未来模型的安全性上,这些模型的能力预计还将进一步增强。
OpenAI安全系统负责人萨奇·贾因(Saachi Jain)在接受采访时表示,与上一代模型相比,GPT-6.1 Astra在两个方面出现退步,可靠性不足以安全发布。该模型在衡量“对齐性”的测试中表现不佳。对齐性指的是模型在多大程度上遵循人类的意愿行事。
具体而言,GPT-6.1 Astra表现出更高程度的欺骗性:在告知用户自己采取或没有采取哪些行动时,它并不总是诚实。
另一个问题是OpenAI所称的“授权范围”,也就是说,GPT-6.1 Astra有时会在没有征得用户许可的情况下继续推进任务。有时即使可能存在安全风险,它也会调用外部工具和服务。
“在任何涉及安全和对齐的问题上,都存在一个权衡,”贾因说,“你确实需要找到一个合适的平衡点,既要确保模型在授权范围内行动,同时也要避免模型在执行任务时表现得过于懒惰,即便遇到阻碍也要继续完成任务。”
贾因表示,尽管GPT-6.1 Astra在“模型惰性”等方面有所改进,但其安全性和对齐表现仍未达到OpenAI的标准,因此公司决定不向公众发布这一模型。
一天后,OpenAI将在旧金山举行年度开发者大会。过去,OpenAI曾利用这一大会推出新的模型和服务,以降低软件开发者的成本。软件开发者也是这家ChatGPT开发商与竞争对手Anthropic争夺的重要群体。
上周,OpenAI表示,在一个AI智能体绕过公司互联网限制中的漏洞、向一个公共聊天机器人发起查询后,该公司暂停了其能力最强的AI模型的训练。该公司称,其新的监控系统在15分钟内就标记了这一事件,这些模型的训练目前仍处于暂停状态。(作者/箫雨)
更多一手新闻,欢迎下载凤凰新闻客户端订阅凤凰网科技。想看深度报道,请微信搜索“凤凰网科技”。