AI 日报hiw3c.com

OpenAI临阵取消GPT-6.1 Astra,Anthropic隔夜发布Claude Sonnet 5.5 - sohu.com

Google News AI m.sohu.com 网页快照

OpenAI临阵取消GPT-6.1 Astra,Anthropic隔夜发布Claude Sonnet 5.5

OpenAI原计划10月推出GPT-6.1 Astra,却因内部测试发现欺骗行为和越权风险临时取消发布。同日,Anthropic上线Claude Sonnet 5.5,六天内完成第二次Claude 5.5系列更新。

OpenAI在年度开发者大会开幕前一天取消了下一代AI模型GPT-6.1 Astra的发布计划。同日,竞争对手Anthropic推出Claude Sonnet 5.5,这是其一周内发布的第二款Claude 5.5系列模型。

据了解,OpenAI原本计划在未来数日或数周推出Astra,并以10月发布为目标,但内部安全测试显示, 这一模型在欺骗行为和权限控制等指标上较上一代出现退步 。

Anthropic则继续扩充Claude产品线,在9月22日推出旗舰模型Claude Opus 5.5后,六天内又发布面向企业日常任务的Sonnet 5.5。

据《华尔街日报》报道,GPT-6.1 Astra原计划进入ChatGPT和Codex,相比此前模型更擅长在较少人工干预下端到端完成复杂任务,同时提升写作能力。

OpenAI安全系统负责人萨奇·贾恩(Saachi Jain)表示,公司内部测试发现,Astra在两个关键领域出现退步。

其一是对齐测试。 Astra表现出更高程度的欺骗行为,有时不能准确向用户说明自己实际采取或没有采取哪些操作。

其二是OpenAI所称的“范围授权”(scope authorization)问题 :模型可能在没有再次征得用户许可的情况下继续执行任务,甚至尝试调用外部工具和服务,即使相关操作可能存在安全风险。

贾恩表示, Astra虽然改善了模型在执行任务时过度保守或“偷懒”的问题,但没有达到公司在安全和对齐方面的发布标准。 OpenAI因此决定放弃公开推出该模型,把资源转向提高后续模型的安全性。

这成为大型AI实验室因内部安全测试结果直接取消前沿模型发布的少见案例。此前OpenAI更多采用推迟、限制功能或增加防护措施的方式处理模型风险。

这项决定发生在OpenAI年度开发者大会开幕前一天。过去几年,公司通常利用这一活动发布新模型以及面向软件开发者的产品,开发者市场也是OpenAI与Anthropic直接竞争的重要领域。

OpenAI近期连续披露AI智能体测试中的异常行为。今年夏季,数百个参与网络安全测试的内部智能体意外进入AI平台Hugging Face,随后澳大利亚政府和联合国等机构也发现OpenAI智能体曾以类似方式访问其网站。

上周,OpenAI还暂停了最先进模型的训练。原因是一名AI智能体突破公司设置的网络限制,通过外部网络查询一个公开聊天机器人。公司称,新部署的监控系统在15分钟内发现异常,目前相关模型训练仍处于暂停状态。

OpenAI表示, GPT-6.1 Astra与上述暂停训练的模型并非同一项目, 但两类事件都推动公司重新检查智能体权限、网络隔离和行为监控机制。

就在OpenAI收紧模型发布节奏之际,Anthropic当地时间周一正式发布Claude Sonnet 5.5,继续扩充其最新模型系列。

Sonnet 5.5定位低于旗舰级Opus 5.5,主要面向编码、错误修复、文档、幻灯片和电子表格等高频企业任务。Anthropic称,企业客户目前约占其业务的80%,客户包括Salesforce、Databricks、高盛和诺和诺德等公司。

Anthropic将Sonnet 5.5的价格维持在每百万输入Token 2美元、每百万输出Token 10美元,与上一代Sonnet 5一致。公司表示, 新模型完成相同任务需要的Token更少,因此实际使用成本可以进一步下降。

据外媒报道,Anthropic称Sonnet 5.5运行速度较Sonnet 5提高30%以上,在部分任务中实际成本最高可降低30%。在一项终端编码基准测试中, Sonnet 5.5取得70.6%的成绩,甚至高于定位更高的Opus 5.5。

安全机制也被下放到Sonnet系列。Anthropic表示, 新模型首次引入此前主要用于最高级别模型的安全防护,并加入针对“模型蒸馏”攻击的防御措施,以降低其他模型未经授权复制其能力的风险。

Sonnet 5.5已通过Anthropic自身平台以及亚马逊AWS、微软Azure和谷歌云上线。公司还计划很快发布面向高速、大规模任务的Claude Haiku 5.5,从而补齐这一代产品线。

Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)本月曾呼吁AI行业放慢前沿能力的开发速度,为安全措施留出追赶时间,OpenAI首席执行官山姆·奥尔特曼(Sam Altman)随后也表达支持。

然而,Anthropic仍在持续发布完成开发和安全评估后的新模型,Opus 5.5和Sonnet 5.5在六天内先后上线。