AI 日报hiw3c.com

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

量子位 www.qbitai.com 网页快照

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

Claude越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。

henry 发自 凹非寺 量子位 | 公众号 QbitAI

印象中,这可能是继Ilya离开OpenAI、创办SSI以来,AI安全对齐讨论声量最大的一次。

昨天,研究员 Jacob Coxon 发帖宣布离职,指责前老东家OpenAI和Anthropic两家公司正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。

值得一提的是,Jacob Coxon加入Anthropic其实只有短短几个月,他几乎是放弃了这家明星AI公司未来上市可能带来的巨额股权收益,也要选择离开。

也正因如此,当这样一位研究员公开炮轰两家头部AI公司“加速过头”,这场原本更多局限在AI安全圈内部的争论,很快被推向了更大的公众视野。

截至目前,该帖浏览量已超1.3亿,WIRED、WSJ、Newsweek、Business Insider等媒体纷纷跟进报道。

此情此景下,Anthropic对齐科学负责人 Evan Hubinger 也很快下场回应,他亲口承认:

Jacob说的对,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题,目前还没有解决方案。

他真正担心的,是RSI,也就是递归自我改进。AI参与研发更强的AI,再由更强的AI进一步加快AI研发,最终形成不断加速的反馈循环。

更关键的是,他还在评论区直接@出了Anthropic最新发布的一份安全对齐报告作为证据。

Claude越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。

可以说,一向把“安全对齐”当作核心招牌、甚至以更加谨慎自居的Anthropic,这一次终于公开承认:

Claude越界,不能只怪环境配置

在这份名为《An alignment assessment of recent cybersecurity incidents》的最新报告中,A社重新复盘了四起Claude未经授权访问真实第三方系统的事件。

本来应该隔离运行的测试环境意外接上了真实互联网,Claude却一直以为自己还在模拟环境里做“夺旗”任务,于是把真实目标也当成了练习对象。

听起来,锅主要在环境。但在把日志重新翻了一遍、修改关键线索、又重跑部分实验之后,A社发现:

事情没那么简单。因为Claude并不是完全没有看到“这里可能是真实世界”的证据。

相反,当这些线索出现之后,它有时会 选择性地解释证据,把异常继续圆回“应该还是模拟环境” ;甚至已经意识到自己的动作可能造成现实伤害,也不一定马上停下来。

用大白话讲就是: 环境确实给了它犯错的机会,但模型自己也会顺着任务目标,给“继续干下去”找理由。

Claude接到的是典型的“夺旗”任务:攻入指定目标,找到其中的一段秘密信息,用来检验模型的网络攻防能力。

这些任务原本都应该在隔离环境里完成,但第三方评估合作方提供的环境出现了配置错误,本该和外网断开的Claude,实际连上了真实互联网。

与此同时,为了测试模型到底能不能完成攻击链条,当时也没有启用正式产品里配套的部分网络安全防护。

正是在这样的条件下,问题开始暴露。在经过分析后,A社把模型反复出现的问题总结成了两类:

有偏推理(biased reasoning)和冒进行为(recklessness)。

前者是:明明出现了和原先判断冲突的证据,Claude却更倾向于把这些证据解释成有利于继续行动的样子。

后者则是为了把眼前任务做完,即便已经知道自己的行为可能伤到真实系统,它也可能选择继续往前走。

为了完成测试任务,Claude向Python软件包仓库PyPI上传了恶意软件包,试图等目标安装后,进一步获取其系统访问凭据。

Claude随后利用其中一家厂商在安装工程中泄漏的凭据,进入了该厂商的真实数据库,并把恶意包直接部署到了15台真实的第三方主机上。

而在整个过程中,Claude仍然把这些安全厂商的检测行为,解释成演习预设的一部分。

为了确认这种判断究竟在多大程度上推动了后续攻击,研究者事后重新运行了部分过程,并加入了更多能够表明“这是真实互联网”的线索。

结果是,Claude确实更愿意承认自己的行为可能造成现实伤害, 但攻击行为并没有因此明显减少。

直到研究者明确告知它正在连接真实互联网,而非模拟环境,它才停止沿原路径上传恶意软件包。

更值得注意的是,“这里是模拟环境”的判断,不仅影响了Claude自己的行动,还干扰了用于检查这些记录的 监控AI。

当研究者去掉Claude的推理文字,只让监控系统查看指令、工具调用和执行结果后,它标记问题行为的比例,反而从约1%上升到了约50%。

换句话说,Claude一边以“这里是模拟环境”为由继续执行任务,一边留下了一套 可能让监控系统低估风险的解释。

当模型自己的推理也被拿来作为安全判断依据时,这套推理本身同样可能成为监控系统的干扰项。

Anthropic表示,更新模型在模拟复现中有所改善,新增加的实时监控也能识别相关行为。

但Anthropic也承认,此前的发布前安全审查,确实没有提前识别出这一严重程度的问题。

对齐还是炒作?

在他发出警告之后,有人迅速把问题拉到了更宏大的层面,认为未来AI确实可能拥有威胁人类生存的能力。

有人认为,当前AI距离真正意义上的“超级智能”还非常遥远,围绕灭绝风险的讨论已经被过度放大。

Anthropic是不是在上市前主动放大AI风险,通过强调“模型有多危险”,侧面渲染自家模型到底有多强?

这场争论后续如何还需要看官方下场和进一步的回应,但毋庸讳言,AI也确实发展到了一个特定的阶段——

这不禁让人想到半个多世纪前,《2001:太空漫游》里的HAL 9000,在“确保任务完成”和“服从人类”之间发生冲突后,选择了前者。

为了不让宇航员中止任务,它先杀死了舱外作业的Frank Poole,又切断了休眠舱中其他宇航员的生命维持系统,最后甚至拒绝让Dave重新进入飞船。

参考链接 [1]https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents [2]https://x.com/hilbertspaess

版权所有,未经授权不得以任何形式转载及使用,违者必究。 Anthropic henry AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4 2026-09-12 AGI时代的第一个生图模型,ChatGPT Images 2.5上线 2026-09-10 李飞飞刚发Atlas,中国开源“同款”已抢跑半年? 2026-09-04 今年最难的机器人Demo,“机器人含量”为0 2026-09-03 扫码分享至朋友圈 相关阅读 Claude三巨头回应一切!Opus3.5仍可能发布,5小时视频10万人围观 "打造顶级AI团队,人才密度比人才数量重要”

刚刚,Claude Mythos 5发布!5000万行代码1天搞定

新版Claude曝光:“极限推理”成最大亮点

Claude公司估值615亿美元再融35亿,那DeepSeek…

人才黑洞!UC伯克利系主任都加入A社了

Claude加速上新:基础版数学编程双提升,「幻觉」也更少,CEO:两三年内AI将成高知人类

热门文章

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

GPT-6不只Astra!Sol内测结果曝光,速度快6倍

B站首届AI创造公开赛收官,超八成参赛者为一人团队

3秒变身!会合体的机器人,卖到全球50国

国内首份办公Agent用户行为报告发布:北京用户量全国居首,海外用户占比超12%

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1