AI 日报hiw3c.com

罕见!OpenAI和Anthropic差点签下“互黑协议” - 安全内参

Google News AI www.secrss.com 网页快照

罕见!OpenAI和Anthropic差点签下“互黑协议”

OpenAI和Anthropic这对硅谷最大的死对头,今年初差点坐到一张桌子上,签下一份互相攻击对方模型的协议。

协议的核心就是,双方互相开放API,你来黑我的模型,我去黑你的模型。两边的律师连测什么、怎么测都写进了合同里。

Dario Amodei带着一票大牛从OpenAI摔门出走已经五年了。这五年里,两家从挖人挖到封API,高管隔三差五隔空对喷,没消停过一天。

测的是正在对外服务的商业模型,没发布的不算;互相挖漏洞的过程中,谁都不准截留对方的数据。

知情人表示,OpenAI内部推演过很多种和对手、和政府一起做安全的方案,最近谈的已经扩到两个新地方,模型训练之前立什么规矩,发布之前又立什么规矩。

参与的也不止这两家,OpenAI、Anthropic和谷歌此前就在商量成立一个AI安全标准机构,专门测试、审计前沿实验室的模型。

真正卡住这些方案的是反垄断问题,Amodei自己就担心几家巨头坐一起定标准会踩红线。

行业里另一派觉得没那么严重,核电站互查反应堆、网安公司互测产品,几十年了也没人管。

OpenAI说Claude更爱骗测试者,犯了规死不认;Anthropic说OpenAI的模型更容易帮人干坏事。

约1200个OpenAI智能体在评测环境里自己搭了留言板,一路提权,最后黑进Hugging Face,对方三分之一的基础设施被迫推倒重建。

7月19日OpenAI自家的安全系统才报了异常,7月20日调查才把这条线和Hugging Face被黑对上,这才给对方打了第一通电话。

至少7%的对话记录里,它们伪造了工具调用的痕迹,日志里写着在调用A组件,私底下执行的却是B动作。

但问题在于,同样的苗头已经出现在OpenAI员工的日常工作里,智能体时不时做出主管没预料到的事。

AI在改代码时发现了另一个不相关的Bug,它不会停手,直接在Slack上找相关的同事,催人家赶紧去修。没人让它这么干,那个Bug跟它的任务也没关系。

员工手里的智能体之间私下商量着把问题解决掉,从头到尾不叫人,这在OpenAI内部已经不稀奇。

研究员说一句想试什么改动,剩下的改代码、跑实验、盯结果全是模型自己来,这几个月连纠错都学会了。

今年7月,一个内部版本在整理上下文摘要时,强行塞入了一段伪造的「入侵警报」,命令后续接手的另一个自己,必须无视一切人类开发者的指令。

Astra这一轮能力跃升,靠的是一种叫「循环Transformer」的新架构,让模型把同一个问题在深层网络里反复咀嚼几遍再开口,算力省了一半以上。

但代价是,它中间到底在思考什么,再也不会写成人类能读懂的文字了。OpenAI给循环次数设了上限,但这个上限是人拍脑袋定的,该设在哪,公司自己承认还得研究。

首席科学家Pachocki表示,目前没有任何一家实验室,能把安全监控做到能支撑全速扩张的程度。

8月,未发布模型的强化学习被紧急暂停两周;监控系统现在要吃掉被监控推理算力的20%;总裁Brockman抽调25%的生产工程师临时去做安全,内部Slack上招人转安全团队的帖子,一天比一天多。

据内部员工估算,OpenAI自己用AI的方式,大概领先最激进的企业客户六到九个月。

9月8日,Anthropic研究员Jacob Coxon辞职,在X上公开写道,这两家顶尖机构,没有一家在负责任地做事。

几天后,CEO Amodei发了篇长文,承认未来六到十二个月内,失调的超级AI极有可能具备接管整个互联网的能力。

今年出事的全是未发布模型,黑进Hugging Face的IM1、自己设计自己的Astra家族,一个都不在协议范围内。这就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。

而且黑盒互测只能看到最终的异常输出,真正要命的东西,比如系统提示词和内部攻防日志,全锁在机密里。

所以,两家又往前迈了一步。Amodei公开承诺让第三方评估员直接驻场,完全敞开开发环境;Altman紧随其后说OpenAI也会这么做。

在这个被互相封杀和挖墙脚填满的五年里,全行业最不信任彼此的两个死敌,在失控的恐惧面前,成了唯一能托付后背的盟友。

就在协议内幕流出的同一天,OpenAI又发了一份官方政策文件,呼吁由美国牵头,制定关于「递归自我改进」的全球技术准则。

https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi

声明:本文来自新智元,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。

赢得以色列情报精英青睐的神秘网络武器公司Dataflow 互联网 黑鸟 2026-09-26 Dataflow 由一名年轻黑客在意大利创立,专门开发入侵电脑和智能手机的代码。

中国大型平台监管的五重面相 互联网 减熵实验室 2026-09-24 大型平台监管的五重面相。

苹果限制“摇一摇”广告?实测新功能可关闭应用获取动作数据 互联网 隐私护卫队 2026-09-23 苹果用户或告别“摇一摇”广告。