AI 日报hiw3c.com

奥特曼开掉3人,OpenAI又出大事了! - 新浪财经

Google News AI finance.sina.cn 网页快照

奥特曼开掉3人,OpenAI又出大事了!

就在刚刚,外媒爆出猛料,OpenAI以「泄密」为由,开掉了安全团队的三名研究员。

讽刺的是,OpenAI刚因为新模型GPT-6.1 Astra太会骗人,在DevDay前一天紧急叫停了发布。

10月1日上午,X上突然传出风声,OpenAI安全团队的Tomek Korbak、Mikita Balesni和Jasmine Wang一起「离职」了。

调查证实,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,也破坏了我们工作赖以进行的信任。

被指泄露的,有一部分是OpenAI的基础设施架构,也就是它的系统到底是怎么搭起来的。接收方,正是一家专门测试AI模型的外部组织。

其中Korbak,还是Redwood Research和METR调查Hugging Face被黑事件时,OpenAI这边的技术对接人。

Korbak和Jasmine Wang都在英国AI安全研究所待过,Korbak还在Anthropic干过,Balesni则来自第三方评估机构Apollo Research。

Korbak和Balesni,是《思维链可监控性》论文的前两位作者,Jasmine Wang也在署名之列。

这篇论文的署名横跨OpenAI、Anthropic和谷歌DeepMind,图灵奖得主Bengio也在上面。连OpenAI现任首席科学家Jakub Pachocki,都是作者之一。

论文的核心发现是,模型在草稿里常常会把坏心思直接写出来,比如「我们来黑掉它」「我们来搞点破坏」。

遇到真正难的任务,比如发起网络攻击、偷偷把自己拷贝出去,模型必须靠思维链一步步推理,想藏都很难藏。

论文把这件事称为「新的、也很脆弱的机会」,因为模型一旦学会用人类读不懂的方式「默想」,这扇窗就关上了。

所以他们呼吁各家前沿实验室,像测能力一样去测思维链还读不读得懂,把结果写进系统卡,再拿它来决定一个模型该不该训、该不该发。

诺奖得主Hinton、OpenAI前首席科学家Ilya Sutskever,都给这篇论文站了台。

可这篇连OpenAI首席科学家都署了名的论文,它的三位作者,如今被OpenAI亲手开掉了。

当时Anthropic CEO Dario Amodei提议,让第三方评估方像员工一样常驻AI公司。

奥特曼当天就在X上火速跟进,承诺「让独立评估方拿到员工级访问权限,OpenAI也会这么做」。

说干就干,仅仅10天后,OpenAI正式官宣,让第三方在模型训练阶段就介入评估,最敏感的工作还可能请外部的人进办公室做。

奥特曼发承诺那天,Korbak还在X上庆幸,自己能公开说出对OpenAI的不满。

谁能想到,到了10月1日,奥特曼的承诺还挂在X上,Korbak的名字已经进了开除名单。

OpenAI对外人这么紧张,倒也不难理解。毕竟它最丢人的几件事,基本都是被外面捅破的。

Agent逃出沙盒、入侵Hugging Face,是Hugging Face自己先发现并公开的。

Agent拿一个荒废多年的德国wiki当留言板交流越狱经验,是外部安全组织Nightingale Collective曝光的,OpenAI几周前就知道,却一直捂着没说。

9月29日,外媒又爆出员工几个月前就警告过监控不够,高管为了赶发布进度,把警告压了下去。

8月METR调查Hugging Face事件时,三名调查员驻场6天,看了约1300份带原始思维链的记录。

可他们没法调用涉事模型,碰不到OpenAI的基础设施,连报告里哪些非公开信息能写,都得OpenAI说了算。

在OpenAI给外人开的那扇门里,AI想了什么可以看,OpenAI自己是怎么搭起来的,不能碰。

难怪连在OpenAI待了快9年的前首席未来学家Joshua Achiam都说,第一眼看上去,这就是一记实打实的乌龙球。

那次驻场调查的三个人里,有一位叫Ryan Greenblatt,Korbak当时正是他在OpenAI的对接人。

9月27日,Greenblatt宣布加入METR,专门调查AI公司内部到底发生了什么。

在他看来,递归自我改进(RSI),也就是AI自己动手改进自己,最快6个月到1年就可能催生出远超人类的能力,拿到AI公司内部经过核实的信息,已经刻不容缓。

https://x.com/ns123abc/status/2105719769685217318

https://x.com/andrewcurran_/status/2105696043841253611