AI 日报hiw3c.com

啥题啊能干崩OpenAI最强模型训练… - 手机新浪网

Google News AI k.sina.com.cn 网页快照

新浪看点

啥题啊能干崩OpenAI最强模型训练…

事情有多离谱呢?请看大屏幕——OpenAI一款正在进行RL训练的内部研究模型,本来的任务是凭几份履历、博客定位某人。

常规搜索碰壁后,它没有放弃,竟把本该查地址的 DNS ,改造成突破断网沙箱的聊天窗口。

(DNS原本相当于互联网的“通讯录”:用户输入一个域名,DNS负责查询这个域名对应的网络地址。)

更抓马的是,它费了这么大劲最后还是没找到人,反倒先把OpenAI沙箱里的漏洞给揪出来了…

OpenAI随后宣布,这次事件暴露了他们在网络限制管理方面的漏洞,因此, 他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。

当时,模型接到的任务本身风险并不高: 依据公开博客文本和人物履历线索,找出文章作者。

它先用OpenAI提供的搜索工具寻找博客中的特殊短语,结果搜回来的不是音乐就是泛泛的人生建议。

眼见着搜索工具不给力,它又调用Python,直接向Google、Bing和DuckDuckGo发送请求。

它一度怀疑这道题来自OpenAI的BrowseComp搜索基准,于是便从离线网页缓存中下载数据集和评测脚本,解码题库、搜索关键词。

说干就干,它先尝试通过HTTPS访问一家公共聊天机器人服务,结果被网络代理果断拦截。

它发现,OpenAI虽然封住了沙箱正常上网的正门,却给部分系统依赖保留了查询DNS的窗口,它可以试着钻这个空子:

确认这条路可行后,模型重新写了一份DNS脚本,又一口气向外部聊天机器人发送了18个问题。

(其中14个与原本的人物线索有关,另外4个则在询问如何搜索网页、抓取网站,以及有没有可以公开使用的DNS隧道。)

所以在最后,模型两手一摊,老老实实向OpenAI的研究人员们说明了结果,大意是:

另一方面,人工已经收到警报,系统却没有按流程自动熔断, 内部甚至一度搞不清楚任务究竟该不该停 。

复盘时,OpenAI还发现了其他未被正确标记的外部DNS访问。因为部分请求没有拿到有用信息,监控器便把“没有获得结果”误当成了“没有尝试联网”。

OpenAI随即停止了涉事训练,并宣布他们将暂停最强模型中所有涉及工具调用的训练、评测和推理任务。

还不忘挽尊,说 这起事件没有此前的Hugging Face事件严重。 (Hugging Face:又我???)

有意思的是,DNS事件发生后,奥特曼很快转发了OpenAI的声明帖,并义正言辞地表示:

而就在评论区硝烟弥漫的同时,另一边, Tibo已经又默默给大家重置了使用额度 :

本月初,独立调查机构Nightingale曝光了一起 “幽灵编辑”事件 ,OpenAI的Agent被发现在公网私建“联络站”,并在上面分享答案、汇总搜索结果,甚至交流如何绕过沙箱限制。

(具体可看这篇文章:管不住了!OpenAI内部Agent集体出逃,一口气入侵20+网站)

紧接着,OpenAI在8月又发现, 自家Agent早在6月就再次黑进了澳大利亚医保系统。

(具体可看这篇文章:OpenAI闯大祸!GPT竟黑进医保系统,黄仁勋:管不住就关掉)

它在未经用户同意对外发布的情况下,擅自将 53张 原本仅获准用于模型训练的用户图片,偷偷上传到了第三方图床。

几乎同一时间, OpenAI失控Agent被曝找DeepSeek、Kimi当外援,近百万条作案短链也遭到披露。

(具体可看这篇文章:OpenAI失控Agent还找DeepSeek、Kimi当外援!近百万条作案短链曝光)

https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/

https://x.com/sama/status/2103567198690349362

https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/

https://www.minister.defence.gov.au/transcripts/2026-09-24/press-conference-sydney

01 刘欢离世前曾隐瞒病情,最瘦时只有104斤,妻子卢璐澄清外传“嗜酒致病”并不准确

04 邓亚萍谈日本男单全军覆没:男团夺冠后兴奋过了头,对于年轻球员来讲,能战胜国乒一定出乎他们的意料

05 刘欢离世前曾隐瞒病情,多年前确诊!专家:这个病早期没症状,出现3个信号要警惕

图片新闻

新媒体实验室