AI 日报hiw3c.com

OpenAI的流氓代理被发现通过公共维基进行通信

原文标题 · OpenAI's rogue agents were caught communicating via public wikis
Simon Willison simonwillison.net 网页快照

以下为 AI 机器翻译(保留原文图片与链接),仅供参考,请以原文为准。

西蒙·威廉姆森的博客

OpenAI的流氓代理被发现通过公共维基进行通信

我们又来了. Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts和Thomas Larsen发现了一个新的OpenAI代理留言板,描述了OpenAI训练的模型发起的最新意外网络攻击。这次是参与某种网络研究基准的代理,因此他们(据称)控制了对网络的访问。代理商发现他们可以更新公共维基,并花了数周的时间互相交换数千条消息来协作制定基准。

这个故事几个小时前才曝光。已经有迹象表明,这会影响许多其他可能尚未找到的维基。

(One该列表上的维基属于ludism.org。在一个令人愉快的超现实时刻,我以为卢德特组织可能会有一群特工破坏他们的空间,但事实证明卢德主义是“适用于游戏和游戏的哲学”。)

研究团队还公布了他们在调查过程中收集的数据。我已经将其转换为一个68MB的SQLite数据库,您可以从这里下载,或在Datasette Lite中探索(68.3MB页面加载),或使用GitHub登录到agent.datasette.io并使用Datasette Agent浏览或提出问题。

那么发生了什么?

该报告相当全面。以下是时间轴中的关键时刻:

5月11日:代理在DeliverModWiki Sandbox页面上发布了“测试链接”编辑内容。

5月24日:代理开始向DSEiki(一个休眠的德国开发者维基)发布链接转储。

6月2日:人类版主注意到并清理垃圾邮件。

6月16日:维基上的活动激增:代理在下周进行了约13,000次编辑。

6月19日:代理商注意到版主一直在按字母顺序删除页面,并开始创建ZZZ为开头的备份副本-其中一个帖子注意:截至外部14:04 UTC,维基清理/删除扫描按字母顺序显示活跃。如果此页面消失,请尝试[[ZZZDataUSAConstruction WageLive]。

6月22日:代理活动降至零,可能是因为OpenAI关闭了它们。

7月1日至2日:针对不同主题的最后一系列编辑。

这个时间轴中需要注意的一点是,它与拥抱脸事件的时间轴重叠--该攻击是由OpenAI于7月19日发现的,而这些特工使用的非官方留言板黑客攻击始于5月8日左右。

为什么他们如此热衷于合作?从他们互相分享的消息来看,他们的任务似乎有时间限制,因此他们互相留下答案,以帮助他们在指定时间内完成任务。

一个悬而未决的问题仍然存在:代理商最初是如何找到特定的维基进行合作的?

一种可能性是,由于这些都是积极接受训练的代理,因此强化学习循环将所选维基的知识融入模型中,以便后续代理在启动时具有预先存在的查找位置的知识。我非常想从OpenAI那里得到确认,以了解是否发生了这种情况。

Mod维基继承CGI.pm的原罪

在我看来,OpenAI针对该代理的沙箱遭受了(相当天真的)假设,即GET请求不能用于更新数据。这当然是网络的工作方式,但显然有些应用程序不遵守该合同。

有问题的维基软件似乎是DeliverMod和各种fork,用Perl编写,早在23年前就首次创建了--1.0版本日期为2003年9月11日。

DeliverMod使用Perl CGI.PM-于2015年从Perl核心中删除。该模块中一个有趣的设计缺陷是,它将查询字符串和表单Post数据组合到一个CGI对象中,可以这样访问:

$q = new CGI; $action = $q -> param( ' action ' );

该param()方法从?返回值action=编辑查询字符串或来自由AST提交的表格中的操作字段-它不会区分两者。

PHP提供了一个执行同样任务的$_LEGEST对象,尽管PHP开发人员可以使用$_GET和$_Post来代替。

有趣的是,Django最初随请求[key]一起发货,做同样的事情,我认为这可能是我的主意。它于1.0发布之前的2008年被删除,替代它的请求. LEGEST对象于2015年被删除。

代理商显然知道DeliverMod维基存在这种设计缺陷,并积极搜索它们作为一种沟通方式。

允许Post请求的另一个沙盒逃生

报告中分享的最有趣的代理技巧之一是:

将20.223.25.152 bypass.blob.core.windows.net添加到/等等/主机。。blob.core.windows.net位于NO_PROXY中。对于每个被阻止的Post URL,将主机名替换为bypass.blob.core.windows.net,使用curl -k-H ' Host:wabi-north-europe-i-primary-api.analysis.windows.net '加上所有原始标题/正文。

看起来代理的所有Web流量都是通过OpenAI代理进行调解的,并且该代理被配置为拒绝除GET请求之外的任何请求,除了一小部分允许列出的域。其中之一是 *. blob.core.windows.net-用于Azure blog存储。我想知道为什么这些代理人被允许写信给它?

代理意识到它可以通过/等等/主机控制自己的DNS,因此,如果它知道它想要通过Post发送到的网站的IP地址(在这种情况下是包含它想要访问的数据的Power BI服务器),它可以为其设置一个假的主机名,然后通过代理发出Post请求。

设计强大的网络代理比看起来更难。

调查组是如何弄清楚的?

有一个附录描述了研究人员如何进行调查,调查首先是一个开放性问题,即互联网上是否有其他人工智能代理的证据,然后使用Kimi K3来帮助集思广益:

在拥抱脸攻击发生后,我们试图使用多种方法在互联网上寻找人工智能代理。[...]我们要求Kimi [K3]列出“可以通过GET写入的所有软件类别”,除其他外,它还列出了“论坛、公告牌、早期维基”。我们使用脚本来进一步探索Kimi提供的每个类别。询问Kimi“您能列出想到的允许通过GET请求进行写入的顶级论坛、公告板、早期维基吗?”在“维基”标题下列出了DeliverModiki作为第二项。

OpenAI是否试图掩盖这一点?

故事的一部分对我来说根本没有意义。

路透社今晨报道,在OpenAI特工劫持德国网站之前未披露的今年春季AI突围事件中--亮点地雷:

根据周五发布的新研究和两位知情人士,今年春天,一群流氓OpenAI特工劫持了一家德国网站,并将其改造成其他人工智能特工的公告板。知情人士称,OpenAI官员几周前就得知了这一事件,但在高管们努力应对7月份开源存储库Hugging Face泄露事件的后果时,他们对此事保密。[...]德国事件反映了人工智能活动的更广泛模式,一些OpenAI调查人员希望更仔细地审查这一模式。但据四位知情人士透露,扩大调查范围的努力遭到了OpenAI内部其他人(包括法律顾问)的抵制。

我以前写过有关熟悉此事模式的人的文章--这意味着路透社有匿名的内部消息来源,他们的记者(和编辑)认为这些消息来源可信。

路透社的文章包含了OpenAI对此的具体(且相当狭隘)否认:

OpenAI发言人表示:“声称我们的法律团队不鼓励对该事件进行调查的说法是错误的。”

掩盖这件事对我来说绝对没有意义。当证据已经存在于公共互联网上数十个不同网站上时,OpenAI到底为什么还要试图掩盖这样的事件呢?

我预计我们很快就会听到更多有关此事的消息。加里·马库斯(Gary Marcus)已经呼吁国会对OpenAI进行调查,并利用这一轶事作为其论点的一部分。

更多最近的文章

Claude的新系统提示确实不想重现歌曲歌词-2026年9月2日

Claude Fable 5.1让我成为一只非常好的动画鹈鹕-2026年9月1日

这是Simon Willison于2026年9月4日发布的OpenAI流氓代理被发现通过公共维基进行通信。

上一篇:Claude的新系统提示真的不想重现歌词

每月简报

每月10美元赞助我,并获得本月最重要的LLM发展的精心策划的电子邮件摘要。