AI 日报hiw3c.com

OpenAI搅乱数学界!科研项目没了,数学家遭毁灭性打击,学界还要数年消化 - 新浪财经

Google News AI finance.sina.com.cn 网页快照

OpenAI搅乱数学界!科研项目没了,数学家遭毁灭性打击,学界还要数年消化

数学家可能真的遇到难题了:AI 产出新数学的速度,开始超过数学界理解数学的速度。

几天前,OpenAI 突然在 GitHub 上公开了一批由内部未发布前沿模型生成的数学 研究成果 ,数量达到惊人的 722 篇。其中涉及数论、代数几何、分析、组合数学等多个方向,一些成果还配有 Lean 形式化证明。

《The Verge》采访了 30 多位数学家。面对这场成果洪流,他们用「 令人震惊、压得人喘不过气、前所未有、恍如梦境、简直疯狂 」等来形容 OpenAI 带来的这场冲击。

尽管每个人的反应不同,研究人员普遍认同一点: 仅仅理解 OpenAI 这次发布的内容,可能就需要数年时间,AI 产出新数学的速度,开始超过数学界理解、验证和吸收数学的速度。

更麻烦的是, OpenAI 或许不会等数学界慢慢消化完这些成果,就会继续向前推进,甚至发布更多新的结果 。

纽约大学数学教授 Tristan Buckmaster 在接受采访时表示,OpenAI 一次性发布 722 篇手稿, 已经摧毁了一些职业早期数学家的研究路径,甚至让一些完整的研究项目失去继续推进的意义 。

如此庞大的成果数量,使得外界甚至很难对 OpenAI 到底发布了什么做出初步判断。

在这些成果公布后的数小时乃至数天里,《The Verge》采访的大多数数学家都表示,他们仍在努力消化全部内容。几位研究者称, 光是看完那份大约 40 页的目录和摘要,就花了将近一个小时 。

康涅狄格大学数学教授 Álvaro Lozano-Robledo 表示: 仅仅浏览完整的摘要列表,就已经让人感到不堪重负 。

OpenAI 在 GitHub 上承认,这些结果目前处于不同的验证阶段,而且许多手稿已经完成形式化,但并非全部。截至发稿时,这批手稿中完成形式化验证的比例还不到一半。

OpenAI 表示,在 700 多篇手稿中, 只有 300 项核心结果完成了形式化验证,约占 42% 。公司称,随着获得更多形式化证明,会继续更新这一仓库。

多位数学家向《The Verge》抱怨形式化验证覆盖不足,尤其是在成果数量如此庞大的情况下。他们强调, 即便某项结果附带了 Lean 代码,评估也不意味着可以立刻完成。

研究人员还需要进一步检查:这份形式化证明究竟证明了论文声称的那个结论,还是只证明了一个与之相关、但并不完全等价的命题。

一些正在逐篇检查论文的研究者表示,即便已经提供了可由计算机验证的证明,质量也并不一致;有时 Lean 所验证的命题,与论文正文中声称的结论之间,并不能完全清晰地对应起来。

伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己研究的代数数论领域里发现了不少相关定理,但其中只有大约六个结果第一眼就特别突出。而这些结果中,几乎没有一个看起来已经在 Lean 中完成了正式验证。

Buzzard 说道:所以,要么我得去读这些可能并不正确的垃圾内容,要么等其他人先去读,要么就等有人把它们形式化之后,我才能确定这些结果到底是不是正确的。

这种担忧很快有了具体案例。研究者 Fan Nie 表示,他们使用自建验证系统 OSVerify 检查 OpenAI 10 月 4 日版本的《Global quantum geometric Langlands at irrational level》时,发现了两个重大问题,其中一个问题还由系统提出了修复方案。

这也进一步说明,OpenAI 批量产出前沿数学结果之后,验证本身正在变成另一项需要被规模化的工作。甚至开始出现一种颇具意味的新局面:AI 负责生成证明,另一套 AI 系统负责找错和修补。

这里的 slop 通常用来形容那些质量低下、经常包含错误的 AI 生成内容。近年来,这类内容越来越频繁地出现在互联网上,甚至进入现实世界,其中也包括学术论文。

数学家告诉《The Verge》,近几年借助 ChatGPT、Claude 等工具生成的此类内容明显增加。很多材料逻辑混乱、难以阅读,也体现不出对相关领域的真正理解;在引用和归功其他研究者方面,问题尤其明显。

OpenAI 此前发布的一些数学研究文本,就曾因写作粗糙受到专家广泛批评,其中一个突出问题就是引用不足,甚至完全缺失归属说明。

因此,在这次大规模发布之前,一些研究人员私下已经把即将到来的论文洪流称作 slopocalypse,也就是 AI 垃圾内容末日之类的说法。

至于这次人们担心的 slopocalypse 是否真的发生,目前还很难判断,主要原因恰恰是 OpenAI 一次发布的材料实在太多。

早期迹象显示, OpenAI 这一次在论文质量上似乎更加谨慎,至少部分论文如此 。多位数学家告诉《The Verge》,他们的第一印象比预期好得多。

不过,他们也承认,这个标准并不高,因为 OpenAI 此前发布的一些数学材料质量本来就比较糟糕。

而比以前更好,并不意味着已经足够好,更不意味着达到了通常情况下,这类重大数学主张所应满足的学术标准。

尤其是在 OpenAI 很多数学结论尚未完成形式化验证的情况下,配套论文的质量就变得格外重要。 因为这些论文是数学家确认、理解、审查和定位相关成果的主要依据。

而像 OpenAI 这样,以如此大的规模同时完成这些工作,更是一个极其艰巨的任务。

OpenAI 的模型正在以令人眼花缭乱的速度,在大量不同数学分支中不断产出新结果,其速度远远超过公司内部人类研究人员能够审查的能力 。

问题在于,OpenAI 并没有足够广泛的专业知识储备和人力资源,去真正严格审查这些处在数学研究最前沿的成果。

布朗大学数学教授 Brendan Hassett 告诉《The Verge》:我最熟悉的那个问题,它的论文写法我快速读了一遍之后几乎看不懂。如果这是一个人写的,我不会再花时间试图理解它。当然,这还剩下另外 721 篇预印本!

一些研究人员还告诉《The Verge》,他们或者同事注意到, 部分论文看起来可能覆盖了其他数学家此前已经完成的工作 。

有些结果如果按照传统数学论文的标准, 本来可能需要数百页才能完整展开,但在 OpenAI 发布的材料中,却被压缩到了几十页甚至更短 。

澳大利亚悉尼大学数学教授 Nalini Joshi 表示,她快速检索了这批论文之后,没有发现太多与自己研究直接重叠的内容。不过,她注意到,自己查看的一些论文参考文献非常短。

考虑到 OpenAI 此前在成果归属和引用问题上已经受到过批评,她表示,自己担心这些论文中的引用情况可能并没有完整呈现相关研究的来龙去脉。

不过,在大量 slop 和不确定性之外,受访数学家普遍承认,这批成果里确实包含了一些分量很重的工作。

多位研究者告诉《The Verge》,虽然目前很难在如此庞大的材料中迅速完成判断,很多结果也还需要进一步验证,但其中一些工作的水准已经相当高。 如果放在 AI 出现之前,这些成果中的不少都足以发表在顶级数学期刊,甚至足以支撑一名研究者建立自己的学术生涯。

斯坦福大学数学家 Jared Duker Lichtman 表示,他认为这样的结果可能有数十个,其中包括对黎曼猜想的推进、霍奇猜想一个特殊情形的解决,以及四维 Kakeya 猜想的解答。

黎曼猜想和霍奇猜想属于七大千禧年难题;Kakeya 问题则是调和分析和几何测度论中的核心问题。今年获得菲尔兹奖的王虹,其重要工作之一正是三维 Kakeya 问题。

数学家 Scott Armstrong 说,这次涉及的很多问题,并不是什么没人听说过的小问题,其中相当一部分都是数学界研究了几十年的著名难题。

OpenAI 发布这些成果之后,一些数学家发现,自己几年以来规划的研究方向突然发生了变化。

圣安德鲁斯大学数学教授 Colva Roney-Dougal 表示,她认识的一些同行, 原本已经围绕相关问题准备好了基金申请,但 OpenAI 的发布之后,这些申请所依赖的核心研究目标直接被抹掉了。

Scott Armstrong 也表示,他知道有一个团队, 几乎整个研究计划都被此次发布覆盖。

Tristan Buckmaster 则告诉《The Verge》, 自己已经听说至少有三个人的完整研究项目因此受到毁灭性冲击。

来源:https://www.theverge.com/ai-artificial-intelligence/994255/openai-millennium-prize-problem-tristan-buckmaster-competition

受冲击最明显的,包括概率论、组合数学和理论计算机科学。 一些群论方向也被研究者形容为遭到了推土机式的推进。

Armstrong 甚至认为,从问题分布来看,OpenAI 显然对一些方向进行了重点攻击,其中就包括今年菲尔兹奖相关的 Kakeya 问题,以及多个千禧年难题。

但这种轻松并没有持续太久,当越来越多人开始搜索这 700 多篇论文时,不少数学家陆续发现自己的工作、研究方向,甚至论文都已经出现在 OpenAI 的引用中。

经历此前几次与数学界的争议之后,OpenAI 找到了新成立的数学与人工智能咨询小组(Advisory Group on Mathematics and Artificial Intelligence,AGMAI),讨论如何更负责任地公开 AI 生成的数学成果。

来源:https://openai.com/index/advisory-group-on-mathematics-and-ai/

例如,AI 实验室最好只发布有人类真正理解的论文;如果无法做到,也应该提供足够的支持,让数学家能够理解、吸收 AI 生成的成果并寻找它们可能的应用。

更重要的是,AGMAI 希望 AI 公司不要把数学研究发布当成宣传模型能力的营销工具,也不应该持续使用外界无法访问的专有模型测试前沿数学难题。

例如,公司表示将资助一系列数学研讨会和会议,帮助数学共同体理解这批结果;也首次披露了更多生成过程的信息,包括模型总共尝试了超过 4000 个问题,一项典型成果平均消耗约 3 小时 ChatGPT Pro thinking 算力。

同时,OpenAI 还建立了论文修改和引用协议,并承诺保留 GitHub 仓库的公开版本历史。

OpenAI 没有透露究竟是哪一个模型产生了这些结果,也没有公开使用的提示词,更没有公布模型尝试过的全部 4000 多个问题。

公司也承认,目前形式化验证仍然不足,并表示未来发布时会进一步改进引用、数学表述和论文呈现质量。

OpenAI 明确表示, 未来仍将继续使用内部前沿模型测试数学以及其他科学领域的问题。

在公布这批成果时,OpenAI 表示,希望把最先进的能力直接提供给科学家,因此仍有必要持续评估内部前沿模型在数学和其他科学领域的能力,从而加快相关科研工具的发展。

该组织再次强调,未来必须让更多研究者公平获得算力和研究工具,并提出了一个更根本的问题:数学研究的未来,不能只是让人类负责理解 AI 实验室生产出来的结果。

对于这 700 多篇手稿,很多数学家估计, 仅仅是完整理解、验证和整理其中的成果,就可能需要整个数学界花上数年。

Scott Armstrong 用了一个非常形象的比喻:假设 AI 就像外星人一样,突然来到地球,把这些数学结果留下,然后马上消失,人类接下来可能还要花十年时间研究这些东西,弄明白它们到底意味着什么。

他们需要补齐证明中的细节,寻找隐藏的联系,提炼真正有价值的新思想,并把这些结果重新放回整个数学知识体系中 。

Lichtman 因此认为,未来解释、验证和理解数学成果的工作需要获得更高的学术价值。

过去,学术奖励更多给予发现新定理的人。如果 AI 开始大量生产新定理,那么 帮助整个共同体消化这些成果的人,也应该得到更多认可。

与此同时,多位数学家指出,这批成果虽然惊人,但目前看来,大多数仍然建立在现有数学方法和技术之上。

它们非常巧妙地填补了已知数学版图中的许多空白,却还没有明显创造出一套全新的数学语言或范式。换句话说,AI 证明了一个此前可能被严重低估的事实:在人类已经建立起来的数学体系内部,还有远比数学家想象中更多的空间可以被继续填满。

正如 Álvaro Lozano-Robledo 所说:数学研究本质上近乎无限,研究当然还会继续。

事实上,《The Verge》采访的很多研究者本身就是 AI 工具的积极使用者,也普遍欢迎 AI 带来新的数学成果。

按照现在的模式,数学研究越来越像是在一张问题清单上不断打勾:解决一个问题,发布结果,然后马上进入下一个问题。

一个醒目的发布公告,一篇初步论文,剩下的验证、解释、整理、建立联系和寻找后续问题,全都交给数学共同体。

但围绕答案产生新思想、建立不同领域之间的联系、提出新的问题,以及找到此前不存在的研究方向,同样构成数学本身。

如果 AI 实验室只是不断给出最终答案,那么理解这些答案并让它们真正进入数学体系的成本,最终还是落在了数学家身上。

相比已经拥有稳定职位的教授,这场变化对博士生、博士后以及尚未获得长期教职的青年研究者影响尤其明显。

因为一个开放数学问题,往往可以支撑一个博士论文、一个基金申请、一份求职材料,以及未来数年的研究计划。

ETH Zurich 数学家 Simon Machado 表示,对于那些科研经费即将结束,或者此刻正在找工作的人来说,这种变化尤其具有破坏性。

越来越多年轻研究者开始担心: 自己赖以建立职业生涯的问题,会不会就是 AI 下一个解决的目标?

Roney-Dougal 形容,这种感觉让人觉得 AI 公司似乎并不真正关心某一个具体数学结果,它们只是不断向前。

Armstrong 的说法更加直接:数学家甚至还没有消化完这一批,可能再过两个月,就会出现一个更大的结果集,把今天的一切再次覆盖过去。

即使像他这样自称对 AI 非常乐观、平时也大量使用 AI 工具的数学家,如今也开始感到不安。

https://www.theverge.com/ai-artificial-intelligence/1008726/openai-mathematics-solutions-chaos

VIP课程推荐

新浪直播

@@title@@

@@status_text@@ @@program_title@@

APP专享直播

热门推荐

24小时滚动播报最新的财经资讯和视频,更多粉丝福利扫描二维码关注(sinafinance)

股市直播

03 / 油价,要降了?普京与特朗普通话:俄将向美及全球供应石油

05 / 特朗普最怕的数据来了:8月逆差破千亿,背后推手让白宫很难堪

06 / 特朗普政府反对所有联合国新一任秘书长候选人 要求推出新候选人

07 / 黄金拉升逼近4200美元,瑞银:今年12月将达到4600美元

08 / 超千亿资金将集结入场!下半年发起大额增持回购计划的低估值股出炉,仅13只

09 / 美以伊最新局势:俄罗斯、伊朗将加强合作,普京强调错不在伊朗

01 / 巴拿马发生70多年来最强地震 拉美部分地区或面临海啸

03 / 泽连斯基:特朗普与普京达成的柴油协议“既不公正,也不坦诚”

04 / 8个月蒸发812亿!尊界质量翻车,江淮连续7季度巨亏

05 / 董事长被罚3000余万元、总罚款超1.2亿!双汇再次道歉:深感愧疚

09 / 10月10日美股收盘:道指涨423点 三大股指本周均录得涨幅 科技股普涨

01 / 两家银行IPO审核“中止”,A股已逾4年无银行新股

03 / 银行加码“六张网”建设,算力产业链成信贷布局新焦点,对公业务或迎增量空间

06 / 六家农商行国庆假期完成系统合并:新设组建徐州农商银行承继全部业务,注册资本超百亿元

10 / 三季度银行罚单合计4亿元 信贷“三查”仍是违规重灾区

7X24小时

用户7763476192 : 再玩下去6000亿都守不住了,没人玩了

新浪简介 | 广告服务 | About Sina 联系我们 | 招聘信息 | 通行证注册 产品答疑 | 网站律师 | SINA English