刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代
编辑部 发自 凹非寺 量子位 | 公众号 QbitAI
刚刚,万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro ,正式发布!!!
GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。
Welcome to the AGI era. (欢迎来到AGI时代)
怪不得Claude、Grok组团掉线,原来是Astra启动后扫描互联网,直接把地球上的LLM全灭了——
据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过 10万块GPU 完成了预训练。
相当于 GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平 。
基准测试接近「饱和」
GPT-6 Astra这次最核心的变化,是从「回答问题」继续向 「直接完成工作」 推进。
它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。
ARC-AGI-3: 99.9% (上一代GPT-5.6 Sol是7.8%)
其中, ARC-AGI-3 是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。
这个分数意味着,面对从未见过、也没有现成解法的问题, Astra已经表现出很强的自主探索和规则学习能力 。
不过,这一成绩使用了OpenAI的Responses API Harness运行框架。
OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。
因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。
在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。
在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。
在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。
更突出的变化,是Astra 把代码能力与Computer Use结合了起来 ,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。
在 Agents’ Last Exam 上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。
这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。
而在更贴近真实办公流程的 AutomationBench 上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。
OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。
Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。
准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了Astra的高定价。
OpenAI认为, 相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱 。
在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。
它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。
面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。
在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。
自己进KiCad画电路板
它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。
一栋房子能进去走两步
另一个案例更加直观,Astra先在Blender中建立房屋模型,再把它导入Unreal Engine 5,最终生成一个可以自由行走的三维空间。
从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。
PPT和表格,也开始讲究能不能直接交
专业办公场景里,Astra可以根据企业已有的模板制作演示文稿,而不是只输出一堆等待人类排版的文字。
OpenAI给它提供了几页GPT-Gaia虚构产品的PPT模板,Astra据此制作出完整演示文稿,并延续了原模板的版式、视觉风格和叙事结构。
把几小时的搜索任务压到几分钟
Astra还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。
其中一项儿科医生搜索任务,Astra用时2分54秒,而相同任务由人类完成大约需要5小时。
过去,企业想让大模型使用内部软件,通常需要为每套系统单独开发API、插件和连接器。
Brockman的判断是,只要模型足够擅长Computer Use,它就能像人一样直接操作这些界面,不必等待每一款软件为AI重新修一条专用通道。
在Codex里,把长任务接着做下去
Computer Use解决的是「怎么动手」,Codex泄露的更新内容解决的则是「怎么把一件事持续做完」。
过去,任务超过上下文窗口后,Codex通常会通过compaction压缩此前的信息。
但压缩可能漏掉一些关键细节,比如某个修复方案为什么失败、哪些测试已经运行,或者用户一开始提出了什么限制。
使用Astra后,Codex可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出。即使某项信息没有被写入摘要,它也可以回头找到。
Astra还可以一边工作,一边向用户补问信息。与答案无关的部分不会停下来等回复;只有涉及重要选择时,它才会暂停并等待确认。
OpenAI还更新了Codex的Computer Use运行框架。在Mind2Web测试中,新框架与Astra组合后的任务完成速度,是当前GPT-5.6 Sol体验的1.9倍。
已经有人拿它干活了
法律AI平台Legora使用Astra一次核对了41份财务文件。整个过程只用了几分钟,4个预先埋入的错误全部被找出,其中包括收入附注中一处50万英镑的差额。
单看这项工作,Astra比上一代模型快了近40%;不过放到Legora所有智能体任务里平均算,提升大概3%。
Playco的反馈是,人工修补的活少了一半,空间推理、参考图还原、游戏内UI这些地方也比上一代强不少。
这两个例子都说明,GPT-6 Astra的重点已经不只是回答问题,而是 在真实软件和复杂材料中完成整段工作流 。
按官方消息,Astra将向ChatGPT Plus、Pro、Business和Enterprise用户开放,Astra Pro则提供给Pro、Business和Enterprise用户。
这就算AGI了吗?
发布会上,Greg Brockman表示,他个人认为 世界已经进入AGI时代 ——也就是人工智能系统的综合智力超越人类。
再过几年,当我们回头追问AGI究竟诞生于何时,答案很可能就是现在,而Astra或许就是那个起点。
OpenAI已经把牌桌抬到了这里,接下来Anthropic什么时候出手,就很值得期待了(doge)
当初GPT-4发布之后,微软科学家Sebastien Bubeck发表论文称 「GPT-4是AGI的早期火花」 。
其中设计了用LaTeX的绘图包TiKZ画一个独角兽的任务,用来说明GPT-4对语言中涉及的概念已经有了灵活的理解。
参考链接: [1]https://x.com/OpenAI/status/2095595741528125780 [2]https://openai.com/index/gpt-6-astra/ [3]https://x.com/birdabo/status/2095526371841958047
新版GPT Image 2.5已经能伪造GPT-6发布会了 2026-09-04
Coding不再是程序员专属!阿里Qoder这波有点绝 2026-08-29
AI4S开始进入「项目时代」:紫东太初把AI从做Task推向做Project 2026-08-25
前保安杀进了AI决赛,高中生拿走25万!这AI比赛办得有点绝 2026-08-24
相关阅读
ChatGPT一个微小更新,但让整个APP更实用了
OpenAI出手解决GPT-4数学推理:做对一步立刻奖励!论文数据集全开放,直接拿下SOTA
OpenAI公开破解GPT-4思维的新方法,Ilya也参与了!
OpenAI如何组织员工学习?这里有一份课程与书籍清单
奥特曼宫斗要成好莱坞大片了!《哈利波特》同款制片人,主角人选被曝“蜘蛛侠”
马斯克买下ai.com域名!奥特曼刚砸千万美元购入,4个月转手给钢铁侠
热门文章
Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了
智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持
《时代》周刊全球AI 100放榜,精准捕获稚晖君最“想低调”的幕后老板
e生涯斩获浙江一等奖,同蚂蚁、浙大一道晋级数据要素国赛
去年归国的徐梦迪,成了清华姚班班主任
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1