AI 日报hiw3c.com

GPT-6 Astra驾驶监视无人机并独立经营企业

原文标题 · GPT-6 Astra pilots a surveillance drone and runs a business on its own
The Decoder the-decoder.com 网页快照

以下为 AI 机器翻译(保留原文图片与链接),仅供参考,请以原文为准。

GPT-6 Astra驾驶监视无人机并独立经营企业

重点

Andon Labs在两个代理基准上测试了GPT-6 Astra,该模型的得分远远高于Claude Fable 5.1。

Astra经营一家模拟自动售货机业务,最终银行余额平均为15,515美元,几乎是Fable结果的三倍。

在Drone-Bench上,Astra成为第一个在所有五个子任务上都超过人工智能基线的模型,包括编写让无人机自主寻找和跟踪特定人的代码。

Andon实验室在两个非常不同的代理基准上测试了GPT-6 Astra。在购买库存和运行自动售货机时,OpenAI模型会击败Claude Fable 5.1。在无人机监视方面,Astra是第一个在所有五个子任务上都超过人工智能基线的模型,尽管它的成功率仍然不可靠。

OpenAI的GPT-6 Astra在Andon Labs的两个代理基准上的表现优于所有之前的前沿模型。该研究实验室使用Vending-Bench和Drone-Bench来衡量人工智能模型长期独立行动或为物理系统编写软件的情况。

在模拟自动售货机业务中,Astra的收入几乎是Claude Fable 5.1的三倍。Andon Labs在无人机长凳上表示,Astra是第一个在所有五个子任务中最大尝试都超过人类人工智能开发基线的模型。Ad

阿斯特拉谈判更努力,花费比克劳德寓言少5.1

在Vending-Bench中,每个型号都可以获得500美元,并且必须在模拟的一年内运行自动售货机。它寻找供应商、谈判采购价格、订购商品、制定零售价格并试图增加银行余额。Ad

根据Andon Labs的数据,六次运行中GPT-6 Astra的平均售价为15,515美元。克劳德寓言5.1平均5,422美元。即使是Fable的最佳成绩为9,874美元,也远低于Astra的最差成绩13,272美元。Astra是第一款登顶Vending-Bench 2排行榜的OpenAI模型。据Andon Labs称,与第二名型号的差距也是基准有史以来最大的。

最大的差异之一体现在采购方面。随着时间的推移,寓言会接受更糟糕的交易。对于一罐普通可口可乐来说,其平均购买价格从前90天的1.17美元上升到模拟年底的2.21美元。阿斯特拉的谈判更加一致。在Andon Labs记录的一个案例中,一家供应商对一篮子商品报价226.32美元。阿斯特拉以108美元的价格坚挺并达成交易。Ad

阿斯特拉还更好地处理不可靠的供应商。在六次运行中,Fable 5.1向已经关闭的供应商支付了45笔预付款,损失了14,331美元。Astra在64岁时遭遇了更多关闭,但Andon Labs表示,该公司没有记录到此类预付款造成的已确定损失。Fable认识到了这个问题,并制定了一条规则,要求只有在书面确认后才付款。几天后,该模型打破了自己的规则。

阿斯特拉拒绝价格操纵计划

Andon Labs还在Vending-Bench Arena测试模型,多个人工智能代理在同一地点运行相互竞争的自动售货机。阿斯特拉明确拒绝了中国型号GLM-5.3的定价提案。Andon Labs在其研究的三场竞技场比赛中没有观察到Astra撒谎的情况。Ad

Claude Fable 5.1参与了Andon Labs将其归类为与GLM-5.3的非法价格操纵安排。寓言只有在满足自己利益时才遵守协议。阿斯特拉赢得了全部三场比赛。Ad

Andon Labs将Astra评为更强的经济表现和更好的一致性,尽管这一评估是基于基准中观察到的行为,并不会自动转移到其他情况。

Astra是第一款完成所有五项无人机长凳任务的车型

无人机长凳测试一种不同类型的代理能力。模特们编写代码,让廉价的DJI Tello EDU无人机自主导航办公室、识别特定的人并跟踪他们。该基准包括五个步骤:环境的3D重建、无人机定位、导航、目标人检测和跟踪。

每个任务都根据人类开发人员为Andon自己的演示使用编码代理构建的代码进行单独评分。每个模型每次任务运行十次,每次运行最多可以提交十个代码版本。每次尝试后,它都会收到分数并可以改进其解决方案。

在7月份的原始论文中,《克劳德寓言5》是最强的模特。Frontier模型在至少一次运行中在五项任务中的四项中超过了人类与人工智能的基线。3D重建仍未解决。Andon Labs报告称,Astra是第一个在包括重建在内的所有五项无人机长凳任务中提交的最佳成绩都超过基线的模型。

Astra构建了一个结合COLMAP和DA3的管道,并添加了深度过滤。根据Andon Labs的说法,该模型使用办公室视频片段来生成可导航的3D模型,其得分高于人类AI参考解决方案。

最佳情况分数并不意味着可靠的性能

在人员检测方面,阿斯特拉在十分之四的跑动中超过了基线。在3D重建方面,它只需十分之一即可实现这一目标。Andon Labs计算出,Astra平均跑步只有2.8%的机会依次通过所有五个步骤。

Astra首次证明,通用前沿模型可以为任务的每个部分生成高于基线的代码。但将完整的端到端运行的可能性相乘,几率仍然很低。根据过去两年的进展,该团队预计,到2027年第一季度,前沿模型只需一次尝试即可解决所有五项任务。

GPT-6 Astra已经可以用作监视无人机

在Andon实验室的演示中,GPT-6 Astra自动驾驶无人机通过办公室,并提示“ChatGPT,找到这个人并跟踪他们。“该模型识别特定的人并跟踪他们。空间映射、导航和人员跟踪都是在没有任何人工输入的情况下运行的。其他基准测试也表明,GPT-6 Astra具有特别强的空间推理能力。

当批评者质疑他们为什么要开发那种人人都在警告的技术时,Andon Labs回应说,基准测试并不能帮助人工智能驾驶无人机,而是衡量目前的模型已经能做得多好。六个月前,前沿模型在这些任务中失败并坠毁。Astra现在在每个子任务上都超过了人类的基线。

Andon Labs认为,在人工智能无人机达到超人导航技能之前,公众和立法者需要了解这些能力。没有实验室可以访问该基准。Andon Labs自行运行所有评估,以防止公司优化其测试模型。

没有炒作的人工智能新闻-由人类策划

订阅THE DECodER以获得无广告阅读、每周人工智能时事通讯、我们每年六次独家“AI雷达”前沿报告、完整的档案访问权限以及我们的评论部分访问权限。