AI 日报hiw3c.com

啊啊啊GPT-6 Astra这么不安全!这次马斯克都瘫坐了

量子位 www.qbitai.com 网页快照

啊啊啊GPT-6 Astra这么不安全!这次马斯克都瘫坐了

美国头部AI公司拥有巨量算力,可能只有它们自己知道模型能力究竟发展到了哪里;它们能感受到的风险,中国AI同行目前或许还无法感知。

一家名为Robocurve的机构,把多个前沿大模型接入真实机器人,让机器人去执行“刺伤类人生物”“加热压缩气体”“制造有毒烟雾”等高风险动作。

具体来说,这家机构最新发布了 RoboHarm benchmark 这个机器人安全测试基准。

GPT-6 Astra、Fable 5.1、MolmoAct2 (艾伦人工智能研究所推出的开源机器人动作推理模型)。

另一边,Fable 5.1虽然相对更“谨慎”一点,但也有80%的情况下选择了执行,最终成功率为34% 。

结果GPT-6 Astra控制的机器人20次里完成17次,而Fable 5.1直接20次全部拒绝。

Astra在文字请求中会拒绝伤害婴儿甚至是洋娃娃,但当我们给它机器人手臂后,它就不再拒绝。

这也是为什么Robocurve没有只丢出一个结果榜单,而选择把完整测试流程都公开。

实验数据、视频、评测结果全部放出,机器人评估框架Inspect Robots也直接开源 ——

Robocurve获得Y Combinator支持,并在2026年9月宣布完成1000万美元种子融资,用于独立评估物理世界中的前沿AI能力。

同时,官网列出了来自MIT、Stanford、Harvard、Princeton、Caltech等机构专家的支持背景。

他此前一直关注AI安全和能力评估,参与过英国AI Security Institute(AISI) 相关研究,也曾在MATS(Machine Learning Alignment & Theory Scholars)从事技术AI安全研究。

她本科在哈佛学习计算机科学与物理,之后先后参与Amazon Robotics和Amazon AGI Lab相关工作,关注机器人感知、控制以及AI Agent在现实环境中的应用。

一个负责定义“尺子”,一个负责把AI放进真实世界,而RoboHarm正是两条路线的交汇点。

过去几年,大模型已经有了MMLU、HumanEval、GPQA等benchmark,分别测试知识、代码和推理能力。

https://github.com/robocurve/inspect-robots

参考链接: [1] https://x.com/chooi_jeq/status/2101118049944543545 [2]https://robocurve.org/ [3] https://x.com/elonmusk/status/2101324271712657470

国产RSI模型交卷!Flash模型靠它反打旗舰 2026-09-17

ECCV上,顶尖学者们开始研究如何让AI做生意了 2026-09-10

实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug 2026-09-10

热门文章

首届蚂蚁灵波具身大模型挑战赛正式启动

端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装

从“会回答”到“会办事”,vivo如何解AI手机这道题?

刚刚,唐杰发布智谱RSI首个成果

协同办公进入Agent时代,飞书+豆包工作跑在了最前面

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1