AI 日报hiw3c.com

Qwen-Drive 1.0告诉你为什么它会刹车,只是不要指望解释会与刹车相匹配

原文标题 · Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuve
The Decoder the-decoder.com 网页快照

以下为 AI 机器翻译(保留原文图片与链接),仅供参考,请以原文为准。

Qwen-Drive 1.0告诉你为什么它会刹车,只是不要指望解释会与刹车相匹配

重点

阿里巴巴的Qwen-Drive 1.0在一个人工智能模型中处理空间感知、交通问题和路线规划。

用于3D地图和路线规划的两个模块扩展了基础语言模型,让人工智能既作为驾驶系统又作为驾驶舱助手运行,而不会丢失现有知识。

在模拟中,再训练将汽车偏离道路的比率从24%降低到12%。但模型的解释并不总是与它做出的驾驶决策相匹配。

Qwen-Drive 1.0在一个人工智能模型中处理三项任务:环境的空间感知、回答有关交通的问题和路线规划。研究人员证实,文本图像模型不会仅仅因为它可以描述图片而自动理解三维空间。

现有的驾驶模型采用一般的文本-图像模型,并根据驾驶数据进行微调,主要是关于交通情况的问答对。根据该文件,这种方法有两个缺点。一个主要基于交通问答训练的模型仍然不能可靠地检测距离、位置和开放空间。如果它过于专注于驾驶数据,它就会通过研究人员所说的“灾难性遗忘”失去最初训练中的广泛常识,而这正是在罕见的意外交通情况下最重要的知识。阿里巴巴研究部门建立的模型旨在解决这两个问题。

一个单独的模块检查模型是否真正理解空间

Qwen-Drive-1.0构建在2月份发布的Qwen 3.5 - 4 B之上,并添加了两个额外的组件。第一种方法是通过在3D空间中发现对象、找出哪些区域被占用并跟踪道路布局来生成周围环境的鸟瞰图。研究人员表示,它兼作测量工具,揭示模型实际从图像中提取了多少空间信息。Ad

第二个组件是规划专家,使用内部模型数据来规划汽车的未来运动。当研究人员仅训练添加的组件并不影响视觉语言模型时,空间准确性仍然很低,这证实了能够详细描述图像的模型不会自动捕捉三维空间。只有当团队还对视觉语言模型本身进行空间任务训练时,性能才会显着提高,这意味着必须有意地内置空间理解交通场景的能力。Ad

培训从感知模块开始,然后结合感知和问题回答,然后是路线规划。最后一步通过强化学习来细化模型的行为。对于视觉语言组件,该团队组合了24个公开可用的交通场景数据集。这些数据集具有不同的结构,有时包含错误。人工智能模型将问题和答案标准化,并将它们与原始数据保持一致。该团队还构建了自己的例子,解释了为什么汽车应该做出特定的驾驶决定,例如哪个物体触发制动。

驾驶舱和驾驶系统均为一种型号

在现代车辆中,信息娱乐系统和驾驶系统正在融合在单个计算单元上,而不是运行在两个独立的控制器上。作者认为,用一般能力换取纯粹驾驶性能的模型在这里没有帮助,因为驾驶舱仍然需要自己的模型和额外的计算来执行对话或开放式问题等任务。Ad

据该报报道,Qwen-Drive 1.0在交通场景问题上的得分远高于未修改的基本模型Qwen3.5- 4 B。最大的差距出现在模型必须解释因果关系时,比如为什么汽车应该刹车或转弯。一般知识也站得住脚:该模型显示驾驶以外的测试几乎没有下降,甚至在某些空间任务中的得分略高。

从模拟到道路

对于驾驶规划,该团队在多个难度级别上测试了该模型,从简单的预测到随着时间的推移错误复合的模拟器。在模拟器中,通过奖励重新训练的版本将汽车偏离道路的比例从24%降低到12%。它驾驶起来也更加谨慎,总体行驶距离更短。Ad

不过,该模型的解释并不总是能准确地指出情况的实际原因。远处的红灯和一个孩子走上道路需要截然不同的反应时间,而模型可以将两者混为一谈。计划的机动也并不总是与模型之前给出的推理相匹配。一些结果取决于作者自己设计或重建的测试程序,因此单个指标几乎无法说明系统将如何处理混乱的现实世界驾驶。Ad

Qwen团队使用其HopChain基准来测量空间理解本身的这种差距。在这里,视觉语言模型错误地分类了对象,混淆了空间关系,即使在图像-文本基准测试中得分很高。灾难性的遗忘也是一个常见的问题。当谷歌Deepmind在2023年建立PaLM-E时,一种用于语言,图像和机器人控制的模型,较小的变体在机器人训练后失去了很大一部分语言能力。最大的版本有5620亿个参数,几乎没有丢失任何东西。

将语言模型与驱动功能配对开辟了新的攻击面。加州大学圣克鲁斯分校的研究人员在摄像机的视野中放置了一个贴有标签的标志,并诱骗DriveLM驾驶系统转向穿过马路的行人,尽管它正确地检测到了行人。与此同时,研究正在转向世界行动模型,该模型还预测环境如何根据代理人自己的行为而变化。

Qwen团队正在Hugging Face、MechanScope和GitHub上向研究社区免费发布该模型。

没有炒作的人工智能新闻-由人类策划

订阅THE DECodER以获得无广告阅读、每周人工智能时事通讯、我们每年六次独家“AI雷达”前沿报告、完整的档案访问权限以及我们的评论部分访问权限。