Qwen-Drive-1.0的核心问题,不是为自动驾驶再增加一个专用模块,而是探索视觉语言基础模型能否成为驾驶系统的统一表示底座。论文将三维感知、视觉问答和运动规划放进同一框架,并通过分阶段训练,让模型获得驾驶场景能力的同时,尽量保留通用视觉理解与指令跟随能力。这代表自动驾驶模型正在从单任务优化,转向更强调共享表示和多能力协同的路线。
统一框架如何工作
Qwen-Drive-1.0保留了预训练视觉语言模型的原有架构,在共享表示之上接入两个关键组件。外部鸟瞰视角感知头负责三维目标检测、语义占用预测和BEV地图分割,既承担感知任务,也作为观察共享表示中三维信息的接口。相比只输出最终驾驶动作,这种设计能够显式呈现部分三维场景结构,便于分析模型究竟获得了怎样的空间理解。
另一个组件是Planning Expert。它以视觉语言模型的共享表示为条件,生成未来自车轨迹。这样,感知信息和规划输出之间不再完全依赖多个相互独立的专用模型,而是通过共享表示建立联系。论文还采用分阶段训练配方,将驾驶监督与通用视觉语言数据结合,用于取得驾驶专长并维持更广泛的视觉语言能力。
评测与能力边界
实验覆盖三维感知、驾驶场景理解,以及开放环、伪闭环和闭环规划设置。论文称,模型在三维感知和驾驶场景理解方面表现较强,同时大体保留通用视觉语言能力;在多种运动规划评测中,也展现出有竞争力的结果。这里的重点不只是某一个指标领先,而是同一模型同时处理“看懂场景”“回答问题”和“预测轨迹”这几类任务。
我的判断
Qwen-Drive-1.0的价值在于提供了一条清晰的系统设计思路:用视觉语言模型承担共享表示,用可检查的BEV感知头连接三维结构,再用规划专家完成轨迹生成。它适合用于研究多模态基础模型如何迁移到自动驾驶,也适合评估通用能力与驾驶专长之间的取舍。但材料没有给出具体指标、数据规模或部署成本,无法据此判断其工程效率和真实道路可靠性。闭环评测结果具有参考意义,却不能替代对复杂长尾场景、安全冗余和实际部署条件的验证。