#AI
阿里千问开源自动驾驶视觉语言模型
阿里千问本周开源了 **Qwen-Drive-1.0-4B**,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。官方称其为**首个面向自动驾驶的视觉语言基础模型**,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时完整保留了预训练 VLM 的原始架构。
模型采用分阶段训练,把驾驶监督与通用视觉语言数据结合,在获得驾驶专项能力的同时保留通用视觉理解与指令遵循。它提供 SFT 和 RL 两个规划专家,仅用公开来源构建规划样本。**RL 版以微小的开环位移误差为代价,换来了人类偏好对齐与闭环安全性上的提升**——对国产模型切入自动驾驶上游是明确信号。
💡 为什么值得看首个打通感知问答规划的自动驾驶 VLM,RL 版以微误差换闭环安全。
查证
来源档案
IT 之家
中文科技媒体,本条为对阿里千问官方开源的转述,转载了官方项目介绍与评测数据
信息来自官方 GitHub/Hugging Face 项目页,内容可信;但「首个」为官方自我定位表述,第三方横向对标尚未出现
延伸阅读
GitHub 项目页给出 NAVSIM、Waymo Open Dataset 等闭环/开环规划指标,想了解实际水平差距可查官方技术报告