探所 Curio 再探再报 了解探所 →
#AI

阿里千问开源自动驾驶视觉语言模型

阿里千问本周开源了 **Qwen-Drive-1.0-4B**,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。官方称其为**首个面向自动驾驶的视觉语言基础模型**,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时完整保留了预训练 VLM 的原始架构。

模型采用分阶段训练,把驾驶监督与通用视觉语言数据结合,在获得驾驶专项能力的同时保留通用视觉理解与指令遵循。它提供 SFT 和 RL 两个规划专家,仅用公开来源构建规划样本。**RL 版以微小的开环位移误差为代价,换来了人类偏好对齐与闭环安全性上的提升**——对国产模型切入自动驾驶上游是明确信号。

💡 为什么值得看首个打通感知问答规划的自动驾驶 VLM,RL 版以微误差换闭环安全。

查证

来源档案

IT 之家

中文科技媒体,本条为对阿里千问官方开源的转述,转载了官方项目介绍与评测数据

信息来自官方 GitHub/Hugging Face 项目页,内容可信;但「首个」为官方自我定位表述,第三方横向对标尚未出现

延伸阅读

论文与基准数据 · ithome.com 10 分钟
GitHub 项目页给出 NAVSIM、Waymo Open Dataset 等闭环/开环规划指标,想了解实际水平差距可查官方技术报告
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store