阿里千问团队近日宣布,其最新开源的自动驾驶视觉语言模型Qwen-Drive-1.0-4B正式亮相。该模型基于Qwen3.5-4B架构开发,是业界首个专为自动驾驶场景设计的视觉语言基础模型,标志着自动驾驶技术向多模态融合方向迈出重要一步。
据研发团队介绍,Qwen-Drive-1.0在预训练阶段创新性地整合了3D空间感知与视觉问答能力,并将运动规划模块纳入统一框架。这种设计既保留了原始视觉语言模型(VLM)的核心架构,又通过分阶段训练策略实现了驾驶专项能力的突破。训练过程中,模型同时吸收了公开驾驶数据集与通用视觉语言数据,确保在具备场景理解能力的同时,维持对日常视觉指令的响应准确性。
该模型采用双专家系统架构,包含监督微调(SFT)与强化学习(RL)两个规划模块。官方评测显示,其在3D目标检测、驾驶场景语义解析、通用视觉问答等任务中表现优异,更在开环轨迹预测、伪闭环决策和真实闭环驾驶等复杂场景下验证了可靠性。特别值得注意的是,强化学习版本通过优化人类偏好对齐机制,在显著提升闭环安全性的同时,仅产生极小的轨迹位移误差。





京公网安备 11011402013531号