当前位置: 首页 » 资讯 » 新科技 » 正文

阿里千问开源Qwen-Drive-1.0-4B:自动驾驶视觉语言模型新突破

IP属地 中国·北京 编辑:大力财经 头部财经 时间:2026-09-06 21:10:52

阿里千问团队近日宣布,其最新开源的自动驾驶视觉语言模型Qwen-Drive-1.0-4B正式亮相。该模型基于Qwen3.5-4B架构开发,是业界首个专为自动驾驶场景设计的视觉语言基础模型,标志着自动驾驶技术向多模态融合方向迈出重要一步。

据研发团队介绍,Qwen-Drive-1.0在预训练阶段创新性地整合了3D空间感知与视觉问答能力,并将运动规划模块纳入统一框架。这种设计既保留了原始视觉语言模型(VLM)的核心架构,又通过分阶段训练策略实现了驾驶专项能力的突破。训练过程中,模型同时吸收了公开驾驶数据集与通用视觉语言数据,确保在具备场景理解能力的同时,维持对日常视觉指令的响应准确性。

该模型采用双专家系统架构,包含监督微调(SFT)与强化学习(RL)两个规划模块。官方评测显示,其在3D目标检测、驾驶场景语义解析、通用视觉问答等任务中表现优异,更在开环轨迹预测、伪闭环决策和真实闭环驾驶等复杂场景下验证了可靠性。特别值得注意的是,强化学习版本通过优化人类偏好对齐机制,在显著提升闭环安全性的同时,仅产生极小的轨迹位移误差。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。