资讯🔥7.0
阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型
📋总体概括
阿里千问本周开源Qwen-Drive-1.0-4B,官方称其为首个面向自动驾驶的视觉语言基础模型。该模型基于Qwen3.5-4B构建,在预训练阶段统一3D感知与视觉问答,并扩展至运动规划,保留原始VLM架构。模型采用分阶段训练,结合驾驶监督与通用视觉语言数据,提供SFT和RL两个规划专家,仅用公开数据统一轨迹格式构建规划样本,评测覆盖3D感知、驾驶场景理解及开环、伪闭环、闭环运动规划。RL版本以微小开环误差代价换取偏好对齐与闭环安全性提升,对自动驾驶研发社区具有开源参考价值。
⚡关键信息
- ▸阿里千问开源Qwen-Drive-1.0-4B,官方称其为首个面向自动驾驶的视觉语言基础模型,基于Qwen3.5-4B构建。
- ▸预训练阶段统一3D感知与视觉问答并扩展至运动规划,同时完整保留预训练VLM的原始架构。
- ▸模型提供SFT和RL两个规划专家,采用分阶段训练以兼顾驾驶能力与通用视觉理解、指令遵循能力。
- ▸仅使用公开来源数据构建规划样本,统一各数据集轨迹格式,覆盖开环、伪闭环、闭环全链路评估。
- ▸RL训练以微小开环位移误差为代价,换取人类偏好对齐和闭环安全性的全面提升。
🔥犀利点评
「首个自动驾驶VLM基础模型」这顶帽子更多是营销话术,Wayve等玩家早有布局,千问赢在开源和4B的小身板。真正值得肯定的是只用公开数据、统一轨迹格式、覆盖闭环评测这套做法——可复现、可比较,比一堆闭源PPT强。但4B模型做闭环驾驶,离上车还差十万八千里,别指望它替代规控栈。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →