Token导航 LogoToken导航TokenDH.com

阿里千问开源Qwen‑Drive‑1.0‑4B,面向自动驾驶的视觉语言基础模型面世

更新时间 2026-09-16来源 牛新网正文 490字阅读约 2分钟2 张图片

ITCOW牛新网 9月6日消息,阿里千问开源Qwen‑Drive‑1.0‑4B,该模型基于Qwen3.5‑4B打造,也是业内首个面向自动驾驶场景的视觉语言基础模型。

阿里千问开源Qwen‑Drive‑1.0‑4B,面向自动驾驶的视觉语言基础模型面世

模型预训练阶段统一处理3D感知、视觉问答任务,还拓展至运动规划能力,完整保留原有视觉语言模型架构。它采用分阶段训练方式,融合驾驶监督数据与通用多模态数据,在掌握自动驾驶相关能力的同时,依旧保有通用视觉理解、指令跟随能力。该版本同时提供SFT、RL两套规划专家,评测维度包含3D感知、驾驶场景理解、通用视觉语言能力以及开环、伪闭环、闭环运动规划。

阿里千问开源Qwen‑Drive‑1.0‑4B,面向自动驾驶的视觉语言基础模型面世

整套规划样本全部取自公开数据源,统一各类数据集轨迹格式,完成从开环预测到闭环驾驶的完整评估。SFT版本在各项基准测试已经具备不错竞争力;经过强化学习优化后,仅小幅增加开环位移误差,就显著提升人类偏好对齐水平与闭环行驶安全性。

开发者能够在GitHub、Hugging Face、ModelScope平台获取该模型相关资源。

文章导航

微信开源WeMM‑Embedding多模态嵌入模型,已在微信业务大规模落地
科大讯飞星火X2.5模型正式发布:293B‑A30B MoE,全国产平台训练
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多