摘要由 AI 生成
2026 年 9 月 6 日,阿里巴巴通义实验室正式开源 Qwen-Drive-1.0-4B 模型。该模型基于 Qwen3.5-4B 构建,是全球首个面向自动驾驶的视觉语言基础模型。其核心创新在于预训练阶段统一了 3D 感知与视觉问答能力,并扩展至运动规划,同时完全保留原始架构。模型采用分阶段训练方案,结合驾驶监督数据与通用视觉语言数据进行训练,提供强化学习(RL)和 supervised fine-tuning(SFT)两个规划专家。官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力以及开环、伪闭环和闭环运动规划。所有规划样本均源自公开数据并统一了轨迹格式。经过强化学习优化后,该模型在人类偏好对齐和闭环安全性方面得到全面提升,尽管以微小的开环位移误差为代价。
关键实体KEY ENTITIES
Qwen-Drive-1.0-4BQwen3.5-4B通义实验室阿里千问阿里巴巴
事件框架EVENT FRAME
产品发布
阿里巴巴
Qwen-Drive-1.0-4B
全球首款自动驾驶视觉语言模型开源
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-06
阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基…
阿里千问本周开源 Qwen-Drive-1.0-4B,这是首个面向自动驾驶的视觉语言基础模型。该模型基于 Qwen3.5-4B 构建,在预训练阶段统一了 3D 感知与视觉问答,并扩展至运动规划,同时完全保留原始架构。模型采用分阶段训练方案…
2 条报道
信号强度SIGNALS
关键词热度
- Qwen-Drive-1.0-4B2
- 阿里巴巴1
- 通义实验室1
- Qwen3.5-4B1
- 阿里千问1
全部报道(2)SOURCES
↗
9 月 6 日,阿里巴巴通义实验室正式开源 Qwen-Drive-1.0-4B 自动驾驶视觉语言模型。该模型基于 Qwen3.5-4B 构建,是全球首个面向自动驾驶的视觉语言基础模型。其创新性在于统一 3D 感知与视觉问答预训练,并扩展至运动规划,同时保留原 VLM 架构。评测覆盖 3D 感知、场景理解、通用视觉语言能力及开环/伪闭环/闭环规划。所有规划样本均来自公开数据,轨迹格式统一,强化学习后显著提升人类偏好对齐与闭环安全性。
↗
I
IT之家
zh
2026-09-06 17:15
阿里千问本周开源 Qwen-Drive-1.0-4B,这是首个面向自动驾驶的视觉语言基础模型。该模型基于 Qwen3.5-4B 构建,在预训练阶段统一了 3D 感知与视觉问答,并扩展至运动规划,同时完全保留原始架构。模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,提供 SFT 和 RL 两个规划专家。官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。Qwen-Drive-1.0 仅使用公开来源构建规划样本,统一了各数据集的轨迹格式。SFT 模型在所有基准上已具备竞争力;经过强化学习后,该模型以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。