Daily Technical Tracking

每日科技追踪 · 2026-9-4

2026年9月4日(周五) · 产品追踪

每日追踪
← 返回首页

Qwen-Drive-1.0-4B开源自动驾驶VLM

Qwen 团队开源 Qwen-Drive-1.0-4B,首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一 3D 感知与视觉问答并扩展至运动规划。

模型定位

2026 年 9 月 4 日,Qwen 团队在魔搭 ModelScope 社区开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。这是首个面向自动驾驶的视觉语言基础模型。

技术要点

  • 在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划。
  • 保持预训练 VLM 的原始架构不变,不因引入驾驶能力而破坏通用视觉语言能力。
  • 采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。

为什么值得关注

过往的自动驾驶模型往往把感知、问答与规划切分为多个独立模块,或在引入驾驶能力后牺牲通用理解能力。Qwen-Drive-1.0-4B 在单一 VLM 架构内统一三类任务,并明确保留通用视觉与指令跟随能力,意味着一个 4B 规模的模型就有可能同时充当驾驶场景的理解接口与决策底座。

同日魔搭社区还更新了多项内容,包括“推理成本降低 96%、保持高精度:PyroDash 用一次交接重新定义 AI 推理”,以及 Spark-X2.5 开源的 4B 与 1.7B 智能体模型等。