具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

NEWS SPECIAL · 2026.06 · QWEN ROBOT

Qwen-Robot 系列专题

Qwen 团队连续放出 Qwen-RobotManipQwen-RobotNavQwen-RobotWorld 三篇机器人技术报告。它们不是简单的厂商专题,更像 Qwen-VLA 之后拆出来的三条工程化分支:操作、导航、世界模型。

3篇技术报告
2 + 1VLA 分支 + WAM 分支
38,100hManip 操作语料 ⚠️
8.6MWorld video-text pairs ⚠️
可信度提示三篇都是 2026 年 6 月的技术报告,极新、非同行评审。本文把 arXiv、官方博客、GitHub/项目页视为一手来源可核;但 LIBERO、RoboTwin、VLN、EWMBench 等性能数字均按作者自评处理,不做跨论文硬排名。

// 01 · 系列关系

从一个总命题,拆成三条工程分支

Qwen-VLA 是“一个模型覆盖操作、导航、轨迹预测”的总基座;Qwen-Robot 三篇把这个命题拆成更具体的系统模块。

// 02 · 三篇分别讲什么

同属 Qwen-Robot,但贡献点完全不同

VLA · 连续操作Qwen-RobotManip

把 Qwen-VLA 往机械臂操作推进,重点是多本体 state-action 对齐与操作数据规模化。

  • Qwen3.5-4B VL backbone + flow-matching DiT action expert。
  • 80 维 canonical state-action vector:左右臂、EEF、夹爪、灵巧手固定语义槽位。
  • camera-frame EEF delta 减少跨本体几何冲突。
  • human-to-robot synthesis 与开源机器人轨迹共同构成约 38,100 小时操作预训练语料 ⚠️。

判断:数据对齐是关键贡献,但最终目标仍是 manipulation policy。

VLA · 分层/导航Qwen-RobotNav

把 Qwen3-VL 改造成可被上层 agent 调用的导航执行器,输出 waypoint trajectory。

  • 统一 VLN、PointNav、ObjNav、Tracking、自动驾驶等任务。
  • 输出 K=8 个 waypoint,每个 waypoint 是 (x, y, theta)
  • task-adaptive observation encoding:task mode、视觉 token budget、时间衰减、相机权重、采样模式均可调。
  • 上层 planner 拆任务,Qwen-RobotNav 执行局部导航段。

判断:更像 System-1 navigation primitive / executor,不是通用操作 VLA。

WAM · 世界模型/数据引擎Qwen-RobotWorld

不直接输出机器人动作,而是把动作写成自然语言条件,从当前观测生成未来视觉轨迹。

  • 冻结 Qwen2.5-VL 作为 action / semantic encoder。
  • 使用 Wan-VAE + 60 层 double-stream MMDiT 生成未来视频 latent。
  • 构建 EWK:8.6M video-text pairs / 200M+ frames ⚠️。
  • 下游目标是合成数据、虚拟评测和规划先验,不是直接闭环控制。

判断:最接近世界模型 / 数据引擎。引用 benchmark 时不能解释为机器人成功率。

// 03 · 是否都是数据层工作

不是。更准确是“数据工程很重,但系统目标不同”

论文数据层权重模型/系统层权重一句话判断
Qwen-RobotManip数据对齐是关键贡献,但目标是操作策略。
Qwen-RobotNav重点是导航模型接口与 agentic execution。
Qwen-RobotWorld很高世界模型 + embodied video 数据引擎。

// 04 · 建议阅读顺序

按“总基座 → 操作 → 导航 → 世界模型”读

  1. Qwen-VLA理解“统一操作 / 导航 / 轨迹预测”的总模型命题。
  2. Qwen-RobotManip看操作数据如何对齐到统一 action space。
  3. Qwen-RobotNav看导航如何从单任务模型变成可配置 executor。
  4. Qwen-RobotWorld看 Qwen 系列如何用世界模型扩展数据、评测和规划。
  5. 知识图谱查看 Qwen-VLA 到三条分支的桥接关系。