让 AI 拥有身体(机器人),在物理世界里「看 → 想 → 动」——感知环境、理解任务、做出动作并影响世界。区别于只在屏幕里输出文字 / 图片的 AI。
具身入门:给初学者的 5 分钟上手
写给谁:第一次接触「具身智能 / VLA / 世界模型」,想要一条清晰路径而不是一上来啃论文的人。
🗺️ 想看可视化地图? → 学习路线图 · 多轨、带依赖关系的图形化路线(本页的可视化补充)
怎么用:先花 5 分钟读完本页建立全局观,再顺着「推荐学习路径」逐步深入——每一步都链到本站对应的细读 / 专题。 不灌水承诺:本页只做概念解释与导航,不堆砌数字;所有量化结论请到对应细读里看(本站统一用 ⚠️ 自评 / ✅ 已核 / 待核 三级标注,见 如何阅读本站)。
读图方式:具身智能可以先按「看见环境 → 理解任务 → 生成动作 → 预想世界变化」四个入口理解;VLA 与 WAM 的差别就藏在后两步里。
一、一分钟搞懂三个词
一类机器人「大脑」模型。输入摄像头画面 + 语言指令(如「把胡萝卜放进锅里」),直接输出机器人动作。可以理解成「能直接操作身体的多模态大模型」。
更前沿的一支。模型先在脑中想象「世界接下来会怎么变」,再据此决定动作——即联合建模「未来状态 + 动作」,而不只是直接出动作。详见 WAM 总览。
一句话串起来:具身智能是目标,VLA 是当下主流的实现路线,WAM 是「先想象再行动」的新范式。 本站就沿 VLA 与 WAM 两条主线展开。
二、核心概念速记
刚入门会反复遇到这些词,先混个脸熟(要深究点链接,完整术语见 术语速查表):
| 词 | 大白话 |
|---|---|
| 本体(embodiment) | 机器人的「身子」——单臂、双臂、人形、四足…… 同一个模型能跨不同本体就叫「跨本体」。 |
| 遥操作(teleoperation) | 人手动操控机器人采数据(像玩遥控),得到「示范轨迹」。精确但贵、慢。 |
| 模仿学习(imitation learning) | 让模型「照着人类示范学」——目前 VLA 的主力训练方式。 |
| 动作分块(action chunking) | 一次预测未来一小段连续动作(而非一步一停),更流畅、更适合高频控制。 |
| 扩散 / 流匹配(diffusion / flow matching) | 一类「生成连续动作」的方法,擅长表达多种可行做法,精度高。 |
| 仿真到真机(sim-to-real) | 先在仿真里廉价造大量数据 / 训练,再迁移到真实机器人;难点是「仿真与现实的差距」。 |
三、推荐学习路径(从这里开始)
按下面顺序走,由浅入深、由全局到细节:
- 把握全局 — 先读 VLA 发展深度调研报告(总报告),了解这条线从哪来、到哪去。
- 看懂奠基 — 读最早把「大模型 + 机器人」打通的三篇:RT-1 → RT-2 → OpenVLA。
- 连续动作怎么出 — 读 Diffusion Policy 与 π0,理解「扩散 / 流匹配生成动作」。
- 数据从哪来 — 读 具身数据全景:真机、人类视频、仿真合成如何凑成「数据金字塔」。
- 模型怎么训 — 读 具身模型训练全流程:预训练 → 协同训练 → 后训练 → 真机 RL 的整条流水线。
- 成绩怎么看 — 读 基准硬数据 + 速查,并记住「不要轻信单一基准分数」。
- 看前沿 — 想了解「先想象再行动」的新范式,进 WAM 世界-行动模型总览。
想按技术路线挑模型读?首页的「按技术路线浏览」卡片把论文按「离散 token / 连续扩散 / 混合 / 新范式」分好了,可对照本路径跳读。另有 时间线 帮你建立年代坐标。
四、怎么读本站(避免被「数字」误导)
机器人论文里大量成绩是提出方自评、未经第三方在统一条件下复现。本站对此有固定体例:
读表时优先看口径与标注,而非只看「谁分高」。详见 如何阅读本站。
五、新手常见疑问
VLA 和 ChatGPT 这类大模型什么关系?
VLA 大多站在预训练视觉-语言模型(VLM)肩上:复用其语义理解,再接上「动作」这一头。所以你对大模型的直觉大半能迁移过来。
为什么非要真机数据,不能全靠仿真?
仿真便宜可放大,但与现实有差距(尤其接触、力);真机数据精确却昂贵稀缺。主流做法是两者混合(见 数据全景)。
人形机器人 = 具身智能吗?
不等于。人形是一种本体;具身智能是让任意本体(单臂 / 四足 / 人形…)具备「感知-决策-行动」能力的智能部分。
完全没基础能看懂吗?
能。按上面的路径走,遇到生词查 术语表 即可;细读里的数学细节第一遍可跳过,先抓「问题—思路—结论」。

