具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

具身入门:给初学者的 5 分钟上手

写给谁:第一次接触「具身智能 / VLA / 世界模型」,想要一条清晰路径而不是一上来啃论文的人。

🗺️ 想看可视化地图?学习路线图 · 多轨、带依赖关系的图形化路线(本页的可视化补充)

怎么用:先花 5 分钟读完本页建立全局观,再顺着「推荐学习路径」逐步深入——每一步都链到本站对应的细读 / 专题。 不灌水承诺:本页只做概念解释与导航,不堆砌数字;所有量化结论请到对应细读里看(本站统一用 ⚠️ 自评 / ✅ 已核 / 待核 三级标注,见 如何阅读本站)。

GPT-IMAGE2 生成的具身入门概念图:机器人感知、语言理解、动作轨迹与未来预测四个入口

读图方式:具身智能可以先按「看见环境 → 理解任务 → 生成动作 → 预想世界变化」四个入口理解;VLA 与 WAM 的差别就藏在后两步里。


一、一分钟搞懂三个词

具身智能Embodied AI

让 AI 拥有身体(机器人),在物理世界里「看 → 想 → 动」——感知环境、理解任务、做出动作并影响世界。区别于只在屏幕里输出文字 / 图片的 AI。

VLA · 视觉-语言-动作Vision-Language-Action

一类机器人「大脑」模型。输入摄像头画面 + 语言指令(如「把胡萝卜放进锅里」),直接输出机器人动作。可以理解成「能直接操作身体的多模态大模型」。

WAM · 世界-行动模型World-Action Model

更前沿的一支。模型先在脑中想象「世界接下来会怎么变」,再据此决定动作——即联合建模「未来状态 + 动作」,而不只是直接出动作。详见 WAM 总览

一句话串起来:具身智能是目标,VLA 是当下主流的实现路线,WAM 是「先想象再行动」的新范式。 本站就沿 VLA 与 WAM 两条主线展开。


二、核心概念速记

刚入门会反复遇到这些词,先混个脸熟(要深究点链接,完整术语见 术语速查表):

大白话
本体(embodiment)机器人的「身子」——单臂、双臂、人形、四足…… 同一个模型能跨不同本体就叫「跨本体」。
遥操作(teleoperation)人手动操控机器人采数据(像玩遥控),得到「示范轨迹」。精确但贵、慢。
模仿学习(imitation learning)让模型「照着人类示范学」——目前 VLA 的主力训练方式。
动作分块(action chunking)一次预测未来一小段连续动作(而非一步一停),更流畅、更适合高频控制。
扩散 / 流匹配(diffusion / flow matching)一类「生成连续动作」的方法,擅长表达多种可行做法,精度高。
仿真到真机(sim-to-real)先在仿真里廉价造大量数据 / 训练,再迁移到真实机器人;难点是「仿真与现实的差距」。

三、推荐学习路径(从这里开始)

按下面顺序走,由浅入深、由全局到细节:

  1. 把握全局 — 先读 VLA 发展深度调研报告(总报告),了解这条线从哪来、到哪去。
  2. 看懂奠基 — 读最早把「大模型 + 机器人」打通的三篇:RT-1RT-2OpenVLA
  3. 连续动作怎么出 — 读 Diffusion Policyπ0,理解「扩散 / 流匹配生成动作」。
  4. 数据从哪来 — 读 具身数据全景:真机、人类视频、仿真合成如何凑成「数据金字塔」。
  5. 模型怎么训 — 读 具身模型训练全流程:预训练 → 协同训练 → 后训练 → 真机 RL 的整条流水线。
  6. 成绩怎么看 — 读 基准硬数据 + 速查,并记住「不要轻信单一基准分数」。
  7. 看前沿 — 想了解「先想象再行动」的新范式,进 WAM 世界-行动模型总览

想按技术路线挑模型读?首页的「按技术路线浏览」卡片把论文按「离散 token / 连续扩散 / 混合 / 新范式」分好了,可对照本路径跳读。另有 时间线 帮你建立年代坐标。


四、怎么读本站(避免被「数字」误导)

机器人论文里大量成绩是提出方自评、未经第三方在统一条件下复现。本站对此有固定体例:

⚠️ 自评提出方 / 厂商自报、未独立复现的数字或结论——采信需谨慎。✅ 已核经对抗式核查确认的事实。待核一手来源未给出、本站不靠记忆 / 常识补全的项。

读表时优先看口径与标注,而非只看「谁分高」。详见 如何阅读本站


五、新手常见疑问

VLA 和 ChatGPT 这类大模型什么关系?

VLA 大多站在预训练视觉-语言模型(VLM)肩上:复用其语义理解,再接上「动作」这一头。所以你对大模型的直觉大半能迁移过来。

为什么非要真机数据,不能全靠仿真?

仿真便宜可放大,但与现实有差距(尤其接触、力);真机数据精确却昂贵稀缺。主流做法是两者混合(见 数据全景)。

人形机器人 = 具身智能吗?

不等于。人形是一种本体;具身智能是让任意本体(单臂 / 四足 / 人形…)具备「感知-决策-行动」能力的智能部分。

完全没基础能看懂吗?

能。按上面的路径走,遇到生词查 术语表 即可;细读里的数学细节第一遍可跳过,先抓「问题—思路—结论」。


继续

已读 0/124