GitVP开源文摘
全部文章/开源文摘

具身智能技术指南 Embodied-AI-Guide

[Lumina具身智能社区] 具身智能技术指南 Embodied-AI-Guide

作者TianxingChen 仓库TianxingChen/Embodied-AI-Guide ↗ 星标★ 16,307 字数98,515 许可NOASSERTION 阅读1
GitHub 原文 ↗
摘要社区主页:lumina-embodied.ai。扫描下方二维码加入交流群;如果二维码失效或无法入群,请邮件联系 lumina.embodiedai@gmail.com,或添加项目发起人微信 `TianxingChen_2002`(请备注:机构 + 姓名 + 来意)。

具身智能技术指南 Embodied-AI-Guide

国内最热门的具身智能技术指南 一份偏「百科全书」定位的具身智能中文知识库与资料索引

从这里开始 · 动手学习 · 认知资料 · 算法篇 · 基础设施篇 · 控制篇 · 硬件篇

GitHub repo stars  Visitors  PRs Welcome  License

📚 本项目希望帮助新人快速建立领域认知:以一个实践项目带大家动手入门具身智能,同时以百科全书的形式梳理当前具身智能涉及的主要技术,让大家清楚不同技术能解决什么问题,未来想深入时有头绪。 欢迎 Star / 分享 / 提 PR。合作与交流可邮件联系 lumina.embodiedai@gmail.com,或添加项目发起人微信 TianxingChen_2002(请备注:机构 + 姓名 + 来意)。

📢 News|项目进展

📝 2026-01-15: Embodied-AI-Guide 完成内容重组

⭐️ 2025-12-18: GitHub Stars 突破 10,000

❤️ 2025-03-15: Embodied-AI-Guide 正式开源

⭐️ Lumina Call(具身智能招聘):website

⭐️ Datawhale every-embodied(具身智能入门教程):repo

🦉 Lumina 具身智能社区

社区主页:lumina-embodied.ai。扫描下方二维码加入交流群;如果二维码失效或无法入群,请邮件联系 lumina.embodiedai@gmail.com,或添加项目发起人微信 TianxingChen_2002(请备注:机构 + 姓名 + 来意)。

Lumina 具身智能社区

🐣 (1) Start From Here —— 从这里开始

具身智能是指一种基于物理实体进行感知和行动的智能系统,其通过智能体与环境的交互获取信息、理解问题、做出决策并实现行动,从而产生智能行为和适应性。

说得更直白一些:大模型已经能很好地处理文字和图像,因为互联网上有海量现成数据;但要让机器人真的伸手把桌上的杯子拿起来,模型必须输出连续的、有物理后果的动作,而这类数据没法从网上爬——每一条都要有人用真机采,采错了还会把东西打碎。这个「数据从哪来、动作怎么表示、做得好不好怎么衡量」的三连问,构成了具身智能当前最核心的矛盾,也是本指南反复出现的主线。

(1.1) How —— 如何使用这份指南

本项目的设计理念是「一条主线 + 一张全景图」:

  • 一条主线:用第 2 章的实践教程,让你在一周内亲手跑通一个操作策略的完整流程;
  • 一张全景图:用第 3 ~ 7 章以百科全书的形式覆盖算法、基础设施、控制与硬件,帮助你判断每项技术解决什么问题、值不值得深入。

建议的阅读顺序:先动手跑通第 2 章,再按兴趣检索后续章节,不必按顺序通读。

(1.2) 学习路线建议(按背景选择起点)

不同背景的读者不必从同一处入手,可参考下表选择起点:

你的背景建议起点推荐路径
完全新手 / 在校本科生第 2 章 动手教程(2) 跑通流程 → (3) 建立认知 → (4) 算法篇 → 按兴趣深入
有 CV / NLP / 深度学习基础第 4 章 算法篇(4) 重点看 Robot Learning 与 VLA → (5) 基础设施 → (2) 动手验证
有自动化 / 机器人学背景第 4 章 算法篇(3) 了解版图 → (4) 补齐学习与决策 → (5) 熟悉仿真与数据生态
偏硬件 / 嵌入式第 7 章 硬件篇(7) 硬件篇 → (6) 控制篇 → (2) 动手教程
想快速了解行业与选题第 3 章 认知资料(3.1) 方法论 → (3.5) 论文列表 → (3.6) 年度趋势

(1.3) 术语速查表

阅读论文与本指南时高频出现的概念,先建立字面认知即可,细节留给对应章节。

展开术语速查表(20 条)
术语一句话解释
Manipulation / Locomotion操作(用手臂改变环境)与移动(用腿或轮子移动本体),具身智能的两条主线
Policy(策略)从观测到动作的映射,也就是日常所说的「模型」
IL / BC(模仿学习 / 行为克隆)从人类演示数据中以监督方式学习动作
RL(强化学习)通过与环境交互并依据奖励信号来优化策略
VLA(Vision-Language-Action)直接把图像与语言指令映射为机器人动作的端到端模型
VA(Vision-Action)只用视觉、不接受语言指令的策略;任务固定时比 VLA 更轻更快
World Model(世界模型)学习「当前状态 + 动作 → 下一步观测」的模型,可用来在脑内推演
WAM(World-Action Model)先用世界模型预测接下来会看到什么,再从预测中解出动作的一类策略
Teleoperation(遥操作)人通过手柄、动捕或主从设备操控机器人,是真机数据采集的主要手段
Demonstration(演示 / 轨迹)一次完整的任务执行记录,通常包含观测、动作与时间戳
Sim2Real Gap仿真与真实世界在物理、渲染、噪声上的差异,会导致策略迁移掉点
Real2Sim把真实场景与物体重建进仿真,用于缩小 Sim2Real Gap
Affordance(可操作性)物体上「可以被怎样操作」的区域或方式,如把手可抓、按钮可按
DoF(自由度)机器人可独立运动的关节数量
End-effector(末端执行器)机械臂末端的执行部件,如夹爪、吸盘、灵巧手
FK / IK(正 / 逆运动学)由关节角求末端位姿 / 由末端位姿反解关节角
URDF描述机器人连杆、关节与惯量的 XML 格式,是仿真与控制的通用输入
MPC(模型预测控制)在滚动时域内反复求解优化问题来生成控制量
WBC(全身控制)把控制目标从机械臂末端扩展到躯干、腿、头等整个身体,人形机器人方向常用
SLAM同时定位与建图,让机器人知道「自己在哪、周围长什么样」

(1.4) 新人常见问题

展开:入门前最常被问到的 6 个问题

Q:需要什么前置基础? A:会用 Python、了解深度学习基本概念(会训练一个分类网络即可)、能在 Linux 上装环境。机器人学与控制论不是前置条件,可以在遇到问题时按需补,参考控制篇开头的「要学到什么程度」。

Q:没有真机器人,还能做具身智能吗? A:能,而且大多数人都是这么开始的。仿真器 + 公开数据集足以支撑从入门到发论文的完整链路,本指南第 2 章就是纯仿真的。真机的价值在于暴露仿真掩盖掉的问题(标定误差、延迟、接触不确定性),但它应该是第二步而不是第一步。如果确实想碰真机,LeRobot 生态的 SO-101 主从臂是目前最低成本的入口。

Q:需要什么显卡? A:训练 ACT、Diffusion Policy 这类轻量策略,16GB 显存够用(本指南第 2 章的教程约需 12GB)。微调 π0、GR00T 这类 VLA 基座通常需要 40GB 以上,或使用 LoRA 等参数高效方法。仅做推理部署时要求低得多,部分模型可在消费级显卡上运行。

Q:该先做操作(Manipulation)还是运动(Locomotion)? A:看你更接近哪边。有 CV / 深度学习背景的人在操作方向上手更快,因为它本质是「带动作输出的监督学习」;有控制、自动化背景的人往往在运动控制方向更有优势,因为它高度依赖仿真中的强化学习与 Sim2Real。两者的技术栈差异比想象中大,建议先选一个做深。

Q:具身智能和传统机器人学是什么关系? A:不是替代关系。传统机器人学提供几何、动力学与控制的底座,保证系统稳定可控;具身智能在其上用学习的方法解决「感知复杂世界、泛化到没见过的任务」这类传统方法难以手工设计的部分。真实系统几乎都是二者的混合。

Q:现在入场是不是太晚了? A:相比语言模型,具身智能远没有收敛——数据、评测、本体三个层面都还没有公认答案。2026 年公认的瓶颈已经从模型架构转向数据配方与评测协议(见算法篇 (5.4)),这意味着不依赖超大算力的研究空间依然很多。

(1.5) About Us —— 关于我们

我们是一个由具身智能初学者组成的团队,希望以自己的学习经验为后来者提供帮助,加快具身智能的普及。欢迎更多朋友加入项目,也欢迎交友与学术合作。有任何问题可联系邮箱 chentianxing2002@gmail.com。

Contributors

⚒️ (2) 动手学习具身智能操作

目标:以 RoboTwin 2.0 为例,完整走通一次操作策略的「生命周期」——读论文建立认知、装环境、拿数据、训练 ACT、跑评测。这条链路本身是通用的,换成别的平台也是同样几步。 前置条件:一块显存不低于 16GB 的显卡(ACT 训练约需 12GB)。官方建议数据采集与策略评测避开 A / H / V 系列显卡,详见 Common Issue。

(2.1) 为什么选择这个教程

具身智能操作是一个复杂的系统问题,可以拆成三个核心环节:

  • 数据从哪来:常见来源包括真机采集、人类视频、仿真合成与世界模型合成,各有短板——真机采集成本高、人类视频信息含量低、仿真合成面临 Sim2Real Gap 与 Scale-up 难题、世界模型合成存在幻觉;
  • 策略怎么设计:网络架构的选择直接影响模型表现、收敛效果与推理速度;
  • 怎么评测性能:没有科学的评测,就无法判断模型好坏,也难以推动技术进步。

面对以上问题,RoboTwin 2.0(ICML 2026)提供了一个很好的学习平台。它基于易配置的 SAPIEN 仿真平台开发,提供 50 个双臂任务的自动化数据合成与统一评测系统,并已开源 10 万条以上预采集轨迹——这意味着新手可以跳过最耗时的数据采集环节,直接从训练开始。

需要注意的是,策略侧的代码现在放在 XPolicyLab 这个子模块里,训练和评测脚本都从那里调用,所以下面的步骤会用到它。它把不同策略的训练与评测收敛到了同一套接口,对学习者的实际好处是:走完一遍 ACT 之后,想换成 π0、RDT-1B 这类 VLA 试试,主要改的是策略名和配置文件,不用从头再理解一套工程。

过程中建议多看合成数据与评测回放视频,以建立对数据分布和策略失败模式的直觉。

(2.2) 学习流程

RoboTwin 2.0:代码|主页|文档|论文

XPolicyLab(策略侧代码):代码|文档

任务与榜单:50 个双臂任务说明|Leaderboard

跑完之后可以看看:RoboDojo(仿真 + 真机统一评测)|RMBench(记忆依赖操作)

(2.2.1) 了解 RoboTwin 2.0 做了什么(约 1 天)

阅读 RoboTwin 2.0 论文,了解仿真数据合成的方案,深入理解合成一条机器人数据需要哪些信息、机器人可以完成什么任务,并了解 ALOHA 硬件。

(2.2.2) 安装平台(约 0.5 天)

按安装文档配置环境,整个过程约 20 分钟。注意 XPolicyLab 现在是 RoboTwin 的 Git 子模块,克隆时必须递归拉取,否则后续训练与评测会缺文件:

# 全新克隆
git clone --recurse-submodules https://github.com/RoboTwin-Platform/RoboTwin.git
cd RoboTwin

# 若此前已克隆过,补拉子模块即可
git submodule update --init --recursive XPolicyLab

(2.2.3) 准备数据(约 0.5 天)

官方已开源 10 万条以上轨迹,推荐直接下载,可以省掉数小时的采集时间。下面只取本教程用到的 beat_block_hammer 任务:

# 只下载指定任务;不传参数则下载全部任务
bash scripts/download_xpolicylab_data.sh beat_block_hammer

数据会落在 data/demo_clean/<task_name>/aloha_agilex/data/。

只有当你需要自定义任务配置、域随机化或更换机器人本体时,才需要自己采集。采集脚本会先搜索能成功完成任务的随机种子,再回放种子录制轨迹:

bash collect_data.sh ${task_name} ${task_config} ${gpu_id}

# Clean Data Example
bash collect_data.sh beat_block_hammer demo_clean 0

# Randomized Data Example
bash collect_data.sh beat_block_hammer demo_randomized 0

自采数据落在 data/<task_config>/<task_name>/<embodiment>/data/,已经是 XPolicyLab 轨迹格式,不需要额外转换。想理解 demo_clean 与 demo_randomized 的差别,可读域随机化文档。

⚠️ 读取 HDF5 里的图像时只能用 XPolicyLab.utils.process_data.decode_image_bit。自己写 cv2.imdecode 或 PIL 解码会因为历史数据版本的布局差异而静默颠倒 RGB 通道,这是最容易踩、也最难排查的坑。

(2.2.4) 训练 ACT 策略(约 1 天)

ACT 是非常经典的操作策略算法,适合作为第一个复现对象,训练大约需要 12GB 显存。策略适配器位于 XPolicyLab/policy/ACT/,XPolicyLab 里所有策略都遵循同一套生命周期脚本:

cd XPolicyLab/policy/ACT
bash install.sh                                  # 安装策略侧运行环境
bash process_data.sh <bench_name> <ckpt_name> <env_cfg_type> <action_type>
bash train.sh <bench_name> <ckpt_name> <env_cfg_type> <action_type> <seed> <gpu_id>

同一套参数命名会贯穿数据处理、训练与评测,中途不需要改名:bench_name 取 RoboTwin;ckpt_name 是本次训练的简称,例如 act_demo;env_cfg_type 用 arx_x5(对应 RoboTwin 默认的 aloha-agilex 布局);action_type 一般取 joint 或 ee。权重会落在 checkpoints/<bench_name>-<ckpt_name>-<env_cfg_type>-<action_type>-<seed>/。具体参数与显存要求以 ACT 适配器 README 为准。

(2.2.5) 评测策略并对照榜单(约 1 天)

RoboTwin 的所有评测都统一走 scripts/eval_policy.sh。调度器会为每个任务各起一个策略服务端和一个仿真器,任务列表与 GPU 配置写在 env_cfg/eval/all_tasks.yml——只想评单个任务的话,把 tasks 裁成一条即可:

bash scripts/eval_policy.sh multitask \
  --config env_cfg/eval/all_tasks.yml \
  --policy-name ACT \
  --ckpt-name <checkpoint> \
  --env-cfg-type arx_x5 \
  --policy-conda-env <policy_env> \
  --eval-env-conda-env <robotwin_env> \
  --action-type joint

加 --dry-run 可以只校验调度计划而不真正启动,结果默认写到 eval_result/multitask/。如果本机显卡不够,还可以把策略服务端放在远程机器、仿真器留在本地,用 --enable-remote 搭配 --policy-server-ip / --policy-server-port 连接,详见 XPolicyLab 文档。

跑完后把自己的成功率与 Leaderboard 上 ACT 的官方成绩对照(demo_clean 下约 56%)。差距过大通常说明数据量、训练轮数或 action_type 没对齐。

至此你已经完整走过一遍操作策略的生命周期。下一步最划算的动作是换个策略再跑一遍:把 --policy-name 换成 Pi_0、RDT_1B、GR00T_N17、X_VLA 中的任意一个,其余流程完全一致,这样能直观感受不同架构在同一任务上的差异。完整策略清单见 XPolicyLab 文档。

📄 (3) Useful Info —— 有利于搭建认知的资料

这一章用于快速建立对具身智能领域的整体认知,适合在系统学习算法、工程或硬件之前,用来了解技术版图、社区生态与研究脉络。

(3.1) 方向性与方法论资料

  • 具身智能基础技术路线(Yunlong Dong):bilibili
  • 斯坦福机器人学导论:bilibili
  • Cyber Nachos(偏系统与工程思维):website

(3.2) 社区与自媒体(长期跟进价值高)

中文(微信公众号) 石麻日记、Lumina 具身智能、机器之心、新智元、量子位、具身智能研究室、具身纪元、Human Five、Xbot 具身知识库、具身智能之心、自动驾驶之心、3D 视觉工坊、将门创投、RLCN 强化学习研究、CVHub

中文(小红书博主) WhynotTV、TianxingChen(陈天行)、穆尧_YaoMarkMu、许华哲 Harry、周博宇、高飞、李弘扬、朱政、丁琰、YY 硕、Mango-Man、RHOSLab #PI-李永露、正合时宜、心言任永亮、York Yang-Dyna Robotics、哲伦班长、吴翼、丁文超、陈思衡、韩晓光、梁俊卫

小红书上曾有一场 AI 学者 Ask Me Anything 活动,多位具身与机器人方向的老师在其中答疑,精华实录可作为寻找值得关注账号的线索。

社区与 wiki

  • Simulately(社区维护的仿真器 wiki,选仿真器时的第一站):website
  • 巨神研习社:website

英文 newsletter / 媒体 / 播客

  • Import AI(Jack Clark,偏政策与产业视角):newsletter
  • The Batch(DeepLearning.AI,综述性强、门槛低):newsletter
  • Ahead of AI(Sebastian Raschka,训练与实现细节):newsletter
  • Humanoid Daily(人形机器人行业日更):website|Machine Dawn:website
  • IEEE Spectrum Robotics:website|The Robot Report(偏商业化与供应链):website
  • TWIML AI Podcast:podcast|The Robot Brains(Pieter Abbeel 主持):podcast

(3.3) 实验室与学术生态

(3.4) 高质量会议与期刊(论文检索时重点关注)

机器人:Science Robotics, TRO, IJRR, JFR, RSS, RAL, IROS, ICRA, CoRL

计算机视觉:CVPR, ICCV, ECCV|机器学习:NeurIPS, ICML, ICLR|AI 与 NLP:AAAI, ACL

(3.5) 论文列表(长期跟进研究进展与选题调研)

  • Awesome Humanoid Robot Learning(Yanjie Ze):repo
  • Paper Reading List(DeepTimber Community):repo
  • Paper List(Yanjie Ze):repo
  • RoboScholar / Embodied AI Paper List(Tianxing Chen):repo
  • Awesome LLM Robotics:repo
  • Awesome Video Robotic Papers:repo
  • Awesome Embodied Robotics and Agent:repo
  • awesome-embodied-vla / va / vln:repo
  • Awesome Affordance Learning:repo
  • Embodied AI Paper TopConf:repo
  • Awesome RL-VLA for Robotic Manipulation(Haoyuan Deng):repo
  • Awesome Efficient-VLA for Robotic Manipulation(Weifan Guan):repo
  • Awesome Embodied Data:project|repo|arXiv

(3.6) 年度趋势总结

  • 1,228 篇 VLA 论文里的数据问题(2026.06,实证分析:VLA 论文量同比增长 5 倍):website
  • VLA 数据集 / 基准 / 数据引擎综述(2026.04):arXiv|repo
  • State of Robot Learning(Dec 2025):website
  • 许华哲 - 具身智能:2025 回望:website
  • 林天威 - 具身 VLA 的 2025:从 Demo 到通用的距离:website

🍎 (4) Algorithm —— 算法篇

完整内容:topics/algorithm.md

这一篇把具身智能中最常用的「算法能力栈」从下往上串了起来:底层是工程工具与几何、标定、控制这类决定系统能否稳定运行的基础;中层是视觉与多模态表征(2D/3D/4D、prompting、affordance),负责把复杂世界压缩成可泛化、可对齐、可被策略利用的中间表示;上层则是学习与决策(RL/IL、VLA、LLM + Planner、快慢系统),把感知与任务目标转成可执行动作,并逐步走向更长程、更通用、更可部署的系统形态。

🏋️‍♂️ (5) Infrastructure —— 软件基础设施篇

完整内容:topics/infrastructure.md

这一章关注的不是「具体某个模型」,而是支撑具身智能研究与系统落地的软件基础设施(Infrastructure)。仿真器决定你能构建怎样的世界,基准集决定你如何比较方法优劣,数据集决定模型最终学到什么样的行为分布。它们共同构成了具身智能中最容易被忽视、但最影响上限与复现性的部分。

🎮 (6) Control —— 控制篇

完整内容:topics/control.md

这一章并不是为了让你「立刻跑一个模型」,而是为具身智能系统提供稳定性、可解释性与工程底座。控制论保证系统在高频下不崩溃,机器人学提供几何与动力学约束,SLAM 与状态估计让机器人「知道自己在哪里」,ROS 与工程库则把理论变成可复现的系统。

🦾 (7) Hardware —— 硬件篇

完整内容:topics/hardware.md

具身智能硬件涵盖多个技术栈:嵌入式软硬件、机械设计、机器人系统集成与传感器等。它们知识面很杂,但共同目标只有一个:把「算法」变成真实世界里稳定可复现的系统。关于硬件学习,最有效的方式几乎永远是 从实践出发——先做出一个能跑起来的最小系统,再逐步扩展复杂度与可靠性。

🤝 Contributing —— 参与贡献

本项目由社区共同维护,欢迎任何形式的参与:

  • 补充资料:在对应篇章的 topics/*.md 中按现有条目格式追加,并尽量补上一句话说明这份资料解决什么问题;
  • 修正内容:发现失效链接、过时结论或表述错误,欢迎直接提 PR 或开 Issue;
  • 改进结构:对章节组织与学习路线有想法,欢迎在 Issue 中讨论。

提交 PR 前请确认:条目放在了语义最贴近的章节、链接可正常访问、格式与相邻条目保持一致。

👍 Citation —— 引用

如果这个仓库对你有帮助,欢迎引用:

@misc{embodiedaiguide2025,
  title = {Embodied-AI-Guide},
  author = {Embodied-AI-Guide-Contributors, Lumina-Embodied-AI-Community, Tianxing Chen},
  month = {January},
  year = {2025},
  url = {https://github.com/TianxingChen/Embodied-AI-Guide},
}

🏷️ License —— 许可协议

本项目采用 非商业使用(Non-Commercial Use) 协议:

  • 允许:个人学习、学术研究与其他非盈利用途;
  • 禁止:任何形式的商业使用,包括但不限于公司/企业内部使用、集成到收费产品或服务中,或用于任何营利目的。

详情请查看仓库中的 LICENSE 文件。如需商业授权(例如在公司产品或商业项目中使用),请联系项目负责人:chentianxing2002@gmail.com。

⭐️ Star History —— Star 历史

Star History Chart

🤝 Sponsors —— 支持机构

感谢 无界智航、超维动力、香港大学 MMLab、地瓜机器人、松灵机器人 对本项目的支持。

Sponsors


algorithm

Embodied-AI-Guide
算法篇

这一篇把具身智能中最常用的「算法能力栈」从下往上串了起来:底层是工程工具与几何、标定、控制这类决定系统能否稳定运行的基础;中层是视觉与多模态表征(2D/3D/4D、prompting、affordance),负责把复杂世界压缩成可泛化、可对齐、可被策略利用的中间表示;上层则是学习与决策(RL/IL、VLA、LLM + Planner、快慢系统),把感知与任务目标转成可执行动作,并逐步走向更长程、更通用、更可部署的系统形态。 🌱 怎么读这一章:它是索引而非教材,不必从头读到尾。如果你是新人,建议先看 (3) Robot Learning 建立学习路线、再看 (5) VLA 了解当前主流,其余章节等你真正需要时再回来检索。

(1) Common Tools —— 具身智能中的常用工程工具

这一部分聚焦于具身智能项目中高频出现、工程上「绕不开」的工具与技巧。它们往往不是算法论文的核心贡献,但却决定了一个系统能否真正跑起来、跑稳定、跑到可复现。

在大多数真实或仿真项目中,你会反复遇到三个问题:点云如何处理、相机和机械臂如何对齐、目标位姿如何转成可执行动作。这些问题一旦处理不当,误差会在后续学习与评测阶段被持续放大——而且极难排查,因为模型不会报错,只会「表现得差一点」。

类别工具/主题链接简要说明
点云处理点云降采样link随机 / 均匀 / FPS / 法线空间等方法,直接影响 3D 感知质量
标定手眼标定handeye-calib|EasyHeC确定相机–机械臂 / 相机–相机相对位姿
控制 / 规划IK / 运动规划cuRobo从目标位姿求解关节状态,工程中非常常见

手眼标定几乎是所有真机项目的起点。 它要回答的问题很朴素:相机看到「杯子在我右前方 30 厘米」,机械臂怎么知道该把手伸到哪?你需要在相机坐标系和机械臂基座坐标系之间求出一个固定的变换矩阵。按相机装在哪里分两种情况:

  • Eye-in-Hand(眼在手上):相机装在机械臂末端,跟着手一起动,视角灵活但每帧都要用当前关节角换算;
  • Eye-to-Hand(眼在手外):相机固定在外部三脚架或支架上,标定一次即可,是大多数数据采集平台的做法。
⚠️ 标定误差是新人最容易忽略的系统性问题:标定差 5 毫米,策略在仿真里完美、到真机上就总差一点抓不准,而你会误以为是模型不行。换过相机位置、拆装过机械臂、甚至只是撞了一下支架,都要重新标定。

围绕这些基础问题,社区已经沉淀了一套相对稳定的组件生态:

用途常用选择
点云 / 几何处理Open3D(Python 友好,首选)、PCL(C++,功能最全)
机器人中间件 / 规划ROS 2、MoveIt 2、mplib(轻量、不依赖 ROS)
视觉标记(提供已知参考位姿)AprilTag、ArUco(OpenCV 内置)
点云配准ICP(Open3D / PCL 均内置)、TEASER++(对外点鲁棒)

小结:Common Tools 并不是为了「提升指标」,而是为了降低系统不确定性。在具身智能中,工程可靠性本身就是一种隐含的性能——一个标定准确、时间同步、数据格式干净的平庸模型,常常打得过一个跑在脏数据上的先进模型。


(2) Vision Foundation Models —— 视觉基础模型在具身智能中的角色

近年来,大规模视觉基础模型已经成为具身智能系统的重要感知支柱。它们并不直接输出动作,但通过提供高质量、具有语义一致性的视觉表征,显著降低了下游任务(检测、分割、跟踪、位姿估计、操作规划)的难度。

对新人来说,这一节最实用的读法是把它当工具箱目录:先看清楚每个模型「输入什么、输出什么」,等你在项目里遇到对应需求时再回来取用。它们在具身系统中通常以两种方式出现——要么作为策略的视觉编码器(冻结权重,提特征喂给动作头),要么作为独立的感知模块(先分割出目标、再把掩码或位姿传给下游规划)。

能力模型 / 工具链接简要说明
图文对齐CLIPlink图像–文本共享语义空间
表征学习DINO (v1/v2/v3)v1|v3高层视觉特征,对 correspondence 很有帮助;v3 是目前默认的稠密特征主干
分割SAM / SAM2link点 / 框提示分割,SAM2 支持视频
分割追踪SAM3link图像与视频级持续分割
3D 重建SAM3Dlink资产 / 场景 / 人体重建
开放词表检测Grounding-DINOlink文本驱动目标检测
检测 + 分割Grounded-SAMlink检测后分割,工程友好
位姿追踪FoundationPoselink物体 6D 位姿估计
深度估计Depth Anything v1/v2link单目深度预测
深度 + 位姿Depth Anything 3paper|repo单个模型同时出深度、相机位姿与 3D 高斯,输入可以是任意张数的图
前馈三维重建VGGT 系列VGGT-Ω|主页一次前向推理直接出几何,替代传统 SfM/COLMAP 流程
点云表征Point Transformer v3link点云特征学习
生成Stable Diffusionlink生成目标图像或中间表征
机器人 FMRDT-1Blink双臂操作基础模型
图文对齐SigLIPlinkCLIP 类模型

以 DINO 系列为例,它们并不是为「具身智能」设计的,但其学到的高层视觉表征在跨实例对应(correspondence)、关键点对齐、对象一致性等问题上泛化性很强——换句话说,它能认出「这个杯子的把手」和「另一个不同形状杯子的把手」是同一类部件。这种隐式的几何与语义一致性,正是操作任务最需要的。

在开放世界设置下,开放词表检测与多任务模型进一步减少了人工标注和任务定制成本:

方向常见选择
开放词表检测OWL-ViT、Detic
通用 / 交互式分割Mask2Former、SEEM
单目深度MiDaS、Depth Anything(见上表)

它们让系统不再局限于「训练时见过的类别」,而是可以通过语言或提示动态指定目标——这一点在家庭场景、长期自主与多任务系统中尤为关键。

🌱 选型时的三条经验: 1. 需要语义就用 CLIP / SigLIP,需要几何对应就用 DINO。两者常常一起用。 2. 分割模型是「有提示才工作」的:SAM 系列需要你先给出点、框或文本,它本身不知道你要哪个物体,所以工程上常见 Grounding-DINO(文本找框)+ SAM(框转掩码)的组合。 3. 单目深度是相对深度,不是米。Depth Anything 这类模型输出的深度需要额外尺度对齐才能用于抓取,直接拿来算三维坐标必然出错——需要精确尺度时请用 RGB-D 相机。

2026 年的两个变化

(1) 几何重建从「流程」变成「一次前向推理」。 过去要知道相机在哪、场景几何长什么样,得跑一整套 SfM / COLMAP 流水线,慢且容易失败。以 VGGT 为代表的前馈式重建模型把这件事压缩成一次网络推理,直接输出深度、相机位姿与点图;Depth Anything 3 进一步把「任意张数输入图 → 深度 + 位姿」统一进单个普通 Transformer。对具身而言,这意味着空间几何正在变成一种可以随手调用的基础能力,而不再是一个需要单独搭建的子系统——也因此开始被直接接进 VLA 当作空间主干。

(2) 分割模型开始「听得懂概念」。 SAM 系列早期只能一次分割一个被提示的物体,SAM 3 引入了以短语或示例图为条件的概念级分割,可以一次找出并跟踪画面中所有符合描述的实例。这恰好对上了机器人最常见的需求:「把桌上所有的杯子都收走」。

⚠️ 一个需要泼冷水的事实:2026 年多个空间推理基准(如 OmniSpatial、MV-RoboBench)的共同结论是:前沿多模态大模型在涉及深度、遮挡关系与视角变换的空间问题上仍然大幅落后于人类,而且单视角基准上的好成绩并不能迁移到多视角。所以不要假设「接一个强 VLM 就解决了空间理解」——这仍是公认的开放问题,也是一个适合新人切入的研究方向。

小结:Vision Foundation Models 的核心价值不在于「替代控制」,而在于将复杂世界压缩成结构化、可泛化的感知表示。它们是当前具身智能从「任务特化系统」走向「通用系统」的关键一环。

(3) Robot Learning —— 机器人学习(从控制到策略)

机器人学习并不是单一方向,而是一条从经典控制(PID / MPC)到学习型策略(RL / IL)的连续谱。在具身系统中,很多「成功的方案」本质上是混合式:用控制与规划保证稳定性,用学习补足复杂感知与泛化能力。

新人最常问的第一个问题是「我该学强化学习还是模仿学习」。一个简化但实用的回答:

模仿学习(IL / BC)强化学习(RL)
数据从哪来人类演示(遥操作、动捕、视频)与环境交互试错,靠奖励函数打分
主要成本采集演示很贵,且质量参差设计奖励函数很难,交互次数极大
在哪里主导操作(Manipulation):桌面抓取、装配、叠衣服移动(Locomotion):四足行走、人形跑跳、无人机飞行
为什么操作任务奖励难写(「叠好了」怎么打分?),但人演示很自然运动任务奖励好写(别摔倒、跟上速度指令),但没法让人去演示怎么迈腿
🌱 给新人的路线:如果你的目标是操作,先学模仿学习,从 ACT 或 Diffusion Policy 开始,它本质上就是监督学习,一周内能跑通;等你发现模仿学习的天花板(演示里没有的情况一律不会),再补强化学习。如果你的目标是四足/人形运动控制,则相反,直接从 RL + 仿真并行采样入手。2025 年之后的主流做法是两者结合:先用海量演示预训练,再用 RL 后训练把成功率从「能做」推到「能用」,详见 (5.4)。

本节给出一组相对系统的入门资源,同时补充工程里最常用的策略基线与仿真/代码生态,方便你快速形成学习路线并落到可跑的实验。

模块资源链接说明
自主机器人课程ETH & TTIC & UdeM Robot Autonomy视频|网站Duckietown 平台贯穿感知-决策-控制闭环
MPC 入门华工机器人实验室:MPC 从公式到代码bilibili|代码从 PID 过渡到 MPC,含仿真与代码
RL 入门强化学习的数学原理(西湖大学)bilibili|书 + 代码数学推导体系化,适合打地基
DRL 速览Abbeel 6 Lectureslink六讲概览 DRL,快速建立框架
DRL 系统课Berkeley CS 185/285(原 CS285)网站|YouTubeLevine 主讲,内容详尽
DRL 中文课李宏毅强化学习link搭配实践(Gymnasium 等)较友好
模仿学习LAMDA:IL 简洁教程link结构清晰,入门友好
真实机器人 ILRSS 2024 Workshop 教程link从真实机器人监督学习的角度讲落地问题

为了尽快「跑通一个具身学习 pipeline」,工程上经常直接从成熟基线开始改:

轻量基线(新人起点)链接说明
ACT(Transformer Policy)repo|主页经典模仿学习基线,结构最简单,建议作为第一个复现对象
Diffusion Policyrepo扩散式动作生成,能表达多模态动作分布,实践中效果稳健
DP3(3D Diffusion Policy)repo引入 3D 点云表征,适配更复杂几何

到 2026 年,论文里的对照组已经不只是上面三个——开源的通用基座权重多到可以直接当基线用,微调一个现成基座往往比从零训练一个小模型效果更好:

开源基座链接说明
π0 / π0.5 / π0-FASTopenpiflow matching VLA 的参考实现,Apache-2.0,生态最成熟
GR00T N1.7repoNVIDIA 跨本体 VLA,Apache-2.0,含人形全身控制支持
RDT2paper|repo清华;靠规模化 UMI 手持数据实现对未见本体的零样本部署
WALL-OSSpaper|repoApache-2.0,视觉语言与动作双专家结构
X-VLArepo0.9B 的小模型,算力有限时的强基线

另一个活跃方向是用 RL 微调已经训好的策略。 纯模仿学习的天花板就是演示数据本身,而 RL 后训练能让模型从自己的失败里改进。由于主流 VLA 用 flow matching 生成动作、拿不到动作的对数概率,标准 PPO 没法直接套用,于是出现了一批绕开这一限制的方法:有的去优化喂给流模型的初始噪声(DSRL),有的在冻结基座之外学一个动作残差、再由 critic 决定用不用(EXPO-FT、SC-VLA),也有用最优传输改写 Q 学习的(OTQL)。这条线最有代表性的成果见 (5.4) 的 RECAP。

仿真与代码生态决定了你能否低成本迭代:同一算法在不同平台的「可用性」差异非常大。

方向推荐平台链接
操作(Manipulation)SAPIEN / RoboTwin、MuJoCo + robosuiteSAPIEN|RoboTwin
运动控制(Locomotion)Isaac Lab、MuJoCo Playground、mjlabIsaac Lab|Playground|mjlab
四足经典实现legged-gym(基于已停更的 IsaacGym,适合读代码学思路)repo
跨平台新选项Genesisrepo

选型的详细建议见基础设施篇,人形与四足的专门路线见控制篇 (4)。

小结:Robot Learning 的核心不是「选 RL 还是 IL」,而是用控制/规划保证稳定,用学习提升复杂感知下的泛化。建议先用成熟基线跑通数据 → 训练 → 评测闭环,再逐步替换关键模块——先让流程转起来,再谈换模型。


(4) LLM for Robotics —— 大语言模型在机器人中的应用

LLM 在机器人领域的价值,更多体现在高层语义理解与任务组织:把自然语言指令转成结构化计划,或者与传统规划器、3D 感知模块协作形成「可执行」的中间表示。需要强调的是:在多数可落地系统中,LLM 并不直接输出低层控制量,而是充当高层策略/规划器,或工具调用与代码生成器。

原因很实际:LLM 推理一次要几百毫秒到数秒,而机械臂的控制回路需要几十到上千赫兹。所以典型分工是——LLM 负责「做什么、按什么顺序做」,VLA 或传统控制器负责「怎么做」。

🌱 这一节和 (5) VLA 是什么关系? 它们是同一个问题的两种解法:本节是分层(LLM 规划 + 底层执行,模块清晰、可解释、易加安全约束,但接口设计费劲且误差会在层间累积);下一节的 VLA 是端到端(视觉语言直接映射到动作,泛化好、无需手工接口,但可解释性差、长任务容易跑偏)。2025 年之后两条路开始合流,产物就是 (5.2) 的「分层双系统 VLA」。新人可以先看 (5),本节作为背景理解。
方向代表资源 / 工作链接说明
综述 / 入门Robotics + LLM 系列link系列文章,适合快速扫全景
概念基础Embodied Agentlink具身智能体基本概念
Agent 综述Lilian Weng:AI Agent中文|英文讲清 Agent 系统常见范式
LLM 做高层规划PaLM-E / DIAC / LBYL / EmbodiedGPTPaLM-E|DIAC|LBYL|EmbodiedGPT用 LLM 做策略/规划或决策
统一高低层RT-2link将语言-视觉与动作更紧密地统一
LLM + PlannerLLM+P / AutoTAMP / Text2MotionLLM+P|AutoTAMP|Text2Motion结合传统规划器提高可执行性
Code 能力Code as Policy / Instruction2ActCaP|I2A用代码中间层提升可控性
3D 感知 + LLMVoxPoser / OmniManipVoxPoser|OmniManip3D 表征辅助规划与约束
多机器人协同RoCo / Scalable-Multi-RobotRoCo|Scalable多机器人协同规划

如果你更关心「离落地更近」的通用策略(而不是纯 LLM 规划),通常会与 VLA / 通用控制模型一起看:

更贴近落地的通用策略链接说明
OpenVLAlink|link通用操控策略代表作之一
Octolink|link强基线与工程化实现较完整

小结: LLM 在机器人里最可靠的定位通常是高层理解 + 规划 + 工具调用,与传统规划/约束或 VLA 低层执行配合,系统更可控、更可复现。


(5) Vision-Language-Action Models —— VLA 模型

VLA(Vision-Language-Action)可以理解为「把视觉-语言模型的能力直接延伸到动作空间」。与「VLM 做 planning」不同,VLA 的目标是更端到端:输入视觉与语言,输出可执行动作(或动作序列)。实现上通常涉及一个关键步骤:动作表示(Action Representation)——把连续控制量或轨迹转成模型可学习的 token / latent,并设计动作头(autoregressive、diffusion、flow 等)完成生成。

从实践角度看,VLA 的差异往往来自三件事: (1)动作如何表示与量化(例如 tokenizer / FAST / latent action) (2)训练数据与对齐方式(真实/仿真/合成,多机型/多任务) (3)系统形态(单模型端到端 vs 分层双系统,是否引入 planner、world model 等)

(5.0) 参考与综述

类型资源链接备注
Blog具身智能 Vision-Language-Action 的思考link
Blog具身智能 VLA 的思考(问答)link
Survey数据视角:数据集、基准与数据引擎 ⭐link|repo2026.04;持续更新,论证「数据基础设施才是瓶颈」
SurveyAction Tokenization 视角 VLA Surveylink|link2025.07.02
SurveyVLA for Embodied AI Surveylink2024.11.28

(5.1) 经典工作

这里内容较多,为了不拉长页面,使用折叠。需要时展开即可。
展开:经典 VLA 工作列表(按方向归类)
方向工作链接机构时间备注
AutoregressiveRT-1linkRT 系列起点
AutoregressiveRT-2link|linkGoogle DeepMind2023.0755B
AutoregressiveRT-TrajectorylinkGDM / UCSD / Stanford2023.11轨迹化输出
AutoregressiveAUTORTlinkGoogle DeepMind2024.01
AutoregressiveRoboFlamingolink|linkByteDance / THU2024.02
AutoregressiveOpenVLAlink|linkStanford2024.067B
AutoregressiveTinyVLAlink上海大学2024.11
AutoregressiveTraceVLAlink|linkMicrosoft2024.12输入 visual trace
Diffusion / FlowOctolink|linkStanford / Berkeley2024.05Octo-base 93M
Diffusion / Flowπ0link|linkStanford / PI3.3B;flow-based diffusion
Diffusion / FlowCogACTlink|linkTHU / MSRA2024.117B
Diffusion / FlowDiffusion-VLAlink华东师范等2024.12
3D Vision3D-VLAlink|linkUMass2024.033D-based LLM
3D VisionSpatialVLAlink|link上海 AI Lab2025.01Adaptive Action Grid
VLA-relatedFAST(π0)paper|repoStanford / Berkeley / PI2025.01动作 tokenizer
VLA-relatedRLDGlinkBerkeley2024.12用 RL 生成高质数据再蒸馏
VLA-relatedBYO-VLAlink|linkPrinceton2024.10运行时图像干预
场景扩展RDT-1B(双臂)link|link清华扩散式动作头
场景扩展QUAR-VLA(四足)link西湖 / 浙大2025.02.04
场景扩展CoVLA(自动驾驶)link|linkTuring2024.12
场景扩展Mobility-VLA(导航)linkGoogle DeepMind2024.07
场景扩展NaVILA(腿式导航)link|linkUCSD2024.12

(5.2) 分层双系统 VLA ⭐

2025 年起最有影响力的范式之一是「分层双系统」: System 2(慢系统)负责理解与规划(通常是 VLM/LLM),输出语言/符号/latent 的中间表示; System 1(快系统)负责高频、稳定的低层控制(VLA / policy),将中间表示转成连续动作。 它的直观优势是:在长任务与复杂场景中,把「推理/规划」与「高频控制」解耦,既提升可解释性,也更易做工程约束与安全策略。

维度常见差异点例子
架构形态单模型 vs 双模型Hi-Robot(VLM + VLA) vs π 系列(单模型范式)
通信方式指令 / 子目标 / latent vector中间表征粒度决定可控性与泛化
数据来源真实 / 仿真 / 合成不同数据组成直接影响鲁棒性
关注重点频率、任务跨度、跨本体人形/移动操作/长程任务等

同时也出现了不少「产业级 VLA/系统」,强调端到端能力与部署:

系统 / 产品链接时间备注
Figure:Helixlink2025.02.20上半身全身控制
智元:GO-1link2025.03.10ViLLA:VLM + MoE,vision-language-latent-action
Physical Intelligence(openpi)link
π0.5link2025.04.22高级任务分解 + 单模型低层执行
Hi Robotlink2025.02.26VLM 推理 + VLA 执行
NVIDIA:GR00T N1repo|paper2025.03.272B,全身控制,强调部署
Psi-R1(灵初智能)link2025.04.27分层端到端 VLA + RL,test-time scaling
Gemini Roboticslink2025.03.2550 Hz
Gemini Robotics on-devicelink2025.06.24设备端部署导向
Gemini Robotics(系列入口)link滚动更新最新一代见 (5.4) 的 Gemini Robotics 2

(5.3) 2025 年代表工作

展开:2025 年代表工作列表
工作链接机构时间备注
VQ-VLAlink|link上海 AI Lab 等2025.07.01VQ action tokenizer
WorldVLAlink|link阿里达摩院等2025.06.21VLA + World Model 统一
BridgeVLAlink|linkCASIA / ByteDance Seed 等2025.06.073D 对齐到 2D
TrackVLAlink|link北大等2025.05.29实时检测与导航
OneTwoVLAlink|link清华等2025.05.17推理与执行协同
UniVLAlink|link港大等2025.05.09潜在动作表征
MoManipVLAlink|link北邮 / NTU 等2025.03.17移动操作
TLAlink|link三星等2025.03.11引入触觉模态
PointVLAlink|link美的等2025.03.10点云微调 2D VLA
SafeVLAlink|link北大2025.03.05安全对齐
HybridVLAlink|link北大2025.03.17扩散 + 自回归统一
DexVLAlink|link美的 / 东南2025.02.09多 action head
DexGraspVLAlink|link北大2025.02.28灵巧手抓取
UP-VLAlink清华2025.02.03预测辅助
UniActlink|link清华通用动作空间
CoT-VLAlinkNVIDIA / StanfordCoT 融入 VLA

(5.4) 2026 进展 ⭐

前面几节的工作几乎都叫「某某 VLA」。但到 2026 年,动作模型的形态已经不止这一种,读论文时会频繁碰到几个新缩写。按动作是怎么生成的来分,大致是这几类:

家族动作从哪来直观理解代表工作
VLA(Vision-Language-Action)视觉 + 语言直接映射到动作看一眼、听指令、直接动π0 / π0.5、GR00T N1 系列、RDT-1B、OpenVLA
VA(Vision-Action)只吃视觉,不接受语言条件任务固定时更轻、更快ACT、Diffusion Policy 及其变体
WAM(World-Action Model)先用世界模型预测「接下来会看到什么」,再从预测中解出动作先在脑子里想一遍再动手入门可先读上一节的 WorldVLA;此后出现了 FastWAM、X-WAM 等专做此事的一类
记忆增强(Memory-Augmented)在策略内部显式维护跨时刻的记忆解决「我刚才把盖子放哪了」π0.6-MEM / π0.7(见下文);评测用 RMBench

还有一个和本体相关的常见缩写 WBC(Whole-Body Control,全身控制):把控制目标从「机械臂末端」扩展到躯干、腿、头等整个身体,是人形机器人方向的主线之一,详见控制篇 (4) 全身控制。2026 年起也常见「全身智能」(Whole-Body Intelligence)这个说法,主要来自 Gemini Robotics 2 的表述,指的是让同一个策略同时管规划与全身运动,目前更多是产品叙事而非公认术语。

这几个家族并不互斥。 实际论文里经常是叠加的——一个模型可以既是 VLA、又带世界模型预测、还加了记忆模块。所以看到新工作时,比记住它叫什么更有用的是问三个问题:动作表示是什么(连续回归 / 离散 token / 扩散)、条件里有没有语言、有没有显式预测未来。这三条基本就能定位它在上面这张表里的位置,也是复现时最先要搞清楚的三件事。

四个正在发生的变化

(1) 从「只学演示」到「从经验里学」。 纯模仿演示数据很容易停在「成功一半」的水平,再往上堆演示的边际收益迅速衰减。π\*0.6 提出的 RECAP 把演示、自主 rollout 与人工介入纠正混在一起做 RL(用 advantage 条件化绕开 flow matching 模型拿不到 action log-prob 的问题),在叠衣服、组装纸箱、做咖啡这类长任务上把吞吐翻倍、失败率减半。RL 后训练正在从加分项变成必选项,国内工作里 Hy-Embodied-0.5-VLA 的 FlowPRO 偏好优化、LingBot-VLA 的 RL 后训练都是同一思路。

(2) 记忆从可选模块变成架构的一部分。 长任务里「刚才把盖子放哪了」是硬需求。π0.6-MEM 与 π0.7 把记忆系统直接做进主干(对历史帧做时空压缩后输出固定数量 token),Hy-Embodied-0.5-VLA 也带了多帧历史的紧凑记忆编码器。评测侧有 RMBench 专测记忆依赖任务。

(3) 世界模型进入推理链路。 不再是「另做一个世界模型」,而是把未来预测嵌进策略内部:InternVLA-A1.5 用可学习的 foresight token 去查询未来动态、训练时由一个冻结的视频生成模型监督,推理时把视频分支丢掉以控制延迟;NVIDIA 的 GR00T N2 则直接建在 DreamZero 这套 World-Action Model 框架上。

(4) 从桌面延伸到全身。 Gemini Robotics 2(2026.07)是个明确的分水岭:此前几代基本是「上半身 / 桌面」模型,这一代开始控制完整人形——从脚到指尖,配套还拆成了三个模型(VLA 负责运动控制、ER 2 负责具身推理与多机协同、On-Device 2 负责本地部署)。

顺着这四条看,会发现竞争焦点已经从「架构」转向「数据配方 + 评测」。2026 年那篇数据视角的 VLA 综述把这点讲得很直接:未来的进展更多取决于数据引擎与评测协议的协同设计,而不是模型架构,因此应当把数据基础设施当作一等研究问题。

代表工作(2025 末 — 2026)

工作链接机构时间一句话看点
VLActpaper|repo|主页港中文 / 港科大 / 思谋2026.08表征驱动的继续预训练;只用开源数据 + 16 卡做出可复用动作主干
Gemini Robotics 2blogGoogle DeepMind2026.07全身智能;VLA / ER / On-Device 三模型分工
InternVLA-A1.5paper|repo上海 AI Lab2026.07foresight token 查询未来动态,由视频生成模型监督
Hy-Embodied-0.5-VLApaper|repo腾讯混元2026.06万小时级 UMI 数据 + 记忆编码器 + RL 后训练的完整栈
π0.7paperPhysical Intelligence2026.04可操控的通用基座;记忆 + 多模态上下文条件
Xiaomi-Robotics-0paper|repo小米2026.024.7B,面向实时执行;权重与后训练代码开源
LingBot-VLApaper|repo蚂蚁灵波2026.01两万小时多构型真机预训练;配套开源 GM-100 基准
UnifoLM-VLA-0repo宇树科技2026.01面向人形操作;强化空间语义的继续预训练
InternVLA-A1paper|repo上海 AI Lab2026.01把未来视觉状态与动作作为联合训练目标
π\*0.6(RECAP)paper|blogPhysical Intelligence2025.11演示 + 自主经验 + 人工纠正混合 RL,吞吐翻倍
GR00T N1.7 / N2repoNVIDIA2026N1.7 已商用早期接入;N2 转向 World-Action Model 架构

评测正在变严

一个容易忽略但很实际的变化:老基准开始饱和、且有记忆效应,光看 LIBERO 的数字已经不足以说明问题。因此出现了两类补充手段——一是更抗「刷分」的仿真基准(LIBERO-Plus 用七类扰动把 LIBERO 扩成一万多个任务并分五档难度、VLA-Arena 补上动态场景与安全约束、RoboDojo),二是真机分布式评测:RoboArena(论文)不再统一任务,而是让分布在多所机构的评测者自选场景、对策略做双盲两两对比,再聚合成排名。自己做实验时,至少报一个仿真基准 + 一个真机或第三方榜单会比只报单一数字可信得多。

🌱 新手建议:不要一上来就横向啃十几个 foundation model。更快的路径是先拿 ACT 或 Diffusion Policy 这类结构简单的基线,把「采数据 → 训练 → 在仿真里评测」这条链路完整跑通一遍(可以直接用主页第 2 章的实战教程),先建立起对数据格式、动作维度、评测指标的手感,再回头读 π0、GR00T 这类大模型的论文,会清楚很多。

去哪找可运行的实现? 这些模型的开源实现比较分散,两个地方能省不少事:LeRobot 提供了统一的数据集格式和多个策略的训练代码,它的数据格式目前基本是通用底座;XPolicyLab 把数十个策略收敛到了同一套部署接口,适合需要在同一批任务上横向对比多个模型的场景。

小结: VLA 从「把动作 token 化」一路走到了「能从自己的失败里改进」。如果只记一句话:2026 年拉开差距的不是 backbone,而是数据配方、RL 后训练与评测的可信度。落到做项目上,优先级大致是——先用 ACT / DP 跑通全链路,再挑一个开源基座(π 系列、GR00T、InternVLA-A 系列都有可用权重)做微调,然后把力气花在数据质量和一个诚实的评测协议上,而不是换更大的模型。

(6) Computer Vision —— 计算机视觉

具身智能几乎所有下游能力(抓取、操作、导航、交互)都建立在视觉之上。和纯 CV 不同,具身更关心的是:在变化的光照、遮挡、视角、运动模糊与跨域条件下,视觉表征是否稳定,以及它是否能与几何(深度/点云)和语言(指令/目标)对齐。本节将视觉按「2D → 3D → 4D(视频/时序)→ Prompting/可供性」串起来,便于你形成一条连续的学习路线。

课程/资源链接说明
CS231n(Stanford)link深度学习 CV 全景课,适合视频 + 讲义快速建立体系

(6.1) 2D / 3D / 4D Vision(从图像到时空)

为了不把页面拉得太长,这里把 2D/3D/4D 的资源合并成一个「能力栈表」。你可以按需选择深入方向。
层级关注点(具身视角)代表资源链接
2D Vision稳定表征与泛化:backbone、对比学习、生成式表征CNN 概念 / ResNet / ViT / SwinCNN|ResNet|ViT|Swin
2D Vision表征学习方法论:对比学习与大规模预训练对比学习综述link
2D/4D Gen生成式模型(用于表征、合成数据、目标图像等)自回归综述 / 扩散综述 / 扩散推导自回归|扩散|推导
3D Vision多视几何与三维理解(对重建/位姿/点云感知很关键)Andreas Geiger 3D Visionlink
3D Vision三维重建与理解(偏工程与应用)GAMES203link
3D/Gen2D/3D 生成方向梳理论文分类 / 2024 论文整理分类|2024
4D Vision视频理解:时序建模与跨帧一致性(具身中非常常见)开山之作 / 串讲 / 综述开山|串讲|综述
4D Gen视频/4D 生成(用于合成与世界建模相关)Lilian Weng 视频扩散博客 / 4D generation list博客|list

(6.2) Visual Prompting & Affordance Grounding

具身视觉的一个关键变化是:我们不只想识别物体,而是要回答「哪里能抓、怎么推、哪能开合」。 因此在工程系统里,视觉常常以两种形式进入控制: (1)通过 prompt / 标注把视觉模型「定向」到当前任务;(2)通过 affordance 将视觉输出直接变成可执行的交互区域或动作参数。

方向资源链接说明
Visual Prompting视觉提示综述linkPrompt 作为任务条件,连接视觉与决策
Visual PromptingPIVOTlink迭代式视觉问答,zero-shot 控制与空间推理
Visual PromptingSet-of-Mark(SoM)for GPT-4Vlink用可视标记提升可控性与对齐
维度工作/数据集链接说明
2D AffordanceCross-View-AG / AGD20Klink|link跨视角学习可供性 + 数据集
2D AffordanceAffordanceLLMlink借助 VLM/LLM 知识提升泛化
3D AffordanceWhere2Actlink铰接物体可供性与交互点
3D AffordanceVAT-Martlink铰接交互数据
3D AffordanceDeformableAffordance / UniGarmentManiplink|link柔性物体与服装等场景
3D AffordanceSceneFun3D / 3D AffordanceNetSceneFun3D|3D AffordanceNet室内环境 + 实物数据与点云可供性数据集

小结: 对具身而言,CV 不只是分类/检测,而是提供可用于交互与决策的稳定表征:2D 打底,3D 提供几何约束,4D 提供跨时间一致性,而 Prompting/可供性把视觉输出变成「可执行」的中间表示。


(7) Computer Graphics —— 计算机图形学(仿真、重建与可微渲染的入口)

图形学在具身中的价值通常体现在三类事情:(1) 仿真与渲染——让你低成本生成交互数据;(2) 重建——把现实转成可学习的资产;(3) 新型表示——NeRF / 3DGS 带来的可微与高效渲染,正在影响数据合成与世界建模。

这一节和 Real2Sim 密切相关:想让仿真里训出的策略在真机上也能用,最直接的办法是把真实场景和物体扫描重建进仿真器,而这正是图形学的工作。如果你的研究方向是仿真数据合成或 Sim2Real,这一节值得认真看;否则可以先跳过。

方向资源链接备注
图形学入门GAMES101link闫令琪老师
实时渲染GAMES202link
角色动画GAMES105linkmotion synthesis / animation
三维重建NeRF 原理代码讲解link
三维重建3DGS 原理代码讲解link
3D 预训练综述3D pre-training surveylink
3DGS + 机器人综述3DGS in Robotics surveylink

小结: 图形学更像「具身的数据与世界接口」:它决定了你能否把场景/资产做成可复现、可扩展、可规模化的训练资源。


(8) Multimodal Models —— 多模态模型(视觉×语言×时序的统一表征)

具身系统中常见的输入是视觉(RGB / 深度 / 点云)与语言(目标与约束),并且往往伴随强烈的时序依赖。多模态模型的核心作用是:把这些信息压缩成一个统一表征空间,使得系统能够在「看懂 + 听懂 + 记住」的前提下做决策与控制。

对具身智能而言,多模态模型最直接的意义是:几乎所有 VLA 都是在一个现成的 VLM 上接动作头改造而来的(π0 基于 PaliGemma、OpenVLA 基于 Prismatic / Llama 2)。因此理解 VLM 怎么把图像变成 token、怎么与语言对齐,是读懂 VLA 架构图的前提。

工作/项目链接说明
CLIPlink经典图文对齐工作(具身中常用作检索/对齐)
LLaVAlink多模态大语言模型经典工作
多模态生成综述link
VLM-R1linkOmAI Lab:R1-style 多模态强化学习(GRPO),强调比常规 SFT 更强

小结: 多模态并不是「把模态拼起来」,而是解决对齐与一致性:对齐让语言可控,一致性让跨时间的决策更稳定。


(9) Robot Navigation —— 机器人导航(任务、系统与生态)

机器人导航的本质是:智能体在已知或未知环境中,根据传感器输入(RGB / 深度 / GPS / IMU 等)与目标指令,输出一系列动作以到达目标。具身任务里,导航往往是更复杂操作的前置能力:先到达,再交互。

这里需要先区分一个容易混淆的概念:经典导航(SLAM 建图 + 路径规划,见控制篇)解决的是「在已有地图里怎么走过去」,而本节讨论的具身导航解决的是「在没见过的房子里,怎么找到我从没标注过的东西」——难点不在路径规划,而在语义理解与探索策略。

为了避免分类太碎,这里把导航组织为三层:任务形态 → 系统形态 → 代表工作与数据集生态。

(9.1) 任务形态(你到底在导航到什么)

任务类型目标怎么给核心难点
物体目标导航(Object-Goal Nav)一个物体类别,如「找到冰箱」没见过的房间里,该往哪个方向探索
图像目标导航(Image-Goal Nav)一张目标位置的照片跨视角匹配:从不同角度认出同一个地方
视觉-语言导航(VLN)一段自然语言路线指令把指令与沿途观测逐步对齐,走错一步就全错
需求驱动导航(Demand-Driven Nav)一个需求而非物体,如「我渴了」需要常识推理:先想清楚该找什么,再去找

(9.2) 系统形态(你如何把感知变成行动)

系统描述优势局限
端到端(E2E)直接从传感器输入映射到动作(RL/IL 等)简洁直接易过拟合、泛化挑战大
模块化(Modular)Mapping + Global Policy + Local Policy 等模块接口组合可解释、工程可控规则与手工设计仍限制通用性
零样本(Zero-shot)不训练或少训练,依赖 CLIP/LLM 等先验更接近迁移到真实场景推理慢、上限受限,常需再对齐

(9.3) 代表工作(按系统形态组织)

这里的工作可以作为「入门时的 anchor」,建议先读摘要 + 方法图建立直觉,再决定深入方向。
展开:端到端(E2E)
工作链接
Learning Object Relation Graph and Tentative Policy for Visual Navigationlink
VTNet: Visual Transformer Network for Object Goal Navigationlink
展开:模块化(Modular)
方法/简称工作链接备注
SemExpObject Goal Navigation using Goal-Oriented Semantic Explorationlink早期语义地图代表
PONIPotential Functions for ObjectGoal Navigation with Interaction-free Learninglinkpotential function + 语义地图预测
3D-aware3D-Aware Object Goal Navigation via Simultaneous Exploration and Identificationlink引入 3D 缓解 2D 语义图信息损失
展开:零样本(Zero-shot)
工作链接备注
CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigationlink用 CLIP 找目标,找到就走过去
L3MVN: Leveraging Large Language Models for Visual Target NavigationlinkLLM 决策「朝哪走」
ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigationlink语义地图 + 常识约束
SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigationlink在线构建场景图喂给 LLM

(9.4) 数据集与仿真生态(决定你能跑什么实验)

数据集/平台链接备注
Matterport3D(MP3D)link真实场景采集,规模大、难度高
Habitat-Matterport3D(HM3D)linkHabitat 生态核心数据
RoboTHORlink场景较小,仿真更轻量
AI2-THORlink与 RoboTHOR 同系,交互生态强
Gibson / iGibsonGibson|iGibson室内仿真常用,iGibson 加入了可交互物体;⚠️ 两者均已停止维护,新项目请用 OmniGibson
R2R(Room-to-Room)linkVLN 的起点数据集,逐句指令跟随
RxR(Room-across-Room)linkR2R 的多语言加强版,指令更长、路径更密
CVDNlink对话式导航:走不下去时可以向人提问
R2R、RxR、CVDN 都构建在 Matterport3D 之上,使用前需要单独签署 Matterport3D 的数据使用协议。

(9.5) 2025 — 2026:导航也有基础模型了 ⭐

上面三类系统形态,是在「一个模型做一个任务」的前提下划分的。2025 年之后,导航复制了操作方向走过的路:从任务特化模型转向跨任务、跨本体的导航基础模型——同一套权重同时处理物体目标导航、语言导航、目标跟踪甚至自动驾驶,也不再为每种本体单独训练。

工作链接时间一句话看点
NavFoMpaper|主页2025.09导航基础模型的代表作:800 万条导航样本,跨四足 / 无人机 / 轮式 / 汽车四类本体与四类任务,无需针对任务微调
FutureNavpaper2026.06把世界模型引入 VLN:动作预测与未来状态生成联合训练
ABot-N1paper2026.07快慢系统式导航:慢系统做链式推理并输出像素级目标点,快系统负责高频路径点

评测侧也在补短板:NavVerse 把评测从纯室内扩展到室内外连续切换的场景;CapNav(CVPR 2026)则提出了一个此前被忽略的问题——导航规划必须考虑本体自身的物理能力(扫地机上不了楼梯、四足可以),同一条路径对不同机器人并不等价。

⚠️ 看到高成功率时请留意 Sim2Real:2026 年一篇结合真机部署的 VLN 综述指出,尽管现有方法在仿真的未见环境中成功率普遍超过 85%,迁移到真实机器人后差距非常明显,避障鲁棒性尤其薄弱。导航方向的仿真与真机差距,目前比操作方向更容易被低估。

(9.6) 其他参考(进一步扩展)

资源链接
Object-Goal Navigation 综述link
VLN 综述 + 真机评测(2026)link
Awesome VLNlink
Habitat Navigation Challengelink

小结:导航方向最重要的分歧不在「用什么网络」,而在系统形态——端到端追求简洁但容易过拟合,模块化更可控但偏工程,零样本更易迁移但速度与上限受限;而 2025 年之后的基础模型路线正在把三者的边界打散。做项目时建议先选定评测平台与数据集生态,再决定模型路线,否则很容易在实现层面被卡住。

(10) Embodied AI for X —— 具身智能 + X

(10.1) Healthcare —— 具身医疗

具身智能技术的迅猛发展正在引领医疗服务模式迈向革命性的新纪元。作为人工智能算法、先进机器人技术与生物医学深度融合的前沿交叉学科,具身智能 + 医疗这一研究领域不仅突破了传统医疗的边界,更开创了智能化医疗的新范式。其多学科协同创新的特质,正在重塑医疗服务的全流程,为精准医疗、远程诊疗和个性化健康管理带来前所未有的发展机遇,推动医疗行业向更智能、更人性化的方向转型升级。这一领域的突破性进展,标志着医疗科技正迈向一个全新的智能化时代。
综述链接
医疗具身智能综述link

(10.1.1) MLLM for Medical —— 多模态大语言模型在医学中的应用

资源链接
用于医学影像分析的通用人工智能综述link
医学影像通用分割模型 MedSAMlink
2024 盘点:医学 AI 大模型,从通用视觉到医疗影像link
医疗领域基础模型的发展机遇与挑战link
SkinGPT-4 for dermatological diagnosislink
PneumoLLM for pneumoconiosis diagnosislink
BiomedGPTlink
LLaVA-Medlink
RoboNurse-VLAlink
PathChatlink
DeepDR-LLMlink
VisionFMlink
Medical-CXR-VQAlink

(10.1.2) Medical Robotics —— 医疗机器人

主题资源链接
五级自动化Medical robotics—Regulatory, ethical, and legal considerations for increasing levels of autonomylink
十年回顾A decade retrospective of medical robotics research from 2010 to 2020link
医疗具身智能分级A Survey of Embodied AI in Healthcare: Techniques, Applications, and Opportunitieslink
AI meets medical roboticsArtificial intelligence meets medical roboticslink
机器人手术综述Robotic surgery (Nature Reviews Bioengineering)link

医疗机器人的机器视觉

资源链接
3DGS 在腔镜手术中的应用综述link
LVM 在手术机器人上的综述(CUHK 任洪亮团队)link

达芬奇相关

资源链接
dVRK 介绍link
Surgical Robot Transformer (SRT)link

Domain-specific Simulators(手术机器人技能学习模拟器)

模拟器链接
SurRoLlink
Surgical Gymlink
ORBIT-Surgicallink
自主缝合综述link

连续体与软体手术机器人

资源链接
Continuum Robots for Medical Interventionslink
Soft Robot-Assisted Minimally Invasive Surgery and Interventions: Advances and Outlooklink
血管介入手术机器人具身智能综述link
什么是软体机器人?软体机器人的具身智能定义link
Learning-Based Control Strategies for Soft Robots: Theory, Achievements, and Future Challengeslink
A concise guide to modelling the physics of embodied intelligence in soft roboticslink
Data-driven methods applied to soft robot modeling and control: A reviewlink

微纳机器人

资源链接
Machine learning for micro- and nanorobotslink

(10.2) UAV —— 无人机(技能、任务与本体)

无人机研究大体可以用「三条主线」来理解: 技能(Skill):避障、竞速、敏捷飞行/特技等,强调高速闭环与安全约束; 任务(Task):探索、重建、跟踪/追捕等,强调长时规划与不确定环境; 本体(Platform):飞行器构型与载荷(例如空中机械臂、全驱动、多模态等),决定了可执行的动作空间与任务边界。 实际系统里三者往往是耦合的:任务提出约束,技能保证可执行,本体决定上限。

(10.2.1) 技能实现/学习(Skill Learning)

无人机技能学习的瓶颈通常不是「有没有算法」,而是闭环速度、仿真可用性、Sim2Real 稳定性。因此这里先列出更贴近 RL/学习的仿真器与工程链路,再给代表工作做索引。

类别仿真/链路链接备注
学习仿真AirSimlinkUE4;生态成熟但运行偏慢
学习仿真FlightmarelinkUnity 渲染;CPU 并行动力学
学习仿真AerialGymlinkIsaac Sim;GPU 并行动力学
轻量生态gym-pybullet-droneslinkPyBullet;装起来最快,适合教学与算法验证。同实验室还有 safe-control-gym(带约束与符号动力学)与 crazyflow(JAX 可微、GPU 加速)
工程链路PX4 SITL / ROS 2link跑真实飞控固件,最接近部署形态。快速迭代或 macOS 上建议用 SIH(物理跑在 PX4 内部,零外部依赖)
兼顾两者aerial-autonomy-stacklinkPX4/ArduPilot + ROS 2 + 感知,同时提供 Gymnasium 接口与超实时仿真
展开:经典技能代表工作(按主题归类)

未知场景障碍物躲避 / 反应式控制

工作链接备注
Learning Monocular Reactive UAV Control in Cluttered Natural Environments (ICRA 2013, CMU)paper监督学习:图像 → 离散控制指令
CAD2RL: Real Single-Image Flight without a Single Real Image (RSS 2017, UCB)paperSim2Real RL + domain randomization
DroNet: Learning to Fly by Driving (RAL 2018, UZH)repo输出速度指令
Learning High-Speed Flight in the Wild (SciRob 2021, UZH)repoDAgger + 传统轨迹规划监督
Back to Newton's Laws: Learning Vision-based Agile Flight via Differentiable Physics (2024, SJTU)paper可微物理辅助策略优化
Flying on Point Clouds using RL (2025, ZJU)paper机载雷达 + Sim2Real RL

无人机竞速(高速度、高精度、高风险约束)

工作链接备注
Champion-level drone racing using deep RL (Nature 2023, UZH)paperRL 战胜人类冠军,领域里程碑
Reaching the Limit in Autonomous Racing: Optimal Control versus RL (SciRob 2023, UZH)paper系统对比 RL 与最优控制,值得精读
Demonstrating Agile Flight from Pixels without State Estimation (RSS 2024, UZH)paper视觉端到端,不依赖显式状态估计

大机动 / 特技飞行(敏捷性与可控性)

工作链接备注
Deep Drone Acrobatics (RSS 2020, UZH)paper模仿学习 + MPC 轨迹跟踪
Whole-Body Control Through Narrow Gaps (ICRA 2025, ZJU)paper端到端窄缝穿越

近两年无人机方向的两个明显趋势,和操作方向高度同步:世界模型进入控制回路,以及 VLA 范式迁移到飞行。

工作链接时间一句话看点
Dream to Flypaper2025.01基于 DreamerV3 的模型式 RL,从像素直接到控制指令;未做奖励塑形却自发学会「转头看路」
MAD(Mapping-Aware Dreamer)paper2026.06世界模型重建的不是图像而是占据与可见性栅格,强迫隐状态编码几何与历史
安全屏蔽式 RL 高速穿越杂乱环境paper2026.02用高阶控制障碍函数(CBF)把策略输出投影到可证明安全的集合里
AerialVLApaper|repo2026.03端到端 UAV VLA:从原始视觉与模糊指令直接出连续控制,不依赖外部检测器

小结: 技能学习的主矛盾通常是「闭环工程问题」:仿真速度、传感器噪声、延迟与 Sim2Real。选平台时建议先明确你需要的是 快速迭代(轻量) 还是 高保真 + 可部署(PX4/ROS 链路)。


(10.2.2) 任务实现/学习(Task Learning)

任务层比技能层更强调:长时规划、部分可观测、目标不确定与多机协作。很多工作会把「任务规划」交给上层策略,把「飞行稳定」交给下层控制/技能模块。

展开:经典任务代表工作(探索/追捕等)
任务工作链接
追捕/协作HOLA-Drone: Hypergraphic Open-ended Learning for Zero-Shot Multi-Drone Cooperative Pursuit (2024, Manchester)paper
追捕/规划Online Planning for Multi-UAV Pursuit-Evasion in Unknown Environments Using Deep RL (RAL 2025, THU)paper
探索Deep RL-based Large-scale Robot Exploration (RAL 2024, NUS)paper
探索ARiADNE: Attention-based Deep Networks for Exploration (ICRA 2023, NUS)paper
探索DARE: Diffusion Policy for Autonomous Robot Exploration (ICRA 2025, NUS)paper

(10.2.3) 无人机硬件平台搭建

教程链接
从 0 制作自主空中机器人link

(10.2.4) 新构型无人机设计

这一部分更偏「具身本体学」:通过构型改变动作空间,使无人机从「移动平台」变成「可交互平台」。

空中机械臂(Aerial Manipulator)

资源/工作链接备注
空中作业机器人,下一代无人机技术?link
Past, Present, and Future of Aerial Robotic Manipulators (TRO 2022)link综述
Millimeter-Level Pick and Peg-in-Hole by Aerial Manipulator (TRO 2023)link
NDOB-Based Control of a UAV with Delta-Arm… (ICRA 2025)link
A Compact Aerial Manipulator… (JIRS 2024)link

全驱动无人机(Fully-Actuated UAV)

工作链接备注
Fully Actuated Multirotor UAVs: A Literature Review (RAM 2020)link综述
Omni-directional aerial vehicle (ICRA 2016, ETH)link
Voliro omniorientational hexacopter (RAM 2018, ETH)link
FLOAT Drone (arXiv 2025, ZJU)link

可变形无人机(Deformable UAV)

工作链接
DRAGON (RAL 2018)link
The Foldable Drone (RAL 2019)link
Ring-Rotor (RAL 2023)link
Passively Morphing Quadcopter (ICRA 2019)link

多模态无人机(Terrestrial-Aerial / Multi-Modal)

工作链接
A bipedal walking robot that can fly… (SciRob 2021, Caltech)link
Morphobot (NC 2023)link
Skater (RAL 2024, ZJU)link
Terrestrial-Aerial Bimodal Vehicles Navigation (RAL 2022, ZJU)link

小结: 如果你关注「具身交互」,新构型往往比换算法更有效:空中机械臂解决「能不能操作」,全驱动解决「姿态与力控自由度」,可变形解决「通过性与安全」,多模态解决「跨地形任务连续性」。


(10.3) Autonomous Driving —— 自动驾驶

自动驾驶和具身操作类似,本质是「在复杂开放世界中闭环决策」。但它的研究与工程路线经常可以归纳成两大块: 世界模型(World / Simulation):如何表示、重建并可控生成驾驶世界(用于仿真、数据增广、评测与训练); 策略系统(Policy):从模块化到端到端,并出现越来越多「快慢系统」范式(快系统高频安全控制,慢系统语义理解与规划)。

(10.3.1) World / Simulation:重建 + 可控生成

主题资源/工作链接备注
生成式仿真(概念)生成式仿真为具身智能释放无限灵感link

3D/4D 场景重建

工作链接备注
NSGlink|linkCVPR 2021
MARSlink|link
StreetGaussianslink|link
OmniRelink|link|linkICLR 2025 Spotlight

场景可控生成 / 世界模型

工作链接备注
GAIA-1link|link
GenAD(OpenDV)link|linkCVPR 2024 Highlight
Vistalink|link|linkNeurIPS 2025
SCP-Difflink|link|link
MagicDrive → MagicDriveDiTlink|link
UniScenelink|linkCVPR 2025
VaVAMlink

生态补充

仿真/数据生态链接说明
CARLAlink自动驾驶仿真的事实标准,闭环评测常用。⚠️ 注意 0.9.x(UE4)与 0.10.x(UE5)是两条独立分支,版本号更低的 0.9.x 反而更成熟,新人极易选错
nuSceneslink多传感器真实数据集,端到端方法的主流评测场
Waymo Open Datasetlink规模最大的真实数据集之一;除感知与运动预测外,还有专门的端到端驾驶数据集(8 路相机 360° 覆盖 + 文本导航指令,聚焦长尾场景)
Argoverse 2link偏运动预测与场景挖掘,含高精地图

小结: 世界模型路线的关键不是「生成得像不像」,而是「能不能被策略有效利用」:可控性、可评测性、覆盖长尾场景,往往比视觉质量更关键。


(10.3.2) Policy:从模块化到端到端,再到快慢系统

主题资源链接
模块化到端到端End-to-end Autonomous Driving: Challenges and Frontierslink
快慢系统并行(观点)理想端到端 VLM 双系统link

为了便于「选路线」,这里把代表工作按快/慢系统拆开: 快系统通常强调高频闭环(检测、占用、轨迹与控制),慢系统强调语义理解、解释与规划(往往更接近 VLM/LLM)。

快系统代表作

工作链接备注
UniADlink|linkCVPR 2023 Best Paper
VADlink|linkICCV 2023
SparseDrivelink|link
DiffusionDrivelink|linkCVPR 2025
Scale-up 特性探究link

慢系统代表作

工作链接备注
DriveVLMlinkCoRL 2024
EMMAlink
Open-EMMAlink开源实现
AutoVLApaper|主页|repoUCLA,2025.06;把连续轨迹离散成可行动作 token,用一个自回归模型统一推理与执行,并用 RL 微调让模型在简单场景下自动跳过冗余推理

值得注意的是,自动驾驶和具身导航正在被同一批模型覆盖:上一节的 NavFoM 就把自动驾驶当作它四类任务之一来训练与评测。这也印证了「快慢系统」这套范式在操作、导航与驾驶三个场景中的通用性。

小结:自动驾驶策略的发展越来越像具身操作——快系统保证稳定与安全,慢系统提供语义理解与长时规划。做研究时建议先固定评测生态(数据 / 仿真 / 指标),再讨论模型形态,否则很难做可复现对比。


(10.3.3) 未来方向

资源链接
AIR ApolloFM 技术全解读link

infrastructure

Embodied-AI-Guide
软件基础设施篇

这一章关注的不是「具体某个模型」,而是支撑具身智能研究与系统落地的软件基础设施(Infrastructure)。 仿真器决定你能构建怎样的世界,基准集决定你如何比较方法优劣,数据集决定模型最终学到什么样的行为分布。它们共同构成了具身智能中最容易被忽视、但最影响上限与复现性的部分。

软件部分可以理解为三层,外加一层工具链: Simulators(仿真环境) 决定你能「跑什么物理世界」;Benchmarks(评测基准) 决定你用什么任务衡量方法优劣;Datasets(数据集) 决定你能训练出怎样的策略分布;最后的工具链则关系到你把策略接到环境上要付多少工程成本。建议优先跑通「一个仿真器 + 一个基准 + 一个数据集」的最小闭环,再逐步扩展到多平台与多模态。

(1) Simulators —— 仿真器

仿真器是具身研究里最先要做的一个选择,也是最容易选错的一个——换仿真器的迁移成本往往比换模型高得多。好消息是,选型主要看两件事:你做的是操作还是运动,以及你需要并行采样还是高保真渲染。

你要做什么推荐起点原因
双臂/单臂操作,想尽快跑通全链路SAPIEN 系(RoboTwin 2.0、ManiSkill)装起来快、任务现成、有预采集数据,本指南第 2 章教程即基于此
四足 / 人形运动控制(RL)Isaac Lab 或 MuJoCo PlaygroundGPU 上数千环境并行采样,RL 训练必需
需要精确接触动力学、做控制研究MuJoCo接触求解稳定,学术界事实标准
需要照片级渲染、大规模场景Isaac Sim基于 Omniverse 的光追渲染,Sim2Real 视觉差距更小
要和 ROS 打通、做移动机器人Gazebo与 ROS/ROS 2 深度集成,传感器插件生态成熟
🌱 新人最常见的误区:以为「物理越真实越好」。实际上早期最该优化的是迭代速度——一个能在十分钟内跑完一轮训练与评测的仿真环境,价值远高于一个物理完美但配置三天都跑不起来的环境。等你要做 Sim2Real 迁移时,再去关心接触参数与渲染保真度。

选型时的第一站推荐社区维护的仿真器 wiki:Simulately,它按物理引擎、渲染、并行能力等维度做了横向对比。

仿真器典型生态 / 对应基准与工具链
IsaacGymlegged-gym
parkour(含蒸馏与真机部署)
extreme-parkour
Isaac SimBEHAVIOR-1K + OmniGibson(工具链)
ARNOLD
GarmentLab|DexGarmentLab
⚠️ 早期的 iGibson 已停止维护,新项目请直接用 OmniGibson
MuJoCorobosuite + robomimic(工具链)
LIBERO
MetaWorld
Gymnasium-Robotics
RoboCasa
RoboHive
OmniSim平台
Apache-2.0 机器人仿真器,提供 URDF 导入、HTTP/MCP Agent 控制、Newton CPU/GPU 物理、合成数据与可复现实验基准;Windows 提供 beta 安装包,Linux 为源码构建,macOS 物理尚未验证
SAPIENManiSkill
RoboTwin 2.0|文档
CoppeliaSimRLBench
PerAct2
COLOSSEUM
PyBulletCALVIN
Ravens
VimaBench
Genesis主页
代码(注意仓库已由 Genesis 更名为 genesis-world)
跨平台(NVIDIA / AMD / Apple),已支持 LiDAR、深度与触觉传感器
SOFA框架
常用于软体机器人仿真
GenieSim框架
评测与文档
Gazebo平台
Open Robotics 维护
与 ROS / ROS 2 深度集成,适合移动机器人、仓储物流等场景

教程:Isaac 101(Blog)

(1.1) 正在发生的变化:物理后端在重新洗牌 ⭐

读 2024 年之前的教程时要注意,这一层最近换了一轮,很多老教程里的安装命令已经跑不通了:

  • IsaacGym 已被 Isaac Lab 取代。经典的 legged-gym、parkour 等仓库仍基于 IsaacGym,可以读代码学思路,但新项目请直接用 Isaac Lab。Isaac Lab 目前 2.x 是稳定线,3.0 仍在 beta,且新的 Newton 后端尚未覆盖全部功能(可变形体、吸盘夹爪等仍需 PhysX),追求可复现就留在 2.x。
  • Newton:由 NVIDIA、Google DeepMind 与 Disney Research 共同贡献给 Linux Foundation 的开源物理引擎,基于 Warp 与 OpenUSD,2026 年已发布正式版。它把刚体、布料、颗粒等多种求解器收进同一框架,正在成为多个仿真器共同的物理底座。
  • MuJoCo Warp:MuJoCo 的 GPU 并行实现,相比早期的 MJX 在接触密集场景下快出一到两个数量级,MuJoCo Playground 已将其设为默认。注意两个限制:自由度较高(约 60 以上)时性能会明显下降,且暂不支持自动微分——需要求梯度时仍要用 MJX 的 JAX 实现。
  • mjlab:把 Isaac Lab 那套 manager-based 接口搬到 MuJoCo Warp 上,不依赖 Isaac Sim,安装轻量,是 2026 年人形 / 四足 RL 值得考虑的新选项。
🌱 一句话总结:做操作看 SAPIEN / MuJoCo,做运动控制看 Isaac Lab / mjlab,物理后端正在向 Newton 与 MuJoCo Warp 收敛。 选定后就别频繁换,迁移成本很高。

(2) Benchmarks —— 基准集

基准集通常定义了三件事:任务集合 + 评测协议 +(可选)参考实现。它的价值是让不同方法在同一套任务与指标上可复现对比——没有共同的基准,「我的方法更好」就只是一句话。

读基准的成功率数字时,请务必同时确认三个前提,否则数字之间没有可比性:(1) 训练用了多少条演示、(2) 评测跑了多少个 episode、用了几个随机种子、(3) 初始状态是固定的还是随机的。同一个模型在这三项上换一种设置,成功率相差二三十个百分点是常事。

基准链接一句话定位
RoboTwin 2.0link
link
程序化生成双臂任务数据与 50 个双臂评测任务(偏「双臂 + 规模化生成」)
RoboDojolink同时提供仿真与真机任务,评测维度覆盖泛化、精度、长程与记忆(偏「统一评测」)
RMBenchlink专门考察记忆能力的操作基准,任务按记忆复杂度分级(偏「记忆依赖任务」)
SimplerENVlink轻量化、可快速对比策略在操作任务上的表现
LIBEROlink
link
程序化生成管道 + 终身学习设置(偏「终身/顺序学习」);是 VLA 论文最常报的数字,但已接近饱和
LIBERO-Pluslink给 LIBERO 加七类扰动、扩成上万任务并分五档难度,用来检验成功率是不是「刷」出来的
VLA-Arenalink在静态桌面任务之外补上动态场景与安全约束
RoboArenalink
paper
真机分布式评测:不统一任务,由多所机构的评测者自选场景做双盲两两对比再聚合排名
CALVINlink
link
语言条件 + 多模态输入 + 长视野操纵(偏「长程任务与规划」)
Meta-Worldlink50 个操作任务,经典多任务/元强化学习基准(偏「多任务泛化」)
Embodied Agent Interfacelink评测 LLM 在具身决策链路(理解/分解/序列化)上的能力,不涉及低层执行
RoboGenlink
link
生成任务/场景/带标注数据(偏「生成数据而非直接生成 policy」)
RescueBenchrepo|paper基于 Unreal Engine / UnrealZoo 的四阶段搜救基准,含五级难度与统一评测(偏「多模态探索、救援交互与空间记忆」)
🌱 怎么报结果才可信:2026 年的共识是至少报一个仿真基准 + 一个真机或第三方榜单。只报单一仿真数字越来越难被接受,因为老基准已经出现明显的饱和与过拟合。相关讨论见算法篇的「评测正在变严」。

(3) Datasets —— 数据集

数据集决定了策略的「经验分布」——模型最终只会做它在数据里见过的事。挑数据集时建议先问四个问题: (1) 真实还是仿真(决定有没有 Sim2Real Gap)、(2) 机器人同构还是异构(同构好训,异构才谈得上跨本体泛化)、(3) 有哪些模态(RGB / RGB-D / 语言 / 触觉 / 声音)、(4) 有没有配套的训练代码与采集流程(决定你能不能复现,而不只是下载)。

数据集链接关键特点(紧凑版)
Open X-Embodiment(RT-X)link22 种机器人平台、百万级真实轨迹,覆盖大量技能与任务(大规模、跨本体)
AgiBot World Datasets(智元)link百万级轨迹、同构机器人采集、多级质检与人工在环流程(工业化采集流程)
RoboMINDlink10.7 万真实演示、96 类物体、四种协作臂、任务按类别组织(真实多任务)
ARIO(All Robots in One)link2D/3D/文本/触觉/声音五模态;操作 + 导航;仿真 + 真实;统一格式且规模大
MimicGenlink
link
基于 robosuite + MuJoCo 的数据生成框架;少量真人演示扩增为大量仿真数据
RoboCasalink
link
MuJoCo 厨房高保真平台;多环境多物体;原子任务 + 组合任务(偏家居厨房)
DexMimicGenlink
link
面向双臂桌面操作;增强版 Real2Sim2Real 数据生成;少量演示生成大量轨迹
FUSE Datasetlink遥操作轨迹;语言指令 + 复杂遮挡;多任务设置(多传感器融合研究友好)
BiPlay Datasetlink双臂轨迹;随机物体与背景;长视频切片成带语言描述的剪辑(泛化导向)
DROIDlink7.6 万轨迹、350 小时、564 场景、86 任务;附硬件与训练代码(真实大规模)
BridgeData V2link6 万轨迹;多环境多技能;目标图像/语言指令;包含遥操作与脚本执行
Ego4D Soundslink第一人称视频 + 环境声音;强调动作与声音对齐(声音模态很有价值)
RH20Tlink人机交互数据;含人脸与语音等敏感信息;体量大且提供缩减版(注意隐私与合规)
白虎数据集link异构机器人;多场景多任务;面向跨平台评测与训练(本体覆盖面广)
RoboTwin 2.0 Datasetlink10 万条以上仿真轨迹;50 个双臂任务;clean / randomized 两档域随机化;可按任务单独下载

(4) 工具链 —— 数据格式与策略部署

前三节解决的是「在哪跑、比什么、用什么数据训」,还剩一件很占时间但不太被写进论文的事:把一个策略真正接到环境上跑起来。麻烦主要来自不统一——每个模型的依赖库、观测格式、动作空间都不一样,换一个仿真器常常要重写一遍胶水代码。下面两个项目分别从「统一数据格式」和「统一部署接口」两个角度减少这部分工作量。

项目链接一句话定位
LeRobotrepo|文档Hugging Face 的机器人学习栈,提供统一的数据集格式和多个策略的训练代码;它的数据格式目前基本是通用底座
XPolicyLabrepo把多个策略收敛到同一套部署接口,策略与环境可以各用自己的依赖环境、跨机器通信;适合在同一批任务上横向对比多个模型

LeRobot 的策略库已经相当全(π0 / π0.5 / π0-FAST、SmolVLA、GR00T、X-VLA、WALL-X 等),另外三个功能对实际项目很有用:

  • LoRA / PEFT 微调已是一等公民(文档),显存不够时不必放弃微调大基座;
  • Real-Time Chunking(RTC) 可以作为开关加在任意 flow matching 策略上,用于缓解推理延迟;
  • 支持从 Hugging Face Hub 直接加载仿真环境,省去本地配置。
⚠️ LeRobot 迭代很快,升级版本时请先看 release note:例如它已移除对 GR00T N1.5 的支持、只保留 N1.7,旧 checkpoint 需要锁定老版本才能加载。这类破坏性变更在本领域的工具链里相当常见。 🌱 新手不必一开始就纠结这一层。只跑一个策略时,直接用该策略仓库自带的脚本最省事;等你需要在同一套任务上比较多个模型,或者撞上「策略要一个 torch 版本、仿真器要另一个」这类依赖冲突时,再回来看它们的价值会明显得多。

control

Embodied-AI-Guide
控制篇

这一章并不是为了让你「立刻跑一个模型」,而是为具身智能系统提供稳定性、可解释性与工程底座。控制论保证系统在高频下不崩溃,机器人学提供几何与动力学约束,SLAM 与状态估计让机器人「知道自己在哪里」,ROS 与工程库则把理论变成可复现的系统。

(1) Control and Robotics —— 控制论与机器人学基础

这一章覆盖的是具身智能中最底层、也最容易被跳过的能力层。控制与机器人学本身并不会直接提高 benchmark 分数,但它们决定了系统是否稳定、可解释、可调试、可部署。如果说算法篇解决的是「我想让机器人做什么」,那么这一章回答的是:机器人凭什么能连续、安全、可控地做到。

(1.0) 先说清楚:要学到什么程度

控制理论是一个能读一辈子的领域,新人最容易犯的错是一头扎进去补三个月数学,却迟迟没碰过真机。实际上,不同目标需要的深度差别很大:

你的目标需要掌握的程度建议投入
训练 VLA / 操作策略,机器人由厂商 SDK 驱动知道 FK/IK 在做什么、关节空间与末端空间的区别、阻抗控制为什么比位置控制安全一周,够用即可
自己搭真机、调机械臂、做力控任务上面全部,再加 PID 调参、坐标变换、手眼标定、实时性与延迟一个月,边调边学
做人形 / 四足运动控制、全身控制再加刚体动力学、旋量代数、最优控制(LQR / MPC)、接触与摩擦建模三个月以上,需要系统学
做移动机器人、需要自主定位导航再加状态估计、EKF、图优化与 SLAM两个月以上
🌱 给新人的建议:先按第一行的标准过一遍,尽快去第 2 章的实战教程把策略跑通;等你真的被某个问题卡住(机械臂抖、抓取时把物体捏碎、末端到不了目标点),再回头精读对应章节,效率会高得多。控制是「按需补课」最划算的一章。

(1.1) 经典课程

材料很多,但真正需要从头看完的只有两门,其余当工具书查即可:

  • Modern Robotics(Northwestern,Kevin Lynch):bilibili|课程主页 系统覆盖坐标系、自由度、FK/IK、旋量与运动学,是机器人学入门的首选。配套教材与 Python 库可直接跑,边看边验证。
  • Advanced Robotics(Berkeley,Pieter Abbeel):bilibili 从控制、规划到 RL / IL / Sim2Real,强调真实系统与决策问题,是连接「控制」与「学习」两套语言的桥梁。
推荐顺序:Modern Robotics → Advanced Robotics。前者解决「机器人是什么」,后者解决「机器人如何在真实世界中做决策」。

(2) Control Foundations —— 控制理论基础

控制论的目标不是「聪明」,而是稳定、可预测与可调试。在具身系统中,学习策略几乎总是建立在控制系统之上:控制负责高频稳定,学习负责复杂决策。你训练出来的 VLA 通常以 10~50 Hz 输出目标位姿,而真正把电机拧到那个位置的,是底下以 500~1000 Hz 运行的控制器。

(2.1) 经典控制(Classical Control)

这一部分帮助你建立对「反馈」的直觉:系统建模、反馈回路、时域与频域分析、传递函数,以及前馈与反馈的区别。一句话概括反馈:测量实际值与目标值的差,再按这个差去调整输出。

PID 是必须掌握的最低配工具——它只有三个参数(比例、积分、微分),却能解决真实调试中相当一部分问题:

🌱 新人最常遇到的三个现象:机械臂到位后来回抖(P 太大或 D 太小)、始终差一点点到不了目标(缺积分项或存在静摩擦)、启动时猛冲一下(积分饱和,需要加 anti-windup)。认出这三种现象,比背下传递函数推导更有用。

(2.2) 现代控制(线性系统与最优控制)

经典控制一次调一个回路,现代控制则把整个系统写成状态空间模型,并把控制问题表述成一个优化问题:给定代价函数(例如「既要快速到达目标,又不要用太大力矩」),求最优的控制序列。LQR 是其中最经典的解析解,也是后面 MPC 的基础。

材料链接适合什么时候看
LQR 直观讲解bilibili想先建立直觉、不想啃公式时
CMU 16-745 Optimal Control ⭐主页|YouTube|bilibili想系统学最优控制与轨迹优化,作业含 Julia 代码,强烈推荐
Modern Control Systems(Dorf & Bishop)经典教材,按书名检索正版即可当工具书查概念

(2.3) 先进控制(Advanced Control)

真实机器人和教科书里的模型总是不一样——负载会变、关节有摩擦、接触瞬间力会突变。先进控制就是处理这些「不理想」的:

方法解决什么问题在具身智能里的典型场景
鲁棒 / 自适应控制模型参数不准或会变化机械臂抓起未知重量的物体后仍能稳住
阻抗 / 导纳控制(参考)让机器人「软」下来,控制的是力与位移的关系而非硬位置插拔、擦拭、人机协作;也是不把物体捏碎的关键
力位混合控制某些方向控位置、某些方向控力打磨平面:法向控力、切向控位置
模型预测控制(MPC)在滚动时域内反复求解优化,能显式处理约束四足 / 人形的步态生成、移动底盘避障
在真实系统中,阻抗控制 + MPC + 学习策略是非常常见且实用的组合:学习策略给目标,MPC 保证约束与可行性,阻抗控制保证接触时的安全。 🌱 如果你只打算记一件事:做接触类任务时,把机械臂从位置控制切到阻抗/力控模式。这一条能避免绝大多数「策略看起来没问题,但一碰到物体就报错或损坏」的事故。

(3) Robotics Foundations —— 机器人学导论

机器人学解决的是「几何 + 物理 + 结构」问题,是控制与感知能够落地的前提。

(3.1) 推荐教材与材料

  • 《现代机器人学:机构、规划与控制》(Kevin Lynch & Frank Park):课程视频|主页与配套代码 有中文版,是目前最推荐的入门教材:用旋量(screw theory)统一处理运动学,比传统 DH 参数法更直观,配套 Python 库能直接验证公式。
  • 进阶数学:《机构学与机器人学的几何基础与旋量代数》(戴建生)、《机器人学的现代数学理论基础》(丁希仑)——只在你需要推导时再翻。

(3.2) 运动学与动力学(Kinematics & Dynamics)

一句话区分:运动学关注「能不能到达」,动力学关注「能不能稳住、能不能用力」。

  • 正运动学 FK:已知每个关节转了多少度,求末端夹爪在空间中的位置姿态。解唯一,算起来简单。
  • 逆运动学 IK:已知想让夹爪去哪,反求各关节该转多少度。可能无解(够不着)、也可能有无穷多解(七自由度冗余臂),因此工程上常用数值求解器并加入关节限位、避障、平滑性等额外约束。

这正是为什么策略输出「关节角」还是「末端位姿」(即 RoboTwin 教程里的 action_type 选 joint 还是 ee)会带来实际差异:前者绕开 IK 但难以跨本体迁移,后者更通用但依赖一个可靠的 IK 求解器。

主题材料
FK / IK 快速直觉视频|原理概览
IK 系统讲解视频一|视频二|理论参考
FK 系统讲解视频一|视频二

动力学中尤其重要的是斜对称矩阵、Twist(旋量速度)、Exponential of Twist 与旋量代数——操作机器人、力控、MPC 与全身控制都离不开这些概念。它们的共同作用是:用一套统一的代数描述「旋转 + 平移」,避免欧拉角带来的万向节死锁与数值问题。


(3.3) 里程计与 SLAM(State Estimation)

状态估计决定了机器人是否「知道自己在哪里」。做桌面操作时这一层往往被相机外参代替,但只要机器人开始移动(移动操作、四足、无人机),它就变成必修课。

常见做法是用 EKF 或图优化融合 IMU、相机、雷达、轮速计,按传感器组合分成几个体系:VIO(视觉 + IMU)、LIO(激光 + IMU)、LIVO(激光 + 视觉 + IMU)。

体系代表系统链接特点
VIOVINS-Mono / VINS-FusionMono|Fusion成本低、依赖纹理;无人机与手持设备常用
视觉 SLAMORB-SLAM3repo特征点法经典实现,支持单目/双目/RGB-D
LIOLOAM / FAST-LIOLOAM|FAST-LIO精度高、对光照不敏感,室外与大场景首选
LIVOFAST-LIVO2repo激光与视觉互补,退化场景更鲁棒
端到端DROID-SLAMpaper学习式稠密 SLAM,纹理弱时表现好但吃显存

系统学习推荐:SLAM Handbook(社区编写,覆盖面新且全)、《视觉 SLAM 十四讲》(中文入门首选,代码可跑)、经典综述(理解领域脉络)。


(3.4) 工程生态与工具(Engineering Stack)

ROS 是把理论变成系统的关键纽带。它本质上是一套进程间通信规范加一堆现成工具:相机、机械臂、雷达各自跑一个节点,通过话题(topic)互发消息,你就不用自己写驱动和通信。新项目请直接学 ROS 2,ROS 1 已停止维护。

资源链接说明
ROS 2 入门(中文)link中文教程,从话题服务讲到工程组织
ROS 2 官方教程link官方文档,遇到概念不清时的权威来源
ROS 2 三小时速成link时间紧时先过一遍
ROS 1 入门(仅供维护老项目)link很多经典代码库仍是 ROS 1

常用机器人库:

库链接用途
cuRobolinkCUDA 加速的 IK、碰撞检测与运动规划,实时性好
MoveIt 2linkROS 生态里最通用的运动规划框架
mpliblink轻量规划库,不依赖 ROS,SAPIEN / RoboTwin 常用
IKFastlink为特定机械臂生成解析 IK,速度极快
Pinocchiolink高效刚体动力学库,MPC 与全身控制的常用底座

其他工程细节:多传感器时间同步(数据对不齐会让训练出的策略莫名其妙地差)、LeRobot(SO-100 / SO-101 等低成本机械臂的软硬件实践,是目前最便宜的真机入门路径)。


(4) Whole-Body Control —— 全身控制与人形运动 ⭐

前三节讲的大多以机械臂为例:机械臂固定在桌上,只要末端到位就算成功。人形与四足机器人不一样——它没有被固定住,用力过猛就会摔倒。 全身控制(Whole-Body Control, WBC)要解决的正是这个问题:把控制目标从「机械臂末端」扩展到躯干、腿、手臂、头的整个身体,在完成任务的同时维持平衡。

它的难点可以归结为一句话:机器人只能通过脚与地面的接触来给自己施力,而这个接触是单向的(只能推不能拉)、有摩擦上限的、还随时可能断开。 所以人形控制的本质是在一堆接触约束下做实时优化。

(4.1) 模型式与学习式两条路线

路线做法优势代价
模型式(MPC + WBC)用简化模型(如线性倒立摆)在线做优化,求解满足接触约束的关节力矩可解释、可加硬约束、不需要训练依赖准确建模,复杂地形与富接触场景难写
学习式(仿真中 RL)在 GPU 上并行几千个环境跑强化学习,再迁移到真机能学出手工难以设计的动态行为(跑、跳、翻滚)奖励函数难调,且必须跨越 Sim2Real Gap

2025 年之后,学习式路线在人形与四足上已经成为主流,模型式方法更多作为安全层或对照基线保留。

(4.2) 入门路径

新人从零做人形运动控制,最快的路线不是先读论文,而是先跑通一个现成仓库看到机器人在仿真里走起来,再回头理解每一项奖励在做什么。

顺序项目链接为什么放在这个位置
1GMT(General Motion Tracking)paper|repo上手门槛最低:只依赖 MuJoCo、附预训练权重,笔记本就能看到 Unitree G1 跟着动捕数据动起来
2Unitree RL Lab / unitree_rl_gymrl_lab|rl_gym厂商官方,本体模型与真机部署链路最可靠;有 G1 / H1 的话从这里开始
3ASAPrepo讲清楚 Sim2Real Gap 怎么补:先在仿真训练,再用真机数据学一个「残差动作」模型去补偿物理误差
4BeyondMimicpaper|主页|repo目前动作跟踪质量的标杆(后空翻、冲刺、侧手翻),并已成为多个公开 RL 仓库的默认方法
5HOVERrepoNVIDIA 的通用神经全身控制器,理解「一个策略支持多种控制接口」的思路

(4.3) 训练框架与工具

工具链接定位
Isaac Labrepo目前最主流的机器人 RL 框架,GPU 并行环境数最多
mjlabpaper|repo|文档把 Isaac Lab 的接口搬到 MuJoCo Warp 上,去掉了 Isaac Sim 依赖,装起来轻得多
HumanoidVerserepo支持 Isaac Gym / Isaac Sim / MuJoCo 多后端,ASAP 的训练底座
MuJoCo Playground主页现成的运动控制环境集合,适合快速验证算法

(4.4) 动作重定向与遥操作

人形 RL 的主流做法是让机器人模仿人类动作,而人类动捕数据(骨骼比例、自由度)和机器人本体对不上,中间必须做一步重定向(Retargeting)。这一步几乎是所有人形动作跟踪工作的共同前置:

  • GMR(General Motion Retargeting):repo —— 实时把 AMASS / SMPL-X、动捕 BVH / FBX 等格式的人体动作转到 17 种以上人形本体上,且特意调过参数使下游 RL 跟踪策略能训得动,是目前的事实标准。
  • TWIST:repo —— 用「教师-学生」蒸馏做实时全身遥操作,人穿动捕设备即可直接驱动人形机器人,可用于采数据。
🌱 给新人的提醒:人形运动控制对仿真并行采样高度依赖,一次训练动辄需要几千个并行环境跑上亿步——这意味着它比操作方向更吃显卡,且几乎不可能在没有仿真的情况下做。如果你手上只有一块消费级显卡,建议从四足(自由度更少、训练更快)或本指南算法篇的操作方向入手。 另外注意,人形领域的产品宣传视频常常来自遥操作或高度特化的策略,看到惊艳的演示时先确认它是自主还是遥操。

hardware

Embodied-AI-Guide
硬件篇

具身智能硬件涵盖多个技术栈:嵌入式软硬件、机械设计、机器人系统集成与传感器等。它们知识面很杂,但共同目标只有一个:把「算法」变成真实世界里稳定可复现的系统。 关于硬件学习,最有效的方式几乎永远是 从实践出发——先做出一个能跑起来的最小系统,再逐步扩展复杂度与可靠性。

(1) Embedded —— 嵌入式

嵌入式决定了机器人「神经系统」的下限:通信是否稳定、控制是否实时、驱动是否安全。建议按 入门单片机 → STM32 工程 → 电机驱动 → 嵌入式 Linux 的顺序推进。

路线/主题资源链接说明
总览路线嵌入式学习路线link用于建立学习路径与关键词地图
入门51 单片机link江科大自动协经典入门
主流工程STM32 单片机link从外设到工程结构
驱动关键STM32 电机驱动(野火)link控制闭环常见落点
工程体系野火 STM32 标准库link更贴近工程写法
工程体系正点原子 STM32link资料全,适合查漏补缺
上位平台韦东山嵌入式 Linuxlink走向系统级开发与部署

小结: 做具身硬件时,嵌入式的价值不在「写出更炫的代码」,而在「系统能稳定跑、延迟可控、驱动可靠」。很多项目后期的崩溃都不是算法问题,而是控制链路与工程细节问题。


(2) Mechanical Design —— 机械设计

机械设计决定了机器人「身体」的能力边界:可达空间、刚度、负载、布线与维护成本等。对于算法同学来说,机械最关键的产出通常是 可制造的 CAD 与 可用于仿真/控制的 URDF。

主题资源链接说明
CAD 入门SolidWorks 教学link面向装配体与工程制图
工程衔接从 SolidWorks 生成 URDFlink用装配体导出机器人模型并进入仿真/控制

(3) Robot System Design —— 机器人系统设计

系统设计关注的是「把多个模块拼成一个可维护系统」:硬件接口、软件架构、标定流程、调试策略、日志与安全机制。建议把系统设计当作「把机器人做成产品」的第一步。

资源链接说明
《机器人学简介》(教材 PDF)link质量高,适合系统性阅读
Robotic Systems(Illinois)link偏「系统化机器人学」的组织方式

(4) Sensors —— 传感器

传感器决定了策略「能看到什么」,因此也直接决定了任务的上限:数据里没有的信息,再大的模型也变不出来。具身系统常见的传感器可以按用途分成四类:

类别典型器件回答什么问题新人优先级
视觉RGB 相机、深度相机目标在哪、场景长什么样⭐️⭐️⭐️ 必备
本体感知关节编码器、IMU我自己现在是什么姿态⭐️⭐️⭐️ 通常由本体自带
力觉关节力矩、六维力/力矩传感器我碰到东西了吗、用了多大力⭐️⭐️ 做接触任务时必需
触觉视触觉传感器、电子皮肤接触点在哪、是否打滑⭐️ 精细操作与研究方向
🌱 建议从「能直接用于闭环」的传感器开始(RGB / 深度 / IMU),把流程跑通后再逐步引入触觉这类高难度模态。触觉数据的采集、标定与泛化难度都远高于视觉,不适合作为第一个项目。

(4.1) 深度相机(Depth Camera)

深度相机是具身操作里出镜率最高的传感器。按成像原理主要分三类,选型时的核心权衡是精度、工作距离与对材质的适应性:

原理特点常见型号
双目 / 主动立体(Active Stereo)近距离精度好、室外也能用;对无纹理表面靠投射散斑补救RealSense D4xx 系列
结构光(Structured Light)近距离精度最高;怕强光,室外基本不可用RealSense SR300、Orbbec Gemini 系列
飞行时间(ToF / iToF)帧率高、受纹理影响小;边缘易飞点,对反光和吸光材质不友好Kinect Azure、Orbbec Femto 系列
设备/生态链接说明
Intel RealSenseSDK|ROS 2 驱动事实上的研究标准,绝大多数开源代码默认支持
Orbbec 奥比中光SDK|ROS 2 驱动国内供货与售后更方便,型号覆盖三种原理
Luxonis OAK-D文档板载算力,可在相机端直接跑神经网络,省主机资源
⚠️ 深度相机的三个常见坑:透明与高反光物体(玻璃杯、不锈钢)几乎必然测不到深度,这是原理性限制而非标定问题;最小工作距离通常在 20~40 厘米,末端相机装太近会全是空洞;RGB 与深度需要对齐(align),否则你按彩色图像素取到的深度值对应的是别的位置。

(4.2) 力觉与本体感知

  • 关节力矩感知:现在不少协作臂与人形本体通过电流估计或串联弹性驱动(SEA)提供关节力矩反馈,这是实现阻抗控制与碰撞检测的前提,详见控制篇。
  • 六维力/力矩传感器:装在腕部,直接测量末端受到的三轴力与三轴力矩,精度远高于电流估计,插拔、打磨、装配类任务常用,代表厂商有 ATI、宇立仪器、坤维科技等。
  • IMU:提供角速度与加速度,是腿式机器人与无人机姿态估计的核心输入;单独使用会随时间漂移,必须与视觉或激光融合(见控制篇的 VIO / LIO 部分)。

(5) Tactile Sensing —— 触觉感知(接触、力与精细操作)

触觉是「接触世界」的关键模态,尤其在装配、柔性物体、精细抓取和遮挡严重的场景中,触觉往往比视觉更可靠。整体上触觉硬件路线常见两类:视触觉(Vision-based tactile) 与 电子皮肤(E-skin)。

(5.1) 视触觉传感器(Vision-Based Tactile Sensors)

视触觉通过摄像头观测弹性介质/标记点的形变,把「触觉」转化为视觉信号来估计接触力、形变与接触几何。它的关键设计点通常包括:传感器形状、标记点布局、材料(硅胶/弹性体)以及光照与成像系统。

  • 优点:高分辨率、非侵入、易与视觉系统融合
  • 缺点:依赖视觉计算、易受光照影响、光学与封装设计复杂

两篇综述覆盖「算法视角」和「结构视角」,建议作为起点: 算法综述 结构综述

(5.2) 电子皮肤(Electronic Skin)

电子皮肤通常用柔性材料(压力薄膜、纳米传感网络等)实现大面积触觉,目标是让机器人拥有类似「全身触觉」的能力,用于安全、人机协作与全身接触交互。

  • 优点:可大面积覆盖、高灵敏度、可伸缩适配复杂表面
  • 缺点:制造与成本较高、数据规模大带来处理挑战、长期稳定性与漂移问题

综述入口

(5.3) 触觉应用与算法(把触觉变成能力)

触觉算法常见落点可以理解为四类:姿态/接触估计、识别与分类、触觉操控技能、统一表征/大模型。

方向代表工作链接
姿态/接触估计(in-hand)3D Shape Perception from Monocular Vision, Touch, and Shape Priorslink
姿态/接触估计(in-scene)Fast Model-Based Contact Patch and Pose Estimation…link
分类/识别Understanding Dynamic Tactile Sensing for Liquid Property Estimationlink
分类/识别Multimode Fusion Perception for Transparent Glass Recognitionlink
触觉操控(装配)Active Extrinsic Contact Sensing: Peg-in-Hole Insertionlink
触觉操控(技能库)Building a Library of Tactile Skills Based on Fingervisionlink
触觉操控(线缆)Cable Manipulation with a Tactile-Reactive Gripperlink
触觉操控(精细手部)Manipulation by Feel: Touch-Based Control with Deep Predictive Modelslink
触觉操控(visuotactile)NeuralFeels with Neural Fields…link
触觉大模型/统一表征Binding Touch to Everything… (CVPR 2024)link

数据工具与标准化:TLabel(GitHub)是一个开源的触觉数据标注与处理工具包(pip install tlabel),提供统一的触觉数据格式标准,支持 GelSight、PaXini、Daimon、UniVTAC 等 10+ 传感器适配器,已被 FTP-1 官方推荐。

触觉的「基础模型」时刻

触觉一直有一个比视觉严重得多的结构性问题:不同厂商的传感器输出格式完全不同(有的是弹性体形变图像,有的是压阻阵列,有的是六维力读数),在一种传感器上训练的模型换个硬件就完全失效。视觉领域有 ImageNet 和统一的 RGB 格式,触觉领域长期没有。

2026 年出现的几项工作正是冲着这一点去的——共同思路是先把异构信号投影到一个与硬件无关的共享表征,再在其上训练策略:

工作链接一句话看点
FTP-1(Foundation Tactile Policy)paper|主页|repo用约 3000 小时、跨 21 种传感器的数据预训练;不同原理的传感器各用一套编码器,再投影到共享的触觉 Transformer,能迁移到训练时没见过的传感器
𝒩₀-Foundationrepo把每一帧触觉统一表示成传感面上的三轴力场以屏蔽硬件差异;配套开放了数千小时的 OpenNeoData 数据集

仿真侧也开始跟进:Genesis 已内置基于 FOTS 的视触觉传感器仿真,这是主流仿真器第一次把触觉当作一等功能提供。

🌱 给想入坑触觉的新人:硬件仍以 GelSight Mini 与 DIGIT 为主流研究选择,两者都有成熟的开源生态。但请做好心理准备——触觉的标定、老化与个体差异都比视觉严重(同型号的两个传感器数据都可能对不上,弹性体用久了还会变形),这也是为什么统一表征会成为这个方向的核心议题。

(5.4) 传感器购买(从研究到落地)

市面上已有成熟视触觉传感器产品,例如 GelSight


(6) Data Collection —— 数据采集硬件

真机数据是目前具身智能最贵的资源,而采集方式直接决定了数据的规模上限与可用性。所有方案本质上都在同一个权衡上取舍:

动作标注越精确,采集成本越高;采集设备越轻便,越需要额外的动作映射(Retargeting)才能给机器人用。
采集范式代表系统链接动机与特点
主从遥操作(Teleoperation)ALOHA / Mobile ALOHAALOHA|Mobile ALOHA|视频人操作一套「主臂」,从臂实时复现。动作标注最精确、可直接训练,但需要一人一机实时操作,规模难上去
VR / 动捕遥操作Open-TeleVisionproject用 VR 头显获得第一人称立体视觉与手部追踪,可远程操作人形;沉浸感好,适合双臂与灵巧手
手持式采集UMI(Universal Manipulation Interface)project|视频手持一个带相机的夹爪直接在真实环境演示,脱离机器人本体采集,成本低、场景多样;代价是要处理本体与视角差异
外骨骼示教AirExoproject穿戴与机器人同构的低成本外骨骼,关节角可直接映射,兼顾精度与便携
灵巧手采集DexUMI / 数据手套DexUMI|数据手套介绍面向灵巧手与 in-hand 操作,核心难点是缩小人手与机器人手之间的形态差距
第一人称人类视频Ego4D / EPIC-KITCHENSEgo4D|EPIC-KITCHENS放弃精确动作标注,换取极低成本与超大规模,用于学习视觉先验与高层行为结构,通常作为预训练数据
🌱 新人怎么选:如果只是想复现论文、验证算法,优先用公开数据集(见基础设施篇),不要一上来就自建采集系统——搭一套能用的采集平台通常比训练一个策略更花时间。真要自己采,最低成本的起点是 LeRobot 生态的 SO-101 主从臂(整套千元级),先跑通「采 50 条 → 训练 → 评测」的闭环,再考虑扩展。

(7) Companies —— 公司与硬件生态

公司主营产品说明
松灵 AgileXPIPER 六轴机械臂
PIKA 数采方案
Cobot Magic 双臂遥操作平台
全部产品(含移动底盘)
面向教育科研;开源仓库
宇树 Unitree四足机器人开发指南
Go2 机器狗
AlienGo 机器狗
通用人形 H1
通用人形 G1
许多产出使用宇树的机器人作为硬件基础
方舟无限 ARXX5 机械臂
X7 双臂平台
R5 机械臂
适合复现很多经典工作,例如 Mobile ALOHA
RoboTwin 松灵底盘 + 方舟臂
波士顿动力 Boston DynamicsSpot 机器狗
Atlas 通用人形
具身智能本体制造商,从液压驱动转向电机驱动
灵心巧手Linker Hand L30(腱绳驱动)
Linker Hand L20(连杆驱动)
主攻各类灵巧手
灵巧智能 DexRobotDexhand 021 灵巧手19 自由度量产灵巧手
银河通用GALBOT G1专注于具身智能多模态大模型通用机器人研发
星海图 GalaxeaA1 六轴机械臂
R1-Pro 仿人形机器人
软硬件产品均自主研发,专注于打造「一脑多型」
World Labs专注于空间智能,致力于打造大型世界模型(LWM),以感知、生成并与 3D 世界进行交互
星动纪元Star1 人形
XHAND1 灵巧手
加速进化Booster T1 人形
人形机器人(上海)有限公司青龙机器人全尺寸通用人形机器人,提供开源硬件设计图纸、软件框架代码、算法包和全链仿真工具。
云深处科技绝影 X30 四足机器人
Dr.01 人形机器人
松应科技具身智能仿真平台供应商
光轮智能具身智能数据平台
智元机器人远征 A2 人形机器人
远征 A2-W 轮式人形
灵犀 X1 人形机器人
精灵 G1 轮式人形
NVIDIA具身智能基建公司
求之科技TOK4 移动主从臂平台
MMK2 移动升降双臂平台
AIRBOT Play 六轴机械臂
开发者文档
穹彻智能
优必选
具身风暴落地具身智能通用按摩机器人
众擎机器人SE01
PM01
T800
魔法原子MagicBot
MagicDog
帕西尼PX-6AX GEN2 触觉传感器
DexH13 GEN2 灵巧手
TORA-ONE 人形机器人

本文由 GitVP 从 GitHub 收录并在站内全文呈现,版权归原作者所有(NOASSERTION)。

← 回到全部文章

同分类还有