01 // CHAPTER ROUTE

AI 的 “身体” 在哪里?

具身智能 · 第一章

从屏幕里的“聊天 AI”,走向能够感知、决策、行动并从物理交互中学习的“做事 AI”。

SECTION 01 / 阅读地图

小节一 · 从“会说”到 真的会做

本节要回答

小节一 · 从“会说”到 真的会做

从“从“会说”到 真的会做”出发,逐页推进到“为什么走路 比下棋更难?”;每张卡都写明本页应抓住的机制或边界。

01

从“会说”到 真的会做

具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。

机制线索CHAT AI知道怎么做写文章 · 翻译 · 写代码能够去做
02

感知、决策、执行 不是单行道

机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。

机制线索感知相机 · 雷达 · 传感器决策大模型 / VLA · 策略
03

为什么走路 比下棋更难?

规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。

机制线索下棋规则明确 · 信息完整走路 / 抓杯子开放 · 不确定 · 充满意外

阅读顺序:从“会说”到 真的… → 感知、决策、执行 … → 为什么走路 比下棋…

本节按“从“会说”到 真的… → 感知、决策、执行 … → 为什么走路 比下棋…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

从“会说”到 真的会做

从语言意图到物理动作,需要感知、决策和执行共同闭环。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 从“会说”到 真的会做”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 从“会说”到 真的会做

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // FROM CHAT TO ACTION

从“会说”到
真的会做

CHAT AI知道怎么做写文章 · 翻译 · 写代码能够去做装上身体

具身智能让 AI 获得感知与行动通道,进入真实或仿真的物理世界。

02 // CLOSED LOOP

感知、决策、执行
不是单行道

感知相机 · 雷达 · 传感器决策大模型 / VLA · 策略执行电机 · 机械臂 · 底盘环境改变重新感知,再调整

机器人每执行一次,环境就可能变化,因此必须重新感知并持续修正。

03 // MORAVEC PARADOX

为什么走路
比下棋更难?

下棋规则明确 · 信息完整走路 / 抓杯子开放 · 不确定 · 充满意外反直觉感知运动更难
规则明确的棋盘与充满障碍和地形变化的机器人抓取场地并列
照片 1.2 棋盘规则明确,物理运动却充满变化与意外

规则世界适合计算,真实世界却要求 AI 随时处理噪声、变化和意外。

SECTION 02 / 阅读地图

小节二 · 精确菜谱,还是 见多识广?

本节要回答

小节二 · 精确菜谱,还是 见多识广?

从“精确菜谱,还是 见多识广?”出发,逐页推进到“两条路线, 同一块地基”;每张卡都写明本页应抓住的机制或边界。

01

精确菜谱,还是 见多识广?

结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。

机制线索传统机器人工程师精确编程固定环境 · 极高精度具身智能
02

模块化: 逐站接力

模块化便于独立开发和排错,代价是接口复杂与误差累积。

机制线索感知识别物体CAMERA理解
03

VLA: 一个模型直达动作

VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。

机制线索相机图像红色杯子在桌上语言指令“放到托盘上”
04

两条路线, 同一块地基

路线可以并行,数据却是两者共同的训练燃料和评估依据。

机制线索模块化短期落地主力可解释 · 可调试 · 可加安全层端到端 VLA

阅读顺序:精确菜谱 → 模块化: 逐站接力 → VLA → … → 两条路线

本节按“精确菜谱 → 模块化: 逐站接力 → VLA → … → 两条路线”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

精确菜谱,还是 见多识广?

泛化能力来自持续观察环境并依据反馈修正动作。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 精确菜谱,还是 见多识广?”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 精确菜谱,还是 见多识广?

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // TWO ROBOT ROUTES

精确菜谱,还是
见多识广?

传统机器人工程师精确编程固定环境 · 极高精度具身智能从大量演示数据学习环境变化 · 灵活适应不是替代而是扩边界

结构化高精度任务仍适合传统机器人;具身智能拓展的是变化更大的场景。

05 // MODULAR PIPELINE

模块化:逐站接力

感知识别物体CAMERA理解空间关系场景语义规划动作路径PLAN控制关节动作精确执行可定位问题模块,但接口多、误差会逐段累积

模块化便于独立开发和排错,代价是接口复杂与误差累积。

06 // VISION-LANGUAGE-ACTION

VLA:一个模型直达动作

相机图像红色杯子在桌上语言指令“放到托盘上”VLA端到端模型大规模数据共同优化机器人动作泛化强 · 黑盒 · 验证难

VLA 省掉人工模块拆分,但依赖海量轨迹、强算力与额外安全机制。

07 // TWO-LEGGED STRATEGY

两条路线,
同一块地基

模块化短期落地主力可解释 · 可调试 · 可加安全层端到端 VLA长期发展方向自然指令 · 端到端优化 · 泛化共同地基:高质量具身数据真机演示 · 仿真轨迹 · 标注与审核

路线可以并行,数据却是两者共同的训练燃料和评估依据。

SECTION 03 / 阅读地图

小节三 · 机器人正在走进 哪些现场?

本节要回答

小节三 · 机器人正在走进 哪些现场?

从“机器人正在走进 哪些现场?”出发,逐页推进到“平台如何 拆掉数据瓶颈?”;每张卡都写明本页应抓住的机制或边界。

01

机器人正在走进 哪些现场?

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

机制线索环境结构化程度决定落地速度仓储物流分拣 · 搬运 · 上架
02

为什么“身体数据” 最难获得?

机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。

机制线索文本互联网海量内容易获取图像
03

平台如何 拆掉数据瓶颈?

真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。

机制线索真机遥操作采集真实动作REAL数字孪生

阅读顺序:机器人正在走进 哪… → 为什么“身体数据”… → 平台如何 拆掉数据…

本节按“机器人正在走进 哪… → 为什么“身体数据”… → 平台如何 拆掉数据…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

机器人正在走进 哪些现场?

仓储、农业等现场会把感知、动作和安全约束同时带进任务。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 机器人正在走进 哪些现场?”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 机器人正在走进 哪些现场?

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // APPLICATION MAP

机器人正在走进
哪些现场?

环境结构化程度决定落地速度仓储物流分拣 · 搬运 · 上架电力巡检缺陷检测 · 变电站巡检家庭 / 医疗整理 · 康复 · 送药农业 / 施工采摘 · 除草 · 焊接

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

09 // DATA BOTTLENECK

为什么“身体数据”
最难获得?

文本互联网海量内容易获取图像公开数据集需标注机器人轨迹真机逐条采集成本最高 · 数量最少

机器人轨迹必须真实操作或高质量仿真采集,时间与硬件成本远高于文本。

10 // DATA FACTORY

平台如何
拆掉数据瓶颈?

真机遥操作采集真实动作REAL数字孪生扩展场景与变化VLM 标注自动预标注人工审核训练数据服务模块化服务 VLADATA
仓储导航项目串联场景采集、训练工作站和机器人测试场
照片 1.5 场景采集、训练与测试共同缓解具身数据瓶颈

真机、仿真和自动标注协同,目标是降低高质量具身数据的采集成本。

RECAP // THREE MODELS

第一章,记住 三个判断框架

01

从“会说”到 真的会做

具身智能让 AI 获得感知与行动通道

02

为什么走路 比下棋更难?

规则世界适合计算

03

模块化: 逐站接力

模块化便于独立开发和排错,代价是接口复杂与误差累积。

04

机器人正在走进 哪些现场?

越结构化的环境越容易落地,家庭与农业等开放场景仍更具挑战。

05

平台如何 拆掉数据瓶颈?

真机、仿真和自动标注协同

理解具身智能,要同时看身体闭环、技术路线与数据来源。

SOURCE QUIZ // 10 MCQ

单选题 · 10 题

得分 0/10

先依据闭环、路线或数据逻辑作答,再查看讲义解析。

SOURCE QUIZ // 5 TRUE-FALSE

判断题 · 5 题

判断题得分 0/5