11 // CHAPTER ROUTE

机器人从模仿者 走向理解者

具身智能 · 第十一章

行为克隆复制专家,扩散策略生成多种动作,VLA 把视觉、语言与行动接成一个“大脑”。

SECTION 01 / 阅读地图

小节一 · 给 AI 看人怎么做,让它 学着做

本节要回答

小节一 · 给 AI 看人怎么做,让它 学着做

从“给 AI 看人怎么做,让它 学着做”出发,逐页推进到“先模仿获得基线,再用奖励 继续优化”;每张卡都写明本页应抓住的机制或边界。

01

给 AI 看人怎么做,让它 学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

机制线索01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图
02

学到相关性,不等于理解 为什么

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

机制线索专家轨迹先减速再转弯MODEL SEES
03

先模仿获得基线,再用奖励 继续优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

机制线索IMITATION专家示范快速获得能用策略BASELINE FIRST

阅读顺序:给 AI 看人怎么做 → 学到相关性 → 先模仿获得基线

本节按“给 AI 看人怎么做 → 学到相关性 → 先模仿获得基线”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

给 AI 看人怎么做,让它 学着做

先从人的示范中学习可执行基线,再讨论更强的优化方式。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 给 AI 看人怎么做,让它 学着做”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 给 AI 看人怎么做,让它 学着做

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // IMITATION LEARNING

给 AI 看人怎么做,让它学着做

01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图线速度目标位置角速度IMITATION LEARNING让输出尽可能接近专家动作03 / POLICY机器人策略看到状态 → 做出动作

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02 // CAUSAL CONFUSION

学到相关性,不等于理解为什么

专家轨迹先减速再转弯MODEL SEES减速 → 转弯相关 ≠ 原因突发障碍等待“减速信号”可能来不及避让

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

03 // IL + RL

先模仿获得基线,再用奖励继续优化

IMITATION专家示范快速获得能用策略BASELINE FIRSTREINFORCEMENTR环境交互 · 奖励优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

SECTION 02 / 阅读地图

小节二 · 从动作噪声中,一步步 去噪成轨迹

本节要回答

小节二 · 从动作噪声中,一步步 去噪成轨迹

从“从动作噪声中,一步步 去噪成轨迹”出发,逐页推进到“精细动作更强,但反应 更慢”;每张卡都写明本页应抓住的机制或边界。

01

从动作噪声中,一步步 去噪成轨迹

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

机制线索随机动作噪声DENOISET → 0条件:视觉与任务
02

两扇门都能走,不要输出 中间值

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

机制线索WALLBC 平均:正中间方案 A · 左门方案 B · 右门
03

精细动作更强,但反应 更慢

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

机制线索适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY

阅读顺序:从动作噪声中 → 两扇门都能走 → 精细动作更强

本节按“从动作噪声中 → 两扇门都能走 → 精细动作更强”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

从动作噪声中,一步步 去噪成轨迹

扩散策略从动作噪声出发,逐步收敛为完整轨迹。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 从动作噪声中,一步步 去噪成轨迹”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 从动作噪声中,一步步 去噪成轨迹

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DIFFUSION POLICY

从动作噪声中,一步步去噪成轨迹

随机动作噪声DENOISET → 0条件:视觉与任务清晰动作序列

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

05 // MULTIMODAL ACTION

两扇门都能走,不要输出中间值

WALLBC 平均:正中间方案 A · 左门方案 B · 右门Diffusion:采样一个清晰方案

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

06 // DIFFUSION LIMITS

精细动作更强,但反应更慢

适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY多步去噪MULTI-STEP不擅长快速·低延迟任务快速导航 · 低延迟避障

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

SECTION 03 / 阅读地图

小节三 · 看到画面,听懂指令,再 做出动作

本节要回答

小节三 · 看到画面,听懂指令,再 做出动作

从“看到画面,听懂指令,再 做出动作”出发,逐页推进到“本章是 选型知识储备”;每张卡都写明本页应抓住的机制或边界。

01

看到画面,听懂指令,再 做出动作

VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。

机制线索VISION摄像头画面LANGUAGE“把杯子放到桌上”
02

视觉 Token 与语言 Token,在 LLM 中…

VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。

机制线索IMAGEViT 编码视觉 TOKENTEXT
03

三大策略,按任务条件选

能力表先定边界,选型还要同时看任务、数据、时延与算力条件。

机制线索维度行为克隆 BC扩散策略VLA 模型
04

从专用模型,走向 通用机器人

讲义给出的方向,是从“一任务一模型”走向“一个模型搞定所有任务”。

机制线索一个任务,一个模型抓取任务导航任务放置任务
05

本章是 选型知识储备

平台当前支持 BC;其余内容用于理解原理差异与做出训练方法选择。

机制线索平台当前支持行为克隆 BC已在第十章完成实操本章要求

阅读顺序:看到画面 → 视觉 Token … → 三大策略 → … → 本章是 选型知识储备

本节按“看到画面 → 视觉 Token … → 三大策略 → … → 本章是 选型知识储备”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

看到画面,听懂指令,再 做出动作

视觉信息与语言指令汇合后,才能支持面向动作的决策。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 看到画面,听懂指令,再 做出动作”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 看到画面,听懂指令,再 做出动作

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

07 // VLA

看到画面,听懂指令,再做出动作

VISION摄像头画面LANGUAGE“把杯子放到桌上”VLA世界知识 + 当前任务ACTION动作 TOKEN机器人可执行指令

VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。

08 // VLA ARCHITECTURE

视觉 Token 与语言 Token,在 LLM 中会合

IMAGEViT 编码视觉 TOKENTEXTTokenizer语言 TOKENLLMV1V2L1L2预训练世界知识联合推理ACTION TOKEN关节角度末端位姿

VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。

10 // CAPABILITY & CHOICE

三大策略,按任务条件选

维度行为克隆 BC扩散策略VLA 模型 语言指令 多模态决策 训练数据极高 推理速度较慢 泛化能力 部署难度 选 BC任务简单固定 · 专家数据优质需快速部署 · 算力有限 选扩散策略需要多种合理方案 · 动作多样推理延迟不是关键问题 选 VLA需要理解语言 · 任务种类多变有足够计算资源

能力表先定边界,选型还要同时看任务、数据、时延与算力条件。

11 // FUTURE TREND

从专用模型,走向通用机器人

一个任务,一个模型抓取任务导航任务放置任务新任务模型彼此分开,能力限于特定任务 讲义方向 一个模型,搞定所有任务通用模型多任务 · 更强泛化抓取导航放置新任务 发展方向不等于边界消失:仍要面对推理、算力、幻觉与安全对齐

讲义给出的方向,是从“一任务一模型”走向“一个模型搞定所有任务”。

12 // COURSE POSITION

本章是选型知识储备

平台当前支持行为克隆 BC已在第十章完成实操 本章要求理解原理与差异不要求从零实现 VLA 讲义后续安排逐步集成训练支持扩散策略 · VLA 学完后,应能回答四个问题 01 BC 与扩散策略的本质区别何时需要表达多种合理动作 02 需要理解语言时如何选择识别 VLA 的适用条件与边界 03 BC 为什么会出现分布偏移说明偏离后误差如何继续累积 04 V、L、A 分别代表什么视觉、语言与动作如何连接

平台当前支持 BC;其余内容用于理解原理差异与做出训练方法选择。

RECAP // CHAPTER 11

从模仿、生成,到 理解

01

给 AI 看人怎么做,让它 学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02

先模仿获得基线,再用奖励 继续优化

实用路线是先用模仿学习快速可用

03

两扇门都能走,不要输出 中间值

扩散策略能表达多种合理动作分布

04

看到画面,听懂指令,再 做出动作

VLA 在视觉与动作之间加入语言理解

05

RT-2 借知识,Octo 降门槛

RT-2 证明世界知识可迁移到控制

任务固定选 BC,多方案精细操作选扩散,需要语言与泛化时考虑 VLA。

SOURCE QUIZ // 8 MCQ

单选题 · 8题

第 1 / 8 题原讲义题库
得分 0 / 8
SOURCE SHORT 01

简答一 · 分布偏移

什么是行为克隆的"分布偏移"问题?请用生活化的例子说明。

YOUR RESPONSE先独立组织答案,再查看讲义解析

分布偏移(Distribution Shift)是行为克隆最核心的问题。简单来说:

训练时,模型只见过"专家完美操作"的状态。就像一个学车的新手,教练只教过他怎么在空旷的练习场开。一旦他上路,遇到一个练习场没见过的路口(偏离了"训练分布"),他就不知道该怎么办了——而且越错越远。

在机器人中,一旦模型在推理时输出一个稍微偏离专家轨迹的动作,机器人就会进入一个"训练数据中没见过的状态"。模型在这个新状态下继续预测,因为没见过,预测更不准,于是进入更陌生的状态——形成恶性循环,最终撞墙。

DAgger 算法通过收集模型"犯错"时的状态加入训练集,让模型学会"偏离后如何纠正",从而缓解此问题。

SOURCE SHORT 02

简答二 · VLA 三步流程

请简述 VLA 模型的三步工作流程。

YOUR RESPONSE先独立组织答案,再查看讲义解析

VLA 模型的工作流程分为三步:

第一步:视觉编码——用视觉编码器(如 ViT)把摄像头拍摄的图像转换成"视觉 Token",即模型能理解的数字表示。

第二步:语言编码——用文本分词器把人类指令(如"把杯子放在桌上")转换成"语言 Token"。

第三步:联合推理与动作输出——把视觉 Token 和语言 Token 一起输入大语言模型(LLM),LLM 利用其预训练的世界知识,理解"看到的是什么"和"要做什么",然后输出"动作 Token"。动作 Token 经过解码器,转换成机器人可执行的具体动作指令(如关节角度、末端位姿)。

整个流程的核心是:大语言模型充当"大脑",把视觉信息和语言指令融合,做出决策。

SOURCE SHORT 03

简答三 · 泛化能力对比

请对比行为克隆、扩散策略、VLA 模型在泛化能力上的差异,并说明原因。

YOUR RESPONSE先独立组织答案,再查看讲义解析

三者泛化能力从低到高排列:

行为克隆(泛化能力低):因为 BC 只是"逐帧模仿",没有理解任务的高层语义。一旦场景变化(光照不同、物体位置偏移),模型就不知道如何处理。它学到的是"特定场景下的特定动作",而不是"导航/操作的一般规律"。

扩散策略(泛化能力中):扩散策略通过"去噪过程"学习动作的分布,天然对噪声和变化有一定鲁棒性。它的多模态输出能力也让它在面对"多种合理方案"时不会崩溃。但扩散策略仍然没有理解"任务目标"——它只是学会了更鲁棒的"动作模式"。

VLA 模型(泛化能力高):VLA 模型的核心优势在于"理解"——它借用了大语言模型中的世界知识。比如,即使模型从未见过"蓝色杯子",只要它知道"杯子"是什么,就能根据语言指令找到它。这种"语义理解"能力让 VLA 在面对全新场景和新物体时,泛化能力远超 BC 和扩散策略。