11 // CHAPTER ROUTE

机器人从模仿者 走向理解者

具身智能 · 第十一章

行为克隆复制专家,扩散策略生成多种动作,VLA 把视觉、语言与行动接成一个“大脑”。

SECTION 01 / 阅读地图

小节一 · 给 AI 看人怎么做,让它学着做

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

给 AI 看人怎么做,让它学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

关键线索01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图
02

学到相关性,不等于理解为什么

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

关键线索专家轨迹先减速再转弯MODEL SEES
03

先模仿获得基线,再用奖励继续优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

关键线索IMITATION专家示范快速获得能用策略BASELINE FIRST

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

给 AI 看人怎么做,让它学着做

先从人的示范中学习可执行基线,再讨论更强的优化方式。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 给 AI 看人怎么做,让它学着做”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 给 AI 看人怎么做,让它学着做

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // IMITATION LEARNING

给 AI 看人怎么做,让它学着做

01 / EXPERT人类专家示范观测与动作,一帧帧配对图像 · 深度图线速度目标位置角速度IMITATION LEARNING让输出尽可能接近专家动作03 / POLICY机器人策略看到状态 → 做出动作

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02 // CAUSAL CONFUSION

学到相关性,不等于理解为什么

专家轨迹先减速再转弯MODEL SEES减速 → 转弯相关 ≠ 原因突发障碍等待“减速信号”可能来不及避让

行为克隆可能复制表面共现模式,却没有学会动作背后的因果条件。

03 // IL + RL

先模仿获得基线,再用奖励继续优化

IMITATION专家示范快速获得能用策略BASELINE FIRSTREINFORCEMENTR环境交互 · 奖励优化

实用路线是先用模仿学习快速可用,再用强化学习突破专家与数据边界。

SECTION 02 / 阅读地图

小节二 · 从动作噪声中,一步步去噪成轨迹

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

从动作噪声中,一步步去噪成轨迹

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

关键线索随机动作噪声DENOISET → 0条件:视觉与任务
02

两扇门都能走,不要输出中间值

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

关键线索WALLBC 平均:正中间方案 A · 左门方案 B · 右门
03

精细动作更强,但反应更慢

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

关键线索适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

从动作噪声中,一步步去噪成轨迹

扩散策略从动作噪声出发,逐步收敛为完整轨迹。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 从动作噪声中,一步步去噪成轨迹”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 从动作噪声中,一步步去噪成轨迹

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DIFFUSION POLICY

从动作噪声中,一步步去噪成轨迹

随机动作噪声DENOISET → 0条件:视觉与任务清晰动作序列

扩散策略把动作序列当生成目标,从噪声中逐步恢复出连贯方案。

05 // MULTIMODAL ACTION

两扇门都能走,不要输出中间值

WALLBC 平均:正中间方案 A · 左门方案 B · 右门Diffusion:采样一个清晰方案

扩散策略能表达多种合理动作分布,避免把两个方案平均成危险动作。

06 // DIFFUSION LIMITS

精细动作更强,但反应更慢

适合慢速·精细操作装配 · 手术 · 灵巧操作LATENCY多步去噪MULTI-STEP不擅长快速·低延迟任务快速导航 · 低延迟避障

多步去噪带来表达力也带来延迟,扩散策略更适合慢速精细操作。

SECTION 03 / 阅读地图

小节三 · 看到画面,听懂指令,再做出动作

本节导读

机器人如何把视觉与语言合并为动作,并在 BC、扩散策略与 VLA 之间做出选择?

01

视觉+语言→动作

VLA 结合画面与指令生成任务动作。

关键线索视觉输入语言指令动作输出
02

Token 在 LLM 中会合

视觉与语言编码为 Token,联合推理后解码动作。

关键线索视觉 Token语言 Token联合推理
03

三类策略怎么选

按任务、数据、时延与算力,在 BC、扩散策略和 VLA 间取舍。

关键线索行为克隆 BC扩散策略VLA 模型
04

从专用走向通用

方向是减少“一任务一模型”,提升跨任务复用。

关键线索跨任务复用通用控制能力迁移
05

平台当前做到哪一步

当前支持 BC;其余用于理解选型边界。

关键线索平台支持 BC选型边界训练路线

选型没有唯一答案:任务、数据、时延与算力共同决定策略。

VISUAL RECAP

本节场景补充

READ THE SCENE

看到画面,听懂指令,再做出动作

视觉信息与语言指令汇合后,才能支持面向动作的决策。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 看到画面,听懂指令,再做出动作”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 看到画面,听懂指令,再做出动作

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

07 // VLA

看到画面,听懂指令,再做出动作

VISION摄像头画面LANGUAGE“把杯子放到桌上”VLA世界知识 + 当前任务ACTION动作 TOKEN机器人可执行指令

VLA 在视觉与动作之间加入语言理解,让机器人按自然语言完成任务。

08 // VLA ARCHITECTURE

视觉 Token 与语言 Token,在 LLM 中会合

IMAGEViT 编码视觉 TOKENTEXTTokenizer语言 TOKENLLMV1V2L1L2预训练世界知识联合推理ACTION TOKEN关节角度末端位姿

VLA 将视觉与语言编码为 Token,由 LLM 联合推理,再解码为可执行动作。

10 // CAPABILITY & CHOICE

三大策略,按任务条件选

维度行为克隆 BC扩散策略VLA 模型 语言指令 多模态决策 训练数据极高 推理速度较慢 泛化能力 部署难度 选 BC任务简单固定 · 专家数据优质需快速部署 · 算力有限 选扩散策略需要多种合理方案 · 动作多样推理延迟不是关键问题 选 VLA需要理解语言 · 任务种类多变有足够计算资源

能力表先定边界,选型还要同时看任务、数据、时延与算力条件。

11 // FUTURE TREND

从专用模型,走向通用机器人

一个任务,一个模型抓取任务导航任务放置任务新任务模型彼此分开,能力限于特定任务 讲义方向 一个模型,搞定所有任务通用模型多任务 · 更强泛化抓取导航放置新任务 发展方向不等于边界消失:仍要面对推理、算力、幻觉与安全对齐

讲义给出的方向,是从“一任务一模型”走向“一个模型搞定所有任务”。

12 // COURSE POSITION

本章是选型知识储备

平台当前支持行为克隆 BC已在第十章完成实操 本章要求理解原理与差异不要求从零实现 VLA 讲义后续安排逐步集成训练支持扩散策略 · VLA 学完后,应能回答四个问题 01 BC 与扩散策略的本质区别何时需要表达多种合理动作 02 需要理解语言时如何选择识别 VLA 的适用条件与边界 03 BC 为什么会出现分布偏移说明偏离后误差如何继续累积 04 V、L、A 分别代表什么视觉、语言与动作如何连接

平台当前支持 BC;其余内容用于理解原理差异与做出训练方法选择。

RECAP // CHAPTER 11

从模仿、生成,到 理解

01

给 AI 看人怎么做,让它 学着做

模仿学习以专家示范为监督,行为克隆是其中最直接的一种方法。

02

先模仿获得基线,再用奖励 继续优化

实用路线是先用模仿学习快速可用

03

两扇门都能走,不要输出 中间值

扩散策略能表达多种合理动作分布

04

看到画面,听懂指令,再 做出动作

VLA 在视觉与动作之间加入语言理解

05

RT-2 借知识,Octo 降门槛

RT-2 证明世界知识可迁移到控制

任务固定选 BC,多方案精细操作选扩散,需要语言与泛化时考虑 VLA。

SOURCE QUIZ // 8 MCQ

单选题 · 8题

第 1 / 8 题原讲义题库
得分 0 / 8
SOURCE SHORT 01

简答一 · 分布偏移

什么是行为克隆的"分布偏移"问题?请用生活化的例子说明。

YOUR RESPONSE先独立组织答案,再查看讲义解析

分布偏移(Distribution Shift)是行为克隆最核心的问题。简单来说:

训练时,模型只见过"专家完美操作"的状态。就像一个学车的新手,教练只教过他怎么在空旷的练习场开。一旦他上路,遇到一个练习场没见过的路口(偏离了"训练分布"),他就不知道该怎么办了——而且越错越远。

在机器人中,一旦模型在推理时输出一个稍微偏离专家轨迹的动作,机器人就会进入一个"训练数据中没见过的状态"。模型在这个新状态下继续预测,因为没见过,预测更不准,于是进入更陌生的状态——形成恶性循环,最终撞墙。

DAgger 算法通过收集模型"犯错"时的状态加入训练集,让模型学会"偏离后如何纠正",从而缓解此问题。

SOURCE SHORT 02

简答二 · VLA 三步流程

请简述 VLA 模型的三步工作流程。

YOUR RESPONSE先独立组织答案,再查看讲义解析

VLA 模型的工作流程分为三步:

第一步:视觉编码——用视觉编码器(如 ViT)把摄像头拍摄的图像转换成"视觉 Token",即模型能理解的数字表示。

第二步:语言编码——用文本分词器把人类指令(如"把杯子放在桌上")转换成"语言 Token"。

第三步:联合推理与动作输出——把视觉 Token 和语言 Token 一起输入大语言模型(LLM),LLM 利用其预训练的世界知识,理解"看到的是什么"和"要做什么",然后输出"动作 Token"。动作 Token 经过解码器,转换成机器人可执行的具体动作指令(如关节角度、末端位姿)。

整个流程的核心是:大语言模型充当"大脑",把视觉信息和语言指令融合,做出决策。

SOURCE SHORT 03

简答三 · 泛化能力对比

请对比行为克隆、扩散策略、VLA 模型在泛化能力上的差异,并说明原因。

YOUR RESPONSE先独立组织答案,再查看讲义解析

三者泛化能力从低到高排列:

行为克隆(泛化能力低):因为 BC 只是"逐帧模仿",没有理解任务的高层语义。一旦场景变化(光照不同、物体位置偏移),模型就不知道如何处理。它学到的是"特定场景下的特定动作",而不是"导航/操作的一般规律"。

扩散策略(泛化能力中):扩散策略通过"去噪过程"学习动作的分布,天然对噪声和变化有一定鲁棒性。它的多模态输出能力也让它在面对"多种合理方案"时不会崩溃。但扩散策略仍然没有理解"任务目标"——它只是学会了更鲁棒的"动作模式"。

VLA 模型(泛化能力高):VLA 模型的核心优势在于"理解"——它借用了大语言模型中的世界知识。比如,即使模型从未见过"蓝色杯子",只要它知道"杯子"是什么,就能根据语言指令找到它。这种"语义理解"能力让 VLA 在面对全新场景和新物体时,泛化能力远超 BC 和扩散策略。