# 具身智能基础第11章《机器人从模仿者 走向理解者》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 6～7 分钟

建议课堂时长：约 11～17 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【机器人从模仿者 走向理解者】

【所属章节和小节】具身智能基础 第11章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“机器人从模仿者 走向理解者”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 给 AI 看人怎么做，让它 学着做】

【所属章节和小节】具身智能基础 第11章｜小节一 · 给 AI 看人怎么做，让它 学着做

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 给 AI 看人怎么做”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节一 · 给 AI 看人怎么做；给 AI 看人怎么做，让它 学着做；学到相关性，不等于理解 为什么；先模仿获得基线，再用奖励 继续优化。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 给 AI 看人怎么做，让它 学着做的场景补充。

【本页要点】先从人的示范中学习可执行基线，再讨论更强的优化方式。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】imitation-learning.webp

## P4【给 AI 看人怎么做，让它 学着做】

【所属章节和小节】具身智能基础 第11章｜小节一 · 给 AI 看人怎么做

【本页目标】能够解释“给 AI 看人怎么做，让它 学着做”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“给 AI 看人怎么做，让它 学着做”，图中的“01 / EXP…、人类专家示范、观测与动作”标出关键证据。模仿学习以专家示范为监督，行为克隆是其中最直接的一种方法。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【学到相关性，不等于理解 为什么】

【所属章节和小节】具身智能基础 第11章｜小节一 · 给 AI 看人怎么做

【本页目标】能够解释“学到相关性，不等于理解 为什么”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“学到相关性，不等于理解 为什么”，图中的“专家轨迹、先减速、再转弯”标出关键证据。行为克隆可能复制表面共现模式，却没有学会动作背后的因果条件。请复核。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】专家轨迹；先减速；再转弯；MODEL SEES。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【先模仿获得基线，再用奖励 继续优化】

【所属章节和小节】具身智能基础 第11章｜小节一 · 给 AI 看人怎么做

【本页目标】能够解释“先模仿获得基线，再用奖励 继续优化”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“先模仿获得基线，再用奖励 继续优化”，图中的“IMITATION、专家示范、快速获得能用策略”标出关键证据。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】IMITATION；专家示范；快速获得能用策略；BASELINE FIRST。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 从动作噪声中，一步步 去噪成轨迹】

【所属章节和小节】具身智能基础 第11章｜小节二 · 从动作噪声中，一步步 去噪成轨迹

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 从动作噪声中，一步步 去噪成轨迹”。请沿着编号核对先后关系，并用每张卡的摘要确认该页承担的机制、证据或边界任务。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节二 · 从动作噪声中；从动作噪声中，一步步 去噪成轨迹；两扇门都能走，不要输出 中间值；精细动作更强，但反应 更慢。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 从动作噪声中，一步步 去噪成轨迹的场景补充。

【本页要点】扩散策略从动作噪声出发，逐步收敛为完整轨迹。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】diffusion-trajectory.webp

## P9【从动作噪声中，一步步 去噪成轨迹】

【所属章节和小节】具身智能基础 第11章｜小节二 · 从动作噪声中

【本页目标】能够解释“从动作噪声中，一步步 去噪成轨迹”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“从动作噪声中，一步步 去噪成轨迹”，图中的“随机动作噪声、DENOISE、T → 0”标出关键证据。扩散策略把动作序列当生成目标，从噪声中逐步恢复出连贯方案。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【两扇门都能走，不要输出 中间值】

【所属章节和小节】具身智能基础 第11章｜小节二 · 从动作噪声中

【本页目标】能够解释“两扇门都能走，不要输出 中间值”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“两扇门都能走，不要输出 中间值”，图中的“WALL、BC 平均：正中间、方案 A · 左门”标出关键证据。扩散策略能表达多种合理动作分布，避免把两个方案平均成危险动作。请复核。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】WALL；BC 平均：正中间；方案 A · 左门；方案 B · 右门。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【精细动作更强，但反应 更慢】

【所属章节和小节】具身智能基础 第11章｜小节二 · 从动作噪声中

【本页目标】能够解释“精细动作更强，但反应 更慢”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“精细动作更强，但反应 更慢”，图中的“适合、慢速·精细操作、装配 · 手术 …”标出关键证据。多步去噪带来表达力也带来延迟，扩散策略更适合慢速精细操作。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】适合；慢速·精细操作；装配 · 手术 · 灵巧操作；LATENCY。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【小节三 · 看到画面，听懂指令，再 做出动作】

【所属章节和小节】具身智能基础 第11章｜小节三 · 看到画面，听懂指令，再 做出动作

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 看到画面，听懂指令，再 做出动作”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节三 · 看到画面；看到画面，听懂指令，再 做出动作；视觉 Token 与语言 Token；三大策略，按任务条件选。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【本节场景补充】

【核心主题】小节三 · 看到画面，听懂指令，再 做出动作的场景补充。

【本页要点】视觉信息与语言指令汇合后，才能支持面向动作的决策。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】vision-language-action.webp

## P14【看到画面，听懂指令，再 做出动作】

【所属章节和小节】具身智能基础 第11章｜小节三 · 看到画面

【本页目标】能够解释“看到画面，听懂指令，再 做出动作”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“看到画面，听懂指令，再 做出动作”，图中的“VISION、摄像头画面、LANGUAGE”标出关键证据。VLA 在视觉与动作之间加入语言理解，让机器人按自然语言完成任务。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【视觉 Token 与语言 Token，在 LLM 中 会合】

【所属章节和小节】具身智能基础 第11章｜小节三 · 看到画面

【本页目标】能够解释“视觉 Token 与语言 Token”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“视觉 Token 与语言 Token”，图中的“IMAGE、ViT 编码、视觉 TOKEN”标出关键证据。VLA 将视觉与语言编码为 Token。同时指出这条关系依赖的条件，以及可能失效的边界。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】IMAGE；ViT 编码；视觉 TOKEN；TEXT。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【三大策略，按任务条件选】

【所属章节和小节】具身智能基础 第11章｜小节四 · 能力比较与选型

【本页目标】能够解释“三大策略，按任务条件选”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“三大策略，按任务条件选”，图中的“维度、行为克隆 BC、扩散策略”标出关键证据。能力表先定边界，选型还要同时看任务、数据、时延与算力条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【从专用模型，走向 通用机器人】

【所属章节和小节】具身智能基础 第11章｜小节五 · 未来趋势

【本页目标】能够解释“从专用模型，走向 通用机器人”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“从专用模型，走向 通用机器人”，图中的“一个任务，一个模型、抓取任务、导航任务”标出关键证据。讲义给出的方向，是从“一任务一模型”走向“一个模型搞定所有任务”。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【本章是 选型知识储备】

【所属章节和小节】具身智能基础 第11章｜小节六 · 实训平台位置

【本页目标】能够解释“本章是 选型知识储备”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“本章是 选型知识储备”，图中的“平台当前支持、行为克隆 BC、已在第十章完成实操”标出关键证据。平台当前支持 BC；其余内容用于理解原理差异与做出训练方法选择。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【从模仿、生成，到 理解】

【所属章节和小节】具身智能基础 第11章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】给 AI 看人怎么做，让它 学着做；先模仿获得基线，再用奖励 继续优化；两扇门都能走，不要输出 中间值；看到画面，听懂指令，再 做出动作。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【单选题 · 8题】

【所属章节和小节】具身智能基础 第11章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 8题”页面。请先独立阅读题干与全部选项，再核对本章的条件后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【简答一 · 分布偏移】

【所属章节和小节】具身智能基础 第11章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页要求完成“简答一 · 分布偏移”。请按画面顺序操作，保存关键截图或文字证据；答案区域保持收起，结束后再比较差异。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P22【简答二 · VLA 三步流程】

【所属章节和小节】具身智能基础 第11章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

阅读“简答二 · VLA 三步流程”后，先确认任务边界、交付格式和验证标准，再写出方案；不要提前查看参考内容或评分提示。再用底部结论检查自己的理解。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P23【简答三 · 泛化能力对比】

【所属章节和小节】具身智能基础 第11章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页任务是“简答三 · 泛化能力对比”。先读清限制与提交物，再逐项完成并保留过程证据；评分默认隐藏，写完方案后再展开自检。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

