# 具身智能基础第3章《教机器人干活》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 6～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【教机器人干活】

【所属章节和小节】具身智能基础 第3章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“教机器人干活”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 遥操作真正生产的是训练数据】

【所属章节和小节】具身智能基础 第3章｜小节一 · 遥操作真正生产的是训练数据

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 遥操作真正生产的是训练数据”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节一；遥操作真正生产的是训练数据；三种主端，没有一种通吃所有任务；不碰机器人，也能把人的动作采下来。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 遥操作真正生产的是训练数据的场景补充。

【本页要点】遥操作的价值在于把人的示范转为可训练的观测—动作数据。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】teleoperation.webp

## P4【遥操作真正生产的是训练数据】

【所属章节和小节】具身智能基础 第3章｜小节一 · 遥操作真正生产的是 …

【本页目标】能够解释“遥操作真正生产的是训练数据”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“遥操作真正生产的是训练数据”，图中的“主端 Master、从端 Slave、数据记录”标出关键证据。在具身智能中，遥操作的核心价值是把人的示范转成可训练的观测—动作序列。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【三种主端，没有一种通吃所有任务】

【所属章节和小节】具身智能基础 第3章｜小节一 · 遥操作真正生产的是 …

【本页目标】能够解释“三种主端，没有一种通吃所有任务”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“三种主端，没有一种通吃所有任务”，图中的“ALOHA LE…、主从异构臂 HA…、VR 手柄 SP…”标出关键证据。选遥操作方案要同时权衡成本、精度、力反馈和任务工作空间。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【不碰机器人，也能把人的动作采下来】

【所属章节和小节】具身智能基础 第3章｜小节一 · 遥操作真正生产的是 …

【本页目标】能够解释“不碰机器人，也能把人的动作采下来”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“不碰机器人，也能把人的动作采下来”，图中的“第一人称、固定视角、多视角融合”标出关键证据。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】第一人称；固定视角；多视角融合。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 遥操作求精 ，无本体求多】

【所属章节和小节】具身智能基础 第3章｜小节二 · 遥操作求精 ，无本体求多

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 遥操作求精 ，无本体求多”。请沿着编号核对先后关系，并用每张卡的摘要确认该页承担的机制、证据或边界任务。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节二 · 遥操作求精 ，无本体求多；遥操作求精 ，无本体求多；一条轨迹，就是完整的观测—动作序列；LeRobot 把异构数据装进一个…。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 遥操作求精 ，无本体求多的场景补充。

【本页要点】精确示范与多样示范各有作用，应按数据缺口组合。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】precision-and-coverage.webp

## P9【遥操作求精 ，无本体求多】

【所属章节和小节】具身智能基础 第3章｜小节二 · 遥操作求 精

【本页目标】能够解释“遥操作求精 ，无本体求多”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“遥操作求精 ，无本体求多”，图中的“选型对照”标出关键证据。两种路线不是二选一：规模数据与高精度示范组合使用，才能彼此补位。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【一条轨迹，就是完整的观测—动作序列】

【所属章节和小节】具身智能基础 第3章｜小节二 · 遥操作求 精

【本页目标】能够解释“一条轨迹，就是完整的观测—动作序列”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“一条轨迹，就是完整的观测—动作序列”，图中的“T0 / STA…、T1、T2”标出关键证据。模型学习的不是孤立视频或关节值，而是每个时间步“看到什么、做了什么”。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【LeRobot 把异构数据装进一个标准包】

【所属章节和小节】具身智能基础 第3章｜小节二 · 遥操作求 精

【本页目标】能够解释“LeRobot 把异构数据装进一个标准包”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“LeRobot 把异构数据装进一个标准包”，图中的“一个 episo…”标出关键证据。统一目录、字段和时间戳，让数据能够直接进入存储、版本管理和训练管道。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】一个 episode 的关键字段。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【清晰度和时间精度，都不是越大越好】

【所属章节和小节】具身智能基础 第3章｜小节二 · 遥操作求 精

【本页目标】能够解释“清晰度和时间精度，都不是越大越好”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“清晰度和时间精度，都不是越大越好”，图中的“分辨率、帧率：先问动作有…”标出关键证据。参数选择要服务任务：画面足够辨识、时间采样足够跟上动作。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】分辨率：细节与存储的拉锯；帧率：先问动作有多快。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【小节三 · 同步误差会把正确数据配成错误因果】

【所属章节和小节】具身智能基础 第3章｜小节三 · 同步误差会把正确数据配成错误因果

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 同步误差会把正确数据配成错误因果”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。再核对条件。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节三；同步误差会把正确数据配成错误因果；数采工厂：把一次示范走成六步流水线；好数据靠质检 + 重采炼成。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P14【本节场景补充】

【核心主题】小节三 · 同步误差会把正确数据配成错误因果的场景补充。

【本页要点】相机、动作和时间戳不同步，会把正确动作配到错误观察上。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】synchronization.webp

## P15【同步误差会把正确数据配成错误因果】

【所属章节和小节】具身智能基础 第3章｜小节三 · 同步误差会把正确数据…

【本页目标】能够解释“同步误差会把正确数据配成错误因果”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“同步误差会把正确数据配成错误因果”，图中的“问题：相机晚了 …、硬件同步、最可靠”标出关键证据。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【数采工厂：把一次示范走成六步流水线】

【所属章节和小节】具身智能基础 第3章｜小节三 · 同步误差会把正确数据…

【本页目标】能够解释“数采工厂：把一次示范走成六步流水线”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“数采工厂：把一次示范走成六步流水线”，图中的“进入模块、检查硬件、创建任务”标出关键证据。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【好数据靠质检 + 重采炼成】

【所属章节和小节】具身智能基础 第3章｜小节三 · 同步误差会把正确数据…

【本页目标】能够解释“好数据靠质检 + 重采炼成”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“好数据靠质检 + 重采炼成”，图中的“DATA QA …、VISIBLE、STABLE”标出关键证据。质量门槛保证每条轨迹可信，轻微改变初始条件则让数据覆盖更多情况。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】DATA QA / CHECKLI…；VISIBLE；STABLE；SYNCED。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【采集链路的五个质量关口】

【所属章节和小节】具身智能基础 第3章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】遥操作真正生产的是 训练数据；不碰机器人，也能把人的动作 采下来；一条轨迹，就是完整的 观测—动作序列；同步误差会把正确数据配成 错误因果。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【单选题：采集链路压力测试】

【所属章节和小节】具身智能基础 第3章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题：采集链路压力测试”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【实操一：完成一次数据采集】

【所属章节和小节】具身智能基础 第3章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“实操一：完成一次数据采集”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【实操二：写一份数据质量报告】

【所属章节和小节】具身智能基础 第3章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页要求完成“实操二：写一份数据质量报告”。请按画面顺序操作，保存关键截图或文字证据；答案区域保持收起，结束后再比较差异。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

