# 具身智能基础第2章《认识 AI 的身体》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 6～7 分钟

建议课堂时长：约 11～17 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【认识 AI 的身体】

【所属章节和小节】具身智能基础 第2章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“认识 AI 的身体”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 身体不是零件堆，是一个持续闭环】

【所属章节和小节】具身智能基础 第2章｜小节一 · 身体不是零件堆，是一个持续闭环

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 身体不是零件堆，是一个持续闭环”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节一 · 身体不是零件堆；身体不是零件堆，是一个持续闭环；机器人的五官各管一件事；从规则到 VLA：决策能力逐层上升。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 身体不是零件堆，是一个持续闭环的场景补充。

【本页要点】传感、计算与执行器必须构成持续闭环，而不是孤立零件。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】body-loop.webp

## P4【身体不是零件堆，是一个持续闭环】

【所属章节和小节】具身智能基础 第2章｜小节一 · 身体不是零件堆

【本页目标】能够解释“身体不是零件堆，是一个持续闭环”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“身体不是零件堆，是一个持续闭环”，图中的“感知、看见与感受、决策”标出关键证据。机器人的智能来自“感知—决策—执行—再感知”的连续循环。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【机器人的五官各管一件事】

【所属章节和小节】具身智能基础 第2章｜小节一 · 身体不是零件堆

【本页目标】能够解释“机器人的五官各管一件事”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“机器人的五官各管一件事”，图中的“RGB / RG…、LiDAR、IMU”标出关键证据。传感器没有“覆盖所有任务眼睛”：颜色、距离、姿态、力与角度必须分工采集。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【从规则到 VLA：决策能力逐层上升】

【所属章节和小节】具身智能基础 第2章｜小节一 · 身体不是零件堆

【本页目标】能够解释“从规则到 VLA：决策能力逐层上升”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“从规则到 VLA：决策能力逐层上升”，图中的“谁来跑这些决策”标出关键证据。决策策略决定“做什么”，计算硬件保证它能在机器人上及时算出来。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】谁来跑这些决策。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 把计算结果变成物理动作】

【所属章节和小节】具身智能基础 第2章｜小节二 · 把计算结果变成物理动作

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 把计算结果变成物理动作”。请沿着编号核对先后关系，并用每张卡的摘要确认该页承担的机制、证据或边界任务。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节二 · 把计算结果变成物理动作；把计算结果变成物理动作；关节只有两种基本动作： 转与移；六轴机械臂为什么是 6 自由度。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 把计算结果变成物理动作的场景补充。

【本页要点】关节把控制信号转换为可测量的旋转或平移运动。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】joint-actuation.webp

## P9【把计算结果变成物理动作】

【所属章节和小节】具身智能基础 第2章｜小节二 · 把计算结果变成 物理…

【本页目标】能够解释“把计算结果变成物理动作”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“把计算结果变成物理动作”，图中的节点和连线标出关键证据。执行器提供运动，末端执行器负责直接接触并改变环境。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【关节只有两种基本动作： 转与移】

【所属章节和小节】具身智能基础 第2章｜小节二 · 把计算结果变成 物理…

【本页目标】能够解释“关节只有两种基本动作： 转与移”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“关节只有两种基本动作： 转与移”，图中的“旋转关节、平移关节”标出关键证据。旋转关节改变角度，平移关节改变直线位置；两者组合出机器人的运动链。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【六轴机械臂为什么是 6 自由度 ？】

【所属章节和小节】具身智能基础 第2章｜小节二 · 把计算结果变成 物理…

【本页目标】能够解释“六轴机械臂为什么是 6 自由度”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“六轴机械臂为什么是 6 自由度”，图中的“J1、J2、J3”标出关键证据。六个关节角度共同编码末端的三维位置与三维姿态。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】J1；J2；J3；J4。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【同一个位置，要先说清楚参考谁】

【所属章节和小节】具身智能基础 第2章｜小节二 · 把计算结果变成 物理…

【本页目标】能够解释“同一个位置，要先说清楚参考谁”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“同一个位置，要先说清楚参考谁”，图中的“WORLD、BASE、END”标出关键证据。坐标值只有和参考坐标系绑定，才能准确表达“在哪里、朝哪看”。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】WORLD；BASE；END；CAMERA。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【小节三 · URDF：机器人的静态结构说明书】

【所属章节和小节】具身智能基础 第2章｜小节三 · URDF：机器人的静态结构说明书

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · URDF：机器人的静态结构说明书”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节三 · URDF；URDF：机器人的静态结构说明书；RGB-D：给每个像素补上距离；IMU 能短时推算，但会产生积分漂移。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P14【本节场景补充】

【核心主题】小节三 · URDF：机器人的静态结构说明书的场景补充。

【本页要点】URDF 用连杆、关节和坐标关系表达机器人的静态身体结构。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】urdf-structure.webp

## P15【URDF：机器人的静态结构说明书】

【所属章节和小节】具身智能基础 第2章｜小节三 · URDF

【本页目标】能够解释“URDF：机器人的静态结构说明书”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“URDF：机器人的静态结构说明书”，图中的“URDF 写什么”标出关键证据。URDF 描述静态结构与关节约束；实时关节角度和健康状态由运行时数…。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【RGB-D：给每个像素补上距离】

【所属章节和小节】具身智能基础 第2章｜小节三 · URDF

【本页目标】能够解释“RGB-D：给每个像素补上距离”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“RGB-D：给每个像素补上距离”，图中的“深度从哪里来”标出关键证据。深度图把二维像素补成三维距离，让抓取、避障与空间理解成为可能。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【IMU 能短时推算，但会产生积分漂移】

【所属章节和小节】具身智能基础 第2章｜小节三 · URDF

【本页目标】能够解释“IMU 能短时推算，但会产生积分漂移”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“IMU 能短时推算，但会产生积分漂移”，图中的“微小测量误差”标出关键证据。IMU 擅长高频短时运动感知，长期定位必须依靠多传感器融合校正。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】微小测量误差，经过两次积分会被放大。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【把机器人的身体地图装进脑中】

【所属章节和小节】具身智能基础 第2章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】身体不是零件堆，是一个 持续闭环；从 规则 到 VLA；关节只有两种基本动作： 转 与 移；URDF：机器人的 静态结构说明书。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【单选题：身体地图校准】

【所属章节和小节】具身智能基础 第2章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题：身体地图校准”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。再核对条件。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【简答一：三层架构】

【所属章节和小节】具身智能基础 第2章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“简答一：三层架构”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【简答二：为什么恰好是六自由度 ？】

【所属章节和小节】具身智能基础 第2章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页要求完成“简答二：为什么恰好是六自由度 ？”。请按画面顺序操作，保存关键截图或文字证据；答案区域保持收起，结束后再比较差异。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P22【简答三：为什么机器人需要深度 ？】

【所属章节和小节】具身智能基础 第2章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

阅读“简答三：为什么机器人需要深度 ？”后，先确认任务边界、交付格式和验证标准，再写出方案；不要提前查看参考内容或评分提示。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

