# 具身智能基础第12章《跨过最后一道 现实鸿沟》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 5～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【跨过最后一道 现实鸿沟】

【所属章节和小节】具身智能基础 第12章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“跨过最后一道 现实鸿沟”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 仿真冠军，到了现实 可能撞墙】

【所属章节和小节】具身智能基础 第12章｜小节一 · 仿真冠军，到了现实 可能撞墙

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 仿真冠军，到了现实 可能撞墙”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节一 · 仿真冠军；仿真冠军，到了现实 可能撞墙；差距来自视觉、物理和 传感器；不要只做得像，要做得 足够多样。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 仿真冠军，到了现实 可能撞墙的场景补充。

【本页要点】仿真与现实的视觉、物理和传感器差距会改变策略表现。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】sim-to-real-gap.webp

## P4【仿真冠军，到了现实 可能撞墙】

【所属章节和小节】具身智能基础 第12章｜小节一 · 仿真冠军

【本页目标】能够解释“仿真冠军，到了现实 可能撞墙”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“仿真冠军，到了现实 可能撞墙”，图中的“SIMULATI…、85%、GAP”标出关键证据。Sim-to-Real Gap 是仿真训练模型进入真实环境后出现的…。同时注意边界。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【差距来自视觉、物理和 传感器】

【所属章节和小节】具身智能基础 第12章｜小节一 · 仿真冠军

【本页目标】能够解释“差距来自视觉、物理和 传感器”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“差距来自视觉、物理和 传感器”，图中的“视觉差异、光照 · 阴影、纹理 · 白平衡”标出关键证据。真实环境会同时改变外观、运动规律和观测质量，三类差异共同拉低性能。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【不要只做得像，要做得 足够多样】

【所属章节和小节】具身智能基础 第12章｜小节一 · 仿真冠军

【本页目标】能够解释“不要只做得像，要做得 足够多样”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“不要只做得像，要做得 足够多样”，图中的“光照、纹理、位置”标出关键证据。域随机化扩大仿真覆盖面，让真实环境落入模型已经见过的变化范围。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】光照；纹理；位置；噪声。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 每轮在线增广，都看见 新变化】

【所属章节和小节】具身智能基础 第12章｜小节二 · 每轮在线增广，都看见 新变化

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 每轮在线增广，都看见 新变化”。请沿着编号核对先后关系，并用每张卡的摘要确认该页承担的机制、证据或边界任务。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节二 · 每轮在线增广；每轮在线增广，都看见 新变化；大量仿真预训练，少量真实 微调；模型留在机器人，延迟 更低。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 每轮在线增广，都看见 新变化的场景补充。

【本页要点】持续增广让系统在新变化出现后仍能补足训练分布。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】online-augmentation.webp

## P9【每轮在线增广，都看见 新变化】

【所属章节和小节】具身智能基础 第12章｜小节二 · 每轮在线增广

【本页目标】能够解释“每轮在线增广，都看见 新变化”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“每轮在线增广，都看见 新变化”，图中的“SAME SAM…、每个 EPOCH…、亮度 / 对比度”标出关键证据。训练时在线增广让每轮图像略有不同，比离线复制更省空间也更防过拟合。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【大量仿真预训练，少量真实 微调】

【所属章节和小节】具身智能基础 第12章｜小节二 · 每轮在线增广

【本页目标】能够解释“大量仿真预训练，少量真实 微调”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“大量仿真预训练，少量真实 微调”，图中的“SIM DATA…、多样仿真场景预训练、GENERAL …”标出关键证据。域适配保留仿真学到的通用能力，再用少量真实数据调整环境特征。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【模型留在机器人，延迟 更低】

【所属章节和小节】具身智能基础 第12章｜小节二 · 每轮在线增广

【本页目标】能够解释“模型留在机器人，延迟 更低”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“模型留在机器人，延迟 更低”，图中的“EDGE / J…、AI、MODEL LO…”标出关键证据。边缘端把推理留在机器人本体，获得低延迟、离线可用与本地隐私。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】EDGE / JETSON；AI；MODEL LOCAL；< 10 ms。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【小节三 · .pth 经过 ONNX，最终变成 TensorRT】

【所属章节和小节】具身智能基础 第12章｜小节三 · .pth 经过 ONNX，最终变成 TensorRT

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · .pth 经过 ONNX”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。再核对条件。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节三 · .pth 经过 ONNX；.pth 经过 ONNX；三层安全，硬件急停 最高优先；安全层还要 独立、故障安全、可追溯。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【本节场景补充】

【核心主题】小节三 · .pth 经过 ONNX，最终变成 TensorRT的场景补充。

【本页要点】模型导出后仍需保留独立、可追溯的安全响应链。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】deployment-safety.webp

## P14【.pth 经过 ONNX，最终变成 TensorRT】

【所属章节和小节】具身智能基础 第12章｜小节三 · 模型导出与安全部署

【本页目标】能够解释“.pth 经过 ONNX”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“.pth 经过 ONNX”，图中的“PYTORCH、.pth、TRAIN”标出关键证据。PyTorch 用于训练。再用底部结论检查自己的理解。同时指出这条关系依赖的条件，以及可能失效的边界。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【三层安全，硬件急停 最高优先】

【所属章节和小节】具身智能基础 第12章｜小节三 · 模型导出与安全部署

【本页目标】能够解释“三层安全，硬件急停 最高优先”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请按画面的层级由外向内。本页聚焦“三层安全，硬件急停 最高优先”，图中的“L3 硬件、L2 固件、L1 软件”标出关键证据。安全优先级是物理急停、力矩限制、碰撞预测、AI 输出，故障时默认停止。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【安全层还要 独立、故障安全、可追溯】

【所属章节和小节】具身智能基础 第12章｜小节三 · 安全设计原则

【本页目标】能够解释“安全层还要 独立、故障安全、可追溯”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“安全层还要 独立、故障安全、可追溯”，图中的“架构优先级、回答：谁能覆写谁、物理急停”标出关键证据。优先级规定谁能覆写谁，三条设计原则规定保护如何可靠运行。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】架构优先级；回答：谁能覆写谁；物理急停；＞。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【低速起步，把异常送回 训练环】

【所属章节和小节】具身智能基础 第12章｜小节三 · 模型导出与安全部署

【本页目标】能够解释“低速起步，把异常送回 训练环”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“低速起步，把异常送回 训练环”，图中的“仿真训练、随机化 + 增广、模型导出”标出关键证据。部署从离线验证和 30% 低速开始，真实异常必须回流为新数据与新参数。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】仿真训练；随机化 + 增广；模型导出；边缘环境。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【真实考验，才算 真正能用】

【所属章节和小节】具身智能基础 第12章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】仿真冠军，到了现实 可能撞墙；不要只做得像，要做得 足够多样；大量仿真预训练，少量真实 微调；.pth 经过 ONNX。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【单选题 · 8题】

【所属章节和小节】具身智能基础 第12章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 8题”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【判断题 · 5题】

【所属章节和小节】具身智能基础 第12章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“判断题 · 5题”页面。请逐条判断陈述是否符合本章条件，并用画面中的机制说明理由；提交后再查看反馈，本段不播报答案。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

