# 具身智能基础第9章《把虚拟世界变成数据工厂》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 8～9 分钟

建议课堂时长：约 13～19 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【把虚拟世界变成数据工厂】

【所属章节和小节】具身智能基础 第9章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“把虚拟世界变成数据工厂”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【真实采集很贵，离屏把数据变便宜】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“真实采集很贵，离屏把数据变便宜”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“真实采集很贵，离屏把数据变便宜”，图中的“真实采集、速度 · 约 1…、成本 · 人工 …”标出关键证据。后台自动批量同时降低采集与标注成本，但渲染产物仍须经过质量检查。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 不看屏幕的场景补充。

【本页要点】离屏渲染把可控三维场景批量转换成可用训练画面。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】offscreen-capture.webp

## P4【不看屏幕，也能批量拍照】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“不看屏幕，也能批量拍照”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“不看屏幕，也能批量拍照”，图中的“普通渲染、取景 → 显示 …、GPU”标出关键证据。离屏渲染直接在 GPU 内存完成图像生成，并把结果写入内存或磁盘。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【五个阶段，把 3D 变成训练样本】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“五个阶段，把 3D 变成训练样本”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“五个阶段，把 3D 变成训练样本”，图中的“场景加载、USD、相机设置”标出关键证据。先准备场景与相机，再由 GPU 计算，最后把图像和元数据一起组装导出。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】场景加载；USD；相机设置；位置 · 角度。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【离屏 ≠ 离线：这是两个维度】

【所属章节和小节】具身智能基础 第9章｜小节一 · 不看屏幕

【本页目标】能够解释“离屏 ≠ 离线：这是两个维度”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“离屏 ≠ 离线：这是两个维度”，图中的“AXIS A、图像送到哪里、ON-SCREEN”标出关键证据。离屏只说明图像不直接送显示器；是否实时、画质高低仍由任务时限和渲染…。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】AXIS A；图像送到哪里；ON-SCREEN；显示器 / 交互视口。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【四类轨迹，各自覆盖不同任务】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“四类轨迹，各自覆盖不同任务”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“四类轨迹，各自覆盖不同任务”，图中的“环绕轨迹、物体识别、俯视扫描”标出关键证据。看物体用环绕，扫区域用俯视，走廊用线性，关键位置用多点巡检。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 关键帧定轨迹的场景补充。

【本页要点】关键帧定义路径变化，采样帧决定何时触发渲染。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】keyframe-trajectory.webp

## P9【关键帧定轨迹， 采样帧才触发渲染】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“关键帧定轨迹， 采样帧才触发渲染”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“关键帧定轨迹， 采样帧才触发渲染”，图中的“KEYFRAMES、K0、K1”标出关键证据。关键帧定义轨迹形状与相机姿态；系统按采样间隔取得位姿。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【少做重复计算，把 GPU 用在信息增量】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“少做重复计算，把 GPU 用在信息增量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“少做重复计算，把 GPU 用在信息增量”，图中的“帧间隔、视角变化 3–5°、多 GPU 并行”标出关键证据。用 3–5° 帧间隔减少近似帧，再用并行与增量渲染提升吞吐。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】帧间隔；视角变化 3–5°；多 GPU 并行；G1。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【训练数据不是散图，而是一棵文件树】

【所属章节和小节】具身智能基础 第9章｜小节二 · 关键帧定轨迹

【本页目标】能够解释“训练数据不是散图，而是一棵文件树”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“训练数据不是散图，而是一棵文件树”，图中的“render_o…、rgb/、depth/”标出关键证据。完整样本同时保存图像、深度或分割结果，以及位姿、标注和渲染配置。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】render_output/；rgb/ · PNG；depth/ · 距离；segmentation/。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【一次渲染，接入四种训练生态】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“一次渲染，接入四种训练生态”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“一次渲染，接入四种训练生态”，图中的“渲染数据包、RGB、POSE”标出关键证据。PyTorch、LeRobot 与 TensorFlow 可自动转…。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【本节场景补充】

【核心主题】小节三 · 一张图要可训练的场景补充。

【本页要点】训练样本要同时保存画面、相机条件和可追溯的组织结构。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】training-ready.webp

## P14【一张图要可训练，必须知道从哪看见】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“一张图要可训练，必须知道从哪看见”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“一张图要可训练，必须知道从哪看见”，图中的“RGB FRAM…、FRAME ID、POSE”标出关键证据。帧 ID 把 RGB、深度、相机位姿和对象标注绑定成一个可用训练样本。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【五个参数，决定速度与质量】

【所属章节和小节】具身智能基础 第9章｜小节四 · 质量与平台流程

【本页目标】能够解释“五个参数，决定速度与质量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“五个参数，决定速度与质量”，图中的“参数、推荐值、使用条件”标出关键证据。参数没有脱离场景的最优值：先锁用途，再在分辨率、光照与显存之间取舍。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【九成求量，一成求关键质量】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“九成求量，一成求关键质量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“九成求量，一成求关键质量”，图中的“快速模式、初期训练、高质量模式”标出关键证据。混合策略用 90% 快速数据保数量，用 10% 关键帧精渲染保质量。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】快速模式；初期训练 · 大数据量；高质量模式；最终训练 · Sim-to-Real。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【先写清条件，再估一千帧时间】

【所属章节和小节】具身智能基础 第9章｜小节四 · 质量与平台流程

【本页目标】能够解释“先写清条件，再估一千帧时间”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“先写清条件，再估一千帧时间”，图中的“1000 FRA…、简单 · 5物体…、0.01 秒/帧”标出关键证据。估时必须绑定物体数、分辨率与光追条件；平台实测与表中估算不可混为同…。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【场景与轨迹，先过预览门】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“场景与轨迹，先过预览门”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“场景与轨迹，先过预览门”，图中的“5.1、打开场景管理、选择 wareh…”标出关键证据。先确认 USD 场景可见。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【一张控制台，锁定输出契约】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“一张控制台，锁定输出契约”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“一张控制台，锁定输出契约”，图中的“图像与质量、1280×720、4x MSAA”标出关键证据。启动前同时核对图像质量、输出通道、保存路径与采样帧数，避免整批返工。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【确认参数后，盯住进度与警告】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“确认参数后，盯住进度与警告”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“确认参数后，盯住进度与警告”，图中的“确认渲染参数、分辨率、轨迹 · 72 帧”标出关键证据。确认弹窗是最后一道参数门；运行中同时看帧数、速度、剩余时间与警告信息。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】确认渲染参数；分辨率 · 通道 · 路径；轨迹 · 72 帧；开始渲染。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【逐帧检查，把异常标出来重渲】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“逐帧检查，把异常标出来重渲”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“逐帧检查，把异常标出来重渲”，图中的“黑屏、相机被遮挡、模糊”标出关键证据。浏览输出时逐帧核对黑屏、模糊与缺物体；只把标记的异常帧送回重渲。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】黑屏；相机被遮挡；模糊；运动模糊过高。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P22【检查通过后，再选导出格式】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“检查通过后，再选导出格式”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“检查通过后，再选导出格式”，图中的“结果检查、异常帧已重渲、标准格式 · 推荐”标出关键证据。标准格式保留 RGB、深度、位姿和标注；也可选 LeRobot。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】结果检查；异常帧已重渲；标准格式 · 推荐；RGB + 深度 + 位姿 + 标注。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P23【按症状定位，不要盲目重跑】

【所属章节和小节】具身智能基础 第9章｜小节五 · Module B 实操

【本页目标】能够解释“按症状定位，不要盲目重跑”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“按症状定位，不要盲目重跑”，图中的“症状、原因、处理”标出关键证据。先把症状映射到光照、参数、通道、标注或显存，再执行对应的最小修复。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】症状；原因；处理；图像全黑。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P24【同一条轨迹，生成十个不同世界】

【所属章节和小节】具身智能基础 第9章｜小节三 · 一张图要可训练

【本页目标】能够解释“同一条轨迹，生成十个不同世界”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“同一条轨迹，生成十个不同世界”，图中的“固定核心、同一场景、同一轨迹”标出关键证据。域随机化改变光照、纹理与物体状态，让模型提前见过真实环境中的变化。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】固定核心；同一场景；同一轨迹；RANDOMIZE。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P25【十轮随机化，得到七百二十帧】

【所属章节和小节】具身智能基础 第9章｜小节六 · 域随机化配置

【本页目标】能够解释“十轮随机化，得到七百二十帧”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“十轮随机化，得到七百二十帧”，图中的“光照、位置 0.3m、强度 0.6–1…”标出关键证据。平台把光照、材质和物体状态设为随机变量，十轮分别写入独立子文件夹。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P26【从质量配置，到域随机化】

【所属章节和小节】具身智能基础 第9章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P27【单选题 · 10题】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 10题”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P28【实操一 · 完整离屏渲染】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页任务是“实操一 · 完整离屏渲染”。先读清限制与提交物，再逐项完成并保留过程证据；评分默认隐藏，写完方案后再展开自检。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P29【实操二 · 域随机化实验】

【所属章节和小节】具身智能基础 第9章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

面对“实操二 · 域随机化实验”，请先列出操作步骤和需要提交的证据，再独立作答；参考内容暂不展开，完成后才用于复核。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

