# 具身智能基础第7章《AI 先标人来验》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 6～6 分钟

建议课堂时长：约 10～16 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【AI 先标人来验】

【所属章节和小节】具身智能基础 第7章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“AI 先标人来验”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 没有答案的图， 教不会模型】

【所属章节和小节】具身智能基础 第7章｜小节一 · 没有答案的图， 教不会模型

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 没有答案的图， 教不会模型”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。再核对条件。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 没有答案的图， 教不会模型的场景补充。

【本页要点】没有与任务对应的标签，原始图像无法直接成为监督信号。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】raw-to-label.webp

## P4【没有答案的图， 教不会模型】

【所属章节和小节】具身智能基础 第7章｜小节一 · 没有答案的图

【本页目标】能够解释“没有答案的图， 教不会模型”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“没有答案的图， 教不会模型”，图中的“RAW IMAGE、只有像素、箱子 · 塑料 …”标出关键证据。标注把像素转成可监督的语义，让模型知道“什么答案才算正确”。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【同一个物体， 六种答案】

【所属章节和小节】具身智能基础 第7章｜小节一 · 没有答案的图

【本页目标】能够解释“同一个物体， 六种答案”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“同一个物体， 六种答案”，图中的“类别、CLASS、BOX”标出关键证据。类别回答“是什么”。同时指出这条关系依赖的条件，以及可能失效的边界。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【从零作业，变成批改作业】

【所属章节和小节】具身智能基础 第7章｜小节一 · 没有答案的图

【本页目标】能够解释“从零作业，变成批改作业”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“从零作业，变成批改作业”，图中的“纯人工 / 从零、VLM + 人工、找物体 → 画框”标出关键证据。效率提升来自工作重心变化：机器先给候选答案，人负责检查与纠正。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 图像 + 指令，输出候选标签】

【所属章节和小节】具身智能基础 第7章｜小节二 · 图像 + 指令，输出候选标签

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

来到“小节二 · 图像 + 指令，输出候选标签”。请沿着编号核对先后关系，并用每张卡的摘要确认该页承担的机制、证据或边界任务。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 图像 + 指令，输出候选标签的场景补充。

【本页要点】图像与指令可先产出候选标签，但不能代替人工核对。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】vlm-prelabel.webp

## P9【图像 + 指令，输出候选标签】

【所属章节和小节】具身智能基础 第7章｜小节二 · 图像 + 指令

【本页目标】能够解释“图像 + 指令，输出候选标签”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“图像 + 指令，输出候选标签”，图中的“场景图像、MAIN CAM…、标注指令”标出关键证据。VLM 输出先被转换为结构化标注，再叠加到视口等待人工确认。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【会看大概， 不会精确测量】

【所属章节和小节】具身智能基础 第7章｜小节二 · 图像 + 指令

【本页目标】能够解释“会看大概， 不会精确测量”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“会看大概， 不会精确测量”，图中的“VLM 擅长、常见物体类别、大致材质与颜色”标出关键证据。精确质量和尺寸应读取 3D/物理参数，不能把视觉猜测当测量值。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【预标注之后，必须过三道门】

【所属章节和小节】具身智能基础 第7章｜小节二 · 图像 + 指令

【本页目标】能够解释“预标注之后，必须过三道门”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“预标注之后，必须过三道门”，图中的“VLM、自动预标注、人工校验”标出关键证据。标准流程是预标注、人工修正、确认保存；任何一步都不能直接跳过审核。再核对条件。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【小节三 · 错在哪里，就修哪里】

【所属章节和小节】具身智能基础 第7章｜小节三 · 错在哪里，就修哪里

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · 错在哪里，就修哪里”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【本节场景补充】

【核心主题】小节三 · 错在哪里，就修哪里的场景补充。

【本页要点】错误类型被定位后，才知道应修改类别、边界还是属性。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】label-qc.webp

## P14【错在哪里，就修哪里】

【所属章节和小节】具身智能基础 第7章｜小节三 · 错在哪里，就 修哪里

【本页目标】能够解释“错在哪里，就修哪里”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“错在哪里，就修哪里”，图中的“REVIEW、DIAGNOSE、类别错误”标出关键证据。类别错就改标签，边界错就修掩码，漏标要补，物理属性要回到场景参数核对。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P15【高质量标注， 四项同时过关】

【所属章节和小节】具身智能基础 第7章｜小节三 · 错在哪里，就 修哪里

【本页目标】能够解释“高质量标注， 四项同时过关”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“高质量标注， 四项同时过关”，图中的“完整性、NO MISSI…、准确性”标出关键证据。完整、准确、精确、一致缺一不可；数据量不能补偿系统性错标。再用底部结论检查自己的理解。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【确认一次，写入两类出口】

【所属章节和小节】具身智能基础 第7章｜小节三 · 错在哪里，就 修哪里

【本页目标】能够解释“确认一次，写入两类出口”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“确认一次，写入两类出口”，图中的“CONFIRMED、LABEL SET、SAVE”标出关键证据。标注既可留在 USD Prim 属性中，也可导出标准格式进入训练管线。同时指出这条关系依赖的条件，以及可能失效的边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【机器提速， 人工保质】

【所属章节和小节】具身智能基础 第7章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【单选题 · 10题】

【所属章节和小节】具身智能基础 第7章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 · 10题”页面。请先独立阅读题干与全部选项，再核对本章的证据后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【实操一 · 单物体全流程】

【所属章节和小节】具身智能基础 第7章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

面对“实操一 · 单物体全流程”，请先列出操作步骤和需要提交的证据，再独立作答；参考内容暂不展开，完成后才用于复核。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【实操二 · 三物体标注】

【所属章节和小节】具身智能基础 第7章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“实操二 · 三物体标注”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【实操三 · 错误排查】

【所属章节和小节】具身智能基础 第7章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页要求完成“实操三 · 错误排查”。请按画面顺序操作，保存关键截图或文字证据；答案区域保持收起，结束后再比较差异。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图

