# AI基础第5章《机器开始看见世界》10–20秒微课语音逐字稿

适用对象：高校非相关专业学生与应用型本科学生

前置知识：无专业前置，仅需一般数字素养

本章学习结果：
1. 能够按讲义顺序解释本章的核心概念与关系。
2. 能够依据画面机制判断结论成立的条件和边界。
3. 能够完成讲义原测验，并用页面证据说明理由。

预计纯语音时长：约 6～7 分钟

建议课堂时长：约 11～17 分钟，包含停顿、作答与反馈

讲解主线：问题地图 → 分节机制 → 证据与边界 → 总结 → 讲义原测验

使用说明：仅将每页“语音逐字稿”正文送入 TTS；视觉说明、媒体状态、教师反馈与答案不朗读。

---

## P1【机器开始看见世界】

【所属章节和小节】AI基础 第5章｜章导入

【本页目标】能够说出本章的核心问题和阅读路线。

【预计播报时长】约 20 秒

【语音逐字稿】

这一章围绕“机器开始看见世界”展开。请先看下方路线卡，建立全章问题地图；后续每一页只处理一个概念、关系或教学动作。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P2【小节一 · 多模态 AI 让信息一起理解】

【所属章节和小节】AI基础 第5章｜小节一 · 多模态 AI 让信息一起理解

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“小节一 · 多模态 AI 让信息一起理解”的阅读地图。画面按顺序列出后续问题，并为每一页补上机制摘要；先定位核心问题，再进入证据页面。再核对条件。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节一；多模态 AI 让信息一起理解；VLM 的三段链路看见；谁在处理图文关系。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P3【本节场景补充】

【核心主题】小节一 · 多模态 AI 让信息一起理解的场景补充。

【本页要点】图像、声音和文字进入同一任务，信息才可以相互校验。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】multimodal-understanding.webp

## P4【多模态 AI 让信息一起理解】

【所属章节和小节】AI基础 第5章｜小节一 · 多模态 AI 让信息…

【本页目标】能够解释“多模态 AI 让信息一起理解”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“多模态 AI 让信息一起理解”，图中的节点和连线标出关键证据。多模态的关键不是“输入更多”，而是让不同线索共同参与理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P5【VLM 的三段链路看见 · 对齐 · 推理】

【所属章节和小节】AI基础 第5章｜小节一 · 多模态 AI 让信息…

【本页目标】能够解释“VLM 的三段链路看见 · 对齐 · 推理”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“VLM 的三段链路看见 · 对齐 · 推理”，图中的“图像向量、已对齐语义”标出关键证据。VLM 先把图像编码，再完成语义对齐，最后才生成与画面有关的回答。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P6【谁在处理图文关系？】

【所属章节和小节】AI基础 第5章｜小节一 · 多模态 AI 让信息…

【本页目标】能够解释“谁在处理图文关系”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“谁在处理图文关系”，图中的“通用交互、中文应用、开源研究”标出关键证据。代表模型的侧重点不同，但共同任务都是把图像与文字放进同一条理解链。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】通用交互；中文应用；开源研究。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P7【小节二 · 扩散模型： 从噪声回到画面】

【所属章节和小节】AI基础 第5章｜小节二 · 扩散模型： 从噪声回到画面

【本页目标】能够说明图像生成、视频连续性、机器人行动与数字孪生之间的递进关系。

【预计播报时长】约 40 秒

【语音逐字稿】

这一小节从生成一幅画面，逐步走到生成连续视频，再连接机器人的行动与训练。第一步，文字给出条件，扩散模型反复去噪，让图像逐步成形。第二步，视频不只要逐帧好看，还要保持物体身份、动作轨迹和光影背景连续。第三步，机器人把感知、任务理解、动作执行和反馈更新连成闭环。最后，数字孪生提供虚拟副本，让机器人先在仿真中试错，再把技能迁移到真实任务。四张卡的共同主线，是从“生成画面”走向“支撑行动”。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】四张编号卡依次呈现：文字条件与反复去噪、视频的物体与动作连续性、感知到行动的反馈闭环、虚拟试错到真实迁移。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P8【本节场景补充】

【核心主题】小节二 · 扩散模型： 从噪声回到画面的场景补充。

【本页要点】由噪声逐步还原结构，才形成可识别的画面。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】diffusion-process.webp

## P9【扩散模型： 从噪声回到画面】

【所属章节和小节】AI基础 第5章｜小节二 · 扩散模型

【本页目标】能够解释“扩散模型： 从噪声回到画面”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“扩散模型： 从噪声回到画面”，图中的节点和连线标出关键证据。扩散模型不是一次画完，而是在文字约束下反复去噪，逐步形成图像。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P10【视频生成的时间一致性】

【所属章节和小节】AI基础 第5章｜小节二 · 扩散模型

【本页目标】能够解释“视频生成的时间一致性”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着箭头从起点读到结果。本页聚焦“视频生成的时间一致性”，图中的“01 · 物体身份、02 · 动作轨迹、03 · 光影与…”标出关键证据。视频不仅要生成单帧，还要让动作、光影和物体在连续帧中保持连贯。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P11【机器人如何把理解变成行动】

【所属章节和小节】AI基础 第5章｜小节二 · 扩散模型

【本页目标】能够解释“机器人如何把理解变成行动”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请沿着闭环逐步追踪。本页聚焦“机器人如何把理解变成行动”，图中的“环境变化 / 下…”标出关键证据。多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】环境变化 / 下一轮感知。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P12【数字孪生： 先练再上场】

【所属章节和小节】AI基础 第5章｜小节二 · 扩散模型

【本页目标】能够解释“数字孪生： 先练再上场”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请对照画面左右两侧。本页聚焦“数字孪生： 先练再上场”，图中的“技能迁移”标出关键证据。在虚拟副本中反复试错，能降低训练成本与风险，再把技能迁移到真实任务。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】技能迁移。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P13【小节三 · TTS 的四级台阶从拼接到克隆】

【所属章节和小节】AI基础 第5章｜小节三 · TTS 的四级台阶从拼接到克隆

【本页目标】能够指出本小节的核心问题和阅读顺序。

【预计播报时长】约 20 秒

【语音逐字稿】

“小节三 · TTS 的四级台阶从拼接到克隆”负责把问题转成一条可检查的解释链。请依次读取标题和摘要，不把多个结论混在同一页。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】小节三；TTS 的四级台阶从拼接到克隆；三种 TTS 工具各有主场；听起来“好” 不止像真人。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P14【本节场景补充】

【核心主题】小节三 · TTS 的四级台阶从拼接到克隆的场景补充。

【本页要点】语音生成需要同时保留内容、韵律与说话风格。

【讲稿】这一页用一张场景图帮助我们把刚才的概念落到可观察的关系上。请先辨认图中的对象和环境，再看它们如何连接或相互作用。接着回到正文，核对这种关系为什么支持本节结论。图片不增加新的判断标准，真正需要记住的概念、条件与边界，仍以本节正文为准。

【对应视觉说明】ChatGPT 生成的本节场景补充图；用于支撑页面主张，不替代正文讲解。

【图片或视频文件名】speech-generation.webp

## P15【TTS 的四级台阶从拼接到克隆】

【所属章节和小节】AI基础 第5章｜小节三 · TTS 的四级台阶 …

【本页目标】能够解释“TTS 的四级台阶从拼接到克隆”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“TTS 的四级台阶从拼接到克隆”，图中的节点和连线标出关键证据。语音越来越自然，同时也要求我们审慎对待语音克隆带来的深度伪造风险。最后说出关键证据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P16【三种 TTS 工具各有主场】

【所属章节和小节】AI基础 第5章｜小节三 · TTS 的四级台阶 …

【本页目标】能够解释“三种 TTS 工具各有主场”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“三种 TTS 工具各有主场”，图中的“本地批量、商业集成、实时交互”标出关键证据。工具选择取决于交付场景：批量、商业品质与实时延迟对应不同方案。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面原有图解。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P17【听起来“好” 不止像真人】

【所属章节和小节】AI基础 第5章｜小节三 · TTS 的四级台阶 …

【本页目标】能够解释“听起来“好” 不止像真人”的核心关系。

【预计播报时长】约 20 秒

【语音逐字稿】

请先看画面中心，再看周围节点。本页聚焦“听起来“好” 不止像真人”，图中的“清晰度、自然度、情感表现力”标出关键证据。评价 TTS 要同时看自然度、清晰度和情感表现力。再核对条件。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】清晰度；自然度；情感表现力。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P18【多模态如何连通世界】

【所属章节和小节】AI基础 第5章｜章总结

【本页目标】能够用一条关系链复述本章核心结论。

【预计播报时长】约 20 秒

【语音逐字稿】

请按屏幕中的纪要卡从左到右回看本章。把每张卡的结论串成一条解释链，再用底部一句话检查自己能否说清机制、条件与边界。再用底部结论检查自己的理解。请把节点间的连接作为判断依据。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】多模态 AI 让信息一起理解；谁在处理 图文关系；视频生成的 时间一致性；TTS 的四级台阶 从拼接到克隆。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P19【单选题 8 题】

【所属章节和小节】AI基础 第5章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

这是“单选题 8 题”页面。请先独立阅读题干与全部选项，再核对本章的关系后作答；提交后才能查看本页反馈，本段不提前播报答案。同时指出这条关系依赖的条件，以及可能失效的边界。同时注意边界。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P20【简答题 VLM 原理】

【所属章节和小节】AI基础 第5章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

请在“简答题 VLM 原理”页面把任务拆成可执行步骤，记录输入、过程和结果；先提交自己的判断，再打开评分要求检查遗漏。请把节点间的连接作为判断依据。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P21【简答题机器人与孪生】

【所属章节和小节】AI基础 第5章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

本页要求完成“简答题机器人与孪生”。请按画面顺序操作，保存关键截图或文字证据；答案区域保持收起，结束后再比较差异。请用画面的层级与连接说明结论为什么成立。阅读时不要跳过中间步骤。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图


## P22【简答题绘本朗读助手】

【所属章节和小节】AI基础 第5章｜章测验

【本页目标】能够按照题目要求独立作答并说明依据。

【预计播报时长】约 20 秒

【语音逐字稿】

阅读“简答题绘本朗读助手”后，先确认任务边界、交付格式和验证标准，再写出方案；不要提前查看参考内容或评分提示。再用底部结论检查自己的理解。请用画面的层级与连接说明结论为什么成立。

【教师提示】以下视觉与媒体元数据不送入 TTS；测验反馈仅在学生作答后使用。

【对应视觉说明】页面标题、关系节点与结论条。画面按本页唯一概念组织，结论条负责收束。

【图片或视频文件名】HTML内联SVG / CSS教学图
