05 // CHAPTER ROUTE

机器开始 看见 世界

AI基础 · 第五章

文字、图像、声音与行动不再各自为政。多模态 AI 让机器把多种信息线索放进同一次理解。

SECTION 01 / 阅读地图

小节一 · 多模态 AI 让信息一起理解

本节要回答

小节一 · 多模态 AI 让信息一起理解

从“多模态 AI 让信息一起理解”出发,逐页推进到“谁在处理 图文关系?”;每张卡都写明本页应抓住的机制或边界。

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

VLM 的三段链路 看见 · 对齐 · 推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

机制线索图像向量已对齐语义
03

谁在处理 图文关系?

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

机制线索通用交互中文应用开源研究

阅读顺序:多模态 AI 让信… → VLM 的三段链路… → 谁在处理 图文关系

本节按“多模态 AI 让信… → VLM 的三段链路… → 谁在处理 图文关系”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

多模态 AI 让信息一起理解

图像、声音和文字进入同一任务,信息才可以相互校验。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 多模态 AI 让信息一起理解”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 多模态 AI 让信息一起理解

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // DEFINITION

多模态 AI
让信息一起理解

文本:提出问题
图像:看见场景
多种信息
通道同时处理 / 理解
音频:听到线索
触觉:获得反馈

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02 // VLM

VLM 的三段链路
看见 · 对齐 · 推理

视觉编码器把图片切成 Patch,转成图像向量
图像向量
连接层把图像向量映射到文本语义空间
已对齐语义
大语言模型结合图片与问题,完成跨模态推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

03 // MODEL MAP

谁在处理
图文关系?

通用交互

OpenAI图标
OpenAI
Google Gemini图标
Google Gemini

图像、语音与视频进入同一轮交互,重点看多模态是否原生协同。

中文应用

通义千问图标
通义千问
智谱 AI图标
智谱 AI

图文理解与中文场景结合,重点看任务语境和本地服务能力。

开源研究

OpenGVLab图标
OpenGVLab

开放模型便于研究、复现与定制,重点看图像和文字如何进入同一理解链。

共同目标:让图像与文字进入同一条理解链。

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

SECTION 02 / 阅读地图

小节二 · 扩散模型: 从噪声回到画面

本节要回答

小节二 · 扩散模型: 从噪声回到画面

从“扩散模型: 从噪声回到画面”出发,逐页推进到“数字孪生: 先练再上场”;每张卡都写明本页应抓住的机制或边界。

01

扩散模型: 从噪声回到画面

扩散模型不是一次画完,而是在文字约束下反复去噪,逐步形成图像。

02

视频生成的 时间一致性

视频不仅要生成单帧,还要让动作、光影和物体在连续帧中保持连贯。

机制线索01 · 物体身份02 · 动作轨迹03 · 光影与背景
03

机器人如何 把理解变成行动

多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。

机制线索环境变化 / 下一轮感知
04

数字孪生: 先练再上场

在虚拟副本中反复试错,能降低训练成本与风险,再把技能迁移到真实任务。

机制线索技能迁移

阅读顺序:扩散模型 → 视频生成的 时间一… → 机器人如何 把理解… → … → 数字孪生

本节按“扩散模型 → 视频生成的 时间一… → 机器人如何 把理解… → … → 数字孪生”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

扩散模型: 从噪声回到画面

由噪声逐步还原结构,才形成可识别的画面。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 扩散模型: 从噪声回到画面”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 扩散模型: 从噪声回到画面

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DIFFUSION

扩散模型:
从噪声回到画面

纯噪声
“粗糙大理石”
文字提示 = 设计图纸
训练:清晰图像逐步加噪
生成:纯噪声逐步去噪
多轮收敛成目标画面
清晰图像月球
柴犬

扩散模型不是一次画完,而是在文字约束下反复去噪,逐步形成图像。

05 // TEXT TO VIDEO

视频生成的
时间一致性

01 · 物体身份

相邻帧中的主体外观、大小和关键特征不能突然变化。

02 · 动作轨迹

位置、姿态和速度要沿同一运动逻辑推进,不能无因跳变。

03 · 光影与背景

光源方向、阴影关系和背景结构应稳定,避免闪烁与漂移。

检查连续视频:先认主体,再追动作,最后核对光影与背景。

视频不仅要生成单帧,还要让动作、光影和物体在连续帧中保持连贯。

06 // ROBOT LOOP

机器人如何
把理解变成行动

1感知摄像头、麦克风、雷达与触觉传感器采集环境信息
2理解多模态模型融合分析,识别场景并规划任务
3行动路径规划、抓取策略与运动控制落实为动作
环境变化 / 下一轮感知

多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。

07 // DIGITAL TWIN

数字孪生:
先练再上场

数字孪生
反复试错 × N
技能迁移
真实世界

在虚拟副本中反复试错,能降低训练成本与风险,再把技能迁移到真实任务。

SECTION 03 / 阅读地图

小节三 · TTS 的四级台阶 从拼接到克隆

本节要回答

小节三 · TTS 的四级台阶 从拼接到克隆

从“TTS 的四级台阶 从拼接到克隆”出发,逐页推进到“听起来“好” 不止像真人”;每张卡都写明本页应抓住的机制或边界。

01

TTS 的四级台阶 从拼接到克隆

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

02

三种 TTS 工具 各有主场

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

机制线索本地批量商业集成实时交互
03

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

机制线索清晰度自然度情感表现力

阅读顺序:TTS 的四级台阶… → 三种 TTS 工具… → 听起来“好” 不止…

本节按“TTS 的四级台阶… → 三种 TTS 工具… → 听起来“好” 不止…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

TTS 的四级台阶 从拼接到克隆

语音生成需要同时保留内容、韵律与说话风格。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · TTS 的四级台阶 从拼接到克隆”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · TTS 的四级台阶 从拼接到克隆

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // TTS HISTORY

TTS 的四级台阶
从拼接到克隆

第一代:拼接预录音素拼接,声音较生硬
第二代:参数统计模型生成参数,仍有电子感
第三代:深度学习端到端生成语音波形,成为主流
最新:零样本克隆少量音频模仿音色,也带来伪造风险

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

09 // TTS TOOLKIT

三种 TTS 工具
各有主场

本地批量

Microsoft Edge图标
Microsoft Edge

免费开放、多种中文发音人、可由 Python 调用;适合本地开发与批量有声内容。

商业集成

讯飞语音图标
讯飞语音

自然度、方言和情感合成突出;适合商业产品、智能硬件与呼叫中心。

实时交互

火山引擎图标
火山引擎

支持流式合成、延迟低、声音库丰富;适合直播、短视频与实时对话。

选择依据是交付场景、质量与延迟,不是品牌名气。

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

10 // TTS METRICS

听起来“好”
不止像真人

清晰度

字词是否听得清、断句是否准确

听得清

自然度

节奏、重音和停顿是否接近真人

像真人

情感表现力

语气和情绪是否匹配内容语境

合语境
TTS 质量 = 三个维度共同过关

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

11 // RECAP

多模态如何 连通世界

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

谁在处理 图文关系?

代表模型的侧重点不同

03

视频生成的 时间一致性

视频不仅要生成单帧

04

TTS 的四级台阶 从拼接到克隆

语音越来越自然

05

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力

多模态 AI 把理解、生成、表达与行动连接起来,但每一步都仍需验证。

SOURCE QUIZ

单选题
8 题

3.1 单选题(每题 5 分,共 40 分)

得分 0/40 分 · 答对 0/8

先独立作答,再用讲义解析核对自己对机制和边界的理解。

SOURCE SHORT 01

简答题
VLM 原理

3.2 简答题(每题 20 分,共 60 分)

第 9 题:请用自己的话解释 VLM(视觉语言模型)的工作原理,并说明它和传统纯文本大语言模型(LLM)的核心区别是什么。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 02

简答题
机器人与孪生

3.2 简答题(每题 20 分,共 60 分)

第 10 题:结合"具身智能"的概念,分析多模态 AI 在机器人领域的重要价值,并举例说明"数字孪生"如何帮助机器人更好地学习技能。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 03

简答题
绘本朗读助手

3.2 简答题(每题 20 分,共 60 分)

第 11 题:某教育科技公司计划开发一款"AI 绘本朗读助手",要求能根据绘本图片自动生成配音。请结合本章所学知识,设计该产品的技术方案,并说明你将使用哪些国内工具来实现。

请先独立完成作答,再展开讲义参考答案进行核对。