05 // CHAPTER ROUTE

机器开始 看见 世界

AI基础 · 第五章

文字、图像、声音与行动不再各自为政。多模态 AI 让机器把多种信息线索放进同一次理解。

SECTION 01 / 阅读地图

小节一 · 多模态 AI 让信息一起理解

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

VLM 的三段链路看见 · 对齐 · 推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

关键线索图像向量已对齐语义
03

谁在处理图文关系?

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

关键线索通用交互中文应用开源研究

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

多模态 AI 让信息一起理解

图像、声音和文字进入同一任务,信息才可以相互校验。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 多模态 AI 让信息一起理解”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 多模态 AI 让信息一起理解

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // DEFINITION

多模态 AI
让信息一起理解

文本:提出问题
图像:看见场景
多种信息
通道同时处理 / 理解
音频:听到线索
触觉:获得反馈

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02 // VLM

VLM 的三段链路
看见 · 对齐 · 推理

视觉编码器把图片切成 Patch,转成图像向量
图像向量
连接层把图像向量映射到文本语义空间
已对齐语义
大语言模型结合图片与问题,完成跨模态推理

VLM 先把图像编码,再完成语义对齐,最后才生成与画面有关的回答。

03 // MODEL MAP

谁在处理
图文关系?

通用交互

OpenAI图标
OpenAI
Google Gemini图标
Google Gemini

图像、语音与视频进入同一轮交互,重点看多模态是否原生协同。

中文应用

通义千问图标
通义千问
智谱 AI图标
智谱 AI

图文理解与中文场景结合,重点看任务语境和本地服务能力。

开源研究

OpenGVLab图标
OpenGVLab

开放模型便于研究、复现与定制,重点看图像和文字如何进入同一理解链。

共同目标:让图像与文字进入同一条理解链。

代表模型的侧重点不同,但共同任务都是把图像与文字放进同一条理解链。

SECTION 02 / 阅读地图

小节二 · 扩散模型: 从噪声回到画面

本节导读

生成模型如何从单幅画面走向连续视频,并进一步支撑机器人的行动与训练?

01

扩散模型: 从噪声回到画面

文字给出条件,模型反复去噪,图像在多轮修正中逐步成形。

关键线索文字条件反复去噪逐步成像
02

视频生成的时间一致性

视频还要保持物体身份、动作轨迹与光影背景在连续帧中连贯。

关键线索物体身份动作轨迹光影与背景
03

机器人如何把理解变成行动

感知环境、理解任务、执行动作,再用反馈更新下一步。

关键线索感知环境理解任务行动反馈
04

数字孪生: 先练再上场

先在虚拟副本中试错,再把验证过的技能迁移到真实任务。

关键线索虚拟试错技能迁移真实任务

从生成画面到驱动行动,关键是保持连续性,并用仿真降低现实试错成本。

VISUAL RECAP

本节场景补充

READ THE SCENE

扩散模型: 从噪声回到画面

由噪声逐步还原结构,才形成可识别的画面。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 扩散模型: 从噪声回到画面”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 扩散模型: 从噪声回到画面

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // DIFFUSION

扩散模型:
从噪声回到画面

纯噪声
“粗糙大理石”
文字提示 = 设计图纸
训练:清晰图像逐步加噪
生成:纯噪声逐步去噪
多轮收敛成目标画面
清晰图像月球
柴犬

扩散模型不是一次画完,而是在文字约束下反复去噪,逐步形成图像。

05 // TEXT TO VIDEO

视频生成的
时间一致性

01 · 物体身份

相邻帧中的主体外观、大小和关键特征不能突然变化。

02 · 动作轨迹

位置、姿态和速度要沿同一运动逻辑推进,不能无因跳变。

03 · 光影与背景

光源方向、阴影关系和背景结构应稳定,避免闪烁与漂移。

检查连续视频:先认主体,再追动作,最后核对光影与背景。

视频不仅要生成单帧,还要让动作、光影和物体在连续帧中保持连贯。

06 // ROBOT LOOP

机器人如何
把理解变成行动

1感知摄像头、麦克风、雷达与触觉传感器采集环境信息
2理解多模态模型融合分析,识别场景并规划任务
3行动路径规划、抓取策略与运动控制落实为动作
环境变化 / 下一轮感知

多模态 AI 把“感知—理解—行动”连成机器人进入真实环境的闭环。

07 // DIGITAL TWIN

数字孪生:
先练再上场

数字孪生
反复试错 × N
技能迁移
真实世界

在虚拟副本中反复试错,能降低训练成本与风险,再把技能迁移到真实任务。

SECTION 03 / 阅读地图

小节三 · TTS 的四级台阶从拼接到克隆

本节导读

按编号进入后续页面,逐项核对核心主张、工作机制与应用边界。

01

TTS 的四级台阶从拼接到克隆

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

02

三种 TTS 工具各有主场

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

关键线索本地批量商业集成实时交互
03

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

关键线索清晰度自然度情感表现力

先看主张,再沿编号核对机制、证据与应用边界。

VISUAL RECAP

本节场景补充

READ THE SCENE

TTS 的四级台阶从拼接到克隆

语音生成需要同时保留内容、韵律与说话风格。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · TTS 的四级台阶从拼接到克隆”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · TTS 的四级台阶从拼接到克隆

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

08 // TTS HISTORY

TTS 的四级台阶
从拼接到克隆

第一代:拼接预录音素拼接,声音较生硬
第二代:参数统计模型生成参数,仍有电子感
第三代:深度学习端到端生成语音波形,成为主流
最新:零样本克隆少量音频模仿音色,也带来伪造风险

语音越来越自然,同时也要求我们审慎对待语音克隆带来的深度伪造风险。

09 // TTS TOOLKIT

三种 TTS 工具
各有主场

本地批量

Microsoft Edge图标
Microsoft Edge

免费开放、多种中文发音人、可由 Python 调用;适合本地开发与批量有声内容。

商业集成

讯飞语音图标
讯飞语音

自然度、方言和情感合成突出;适合商业产品、智能硬件与呼叫中心。

实时交互

火山引擎图标
火山引擎

支持流式合成、延迟低、声音库丰富;适合直播、短视频与实时对话。

选择依据是交付场景、质量与延迟,不是品牌名气。

工具选择取决于交付场景:批量、商业品质与实时延迟对应不同方案。

10 // TTS METRICS

听起来“好”
不止像真人

清晰度

字词是否听得清、断句是否准确

听得清

自然度

节奏、重音和停顿是否接近真人

像真人

情感表现力

语气和情绪是否匹配内容语境

合语境
TTS 质量 = 三个维度共同过关

评价 TTS 要同时看自然度、清晰度和情感表现力,不能只听“像不像真人”。

11 // RECAP

多模态如何 连通世界

01

多模态 AI 让信息一起理解

多模态的关键不是“输入更多”,而是让不同线索共同参与理解。

02

谁在处理 图文关系?

代表模型的侧重点不同

03

视频生成的 时间一致性

视频不仅要生成单帧

04

TTS 的四级台阶 从拼接到克隆

语音越来越自然

05

听起来“好” 不止像真人

评价 TTS 要同时看自然度、清晰度和情感表现力

多模态 AI 把理解、生成、表达与行动连接起来,但每一步都仍需验证。

SOURCE QUIZ

单选题
8 题

3.1 单选题(每题 5 分,共 40 分)

得分 0/40 分 · 答对 0/8

先独立作答,再用讲义解析核对自己对机制和边界的理解。

SOURCE SHORT 01

简答题
VLM 原理

3.2 简答题(每题 20 分,共 60 分)

第 9 题:请用自己的话解释 VLM(视觉语言模型)的工作原理,并说明它和传统纯文本大语言模型(LLM)的核心区别是什么。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 02

简答题
机器人与孪生

3.2 简答题(每题 20 分,共 60 分)

第 10 题:结合"具身智能"的概念,分析多模态 AI 在机器人领域的重要价值,并举例说明"数字孪生"如何帮助机器人更好地学习技能。

请先独立完成作答,再展开讲义参考答案进行核对。

SOURCE SHORT 03

简答题
绘本朗读助手

3.2 简答题(每题 20 分,共 60 分)

第 11 题:某教育科技公司计划开发一款"AI 绘本朗读助手",要求能根据绘本图片自动生成配音。请结合本章所学知识,设计该产品的技术方案,并说明你将使用哪些国内工具来实现。

请先独立完成作答,再展开讲义参考答案进行核对。