04 // CHAPTER ROUTE

机器如何 看懂世界?

AI基础 · 第四章

任务不同,模型回答世界的粒度也不同。

SECTION 01 / 阅读地图

小节一 · 三种 视觉任务

本节要回答

小节一 · 三种 视觉任务

从“三种 视觉任务”出发,逐页推进到“图像的 数字语言”;每张卡都写明本页应抓住的机制或边界。

01

三种 视觉任务

任务不同,模型回答世界的粒度也不同。

机制线索分类街景 · 98%检测人 + 车 + 坐标
02

从整图到 像素

分类、检测、分割构成从粗到细的视觉理解阶梯。

机制线索整张图1 标签N 个框像素级标签
03

图像的 数字语言

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

机制线索一个像素R 216G 74B 138

阅读顺序:三种 视觉任务 → 从整图到 像素 → 图像的 数字语言

本节按“三种 视觉任务 → 从整图到 像素 → 图像的 数字语言”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

三种 视觉任务

同一场景可被整体分类、目标检测或像素级分割,以不同粒度回答问题。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 三种 视觉任务”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 三种 视觉任务

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

MODULE 01 // THREE TASKS

三种视觉任务

分类街景 · 98% 检测人 + 车 + 坐标 分割每个像素有类别

任务不同,模型回答世界的粒度也不同。

MODULE 02 // OUTPUT GRANULARITY

从整图到像素

整张图1 标签 N 个框 像素级标签 粒度越来越细

分类、检测、分割构成从粗到细的视觉理解阶梯。

MODULE 03 // PIXEL MATRIX

图像的数字语言

一个像素R 216G 74B 1380 — 255

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

SECTION 02 / 阅读地图

小节二 · CNN 逐层看懂

本节要回答

小节二 · CNN 逐层看懂

从“CNN 逐层看懂”出发,逐页推进到“训练就是 反复纠错”;每张卡都写明本页应抓住的机制或边界。

01

CNN 逐层看懂

CNN 把简单边缘逐层组合成局部特征与整体语义。

机制线索浅层先找基本笔画边缘 · 线条 · 转角组合
02

训练就是 反复纠错

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

机制线索1 · 标注样本图片 + 猫 / 狗2 · 模型预测猜:猫

阅读顺序:CNN 逐层看懂 → 训练就是 反复纠错

本节按“CNN 逐层看懂 → 训练就是 反复纠错”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

CNN 逐层看懂

视觉模型通过预测、比较和调整,逐轮减少误差。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · CNN 逐层看懂”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · CNN 逐层看懂

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

MODULE 04 // CNN FEATURES

CNN 逐层看懂

浅层先找基本笔画边缘 · 线条 · 转角 组合 中间层把边缘拼成可识别的局部 眼睛 耳朵 毛发纹理 LOCAL FEATURES 再组合 深层形成完整概念整体语义

CNN 把简单边缘逐层组合成局部特征与整体语义。

MODULE 04 // TRAINING LOOP

训练就是反复纠错

1 · 标注样本图片 + 猫 / 狗2 · 模型预测猜:猫3 · 比较损失预测 ≠ 答案4 · 调整参数误差决定移动方向与幅度 w1 w2 w3REPEAT · 直到误差下降

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

SECTION 03 / 阅读地图

小节三 · 视觉大模型 三件套

本节要回答

小节三 · 视觉大模型 三件套

从“视觉大模型 三件套”出发,逐页推进到“部署不是 终点”;每张卡都写明本页应抓住的机制或边界。

01

视觉大模型 三件套

CLIP、SAM 与 Grounding DINO 分别连接图文、分割万物和开放检测。

机制线索视觉大模型CLIP图像 ↔ 文字
02

巡检 数据流水线

工业视觉从采集到决策,每个环节都决定最终可靠性。

机制线索采集无人机照片标注框出缺陷
03

部署不是 终点

边缘端与云端协同,难例持续回流,模型才会越用越好。

机制线索边缘端无人机 / 机器人快速初筛量化 · 剪枝 · 蒸馏

阅读顺序:视觉大模型 三件套 → 巡检 数据流水线 → 部署不是 终点

本节按“视觉大模型 三件套 → 巡检 数据流水线 → 部署不是 终点”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

视觉大模型 三件套

理解请求、分出对象、定位目标再行动,构成可落地的视觉工作流。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 视觉大模型 三件套”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 视觉大模型 三件套

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

MODULE 06 // FOUNDATION MODELS

视觉大模型三件套

视觉大模型 CLIP图像 ↔ 文字零样本分类SAM点击 / 框选分割任意物体Grounding DINO“你说找什么,它就找什么”

CLIP、SAM 与 Grounding DINO 分别连接图文、分割万物和开放检测。

MODULE 07 // INDUSTRIAL INSPECTION

巡检数据流水线

采集无人机照片标注框出缺陷训练70 / 20 / 10部署云 / 边缘端实时推理决策缺陷预警

工业视觉从采集到决策,每个环节都决定最终可靠性。

MODULE 08 // DEPLOYMENT LOOP

部署不是终点

边缘端无人机 / 机器人快速初筛量化 · 剪枝 · 蒸馏云端GPU 精细分析人工复核收集误检 / 漏检端云协同持续更新

边缘端与云端协同,难例持续回流,模型才会越用越好。

MODULE 09 // CHAPTER RECAP

本章 总结

01

三种 视觉任务

任务不同,模型回答世界的粒度也不同。

02

图像的 数字语言

彩色图像的底层,是由 RGB 数值组成的像素矩阵。

03

训练就是 反复纠错

模型通过猜测、比较、调整和重复,逐渐学会正确识别。

04

视觉大模型 三件套

CLIP、SAM 与 Grounding DINO 分…

05

部署不是 终点

边缘端与云端协同,难例持续回流,模型才会越用越好。

计算机视觉的价值,是把像素转化为可持续优化的决策闭环。

KNOWLEDGE CHECK

单选题 · 10题 × 5分

答对 0/10 · 得分 0/50
TRUE OR FALSE

判断题 · 5题 × 4分

1图像分类任务可以同时在一张图中识别多个不同类别的物体并给出它们的位置。
2语义分割可以对图像中的每个像素进行分类,因此它能区分同一类物体的不同个体(如画面中"第一只猫"和"第二只猫")。
3SAM 模型可以在没有针对特定类别训练的情况下,直接分割它从未见过的物体。
4在 AI 数据闭环中,"模型部署"意味着项目结束,不需要再对模型进行任何更新。
5在输电线路巡检中,无人机拍摄的照片可以直接用于 AI 模型训练,不需要人工标注。
答对 0/5 · 得分 0/20
ASSESSMENT SUMMARY

测验分数统计

测验分数统计
部分题数每题分值满分
单选题10 题5 分50 分
判断题5 题4 分20 分
合计15 题-70 分
单选:答对 0/10 · 得分 0/50 判断:答对 0/5 · 得分 0/20 当前总分 0/70

合计 15 题,满分 70 分。