07 // CHAPTER ROUTE

给技术 系上安全带

AI基础 · 第七章

AI 越能影响现实,越要理解隐私、偏见、幻觉、伪造与物理安全背后的验证责任。

SECTION 01 / 阅读地图

小节一 · 隐私保护的 三道防线

本节要回答

小节一 · 隐私保护的 三道防线

从“隐私保护的 三道防线”出发,逐页推进到“99% 与 70% 暴露了什么”;每张卡都写明本页应抓住的机制或边界。

01

隐私保护的 三道防线

隐私保护不是单点技术:先减少直接暴露,再限制数据流动与可推断性。

机制线索数据脱敏联邦学习差分隐私
02

偏见如何被 自动放大

算法偏见通常不是 AI 自发产生,而是从不完整或带偏见的数据中学来并放大。

机制线索历史偏见采样偏差标注偏见模型固化
03

99% 与 70% 暴露了什么

总体指标好看不够:必须分别检查不同子类数据与不同场景的表现。

机制线索高分来自偏斜样本模型学到的捷径换个颜色就掉分

阅读顺序:隐私保护的 三道防线 → 偏见如何被 自动放大 → 99% 与 70%…

本节按“隐私保护的 三道防线 → 偏见如何被 自动放大 → 99% 与 70%…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

隐私保护的 三道防线

数据、权限与审查一起构成隐私保护的边界。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节一 · 隐私保护的 三道防线”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节一 · 隐私保护的 三道防线

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

01 // PRIVACY

隐私保护的
三道防线

降低个人可识别性同一目标,三种不同机制
01

数据脱敏

训练前去除姓名、身份证号等直接身份信息。

02

联邦学习

数据不出本地,只上传模型更新。

03

差分隐私

加入适度噪声,降低反推个人信息的风险。

隐私保护不是单点技术:先减少直接暴露,再限制数据流动与可推断性。

02 // BIAS

偏见如何被
自动放大

SOURCE 01

历史偏见

过去的制度与选择已经写进训练数据。

SOURCE 02

采样偏差

某类样本太少,模型看不见真实分布。

SOURCE 03

标注偏见

人工判断把单一视角带进标签。

OUTPUT

模型固化

既有倾向被自动化,并在更大规模上放大。

BIAS × AUTOMATION

算法偏见通常不是 AI 自发产生,而是从不完整或带偏见的数据中学来并放大。

03 // COLOR GAP

99% 与 70%
暴露了什么

总体指标好看不够:必须分别检查不同子类数据与不同场景的表现。

SECTION 02 / 阅读地图

小节二 · 流畅不等于 真实

本节要回答

小节二 · 流畅不等于 真实

从“流畅不等于 真实”出发,逐页推进到“看起来像真的 也要验来源”;每张卡都写明本页应抓住的机制或边界。

01

流畅不等于 真实

大模型预测下一个词,不等于查询事实库;重要信息必须回到可验证的证据。

机制线索模型生成:预测下一个词事实核验:回到证据链
02

应对幻觉的 五步验证

降低幻觉的关键不是盲信模型自检,而是建立来源、逻辑与人工的交叉验证链。

03

看起来像真的 也要验来源

深度伪造可同时篡改图像、音频和视频;比盯住单一细节更重要的是来源验证。

机制线索内容内部线索传播链外部证据

阅读顺序:流畅不等于 真实 → 应对幻觉的 五步验证 → 看起来像真的 也要…

本节按“流畅不等于 真实 → 应对幻觉的 五步验证 → 看起来像真的 也要…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

流畅不等于 真实

流畅的表述仍需回到证据与来源进行核验。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节二 · 流畅不等于 真实”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节二 · 流畅不等于 真实

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

04 // HALLUCINATION

流畅不等于
真实

模型生成:预测下一个词

流畅自信有逻辑

仍可能编造事实、引用、推理前提或计算结果。

事实核验:回到证据链

可靠来源、交叉验证和可复查推理,才让重要信息可信。

大模型预测下一个词,不等于查询事实库;重要信息必须回到可验证的证据。

05 // VERIFY

应对幻觉的
五步验证

重要信息
先别急着信
① 追问来源要求具体出处
② 交叉验证用独立渠道核对
③ 逻辑审查检查前提与推理
④ 人工判断常识与专业复核
⑤ 限定范围不确定时说不知道

降低幻觉的关键不是盲信模型自检,而是建立来源、逻辑与人工的交叉验证链。

06 // DEEPFAKE

看起来像真的
也要验来源

内容内部线索

看细节|面部边缘、眨眼、光影听音质|呼吸、语调、背景噪声查背景|变形、扭曲、不自然边缘

这些异常能提示风险,但单一细节不能独立定案。

VERIFY

传播链外部证据

验来源|追溯原始出处与转发链用工具|检测结果只作辅助三问验证|来源、独立证实、传播目的

来源核实与独立渠道,比“看起来像不像”更可靠。

深度伪造可同时篡改图像、音频和视频;比盯住单一细节更重要的是来源验证。

SECTION 03 / 阅读地图

小节三 · 当 AI 有了身体 错误会碰到现实

本节要回答

小节三 · 当 AI 有了身体 错误会碰到现实

从“当 AI 有了身体 错误会碰到现实”出发,逐页推进到“AI 出错时 谁来负责”;每张卡都写明本页应抓住的机制或边界。

01

当 AI 有了身体 错误会碰到现实

具身风险从“说错话”变成“做错事”,必须在软件之外预留物理与流程保护。

机制线索感知错误策略失误硬件失控对抗攻击
02

安全不是一层 是三层防线

真正的安全要让一层失效时仍有下一层接住风险,急停按钮属于硬件安全层。

03

AI 出错时 谁来负责

AI 不是法律责任主体;责任要回到开发、使用与恶意攻击等具体人的行为。

阅读顺序:当 AI 有了身体… → 安全不是一层 是三… → AI 出错时 谁来…

本节按“当 AI 有了身体… → 安全不是一层 是三… → AI 出错时 谁来…”推进:先定位问题,再读机制,最后用页面结论校验理解。

VISUAL RECAP

本节场景补充

READ THE SCENE

当 AI 有了身体 错误会碰到现实

当系统进入物理世界,错误会转化为真实的安全与责任问题。

读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

支持“小节三 · 当 AI 有了身体 错误会碰到现实”讲解的 ChatGPT 生成教学场景图
教学场景补充 · 小节三 · 当 AI 有了身体 错误会碰到现实

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。

07 // PHYSICAL RISK

当 AI 有了身体
错误会碰到现实

AI 有了身体
风险进入现实

感知错误

传感器误判对象,动作目标随之出错。

策略失误

危险路径被当作可行动作。

硬件失控

故障或断连后设备无法及时停止。

对抗攻击

恶意输入诱导系统误判。

具身风险从“说错话”变成“做错事”,必须在软件之外预留物理与流程保护。

08 // THREE LAYERS

安全不是一层
是三层防线

03 / 流程安全层

双人确认 · 模拟 100 次 · 渐进部署 · 日志追溯

02 / 硬件安全层

急停按钮 · 碰撞检测 · 安全围栏 · 声光报警

01 / 软件安全层

阈值 · 动作限制 · 异常检测

真正的安全要让一层失效时仍有下一层接住风险,急停按钮属于硬件安全层。

09 // RESPONSIBILITY

AI 出错时
谁来负责

AI 不是
法律主体
先判断具体场景,再把责任落回人的行为。
训练数据有问题开发者 / 数据提供方负责数据质量
使用方式不当使用者承担规范操作与复核责任
未知场景出错开发者 + 使用者共同承担验证责任
恶意攻击导致出错攻击者承担相应法律责任
共同守护:开发者 × 使用者 × 监管者

AI 不是法律责任主体;责任要回到开发、使用与恶意攻击等具体人的行为。

10 // RECAP

把安全带 扣在全过程

01

隐私保护的 三道防线

隐私保护不是单点技术:先减少直接暴露

02

99% 与 70% 暴露了什么

总体指标好看不够

03

应对幻觉的 五步验证

降低幻觉的关键不是盲信模型自检

04

当 AI 有了身体 错误会碰到现实

具身风险从“说错话”变成“做错事”

05

AI 出错时 谁来负责

AI 不是法律责任主体

AI 越强大,越要把验证、约束和责任嵌入从数据到部署的每一个环节。

SOURCE QUIZ

单选题
8 题

答对 0/8

先独立判断,再用讲义解析追问:你依据的是数据、机制还是安全层级?

SOURCE TRUE / FALSE

判断题
5 题

判断之后必须说出理由:哪些安全结论是“降低风险”,而不是“完全消除风险”。

SOURCE CASE

案例:招聘系统
偏见事件

案例:AI 招聘系统的偏见事件

某大型制造企业引入了一套 AI 招聘系统,用于自动筛选技术岗位的求职简历。该系统基于过去 10 年该企业成功员工的简历数据进行训练。系统上线半年后,HR 部门发现:

  • 通过 AI 筛选的候选人中,毕业于某几所特定院校的比例高达 85%
  • 来自非传统工程背景(如自学转行、职业培训)的候选人通过率极低,仅 3%
  • 虽然 AI 筛选的候选人在面试中表现良好,但新员工入职后 6 个月内的离职率反而比之前上升了 12%

经调查发现:该企业过去 10 年招聘的技术岗位员工,确实主要来自那几所特定院校(因为 HR 之前就是优先从这些院校招聘的)。AI 从历史数据中学到了"这些院校 = 好员工"的规律,并自动将其变成了筛选标准。

请回答以下问题:

(1)这个案例中,AI 招聘系统出现了什么问题?问题的根源在哪里?(4 分)

(2)如果你是该企业的 AI 伦理顾问,你会提出哪些改进建议?(至少 3 条,6 分)

不要把历史上的“常见”误当成未来的“应该”:先查数据来源,再查分组结果与人工复核。