LLM 本质: 词语接龙机器
大模型不是查答案
从 Token 到训练与部署
大模型不是查答案
上下文窗口是一次请求中模型能“看到”的最大 Token…
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
现代大模型通常按“预训练 → SFT → RLHF”递…
工业应用常用“云端 + 本地”混合方案
从“LLM 本质: 词语接龙机器”出发,逐页推进到“上下文窗口: 短期记忆”;每张卡都写明本页应抓住的机制或边界。
大模型不是查答案,而是在给定上文后预测最合理的下一个 Token。
Token 不是字也不是词,而是模型内部切分出的最小处理单位。
上下文窗口是一次请求中模型能“看到”的最大 Token 数量。
阅读顺序:LLM 本质 → Token 是语言… → 上下文窗口
本节按“LLM 本质 → Token 是语言… → 上下文窗口”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
模型根据已有上下文,从候选中继续选择下一个合理片段。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
大模型不是查答案,而是在给定上文后预测最合理的下一个 Token。
Token 不是字也不是词,而是模型内部切分出的最小处理单位。
上下文窗口是一次请求中模型能“看到”的最大 Token 数量。
从“国产大模型: 各有看家本领”出发,逐页推进到“RLHF: 价值观对齐”;每张卡都写明本页应抓住的机制或边界。
DeepSeek 突出开源与性价比,Kimi 突出超长上下文与文档能力。
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
SFT 给模型看标准问答,告诉它“像这样回答”。
RLHF 让人类当裁判,把模型从“会答”推向“答得更好”。
阅读顺序:国产大模型 → 预训练: 博览群书 → 监督微调: 学会答题 → … → RLHF
本节按“国产大模型 → 预训练: 博览群书 → 监督微调: 学会答题 → … → RLHF”推进:先定位问题,再读机制,最后用页面结论校验理解。
先按任务和部署条件筛选,再比较模型;不要只看品牌名称。
DeepSeek 突出开源与性价比,Kimi 突出超长上下文与文档能力。
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
SFT 给模型看标准问答,告诉它“像这样回答”。
RLHF 让人类当裁判,把模型从“会答”推向“答得更好”。
从“三阶段训练: 顺序不能颠倒”出发,逐页推进到“教学团队策略: 混合部署”;每张卡都写明本页应抓住的机制或边界。
现代大模型通常按“预训练 → SFT → RLHF”递进训练。
日常学习用云端更方便,涉密数据和企业内网更适合本地部署。
工业应用常用“云端 + 本地”混合方案,在效率和安全之间取平衡。
阅读顺序:三阶段训练 → 云端 vs 本地 → 教学团队策略
本节按“三阶段训练 → 云端 vs 本地 → 教学团队策略”推进:先定位问题,再读机制,最后用页面结论校验理解。
READ THE SCENE
先学习通用规律,再做任务微调与偏好对齐,顺序不能颠倒。
读图顺序:先看对象和环境,再看它们之间的关系,最后回到本节结论。

图片只用于帮助观察本页关系;课程结论仍以正文和逐字稿为准。
现代大模型通常按“预训练 → SFT → RLHF”递进训练。
日常学习用云端更方便,涉密数据和企业内网更适合本地部署。
工业应用常用“云端 + 本地”混合方案,在效率和安全之间取平衡。
大模型不是查答案
上下文窗口是一次请求中模型能“看到”的最大 Token…
预训练用 TB 级公开文本,让模型学语言规律和世界知识。
现代大模型通常按“预训练 → SFT → RLHF”递…
工业应用常用“云端 + 本地”混合方案
理解 Token、训练流程和部署取舍,才算摸到大模型的“心脏”。
完成一次知识问答和一次代码挑战,并如实记录模型表现。
“请用 200 字介绍人工智能的发展历程”
“请帮我写一个 Python 函数,判断一个数字是否是质数,并添加注释解释每一步。”
在 DeepSeek 或 Kimi 中分别输入以下 Prompt,对比结果差异,并记录你的发现:
参考答案:
Token 是大模型处理文本的最小单位,它不是字也不是词,而是模型内部"切分"出来的有意义的小片段。一段中文文本的 Token 数量不等于汉字数量,原因有二:
评分要点:能说清楚 Token 不是字也不是词(2 分),能举例说明中文分词后 Token 数与字数不一致(2 分),语言表达清晰(1 分)。
参考答案:
| 阶段 | 目标 | 所用数据类型 |
|---|---|---|
| 预训练 | 让模型学习语言的基本规律和世界知识 | 海量互联网文本(TB 级,质量参差不齐) |
| SFT | 让模型学会"问答格式",按指令回答 | 高质量人工标注的问答对(万-十万条) |
| RLHF | 让模型对齐人类价值观,生成安全、有用的回答 | 人类偏好排序数据(对多个回答进行好坏排序) |
三者的关系是递进的:预训练给模型"知识",SFT 给模型"对话格式",RLHF 给模型"价值观"。
评分要点:三个阶段名称和顺序正确(1 分),每个阶段的目标和数据描述准确(各 1 分,共 3 分),能说明三者递进关系(1 分)。
参考答案:
我会选择本地部署。理由如下:
补充说明:如果公司的文档处理量不大,且对实时性要求高,可以考虑"混合方案"——日常非敏感文档用云端 API 快速处理,涉密文档走本地模型。
评分要点:明确选择本地部署(1 分),至少列出 2 个合理理由(各 1 分,共 2 分),能讨论混合方案作为补充说明(1 分),逻辑清晰(1 分)。