🧠 第3次课 · 预训练与后训练
0/7
AIGC 应用与实践 · 第 3 次课

大模型是怎么被"教育"出来的?

上节课它学会了"开会"(Transformer),但这节课你会发现:会开会 ≠ 会干活。一个强大的模型,还要经历两段教育——预训练和后训练。下面 7 个互动关卡,带你亲手体验模型的成长之路。

预训练:模型的"基础教育"阶段

剧情钩子:Transformer 已经学会了"开会",但会议桌上还没有材料。于是预训练登场——把一个新人送进基础教育,海量阅读,先学会语言规律和世界常识。

是什么

模型正式服务用户前的第一阶段训练。把互联网网页、书籍、文章、代码等海量文本交给模型,让它学习词与词的关系、句法结构、常见事实和各领域表达,目标是形成广泛的语言与知识基础,而不是只会回答某个固定问题。

特点

数据规模极大、覆盖面广、成本高,训练目标通用。练完后模型具备语言理解、常识推断、写作改写、代码补全等基础能力——但更像一个读过很多书的"续写器":知道语言怎么接,不一定知道你要什么格式、语气和边界。

典型例子

读过大量"今天天气很好,适合出门",就更会续写活动安排;读过很多 Python 报错与修复示例,就更会识别代码错误。但它分不清你要的是课堂发言、求职简历还是短视频脚本

⚠️ 易错点预警
  • 预训练 ≠ 把资料背下来。模型不是数据库,而是在海量文本中学习统计规律和语义关系
  • 预训练结束 ≠ 模型可靠。它可能知道很多表达,却仍会编造细节、误解指令或输出不合适的答案。
🎮 互动 1/7:一句话画像 ✔ 完成

刚结束预训练的模型,最像下面哪一个?凭直觉选。

学习通 讲完本模块后完成【M1-01】识别预训练目标、【M1-02】判断预训练能力、【M1-03】匹配预训练原料

自监督学习:全网规模的大规模完形填空

剧情钩子:预训练的数据量太大,人工标注答案根本不现实。自监督学习站出来说:"别急着给每句话写答案,把文本本身变成试卷。"

是什么

不需要人工逐条标注的训练方式。系统自动遮住文本中的词,或让模型预测下一个词、前后句关系——文本的一部分变成输入,另一部分自动变成学习目标,所以叫"自"监督

优势与软肋

优势:几乎能利用无穷的自然文本,在反复预测中学到语法、搭配、上下文一致性。软肋:数据来自真实文本,可能包含过时观点、错误说法和偏见——模型学到的是语言概率,不等于每条事实都被验证过。

典型例子

"前端开发需要掌握 HTML、CSS 和______"→ 模型会预测 JavaScript;"她把文件保存到桌面,接着打开______"→ 可能是文件夹、电脑或软件。填空越复杂,越需要理解语义

⚠️ 易错点预警
  • 自监督学习 ≠ 无监督学习:虽然不靠人工标签,但系统仍从文本内部自动构造了学习信号;无监督学习更强调在没有预设标签的情况下发现结构。
  • "没有人工标注" ≠ "没有监督目标"。
🎮 互动 2/7:你来当一次"模型" ✔ 完成

3 道完形填空:先自己选一个答案,再看看模型眼中的概率分布——感受一下"自监督"到底在练什么。

🎉 恭喜通关!你刚刚体验的就是预训练阶段模型做的核心练习——在亿万条文本上反复做完形填空,没有人写答案,答案就藏在文本自己身上。这就是"自监督"。

学习通 讲完本模块后完成【M2-01】解释完形填空机制、【M2-02】判断自监督学习、【M2-03】辨析标注需求

涌现能力:水管加粗到临界点,突然喷水

剧情钩子:模型不断变大,你以为它只是"写得快一点"?但某些能力像水管加粗到临界点后突然喷水——小模型做不到的任务,大模型开始能做了。

是什么

当模型参数、数据量和算力规模达到一定程度后,出现的较小模型不具备或表现很弱的能力:多步推理、跨领域总结、按复杂指令组织答案、理解隐含条件。它不是凭空魔法,而是大规模学习与复杂结构共同作用的能力跃迁

两个关键词

① 规模阈值:同类模型小规模时只会复述,大规模后才出现稳定推理。② 任务依赖:不同任务出现涌现的时机不同——有的随规模快速改善,有的仍然失败。不能把所有好结果都归因于涌现。

典型例子

小模型只能把长文压缩成几句话;大模型能总结、比较观点、指出矛盾、按老师要求改写成课堂汇报。数学应用题:小模型直接蒙答案,大模型能拆条件、列关系、逐步推理

⚠️ 易错点预警
  • 涌现 ≠ 能力可靠、永远正确,更 ≠ 模型有了人类意识。它只描述规模扩大后能力的显著变化
  • 别把普通改进都说成涌现:只有能力的表现方式或任务难度出现明显跃迁时才适用。
🎮 互动 3/7:涌现实验室 ✔ 完成

拖动滑块,把模型从"十亿级"一路养到"千亿级",亲眼看看"多步推理"这项能力在哪一刻被点亮。(示意图,非真实评测数据)

模型规模与多步推理成功率关系示意图 横轴为模型规模(1B到700B,示意),纵轴为多步推理任务成功率。曲线在规模阈值前长期低位,越过阈值后快速跃升后趋平。 80% 50% 20% 1B 10B 100B 700B 模型规模(参数量,示意)→ 多步推理成功率 → 涌现阈值(示意) 10%
十亿级 · 能力 10%
只会复述:给它一篇长文只能压缩成几句话;数学应用题直接蒙一个答案。

注意两个细节:① 阈值位置因任务而异,换一个任务曲线就不一样;② 越过阈值 ≠ 万能,涌现描述的是跃迁,不是可靠。

学习通 讲完本模块后完成【M3-01】识别涌现现象、【M3-02】判断规模条件、【M3-03】设计能力测试任务

知识截止与幻觉:模型的两种"不靠谱"

剧情钩子:模型读过很多书,但它不能自动刷新书架。问到截止后的事,它可能装作知道;遇到不确定的内容,它也可能补出一个看似合理的细节。

知识截止

模型只能稳定学习到训练数据截止时间之前的信息,之后的事件、产品、政策可能不在知识范围内。这是时间边界问题——书架上的书停在某一刻。

幻觉

模型生成了看似合理但实际错误、虚构或无法验证的内容:编造文献、网址、API 名称、案件细节。这是生成机制带来的可靠性问题

怎么缓解

截止:联网检索、更新模型、提供新资料。幻觉:人工核验、要求模型说明依据、限制回答范围、交叉验证。做作业、写代码、查新闻前,先判断是否涉及事实与时间敏感信息。

⚠️ 易错点预警
  • 不是所有错误都叫幻觉:时间边界导致的信息陈旧是知识截止;逻辑错误、漏看条件也不一定是幻觉。
  • 语气流畅、态度自信 ≠ 事实正确。
🎮 互动 4/7:火眼金睛鉴定师 答对 0/6 ✔ 完成

6 个真实感案例,判断每个回答的问题出在哪。鉴定师的直觉,就是在对错里练出来的。

🔍 鉴定完成!记住口诀:旧了是截止,编了是幻觉,错了看情况,流畅不代表对。

学习通 讲完本模块后完成【M4-01】识别知识截止、【M4-02】区分幻觉与过时、【M4-03】选择核验策略

后训练 SFT:从"博览群书"到"持证上岗"

剧情钩子:预训练结束后,模型像一个博览群书但没上过岗的毕业生——它会续写,却可能把你的问题续写成一篇散文。于是 SFT 登场,像岗前培训:拿大量"问题—好答案"样例,教它听懂指令、控制格式、承担责任。

是什么

SFT(Supervised Fine-Tuning,监督微调)是大模型后训练的重要阶段。训练数据由提示词 + 高品质回答组成,模型从中学习:用户是在提问、求解、总结、改写还是分类;回答该用什么角色、结构、语气、长度和安全边界。

改变了什么

预训练让模型"会说",SFT 让模型"按要求说"。经过 SFT,模型更能遵守"分点回答""只输出代码""扮演面试官""不要编造来源"等指令。但它仍不能消除幻觉,不能替代事实核验。

典型例子

用户要求"用三条建议回答":没充分后训练的续写器可能继续写一段背景说明;经过 SFT 的助手更可能输出三条编号建议。要求"扮演严格的项目经理",SFT 帮助模型进入角色,按审查视角提出风险和优先级。

⚠️ 易错点预警
  • SFT ≠ 重新预训练。它是在已有能力基础上调整行为,重点是指令对齐和答案质量。
  • "回答礼貌" ≠ "回答正确":模型可能格式很好但事实有误。
🎮 互动 5/7:岗前培训前后对照 ✔ 完成

同一个提问,同一个模型——切换开关,看"岗前培训"到底改变了什么。

用户提问:请用三条建议回答:零基础学生如何开始学前端?

学习前端是很多人都会做出的选择,因为前端技术发展迅速,应用广泛。在正式学习之前,我们首先要了解什么是前端,以及前端在整个软件开发流程中处于什么位置。很多初学者在学习过程中会感到迷茫,因此掌握正确的学习方法显得尤为重要。首先,让我们从网页的构成讲起……

看到了吗?模式A把你的问题续写成了一篇科普散文——它不是不想帮你,是没人教过它"什么叫按要求回答"。SFT 的本质,就是用大量好示范把"会说话"训练成"会沟通"。

学习通 讲完本模块后完成【M5-01】识别 SFT 目标、【M5-02】判断指令数据、【M5-03】比较前后行为

SFT 数据质量:好老师不是讲得多,而是示范得准

剧情钩子:SFT 培训班开课了,可如果教材里全是含糊答案、错误步骤和不安全建议——模型学得越熟练,错得越像样。数据质量开始接管课堂。

好数据长什么样

高质量"问题—回答"样本通常具备:清晰任务、准确事实、完整步骤、合适格式、一致风格、必要安全边界。少量高质量样本,胜过大量噪声样本——后者会让模型在不同风格之间摇摆。

多样性同样重要

数据要覆盖真实任务的多样性:不同岗位、难度、语言风格、失败场景和安全请求。如果训练集全是简答题,模型遇到表格整理、代码修改、多轮追问时可能表现不稳定。若很多答案都编造 API,模型也会更倾向编造。

怎么评估

五个维度:正确性、一致性、可执行性、结构清晰度、边界处理。不能只检查答案"看起来专业",还要检查事实是否可靠、步骤能否执行、格式是否符合任务。

⚠️ 易错点预警
  • 只看"是否专业"不够:低质量样本可能冗长、格式混乱、事实错误、覆盖面窄,甚至教会模型不良表达。
  • 数据质量 > 单纯数量;数量多 ≠ 更好。
🎮 互动 6/7:SFT 教材质检员 ✔ 完成

你是 SFT 数据质检员。同一个问题"帮学生制定前端学习计划",两份候选训练样本——哪份更有资格进教材?

📄 样本 A

多练习、多看文档,加油!相信你一定能学好前端的!

📄 样本 B

分三阶段:第 1-2 周学 HTML/CSS,每天仿写一个小页面;第 3-5 周学 JavaScript 基础,完成一个待办清单小项目;第 6 周做个人主页综合练习。每周末复盘并调整计划。适合零基础、每天能投入约 1 小时的学生。

五个维度质检报告
质检维度样本 A样本 B
任务清晰度✗ 目标模糊,等于没回答✓ 阶段目标明确
步骤可执行✗ "多练习"无法执行✓ 每步有具体动作和产出
结构清晰度✗ 只有一句话✓ 分阶段 + 时间安排
覆盖面△ 无对象假设✓ 说明了适用人群和时间投入
风格一致性△ 只有鼓励,缺实质内容✓ 语气稳定、信息密度合理
✅ 样本 B 胜出。记住两条原则:① 质量比数量重要——大量噪声样本会让模型摇摆;② 多样性和质量同样重要——如果教材里全是这类简答题,模型遇到表格整理、代码修改、多轮追问就会翻车。好老师不是讲得多,而是示范得准。

学习通 讲完本模块后完成【M6-01】评估 SFT 数据质量、【M6-02】诊断坏样本、【M6-03】设计高质量 SFT 样本

毕业自测:6 张知识闪卡

每张卡对应一个模块的"最容易被考试抓住"的问题。先在心里作答,再点卡翻面核对。

🎮 互动 7/7:翻开全部 6 张卡 ✔ 完成

📝 课后作业:大模型知识边界测试

设计 5 个问题测试常用大模型的知识边界,记录:你使用的提示词、模型的回答、错误类型(知识截止 / 幻觉 / 普通错误)、以及你的核验来源。用上今天学的"鉴定师"眼光,把每个错误归类清楚。

⏰ 截止:下节课前一天 22:00