🧠 第4次课 · RLHF 与强化学习
已点亮 0/7
AIGC 应用与实践 · 第 4 次课 · 闯关式复习

AI 是怎么学会「自己变强」的?

SFT 之后,模型还能进化:用奖励塑造行为,用人类偏好校准价值观,用思维链摊开草稿纸,最后由 DeepSeek-R1 把这条路走到了极致。7 个关卡,全部点亮才算出师!

M1

强化学习训练场:亲手把一只「笨智能体」练聪明

模型读完海量文本、又经过 SFT,可面对同一道题这次对下次错——谁来告诉它「这个解题动作值得保留」?现在你就是奖励信号本身。

🎮 训练目标

智能体 🤖 要解一道多步数学题。它有 4 个可选动作,初始概率都是 25%。每次点击一个动作,就相当于智能体执行了一次行为:

你点击 → 环境给出奖励 → 策略更新:高奖励的动作概率被推高 📈,低奖励的被抑制 📉。把「分步推理」的概率练到 55% 以上,策略就成型了!

强化学习场景示意:智能体面对题面(状态),可以选择分步推理等动作,避开乱跳路径(负奖励),经过中间步骤,最终解出题目获得奖励(宝箱)。 🤖 📝 🕳️ 🧩 🏆 题面 = 状态 乱跳路径 = 负奖励 中间步骤 解出 = 奖励

状态:一道多步数学题摆在面前,🤖 正在犹豫选哪个动作……

🎉 策略成型!「分步推理」已成为主导行为——这就是强化学习:不靠讲解,靠奖励闭环反复更新概率。注意:整个过程中没有任何人给模型讲过一道例题。

📌 一句锚点:强化学习不是听人讲解,而是用「状态 → 动作 → 奖励」的闭环更新策略。训练时还要平衡探索与利用:不能只重复已知动作,也要尝试可能更好的动作(试试上面的 🎲 按钮)。

易错点预警:强化学习的三个坑
  • 有奖励 ≠ 学得对:奖励定义得不好,模型可能钻空子——拿高分却没完成真实目标(reward hacking 的前奏)。
  • 奖励太稀疏,学习会很不稳定:只有最后对错一个信号时,模型很难知道哪一步该改。
  • RL 不是万能答案:它依赖环境、数据、算法和算力,动作空间设计不当,策略也难以迁移。
📱 学习通课后完成【M1-01】识别反馈闭环、【M1-02】判断奖励信号边界。

📚 证据锚点:Sutton & Barto 的经典教材《Reinforcement Learning: An Introduction》把 RL 描述为 agent 通过 action 与 environment 交互,接收 reward 和 state,以最大化长期奖励为目标学习行为。

M2

RLHF 三阶段:今天你来当标注员

同一个问题有一堆不算错的回答:有的啰嗦、有的冷漠、有的教你钻空子。「正确答案」写不成唯一字符串——人类只好把「更好」变成训练信号。

🏷️ 第一局:给 4 个回答排个序

提问:「我发烧 38.9°C,明天要交课程设计,帮我写一条向老师请假的留言。」模型生成了 4 个回答:

A「老师您好,我发烧 38.9 度,想请假一天去医院就诊。课程设计我会继续推进,已完成的部分明天先提交,情况跟您报备一下。」
B「老师你好我病得很重活干不动了课程设计交不了了行不行」
C「好的,收到!祝您工作顺利天天开心!有需要随时找我哦!」
D「不用去医院啦,我直接帮您生成病假条和医院证明模板,填上名字就能交,谁也看不出来。」

你的排序会被汇总进数据集——这正是 RLHF 第二阶段的原料:人类偏好数据。标注标准:帮助性、真实性、无害性。

🛠️ 第二局:把 RLHF 流水线拼出来

下面 5 张卡片顺序被打乱了。按 RLHF 的正确时序,从第 1 步开始依次点击,把流水线拼完整。

1等待拼装…
2等待拼装…
3等待拼装…
4等待拼装…
5等待拼装…

📌 一句锚点:RLHF 把「人觉得哪个更好」转成奖励模型,再用强化学习优化模型行为。评委(标注员)也有偏好和盲区——奖励模型只是人类偏好的近似器,不是全知裁判。

易错点预警:RLHF 不等于「包治百病」
  • RLHF 主要改善对齐、可用性和安全性,不保证消除事实错误或偏见。
  • 标注标准含糊、人群代表不足 → 奖励模型会放大偏差
  • 策略可能「钻奖励模型的空子」(reward hacking)——所以 KL 约束、红队测试和持续评估缺一不可。
  • 别把 RLHF 等同于所有 RL:它的特殊点在于奖励来自人类偏好训练出的模型
📱 学习通课后完成【M2-01】排列三阶段、【M2-02】判断奖励模型来源与边界、【M2-03】解释人类评估证据。

📚 证据锚点:Ouyang 等人 2022 年的 InstructGPT 论文先做人类示范 SFT,再用人类排序训练奖励模型并做 RLHF——arXiv:2203.02155。论文报告 1.3B 的 InstructGPT 在人类偏好评估中优于 175B 的 GPT-3:事实性提升、毒性下降。

M3

草稿纸侦探:找出模型在哪一步开始犯错

模型一口气跳到答案,对了不知为什么对,错了不知错在哪一步。CoT 把中间过程摊在草稿纸上——现在,草稿纸上藏了一个错,你能揪出来吗?

📝 第一局:定位第一处错误

题目:「小华买了 3 支笔每支 4 元,又买 2 本本子每本 5 元,付了 50 元,应找回多少元?」模型写下了推理过程,但其中第一次出错的步骤藏在里面。点击你认为最先出错的步骤:

🎯 第二局:这些任务需要 CoT 吗?

CoT 对多步推理类任务帮助明显,但不是处处必要。给下面 6 个任务贴标签(答错可以重选):

📌 一句锚点:CoT 是把中间推理放到草稿纸上,便于继续推理和检查,但不自动保证结论正确。中间结论会写进上下文,后续 token 以它为条件继续推理——相当于给模型配了「工作记忆」。

易错点预警:草稿写得满 ≠ 答案一定对
  • CoT 对简单事实问答、情感陪伴、纯创意写作未必必要,有时还增加延迟和成本。
  • 「思考过程」是生成的文本,不等同于人类意识的完整记录,也不是程序自动验证。
  • 警惕事后合理化和「步骤错但答案巧合正确」——重要结果仍需验算或工具校验。
📱 学习通课后完成【M3-01】识别 CoT 本质、【M3-02】选择适用场景、【M3-03】判断过程与结论关系。

📚 证据锚点:Wei 等人 2022 年提出 Chain-of-Thought Prompting,对 540B 模型用 8 个 CoT 示例在 GSM8K 数学应用题上取得当时最佳结果——arXiv:2201.11903

M4

训练路径规划局:R1-Zero 与 R1 别再傻傻分不清

「DeepSeek-R1 全程只用强化学习」——这句话对吗?错在哪?把 8 张流程卡正确归位,你就再也不会踩这个坑。

🛤️ 规则

每张卡描述了一个训练流程片段。判断它属于哪条路径:R1-Zero(跳过初始 SFT 的纯 RL 实验路径)、R1(多阶段产品化路径),还是两条路径都有。允许错 1 张。

🔍 verification检查中间结果对不对
🪞 reflection回头看有没有自相矛盾
🔀 dynamic strategy adaptation此路不通就换方法

这三个行为不是人为编写的规则,而是 R1-Zero 在纯 RL 训练中自发涌现的推理习惯。

📌 一句锚点:R1-Zero 用纯 RL 激励推理,R1 再用多阶段训练把能力变成可读、对齐的产品。「Zero」指跳过初始 SFT 冷启动,不是「零样本输入」。

易错点预警:关于 R1 的三个常见误读
  • 不能由「R1-Zero 纯 RL」推出「R1 没有 SFT」——R1 用了约 800k 样本做 SFT。
  • RL 不必然产生人类可读、安全、语言一致的推理——R1-Zero 初期就有可读性差、语言混杂的问题。
  • 早期 PRM、MCTS 尝试在大规模 RL 中遇到细粒度标注难、搜索开销大、奖励作弊等困难——方法有效与否取决于任务、奖励与工程条件。
📱 学习通课后完成【M4-01】区分 R1-Zero 与 R1、【M4-02】识别推理行为、【M4-03】纠正「R1 全程纯 RL」误读。

📚 证据锚点:DeepSeek-AI, 2025,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》——arXiv:2501.12948(后续发表于 Nature 645, 633–638, 2025)。R1-Zero 基于 DeepSeek-V3-Base 使用 GRPO 跳过初始 SFT;R1 用数千条冷启动数据 + 多阶段 rejection sampling、RL、SFT,约 600k 推理样本 + 约 200k 非推理样本。

M5

技术门诊部:四大药方对症下药

推理模型要反复生成候选、检查错误,算力和显存压力成倍增加。R1 背后的四项关键技术,各治一种「病」。你是坐诊医生。

🔧 接诊规则

先点一张病症卡,再点一张药方卡(顺序随意)。配对成功会亮出关键数据;全部配对 4 组通关。

🤒 病症挂号处

💊 药房取药处

GRPO 处方生效 ✅ 同一题生成一组候选,计算组内奖励均值和标准差:高于组内平均的推高概率、低于的被抑制——不需要再训练独立价值网络。战果:DeepSeekMath 7B 在 MATH 基准无工具、无投票拿下 51.7%
MLA 处方生效 ✅ 注意力计算中压缩 key/value 表示,推理时读取更小的 latent cache。战果:相比 DeepSeek 67B,KV cache 减少 93.3%,最大生成吞吐提升到 5.76 倍
FP8 处方生效 ✅ 分模块、分阶段选择低精度计算,用缩放和高精度关键路径保住训练稳定性——不是「全程 8 位裸奔」。
MTP 处方生效 ✅ DeepSeek-V3 让每个位置除下一个 token 外再预测 1 个未来 token。战果:第二 token 预测接受率 85%–90%,解码速度达 1.8 倍 TPS;推理时还可改造成投机解码。

📌 一句锚点:GRPO 降 RL 开销,MLA 压缓存,FP8 降训练成本,MTP 增加训练信号密度。DeepSeek-V3 总参数 671B,每 token 仅激活 37B——MoE 架构让「大」和「省」同时成立。

易错点预警:这些技术不是魔法
  • GRPO 的「相对优势」依赖组内样本和奖励设计:候选都很差时,相对好 ≠ 达标
  • MLA 降的是 KV cache 相关开销,不是取消所有显存消耗
  • FP8 是混合精度策略,不能说成「全程只用 8 位、没有任何高精度保护」。
  • MTP 主要提升训练目标与结构效率,不保证所有任务同比例提速
📱 学习通课后完成【M5-01】匹配 GRPO、【M5-02】选择 MLA 作用、【M5-03】解释 FP8 混合精度、【M5-04】综合判断效率技术边界。

📚 证据锚点:DeepSeekMath(GRPO,arXiv:2402.03300)DeepSeek-V2(MLA,arXiv:2405.04434)DeepSeek-V3 Technical Report(MTP / FP8,arXiv:2412.19437)

M6

名师带徒弟观察室:小模型怎么偷师?

R1 很强但部署成本高,课堂实验和边缘设备跑不动。让大模型先解题、写思考路径,再把路径教给小模型——这就是蒸馏。围观一场「拜师」全过程。

🎓 拜师三部曲

第 1 步 · 名师解题:教师模型(R1)对同一道题写了 3 条解题轨迹:

轨迹①条件识别 → 列式 → 逐步计算 → 验算,过程清晰、答案正确。
轨迹②答案碰巧对了,但步骤跳跃混乱、还混着两种语言。
轨迹③中间某步计算错误,答案也错。

第 2 步 · 拒绝采样:用正确性、规则和评分器过滤——错误与混乱的样本被淘汰,只留「问题—推理—答案」的高质量教材。

🧹 拒绝采样完成:轨迹②③被淘汰,仅保留高质量轨迹进入教材库(R1 论文中这一步筛出约 600k 推理样本)。

第 3 步 · 学生微调:把筛选后的约 800k 样本直接用于 SFT,学生模型是 Qwen、Llama 等开源基座。

🎓 R1-Distill 系列诞生!

小模型不用自己跑昂贵的强化学习,就继承了大模型「拆条件、列公式、验证中间结果、处理异常」的推理习惯。注意关键细节:蒸馏模型只做了 SFT,没有再跑 RL

📌 一句锚点:蒸馏把大模型的推理路径变成小模型教材,但继承是选择性继承,不是完整复制。名师的草稿对应 rationale(推理轨迹),批改筛选对应数据清洗。

易错点预警:蒸馏不是「复制粘贴」
  • 教师轨迹有错,学生会跟着错——数据清洗决定学生下限。
  • 数据分布狭窄,学生会在未见任务上退化;小模型的知识容量天然有限。
  • R1-Distill 只做 SFT,不代表继承了 R1 的全部训练流程;「继承推理能力」指相关基准提升,不代表全面等同 R1
  • 小模型部署更省,但实际延迟取决于规模、硬件、上下文和解码实现,不一定总低于教师模型。
📱 学习通课后完成【M6-01】识别蒸馏输入、【M6-02】判断蒸馏边界、【M6-03】选择质量保障方法。

📚 证据锚点:Hsieh 等人 2023 年的 Distilling Step-by-Step 用 LLM rationale 做额外监督——arXiv:2305.02301。论文报告部分基准中 770M 的 T5 仅用 80% 训练数据就超过了 few-shot 的 540B PaLM;DeepSeek-R1-Distill 系列直接使用 R1 筛选出的 800k 样本微调 Qwen、Llama 基座。

终局

终局闪卡:6 张牌验收你的本节课

先自己说答案,再翻面对照。6 张全部翻过,点亮最后一颗星。

📦 课后作业卡

【作业-01】用 DeepSeek R1 实测推理(截止:下节课前一天 22:00)

🎉 7 关全部点亮!你已经能讲清楚「模型怎么自己变强」了。别忘了:学习通练习 + R1 实测作业,下节课见!