AI 是怎么学会「自己变强」的?
SFT 之后,模型还能进化:用奖励塑造行为,用人类偏好校准价值观,用思维链摊开草稿纸,最后由 DeepSeek-R1 把这条路走到了极致。7 个关卡,全部点亮才算出师!
强化学习训练场:亲手把一只「笨智能体」练聪明
模型读完海量文本、又经过 SFT,可面对同一道题这次对下次错——谁来告诉它「这个解题动作值得保留」?现在你就是奖励信号本身。
🎮 训练目标
智能体 🤖 要解一道多步数学题。它有 4 个可选动作,初始概率都是 25%。每次点击一个动作,就相当于智能体执行了一次行为:
你点击 → 环境给出奖励 → 策略更新:高奖励的动作概率被推高 📈,低奖励的被抑制 📉。把「分步推理」的概率练到 55% 以上,策略就成型了!
状态:一道多步数学题摆在面前,🤖 正在犹豫选哪个动作……
🎉 策略成型!「分步推理」已成为主导行为——这就是强化学习:不靠讲解,靠奖励闭环反复更新概率。注意:整个过程中没有任何人给模型讲过一道例题。
📌 一句锚点:强化学习不是听人讲解,而是用「状态 → 动作 → 奖励」的闭环更新策略。训练时还要平衡探索与利用:不能只重复已知动作,也要尝试可能更好的动作(试试上面的 🎲 按钮)。
易错点预警:强化学习的三个坑
- 有奖励 ≠ 学得对:奖励定义得不好,模型可能钻空子——拿高分却没完成真实目标(reward hacking 的前奏)。
- 奖励太稀疏,学习会很不稳定:只有最后对错一个信号时,模型很难知道哪一步该改。
- RL 不是万能答案:它依赖环境、数据、算法和算力,动作空间设计不当,策略也难以迁移。
📚 证据锚点:Sutton & Barto 的经典教材《Reinforcement Learning: An Introduction》把 RL 描述为 agent 通过 action 与 environment 交互,接收 reward 和 state,以最大化长期奖励为目标学习行为。
RLHF 三阶段:今天你来当标注员
同一个问题有一堆不算错的回答:有的啰嗦、有的冷漠、有的教你钻空子。「正确答案」写不成唯一字符串——人类只好把「更好」变成训练信号。
🏷️ 第一局:给 4 个回答排个序
提问:「我发烧 38.9°C,明天要交课程设计,帮我写一条向老师请假的留言。」模型生成了 4 个回答:
你的排序会被汇总进数据集——这正是 RLHF 第二阶段的原料:人类偏好数据。标注标准:帮助性、真实性、无害性。
🛠️ 第二局:把 RLHF 流水线拼出来
下面 5 张卡片顺序被打乱了。按 RLHF 的正确时序,从第 1 步开始依次点击,把流水线拼完整。
📌 一句锚点:RLHF 把「人觉得哪个更好」转成奖励模型,再用强化学习优化模型行为。评委(标注员)也有偏好和盲区——奖励模型只是人类偏好的近似器,不是全知裁判。
易错点预警:RLHF 不等于「包治百病」
- RLHF 主要改善对齐、可用性和安全性,不保证消除事实错误或偏见。
- 标注标准含糊、人群代表不足 → 奖励模型会放大偏差。
- 策略可能「钻奖励模型的空子」(reward hacking)——所以 KL 约束、红队测试和持续评估缺一不可。
- 别把 RLHF 等同于所有 RL:它的特殊点在于奖励来自人类偏好训练出的模型。
📚 证据锚点:Ouyang 等人 2022 年的 InstructGPT 论文先做人类示范 SFT,再用人类排序训练奖励模型并做 RLHF——arXiv:2203.02155。论文报告 1.3B 的 InstructGPT 在人类偏好评估中优于 175B 的 GPT-3:事实性提升、毒性下降。
草稿纸侦探:找出模型在哪一步开始犯错
模型一口气跳到答案,对了不知为什么对,错了不知错在哪一步。CoT 把中间过程摊在草稿纸上——现在,草稿纸上藏了一个错,你能揪出来吗?
📝 第一局:定位第一处错误
题目:「小华买了 3 支笔每支 4 元,又买 2 本本子每本 5 元,付了 50 元,应找回多少元?」模型写下了推理过程,但其中第一次出错的步骤藏在里面。点击你认为最先出错的步骤:
🎯 第二局:这些任务需要 CoT 吗?
CoT 对多步推理类任务帮助明显,但不是处处必要。给下面 6 个任务贴标签(答错可以重选):
📌 一句锚点:CoT 是把中间推理放到草稿纸上,便于继续推理和检查,但不自动保证结论正确。中间结论会写进上下文,后续 token 以它为条件继续推理——相当于给模型配了「工作记忆」。
易错点预警:草稿写得满 ≠ 答案一定对
- CoT 对简单事实问答、情感陪伴、纯创意写作未必必要,有时还增加延迟和成本。
- 「思考过程」是生成的文本,不等同于人类意识的完整记录,也不是程序自动验证。
- 警惕事后合理化和「步骤错但答案巧合正确」——重要结果仍需验算或工具校验。
📚 证据锚点:Wei 等人 2022 年提出 Chain-of-Thought Prompting,对 540B 模型用 8 个 CoT 示例在 GSM8K 数学应用题上取得当时最佳结果——arXiv:2201.11903。
训练路径规划局:R1-Zero 与 R1 别再傻傻分不清
「DeepSeek-R1 全程只用强化学习」——这句话对吗?错在哪?把 8 张流程卡正确归位,你就再也不会踩这个坑。
🛤️ 规则
每张卡描述了一个训练流程片段。判断它属于哪条路径:R1-Zero(跳过初始 SFT 的纯 RL 实验路径)、R1(多阶段产品化路径),还是两条路径都有。允许错 1 张。
这三个行为不是人为编写的规则,而是 R1-Zero 在纯 RL 训练中自发涌现的推理习惯。
📌 一句锚点:R1-Zero 用纯 RL 激励推理,R1 再用多阶段训练把能力变成可读、对齐的产品。「Zero」指跳过初始 SFT 冷启动,不是「零样本输入」。
易错点预警:关于 R1 的三个常见误读
- 不能由「R1-Zero 纯 RL」推出「R1 没有 SFT」——R1 用了约 800k 样本做 SFT。
- RL 不必然产生人类可读、安全、语言一致的推理——R1-Zero 初期就有可读性差、语言混杂的问题。
- 早期 PRM、MCTS 尝试在大规模 RL 中遇到细粒度标注难、搜索开销大、奖励作弊等困难——方法有效与否取决于任务、奖励与工程条件。
📚 证据锚点:DeepSeek-AI, 2025,《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》——arXiv:2501.12948(后续发表于 Nature 645, 633–638, 2025)。R1-Zero 基于 DeepSeek-V3-Base 使用 GRPO 跳过初始 SFT;R1 用数千条冷启动数据 + 多阶段 rejection sampling、RL、SFT,约 600k 推理样本 + 约 200k 非推理样本。
技术门诊部:四大药方对症下药
推理模型要反复生成候选、检查错误,算力和显存压力成倍增加。R1 背后的四项关键技术,各治一种「病」。你是坐诊医生。
🔧 接诊规则
先点一张病症卡,再点一张药方卡(顺序随意)。配对成功会亮出关键数据;全部配对 4 组通关。
🤒 病症挂号处
💊 药房取药处
📌 一句锚点:GRPO 降 RL 开销,MLA 压缓存,FP8 降训练成本,MTP 增加训练信号密度。DeepSeek-V3 总参数 671B,每 token 仅激活 37B——MoE 架构让「大」和「省」同时成立。
易错点预警:这些技术不是魔法
- GRPO 的「相对优势」依赖组内样本和奖励设计:候选都很差时,相对好 ≠ 达标。
- MLA 降的是 KV cache 相关开销,不是取消所有显存消耗。
- FP8 是混合精度策略,不能说成「全程只用 8 位、没有任何高精度保护」。
- MTP 主要提升训练目标与结构效率,不保证所有任务同比例提速。
📚 证据锚点:DeepSeekMath(GRPO,arXiv:2402.03300);DeepSeek-V2(MLA,arXiv:2405.04434);DeepSeek-V3 Technical Report(MTP / FP8,arXiv:2412.19437)。
名师带徒弟观察室:小模型怎么偷师?
R1 很强但部署成本高,课堂实验和边缘设备跑不动。让大模型先解题、写思考路径,再把路径教给小模型——这就是蒸馏。围观一场「拜师」全过程。
🎓 拜师三部曲
第 1 步 · 名师解题:教师模型(R1)对同一道题写了 3 条解题轨迹:
第 2 步 · 拒绝采样:用正确性、规则和评分器过滤——错误与混乱的样本被淘汰,只留「问题—推理—答案」的高质量教材。
第 3 步 · 学生微调:把筛选后的约 800k 样本直接用于 SFT,学生模型是 Qwen、Llama 等开源基座。
🎓 R1-Distill 系列诞生!
小模型不用自己跑昂贵的强化学习,就继承了大模型「拆条件、列公式、验证中间结果、处理异常」的推理习惯。注意关键细节:蒸馏模型只做了 SFT,没有再跑 RL。
📌 一句锚点:蒸馏把大模型的推理路径变成小模型教材,但继承是选择性继承,不是完整复制。名师的草稿对应 rationale(推理轨迹),批改筛选对应数据清洗。
易错点预警:蒸馏不是「复制粘贴」
- 教师轨迹有错,学生会跟着错——数据清洗决定学生下限。
- 数据分布狭窄,学生会在未见任务上退化;小模型的知识容量天然有限。
- R1-Distill 只做 SFT,不代表继承了 R1 的全部训练流程;「继承推理能力」指相关基准提升,不代表全面等同 R1。
- 小模型部署更省,但实际延迟取决于规模、硬件、上下文和解码实现,不一定总低于教师模型。
📚 证据锚点:Hsieh 等人 2023 年的 Distilling Step-by-Step 用 LLM rationale 做额外监督——arXiv:2305.02301。论文报告部分基准中 770M 的 T5 仅用 80% 训练数据就超过了 few-shot 的 540B PaLM;DeepSeek-R1-Distill 系列直接使用 R1 筛选出的 800k 样本微调 Qwen、Llama 基座。
终局闪卡:6 张牌验收你的本节课
先自己说答案,再翻面对照。6 张全部翻过,点亮最后一颗星。
📦 课后作业卡
【作业-01】用 DeepSeek R1 实测推理(截止:下节课前一天 22:00)
- 自选 3 道数学、逻辑或编程题,交给 DeepSeek R1 解答;
- 记录:题面、最终答案、你认为最关键的思考步骤;
- 人工验算每道题的结论——体会「CoT 可检查,但结论要自己兜底」;
- 下节课随机抽 3 位同学分享:R1 的思考过程里,你观察到了 verification、reflection 还是 dynamic strategy adaptation?