授课讲义:第 04 次课:RLHF 与强化学习:DeepSeek-R1 深度解析

一、上节课回顾

  • 上节课三个要点:
    1. 神经元按“输入、权重、激活、输出”处理信息,权重决定不同输入的重要程度。
    2. 神经网络通过多层组合特征;RNN 像传话游戏,远距离信息容易丢失,Transformer 改用开会式注意力全局找关联。
    3. 预训练让模型在海量文本中学语言规律,SFT 用“问题—好回答”样本把续写机器调整成更听话的助手。
  • 已经留下的基础:学生能解释注意力机制、预训练、自监督学习、涌现能力、知识截止、幻觉和 SFT 的基本关系。
  • 今天要接上的问题:SFT 之后,模型如何继续通过奖励信号优化推理,而不是只模仿标准答案?
  • 开场检查:请学生用一句话回答“SFT 学的是什么信号?它与‘环境或评委给分再调整行为’有什么不同?”

二、本节课主要内容和目标

本节课结束时,学生能:

  1. 用状态、动作、奖励和反馈闭环解释强化学习的基本机制。
  2. 按顺序说明 RLHF 的 SFT、奖励模型、强化优化三个阶段,并解释人类排序数据的作用。
  3. 判断 CoT 适用场景,区分“展示中间推理步骤”与“结论必然正确”。
  4. 区分 DeepSeek-R1-Zero 的纯强化学习路径与 DeepSeek-R1 的多阶段训练路径。
  5. 说明 GRPO、MLA、FP8、MTP 分别解决什么问题,并选择合适的适用边界。
  6. 解释蒸馏如何让小模型继承大模型推理能力,同时判断其能力不一定全面等同。
  7. 根据“奖励来源、推理过程、训练成本、安全边界”比较不同训练方法。
顺序知识点学生能做到课堂练习时间
M1强化学习基础解释奖惩反馈如何塑造行为【M1-01】【M1-02】10分钟
M2RLHF 三阶段说明人类偏好如何进入训练【M2-01】【M2-02】【M2-03】15分钟
M3思维链 CoT判断中间推理步骤的价值与边界【M3-01】【M3-02】【M3-03】12分钟
M4DeepSeek R1 与纯强化学习区分 R1-Zero 与 R1 的训练路径【M4-01】【M4-02】【M4-03】15分钟
M5R1 关键技术:GRPO、MLA、FP8、MTP匹配关键技术与训练/推理效率问题【M5-01】【M5-02】【M5-03】【M5-04】18分钟
M6蒸馏与小模型推理能力继承解释蒸馏收益和能力边界【M6-01】【M6-02】【M6-03】10分钟

课堂总时长 80 分钟,另留 10 分钟机动。教师准备一个奖惩反馈示意图、一份 RLHF 三阶段流程图、一道可展示 CoT 的数学题、一段 DeepSeek-R1 思考过程示例和一份 R1/R1-Zero 对照表。

三、本节课知识内容

M1:强化学习基础

问题开场:一个模型读完海量文本后会说很多话,SFT 后也能按照指令回答。可面对同一道数学题,它这次写对、下次写错,谁来告诉它“这个解题策略更值得保留,那个胡乱跳跃的路径应该被抑制”?如果答案只有最终对错,模型怎样把结果变成下一次的行为调整?

旧解释失效:“模型见过很多例题,所以会做题”解释不了失败后的改进。“SFT 照着好答案学”也解释不了没有唯一文本答案的场景:下棋要看对手反应,机器人要看环境状态,复杂推理要看策略是否稳定。仅靠模仿正确示范,缺少一个根据行为结果持续调整策略的机制。

概念登场:强化学习(Reinforcement Learning,RL)是一种智能体通过与环境交互,根据奖励信号调整策略的学习方式。它关心“在什么状态(state)下采取什么动作(action),能获得更高奖励(reward)”。奖励通常是可以计算的反馈,如分数、正确性、任务完成度或安全惩罚;策略则是从状态到动作的决策规则。

机制拆解:先有状态,例如题面、棋盘、机器人感知到的环境;智能体根据当前策略选择动作,例如写下解题步骤、移动棋子或控制机械臂;环境反馈下一个状态和奖励;学习算法根据奖励提高带来高回报的动作概率,降低带来低回报的动作概率。这个循环反复进行,模型不是记住某一题的答案,而是逐渐更新“遇到类似情况该怎么决策”的策略。训练时还要平衡探索与利用:不能只重复已知动作,也要尝试可能更好的动作。

证据锚点:Sutton 和 Barto 的经典教材《Reinforcement Learning: An Introduction》把 RL 描述为 agent 通过 action 与 environment 交互,接收 reward 和 state,并以最大化长期奖励为目标学习行为。来源:Sutton & Barto, Reinforcement Learning: An Introduction

类比展开:训练宠物像强化学习:狗做出动作对应智能体选择 action,“坐下成功”或“做错”对应环境反馈,零食或没有零食对应 reward,狗调整以后的行为对应策略更新。游戏闯关也类似:玩家用关卡结果修正操作路线。但狗和玩家有情绪、意图和感知经验,模型没有“想被夸奖”的意识;RL 中的奖励本质是数值信号,学习过程是参数更新,不是心理说服。但这个类比的边界在于:狗对应生物行为,模型的动作概率对应参数更新,并不对应意识和情绪。

边界与误读:强化学习不等于“有奖励就一定学对”。奖励定义得不好,模型可能钻空子,得到高分却没有完成真实目标;奖励过于稀疏,学习可能很不稳定;动作空间设计不当,也会让策略难以迁移。RL 还依赖环境、数据、算法和算力,不能把“强化学习”当成所有训练难题的万能答案。

一句锚点:强化学习不是听人讲解,而是用状态、动作和奖励的闭环更新策略。

课堂练习:讲完本模块后,在学习通完成【M1-01】识别反馈闭环、【M1-02】判断奖励信号边界。

M2:RLHF 三阶段

问题开场:同一个问题可以有很多不算语法错误的回答:有的啰嗦,有的编造来源,有的冷漠,有的包含危险建议。“正确答案”很难写成唯一字符串,人工也不可能逐条修改模型生成的海量回复。怎样把人类觉得“更好”的判断,变成模型能学习的训练信号?

旧解释失效:普通 SFT 能让模型模仿“问题—好回答”,但它需要现成的示范答案,且监督信号通常来自固定样本。对于“A 比 B 更有帮助、更安全”这类相对偏好,单靠逐题写标准答案很难覆盖。规则过滤能挡住部分危险内容,却难以判断复杂上下文中的帮助性与无害性平衡。

概念登场:RLHF(Reinforcement Learning from Human Feedback)用人类偏好训练奖励模型,再用强化学习优化语言模型。常见三阶段是:先做监督微调(SFT),让基座模型具备基本指令响应能力;再让人类对同一提示下的多个模型输出排序,训练奖励模型;最后用奖励模型给策略模型的输出打分,通过 PPO 等强化学习方法优化模型行为。

机制拆解:第一阶段 SFT 提供行为起点,模型先学会把用户输入当成指令而不是普通续写。第二阶段,系统让模型对同一问题生成多个回答,标注员按帮助性、真实性、无害性等标准排序;奖励模型以提示和回答为输入,输出代表人类偏好强度的分数。第三阶段,策略模型生成回答,奖励模型评分,强化学习算法提高高分回答的生成概率;同时通常加入 KL 惩罚,防止策略为了讨好奖励模型而偏离原模型太远。这样,稀疏的人工判断被转成可批量使用的评分信号。

证据锚点:Ouyang 等人在 InstructGPT 论文中先用人类示范做 SFT,再用人类对模型输出的排序训练 reward model 并做 RLHF;论文报告 1.3B InstructGPT 在人类偏好评估中优于 175B GPT-3,输出的事实性提升、毒性下降。来源:OpenAI / Ouyang et al., 2022, Training language models to follow instructions with human feedback, arXiv:2203.02155。

类比展开:RLHF 像培养新员工:先看优秀范文和岗位手册,相当于 SFT;再请资深评委给不同方案排序,形成评分标准,相当于奖励模型;员工以后按评委反馈改进工作方式,相当于强化优化。评委对应人类标注偏好,排序对应相对比较。但评委也有偏好、疲劳和文化盲区;奖励模型只是学到的近似评分器,不是全知裁判。但这个类比的边界在于:评委对应人类标注群体,奖励模型只是对应其偏好的近似器,类比在偏好偏差和 reward hacking 处失效。

边界与误读:RLHF 主要改善对齐、可用性和安全性,不保证消除事实错误或偏见。若标注标准含糊、人群代表不足,奖励模型会放大偏差。奖励模型也可能被策略“钻空子”,出现 reward hacking;KL 约束、红队测试和持续评估都不可少。也不要把 RLHF 等同于所有 RL,它的特殊点在于奖励来自人类偏好训练出的模型。

一句锚点:RLHF 把“人觉得哪个更好”转成奖励模型,再用强化学习优化模型行为。

课堂练习:讲完本模块后,在学习通完成【M2-01】排列三阶段、【M2-02】判断奖励模型来源与边界、【M2-03】解释人类评估证据。

M3:思维链 CoT

问题开场:直接问模型一道多步数学题,它可能一口气跳到答案。答案若错了,老师看不出错在哪一步;答案若对了,也分不清是推理成功还是碰巧模仿了某个结果。复杂任务需要模型把中间过程摆出来,可“写了过程”为什么会让推理更容易成功?

旧解释失效:“回答长就是认真”解释不了冗长废话;传统 few-shot 只示范输入输出,模型缺少“从已知条件推到中间量,再推到目标”的显式路径。对需要多步约束、单位转换、逻辑排除或代码跟踪的任务,单步预测很难同时承载所有中间状态。

概念登场:思维链(Chain-of-Thought,CoT)是在最终答案前生成一系列中间推理步骤的方法。它让模型把复杂问题分解为可追踪的步骤:提取条件、列式、转换、检查、排除错误选项,再得出结论。CoT 可以通过提示示例激发,也可以通过训练让模型形成更稳定的推理表达。

机制拆解:输入包含任务和示例时,CoT 示例展示“问题—中间步骤—答案”的映射;模型生成时把中间结论写入上下文,后续 token 可以继续以这些中间结论为条件,而不是强迫一次跳跃到终点。这样,多步计算被外化为可检查的文本,错误更容易定位;对模型自身来说,中间步骤也相当于给后续预测提供了工作记忆。评价时要看步骤是否真的使用题面条件、是否自洽,不能只看长度。

证据锚点:Wei 等人提出 Chain-of-Thought Prompting,把中间推理步骤写进 few-shot 示例;论文报告对 540B 模型使用 8 个 CoT 示例,在 GSM8K 数学应用题上取得当时最佳结果,超过带 verifier 微调的 GPT-3。来源:Wei et al., 2022, Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, arXiv:2201.11903。

类比展开:CoT 像草稿纸:题面对应原始输入,草稿上的公式和中间量对应中间推理步骤,最终答案对应输出。草稿让老师能检查每一步,也让学生自己不会把条件漏掉。但草稿写得满不等于对:一个公式看起来漂亮,仍可能用错单位或抄错数字;“步骤合理”只是更容易检查,不是正确性的保证。但这个类比的边界在于:草稿公式对应中间推理状态,而“看起来合理”不对应数学必然正确,类比在抄错和事后合理化处失效。

边界与误读:CoT 对多步数学、逻辑、代码追踪和约束满足类任务帮助明显,但对简单事实问答、情感陪伴或纯创意写作未必必要,有时还会增加延迟和成本。CoT 展示的“思考过程”是生成的推理文本,不等同于人类意识的完整记录,也不等于程序自动验证。模型可能出现事后合理化、步骤错误但答案巧合正确的情况,重要结果仍需验算或工具校验。

一句锚点:CoT 是把中间推理放到草稿纸上,便于继续推理和检查,但不自动保证结论正确。

课堂练习:讲完本模块后,在学习通完成【M3-01】识别 CoT 本质、【M3-02】选择适用场景、【M3-03】判断过程与结论关系。

M4:DeepSeek R1 与纯强化学习

问题开场:SFT 示范能教模型“好答案长什么样”,但高质量长推理样本很贵,而且只模仿范例不一定让模型学会自己检查和换方法。DeepSeek 团队尝试用可验证奖励激励推理:模型做错就少得分,做对就多得分。这里的“纯强化学习”到底指谁?是不是 DeepSeek-R1 全程只靠 RL?

旧解释失效:把 DeepSeek-R1 简化成“整个模型完全纯 RL”会丢掉关键阶段。R1-Zero 确实跳过初始 SFT,用强化学习直接激励推理;但正式的 DeepSeek-R1 为了解决可读性、语言混杂和对齐问题,引入了多阶段流程,结合 rejection sampling、RL 和 SFT。若把两者混为一谈,就无法解释为什么 R1-Zero 有探索价值,R1 又要继续加工。

概念登场:DeepSeek-R1-Zero 是基于 DeepSeek-V3-Base、使用 GRPO、跳过初始 SFT、以强化学习激励推理能力的实验路径;它证明推理行为可以从带奖励的 RL 中涌现。DeepSeek-R1 则是在此基础和冷启动数据之上构建的多阶段模型,用 rejection sampling 筛选样本、继续 RL 和 SFT,使推理能力继承到更可读、更对齐的输出中。

机制拆解:R1-Zero 的关键在于奖励信号:数学、代码等答案可验证的任务看最终正确性;输出还要满足推理过程和答案的格式要求。GRPO 在同一提示的组内样本之间比较相对优势,策略因此更新。训练中模型会尝试不同推理路径,逐渐出现 verification(检查中间结果)、reflection(回头看有没有矛盾)和 dynamic strategy adaptation(换方法)等行为。R1 的多阶段流程先用数千条长 CoT 冷启动数据改善表达,再用 RL 提升推理;随后通过 rejection sampling 生成约 600k 推理样本,并补充约 200k 写作、事实问答、自我认知等非推理样本,形成约 800k SFT 数据,重训后继续 RL 优化对齐和推理表现。

证据锚点:DeepSeek-AI 论文说明 R1-Zero 基于 DeepSeek-V3-Base,使用 GRPO,跳过初始 SFT,用纯 RL 激励推理;奖励主要依赖最终答案正确性和格式,模型自发出现 verification、reflection、dynamic strategy adaptation。R1 先用数千条冷启动数据,再通过多阶段 rejection sampling、RL、SFT 改善可读性和对齐;论文明确报告约 600k 推理样本和约 200k 非推理样本,共约 800k 样本用于相关 SFT。来源:DeepSeek-AI, 2025, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, arXiv:2501.12948;后续发表于 Nature 645, 633–638 (2025)。

类比展开:R1-Zero 像学生不先看范文,直接刷题,根据答案对错慢慢摸索出“检查、反推、换方法”的习惯;R1 则像这个学生后来把有效套路整理成笔记,请老师修正表达和错误习惯,再做专项训练。刷题对应 RL,笔记和示范对应 SFT,筛选好题解对应 rejection sampling。但学生有真实的理解和元认知,模型只是参数化策略;R1-Zero 初期还存在可读性差和语言混合问题。但这个类比的边界在于:刷题对应奖励驱动的策略更新,笔记对应监督样本,而学生对应真实理解,模型不对应完整的元认知主体;该类比在可读性和语言混合处失效。

边界与误读:不能说“R1-Zero 纯 RL”就推出“R1 没有监督微调”,也不能说 RL 必然产生人类可读、安全且语言一致的推理。“Zero”指跳过初始 SFT 冷启动,不是“零样本输入”。论文还报告早期 PRM 和 MCTS 尝试在大规模 RL 流程中遇到细粒度标注、搜索开销和奖励作弊等困难;这说明方法有效与否取决于任务、奖励与工程条件。R1-Zero 的探索意义在于奖励驱动,不代表可以省略对齐、数据清洗和安全评估。R1 的“思考过程”是可以分析的生成文本,重要结论仍要看最终结果是否可验证。

一句锚点:R1-Zero 用纯 RL 激励推理,R1 再用多阶段训练把能力变成可读、对齐的产品。

课堂练习:讲完本模块后,在学习通完成【M4-01】区分 R1-Zero 与 R1、【M4-02】识别推理行为、【M4-03】纠正“R1 全程纯 RL”误读。

M5:R1 关键技术:GRPO、MLA、FP8、MTP

问题开场:推理模型要反复生成候选、检查错误、尝试策略,算力和显存压力成倍增加。PPO 需要额外的价值网络,长上下文会撑大 KV cache,低精度训练可能损伤稳定性,一次只预测一个 token 又限制训练信号。R1 及其基座技术如何同时处理推理优化、存储、成本和训练效率?

旧解释失效:只看参数量解释不了成本差异;只说“用了强化学习”解释不了策略梯度怎么稳定;只说“大模型聪明”解释不了长上下文推理为什么贵。传统 PPO 有效但资源开销较高,普通 KV cache 随上下文线性膨胀,单纯把所有数值压到低精度又容易影响训练稳定。

概念登场:GRPO(Group Relative Policy Optimization)是 PPO 的变体,对同一提示采样一组回答,用组内相对比较估计优势,减少对独立价值网络的依赖。MLA(Multi-head Latent Attention)把 Key-Value cache 压缩到低秩 latent 向量,降低长上下文推理时的显存占用。FP8 mixed precision 用 8 位浮点参与部分训练计算,同时保留关键高精度环节以降低成本。MTP(Multi-Token Prediction)在 DeepSeek-V3 中让每个位置除预测下一个 token 外,再预测一个额外未来 token,提高训练信号密度,并在推理中可改造成投机解码。

机制拆解:GRPO 对同一题生成一组候选,计算组内奖励均值和标准差,把高于组内平均的回答推向更高概率,低于平均的回答被抑制;这样不需要训练一个额外价值模型来估计基线。MLA 在注意力计算中压缩 key/value 表示,推理时读取更小的 latent cache,从而减少显存并提高吞吐。FP8 训练不是把所有状态随意截断,而是分模块、分阶段选择低精度计算,并用缩放和高精度关键路径保持稳定。MTP 在预训练目标中让每个位置额外预测下一个之后的 1 个 token;推理时可以丢弃模块让主模型独立工作,也可复用它做投机解码。DeepSeek-V3 报告第二个 token 的接受率为 85%–90%,可带来 1.8 倍 TPS。

证据锚点:DeepSeekMath 论文提出 GRPO,说明其用组内相对比较优化,在数学推理提升的同时降低 PPO 内存占用;DeepSeekMath 7B 在 MATH 基准上无外部工具、无投票达到 51.7%。DeepSeek-V2 报告 MLA 将 KV cache 压缩进 latent vector,相比 DeepSeek 67B 减少 93.3%,最大生成吞吐提升到 5.76 倍。DeepSeek-V3 报告总参数 671B、每 token 激活 37B,采用 MLA、DeepSeekMoE 和 multi-token prediction,其中 MTP 深度为 1;并介绍 FP8 mixed precision training framework。MTP 评估报告第二个 token 预测接受率 85%–90%,解码速度达 1.8 倍 TPS。来源:DeepSeek-AI, 2024, DeepSeekMath, arXiv:2402.03300;DeepSeek-AI, 2024, DeepSeek-V2, arXiv:2405.04434;DeepSeek-AI, 2024, DeepSeek-V3 Technical Report, arXiv:2412.19437。

类比展开:GRPO 像同一题让小组四人独立作答,老师不设绝对分数线,而是根据组内名次反馈谁的做法更值得保留。MLA 像把厚会议纪要压缩成索引卡,保留后续检索需要的关键信息,减少记忆负担。FP8 像用更短记号记账,多数账目省空间提速,关键总账仍用高精度复核。MTP 像练习时不只猜下一个字,而是一次多看几步,训练密度更高。但索引卡可能丢细节,短记号必须控制误差,小组名次也不等于绝对水平;这些技术都要靠工程约束维持稳定。但这个类比的边界在于:小组名次对应组内相对优势,索引卡对应 latent cache,短记号对应低精度数值;它们不对应无条件的无损压缩或绝对能力提升,类比在误差控制和分布外任务处失效。

边界与误读:GRPO 的“相对优势”依赖同一提示下的组内样本和奖励设计,如果候选质量都很差,相对较好不代表达到目标。MLA 降低的是 KV cache 相关开销,不是取消所有显存消耗。FP8 是混合精度策略,不能描述成“全程只用 8 位且没有任何高精度保护”。MTP 主要提升训练目标和结构效率,不等同于推理时一定无限制地一次输出多个 token,也不保证所有任务都同比例提速。

一句锚点:GRPO 降 RL 开销,MLA 压缓存,FP8 降训练成本,MTP 增加训练信号密度。

课堂练习:讲完本模块后,在学习通完成【M5-01】匹配 GRPO、【M5-02】选择 MLA 作用、【M5-03】解释 FP8 混合精度、【M5-04】综合判断效率技术边界。

M6:蒸馏与小模型推理能力继承

问题开场:R1 这类大推理模型能力强,但部署成本高,很多课堂实验、边缘设备和低成本产品跑不动。能否让大模型先解题、写思考路径,再把这些路径教给小模型,使小模型不必重复昂贵的强化学习也能学会类似推理?

旧解释失效:只压缩参数像把厚书直接撕薄,容易丢掉关键推理链条;普通输出蒸馏只学最终答案,学生可能记住结果却不会推导。对数学和逻辑任务,答案对错不足以传递“如何检查、何时反推、怎样换方法”的策略。

概念登场:推理蒸馏是让小模型学习大模型生成的解题过程、理由或结构化样本,从而继承推理模式的方法。它可以配合原始问题和答案、 rationale、筛选后的高质量轨迹或拒绝采样数据进行 SFT;DeepSeek-R1-Distill 系列则用 R1 生成的 800k 样本直接微调 Qwen、Llama 等开源基座模型,而不是对这些蒸馏模型再做 RL,使较小模型获得更强推理表现。

机制拆解:先由教师模型生成多条解题轨迹,系统用正确性、规则、评分器或拒绝采样筛掉错误与混乱样本;再把保留的“问题—推理—答案”样本用于训练学生模型。小模型在参数量更小的条件下学习如何拆条件、列公式、验证中间结果、处理异常情况。这样,教师模型的探索成本被复用,学生模型训练目标更聚焦;小模型通常更容易部署、显存占用更低,但实际延迟取决于模型规模、硬件、上下文和解码实现,不一定总低于教师模型。

证据锚点:Hsieh 等人提出 Distilling Step-by-Step,用 LLM rationale 作为额外监督训练小模型;论文报告部分基准中 770M T5 在仅用 80% 训练数据的情况下超过 few-shot prompted 540B PaLM。DeepSeek-R1 论文说明 R1-Distill 系列基于 Qwen、Llama 等开源模型,直接使用 R1 筛选出的 800k 样本微调,使小模型继承推理能力。来源:Hsieh et al., 2023, Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes, arXiv:2305.02301;DeepSeek-AI R1 开源资料。

类比展开:蒸馏像名师把解题套路整理给徒弟:名师先示范完整草稿,徒弟学习条件识别、步骤转换、检查方法;徒弟对应小模型,名师草稿对应 rationale 或推理轨迹,批改筛选对应数据清洗。徒弟更小、通常更省资源,但不一定全面超过老师,速度也要看硬件和解码实现;遇到新题型、跨领域综合或需要大量世界知识时,容量差异仍然存在。但这个类比的边界在于:名师草稿对应教师 rationale,徒弟对应小模型;徒弟不对应教师的完整知识容量,类比在跨领域新任务处失效。

边界与误读:蒸馏不是无损复制。教师轨迹有错,学生会跟着错;数据分布狭窄,学生会在未见任务上退化;小模型知识容量也有限。蒸馏后的模型仍要单独评测事实性、安全性、语言一致性、输出格式和推理鲁棒性;R1-Distill 只做 SFT,不代表继承了 R1 的全部训练流程。R1-Distill 的“继承推理能力”指在相关基准和任务上提升,不代表全面等同 R1。

一句锚点:蒸馏把大模型的推理路径变成小模型教材,但继承是选择性继承,不是完整复制。

课堂练习:讲完本模块后,在学习通完成【M6-01】识别蒸馏输入、【M6-02】判断蒸馏边界、【M6-03】选择质量保障方法。

课后作业

  • 【作业-01】用 DeepSeek R1 完成 3 道数学、逻辑或编程题,记录题面、最终答案、关键思考步骤和人工验算结论,截止下节课前一天 22:00。

资料与下载

  • PPT 课件:已上传学习通网盘,待补充下载链接。
  • 课堂/课后习题:请在学习通对应单元完成,待补充入口链接。
  • 补充提示词或资料:如本页未列出,以老师课前在学习通发布的资料包为准。