课后习题:RLHF 与强化学习:DeepSeek-R1 深度解析

课堂习题

【M1-01】识别强化学习闭环

  • 知识点:M1 强化学习基础
  • 题型:单选题
  • 难度:易

题干:【M1-01】在强化学习中,“模型根据题面选择一种解题动作,系统根据结果给分,再调整后续策略”最直接体现了哪组要素的关系?
A. 提示词、模板、字数
B. 状态、动作、奖励与策略更新
C. 参数量、数据集、文件大小
D. 标点、语气、段落长度

答案与解析

答案:B
解析:题面对应状态,解题动作对应 action,结果给分对应 reward,后续行为调整对应策略更新。A、C、D 都只是表层数据或输出属性,没有形成强化学习的反馈闭环。

【M1-02】判断奖励信号本质

  • 知识点:M1 强化学习基础
  • 题型:判断题
  • 难度:中

题干:【M1-02】强化学习中的奖励本质上是可用于策略更新的反馈信号,不代表模型像人或宠物一样“渴望被夸奖”。
A. 对
B. 错

答案与解析

答案:对
解析:宠物类比有助于理解奖惩反馈,但模型没有人类式的意图和情绪;奖励通常被实现为数值或评分信号,用于改变策略参数。

【M2-01】排列 RLHF 三阶段

  • 知识点:M2 RLHF 三阶段
  • 题型:单选题
  • 难度:易

题干:【M2-01】下列哪条最符合常见 RLHF 的阶段顺序?
A. 奖励模型打分 → 人类写示范 → SFT
B. PPO 强化优化 → 人类排序 → 奖励模型训练
C. SFT → 人类排序训练奖励模型 → 强化优化策略
D. 奖励模型训练 → SFT → 人类排序

答案与解析

答案:C
解析:RLHF 通常先用人写示范做监督微调,让模型具备指令响应起点;再用人类对多个输出的排序训练奖励模型;最后用奖励模型指导 PPO 等强化学习优化。其余选项都把阶段顺序颠倒。

【M2-02】理解奖励模型与边界

  • 知识点:M2 RLHF 三阶段
  • 题型:多选题
  • 难度:中

题干:【M2-02】关于 RLHF 中的奖励模型和训练结果,下列说法哪些正确?
A. 奖励模型通常用人类对模型输出的偏好排序训练。
B. RLHF 可以改善有帮助性、真实性和无害性等对齐表现。
C. RLHF 能保证模型以后不再产生任何事实错误。
D. 策略模型可能钻奖励模型的空子,因此需要评估和约束。

答案与解析

答案:ABD
解析:奖励模型把人类相对偏好转成评分信号;InstructGPT 研究显示 RLHF 可提升人类评估中的事实性和安全性表现。但它不能消除所有错误,C 错误。奖励模型是近似裁判,可能出现 reward hacking,所以 D 正确。

【M2-03】解释 InstructGPT 证据

  • 知识点:M2 RLHF 三阶段
  • 题型:判断题
  • 难度:中

题干:【M2-03】InstructGPT 论文报告,1.3B InstructGPT 在人类偏好评估中优于 175B GPT-3,这说明人类偏好训练可以显著影响模型可用性。
A. 对
B. 错

答案与解析

答案:对
解析:该论文的关键发现是较小模型经过 SFT 和 RLHF 后,在人类评估中超过更大的 GPT-3,说明对齐训练对实际可用性影响很大;但这不等于参数量不重要,也不等于所有任务都必然更好。

【M3-01】识别 CoT 本质

  • 知识点:M3 思维链 CoT
  • 题型:单选题
  • 难度:易

题干:【M3-01】“Chain-of-Thought / 思维链”最准确的含义是什么?
A. 让模型在最终答案前生成中间推理步骤
B. 把所有答案缩写成一句话
C. 用更长的客套话装饰回答
D. 禁止模型参考上下文

答案与解析

答案:A
解析:CoT 的核心是把多步任务分解为可追踪的中间步骤,方便后续推理和检查。B、C 只关注长度或形式,D 与 CoT 无关。

【M3-02】选择 CoT 适用场景

  • 知识点:M3 思维链 CoT
  • 题型:多选题
  • 难度:中

题干:【M3-02】下列哪些任务更适合优先使用 CoT?
A. 多步数学应用题
B. 需要排除矛盾条件的逻辑题
C. 追踪变量变化的短代码执行题
D. 询问“今天星期几”的单步日常问答

答案与解析

答案:ABC
解析:多步计算、约束推理和变量追踪都能从中间步骤中受益。D 通常是一步事实问题,使用长推理链未必带来收益,反而可能增加成本。

【M3-03】过程不等于必然正确

  • 知识点:M3 思维链 CoT
  • 题型:判断题
  • 难度:中

题干:【M3-03】模型的 CoT 步骤看起来合理,就一定说明最终结论正确,因此不需要人工验算。
A. 对
B. 错

答案与解析

答案:错
解析:CoT 让过程更容易检查,但模型可能出现算错、误用条件或事后合理化。步骤合理只是提高可审查性,重要结果仍需验算、工具或权威来源核验。

【M4-01】区分 R1-Zero 与 R1

  • 知识点:M4 DeepSeek R1 与纯强化学习
  • 题型:单选题
  • 难度:中

题干:【M4-01】根据 DeepSeek-R1 论文,下列哪项描述最准确?
A. DeepSeek-R1-Zero 基于 DeepSeek-V3-Base,跳过初始 SFT,用 GRPO 进行纯强化学习。
B. DeepSeek-R1-Zero 先做大规模 SFT,再做 RL。
C. DeepSeek-R1 全程没有使用 SFT。
D. DeepSeek-R1 和 R1-Zero 是同一个训练流程的两个名字。

答案与解析

答案:A
解析:R1-Zero 的实验意义在于跳过初始 SFT,用 GRPO 和可验证奖励激励推理。正式版 R1 采用多阶段框架,结合 rejection sampling、RL、SFT 等改善可读性和对齐,所以 B、C、D 均不准确。

【M4-02】识别推理行为

  • 知识点:M4 DeepSeek R1 与纯强化学习
  • 题型:多选题
  • 难度:中

题干:【M4-02】DeepSeek-R1 论文描述 R1-Zero 在训练中自发出现的推理相关行为包括哪些?
A. verification,检查中间结果
B. reflection,回看是否有矛盾
C. dynamic strategy adaptation,调整或更换策略
D. 自动联网检索所有外部数据库

答案与解析

答案:ABC
解析:论文提到模型出现 verification、reflection 和 dynamic strategy adaptation 等行为。这些行为体现在生成文本和策略变化中;D 是外部工具能力,不属于论文描述的 R1-Zero 自发推理行为。

【M4-03】纠正纯 RL 误读

  • 知识点:M4 DeepSeek R1 与纯强化学习
  • 题型:判断题
  • 难度:易

题干:【M4-03】因为 DeepSeek-R1-Zero 采用纯强化学习,所以正式版 DeepSeek-R1 也完全没有监督微调阶段。
A. 对
B. 错

答案与解析

答案:错
解析:这是常见混淆。R1-Zero 才是跳过初始 SFT 的纯 RL 推理训练示例;DeepSeek-R1 采用多阶段训练,结合 rejection sampling、RL、SFT,以改善可读性和对齐。

【M5-01】匹配 GRPO 机制

  • 知识点:M5 R1 关键技术:GRPO、MLA、FP8、MTP
  • 题型:单选题
  • 难度:中

题干:【M5-01】GRPO 优化策略时最依赖哪类信号?
A. 同一提示下组内候选回答的相对优势
B. 人工逐字修改每个输出
C. 外部数据库的实时查询结果
D. 输出段落的美观程度

答案与解析

答案:A
解析:GRPO 是 PPO 变体,对同一提示采样一组回答,用组内奖励均值和标准差计算相对优势,从而减少对独立价值网络的依赖。B、C、D 都不是 GRPO 的核心机制。

【M5-02】选择 MLA 作用

  • 知识点:M5 R1 关键技术:GRPO、MLA、FP8、MTP
  • 题型:单选题
  • 难度:中

题干:【M5-02】Multi-head Latent Attention(MLA)主要解决哪类问题?
A. 压缩 Key-Value cache,降低长上下文推理的显存压力
B. 自动翻译所有训练语料
C. 把模型参数从 671B 强行减到 7B
D. 关闭注意力机制以节省计算

答案与解析

答案:A
解析:MLA 将 Key-Value cache 压缩进 latent vector,DeepSeek-V2 报告相比 DeepSeek 67B 减少 93.3% KV cache,并提升最大生成吞吐。它不是删除注意力,也不是直接压缩总参数量。

【M5-03】解释 FP8 混合精度

  • 知识点:M5 R1 关键技术:GRPO、MLA、FP8、MTP
  • 题型:单选题
  • 难度:难

题干:【M5-03】DeepSeek-V3 技术报告中的 FP8 mixed precision training 最准确的理解是什么?
A. 所有训练数值全程只允许 8 位,且不保留任何高精度保护
B. 在部分训练计算中引入 FP8,并通过混合精度策略兼顾成本与稳定性
C. 用 FP8 把模型知识转换成图片
D. 只影响输出字体和界面渲染

答案与解析

答案:B
解析:FP8 训练用于降低大规模训练成本,但“混合精度”意味着需要按模块、缩放和高精度关键路径控制数值稳定性。A 忽略保护机制,C、D 与训练精度无关。

【M5-04】综合判断效率技术

  • 知识点:M5 R1 关键技术:GRPO、MLA、FP8、MTP
  • 题型:多选题
  • 难度:难

题干:【M5-04】关于 DeepSeek 相关效率技术,下列说法哪些正确?
A. GRPO 用组内相对比较减少对独立价值网络的依赖。
B. MLA 通过 latent 压缩降低 KV cache 开销。
C. MTP 让训练目标一次预测多个未来 token,提高训练信号密度。
D. FP8 混合精度的唯一作用是让模型更聪明。

答案与解析

答案:ABC
解析:A、B、C 分别对应 GRPO、MLA 和 MTP 的设计目标。FP8 的主要作用是提高大规模训练的性价比并控制数值稳定性,不是直接等同于提升智力,D 错误。

【M6-01】识别推理蒸馏输入

  • 知识点:M6 蒸馏与小模型推理能力继承
  • 题型:单选题
  • 难度:易

题干:【M6-01】要让小模型从大推理模型中学习,最符合“推理蒸馏”的输入是什么?
A. 只给学生模型最终答案
B. 用大模型生成并筛选后的解题轨迹或 rationale 训练小模型
C. 删除小模型所有参数
D. 把大模型界面截图导入小模型

答案与解析

答案:B
解析:推理蒸馏的关键是传递中间推理路径,而不只是结果。筛选高质量轨迹能减少错误示范,使小模型学习拆解、验证和调整策略的模式。

【M6-02】判断蒸馏边界

  • 知识点:M6 蒸馏与小模型推理能力继承
  • 题型:多选题
  • 难度:中

题干:【M6-02】关于推理蒸馏,下列说法哪些正确?
A. 蒸馏可以让小模型继承大模型的一部分推理模式。
B. R1-Distill 系列使用 R1 生成的 800k 样本直接 SFT Qwen、Llama 等开源基座模型。
C. 蒸馏保证小模型在所有任务上全面等同教师模型。
D. 教师模型生成的错误轨迹若未清洗,可能误导学生模型。

答案与解析

答案:ABD
解析:蒸馏通过 R1 筛选出的高质量推理样本提升小模型相关能力,R1-Distill 采用直接 SFT,没有对这些蒸馏模型再做 RL。但小模型容量、知识覆盖和教师数据分布都有限,不能保证全面等同教师模型,C 错误;脏数据会影响学生模型,D 正确。

【M6-03】选择质量保障方法

  • 知识点:M6 蒸馏与小模型推理能力继承
  • 题型:判断题
  • 难度:中

题干:【M6-03】蒸馏后的小模型只需要看参数量变小,不需要重新评测事实性、安全性和推理鲁棒性。
A. 对
B. 错

答案与解析

答案:错
解析:蒸馏是选择性继承,不是无损复制。学生模型可能受训练分布、教师错误和容量限制影响,必须按目标场景重新评测正确性、安全性、语言一致性和失败模式。