课后习题:预训练与后训练:大模型的教育
课堂习题
【M1-01】识别预训练目标
- 知识点:M1 预训练
- 题型:单选题
- 难度:易
题干:【M1-01】大模型预训练阶段最主要的目标是什么?
A. 学习海量文本中的语言规律和世界知识
B. 直接学会服从所有用户指令
C. 删除训练数据中的所有错误观点
D. 只记住企业内部最新文档
答案与解析
答案:A
解析:预训练用海量网页、书籍、文章和代码建立语言、知识和表达基础。服从指令主要靠后训练;数据清洗不能保证删除所有错误,企业最新文档也不属于通用预训练目标。
【M1-02】判断预训练能力
- 知识点:M1 预训练
- 题型:判断题
- 难度:中
题干:【M1-02】预训练之后,模型一定已经学会按照用户要求的格式、语气和安全边界来回答。
答案与解析
答案:错
解析:预训练主要形成语言和知识基础,模型更像续写器。格式、角色、安全边界等协作行为通常还需要后训练调整。
【M1-03】匹配预训练原料
- 知识点:M1 预训练
- 题型:多选题
- 难度:中
题干:【M1-03】下列哪些材料更适合作为通用大模型预训练阶段的文本来源?
A. 网页文章
B. 书籍
C. Python 代码
D. 学生提交的一份未授权成绩单
答案与解析
答案:ABC
解析:网页、书籍和代码能提供语言、知识和代码表达。未授权成绩单涉及隐私,且不是通用预训练语料。
【M2-01】解释完形填空机制
- 知识点:M2 自监督学习
- 题型:单选题
- 难度:中
题干:【M2-01】“前端开发需要掌握 HTML、CSS 和______。”让模型预测空格处内容,这种训练方式最接近什么?
A. 自监督学习中的完形填空式训练
B. 依赖人工标注每条答案的监督学习
C. 只靠奖惩信号调整策略的强化学习
D. 由专家手写规则库的专家系统
答案与解析
答案:A
解析:文本本身被改造成预测目标,模型根据上下文学习语言关系,不需要人工逐条标注。
【M2-02】判断自监督学习
- 知识点:M2 自监督学习
- 题型:判断题
- 难度:中
题干:【M2-02】自监督学习不需要人工逐条标注答案,因此也没有任何学习目标。
答案与解析
答案:错
解析:自监督学习会从文本内部自动构造目标,例如预测被遮盖词、下一个词或前后句关系;它不是没有目标。
【M2-03】辨析标注需求
- 知识点:M2 自监督学习
- 题型:多选题
- 难度:中
题干:【M2-03】关于预训练中的自监督学习,下列说法哪些正确?
A. 可以利用大规模自然文本
B. 文本的一部分可以自动变成学习目标
C. 模型能从中学习语法和常见搭配
D. 它能保证所有学到的知识都经过事实核验
答案与解析
答案:ABC
解析:自监督学习适合利用海量文本,并通过预测任务学习语言规律;数据中的错误和过时信息不会被自动验证。
【M3-01】识别涌现现象
- 知识点:M3 涌现能力
- 题型:单选题
- 难度:中
题干:【M3-01】下列哪种现象最适合用“涌现能力”解释?
A. 模型规模扩大后,多步推理和复杂总结能力显著出现
B. 模型回答速度因为更换硬盘而变快
C. 用户输入更长的提示词后,页面显示更多文字
D. 模型输出内容被人工复制到另一个文档
答案与解析
答案:A
解析:涌现强调模型规模、数据和算力达到一定程度后,某些较弱或不存在的能力显著出现,而不是硬件速度、页面显示或复制行为。
【M3-02】判断规模条件
- 知识点:M3 涌现能力
- 题型:判断题
- 难度:中
题干:【M3-02】只要模型出现涌现能力,就说明它在所有任务上都会稳定正确。
答案与解析
答案:错
解析:涌现能力具有任务依赖性,不同任务的表现提升不同;模型仍可能失败、编造或误解条件。
【M3-03】设计能力测试任务
- 知识点:M3 涌现能力
- 题型:多选题
- 难度:中
题干:【M3-03】测试模型是否出现更强推理和总结能力,下列哪些任务比较合适?
A. 比较两篇文章的观点差异
B. 根据多个条件拆解项目风险
C. 按指定受众改写技术说明
D. 统计模型参数文件占用的硬盘空间
答案与解析
答案:ABC
解析:前三项需要语义理解、关系组织和指令跟随;硬盘统计属于系统操作,不适合作为语言模型涌现能力的语言任务测试。
【M4-01】识别知识截止
- 知识点:M4 知识截止与幻觉
- 题型:单选题
- 难度:易
题干:【M4-01】模型只学习到 2025 年 6 月前的数据,用户询问 2026 年 2 月的新政策。模型给出一个旧政策解释。这最突出的原因是?
A. 知识截止
B. 模型没有神经网络
C. 用户没有关闭网页
D. Token 数量太少
答案与解析
答案:A
解析:训练数据有时间边界,训练截止之后的新事实可能不在模型知识范围内。
【M4-02】区分幻觉与过时
- 知识点:M4 知识截止与幻觉
- 题型:判断题
- 难度:中
题干:【M4-02】模型编造一篇看起来很真实但实际不存在的论文,属于知识截止问题。
答案与解析
答案:错
解析:这更像幻觉。知识截止强调训练数据有时间边界;幻觉强调模型生成了虚构或不可验证内容。
【M4-03】选择核验策略
- 知识点:M4 知识截止与幻觉
- 题型:多选题
- 难度:中
题干:【M4-03】处理AI回答中的不可靠信息,下列做法哪些合适?
A. 对时间敏感信息检查官方来源
B. 要求模型给出判断依据
C. 用多个来源交叉验证
D. 只要回答语气肯定就直接采信
答案与解析
答案:ABC
解析:官方来源、依据说明和交叉验证能降低风险;语气流畅不等于事实正确。
【M5-01】识别 SFT 目标
- 知识点:M5 后训练 SFT
- 题型:单选题
- 难度:中
题干:【M5-01】SFT 阶段使用大量“问题—好回答”样本,最主要想训练模型学会什么?
A. 按用户指令组织合适的回答
B. 从零开始重新学习所有世界知识
C. 不再需要任何训练数据
D. 把所有回答都压缩成一句话
答案与解析
答案:A
解析:SFT通过示例让模型理解任务类型、格式、角色、语气和安全边界,而不是从零重建知识,也不要求固定缩短答案。
【M5-02】判断指令数据
- 知识点:M5 后训练 SFT
- 题型:判断题
- 难度:中
题干:【M5-02】SFT 数据通常由提示词和高质量回答成对组成。
答案与解析
答案:对
解析:SFT用“问题—好回答”示例告诉模型在特定指令下应产生什么行为。
【M5-03】比较前后行为
- 知识点:M5 后训练 SFT
- 题型:多选题
- 难度:中
题干:【M5-03】经过高质量 SFT 后,模型可能在哪些方面表现更好?
A. 更清楚分点回答的格式
B. 更能理解“扮演面试官”等角色要求
C. 更能控制回答长度和语气
D. 自动保证所有事实都无需人工核验
答案与解析
答案:ABC
解析:SFT能改善指令跟随、角色表现和表达控制,但不能消除事实核验需求。
【M6-01】评估 SFT 数据质量
- 知识点:M6 SFT 数据质量
- 题型:单选题
- 难度:中
题干:【M6-01】评估SFT数据质量时,下列哪项最重要?
A. 回答是否准确、清晰、可执行并符合任务格式
B. 回答字数是否越多越好
C. 数据是否全部由同一个模型生成
D. 问题是否全部来自同一个章节
答案与解析
答案:A
解析:SFT数据要示范正确、清晰、可执行和格式合适的行为。字数并非越多越好,单一来源和单一任务反而会降低泛化。
【M6-02】诊断坏样本
- 知识点:M6 SFT 数据质量
- 题型:判断题
- 难度:中
题干:【M6-02】SFT样本中的回答只要看起来专业,就一定是高质量数据。
答案与解析
答案:错
解析:还要检查事实是否可靠、步骤能否执行、格式是否匹配任务、是否包含安全和覆盖面问题。
【M6-03】设计高质量 SFT 样本
- 知识点:M6 SFT 数据质量
- 题型:多选题
- 难度:中
题干:【M6-03】构建高质量SFT数据集时,下列做法哪些正确?
A. 覆盖不同类型任务
B. 保持答案事实准确
C. 统一任务所需的输出格式
D. 故意混入大量低质量回答增加数量
答案与解析
答案:ABC
解析:高质量数据需要覆盖真实任务多样性,并保持事实、步骤和格式稳定;噪声数据会让模型学到不一致行为。