是什么
模型正式服务用户前的第一阶段训练。把互联网网页、书籍、文章、代码等海量文本交给模型,让它学习词与词的关系、句法结构、常见事实和各领域表达,目标是形成广泛的语言与知识基础,而不是只会回答某个固定问题。
上节课它学会了"开会"(Transformer),但这节课你会发现:会开会 ≠ 会干活。一个强大的模型,还要经历两段教育——预训练和后训练。下面 7 个互动关卡,带你亲手体验模型的成长之路。
剧情钩子:Transformer 已经学会了"开会",但会议桌上还没有材料。于是预训练登场——把一个新人送进基础教育,海量阅读,先学会语言规律和世界常识。
模型正式服务用户前的第一阶段训练。把互联网网页、书籍、文章、代码等海量文本交给模型,让它学习词与词的关系、句法结构、常见事实和各领域表达,目标是形成广泛的语言与知识基础,而不是只会回答某个固定问题。
数据规模极大、覆盖面广、成本高,训练目标通用。练完后模型具备语言理解、常识推断、写作改写、代码补全等基础能力——但更像一个读过很多书的"续写器":知道语言怎么接,不一定知道你要什么格式、语气和边界。
读过大量"今天天气很好,适合出门",就更会续写活动安排;读过很多 Python 报错与修复示例,就更会识别代码错误。但它分不清你要的是课堂发言、求职简历还是短视频脚本。
刚结束预训练的模型,最像下面哪一个?凭直觉选。
学习通 讲完本模块后完成【M1-01】识别预训练目标、【M1-02】判断预训练能力、【M1-03】匹配预训练原料
剧情钩子:预训练的数据量太大,人工标注答案根本不现实。自监督学习站出来说:"别急着给每句话写答案,把文本本身变成试卷。"
不需要人工逐条标注的训练方式。系统自动遮住文本中的词,或让模型预测下一个词、前后句关系——文本的一部分变成输入,另一部分自动变成学习目标,所以叫"自"监督。
优势:几乎能利用无穷的自然文本,在反复预测中学到语法、搭配、上下文一致性。软肋:数据来自真实文本,可能包含过时观点、错误说法和偏见——模型学到的是语言概率,不等于每条事实都被验证过。
"前端开发需要掌握 HTML、CSS 和______"→ 模型会预测 JavaScript;"她把文件保存到桌面,接着打开______"→ 可能是文件夹、电脑或软件。填空越复杂,越需要理解语义。
3 道完形填空:先自己选一个答案,再看看模型眼中的概率分布——感受一下"自监督"到底在练什么。
学习通 讲完本模块后完成【M2-01】解释完形填空机制、【M2-02】判断自监督学习、【M2-03】辨析标注需求
剧情钩子:模型不断变大,你以为它只是"写得快一点"?但某些能力像水管加粗到临界点后突然喷水——小模型做不到的任务,大模型开始能做了。
当模型参数、数据量和算力规模达到一定程度后,出现的较小模型不具备或表现很弱的能力:多步推理、跨领域总结、按复杂指令组织答案、理解隐含条件。它不是凭空魔法,而是大规模学习与复杂结构共同作用的能力跃迁。
① 规模阈值:同类模型小规模时只会复述,大规模后才出现稳定推理。② 任务依赖:不同任务出现涌现的时机不同——有的随规模快速改善,有的仍然失败。不能把所有好结果都归因于涌现。
小模型只能把长文压缩成几句话;大模型能总结、比较观点、指出矛盾、按老师要求改写成课堂汇报。数学应用题:小模型直接蒙答案,大模型能拆条件、列关系、逐步推理。
拖动滑块,把模型从"十亿级"一路养到"千亿级",亲眼看看"多步推理"这项能力在哪一刻被点亮。(示意图,非真实评测数据)
注意两个细节:① 阈值位置因任务而异,换一个任务曲线就不一样;② 越过阈值 ≠ 万能,涌现描述的是跃迁,不是可靠。
学习通 讲完本模块后完成【M3-01】识别涌现现象、【M3-02】判断规模条件、【M3-03】设计能力测试任务
剧情钩子:模型读过很多书,但它不能自动刷新书架。问到截止后的事,它可能装作知道;遇到不确定的内容,它也可能补出一个看似合理的细节。
模型只能稳定学习到训练数据截止时间之前的信息,之后的事件、产品、政策可能不在知识范围内。这是时间边界问题——书架上的书停在某一刻。
模型生成了看似合理但实际错误、虚构或无法验证的内容:编造文献、网址、API 名称、案件细节。这是生成机制带来的可靠性问题。
截止:联网检索、更新模型、提供新资料。幻觉:人工核验、要求模型说明依据、限制回答范围、交叉验证。做作业、写代码、查新闻前,先判断是否涉及事实与时间敏感信息。
6 个真实感案例,判断每个回答的问题出在哪。鉴定师的直觉,就是在对错里练出来的。
学习通 讲完本模块后完成【M4-01】识别知识截止、【M4-02】区分幻觉与过时、【M4-03】选择核验策略
剧情钩子:预训练结束后,模型像一个博览群书但没上过岗的毕业生——它会续写,却可能把你的问题续写成一篇散文。于是 SFT 登场,像岗前培训:拿大量"问题—好答案"样例,教它听懂指令、控制格式、承担责任。
SFT(Supervised Fine-Tuning,监督微调)是大模型后训练的重要阶段。训练数据由提示词 + 高品质回答组成,模型从中学习:用户是在提问、求解、总结、改写还是分类;回答该用什么角色、结构、语气、长度和安全边界。
预训练让模型"会说",SFT 让模型"按要求说"。经过 SFT,模型更能遵守"分点回答""只输出代码""扮演面试官""不要编造来源"等指令。但它仍不能消除幻觉,不能替代事实核验。
用户要求"用三条建议回答":没充分后训练的续写器可能继续写一段背景说明;经过 SFT 的助手更可能输出三条编号建议。要求"扮演严格的项目经理",SFT 帮助模型进入角色,按审查视角提出风险和优先级。
同一个提问,同一个模型——切换开关,看"岗前培训"到底改变了什么。
学习前端是很多人都会做出的选择,因为前端技术发展迅速,应用广泛。在正式学习之前,我们首先要了解什么是前端,以及前端在整个软件开发流程中处于什么位置。很多初学者在学习过程中会感到迷茫,因此掌握正确的学习方法显得尤为重要。首先,让我们从网页的构成讲起……
学习通 讲完本模块后完成【M5-01】识别 SFT 目标、【M5-02】判断指令数据、【M5-03】比较前后行为
剧情钩子:SFT 培训班开课了,可如果教材里全是含糊答案、错误步骤和不安全建议——模型学得越熟练,错得越像样。数据质量开始接管课堂。
高质量"问题—回答"样本通常具备:清晰任务、准确事实、完整步骤、合适格式、一致风格、必要安全边界。少量高质量样本,胜过大量噪声样本——后者会让模型在不同风格之间摇摆。
数据要覆盖真实任务的多样性:不同岗位、难度、语言风格、失败场景和安全请求。如果训练集全是简答题,模型遇到表格整理、代码修改、多轮追问时可能表现不稳定。若很多答案都编造 API,模型也会更倾向编造。
五个维度:正确性、一致性、可执行性、结构清晰度、边界处理。不能只检查答案"看起来专业",还要检查事实是否可靠、步骤能否执行、格式是否符合任务。
你是 SFT 数据质检员。同一个问题"帮学生制定前端学习计划",两份候选训练样本——哪份更有资格进教材?
多练习、多看文档,加油!相信你一定能学好前端的!
分三阶段:第 1-2 周学 HTML/CSS,每天仿写一个小页面;第 3-5 周学 JavaScript 基础,完成一个待办清单小项目;第 6 周做个人主页综合练习。每周末复盘并调整计划。适合零基础、每天能投入约 1 小时的学生。
| 质检维度 | 样本 A | 样本 B |
|---|---|---|
| 任务清晰度 | ✗ 目标模糊,等于没回答 | ✓ 阶段目标明确 |
| 步骤可执行 | ✗ "多练习"无法执行 | ✓ 每步有具体动作和产出 |
| 结构清晰度 | ✗ 只有一句话 | ✓ 分阶段 + 时间安排 |
| 覆盖面 | △ 无对象假设 | ✓ 说明了适用人群和时间投入 |
| 风格一致性 | △ 只有鼓励,缺实质内容 | ✓ 语气稳定、信息密度合理 |
学习通 讲完本模块后完成【M6-01】评估 SFT 数据质量、【M6-02】诊断坏样本、【M6-03】设计高质量 SFT 样本
每张卡对应一个模块的"最容易被考试抓住"的问题。先在心里作答,再点卡翻面核对。
设计 5 个问题测试常用大模型的知识边界,记录:你使用的提示词、模型的回答、错误类型(知识截止 / 幻觉 / 普通错误)、以及你的核验来源。用上今天学的"鉴定师"眼光,把每个错误归类清楚。
⏰ 截止:下节课前一天 22:00