授课讲义:第 02 次课:神经网络与 Transformer:AI 的大脑结构

一、上节课回顾

  • 上节课三个要点:
    1. AI 发展从规则系统走到大模型,核心变化是从人写规则转向从数据中学规律。
    2. 监督学习靠带答案练习,无监督学习自己找规律,强化学习靠奖惩反馈;AI 依赖算力、算法和数据。
    3. 大模型像文字接龙,会根据前文预测候选词;温度、上下文窗口和概率采样影响输出。
  • 已经留下的基础:学生能完成一次 AI 对话和文生图体验,也能区分“生成结果合理”与“结果可直接交付”。
  • 今天要接上的问题:大模型为什么能记住长距离关系、判断一词多义,并生成更连贯的回答。
  • 开场检查:请学生用一句话回答“上次课说的文字接龙,为什么可能忘记前文?”

二、本节课主要内容和目标

本节课结束时,学生能:

  1. 画出一个简化人工神经元,并标出输入、权重、激活、输出四个环节。
  2. 用输入层、隐藏层、输出层解释神经网络为什么能提取越来越抽象的特征。
  3. 通过传话游戏说明传统 RNN 的信息衰减问题。
  4. 用“开会讨论”和“全局注意力”解释 Transformer 与传统 RNN 的区别。
  5. 根据 bank 等一词多义例句,说明注意力机制如何依靠上下文选择含义。
顺序知识点学生能做到课堂练习时间
M1人工神经元画出并解释信息处理过程【M1-01】【M1-02】【M1-03】18分钟
M2神经网络分层说明每层如何逐级提取特征【M2-01】【M2-02】【M2-03】14分钟
M3RNN 的局限用传话游戏解释信息衰减【M3-01】【M3-02】【M3-03】12分钟
M4Transformer 注意力用全局视角解释重要信息【M4-01】【M4-02】【M4-03】20分钟
M5一词多义处理根据上下文判断词义【M5-01】【M5-02】【M5-03】16分钟

课堂总时长 80 分钟,另留 10 分钟机动。学生需要纸笔或平板绘图工具;教师准备神经元示意图、传话句卡、bank 例句卡和 AI 工具演示环境。

三、本节课知识内容

M1:人工神经元

剧情钩子:上一课说大模型在文字接龙,可到底是谁在接?打开 AI 的“大脑车间”,最小工人——人工神经元登场:它接收信息、判断重要性,再决定要不要输出。

是什么:人工神经元是对大脑神经细胞的简化模拟。它接收多个输入,为每个输入乘上权重,再把加权结果汇总,经过激活函数判断,最后产生输出。输入代表外部信息,权重代表不同信息的重要程度,激活决定信号是否继续传递以及输出强度。

核心特点:神经元的关键不是“收到信息”,而是“区分信息的重要性”。权重越大,对应输入对结果的影响越大;权重越小,影响越弱。激活函数让神经元不只做加法,还能形成阈值、筛选或非线性转换。一个神经元能力有限,但大量神经元连接后,可以表示复杂模式。

典型例子:判断“是否推荐学生参加技能竞赛”时,可以把平时成绩、项目作品、出勤作为输入。如果竞赛更看重作品,项目作品权重最高;如果课程纪律是硬条件,出勤也会有较高权重。汇总后,激活结果可以表示“推荐、待定或不推荐”。

易错点:学生容易把输入值和权重混在一起。输入是原始信息,权重是模型学习到的重要程度。也不能认为激活函数只是简单相加;加权求和之后,激活函数会改变输出的形式、范围或触发方式。

课堂练习:讲完本模块后,在学习通完成【M1-01】梳理神经元流程、【M1-02】判断神经元权重、【M1-03】解释激活作用。

M2:神经网络分层

剧情钩子:一个神经元只能做一个判断,能力太有限。于是神经网络把它们编成流水线:先看细节,再组合关系,最后给出结论。

是什么:神经网络把许多神经元组织成层。输入层接收原始数据,隐藏层逐层组合特征,输出层给出判断或预测。浅层往往识别简单关系,深层把这些简单关系继续组合成更抽象的模式。所谓“深”,通常指隐藏层数量多、逐级抽象的路径长。

核心特点:分层的意义是把复杂判断拆成多次加工。前一层输出成为后一层输入,模型因此能先识别局部,再理解关系,最后形成结论。层数越深,可表达的组合越丰富,但也越需要充足数据和算力;不是所有任务都是层数越多越好。

典型例子:识别“教室里举手的学生”时,浅层可能看到边缘、颜色和形状;中间层组合出手、脸、身体等部位;较深层再判断“学生”“举手”“课堂场景”之间的关系;输出层给出是否识别到目标。

易错点:学生容易把“隐藏层”理解成黑箱名称,说不出职责。应抓住“接收上一层输出、组合更复杂特征、传给下一层”这条主线。也不能把文件名、保存路径等系统信息当成神经网络提取的特征。

课堂练习:讲完本模块后,在学习通完成【M2-01】识别分层职责、【M2-02】判断深层特征、【M2-03】拆解识别流程。

M3:RNN 的局限

剧情钩子:处理长句子时,RNN 主动举手:“我按顺序传话。”可惜句子越长,信息越像传话游戏,传到后面已经变了样。

是什么:循环神经网络 RNN 是一种按时间或文本顺序处理信息的结构。当前步骤的输出会进入下一步,形成“记忆”。传统 RNN 在短序列中有效,但随着序列变长,早期信息在逐步传递中衰减、变形或被后来的信息覆盖。

核心特点:RNN 的优势是符合语言和事件的先后顺序,参数规模也相对较小。它的弱点是远距离依赖不稳定:句子开头的关键条件,可能到结尾已经被中间内容冲淡。它主要靠隐藏状态逐步传递信息,而不是让所有位置同时直接建立联系。

典型例子:传话游戏中,“周三下午三点,机房,前端小组带电脑参加部署测试”经过几个人转述后,时间、地点或任务可能丢失。RNN处理长句时类似:距离越远,开头信息越难稳定保留到最后。

易错点:学生容易把信息丢失归因于“学生没记住”或“模型太小”。更本质的问题是逐级传递方式让远距离信息容易被稀释。也不能把 RNN 和 Transformer 混为一谈;传统 RNN主要按顺序传递,Transformer 才使用全局注意力。

课堂练习:讲完本模块后,在学习通完成【M3-01】概括 RNN 问题、【M3-02】定位 RNN 问题、【M3-03】判断 RNN 视角。

M4:Transformer 注意力

剧情钩子:RNN 的传话游戏容易丢失信息,传来传去变了样。于是 Google Transformer 拍桌子说:“别传话了,我们来开会。”会上所有材料同时摊开,谁和议题有关,谁就被重点关注。

是什么:Transformer 是一种以注意力机制为核心的神经网络结构。它让一段文本中的不同位置互相建立关系,并根据任务为重要信息分配更高权重。与只沿顺序传递信息不同,Transformer 能同时看到全局内容,再决定“谁和谁有关”“哪些证据更重要”。

核心特点:注意力机制解决了远距离依赖问题。模型处理一个词时,不只看前一个词,还可以关注句子甚至篇章中的相关词。它像开会:所有材料都摆在桌面上,参会者根据议题挑选重点,而不是只能听上一个人转述。这个机制让 Transformer 在长文本、语义理解和生成任务中表现更好。

典型例子:判断“谁最适合当班长”时,全班不只听最后一位同学的发言,而是同时考虑组织能力、责任心、沟通能力和时间投入。权重会向与“班长职责”最相关的证据倾斜。模型处理文本时,也会根据任务提高相关词句的权重。

易错点:注意力不是平均看所有内容,也不是只看关键词字面。它会根据上下文和任务建立关系。也不能认为 Transformer 完全抛弃了顺序信息;它仍然会利用位置信息,只是不再只靠逐步传递来记忆。

课堂练习:讲完本模块后,在学习通完成【M4-01】解释注意力机制、【M4-02】选择注意力重点、【M4-03】判断 Transformer 视角。

M5:一词多义处理

剧情钩子:开会时,bank 这个词引发争论:有人说银行,有人说河岸。会议主席说:“别吵,先看上下文。”注意力机制开始根据线索判断词义。

是什么:一词多义指同一个词在不同上下文中有不同含义。注意力机制会让模型根据周围词的关系调整词的表示。bank 在“bank of the river”中受 river 影响,更可能表示河岸;在“go to the bank”中受动作和业务场景影响,更可能表示银行。

核心特点:模型不是为每个词查一条固定释义,而是根据上下文计算关系。上下文线索越强,某个含义的注意力权重越高。中文也有类似现象:“苹果手机”里的苹果指向品牌,“吃苹果”里的苹果指向水果;“鼠标”在设备语境和动物语境中含义不同。

典型例子:翻译“I sat on the bank of the river”时,river 提供地点线索;翻译“go to the bank”时,go to 提示前往某个场所。让 AI 解释判断依据时,应能指出这些线索词,而不是只给出最终翻译。

易错点:学生容易认为单词含义固定不变,或认为 AI 只要认识单词就一定译对。专业语境、行业语境和错误搭配仍可能导致误判。判断词义时,要训练自己找出关键线索词,并让 AI 说明理由。

课堂练习:讲完本模块后,在学习通完成【M5-01】判断 bank 词义、【M5-02】判断 bank 含义、【M5-03】判断上下文词义。

课后作业

  • 【作业-01】给家人解释 Transformer 注意力:用不超过 300 字和一个生活类比解释注意力机制,截止下节课前一天 22:00。

资料与下载

  • PPT 课件:已上传学习通网盘,待补充下载链接。
  • 课堂/课后习题:请在学习通对应单元完成,待补充入口链接。
  • 补充提示词或资料:如本页未列出,以老师课前在学习通发布的资料包为准。