课后习题:AI 绘图原理:Stable Diffusion 深度解析

课堂习题

【M1-01】识别扩散过程

  • 知识点:M1 扩散模型
  • 题型:单选题
  • 难度:易

题干:【M1-01】Stable Diffusion 所属的扩散模型,最核心的训练和生成思路是什么?
A. 直接从训练集中复制一张最接近的图片
B. 训练时逐步加噪,生成时从噪声逐步去噪
C. 只用文本匹配数据库中的相似图片
D. 先压缩图片,再直接保存为更小的 JPG

答案与解析

答案:B
解析:扩散模型在前向过程给真实图逐步加噪声,训练神经网络预测噪声;生成时从随机噪声开始反向去噪。A、C 是检索式误解,D 只描述普通压缩,不体现扩散学习。

【M1-02】判断生成与修复边界

  • 知识点:M1 扩散模型
  • 题型:判断题
  • 难度:中

题干:【M1-02】Stable Diffusion 从噪声生成图片,等价于把某张真实脏图精确还原成它的原图。
A. 对
B. 错

答案与解析

答案:错
解析:去噪类比有助于理解,但文生图是从随机噪声和文本条件中采样生成新图,不是图像恢复任务,也不保证还原某张训练原图。

【M2-01】匹配 VAE 角色

  • 知识点:M2 潜在空间与 VAE
  • 题型:单选题
  • 难度:易

题干:【M2-01】在 Stable Diffusion 中,VAE 的主要作用是什么?
A. 把提示词转换成英文单词
B. 把图片压缩到潜在空间,并把 latent 解码回像素图
C. 代替 U-Net 完成全部去噪
D. 只负责给图片添加水印

答案与解析

答案:B
解析:VAE 包含编码器和解码器:编码器把像素图压缩为潜在表示,扩散在 latent 中进行,最后解码器还原为像素图。提示词由文本编码器处理,去噪主要由 U-Net 完成。

【M2-02】判断潜在扩散收益与代价

  • 知识点:M2 潜在空间与 VAE
  • 题型:多选题
  • 难度:中

题干:【M2-02】关于潜在扩散和 VAE,下列说法哪些正确?
A. Latent Diffusion 在潜在空间中做加噪和去噪。
B. 压缩到 latent 可以降低训练和推理的计算压力。
C. VAE 解码能保证所有微小细节与压缩前完全一致。
D. 不同模型家族混用不匹配的 VAE 可能出现色彩或结构异常。

答案与解析

答案:ABD
解析:潜在扩散的核心是把扩散过程放在低维 latent 中,从而降低计算负担;但压缩和还原可能损失细节,C 错误。基础模型、VAE、LoRA 需要匹配,混用不兼容组件可能导致异常。

【M2-03】解释 latent 空间

  • 知识点:M2 潜在空间与 VAE
  • 题型:判断题
  • 难度:中

题干:【M2-03】Stable Diffusion 的 latent 空间就是一张人眼一定能直接看懂的小缩略图。
A. 对
B. 错

答案与解析

答案:错
解析:latent 是模型用来表示图像结构和语义特征的紧凑向量表示,不是普通缩略图;有些可视化方法能把 latent 转成可看图,但不能把 latent 本身等同于可读图片。

【M3-01】匹配 CLIP 作用

  • 知识点:M3 CLIP 文本编码器
  • 题型:单选题
  • 难度:易

题干:【M3-01】在文生图流程中,CLIP 文本编码器的主要作用是什么?
A. 把提示词转换成与图像语义对齐的文本向量
B. 把像素图压缩成 latent
C. 保存用户的历史生成记录
D. 自动替换所有英文提示词为中文

答案与解析

答案:A
解析:CLIP 通过图文对齐训练得到文本编码器,可以把 prompt 转成 U-Net 可用的条件向量。像素压缩由 VAE 完成,生成记录和自动翻译不是 CLIP 的核心作用。

【M3-02】判断语言支持边界

  • 知识点:M3 CLIP 文本编码器
  • 题型:判断题
  • 难度:中

题干:【M3-02】“CLIP 只能支持英文”是所有模型和版本的绝对规律。
A. 对
B. 错

答案与解析

答案:错
解析:SD 1.x 常见英文 CLIP 编码器偏英文提示,但“只支持英文”取决于具体模型的训练数据、分词器和文本编码器;许多新模型或多语言方案可以处理其他语言。

【M4-01】识别 U-Net 任务

  • 知识点:M4 U-Net 与采样步数
  • 题型:单选题
  • 难度:易

题干:【M4-01】在典型 DDPM 和 Stable Diffusion 的去噪流程中,U-Net 最主要的任务是什么?
A. 预测当前 latent 中应去除的噪声
B. 直接输出最终英文提示词
C. 只负责把图片保存到磁盘
D. 判断图片是否侵犯版权

答案与解析

答案:A
解析:U-Net 接收带噪 latent、时间步和文本条件,预测噪声或更新方向,再由 scheduler 更新 latent。版权判断、存储和 prompt 翻译都不是 U-Net 的核心任务。

【M4-02】理解 U-Net 结构与输入

  • 知识点:M4 U-Net 与采样步数
  • 题型:多选题
  • 难度:中

题干:【M4-02】关于 U-Net,下列说法哪些正确?
A. skip connection 有助于把浅层细节传给重建路径。
B. 时间步 t 能告诉 U-Net 当前噪声水平。
C. 文本嵌入可以通过交叉注意力影响去噪方向。
D. U-Net 每一步都会重新生成一张完全无关的图片。

答案与解析

答案:ABC
解析:U-Net 的编码器—解码器结构和 skip connection 有助于定位和恢复细节;时间步与文本条件都会参与预测。生成是逐步更新的过程,D 错误。

【M4-03】选择采样步数策略

  • 知识点:M4 U-Net 与采样步数
  • 题型:判断题
  • 难度:中

题干:【M4-03】采样步数越大,生成质量一定持续提高,且永远不会改变画面风格。
A. 对
B. 错

答案与解析

答案:错
解析:步数增加通常会增加耗时,可能在一定范围内改善细节,但存在边际收益递减,也可能出现过度锐化、色彩变化或风格偏移;应结合模型、sampler、CFG 和任务测试。

【M5-01】解释 CFG 机制

  • 知识点:M5 CFG 与负面提示词
  • 题型:单选题
  • 难度:中

题干:【M5-01】Classifier-Free Guidance(CFG)的基本做法是什么?
A. 放大“有文本条件”与“弱文本条件”噪声预测之间的差异
B. 把所有负面提示词从训练集中删除
C. 只提高图片分辨率,不改变生成方向
D. 把 U-Net 替换成 VAE 解码器

答案与解析

答案:A
解析:CFG 用条件预测和弱条件/无条件预测的差值放大文本引导方向,使结果更贴 prompt。它不是删除数据、单纯放大图片,也不替换 U-Net。

【M5-02】判断 CFG 高低影响

  • 知识点:M5 CFG 与负面提示词
  • 题型:多选题
  • 难度:中

题干:【M5-02】关于 CFG 强度,下列说法哪些正确?
A. CFG 偏低时,画面可能有更多自由发挥,但可能不够贴 prompt。
B. CFG 适中时,通常更容易平衡主题贴合度和画面自然度。
C. CFG 过高可能导致高饱和、僵硬、肢体错误或画面过度锐化。
D. CFG 数值越高,图片质量一定越高。

答案与解析

答案:ABC
解析:CFG 决定文本方向被放大的程度;常见范围需要在具体模型中测试,过高会损害自然度和多样性,D 错误。

【M5-03】选择负面提示词用途

  • 知识点:M5 CFG 与负面提示词
  • 题型:单选题
  • 难度:易

题干:【M5-03】下列哪项最适合写入负面提示词?
A. lowres, blurry, extra fingers, watermark
B. a cat wearing a red hat in a park
C. oil painting, soft lighting, high detail
D. cyberpunk city at night

答案与解析

答案:A
解析:负面提示词用于描述希望远离的低质或不需要属性;B、C、D 都是正向画面目标或风格描述,不适合作为“不要什么”的负面项。

【M5-04】纠正参数误区

  • 知识点:M5 CFG 与负面提示词
  • 题型:判断题
  • 难度:中

题干:【M5-04】负面提示词可以替代内容安全审核,也能修复错误的基础模型或不匹配的 LoRA。
A. 对
B. 错

答案与解析

答案:错
解析:负面提示词只能影响采样方向,减少明确不想要的属性;不能替代安全审核,也不能修复模型、VAE、LoRA 不匹配或 prompt 结构错误。

【M6-01】识别 LoRA 机制

  • 知识点:M6 LoRA 与 ControlNet
  • 题型:单选题
  • 难度:易

题干:【M6-01】LoRA 微调的主要特点是什么?
A. 训练低秩适配层,只保存较小的附加权重
B. 每次生成都重训完整 Stable Diffusion
C. 只修改提示词,不涉及模型权重
D. 必须删除原模型全部参数后重新训练

答案与解析

答案:A
解析:LoRA 冻结或基本保留预训练权重,训练低秩适配层,文件通常比完整模型小,便于切换;但它仍依赖匹配的基础模型。

【M6-02】判断 LoRA 边界

  • 知识点:M6 LoRA 与 ControlNet
  • 题型:多选题
  • 难度:中

题干:【M6-02】关于 LoRA,下列说法哪些正确?
A. LoRA 常用于固定画风、角色特征或服装概念。
B. LoRA 文件一般比完整基础模型小。
C. LoRA 必须与合适的基础模型版本搭配使用。
D. LoRA 权重越高,所有图片效果一定越好。

答案与解析

答案:ABC
解析:LoRA 通过附加权重学习风格或概念,文件小、可复用;但需要匹配基础模型。权重过高可能破坏画面,D 错误。

【M6-03】匹配 ControlNet 条件

  • 知识点:M6 LoRA 与 ControlNet
  • 题型:单选题
  • 难度:中

题干:【M6-03】想根据人物骨架控制姿势,最合适的 ControlNet 类型是什么?
A. OpenPose
B. Depth
C. Canny
D. Textual Inversion

答案与解析

答案:A
解析:OpenPose 常用于提取人体骨架并控制姿态;Depth 控制空间深浅,Canny 控制硬边缘轮廓,Textual Inversion 不是 ControlNet 姿态控制类型。

【M6-04】选择控图方法

  • 知识点:M6 LoRA 与 ControlNet
  • 题型:多选题
  • 难度:难

题干:【M6-04】关于 LoRA 与 ControlNet 的分工,下列说法哪些正确?
A. LoRA 更适合学习统一画风或特定角色特征。
B. Lineart ControlNet 可以用线稿影响轮廓和构图。
C. Depth ControlNet 可以利用前后景深关系辅助空间布局。
D. ControlNet 只要上传任意参考图,就一定能完美复刻所有内容。

答案与解析

答案:ABC
解析:LoRA 侧重风格和角色一致性,Lineart、Depth 等 ControlNet 侧重构图、轮廓或空间控制。ControlNet 还受模型、预处理、权重和分辨率影响,不能保证完美复刻,D 错误。