Files
2026_DesignAI/05-generative-ai/04.1-diffusion.md
T
pengxiao e58b95d227 初始化:从 docx 拆分为独立 Markdown 章节
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件,
按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-04-25 10:32:58 +08:00

3.3 KiB

学习目标

  1. 理解生成模型的发展脉络

    掌握Diffusion模型的基本原理

    了解各类生成模型的优缺点

生成模型家族

AE (Autoencoder,自编码器)

输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构

思想:学习数据的压缩表示

问题:生成的图像模糊,缺乏多样性

VAE (Variational AE,变分自编码器)

潜在空间约束为标准正态分布

可以随机采样`` → ``解码`` → ``生成新图像

改进:引入概率分布,增强生成能力

GAN (Generative Adversarial Network)

生成器:生成假图像
判别器:判断真假

对抗训练,相互博弈

优势:生成图像质量高 问题:训练不稳定,模式崩溃

Diffusion Model (扩散模型)

前向:逐步加噪`` → ``纯噪声
反向:学习去噪`` → ``还原图像

优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3

Diffusion原理

前向过程 (加噪)

原图`` x₀
↓ ``加高斯噪声
x₁ = x₀ + ε₁
↓ ``加噪声
x₂ = x₁ + ε₂
↓ ...
x_T`` = ``纯噪声

反向过程 (去噪)

纯噪声`` ``x_T
↓ ``去噪
x_{T-1} = ``去噪网络``(``x_T``)
↓ ``去噪
x_{T-2} = ``去噪网络``(x_{T-1})
↓ ...
x₀ = ``原始图像

训练目标

去噪网络学习预测:
``添加的噪声`` ε
``或
``原始图像`` x₀

Stable Diffusion架构

潜在空间扩散

为了效率,在潜在空间操作:

图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪

VAE``解码`` → ``图像

核心组件


组件 作用


VAE 图像与潜在空间的转换

U-Net 去噪网络

Text Encoder 处理文本提示词

CLIP 文图对齐

文生图工作流

输入提示词

"``一只猫,水彩画风格``"

2. ``文本编码

→ 文本向量表示

3. ``初始化

→ 随机噪声

4. ``去噪循环

for t in T...1:

噪声`` → ``预测噪声`` → ``去噪

5. ``解码输出

    → 潜在表示 → VAE解码 → 图像

思考与练习

  1. Diffusion为什么比GAN训练更稳定?

  2. 潜在空间扩散有什么优势?

  3. 文生图如何实现风格控制?

关键术语


中文 英文 说明


潜在空间 Latent Space 压缩后的数据表示空间

去噪 Denoising 移除噪声的过程

提示词 Prompt 指导生成的文本描述

潜变量 Latent Variable 不可直接观测的变量

模式崩溃 Mode Collapse GAN生成多样性不足

延伸阅读

  1. Denoising Diffusion Probabilistic Models

    High-Resolution Image Synthesis with Latent Diffusion Models # 04.2 AIGC设计工具链