### 学习目标 1. 理解生成模型的发展脉络 掌握Diffusion模型的基本原理 了解各类生成模型的优缺点 ### 生成模型家族 #### AE (Autoencoder,自编码器) `输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构` 思想:学习数据的压缩表示 问题:生成的图像模糊,缺乏多样性 #### VAE (Variational AE,变分自编码器) `潜在空间约束为标准正态分布`\ ` ↓`\ `可以随机采样`` → ``解码`` → ``生成新图像` 改进:引入概率分布,增强生成能力 #### GAN (Generative Adversarial Network) `生成器:生成假图像`\ `判别器:判断真假`\ ` ↓`\ `对抗训练,相互博弈` 优势:生成图像质量高 问题:训练不稳定,模式崩溃 #### Diffusion Model (扩散模型) `前向:逐步加噪`` → ``纯噪声`\ `反向:学习去噪`` → ``还原图像` 优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3 ### Diffusion原理 #### 前向过程 (加噪) `原图`` x₀`\ ` ↓ ``加高斯噪声`\ `x₁ = x₀ + ε₁`\ ` ↓ ``加噪声`\ `x₂ = x₁ + ε₂`\ ` ↓ ...`\ `x_T`` = ``纯噪声` #### 反向过程 (去噪) `纯噪声`` ``x_T`\ ` ↓ ``去噪`\ `x_{T-1} = ``去噪网络``(``x_T``)`\ ` ↓ ``去噪`\ `x_{T-2} = ``去噪网络``(x_{T-1})`\ ` ↓ ...`\ `x₀ = ``原始图像` #### 训练目标 `去噪网络学习预测:`\ ` ``添加的噪声`` ε`\ ` ``或`\ ` ``原始图像`` x₀` ### Stable Diffusion架构 #### 潜在空间扩散 `为了效率,在潜在空间操作:`\ \ `图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\ ` ↓`\ ` VAE``解码`` → ``图像` #### 核心组件 ------------------------------------- 组件 作用 -------------- ---------------------- VAE 图像与潜在空间的转换 U-Net 去噪网络 Text Encoder 处理文本提示词 CLIP 文图对齐 ------------------------------------- ### 文生图工作流 #### 输入提示词 `"``一只猫,水彩画风格``"` #### `2. ``文本编码` #### → 文本向量表示 `3. ``初始化` #### → 随机噪声 `4. ``去噪循环` `for t in T...1:` `噪声`` → ``预测噪声`` → ``去噪` `5. ``解码输出` → 潜在表示 → VAE解码 → 图像 ### 思考与练习 1. Diffusion为什么比GAN训练更稳定? 2. 潜在空间扩散有什么优势? 3. 文生图如何实现风格控制? ### 关键术语 --------------------------------------------------- 中文 英文 说明 ---------- ----------------- ---------------------- 潜在空间 Latent Space 压缩后的数据表示空间 去噪 Denoising 移除噪声的过程 提示词 Prompt 指导生成的文本描述 潜变量 Latent Variable 不可直接观测的变量 模式崩溃 Mode Collapse GAN生成多样性不足 --------------------------------------------------- ### 延伸阅读 1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239) [High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链