e58b95d227
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件, 按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
152 lines
3.3 KiB
Markdown
152 lines
3.3 KiB
Markdown
|
|
### 学习目标
|
|
|
|
1. 理解生成模型的发展脉络
|
|
|
|
掌握Diffusion模型的基本原理
|
|
|
|
了解各类生成模型的优缺点
|
|
|
|
### 生成模型家族
|
|
|
|
#### AE (Autoencoder,自编码器)
|
|
|
|
`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构`
|
|
|
|
思想:学习数据的压缩表示
|
|
|
|
问题:生成的图像模糊,缺乏多样性
|
|
|
|
#### VAE (Variational AE,变分自编码器)
|
|
|
|
`潜在空间约束为标准正态分布`\
|
|
` ↓`\
|
|
`可以随机采样`` → ``解码`` → ``生成新图像`
|
|
|
|
改进:引入概率分布,增强生成能力
|
|
|
|
#### GAN (Generative Adversarial Network)
|
|
|
|
`生成器:生成假图像`\
|
|
`判别器:判断真假`\
|
|
` ↓`\
|
|
`对抗训练,相互博弈`
|
|
|
|
优势:生成图像质量高 问题:训练不稳定,模式崩溃
|
|
|
|
#### Diffusion Model (扩散模型)
|
|
|
|
`前向:逐步加噪`` → ``纯噪声`\
|
|
`反向:学习去噪`` → ``还原图像`
|
|
|
|
优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3
|
|
|
|
### Diffusion原理
|
|
|
|
#### 前向过程 (加噪)
|
|
|
|
`原图`` x₀`\
|
|
` ↓ ``加高斯噪声`\
|
|
`x₁ = x₀ + ε₁`\
|
|
` ↓ ``加噪声`\
|
|
`x₂ = x₁ + ε₂`\
|
|
` ↓ ...`\
|
|
`x_T`` = ``纯噪声`
|
|
|
|
#### 反向过程 (去噪)
|
|
|
|
`纯噪声`` ``x_T`\
|
|
` ↓ ``去噪`\
|
|
`x_{T-1} = ``去噪网络``(``x_T``)`\
|
|
` ↓ ``去噪`\
|
|
`x_{T-2} = ``去噪网络``(x_{T-1})`\
|
|
` ↓ ...`\
|
|
`x₀ = ``原始图像`
|
|
|
|
#### 训练目标
|
|
|
|
`去噪网络学习预测:`\
|
|
` ``添加的噪声`` ε`\
|
|
` ``或`\
|
|
` ``原始图像`` x₀`
|
|
|
|
### Stable Diffusion架构
|
|
|
|
#### 潜在空间扩散
|
|
|
|
`为了效率,在潜在空间操作:`\
|
|
\
|
|
`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\
|
|
` ↓`\
|
|
` VAE``解码`` → ``图像`
|
|
|
|
#### 核心组件
|
|
|
|
-------------------------------------
|
|
组件 作用
|
|
-------------- ----------------------
|
|
VAE 图像与潜在空间的转换
|
|
|
|
U-Net 去噪网络
|
|
|
|
Text Encoder 处理文本提示词
|
|
|
|
CLIP 文图对齐
|
|
-------------------------------------
|
|
|
|
### 文生图工作流
|
|
|
|
#### 输入提示词
|
|
|
|
`"``一只猫,水彩画风格``"`
|
|
|
|
####
|
|
|
|
`2. ``文本编码`
|
|
|
|
#### → 文本向量表示
|
|
|
|
`3. ``初始化`
|
|
|
|
#### → 随机噪声
|
|
|
|
`4. ``去噪循环`
|
|
|
|
`for t in T...1:`
|
|
|
|
`噪声`` → ``预测噪声`` → ``去噪`
|
|
|
|
`5. ``解码输出`
|
|
|
|
→ 潜在表示 → VAE解码 → 图像
|
|
|
|
### 思考与练习
|
|
|
|
1. Diffusion为什么比GAN训练更稳定?
|
|
|
|
2. 潜在空间扩散有什么优势?
|
|
|
|
3. 文生图如何实现风格控制?
|
|
|
|
### 关键术语
|
|
|
|
---------------------------------------------------
|
|
中文 英文 说明
|
|
---------- ----------------- ----------------------
|
|
潜在空间 Latent Space 压缩后的数据表示空间
|
|
|
|
去噪 Denoising 移除噪声的过程
|
|
|
|
提示词 Prompt 指导生成的文本描述
|
|
|
|
潜变量 Latent Variable 不可直接观测的变量
|
|
|
|
模式崩溃 Mode Collapse GAN生成多样性不足
|
|
---------------------------------------------------
|
|
|
|
### 延伸阅读
|
|
|
|
1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239)
|
|
|
|
[High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链
|