Files
2026_DesignAI/officefile/07-generative-ai/07-generative-ai.md
T
pengxiao 219232de74 refactor: 重组项目目录结构
以讲义内容为骨架迁移到标准目录格式:
- officefile/ 主内容(12章 + 附录 + CC4SI补充)
- dofile/ 代码示例(11个Python脚本)
- data/ 图片资源
- output/ 生成输出(忽略)
- Archive/ 归档旧目录(忽略)
- .claude/skills/ 保留markdown-to-docx工具链
- .pandoc/ 保留CSL和本地化配置

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-05-25 14:00:56 +08:00

497 lines
18 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 第7章:生成式AI——从创造到智能生成
## 篇章导读
生成式AIGenerative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的"创意伙伴"Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从"分析"到"创造"的转变,正是生成式AI最激动人心的地方。
本章将从生成模型的基本原理出发,系统介绍从自编码器(AE)、对抗生成网络(GAN)到扩散模型(Diffusion Model)的技术演进,并深入探讨AIGC工具链在设计领域的实际应用。
---
## 7.1 早期生成模型
### 7.1.1 自编码器(Autoencoder, AE
自编码器是最早的生成模型思想之一,其核心理念是**学习数据的压缩表示**。
**基本结构:**
```
输入 → 编码器 (Encoder) → 潜在表示 (Latent) → 解码器 (Decoder) → 重构输出
```
自编码器的工作方式可以理解为"先压缩,再还原":编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
**局限性:**
- 生成的图像通常**模糊**,缺乏细节
- 潜在空间缺乏结构,无法保证连续采样产生有意义的输出
- 生成**多样性不足**,更偏向重构而非创造
> **设计类比**:AE就像一位只会临摹的画师——他能把看到的景象画出来,但画得不够精细,也无法凭空创造出新的画面。
### 7.1.2 变分自编码器(Variational Autoencoder, VAE
VAE在AE的基础上引入了**概率思想**,是生成模型的重要进步。
**核心改进:**
```
传统AE: 编码器 → 确定的潜在向量 z → 解码器
VAE: 编码器 → 均值 μ、方差 σ → 采样 z ~ N(μ, σ²) → 解码器
```
VAE的关键在于将潜在空间约束为**标准正态分布**。这意味着潜在空间中的每个点都对应一个合理的输出,我们可以通过从正态分布中随机采样,再经过解码器,来**生成全新的图像**。
```
从标准正态分布中随机采样 z
解码器 (Decoder)
生成全新图像
```
**优势与不足:**
| 特性 | AE | VAE |
| --- | --- | --- |
| 潜在空间 | 无约束 | 标准正态分布 |
| 可采样性 | 不可 | 可采样生成新图像 |
| 生成质量 | 模糊 | 略好但仍偏模糊 |
| 多样性 | 低 | 较高 |
> **设计类比**:VAE就像一位理解了"风格空间"的画师——他不仅会临摹,还能在"风格空间"中探索,画出从未见过但风格一致的新作品。
---
## 7.2 对抗生成
### 7.2.1 生成对抗网络(GAN
2014年,Ian Goodfellow提出了生成对抗网络(Generative Adversarial Network, GAN),开创了生成模型的新范式。
**核心思想:对抗博弈**
```
生成器 (Generator):生成假图像 → 试图欺骗判别器
判别器 (Discriminator):判断图像真假 → 试图识破生成器
对抗训练,相互博弈,共同进步
```
GAN的训练过程可以类比为**伪造者与鉴定师**的博弈:
- **伪造者**(生成器)不断改进伪造技术,制造更逼真的假画
- **鉴定师**(判别器)不断提升辨别能力,区分真画和假画
- 随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的"杰作"
**训练过程:**
```
步骤1:生成器从随机噪声生成假图像
步骤2:判别器同时接收真实图像和假图像
步骤3:判别器输出"真"或"假"的判断
步骤4:根据判别结果,同时更新生成器和判别器
步骤5:重复以上过程,直到生成器能产生逼真图像
```
**优势:**
- 生成图像质量高,细节丰富
- 训练速度较快(相比扩散模型)
**问题:**
- **训练不稳定**:生成器和判别器需要精心平衡,容易出现一方过强
- **模式崩溃(Mode Collapse)**:生成器可能只学会生成少数几种图像,缺乏多样性
- 超参数敏感,调参困难
### 7.2.2 StyleGAN:高质量人脸生成
StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性成果。
**核心创新——风格控制:**
```
随机噪声 z → 映射网络 → 风格向量 w
风格向量 w 注入生成器的不同层:
- 浅层:控制粗粒度特征(脸型、姿态)
- 中层:控制中粒度特征(发型、表情)
- 深层:控制细粒度特征(肤色、细节)
生成高质量人脸图像
```
StyleGAN可以精确控制生成人脸的各个属性——年龄、性别、发型、表情等,并且生成的人脸在视觉上与真人照片几乎无法区分。
### 7.2.3 CycleGAN:无配对图像转换
CycleGAN解决了一个重要的实际问题:**无需成对训练数据**的图像风格转换。
```
领域A(如:照片)←→ 领域B(如:油画)
生成器GA → B(照片变油画)
生成器FB → A(油画变照片)
循环一致性约束:F(G(A)) ≈ A
```
CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景转夜晚、夏季景观转冬季等。
> **设计思考**:GAN系列模型展示了"对抗"这一全新的训练范式——不是告诉模型"正确答案是什么",而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
---
## 7.3 扩散模型
### 7.3.1 核心原理
扩散模型(Diffusion Model)是当前生成式AI的主流技术,其核心思想出人意料地简洁:**先学会如何破坏,再学会如何修复**。
**前向过程(Forward Process)——逐步加噪:**
```
原始图像 x₀
↓ 添加高斯噪声
x₁ = √(1-β₁)·x₀ + √β₁·ε₁
↓ 添加噪声
x₂ = √(1-β₂)·x₁ + √β₂·ε₂
↓ ...(重复T步)
x_T ≈ 纯噪声(与原始图像完全无关)
```
前向过程就像往一幅画上逐步泼洒墨水,每一步都让画面变得更模糊,最终变成完全的噪声。
**反向过程(Reverse Process)——逐步去噪:**
```
纯噪声 x_T
↓ 去噪网络预测并移除噪声
x_{T-1} = 去噪一步
↓ 去噪网络预测并移除噪声
x_{T-2} = 去噪一步
↓ ...(重复T步)
x₀ ≈ 原始图像
```
反向过程则像一位技艺精湛的修复师,从一团混沌的噪声中,逐步还原出清晰的图像。
**训练目标:**
```
去噪网络学习预测:添加的噪声 ε
即:给定 noisy image x_t 和时间步 t,预测 ε
损失函数:L = ||ε - ε_θ(x_t, t)||²
```
模型不需要学习"好图像长什么样",而是学习"噪声长什么样"——这是一个更容易学习的目标。
### 7.3.2 Stable Diffusion架构
Stable Diffusion是扩散模型最重要的工程实现,其核心创新是**在潜在空间(Latent Space)中进行扩散**,而非直接在像素空间操作,从而大幅提升了效率。
**整体架构:**
```
文本提示 "一只猫,水彩画风格"
Text Encoder (CLIP文本编码器) → 文本特征向量
随机噪声(在潜在空间中)
U-Net 去噪网络(条件引导:文本特征)
↓ 反复去噪T步
去噪后的潜在表示
VAE Decoder (解码器)
生成图像
```
**核心组件:**
| 组件 | 作用 | 说明 |
| --- | --- | --- |
| VAE Encoder/Decoder | 图像与潜在空间的转换 | 将高维图像压缩到低维潜在空间,提升效率 |
| U-Net | 去噪网络 | 核心生成引擎,预测并移除噪声 |
| Text Encoder (CLIP) | 文本编码 | 将文本提示转化为模型可理解的特征向量 |
| CLIP | 文图对齐 | 确保生成的图像与文本描述语义一致 |
**潜在空间扩散的优势:**
- 在低维空间操作,**计算量大幅降低**
- 压缩过程自动去除冗余信息,保留语义关键特征
- 使消费级显卡也能运行生成模型
### 7.3.3 文生图工作流(Text-to-Image Workflow
从文字到图像的完整流程:
```
1. 输入提示词(Prompt
"一座现代风格的别墅,白色外墙,大面积落地窗,周围绿树环绕,日落光线"
2. 文本编码
Prompt → CLIP Text Encoder → 文本特征向量
3. 初始化噪声
在潜在空间中生成随机噪声
4. 去噪循环
for t = T → 1:
噪声图 → U-Net(条件:文本特征 + 时间步)→ 预测噪声 → 减去噪声
5. 解码输出
潜在表示 → VAE Decoder → 最终图像
```
**提示词工程(Prompt Engineering** 是影响生成质量的关键因素。一个好的提示词通常包含:
- **主体描述**:画面核心内容
- **风格指定**:如"水彩画""赛博朋克""极简主义"
- **质量修饰**:如"高清""细节丰富""4K"
- **光照氛围**:如"黄金时段光线""柔和阴影"
> **设计类比**:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是"设计任务书",CLIP编码器理解需求,U-Net是"设计师的大脑",而VAE解码器将脑海中的概念转化为可见的图纸。
---
## 7.4 AIGC工具链
### 7.4.1 ControlNet:精确条件控制
纯文生图虽然强大,但设计师往往需要**精确控制**空间结构——这正是ControlNet解决的问题。
**核心原理:**
```
输入图像 → 提取结构条件(边缘/深度/姿态/分割)
条件特征注入ControlNet
ControlNet与主U-Net协同
输出:保持结构条件 + 应用风格
```
**支持的典型条件类型:**
| 条件类型 | 英文名 | 说明 | 设计应用 |
| --- | --- | --- | --- |
| Canny边缘 | Canny Edge | 检测图像轮廓 | 草图控制、线稿渲染 |
| 深度图 | Depth Map | 估计场景深度 | 空间关系控制 |
| 人体姿态 | OpenPose | 检测人体关键点 | 人物场景生成 |
| 法线图 | Normal Map | 表面法线方向 | 材质细节控制 |
| 语义分割 | Segmentation | 区域语义标注 | 功能区域控制 |
**设计工作流示例:**
```
手绘草图 → Canny边缘提取 → ControlNet条件控制 → 精细效果图
户型平面图 → 深度图提取 → ControlNet条件控制 → 三维透视渲染
结构线稿 → 分割图提取 → ControlNet条件控制 → 风格化设计方案
```
### 7.4.2 LoRA:高效微调
全量微调一个大模型需要巨大的计算资源,而LoRALow-Rank Adaptation,低秩适应)提供了一种**高效微调**方案。
**核心原理:**
```
原始权重矩阵 W(冻结不变,参数量 d×d)
+
低秩分解矩阵 ΔW = A × B(仅训练这部分)
A: d×r, B: r×dr << d
新权重 = W + ΔW = W + A×B
参数量从 d² 降低到 2×d×r(减少100-1000倍)
```
**LoRA的核心优势:**
- 参数量减少**100-1000倍**,大幅降低训练成本
- 训练速度快,个人电脑即可完成
- 多个LoRA可灵活叠加组合
**应用方式:**
```
基础模型 + LoRA_A(建筑风格)= 建筑风格生成
基础模型 + LoRA_B(室内风格)= 室内风格生成
基础模型 + LoRA_A + LoRA_B = 混合风格生成
```
设计师可以针对特定设计风格训练专属LoRA,如"新中式风格""日式极简风格"等,实现个性化的AI生成。
### 7.4.3 ComfyUI:模块化工作流
ComfyUI是一个基于**节点化(Node-based)** 的AIGC工作流平台,允许用户通过可视化连接来构建复杂的生成流程。
**核心特点:**
```
节点化连接 → 可视化流程 → 灵活定制 → 可复用分享
```
**典型节点:**
| 节点类型 | 功能 |
| --- | --- |
| Load Checkpoint | 加载基础模型 |
| CLIP Text Encode | 文本编码(正向/负向提示词) |
| KSampler | 采样去噪(控制步数、采样器类型等) |
| VAE Decode | 潜在空间解码为图像 |
| ControlNet Apply | 应用ControlNet条件控制 |
| LoRA Loader | 加载LoRA微调模型 |
| Save Image | 保存生成图像 |
**典型工作流示例:**
```
文本提示词 → CLIP编码 → 正向提示
负向提示词 → CLIP编码 → 负向提示 ──→ KSampler ← ControlNet条件
VAE解码
保存图像
```
### 7.4.4 Midjourney:创意探索平台
Midjourney是一个面向创意的AI图像生成平台,以极高的审美质量和艺术表现力著称。
**特点:**
- 操作简单,通过自然语言交互即可生成
- 生成图像具有很高的艺术审美品质
- 适合设计前期的**创意发散和灵感探索**
- 付费云服务,依赖网络连接
### 7.4.5 AIGC工具对比
| 工具 | 核心优势 | 适用场景 | 使用门槛 | 部署方式 |
| --- | --- | --- | --- | --- |
| Midjourney | 审美品质高、操作简单 | 创意探索、灵感发散 | 低 | 云端服务 |
| Stable Diffusion | 开源可控、本地运行 | 精细控制、批量生成 | 中 | 本地部署 |
| ControlNet | 精确结构控制 | 草图渲染、条件生成 | 中高 | 模块插件 |
| ComfyUI | 灵活工作流、可视化 | 复杂流程、定制需求 | 高 | 本地部署 |
> **设计实践建议**:在设计流程的不同阶段,可以灵活选择不同工具。前期概念阶段用Midjourney快速探索创意方向,确定方向后用Stable Diffusion + ControlNet进行精确控制,用LoRA实现风格一致性,用ComfyUI构建自动化工作流。
---
## 7.5 设计应用
### 7.5.1 建筑设计:从草图到渲染
```
手绘概念草图
↓ ControlNet (Canny边缘)
+ 提示词:"现代风格建筑,玻璃幕墙,自然光线"
AI生成效果图
↓ LoRA风格微调
多方案对比(3-5个方案)
设计师选择与调整
```
**应用价值:**
- 快速将手绘概念转化为可视化效果图
- 生成多个设计方案进行比选
- 客户沟通效率大幅提升
### 7.5.2 室内设计:从平面到立体
```
户型平面图
↓ ControlNet (Depth/Segmentation)
+ 提示词:"北欧风格客厅,浅色木地板,简约家具"
三维空间效果图
↓ LoRA材质替换
不同材质方案(木质/石材/金属)
风格迁移 → 多风格方案
```
### 7.5.3 平面设计:品牌视觉生成
```
品牌关键词:"科技感、绿色环保、信任感"
AI生成Logo候选方案(多组)
设计师筛选与调整
品牌视觉系统延展(名片、海报、包装)
```
### 7.5.4 综合案例:住宅客厅设计工作流
以下是一个完整的AI辅助住宅客厅设计工作流:
```
第1步:需求输入
客户需求:"20㎡客厅,现代简约,预算3万元,朝南,适合家庭活动"
第2步:AI生成多方案
方案A:开放式布局,浅色调,北欧简约
方案B:L型沙发布局,中性色调,日式风格
方案C:分区布局,暖色调,现代轻奢
第3步:用户选择与调整
客户选择方案B → "希望增加书房功能"
第4步:AI迭代优化
基于反馈调整 → 融合阅读角功能
第5步:VR预览
AI生成全景图 → VR沉浸式体验
第6步:最终确认
设计师微调 → 客户确认 → 施工图
```
> **设计反思**:生成式AI极大地提升了设计效率,但它始终是**辅助工具**而非替代者。设计师的审美判断、空间理解、人文关怀——这些是AI无法取代的核心能力。AI的价值在于扩展设计师的创造力边界,而非取代设计师本身。
---
## 思考与练习
1. **原理理解**Diffusion模型为什么比GAN训练更稳定?从训练目标的角度进行分析。
2. **技术对比**:对比AE、VAE、GAN和Diffusion四种生成模型,分析各自的优势和局限。在什么场景下你会选择哪种模型?
3. **工具应用**:如果你需要将一张手绘建筑草图转化为写实渲染图,请设计一个完整的AIGC工作流(包括使用的工具、条件和提示词策略)。
4. **设计实践**:选择一个室内空间,分别使用Midjourney和Stable Diffusion + ControlNet生成设计方案,对比两者的生成效果和可控性。
5. **伦理思考**:AI生成的设计作品,版权归属于谁?训练数据中使用了大量设计师的作品,这是否构成侵权?你如何看待这个问题?
---
## 关键术语
| 中文 | 英文 | 说明 |
| --- | --- | --- |
| 自编码器 | Autoencoder (AE) | 学习数据压缩与重构的模型 |
| 变分自编码器 | Variational Autoencoder (VAE) | 引入概率分布的自编码器,可采样生成 |
| 生成对抗网络 | Generative Adversarial Network (GAN) | 生成器与判别器对抗训练的生成模型 |
| 扩散模型 | Diffusion Model | 通过加噪-去噪过程生成数据的模型 |
| 去噪 | Denoising | 移除噪声、还原图像的过程 |
| 潜在空间 | Latent Space | 压缩后的低维数据表示空间 |
| 提示词 | Prompt | 指导AI生成的文本描述 |
| 条件控制 | Conditional Control (ControlNet) | 通过结构条件精确引导生成过程 |
| 低秩适应 | LoRA (Low-Rank Adaptation) | 低秩矩阵分解的高效微调方法 |
| 模式崩溃 | Mode Collapse | GAN生成多样性不足的现象 |
| 采样器 | Sampler | 去噪采样算法,决定生成过程的具体方式 |
| 文图对齐 | CLIP | 实现文本与图像语义对应的技术 |
| 提示词工程 | Prompt Engineering | 设计优化提示词以提升生成质量的技术 |