d4665a362e
- 新增 officefile/latex/ 目录,包含 main.tex、preamble.tex 及 14 个章节 + 10 个附录 tex 文件 - md→tex 转换流程:pandoc 转换 + _postprocess.py 后处理(去编号、修破折号、清标签) - 修复 5 个 md 源文件的标题层级(H1→H2 降级,统一层级结构) - 配置 VS Code LaTeX Workshop(xelatex + ctexbook 编译链) - 新增 VS Code workspace 和 .gitignore(排除 LaTeX 编译产物) Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
642 lines
22 KiB
TeX
642 lines
22 KiB
TeX
\chapter{生成式AI——从创造到智能生成}
|
||
|
||
\section{篇章导读}
|
||
|
||
生成式AI(Generative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的''创意伙伴''(Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从''分析''到''创造''的转变,正是生成式AI最激动人心的地方。
|
||
|
||
本章将从生成模型的基本原理出发,系统介绍从自编码器(AE)、对抗生成网络(GAN)到扩散模型(Diffusion Model)的技术演进,并深入探讨AIGC工具链在设计领域的实际应用。
|
||
|
||
|
||
\section{早期生成模型}
|
||
|
||
\subsection{自编码器(Autoencoder, AE)}
|
||
|
||
自编码器是最早的生成模型思想之一,其核心理念是\textbf{学习数据的压缩表示}。
|
||
|
||
\textbf{基本结构:}
|
||
|
||
\begin{lstlisting}
|
||
输入 → 编码器 (Encoder) → 潜在表示 (Latent) → 解码器 (Decoder) → 重构输出
|
||
\end{lstlisting}
|
||
|
||
自编码器的工作方式可以理解为''先压缩,再还原'':编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
|
||
|
||
\textbf{局限性:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
生成的图像通常\textbf{模糊},缺乏细节
|
||
\item
|
||
潜在空间缺乏结构,无法保证连续采样产生有意义的输出
|
||
\item
|
||
生成\textbf{多样性不足},更偏向重构而非创造
|
||
\end{itemize}
|
||
|
||
\begin{quote}
|
||
\textbf{设计类比}:AE就像一位只会临摹的画师——他能把看到的景象画出来,但画得不够精细,也无法凭空创造出新的画面。
|
||
\end{quote}
|
||
|
||
\subsection{变分自编码器(Variational Autoencoder, VAE)}
|
||
|
||
VAE在AE的基础上引入了\textbf{概率思想},是生成模型的重要进步。
|
||
|
||
\textbf{核心改进:}
|
||
|
||
\begin{lstlisting}
|
||
传统AE: 编码器 → 确定的潜在向量 z → 解码器
|
||
VAE: 编码器 → 均值 μ、方差 σ → 采样 z ~ N(μ, σ²) → 解码器
|
||
\end{lstlisting}
|
||
|
||
VAE的关键在于将潜在空间约束为\textbf{标准正态分布}。这意味着潜在空间中的每个点都对应一个合理的输出,我们可以通过从正态分布中随机采样,再经过解码器,来\textbf{生成全新的图像}。
|
||
|
||
\begin{lstlisting}
|
||
从标准正态分布中随机采样 z
|
||
↓
|
||
解码器 (Decoder)
|
||
↓
|
||
生成全新图像
|
||
\end{lstlisting}
|
||
|
||
\textbf{优势与不足:}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}lll@{}}
|
||
\toprule\noalign{}
|
||
特性 & AE & VAE \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
潜在空间 & 无约束 & 标准正态分布 \\
|
||
可采样性 & 不可 & 可采样生成新图像 \\
|
||
生成质量 & 模糊 & 略好但仍偏模糊 \\
|
||
多样性 & 低 & 较高 \\
|
||
\end{longtable}
|
||
}
|
||
|
||
\begin{quote}
|
||
\textbf{设计类比}:VAE就像一位理解了''风格空间''的画师——他不仅会临摹,还能在''风格空间''中探索,画出从未见过但风格一致的新作品。
|
||
\end{quote}
|
||
|
||
|
||
\section{对抗生成}
|
||
|
||
\subsection{生成对抗网络(GAN)}
|
||
|
||
2014年,Ian Goodfellow提出了生成对抗网络(Generative Adversarial Network, GAN),开创了生成模型的新范式。
|
||
|
||
\textbf{核心思想:对抗博弈}
|
||
|
||
\begin{lstlisting}
|
||
生成器 (Generator):生成假图像 → 试图欺骗判别器
|
||
判别器 (Discriminator):判断图像真假 → 试图识破生成器
|
||
↓
|
||
对抗训练,相互博弈,共同进步
|
||
\end{lstlisting}
|
||
|
||
GAN的训练过程可以类比为\textbf{伪造者与鉴定师}的博弈:
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
\textbf{伪造者}(生成器)不断改进伪造技术,制造更逼真的假画
|
||
\item
|
||
\textbf{鉴定师}(判别器)不断提升辨别能力,区分真画和假画
|
||
\item
|
||
随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的''杰作''
|
||
\end{itemize}
|
||
|
||
\textbf{训练过程:}
|
||
|
||
\begin{lstlisting}
|
||
步骤1:生成器从随机噪声生成假图像
|
||
步骤2:判别器同时接收真实图像和假图像
|
||
步骤3:判别器输出"真"或"假"的判断
|
||
步骤4:根据判别结果,同时更新生成器和判别器
|
||
步骤5:重复以上过程,直到生成器能产生逼真图像
|
||
\end{lstlisting}
|
||
|
||
\textbf{优势:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
生成图像质量高,细节丰富
|
||
\item
|
||
训练速度较快(相比扩散模型)
|
||
\end{itemize}
|
||
|
||
\textbf{问题:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
\textbf{训练不稳定}:生成器和判别器需要精心平衡,容易出现一方过强
|
||
\item
|
||
\textbf{模式崩溃(Mode Collapse)}:生成器可能只学会生成少数几种图像,缺乏多样性
|
||
\item
|
||
超参数敏感,调参困难
|
||
\end{itemize}
|
||
|
||
\subsection{StyleGAN:高质量人脸生成}
|
||
|
||
StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性成果。
|
||
|
||
\textbf{核心创新——风格控制:}
|
||
|
||
\begin{lstlisting}
|
||
随机噪声 z → 映射网络 → 风格向量 w
|
||
↓
|
||
风格向量 w 注入生成器的不同层:
|
||
- 浅层:控制粗粒度特征(脸型、姿态)
|
||
- 中层:控制中粒度特征(发型、表情)
|
||
- 深层:控制细粒度特征(肤色、细节)
|
||
↓
|
||
生成高质量人脸图像
|
||
\end{lstlisting}
|
||
|
||
StyleGAN可以精确控制生成人脸的各个属性——年龄、性别、发型、表情等,并且生成的人脸在视觉上与真人照片几乎无法区分。
|
||
|
||
\subsection{CycleGAN:无配对图像转换}
|
||
|
||
CycleGAN解决了一个重要的实际问题:\textbf{无需成对训练数据}的图像风格转换。
|
||
|
||
\begin{lstlisting}
|
||
领域A(如:照片)←→ 领域B(如:油画)
|
||
↓
|
||
生成器G:A → B(照片变油画)
|
||
生成器F:B → A(油画变照片)
|
||
↓
|
||
循环一致性约束:F(G(A)) ≈ A
|
||
\end{lstlisting}
|
||
|
||
CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景转夜晚、夏季景观转冬季等。
|
||
|
||
\begin{quote}
|
||
\textbf{设计思考}:GAN系列模型展示了''对抗''这一全新的训练范式——不是告诉模型''正确答案是什么'',而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
|
||
\end{quote}
|
||
|
||
|
||
\section{扩散模型}
|
||
|
||
\subsection{核心原理}
|
||
|
||
扩散模型(Diffusion Model)是当前生成式AI的主流技术,其核心思想出人意料地简洁:\textbf{先学会如何破坏,再学会如何修复}。
|
||
|
||
\textbf{前向过程(Forward Process)——逐步加噪:}
|
||
|
||
\begin{lstlisting}
|
||
原始图像 x₀
|
||
↓ 添加高斯噪声
|
||
x₁ = √(1-β₁)·x₀ + √β₁·ε₁
|
||
↓ 添加噪声
|
||
x₂ = √(1-β₂)·x₁ + √β₂·ε₂
|
||
↓ ...(重复T步)
|
||
x_T ≈ 纯噪声(与原始图像完全无关)
|
||
\end{lstlisting}
|
||
|
||
前向过程就像往一幅画上逐步泼洒墨水,每一步都让画面变得更模糊,最终变成完全的噪声。
|
||
|
||
\textbf{反向过程(Reverse Process)——逐步去噪:}
|
||
|
||
\begin{lstlisting}
|
||
纯噪声 x_T
|
||
↓ 去噪网络预测并移除噪声
|
||
x_{T-1} = 去噪一步
|
||
↓ 去噪网络预测并移除噪声
|
||
x_{T-2} = 去噪一步
|
||
↓ ...(重复T步)
|
||
x₀ ≈ 原始图像
|
||
\end{lstlisting}
|
||
|
||
反向过程则像一位技艺精湛的修复师,从一团混沌的噪声中,逐步还原出清晰的图像。
|
||
|
||
\textbf{训练目标:}
|
||
|
||
\begin{lstlisting}
|
||
去噪网络学习预测:添加的噪声 ε
|
||
即:给定 noisy image x_t 和时间步 t,预测 ε
|
||
损失函数:L = ||ε - ε_θ(x_t, t)||²
|
||
\end{lstlisting}
|
||
|
||
模型不需要学习''好图像长什么样'',而是学习''噪声长什么样''——这是一个更容易学习的目标。
|
||
|
||
\subsection{Stable Diffusion架构}
|
||
|
||
Stable Diffusion是扩散模型最重要的工程实现,其核心创新是\textbf{在潜在空间(Latent Space)中进行扩散},而非直接在像素空间操作,从而大幅提升了效率。
|
||
|
||
\textbf{整体架构:}
|
||
|
||
\begin{lstlisting}
|
||
文本提示 "一只猫,水彩画风格"
|
||
↓
|
||
Text Encoder (CLIP文本编码器) → 文本特征向量
|
||
↓
|
||
随机噪声(在潜在空间中)
|
||
↓
|
||
U-Net 去噪网络(条件引导:文本特征)
|
||
↓ 反复去噪T步
|
||
去噪后的潜在表示
|
||
↓
|
||
VAE Decoder (解码器)
|
||
↓
|
||
生成图像
|
||
\end{lstlisting}
|
||
|
||
\textbf{核心组件:}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}@{}}
|
||
\toprule\noalign{}
|
||
\begin{minipage}[b]{\linewidth}\raggedright
|
||
组件
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
作用
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
说明
|
||
\end{minipage} \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
VAE Encoder/Decoder & 图像与潜在空间的转换 & 将高维图像压缩到低维潜在空间,提升效率 \\
|
||
U-Net & 去噪网络 & 核心生成引擎,预测并移除噪声 \\
|
||
Text Encoder (CLIP) & 文本编码 & 将文本提示转化为模型可理解的特征向量 \\
|
||
CLIP & 文图对齐 & 确保生成的图像与文本描述语义一致 \\
|
||
\end{longtable}
|
||
}
|
||
|
||
\textbf{潜在空间扩散的优势:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
在低维空间操作,\textbf{计算量大幅降低}
|
||
\item
|
||
压缩过程自动去除冗余信息,保留语义关键特征
|
||
\item
|
||
使消费级显卡也能运行生成模型
|
||
\end{itemize}
|
||
|
||
\subsection{文生图工作流(Text-to-Image Workflow)}
|
||
|
||
从文字到图像的完整流程:
|
||
|
||
\begin{lstlisting}
|
||
1. 输入提示词(Prompt)
|
||
"一座现代风格的别墅,白色外墙,大面积落地窗,周围绿树环绕,日落光线"
|
||
|
||
2. 文本编码
|
||
Prompt → CLIP Text Encoder → 文本特征向量
|
||
|
||
3. 初始化噪声
|
||
在潜在空间中生成随机噪声
|
||
|
||
4. 去噪循环
|
||
for t = T → 1:
|
||
噪声图 → U-Net(条件:文本特征 + 时间步)→ 预测噪声 → 减去噪声
|
||
|
||
5. 解码输出
|
||
潜在表示 → VAE Decoder → 最终图像
|
||
\end{lstlisting}
|
||
|
||
\textbf{提示词工程(Prompt Engineering)} 是影响生成质量的关键因素。一个好的提示词通常包含:
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
\textbf{主体描述}:画面核心内容
|
||
\item
|
||
\textbf{风格指定}:如''水彩画''\,``赛博朋克''``极简主义''
|
||
\item
|
||
\textbf{质量修饰}:如''高清''\,``细节丰富''``4K''
|
||
\item
|
||
\textbf{光照氛围}:如''黄金时段光线''\,``柔和阴影''
|
||
\end{itemize}
|
||
|
||
\begin{quote}
|
||
\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是''设计任务书'',CLIP编码器理解需求,U-Net是''设计师的大脑'',而VAE解码器将脑海中的概念转化为可见的图纸。
|
||
\end{quote}
|
||
|
||
|
||
\section{AIGC工具链}
|
||
|
||
\subsection{ControlNet:精确条件控制}
|
||
|
||
纯文生图虽然强大,但设计师往往需要\textbf{精确控制}空间结构——这正是ControlNet解决的问题。
|
||
|
||
\textbf{核心原理:}
|
||
|
||
\begin{lstlisting}
|
||
输入图像 → 提取结构条件(边缘/深度/姿态/分割)
|
||
↓
|
||
条件特征注入ControlNet
|
||
↓
|
||
ControlNet与主U-Net协同
|
||
↓
|
||
输出:保持结构条件 + 应用风格
|
||
\end{lstlisting}
|
||
|
||
\textbf{支持的典型条件类型:}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}llll@{}}
|
||
\toprule\noalign{}
|
||
条件类型 & 英文名 & 说明 & 设计应用 \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
Canny边缘 & Canny Edge & 检测图像轮廓 & 草图控制、线稿渲染 \\
|
||
深度图 & Depth Map & 估计场景深度 & 空间关系控制 \\
|
||
人体姿态 & OpenPose & 检测人体关键点 & 人物场景生成 \\
|
||
法线图 & Normal Map & 表面法线方向 & 材质细节控制 \\
|
||
语义分割 & Segmentation & 区域语义标注 & 功能区域控制 \\
|
||
\end{longtable}
|
||
}
|
||
|
||
\textbf{设计工作流示例:}
|
||
|
||
\begin{lstlisting}
|
||
手绘草图 → Canny边缘提取 → ControlNet条件控制 → 精细效果图
|
||
户型平面图 → 深度图提取 → ControlNet条件控制 → 三维透视渲染
|
||
结构线稿 → 分割图提取 → ControlNet条件控制 → 风格化设计方案
|
||
\end{lstlisting}
|
||
|
||
\subsection{LoRA:高效微调}
|
||
|
||
全量微调一个大模型需要巨大的计算资源,而LoRA(Low-Rank Adaptation,低秩适应)提供了一种\textbf{高效微调}方案。
|
||
|
||
\textbf{核心原理:}
|
||
|
||
\begin{lstlisting}
|
||
原始权重矩阵 W(冻结不变,参数量 d×d)
|
||
+
|
||
低秩分解矩阵 ΔW = A × B(仅训练这部分)
|
||
A: d×r, B: r×d(r << d)
|
||
↓
|
||
新权重 = W + ΔW = W + A×B
|
||
↓
|
||
参数量从 d² 降低到 2×d×r(减少100-1000倍)
|
||
\end{lstlisting}
|
||
|
||
\textbf{LoRA的核心优势:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
参数量减少\textbf{100-1000倍},大幅降低训练成本
|
||
\item
|
||
训练速度快,个人电脑即可完成
|
||
\item
|
||
多个LoRA可灵活叠加组合
|
||
\end{itemize}
|
||
|
||
\textbf{应用方式:}
|
||
|
||
\begin{lstlisting}
|
||
基础模型 + LoRA_A(建筑风格)= 建筑风格生成
|
||
基础模型 + LoRA_B(室内风格)= 室内风格生成
|
||
基础模型 + LoRA_A + LoRA_B = 混合风格生成
|
||
\end{lstlisting}
|
||
|
||
设计师可以针对特定设计风格训练专属LoRA,如''新中式风格''\,``日式极简风格''等,实现个性化的AI生成。
|
||
|
||
\subsection{ComfyUI:模块化工作流}
|
||
|
||
ComfyUI是一个基于\textbf{节点化(Node-based)} 的AIGC工作流平台,允许用户通过可视化连接来构建复杂的生成流程。
|
||
|
||
\textbf{核心特点:}
|
||
|
||
\begin{lstlisting}
|
||
节点化连接 → 可视化流程 → 灵活定制 → 可复用分享
|
||
\end{lstlisting}
|
||
|
||
\textbf{典型节点:}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}ll@{}}
|
||
\toprule\noalign{}
|
||
节点类型 & 功能 \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
Load Checkpoint & 加载基础模型 \\
|
||
CLIP Text Encode & 文本编码(正向/负向提示词) \\
|
||
KSampler & 采样去噪(控制步数、采样器类型等) \\
|
||
VAE Decode & 潜在空间解码为图像 \\
|
||
ControlNet Apply & 应用ControlNet条件控制 \\
|
||
LoRA Loader & 加载LoRA微调模型 \\
|
||
Save Image & 保存生成图像 \\
|
||
\end{longtable}
|
||
}
|
||
|
||
\textbf{典型工作流示例:}
|
||
|
||
\begin{lstlisting}
|
||
文本提示词 → CLIP编码 → 正向提示
|
||
↓
|
||
负向提示词 → CLIP编码 → 负向提示 ──→ KSampler ← ControlNet条件
|
||
↓
|
||
VAE解码
|
||
↓
|
||
保存图像
|
||
\end{lstlisting}
|
||
|
||
\subsection{Midjourney:创意探索平台}
|
||
|
||
Midjourney是一个面向创意的AI图像生成平台,以极高的审美质量和艺术表现力著称。
|
||
|
||
\textbf{特点:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
操作简单,通过自然语言交互即可生成
|
||
\item
|
||
生成图像具有很高的艺术审美品质
|
||
\item
|
||
适合设计前期的\textbf{创意发散和灵感探索}
|
||
\item
|
||
付费云服务,依赖网络连接
|
||
\end{itemize}
|
||
|
||
\subsection{AIGC工具对比}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 8\tabcolsep) * \real{0.2000}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 8\tabcolsep) * \real{0.2000}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 8\tabcolsep) * \real{0.2000}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 8\tabcolsep) * \real{0.2000}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 8\tabcolsep) * \real{0.2000}}@{}}
|
||
\toprule\noalign{}
|
||
\begin{minipage}[b]{\linewidth}\raggedright
|
||
工具
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
核心优势
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
适用场景
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
使用门槛
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
部署方式
|
||
\end{minipage} \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
Midjourney & 审美品质高、操作简单 & 创意探索、灵感发散 & 低 & 云端服务 \\
|
||
Stable Diffusion & 开源可控、本地运行 & 精细控制、批量生成 & 中 & 本地部署 \\
|
||
ControlNet & 精确结构控制 & 草图渲染、条件生成 & 中高 & 模块插件 \\
|
||
ComfyUI & 灵活工作流、可视化 & 复杂流程、定制需求 & 高 & 本地部署 \\
|
||
\end{longtable}
|
||
}
|
||
|
||
\begin{quote}
|
||
\textbf{设计实践建议}:在设计流程的不同阶段,可以灵活选择不同工具。前期概念阶段用Midjourney快速探索创意方向,确定方向后用Stable Diffusion + ControlNet进行精确控制,用LoRA实现风格一致性,用ComfyUI构建自动化工作流。
|
||
\end{quote}
|
||
|
||
|
||
\section{设计应用}
|
||
|
||
\subsection{建筑设计:从草图到渲染}
|
||
|
||
\begin{lstlisting}
|
||
手绘概念草图
|
||
↓ ControlNet (Canny边缘)
|
||
+ 提示词:"现代风格建筑,玻璃幕墙,自然光线"
|
||
↓
|
||
AI生成效果图
|
||
↓ LoRA风格微调
|
||
多方案对比(3-5个方案)
|
||
↓
|
||
设计师选择与调整
|
||
\end{lstlisting}
|
||
|
||
\textbf{应用价值:}
|
||
|
||
\begin{itemize}
|
||
\tightlist
|
||
\item
|
||
快速将手绘概念转化为可视化效果图
|
||
\item
|
||
生成多个设计方案进行比选
|
||
\item
|
||
客户沟通效率大幅提升
|
||
\end{itemize}
|
||
|
||
\subsection{室内设计:从平面到立体}
|
||
|
||
\begin{lstlisting}
|
||
户型平面图
|
||
↓ ControlNet (Depth/Segmentation)
|
||
+ 提示词:"北欧风格客厅,浅色木地板,简约家具"
|
||
↓
|
||
三维空间效果图
|
||
↓ LoRA材质替换
|
||
不同材质方案(木质/石材/金属)
|
||
↓
|
||
风格迁移 → 多风格方案
|
||
\end{lstlisting}
|
||
|
||
\subsection{平面设计:品牌视觉生成}
|
||
|
||
\begin{lstlisting}
|
||
品牌关键词:"科技感、绿色环保、信任感"
|
||
↓
|
||
AI生成Logo候选方案(多组)
|
||
↓
|
||
设计师筛选与调整
|
||
↓
|
||
品牌视觉系统延展(名片、海报、包装)
|
||
\end{lstlisting}
|
||
|
||
\subsection{综合案例:住宅客厅设计工作流}
|
||
|
||
以下是一个完整的AI辅助住宅客厅设计工作流:
|
||
|
||
\begin{lstlisting}
|
||
第1步:需求输入
|
||
客户需求:"20㎡客厅,现代简约,预算3万元,朝南,适合家庭活动"
|
||
↓
|
||
第2步:AI生成多方案
|
||
方案A:开放式布局,浅色调,北欧简约
|
||
方案B:L型沙发布局,中性色调,日式风格
|
||
方案C:分区布局,暖色调,现代轻奢
|
||
↓
|
||
第3步:用户选择与调整
|
||
客户选择方案B → "希望增加书房功能"
|
||
↓
|
||
第4步:AI迭代优化
|
||
基于反馈调整 → 融合阅读角功能
|
||
↓
|
||
第5步:VR预览
|
||
AI生成全景图 → VR沉浸式体验
|
||
↓
|
||
第6步:最终确认
|
||
设计师微调 → 客户确认 → 施工图
|
||
\end{lstlisting}
|
||
|
||
\begin{quote}
|
||
\textbf{设计反思}:生成式AI极大地提升了设计效率,但它始终是\textbf{辅助工具}而非替代者。设计师的审美判断、空间理解、人文关怀——这些是AI无法取代的核心能力。AI的价值在于扩展设计师的创造力边界,而非取代设计师本身。
|
||
\end{quote}
|
||
|
||
|
||
\section{思考与练习}
|
||
|
||
\begin{enumerate}
|
||
\def\labelenumi{\arabic{enumi}.}
|
||
\item
|
||
\textbf{原理理解}:Diffusion模型为什么比GAN训练更稳定?从训练目标的角度进行分析。
|
||
\item
|
||
\textbf{技术对比}:对比AE、VAE、GAN和Diffusion四种生成模型,分析各自的优势和局限。在什么场景下你会选择哪种模型?
|
||
\item
|
||
\textbf{工具应用}:如果你需要将一张手绘建筑草图转化为写实渲染图,请设计一个完整的AIGC工作流(包括使用的工具、条件和提示词策略)。
|
||
\item
|
||
\textbf{设计实践}:选择一个室内空间,分别使用Midjourney和Stable Diffusion + ControlNet生成设计方案,对比两者的生成效果和可控性。
|
||
\item
|
||
\textbf{伦理思考}:AI生成的设计作品,版权归属于谁?训练数据中使用了大量设计师的作品,这是否构成侵权?你如何看待这个问题?
|
||
\end{enumerate}
|
||
|
||
|
||
\section{关键术语}
|
||
|
||
{\def\LTcaptype{none} % do not increment counter
|
||
\begin{longtable}[]{@{}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}
|
||
>{\raggedright\arraybackslash}p{(\linewidth - 4\tabcolsep) * \real{0.3333}}@{}}
|
||
\toprule\noalign{}
|
||
\begin{minipage}[b]{\linewidth}\raggedright
|
||
中文
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
英文
|
||
\end{minipage} & \begin{minipage}[b]{\linewidth}\raggedright
|
||
说明
|
||
\end{minipage} \\
|
||
\midrule\noalign{}
|
||
\endhead
|
||
\bottomrule\noalign{}
|
||
\endlastfoot
|
||
自编码器 & Autoencoder (AE) & 学习数据压缩与重构的模型 \\
|
||
变分自编码器 & Variational Autoencoder (VAE) & 引入概率分布的自编码器,可采样生成 \\
|
||
生成对抗网络 & Generative Adversarial Network (GAN) & 生成器与判别器对抗训练的生成模型 \\
|
||
扩散模型 & Diffusion Model & 通过加噪-去噪过程生成数据的模型 \\
|
||
去噪 & Denoising & 移除噪声、还原图像的过程 \\
|
||
潜在空间 & Latent Space & 压缩后的低维数据表示空间 \\
|
||
提示词 & Prompt & 指导AI生成的文本描述 \\
|
||
条件控制 & Conditional Control (ControlNet) & 通过结构条件精确引导生成过程 \\
|
||
低秩适应 & LoRA (Low-Rank Adaptation) & 低秩矩阵分解的高效微调方法 \\
|
||
模式崩溃 & Mode Collapse & GAN生成多样性不足的现象 \\
|
||
采样器 & Sampler & 去噪采样算法,决定生成过程的具体方式 \\
|
||
文图对齐 & CLIP & 实现文本与图像语义对应的技术 \\
|
||
提示词工程 & Prompt Engineering & 设计优化提示词以提升生成质量的技术 \\
|
||
\end{longtable}
|
||
}
|