fix(latex): 修复中文引号渲染,''...'' → "..."(139处)
pandoc 转换将中文双引号变为两个ASCII单引号,导致LaTeX中 左右引号均渲染为右引号。替换为Unicode中文引号以正确显示。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
@@ -113,7 +113,7 @@ AutoDL & 按时计费 & 中期项目 \\
|
||||
|
||||
所以整个链条是:\textbf{包管理器下载编译好的二进制 → 放到 PATH 目录 → shell 通过 PATH 找到它 → execve 加载到内存 →}
|
||||
|
||||
\textbf{二进制内部调用 OS API 完成实际工作}。没有任何''魔法'',本质上就是文件操作和进程管理的组合。
|
||||
\textbf{二进制内部调用 OS API 完成实际工作}。没有任何“魔法”,本质上就是文件操作和进程管理的组合。
|
||||
|
||||
\subsubsection{程序设计语言与软件开发}
|
||||
|
||||
@@ -175,7 +175,7 @@ Ruby:Web开发(Ruby on Rails)
|
||||
|
||||
特点:开发灵活、调试方便,但运行速度通常慢于编译型语言。
|
||||
|
||||
\textbf{混合模式}:Java 采用''编译为字节码 → 虚拟机解释执行''的混合方式,兼顾了跨平台和性能。
|
||||
\textbf{混合模式}:Java 采用“编译为字节码 → 虚拟机解释执行”的混合方式,兼顾了跨平台和性能。
|
||||
|
||||
\paragraph{常见编程语言概览}
|
||||
|
||||
@@ -289,7 +289,7 @@ pip install torch torchvision
|
||||
|
||||
\subparagraph{Python概述与特点}\label{pythonux6982ux8ff0ux4e0eux7279ux70b9}
|
||||
|
||||
Python由Guido van Rossum于1991年发布,以''优雅''\,``简洁''\,``可读性强''为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。
|
||||
Python由Guido van Rossum于1991年发布,以“优雅”\,``简洁“\,``可读性强”为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。
|
||||
|
||||
\textbf{核心特点}: - 语法简洁,接近自然语言,入门门槛低 - 丰富的第三方库生态(AI、数据处理、Web等) - 跨平台运行(Windows、macOS、Linux) - 活跃的开源社区支持
|
||||
|
||||
|
||||
@@ -10,7 +10,7 @@
|
||||
|
||||
Vibe Coding:\textbf{模糊想法 → AI辅助 → 迭代完善}
|
||||
|
||||
Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达''想要什么''。
|
||||
Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达“想要什么”。
|
||||
|
||||
\paragraph{工作流程}
|
||||
|
||||
@@ -138,7 +138,7 @@ Claude Code提供VSCode扩展,在编辑器中获得同样的AI辅助能力:
|
||||
在编辑器中选中代码后,可以直接向Claude提问或请求修改
|
||||
\end{enumerate}
|
||||
|
||||
\textbf{常用场景}: - 选中一段代码,请求''解释这段代码'' - 选中函数,请求''添加错误处理'' - 在Claude面板中输入''帮我写单元测试''
|
||||
\textbf{常用场景}: - 选中一段代码,请求“解释这段代码” - 选中函数,请求“添加错误处理” - 在Claude面板中输入“帮我写单元测试”
|
||||
|
||||
\paragraph{典型项目工作流}
|
||||
|
||||
@@ -361,7 +361,7 @@ c & d
|
||||
|
||||
\textbf{核心特性}: - \textbf{本地存储}:所有笔记以Markdown文件保存在本地,数据完全自主 - \textbf{双向链接}:用 {[}{[}笔记名{]}{]} 在笔记之间建立链接,形成知识网络 - \textbf{图谱视图}:可视化笔记之间的关联关系 - \textbf{插件生态}:丰富的社区插件扩展功能(如日历、看板、模板等) - \textbf{实时预览}:编辑Markdown时实时渲染效果
|
||||
|
||||
\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装''目录''插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来
|
||||
\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装“目录”插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来
|
||||
|
||||
\subsubsection{Git版本管理与GitHub协作}\label{gitux7248ux672cux7ba1ux7406ux4e0egithubux534fux4f5c}
|
||||
|
||||
|
||||
@@ -35,7 +35,7 @@
|
||||
|
||||
AI技术仍在飞速发展,本书的内容不可避免地会随着时间推移而需要更新。但书中所传达的核心思想——理解原理、拥抱工具、人机协作——将具有持久的价值。
|
||||
|
||||
感谢AI技术本身——本书的写作过程中广泛使用了Claude、ChatGPT等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。
|
||||
感谢AI技术本身——本书的写作过程中广泛使用了Claude Code等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。
|
||||
|
||||
设计的人工智能时代才刚刚开始。希望这本书能成为读者进入这个新时代的一块踏脚石,从而汇聚起万千努力,能够成为点燃"通用设计智能"的星星之火。
|
||||
|
||||
|
||||
@@ -47,7 +47,7 @@
|
||||
|
||||
\subsection{案例背景}
|
||||
|
||||
Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现''拿了就走''的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。
|
||||
Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现“拿了就走”的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。
|
||||
|
||||
\subsection{技术要素}
|
||||
|
||||
@@ -70,7 +70,7 @@ Amazon Go 的 AI 技术栈融合了多项前沿技术:
|
||||
|
||||
\subsection{启示}
|
||||
|
||||
Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''拿了就走'',AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。
|
||||
Amazon Go 展示了 AI 技术如何重构传统场景。从“扫码支付”到“拿了就走”,AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。
|
||||
|
||||
\section{AI 发展时间线(2016--2024)}
|
||||
|
||||
@@ -128,7 +128,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''
|
||||
音频生成:音乐、配音、音效
|
||||
\end{itemize}
|
||||
|
||||
\textbf{设计影响}:从''工具辅助''到''生成伙伴''
|
||||
\textbf{设计影响}:从“工具辅助”到“生成伙伴”
|
||||
|
||||
\subsection{Agent(智能体)}
|
||||
|
||||
@@ -148,7 +148,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''
|
||||
\textbf{工具(Tool Use)}:调用外部资源
|
||||
\end{itemize}
|
||||
|
||||
\textbf{设计影响}:从''被动执行''到''主动协作''
|
||||
\textbf{设计影响}:从“被动执行”到“主动协作”
|
||||
|
||||
\subsection{AI4S(AI for Science)}\label{ai4sai-for-science}
|
||||
|
||||
@@ -497,9 +497,9 @@ y = a₁x₁ + a₂x₂ + b & 多输入神经元 \\
|
||||
\def\labelenumi{\arabic{enumi}.}
|
||||
\tightlist
|
||||
\item
|
||||
万能逼近定理告诉我们神经网络''能''做任何事,但没有说''如何''高效学习。这个区别意味着什么?
|
||||
万能逼近定理告诉我们神经网络“能”做任何事,但没有说“如何”高效学习。这个区别意味着什么?
|
||||
\item
|
||||
Scaling Law 是否意味着''越大越好''?在资源有限的情况下,应该如何权衡?
|
||||
Scaling Law 是否意味着“越大越好”?在资源有限的情况下,应该如何权衡?
|
||||
\item
|
||||
从函数式视角理解 AI,对你理解设计问题有何启发?
|
||||
\end{enumerate}
|
||||
|
||||
+15
-15
@@ -1,6 +1,6 @@
|
||||
\chapter{设计人工智能的理论框架}
|
||||
|
||||
本章建立全书的核心理论框架。我们从''函数描述世界''的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。
|
||||
本章建立全书的核心理论框架。我们从“函数描述世界”的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。
|
||||
|
||||
\section{篇章导读}
|
||||
|
||||
@@ -8,7 +8,7 @@
|
||||
|
||||
无论是处理文本、图像还是三维空间数据,AI的本质工作都是一样的——从数据中学习映射函数 \(y = f(x; \theta)\)。区别仅在于输入数据的形态不同,因此需要不同的网络结构来高效处理。
|
||||
|
||||
本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立''环境-智能体-任务''实践框架,降低上手门槛
|
||||
本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立“环境-智能体-任务”实践框架,降低上手门槛
|
||||
|
||||
|
||||
\section{函数式AI视角}
|
||||
@@ -18,7 +18,7 @@
|
||||
\begin{itemize}
|
||||
\tightlist
|
||||
\item
|
||||
理解''Functions Describe the World''的核心理念
|
||||
理解“Functions Describe the World”的核心理念
|
||||
\item
|
||||
掌握从Excel线性回归到神经网络的演进逻辑
|
||||
\item
|
||||
@@ -126,7 +126,7 @@ plt.grid(True, alpha=0.3)
|
||||
plt.show()
|
||||
\end{lstlisting}
|
||||
|
||||
这段代码展示了一个完整的''从数据中学习函数''的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}。
|
||||
这段代码展示了一个完整的“从数据中学习函数”的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}。
|
||||
|
||||
\subsection{数据驱动 vs 规则驱动}
|
||||
|
||||
@@ -159,7 +159,7 @@ result = model.predict(new_image) # 自动判断
|
||||
优势: - 自动发现人类难以表达的规律 - 数据越多,性能越好 - 可以处理复杂的、非线性的关系 - 适应性强,可迁移到新任务
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计思维的转变}:从''设计规则''到''设计数据''。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。
|
||||
\textbf{设计思维的转变}:从“设计规则”到“设计数据”。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -319,7 +319,7 @@ AI同样需要针对不同模态的数据采用不同的处理方式。一种数
|
||||
|
||||
\textbf{第四阶段:大模型时代(Foundation Models)}
|
||||
|
||||
参数规模达到十亿甚至万亿级别的模型,展现出''涌现能力''(Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。
|
||||
参数规模达到十亿甚至万亿级别的模型,展现出“涌现能力”(Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。
|
||||
|
||||
特点: - 单一模型处理多种任务(通用性) - 涌现能力:规模带来质变 - 少样本甚至零样本学习 - Scaling Law:性能随规模持续提升
|
||||
|
||||
@@ -412,7 +412,7 @@ FPFH → PointNet → Point-BERT → Point-E
|
||||
\item
|
||||
\textbf{预训练时代是设计师的最佳入口}。利用预训练模型,设计师不需要海量数据和强大算力,就能将AI应用到设计实践中。
|
||||
\item
|
||||
\textbf{大模型时代带来''民主化''}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。
|
||||
\textbf{大模型时代带来“民主化”}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。
|
||||
\end{enumerate}
|
||||
|
||||
|
||||
@@ -589,7 +589,7 @@ print(f"最终输出: {y.flatten()}")
|
||||
|
||||
\subsection{激活函数}
|
||||
|
||||
激活函数(Activation Function)是神经网络的''灵魂''。没有激活函数,无论网络有多少层,都等价于一个单层线性变换:
|
||||
激活函数(Activation Function)是神经网络的“灵魂”。没有激活函数,无论网络有多少层,都等价于一个单层线性变换:
|
||||
|
||||
\[y = W_2(W_1x) = (W_2W_1)x = W'x\]
|
||||
|
||||
@@ -624,7 +624,7 @@ Sigmoid & \(\sigma(z) = \frac{1}{1+e^{-z}}\) & (0, 1) & 输出可解释为概率
|
||||
ReLU & \(\text{ReLU}(z) = \max(0, z)\) & {[}0, +∞) & 计算简单高效;缓解梯度消失 & \textbf{隐藏层首选} \\
|
||||
Tanh & \(\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}\) & (-1, 1) & 零中心化;两端梯度消失 & 循环网络隐藏层 \\
|
||||
Softmax & \(\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_j e^{z_j}}\) & (0, 1),和为1 & 输出为概率分布 & 多分类输出层 \\
|
||||
LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU''死神经元''问题 & 深层网络隐藏层 \\
|
||||
LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU“死神经元”问题 & 深层网络隐藏层 \\
|
||||
\end{longtable}
|
||||
}
|
||||
|
||||
@@ -646,12 +646,12 @@ ReLU: Sigmoid: Tanh:
|
||||
\end{lstlisting}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计类比}:激活函数就像是设计中的''非线性思维''。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了''跳跃''和''拐弯''的能力,让网络能够表达复杂的设计关系。
|
||||
\textbf{设计类比}:激活函数就像是设计中的“非线性思维”。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了“跳跃”和“拐弯”的能力,让网络能够表达复杂的设计关系。
|
||||
\end{quote}
|
||||
|
||||
\subsection{损失函数}
|
||||
|
||||
损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的''指南针''。
|
||||
损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的“指南针”。
|
||||
|
||||
\textbf{常用损失函数}
|
||||
|
||||
@@ -695,7 +695,7 @@ ReLU: Sigmoid: Tanh:
|
||||
|
||||
\subsection{反向传播与梯度下降}
|
||||
|
||||
反向传播(Backpropagation)是训练神经网络的核心算法,它解决了''如何高效计算每个参数对损失的影响程度''这一问题。
|
||||
反向传播(Backpropagation)是训练神经网络的核心算法,它解决了“如何高效计算每个参数对损失的影响程度”这一问题。
|
||||
|
||||
\textbf{核心思想:梯度下降}
|
||||
|
||||
@@ -832,7 +832,7 @@ print(f"真实参数: W = [2.0, 3.0], b = [1.0]")
|
||||
\begin{itemize}
|
||||
\tightlist
|
||||
\item
|
||||
理解''环境-智能体-任务''三元框架
|
||||
理解“环境-智能体-任务”三元框架
|
||||
\item
|
||||
认识环境配置是AI实践中的关键瓶颈
|
||||
\item
|
||||
@@ -927,7 +927,7 @@ GPU/CUDA配置 & 驱动版本与CUDA版本不匹配 & ★★★★★ \\
|
||||
}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{核心观点}:环境问题不是''技术能力不足''的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。
|
||||
\textbf{核心观点}:环境问题不是“技术能力不足”的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。
|
||||
\end{quote}
|
||||
|
||||
\subsection{降低门槛的实践策略}
|
||||
@@ -1049,7 +1049,7 @@ d2l.ai(动手学深度学习) & 代码驱动,PyTorch/MXNet/TensorFlow多
|
||||
\endhead
|
||||
\bottomrule\noalign{}
|
||||
\endlastfoot
|
||||
Hugging Face & 模型和数据集的''GitHub'',可在线体验 \\
|
||||
Hugging Face & 模型和数据集的“GitHub”,可在线体验 \\
|
||||
Civitai & Stable Diffusion模型分享社区 \\
|
||||
Papers With Code & 论文+代码+排行榜,追踪最新技术 \\
|
||||
\end{longtable}
|
||||
|
||||
@@ -4,7 +4,7 @@
|
||||
|
||||
一维数据(1D Data)是人工智能处理的最基础、也是最重要的数据形态。你正在阅读的文字、你说出的一句话、股票市场的价格走势、建筑室内温度随时间的变化——这些都是一维序列数据。
|
||||
|
||||
与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了''和''饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。
|
||||
与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了“和”饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。
|
||||
|
||||
本章将带你踏上一段激动人心的技术演进之旅:从早期的小型循环神经网络(RNN),到注意力机制的革命性突破,再到 Transformer 架构的横空出世,最终见证大语言模型(LLM)如何改变整个 AI 格局。这条从小模型到大模型的技术脉络,不仅是深度学习最精彩的故事之一,也直接关系到今天每一位设计师如何使用 AI 工具。
|
||||
|
||||
@@ -75,14 +75,14 @@
|
||||
"光线 充足" → 设计优点
|
||||
\end{lstlisting}
|
||||
|
||||
模型需要''记住''之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。
|
||||
模型需要“记住”之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。
|
||||
|
||||
|
||||
\section{RNN:循环神经网络}
|
||||
|
||||
\subsection{核心思想}
|
||||
|
||||
RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State)在时间步之间传递信息,实现''记忆''功能。
|
||||
RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State)在时间步之间传递信息,实现“记忆”功能。
|
||||
|
||||
\begin{lstlisting}
|
||||
时间展开视图:
|
||||
@@ -128,7 +128,7 @@ RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State)
|
||||
时间步7:看到"空间感" → h₇ = "完整理解:客厅用开放式布局来增加空间感"
|
||||
\end{lstlisting}
|
||||
|
||||
每一步,RNN 都在累积和更新对文本的理解。这就是''记忆''的力量。
|
||||
每一步,RNN 都在累积和更新对文本的理解。这就是“记忆”的力量。
|
||||
|
||||
\subsection{PyTorch 代码示例}
|
||||
|
||||
@@ -189,14 +189,14 @@ RNN 需要通过反向传播跨越多个时间步来更新参数。当序列较
|
||||
RNN 处理长序列时遇到同样的问题!
|
||||
\end{lstlisting}
|
||||
|
||||
在实际应用中,标准 RNN 通常只能''记住''5-10步之前的信息。对于''这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高''这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。
|
||||
在实际应用中,标准 RNN 通常只能“记住”5-10步之前的信息。对于“这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高”这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。
|
||||
|
||||
|
||||
\section{LSTM:长短期记忆网络}
|
||||
|
||||
\subsection{设计哲学}
|
||||
|
||||
LSTM(Long Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的''信息高速公路'',让信息可以长距离传递而不被稀释。
|
||||
LSTM(Long Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的“信息高速公路”,让信息可以长距离传递而不被稀释。
|
||||
|
||||
\begin{lstlisting}
|
||||
LSTM 单元内部结构:
|
||||
@@ -220,7 +220,7 @@ LSTM 单元内部结构:
|
||||
|
||||
\subsection{三道门:遗忘、输入、输出}
|
||||
|
||||
LSTM 通过三个''门''(Gate)来精确控制信息的流动:
|
||||
LSTM 通过三个“门”(Gate)来精确控制信息的流动:
|
||||
|
||||
\textbf{1. 遗忘门(Forget Gate)}:决定从细胞状态中丢弃什么信息
|
||||
|
||||
@@ -428,7 +428,7 @@ RNN 的局限 & 具体影响 \\
|
||||
|
||||
\subsection{核心思想}
|
||||
|
||||
自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置''交流'',一步到位地获取全局信息。
|
||||
自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置“交流”,一步到位地获取全局信息。
|
||||
|
||||
\begin{lstlisting}
|
||||
传统 RNN(串行传递信息):
|
||||
@@ -553,7 +553,7 @@ print(f"输出形状: {output.shape}") # (1, 4, 64)
|
||||
|
||||
\subsection{为什么需要多头?}
|
||||
|
||||
单个注意力头只能学习一种''关注模式''。现实中的语言理解需要同时关注多种关系:
|
||||
单个注意力头只能学习一种“关注模式”。现实中的语言理解需要同时关注多种关系:
|
||||
|
||||
\begin{lstlisting}
|
||||
句子:"设计师用木质材料打造了温馨的北欧风格客厅"
|
||||
@@ -619,7 +619,7 @@ class MultiHeadAttention(nn.Module):
|
||||
|
||||
\subsection{为什么需要位置信息?}
|
||||
|
||||
Self-Attention 本身是''位置无关''的——它把输入看作一个集合(Set),而不是序列(Sequence):
|
||||
Self-Attention 本身是“位置无关”的——它把输入看作一个集合(Set),而不是序列(Sequence):
|
||||
|
||||
\begin{lstlisting}
|
||||
输入 A:"客厅 在 北面"
|
||||
@@ -833,9 +833,9 @@ class FeedForward(nn.Module):
|
||||
输出 → 传递给下一层或最终线性层
|
||||
\end{lstlisting}
|
||||
|
||||
\subsection{Masked Self-Attention:为什么要''掩码''?}
|
||||
\subsection{Masked Self-Attention:为什么要“掩码”?}
|
||||
|
||||
在生成文本时,模型不能''偷看''未来的词:
|
||||
在生成文本时,模型不能“偷看”未来的词:
|
||||
|
||||
\begin{lstlisting}
|
||||
生成 "现代 简约 风格 客厅":
|
||||
@@ -1191,7 +1191,7 @@ Transformer 论文发表后的几年里,研究者们发现了一个关键规
|
||||
|
||||
\section{RAG:检索增强生成}
|
||||
|
||||
\subsection{问题:大模型的''幻觉''}
|
||||
\subsection{问题:大模型的“幻觉”}
|
||||
|
||||
LLM 会自信地编造不存在的事实:
|
||||
|
||||
@@ -1338,7 +1338,7 @@ answer = llm.generate(augmented_prompt)
|
||||
|
||||
\subsection{核心原则}
|
||||
|
||||
Prompt Engineering 是与大语言模型有效沟通的''艺术与科学'':
|
||||
Prompt Engineering 是与大语言模型有效沟通的“艺术与科学”:
|
||||
|
||||
\begin{lstlisting}
|
||||
原则一:明确任务
|
||||
|
||||
+16
-16
@@ -6,7 +6,7 @@
|
||||
|
||||
人类感知世界,约80\%的信息来自视觉。对于设计师而言,图像不仅是设计成果的呈现形式,更是灵感来源、分析对象和沟通媒介。
|
||||
|
||||
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从''识别图片中的猫''一步步发展到''理解任意场景中的任意内容'',以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
|
||||
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从“识别图片中的猫”一步步发展到“理解任意场景中的任意内容”,以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
|
||||
|
||||
通过本章学习,你将:
|
||||
|
||||
@@ -75,7 +75,7 @@ CNN通过三个关键设计解决了MLP的上述缺陷:
|
||||
\end{longtable}
|
||||
}
|
||||
|
||||
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种''从局部到整体''的视觉处理方式。
|
||||
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种“从局部到整体”的视觉处理方式。
|
||||
|
||||
\subsection{卷积操作}
|
||||
|
||||
@@ -242,7 +242,7 @@ LeNet (1998) AlexNet (2012) VGG (2014) ResNet (2015)
|
||||
\endlastfoot
|
||||
LeNet-5 & 1998 & 5层 & 首个成功的CNN & 手写数字识别,邮局实用 \\
|
||||
AlexNet & 2012 & 8层 & ReLU、Dropout、GPU训练 & ImageNet竞赛冠军,深度学习复兴 \\
|
||||
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明''更深=更好''的简洁设计 \\
|
||||
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明“更深=更好”的简洁设计 \\
|
||||
ResNet & 2015 & 152层+ & 残差连接(Skip Connection) & 突破深度瓶颈,可训练极深网络 \\
|
||||
\end{longtable}
|
||||
}
|
||||
@@ -293,7 +293,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}:
|
||||
\end{itemize}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计思维链接}:残差连接的思想类似于设计中的''增量修改''——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种''在已有基础上做调整''的策略,在参数空间中比''从零开始学习''高效得多。
|
||||
\textbf{设计思维链接}:残差连接的思想类似于设计中的“增量修改”——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种“在已有基础上做调整”的策略,在参数空间中比“从零开始学习”高效得多。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -301,7 +301,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}:
|
||||
|
||||
\subsection{从分类到检测}
|
||||
|
||||
图像分类回答的问题是''这是什么'',而目标检测需要同时回答两个问题:
|
||||
图像分类回答的问题是“这是什么”,而目标检测需要同时回答两个问题:
|
||||
|
||||
\begin{lstlisting}
|
||||
分类: "这是一张建筑的照片" → what
|
||||
@@ -332,7 +332,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}:
|
||||
|
||||
\subsection{两阶段检测器}
|
||||
|
||||
两阶段方法的思路是''先找候选区域,再分类判别'',精度高但速度较慢。
|
||||
两阶段方法的思路是“先找候选区域,再分类判别”,精度高但速度较慢。
|
||||
|
||||
\textbf{演进路线}:
|
||||
|
||||
@@ -586,7 +586,7 @@ DeepLab由Google团队提出,其核心创新是\textbf{空洞卷积(Atrous C
|
||||
|
||||
2020年,Google团队提出了 \textbf{ViT(Vision Transformer)},首次证明纯Transformer架构可以在图像任务上达到甚至超越CNN的性能,开启了视觉领域的Transformer时代。
|
||||
|
||||
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个''词''(Token),然后送入标准Transformer编码器处理。
|
||||
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个“词”(Token),然后送入标准Transformer编码器处理。
|
||||
|
||||
\begin{lstlisting}
|
||||
输入图像 (224×224×3) 切分为图块 线性嵌入
|
||||
@@ -744,7 +744,7 @@ Swin Transformer的设计使其兼具CNN的层级特征提取优势和Transforme
|
||||
└─────────┘ └──────────┘
|
||||
\end{lstlisting}
|
||||
|
||||
CLIP的训练目标:对于N个''图像-文本''配对,最大化正确配对的相似度,最小化错误配对的相似度。
|
||||
CLIP的训练目标:对于N个“图像-文本”配对,最大化正确配对的相似度,最小化错误配对的相似度。
|
||||
|
||||
\textbf{零样本分类}:
|
||||
|
||||
@@ -764,7 +764,7 @@ CLIP的意义在于:\textbf{用自然语言定义视觉概念},打破了传
|
||||
|
||||
\subsection{SAM:分割一切}
|
||||
|
||||
\textbf{SAM(Segment Anything Model, Meta, 2023)}是一个''可提示''的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
|
||||
\textbf{SAM(Segment Anything Model, Meta, 2023)}是一个“可提示”的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
|
||||
|
||||
\begin{lstlisting}
|
||||
SAM 的三种提示方式
|
||||
@@ -796,7 +796,7 @@ SAM 的三种提示方式
|
||||
\textbf{海量数据集}:SA-1B数据集包含10亿级自动标注的分割掩码
|
||||
\end{itemize}
|
||||
|
||||
SAM的设计理念是成为视觉领域的''基础模型''——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
|
||||
SAM的设计理念是成为视觉领域的“基础模型”——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
|
||||
|
||||
\subsection{DINOv2:自监督视觉特征}
|
||||
|
||||
@@ -834,7 +834,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
|
||||
|
||||
\subsection{视觉-语言模型}
|
||||
|
||||
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅''看图说话'',而是真正理解图像内容并可以回答关于图像的复杂问题。
|
||||
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅“看图说话”,而是真正理解图像内容并可以回答关于图像的复杂问题。
|
||||
|
||||
\textbf{典型任务与模型}:
|
||||
|
||||
@@ -949,7 +949,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
|
||||
\item
|
||||
\textbf{智能标签}:自动为设计素材添加语义标签,无需人工标注
|
||||
\item
|
||||
\textbf{自然语言检索}:用文字描述查找设计参考图(如''带玻璃幕墙的现代商业建筑'')
|
||||
\textbf{自然语言检索}:用文字描述查找设计参考图(如“带玻璃幕墙的现代商业建筑”)
|
||||
\item
|
||||
\textbf{风格分类}:自动识别设计作品的风格特征
|
||||
\item
|
||||
@@ -971,7 +971,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
|
||||
后现代/...) 未知风格) 的设计案例)
|
||||
\end{lstlisting}
|
||||
|
||||
结合CLIP的零样本能力,设计师可以自定义风格类别(如''新中式''\,``极简主义''``有机建筑''等),无需收集训练数据即可进行风格分类。
|
||||
结合CLIP的零样本能力,设计师可以自定义风格类别(如“新中式”\,``极简主义“``有机建筑”等),无需收集训练数据即可进行风格分类。
|
||||
|
||||
|
||||
\section{本章小结}
|
||||
@@ -1004,9 +1004,9 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
|
||||
\item
|
||||
\textbf{架构对比}:CNN通过局部卷积提取特征,ViT通过全局自注意力建立关系。在设计场景中(如建筑立面分析、街景品质评估),你认为哪种架构更适合?为什么?
|
||||
\item
|
||||
\textbf{零样本能力}:CLIP实现了''用自然语言做图像分类''的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的''宜居性'',你会如何设计提示文本?考虑需要哪些视觉线索。
|
||||
\textbf{零样本能力}:CLIP实现了“用自然语言做图像分类”的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的“宜居性”,你会如何设计提示文本?考虑需要哪些视觉线索。
|
||||
\item
|
||||
\textbf{大模型与传统方法}:SAM号称可以''分割一切''。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
|
||||
\textbf{大模型与传统方法}:SAM号称可以“分割一切”。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
|
||||
\end{enumerate}
|
||||
|
||||
|
||||
@@ -1032,7 +1032,7 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
|
||||
卷积神经网络 & Convolutional Neural Network (CNN) & 利用卷积操作提取局部特征的神经网络 \\
|
||||
卷积核/滤波器 & Kernel / Filter & 卷积操作中用于特征提取的小矩阵 \\
|
||||
池化 & Pooling & 降低特征图空间尺寸的下采样操作 \\
|
||||
感受野 & Receptive Field & 神经元能''看到''的输入区域大小 \\
|
||||
感受野 & Receptive Field & 神经元能“看到”的输入区域大小 \\
|
||||
残差连接 & Residual/Skip Connection & 将输入直接加到输出上,解决深层网络退化问题 \\
|
||||
目标检测 & Object Detection & 同时识别图像中目标的类别和位置 \\
|
||||
边界框 & Bounding Box & 用矩形框标出目标位置的表示方法 \\
|
||||
|
||||
@@ -2,9 +2,9 @@
|
||||
|
||||
\section{篇章导读}
|
||||
|
||||
三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入''现代化办公椅''的文本描述,AI便能生成一个可编辑的3D模型。
|
||||
三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入“现代化办公椅”的文本描述,AI便能生成一个可编辑的3D模型。
|
||||
|
||||
这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何''看见''和''重建''空间,并探索空间智能在设计领域的广阔应用。
|
||||
这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何“看见”和“重建”空间,并探索空间智能在设计领域的广阔应用。
|
||||
|
||||
|
||||
\section{三维数据表示}
|
||||
@@ -131,7 +131,7 @@
|
||||
\item
|
||||
内存消耗与分辨率的立方成正比
|
||||
\item
|
||||
分辨率有限时存在''方块效应''
|
||||
分辨率有限时存在“方块效应”
|
||||
\item
|
||||
适合3D卷积神经网络处理
|
||||
\end{itemize}
|
||||
@@ -703,7 +703,7 @@ MVS稠密匹配
|
||||
|
||||
\subsubsection{核心思想}
|
||||
|
||||
不再显式存储3D模型(点云/网格),而是用一个神经网络来''记住''整个三维场景:
|
||||
不再显式存储3D模型(点云/网格),而是用一个神经网络来“记住”整个三维场景:
|
||||
|
||||
\begin{lstlisting}
|
||||
传统: 场景 → 存储为点云/网格/体素
|
||||
@@ -859,7 +859,7 @@ NeRF的隐式表示虽然质量高,但速度慢、难以编辑。3D Gaussian S
|
||||
|
||||
\subsection{3D生成模型}
|
||||
|
||||
从2023年开始,AI不仅能''重建''已有场景,还能从零''生成''新的3D内容。
|
||||
从2023年开始,AI不仅能“重建”已有场景,还能从零“生成”新的3D内容。
|
||||
|
||||
\subsubsection{Text-to-3D (文本生成3D)}
|
||||
|
||||
@@ -1070,7 +1070,7 @@ print(f"颜色形状: {color.shape}, 密度形状: {density.shape}")
|
||||
|
||||
\subsection{从3D感知到空间推理}
|
||||
|
||||
前两节我们学习了AI如何''感知''和''重建''三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。
|
||||
前两节我们学习了AI如何“感知”和“重建”三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。
|
||||
|
||||
\begin{lstlisting}
|
||||
3D能力层次:
|
||||
@@ -1308,7 +1308,7 @@ AI增强GIS:
|
||||
\item
|
||||
数字孪生的四个层次在设计实践中分别对应哪些具体工具和方法?
|
||||
\item
|
||||
设想一个''认知孪生''校园,它能做哪些事情?需要哪些技术支撑?
|
||||
设想一个“认知孪生”校园,它能做哪些事情?需要哪些技术支撑?
|
||||
\end{enumerate}
|
||||
|
||||
\subsection{关键术语}
|
||||
@@ -1682,7 +1682,7 @@ print("城市模型已保存为 city_model.obj")
|
||||
\item
|
||||
\textbf{技术路线对比}:NeRF和3D Gaussian Splatting分别代表了隐式和显式的场景表示路线。请从设计应用的角度分析:哪些设计场景更适合NeRF,哪些更适合3DGS?未来两者会融合还是分化?
|
||||
\item
|
||||
\textbf{空间智能畅想}:设想你正在设计一个''AI空间设计师助手'',它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。
|
||||
\textbf{空间智能畅想}:设想你正在设计一个“AI空间设计师助手”,它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。
|
||||
\end{enumerate}
|
||||
|
||||
\section{关键术语}
|
||||
|
||||
@@ -2,7 +2,7 @@
|
||||
|
||||
\section{篇章导读}
|
||||
|
||||
生成式AI(Generative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的''创意伙伴''(Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从''分析''到''创造''的转变,正是生成式AI最激动人心的地方。
|
||||
生成式AI(Generative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的“创意伙伴”(Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从“分析”到“创造”的转变,正是生成式AI最激动人心的地方。
|
||||
|
||||
本章将从生成模型的基本原理出发,系统介绍从自编码器(AE)、对抗生成网络(GAN)到扩散模型(Diffusion Model)的技术演进,并深入探讨AIGC工具链在设计领域的实际应用。
|
||||
|
||||
@@ -19,7 +19,7 @@
|
||||
输入 → 编码器 (Encoder) → 潜在表示 (Latent) → 解码器 (Decoder) → 重构输出
|
||||
\end{lstlisting}
|
||||
|
||||
自编码器的工作方式可以理解为''先压缩,再还原'':编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
|
||||
自编码器的工作方式可以理解为“先压缩,再还原”:编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
|
||||
|
||||
\textbf{局限性:}
|
||||
|
||||
@@ -76,7 +76,7 @@ VAE的关键在于将潜在空间约束为\textbf{标准正态分布}。这意
|
||||
}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计类比}:VAE就像一位理解了''风格空间''的画师——他不仅会临摹,还能在''风格空间''中探索,画出从未见过但风格一致的新作品。
|
||||
\textbf{设计类比}:VAE就像一位理解了“风格空间”的画师——他不仅会临摹,还能在“风格空间”中探索,画出从未见过但风格一致的新作品。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -104,7 +104,7 @@ GAN的训练过程可以类比为\textbf{伪造者与鉴定师}的博弈:
|
||||
\item
|
||||
\textbf{鉴定师}(判别器)不断提升辨别能力,区分真画和假画
|
||||
\item
|
||||
随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的''杰作''
|
||||
随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的“杰作”
|
||||
\end{itemize}
|
||||
|
||||
\textbf{训练过程:}
|
||||
@@ -174,7 +174,7 @@ CycleGAN解决了一个重要的实际问题:\textbf{无需成对训练数据}
|
||||
CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景转夜晚、夏季景观转冬季等。
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计思考}:GAN系列模型展示了''对抗''这一全新的训练范式——不是告诉模型''正确答案是什么'',而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
|
||||
\textbf{设计思考}:GAN系列模型展示了“对抗”这一全新的训练范式——不是告诉模型“正确答案是什么”,而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -220,7 +220,7 @@ x₀ ≈ 原始图像
|
||||
损失函数:L = ||ε - ε_θ(x_t, t)||²
|
||||
\end{lstlisting}
|
||||
|
||||
模型不需要学习''好图像长什么样'',而是学习''噪声长什么样''——这是一个更容易学习的目标。
|
||||
模型不需要学习“好图像长什么样”,而是学习“噪声长什么样”——这是一个更容易学习的目标。
|
||||
|
||||
\subsection{Stable Diffusion架构}
|
||||
|
||||
@@ -311,15 +311,15 @@ CLIP & 文图对齐 & 确保生成的图像与文本描述语义一致 \\
|
||||
\item
|
||||
\textbf{主体描述}:画面核心内容
|
||||
\item
|
||||
\textbf{风格指定}:如''水彩画''\,``赛博朋克''``极简主义''
|
||||
\textbf{风格指定}:如“水彩画”\,``赛博朋克“``极简主义”
|
||||
\item
|
||||
\textbf{质量修饰}:如''高清''\,``细节丰富''``4K''
|
||||
\textbf{质量修饰}:如“高清”\,``细节丰富“``4K”
|
||||
\item
|
||||
\textbf{光照氛围}:如''黄金时段光线''\,``柔和阴影''
|
||||
\textbf{光照氛围}:如“黄金时段光线”\,``柔和阴影''
|
||||
\end{itemize}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是''设计任务书'',CLIP编码器理解需求,U-Net是''设计师的大脑'',而VAE解码器将脑海中的概念转化为可见的图纸。
|
||||
\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是“设计任务书”,CLIP编码器理解需求,U-Net是“设计师的大脑”,而VAE解码器将脑海中的概念转化为可见的图纸。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -404,7 +404,7 @@ Canny边缘 & Canny Edge & 检测图像轮廓 & 草图控制、线稿渲染 \\
|
||||
基础模型 + LoRA_A + LoRA_B = 混合风格生成
|
||||
\end{lstlisting}
|
||||
|
||||
设计师可以针对特定设计风格训练专属LoRA,如''新中式风格''\,``日式极简风格''等,实现个性化的AI生成。
|
||||
设计师可以针对特定设计风格训练专属LoRA,如“新中式风格”\,``日式极简风格''等,实现个性化的AI生成。
|
||||
|
||||
\subsection{ComfyUI:模块化工作流}
|
||||
|
||||
|
||||
+10
-10
@@ -2,9 +2,9 @@
|
||||
|
||||
\section{篇章导读}
|
||||
|
||||
AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响应''到''主动行动'',从''单一能力''到''系统协同''。如果说前几章介绍的AI模型是''工具'',那么AI Agent就是能\textbf{自主使用工具的助手}。
|
||||
AI Agent(智能体)代表了人工智能的下一个前沿:从“被动响应”到“主动行动”,从“单一能力”到“系统协同”。如果说前几章介绍的AI模型是“工具”,那么AI Agent就是能\textbf{自主使用工具的助手}。
|
||||
|
||||
想象这样一幅场景:你告诉AI''帮我分析这块场地的开发潜力'',它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。
|
||||
想象这样一幅场景:你告诉AI“帮我分析这块场地的开发潜力”,它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。
|
||||
|
||||
本章将从规则系统出发,系统介绍LLM-based Agent的架构、推理模式、多Agent协作机制,以及在设计领域的应用前景。
|
||||
|
||||
@@ -13,7 +13,7 @@ AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响
|
||||
|
||||
\subsection{规则系统时代}
|
||||
|
||||
最早的''智能系统''基于\textbf{规则(Rules)},即''如果满足条件A,则执行动作B''。
|
||||
最早的“智能系统”基于\textbf{规则(Rules)},即“如果满足条件A,则执行动作B”。
|
||||
|
||||
\textbf{典型结构:}
|
||||
|
||||
@@ -39,7 +39,7 @@ else:
|
||||
\item
|
||||
维护困难——规则数量膨胀后,系统变得难以理解和更新
|
||||
\item
|
||||
缺乏理解——系统并不''理解''规则背后的含义,只是机械执行
|
||||
缺乏理解——系统并不“理解”规则背后的含义,只是机械执行
|
||||
\end{itemize}
|
||||
|
||||
\subsection{传统规划方法}
|
||||
@@ -72,7 +72,7 @@ else:
|
||||
\end{longtable}
|
||||
}
|
||||
|
||||
LLM之所以能成为Agent的''大脑'',关键在于它具备了:
|
||||
LLM之所以能成为Agent的“大脑”,关键在于它具备了:
|
||||
|
||||
\begin{itemize}
|
||||
\tightlist
|
||||
@@ -123,7 +123,7 @@ LLM之所以能成为Agent的''大脑'',关键在于它具备了:
|
||||
- 工具反馈:查询结果、执行状态、错误信息
|
||||
\end{lstlisting}
|
||||
|
||||
感知的关键在于\textbf{理解意图}——用户说''设计一个公园'',Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。
|
||||
感知的关键在于\textbf{理解意图}——用户说“设计一个公园”,Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。
|
||||
|
||||
\subsection{规划(Planning)}
|
||||
|
||||
@@ -236,7 +236,7 @@ CoT的价值在于\textbf{让思考过程可见},这不仅提升了推理的
|
||||
|
||||
\subsection{ReAct(Reasoning + Acting)}\label{reactreasoning-acting}
|
||||
|
||||
ReAct模式将\textbf{推理与行动交替进行},形成''思考-行动-观察''的循环。
|
||||
ReAct模式将\textbf{推理与行动交替进行},形成“思考-行动-观察”的循环。
|
||||
|
||||
\textbf{基本循环:}
|
||||
|
||||
@@ -392,7 +392,7 @@ Agent角色
|
||||
\item
|
||||
\textbf{Agent团队}:多个Agent组成固定团队,各有专长
|
||||
\item
|
||||
\textbf{Agent市场}:Agent可以''雇佣''其他Agent完成特定子任务
|
||||
\textbf{Agent市场}:Agent可以“雇佣”其他Agent完成特定子任务
|
||||
\item
|
||||
\textbf{Agent社会}:大量Agent在开放环境中自主交互和协作
|
||||
\end{itemize}
|
||||
@@ -627,11 +627,11 @@ AI协作能力:
|
||||
\item
|
||||
\textbf{推理模式}:CoT和ReAct各适用于什么场景?请分别举一个设计领域的应用案例。
|
||||
\item
|
||||
\textbf{多Agent设计}:如果要设计一个''城市规划审批Agent系统'',你会设计哪些Agent角色?它们之间如何协作?
|
||||
\textbf{多Agent设计}:如果要设计一个“城市规划审批Agent系统”,你会设计哪些Agent角色?它们之间如何协作?
|
||||
\item
|
||||
\textbf{HITL实践}:在设计流程中,哪些环节应该由AI自动完成,哪些环节必须保留人工审核?请给出你的判断依据。
|
||||
\item
|
||||
\textbf{MCP理解}:MCP协议如何解决设计领域AI应用的''数据孤岛''问题?以一个具体的建筑设计场景为例进行说明。
|
||||
\textbf{MCP理解}:MCP协议如何解决设计领域AI应用的“数据孤岛”问题?以一个具体的建筑设计场景为例进行说明。
|
||||
\item
|
||||
\textbf{未来展望}:你认为AI Agent在未来10年会如何改变设计行业的就业结构?设计师应该如何准备?
|
||||
\end{enumerate}
|
||||
|
||||
+17
-17
@@ -6,7 +6,7 @@
|
||||
|
||||
2016年,AlphaGo击败围棋世界冠军李世石,让强化学习走入公众视野。此后,从蛋白质结构预测(AlphaFold)到大语言模型的人类对齐(RLHF),强化学习已深入AI的各个核心领域,成为现代人工智能不可或缺的基石。
|
||||
|
||||
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解''智能体如何在复杂世界中做出决策''的关键框架。
|
||||
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解“智能体如何在复杂世界中做出决策”的关键框架。
|
||||
|
||||
|
||||
\section{学习目标}
|
||||
@@ -103,7 +103,7 @@ R & 奖励函数(Reward Function) & R(s,a),在状态s采取动作a获得
|
||||
|
||||
\[G_t = r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + ... = \sum_{k=0}^{\infty} \gamma^k r_{t+k}\]
|
||||
|
||||
为了评估''处于某个状态有多好'',我们定义两种价值函数:
|
||||
为了评估“处于某个状态有多好”,我们定义两种价值函数:
|
||||
|
||||
\textbf{状态价值函数(State Value Function)V(s)}:在状态s下,遵循策略π所能获得的期望累积奖励。
|
||||
|
||||
@@ -113,7 +113,7 @@ R & 奖励函数(Reward Function) & R(s,a),在状态s采取动作a获得
|
||||
|
||||
\[Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]\]
|
||||
|
||||
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下''哪个动作最好''。
|
||||
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下“哪个动作最好”。
|
||||
|
||||
\section{Q-Learning}\label{q-learning}
|
||||
|
||||
@@ -137,7 +137,7 @@ DQN的两个关键创新:
|
||||
|
||||
\textbf{经验回放(Experience Replay)}:将智能体的经历 (s, a, r, s') 存储在回放缓冲区中,训练时随机采样小批量数据。这打破了数据之间的时间相关性,提高了训练稳定性。
|
||||
|
||||
\textbf{目标网络(Target Network)}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了''追逐移动目标''的不稳定性。
|
||||
\textbf{目标网络(Target Network)}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了“追逐移动目标”的不稳定性。
|
||||
|
||||
\begin{lstlisting}[language=Python]
|
||||
# DQN核心思路伪代码
|
||||
@@ -275,7 +275,7 @@ for s in range(n_states):
|
||||
\end{lstlisting}
|
||||
|
||||
\begin{quote}
|
||||
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它''该怎么走'',它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
|
||||
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它“该怎么走”,它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -373,7 +373,7 @@ Critic提供一个\textbf{基线(Baseline)},使得梯度估计的方差大
|
||||
|
||||
\[A(s, a) = Q(s, a) - V(s)\]
|
||||
|
||||
优势函数衡量的是''采取动作a比平均水平好多少''。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
|
||||
优势函数衡量的是“采取动作a比平均水平好多少”。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
|
||||
|
||||
\section{PPO:近端策略优化}
|
||||
|
||||
@@ -463,9 +463,9 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新
|
||||
|
||||
AlphaGo的核心技术组合:
|
||||
|
||||
\textbf{策略网络(Policy Network)}:学习''下一步应该下在哪里'',输入棋盘状态,输出每个位置落子的概率分布。
|
||||
\textbf{策略网络(Policy Network)}:学习“下一步应该下在哪里”,输入棋盘状态,输出每个位置落子的概率分布。
|
||||
|
||||
\textbf{价值网络(Value Network)}:学习''当前局面谁更可能赢'',输入棋盘状态,输出一个-1到1之间的胜率评估。
|
||||
\textbf{价值网络(Value Network)}:学习“当前局面谁更可能赢”,输入棋盘状态,输出一个-1到1之间的胜率评估。
|
||||
|
||||
\textbf{蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)}:在策略网络的指导下进行前瞻搜索,通过模拟大量对局来评估每个候选落子点的价值。
|
||||
|
||||
@@ -512,7 +512,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类:
|
||||
\end{longtable}
|
||||
}
|
||||
|
||||
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为''错误''的棋,最终却证明是更优的选择。
|
||||
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为“错误”的棋,最终却证明是更优的选择。
|
||||
|
||||
\section{AlphaFold(2020)}\label{alphafold2020}
|
||||
|
||||
@@ -560,10 +560,10 @@ AlphaFold的意义对设计领域尤其深远:
|
||||
└──────────────────────────────────────────┘
|
||||
\end{lstlisting}
|
||||
|
||||
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过''搜索 + 深度学习 + 计算''的组合来获得突破。
|
||||
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过“搜索 + 深度学习 + 计算”的组合来获得突破。
|
||||
|
||||
\begin{quote}
|
||||
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从''玩具问题''走向''真实世界问题''的趋势。设计领域正是这种真实世界问题的重要阵地。
|
||||
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从“玩具问题”走向“真实世界问题”的趋势。设计领域正是这种真实世界问题的重要阵地。
|
||||
\end{quote}
|
||||
|
||||
|
||||
@@ -588,7 +588,7 @@ AlphaFold的意义对设计领域尤其深远:
|
||||
\textbf{对齐(Alignment)} 的目标是让AI模型的行为符合人类的价值观和期望,使其成为安全、有用、诚实的助手。而\textbf{RLHF(Reinforcement Learning from Human Feedback)} 是目前最成功的对齐方法。
|
||||
|
||||
\begin{quote}
|
||||
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型''能力'',而RLHF赋予模型''方向''——让能力服务于人类的目标。
|
||||
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型“能力”,而RLHF赋予模型“方向”——让能力服务于人类的目标。
|
||||
\end{quote}
|
||||
|
||||
\section{RLHF:从人类反馈中学习}
|
||||
@@ -669,7 +669,7 @@ for step in range(training_steps):
|
||||
|
||||
RLHF需要大量人工标注,成本高昂。\textbf{RLAIF(Reinforcement Learning from AI Feedback)} 用AI替代人类标注者来提供反馈:
|
||||
|
||||
\textbf{Constitutional AI(宪法AI)} 由Anthropic提出,其核心思想是让AI通过一组''宪法原则''进行自我纠正:
|
||||
\textbf{Constitutional AI(宪法AI)} 由Anthropic提出,其核心思想是让AI通过一组“宪法原则”进行自我纠正:
|
||||
|
||||
\begin{lstlisting}
|
||||
Constitutional AI 流程:
|
||||
@@ -699,9 +699,9 @@ Constitutional AI 流程:
|
||||
|
||||
\section{什么是具身智能?}
|
||||
|
||||
\textbf{具身智能(Embodied AI)} 是指拥有物理或虚拟''身体''的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
|
||||
\textbf{具身智能(Embodied AI)} 是指拥有物理或虚拟“身体”的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
|
||||
|
||||
传统AI(如大语言模型)是一个''缸中之脑''——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
|
||||
传统AI(如大语言模型)是一个“缸中之脑”——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
|
||||
|
||||
\begin{lstlisting}
|
||||
┌───────────────────────────────────────────┐
|
||||
@@ -850,7 +850,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
|
||||
|
||||
\section{设计应用}
|
||||
|
||||
强化学习为设计领域提供了从''被动工具''到''主动智能体''的范式转变。以下是一些具有代表性的应用场景。
|
||||
强化学习为设计领域提供了从“被动工具”到“主动智能体”的范式转变。以下是一些具有代表性的应用场景。
|
||||
|
||||
\section{空间布局优化}
|
||||
|
||||
@@ -875,7 +875,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
|
||||
- 空间浪费惩罚
|
||||
\end{lstlisting}
|
||||
|
||||
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的''风格''和''策略'',而不仅是找到单一最优解。
|
||||
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的“风格”和“策略”,而不仅是找到单一最优解。
|
||||
|
||||
\section{路径规划与导航}
|
||||
|
||||
|
||||
Reference in New Issue
Block a user