From c9d2ce8a69d845d578fda8bd44a3e17f0a281923 Mon Sep 17 00:00:00 2001 From: xiaopeng <1509442308@qq.com> Date: Fri, 29 May 2026 14:05:08 +0800 Subject: [PATCH] =?UTF-8?q?fix(latex):=20=E4=BF=AE=E5=A4=8D=E4=B8=AD?= =?UTF-8?q?=E6=96=87=E5=BC=95=E5=8F=B7=E6=B8=B2=E6=9F=93=EF=BC=8C''...''?= =?UTF-8?q?=20=E2=86=92=20"..."=EF=BC=88139=E5=A4=84=EF=BC=89?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit pandoc 转换将中文双引号变为两个ASCII单引号,导致LaTeX中 左右引号均渲染为右引号。替换为Unicode中文引号以正确显示。 Co-Authored-By: Claude Opus 4.7 --- appendices/ap01-programming.tex | 6 +++--- appendices/ap02-vibe-coding.tex | 6 +++--- chapters/ch00-preface.tex | 2 +- chapters/ch01-intro.tex | 12 ++++++------ chapters/ch02-framework.tex | 30 ++++++++++++++--------------- chapters/ch03-1d-sequence.tex | 28 +++++++++++++-------------- chapters/ch04-2d-vision.tex | 32 +++++++++++++++---------------- chapters/ch05-3d-spatial.tex | 16 ++++++++-------- chapters/ch06-generative.tex | 22 ++++++++++----------- chapters/ch07-agent.tex | 20 +++++++++---------- chapters/ch08-rl.tex | 34 ++++++++++++++++----------------- 11 files changed, 104 insertions(+), 104 deletions(-) diff --git a/appendices/ap01-programming.tex b/appendices/ap01-programming.tex index 51eb424..71c9c6f 100644 --- a/appendices/ap01-programming.tex +++ b/appendices/ap01-programming.tex @@ -113,7 +113,7 @@ AutoDL & 按时计费 & 中期项目 \\ 所以整个链条是:\textbf{包管理器下载编译好的二进制 → 放到 PATH 目录 → shell 通过 PATH 找到它 → execve 加载到内存 →} -\textbf{二进制内部调用 OS API 完成实际工作}。没有任何''魔法'',本质上就是文件操作和进程管理的组合。 +\textbf{二进制内部调用 OS API 完成实际工作}。没有任何“魔法”,本质上就是文件操作和进程管理的组合。 \subsubsection{程序设计语言与软件开发} @@ -175,7 +175,7 @@ Ruby:Web开发(Ruby on Rails) 特点:开发灵活、调试方便,但运行速度通常慢于编译型语言。 -\textbf{混合模式}:Java 采用''编译为字节码 → 虚拟机解释执行''的混合方式,兼顾了跨平台和性能。 +\textbf{混合模式}:Java 采用“编译为字节码 → 虚拟机解释执行”的混合方式,兼顾了跨平台和性能。 \paragraph{常见编程语言概览} @@ -289,7 +289,7 @@ pip install torch torchvision \subparagraph{Python概述与特点}\label{pythonux6982ux8ff0ux4e0eux7279ux70b9} -Python由Guido van Rossum于1991年发布,以''优雅''\,``简洁''\,``可读性强''为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。 +Python由Guido van Rossum于1991年发布,以“优雅”\,``简洁“\,``可读性强”为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。 \textbf{核心特点}: - 语法简洁,接近自然语言,入门门槛低 - 丰富的第三方库生态(AI、数据处理、Web等) - 跨平台运行(Windows、macOS、Linux) - 活跃的开源社区支持 diff --git a/appendices/ap02-vibe-coding.tex b/appendices/ap02-vibe-coding.tex index 08f4777..1f2cb60 100644 --- a/appendices/ap02-vibe-coding.tex +++ b/appendices/ap02-vibe-coding.tex @@ -10,7 +10,7 @@ Vibe Coding:\textbf{模糊想法 → AI辅助 → 迭代完善} -Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达''想要什么''。 +Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达“想要什么”。 \paragraph{工作流程} @@ -138,7 +138,7 @@ Claude Code提供VSCode扩展,在编辑器中获得同样的AI辅助能力: 在编辑器中选中代码后,可以直接向Claude提问或请求修改 \end{enumerate} -\textbf{常用场景}: - 选中一段代码,请求''解释这段代码'' - 选中函数,请求''添加错误处理'' - 在Claude面板中输入''帮我写单元测试'' +\textbf{常用场景}: - 选中一段代码,请求“解释这段代码” - 选中函数,请求“添加错误处理” - 在Claude面板中输入“帮我写单元测试” \paragraph{典型项目工作流} @@ -361,7 +361,7 @@ c & d \textbf{核心特性}: - \textbf{本地存储}:所有笔记以Markdown文件保存在本地,数据完全自主 - \textbf{双向链接}:用 {[}{[}笔记名{]}{]} 在笔记之间建立链接,形成知识网络 - \textbf{图谱视图}:可视化笔记之间的关联关系 - \textbf{插件生态}:丰富的社区插件扩展功能(如日历、看板、模板等) - \textbf{实时预览}:编辑Markdown时实时渲染效果 -\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装''目录''插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来 +\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装“目录”插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来 \subsubsection{Git版本管理与GitHub协作}\label{gitux7248ux672cux7ba1ux7406ux4e0egithubux534fux4f5c} diff --git a/chapters/ch00-preface.tex b/chapters/ch00-preface.tex index 19f0d61..c4195eb 100644 --- a/chapters/ch00-preface.tex +++ b/chapters/ch00-preface.tex @@ -35,7 +35,7 @@ AI技术仍在飞速发展,本书的内容不可避免地会随着时间推移而需要更新。但书中所传达的核心思想——理解原理、拥抱工具、人机协作——将具有持久的价值。 -感谢AI技术本身——本书的写作过程中广泛使用了Claude、ChatGPT等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。 +感谢AI技术本身——本书的写作过程中广泛使用了Claude Code等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。 设计的人工智能时代才刚刚开始。希望这本书能成为读者进入这个新时代的一块踏脚石,从而汇聚起万千努力,能够成为点燃"通用设计智能"的星星之火。 diff --git a/chapters/ch01-intro.tex b/chapters/ch01-intro.tex index f3d0e78..27ef87e 100644 --- a/chapters/ch01-intro.tex +++ b/chapters/ch01-intro.tex @@ -47,7 +47,7 @@ \subsection{案例背景} -Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现''拿了就走''的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。 +Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现“拿了就走”的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。 \subsection{技术要素} @@ -70,7 +70,7 @@ Amazon Go 的 AI 技术栈融合了多项前沿技术: \subsection{启示} -Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''拿了就走'',AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。 +Amazon Go 展示了 AI 技术如何重构传统场景。从“扫码支付”到“拿了就走”,AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。 \section{AI 发展时间线(2016--2024)} @@ -128,7 +128,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到'' 音频生成:音乐、配音、音效 \end{itemize} -\textbf{设计影响}:从''工具辅助''到''生成伙伴'' +\textbf{设计影响}:从“工具辅助”到“生成伙伴” \subsection{Agent(智能体)} @@ -148,7 +148,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到'' \textbf{工具(Tool Use)}:调用外部资源 \end{itemize} -\textbf{设计影响}:从''被动执行''到''主动协作'' +\textbf{设计影响}:从“被动执行”到“主动协作” \subsection{AI4S(AI for Science)}\label{ai4sai-for-science} @@ -497,9 +497,9 @@ y = a₁x₁ + a₂x₂ + b & 多输入神经元 \\ \def\labelenumi{\arabic{enumi}.} \tightlist \item - 万能逼近定理告诉我们神经网络''能''做任何事,但没有说''如何''高效学习。这个区别意味着什么? + 万能逼近定理告诉我们神经网络“能”做任何事,但没有说“如何”高效学习。这个区别意味着什么? \item - Scaling Law 是否意味着''越大越好''?在资源有限的情况下,应该如何权衡? + Scaling Law 是否意味着“越大越好”?在资源有限的情况下,应该如何权衡? \item 从函数式视角理解 AI,对你理解设计问题有何启发? \end{enumerate} diff --git a/chapters/ch02-framework.tex b/chapters/ch02-framework.tex index 13bc383..6d6116c 100644 --- a/chapters/ch02-framework.tex +++ b/chapters/ch02-framework.tex @@ -1,6 +1,6 @@ \chapter{设计人工智能的理论框架} -本章建立全书的核心理论框架。我们从''函数描述世界''的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。 +本章建立全书的核心理论框架。我们从“函数描述世界”的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。 \section{篇章导读} @@ -8,7 +8,7 @@ 无论是处理文本、图像还是三维空间数据,AI的本质工作都是一样的——从数据中学习映射函数 \(y = f(x; \theta)\)。区别仅在于输入数据的形态不同,因此需要不同的网络结构来高效处理。 -本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立''环境-智能体-任务''实践框架,降低上手门槛 +本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立“环境-智能体-任务”实践框架,降低上手门槛 \section{函数式AI视角} @@ -18,7 +18,7 @@ \begin{itemize} \tightlist \item - 理解''Functions Describe the World''的核心理念 + 理解“Functions Describe the World”的核心理念 \item 掌握从Excel线性回归到神经网络的演进逻辑 \item @@ -126,7 +126,7 @@ plt.grid(True, alpha=0.3) plt.show() \end{lstlisting} -这段代码展示了一个完整的''从数据中学习函数''的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}。 +这段代码展示了一个完整的“从数据中学习函数”的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}。 \subsection{数据驱动 vs 规则驱动} @@ -159,7 +159,7 @@ result = model.predict(new_image) # 自动判断 优势: - 自动发现人类难以表达的规律 - 数据越多,性能越好 - 可以处理复杂的、非线性的关系 - 适应性强,可迁移到新任务 \begin{quote} -\textbf{设计思维的转变}:从''设计规则''到''设计数据''。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。 +\textbf{设计思维的转变}:从“设计规则”到“设计数据”。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。 \end{quote} @@ -319,7 +319,7 @@ AI同样需要针对不同模态的数据采用不同的处理方式。一种数 \textbf{第四阶段:大模型时代(Foundation Models)} -参数规模达到十亿甚至万亿级别的模型,展现出''涌现能力''(Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。 +参数规模达到十亿甚至万亿级别的模型,展现出“涌现能力”(Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。 特点: - 单一模型处理多种任务(通用性) - 涌现能力:规模带来质变 - 少样本甚至零样本学习 - Scaling Law:性能随规模持续提升 @@ -412,7 +412,7 @@ FPFH → PointNet → Point-BERT → Point-E \item \textbf{预训练时代是设计师的最佳入口}。利用预训练模型,设计师不需要海量数据和强大算力,就能将AI应用到设计实践中。 \item - \textbf{大模型时代带来''民主化''}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。 + \textbf{大模型时代带来“民主化”}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。 \end{enumerate} @@ -589,7 +589,7 @@ print(f"最终输出: {y.flatten()}") \subsection{激活函数} -激活函数(Activation Function)是神经网络的''灵魂''。没有激活函数,无论网络有多少层,都等价于一个单层线性变换: +激活函数(Activation Function)是神经网络的“灵魂”。没有激活函数,无论网络有多少层,都等价于一个单层线性变换: \[y = W_2(W_1x) = (W_2W_1)x = W'x\] @@ -624,7 +624,7 @@ Sigmoid & \(\sigma(z) = \frac{1}{1+e^{-z}}\) & (0, 1) & 输出可解释为概率 ReLU & \(\text{ReLU}(z) = \max(0, z)\) & {[}0, +∞) & 计算简单高效;缓解梯度消失 & \textbf{隐藏层首选} \\ Tanh & \(\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}\) & (-1, 1) & 零中心化;两端梯度消失 & 循环网络隐藏层 \\ Softmax & \(\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_j e^{z_j}}\) & (0, 1),和为1 & 输出为概率分布 & 多分类输出层 \\ -LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU''死神经元''问题 & 深层网络隐藏层 \\ +LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU“死神经元”问题 & 深层网络隐藏层 \\ \end{longtable} } @@ -646,12 +646,12 @@ ReLU: Sigmoid: Tanh: \end{lstlisting} \begin{quote} -\textbf{设计类比}:激活函数就像是设计中的''非线性思维''。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了''跳跃''和''拐弯''的能力,让网络能够表达复杂的设计关系。 +\textbf{设计类比}:激活函数就像是设计中的“非线性思维”。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了“跳跃”和“拐弯”的能力,让网络能够表达复杂的设计关系。 \end{quote} \subsection{损失函数} -损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的''指南针''。 +损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的“指南针”。 \textbf{常用损失函数} @@ -695,7 +695,7 @@ ReLU: Sigmoid: Tanh: \subsection{反向传播与梯度下降} -反向传播(Backpropagation)是训练神经网络的核心算法,它解决了''如何高效计算每个参数对损失的影响程度''这一问题。 +反向传播(Backpropagation)是训练神经网络的核心算法,它解决了“如何高效计算每个参数对损失的影响程度”这一问题。 \textbf{核心思想:梯度下降} @@ -832,7 +832,7 @@ print(f"真实参数: W = [2.0, 3.0], b = [1.0]") \begin{itemize} \tightlist \item - 理解''环境-智能体-任务''三元框架 + 理解“环境-智能体-任务”三元框架 \item 认识环境配置是AI实践中的关键瓶颈 \item @@ -927,7 +927,7 @@ GPU/CUDA配置 & 驱动版本与CUDA版本不匹配 & ★★★★★ \\ } \begin{quote} -\textbf{核心观点}:环境问题不是''技术能力不足''的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。 +\textbf{核心观点}:环境问题不是“技术能力不足”的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。 \end{quote} \subsection{降低门槛的实践策略} @@ -1049,7 +1049,7 @@ d2l.ai(动手学深度学习) & 代码驱动,PyTorch/MXNet/TensorFlow多 \endhead \bottomrule\noalign{} \endlastfoot -Hugging Face & 模型和数据集的''GitHub'',可在线体验 \\ +Hugging Face & 模型和数据集的“GitHub”,可在线体验 \\ Civitai & Stable Diffusion模型分享社区 \\ Papers With Code & 论文+代码+排行榜,追踪最新技术 \\ \end{longtable} diff --git a/chapters/ch03-1d-sequence.tex b/chapters/ch03-1d-sequence.tex index 4241113..7b5c793 100644 --- a/chapters/ch03-1d-sequence.tex +++ b/chapters/ch03-1d-sequence.tex @@ -4,7 +4,7 @@ 一维数据(1D Data)是人工智能处理的最基础、也是最重要的数据形态。你正在阅读的文字、你说出的一句话、股票市场的价格走势、建筑室内温度随时间的变化——这些都是一维序列数据。 -与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了''和''饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。 +与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了“和”饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。 本章将带你踏上一段激动人心的技术演进之旅:从早期的小型循环神经网络(RNN),到注意力机制的革命性突破,再到 Transformer 架构的横空出世,最终见证大语言模型(LLM)如何改变整个 AI 格局。这条从小模型到大模型的技术脉络,不仅是深度学习最精彩的故事之一,也直接关系到今天每一位设计师如何使用 AI 工具。 @@ -75,14 +75,14 @@ "光线 充足" → 设计优点 \end{lstlisting} -模型需要''记住''之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。 +模型需要“记住”之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。 \section{RNN:循环神经网络} \subsection{核心思想} -RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State)在时间步之间传递信息,实现''记忆''功能。 +RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State)在时间步之间传递信息,实现“记忆”功能。 \begin{lstlisting} 时间展开视图: @@ -128,7 +128,7 @@ RNN(Recurrent Neural Network)通过\textbf{隐藏状态}(Hidden State) 时间步7:看到"空间感" → h₇ = "完整理解:客厅用开放式布局来增加空间感" \end{lstlisting} -每一步,RNN 都在累积和更新对文本的理解。这就是''记忆''的力量。 +每一步,RNN 都在累积和更新对文本的理解。这就是“记忆”的力量。 \subsection{PyTorch 代码示例} @@ -189,14 +189,14 @@ RNN 需要通过反向传播跨越多个时间步来更新参数。当序列较 RNN 处理长序列时遇到同样的问题! \end{lstlisting} -在实际应用中,标准 RNN 通常只能''记住''5-10步之前的信息。对于''这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高''这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。 +在实际应用中,标准 RNN 通常只能“记住”5-10步之前的信息。对于“这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高”这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。 \section{LSTM:长短期记忆网络} \subsection{设计哲学} -LSTM(Long Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的''信息高速公路'',让信息可以长距离传递而不被稀释。 +LSTM(Long Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的“信息高速公路”,让信息可以长距离传递而不被稀释。 \begin{lstlisting} LSTM 单元内部结构: @@ -220,7 +220,7 @@ LSTM 单元内部结构: \subsection{三道门:遗忘、输入、输出} -LSTM 通过三个''门''(Gate)来精确控制信息的流动: +LSTM 通过三个“门”(Gate)来精确控制信息的流动: \textbf{1. 遗忘门(Forget Gate)}:决定从细胞状态中丢弃什么信息 @@ -428,7 +428,7 @@ RNN 的局限 & 具体影响 \\ \subsection{核心思想} -自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置''交流'',一步到位地获取全局信息。 +自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置“交流”,一步到位地获取全局信息。 \begin{lstlisting} 传统 RNN(串行传递信息): @@ -553,7 +553,7 @@ print(f"输出形状: {output.shape}") # (1, 4, 64) \subsection{为什么需要多头?} -单个注意力头只能学习一种''关注模式''。现实中的语言理解需要同时关注多种关系: +单个注意力头只能学习一种“关注模式”。现实中的语言理解需要同时关注多种关系: \begin{lstlisting} 句子:"设计师用木质材料打造了温馨的北欧风格客厅" @@ -619,7 +619,7 @@ class MultiHeadAttention(nn.Module): \subsection{为什么需要位置信息?} -Self-Attention 本身是''位置无关''的——它把输入看作一个集合(Set),而不是序列(Sequence): +Self-Attention 本身是“位置无关”的——它把输入看作一个集合(Set),而不是序列(Sequence): \begin{lstlisting} 输入 A:"客厅 在 北面" @@ -833,9 +833,9 @@ class FeedForward(nn.Module): 输出 → 传递给下一层或最终线性层 \end{lstlisting} -\subsection{Masked Self-Attention:为什么要''掩码''?} +\subsection{Masked Self-Attention:为什么要“掩码”?} -在生成文本时,模型不能''偷看''未来的词: +在生成文本时,模型不能“偷看”未来的词: \begin{lstlisting} 生成 "现代 简约 风格 客厅": @@ -1191,7 +1191,7 @@ Transformer 论文发表后的几年里,研究者们发现了一个关键规 \section{RAG:检索增强生成} -\subsection{问题:大模型的''幻觉''} +\subsection{问题:大模型的“幻觉”} LLM 会自信地编造不存在的事实: @@ -1338,7 +1338,7 @@ answer = llm.generate(augmented_prompt) \subsection{核心原则} -Prompt Engineering 是与大语言模型有效沟通的''艺术与科学'': +Prompt Engineering 是与大语言模型有效沟通的“艺术与科学”: \begin{lstlisting} 原则一:明确任务 diff --git a/chapters/ch04-2d-vision.tex b/chapters/ch04-2d-vision.tex index 592496a..44d8a63 100644 --- a/chapters/ch04-2d-vision.tex +++ b/chapters/ch04-2d-vision.tex @@ -6,7 +6,7 @@ 人类感知世界,约80\%的信息来自视觉。对于设计师而言,图像不仅是设计成果的呈现形式,更是灵感来源、分析对象和沟通媒介。 -本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从''识别图片中的猫''一步步发展到''理解任意场景中的任意内容'',以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。 +本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从“识别图片中的猫”一步步发展到“理解任意场景中的任意内容”,以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。 通过本章学习,你将: @@ -75,7 +75,7 @@ CNN通过三个关键设计解决了MLP的上述缺陷: \end{longtable} } -\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种''从局部到整体''的视觉处理方式。 +\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种“从局部到整体”的视觉处理方式。 \subsection{卷积操作} @@ -242,7 +242,7 @@ LeNet (1998) AlexNet (2012) VGG (2014) ResNet (2015) \endlastfoot LeNet-5 & 1998 & 5层 & 首个成功的CNN & 手写数字识别,邮局实用 \\ AlexNet & 2012 & 8层 & ReLU、Dropout、GPU训练 & ImageNet竞赛冠军,深度学习复兴 \\ -VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明''更深=更好''的简洁设计 \\ +VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明“更深=更好”的简洁设计 \\ ResNet & 2015 & 152层+ & 残差连接(Skip Connection) & 突破深度瓶颈,可训练极深网络 \\ \end{longtable} } @@ -293,7 +293,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}: \end{itemize} \begin{quote} -\textbf{设计思维链接}:残差连接的思想类似于设计中的''增量修改''——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种''在已有基础上做调整''的策略,在参数空间中比''从零开始学习''高效得多。 +\textbf{设计思维链接}:残差连接的思想类似于设计中的“增量修改”——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种“在已有基础上做调整”的策略,在参数空间中比“从零开始学习”高效得多。 \end{quote} @@ -301,7 +301,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}: \subsection{从分类到检测} -图像分类回答的问题是''这是什么'',而目标检测需要同时回答两个问题: +图像分类回答的问题是“这是什么”,而目标检测需要同时回答两个问题: \begin{lstlisting} 分类: "这是一张建筑的照片" → what @@ -332,7 +332,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection)}: \subsection{两阶段检测器} -两阶段方法的思路是''先找候选区域,再分类判别'',精度高但速度较慢。 +两阶段方法的思路是“先找候选区域,再分类判别”,精度高但速度较慢。 \textbf{演进路线}: @@ -586,7 +586,7 @@ DeepLab由Google团队提出,其核心创新是\textbf{空洞卷积(Atrous C 2020年,Google团队提出了 \textbf{ViT(Vision Transformer)},首次证明纯Transformer架构可以在图像任务上达到甚至超越CNN的性能,开启了视觉领域的Transformer时代。 -\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个''词''(Token),然后送入标准Transformer编码器处理。 +\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个“词”(Token),然后送入标准Transformer编码器处理。 \begin{lstlisting} 输入图像 (224×224×3) 切分为图块 线性嵌入 @@ -744,7 +744,7 @@ Swin Transformer的设计使其兼具CNN的层级特征提取优势和Transforme └─────────┘ └──────────┘ \end{lstlisting} -CLIP的训练目标:对于N个''图像-文本''配对,最大化正确配对的相似度,最小化错误配对的相似度。 +CLIP的训练目标:对于N个“图像-文本”配对,最大化正确配对的相似度,最小化错误配对的相似度。 \textbf{零样本分类}: @@ -764,7 +764,7 @@ CLIP的意义在于:\textbf{用自然语言定义视觉概念},打破了传 \subsection{SAM:分割一切} -\textbf{SAM(Segment Anything Model, Meta, 2023)}是一个''可提示''的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。 +\textbf{SAM(Segment Anything Model, Meta, 2023)}是一个“可提示”的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。 \begin{lstlisting} SAM 的三种提示方式 @@ -796,7 +796,7 @@ SAM 的三种提示方式 \textbf{海量数据集}:SA-1B数据集包含10亿级自动标注的分割掩码 \end{itemize} -SAM的设计理念是成为视觉领域的''基础模型''——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。 +SAM的设计理念是成为视觉领域的“基础模型”——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。 \subsection{DINOv2:自监督视觉特征} @@ -834,7 +834,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练 \subsection{视觉-语言模型} -大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅''看图说话'',而是真正理解图像内容并可以回答关于图像的复杂问题。 +大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅“看图说话”,而是真正理解图像内容并可以回答关于图像的复杂问题。 \textbf{典型任务与模型}: @@ -949,7 +949,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练 \item \textbf{智能标签}:自动为设计素材添加语义标签,无需人工标注 \item - \textbf{自然语言检索}:用文字描述查找设计参考图(如''带玻璃幕墙的现代商业建筑'') + \textbf{自然语言检索}:用文字描述查找设计参考图(如“带玻璃幕墙的现代商业建筑”) \item \textbf{风格分类}:自动识别设计作品的风格特征 \item @@ -971,7 +971,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练 后现代/...) 未知风格) 的设计案例) \end{lstlisting} -结合CLIP的零样本能力,设计师可以自定义风格类别(如''新中式''\,``极简主义''``有机建筑''等),无需收集训练数据即可进行风格分类。 +结合CLIP的零样本能力,设计师可以自定义风格类别(如“新中式”\,``极简主义“``有机建筑”等),无需收集训练数据即可进行风格分类。 \section{本章小结} @@ -1004,9 +1004,9 @@ CNN时代 (2012-2020) Transformer时代 (2020-) \item \textbf{架构对比}:CNN通过局部卷积提取特征,ViT通过全局自注意力建立关系。在设计场景中(如建筑立面分析、街景品质评估),你认为哪种架构更适合?为什么? \item - \textbf{零样本能力}:CLIP实现了''用自然语言做图像分类''的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的''宜居性'',你会如何设计提示文本?考虑需要哪些视觉线索。 + \textbf{零样本能力}:CLIP实现了“用自然语言做图像分类”的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的“宜居性”,你会如何设计提示文本?考虑需要哪些视觉线索。 \item - \textbf{大模型与传统方法}:SAM号称可以''分割一切''。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择? + \textbf{大模型与传统方法}:SAM号称可以“分割一切”。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择? \end{enumerate} @@ -1032,7 +1032,7 @@ CNN时代 (2012-2020) Transformer时代 (2020-) 卷积神经网络 & Convolutional Neural Network (CNN) & 利用卷积操作提取局部特征的神经网络 \\ 卷积核/滤波器 & Kernel / Filter & 卷积操作中用于特征提取的小矩阵 \\ 池化 & Pooling & 降低特征图空间尺寸的下采样操作 \\ -感受野 & Receptive Field & 神经元能''看到''的输入区域大小 \\ +感受野 & Receptive Field & 神经元能“看到”的输入区域大小 \\ 残差连接 & Residual/Skip Connection & 将输入直接加到输出上,解决深层网络退化问题 \\ 目标检测 & Object Detection & 同时识别图像中目标的类别和位置 \\ 边界框 & Bounding Box & 用矩形框标出目标位置的表示方法 \\ diff --git a/chapters/ch05-3d-spatial.tex b/chapters/ch05-3d-spatial.tex index 8e7c4f1..9f7c39e 100644 --- a/chapters/ch05-3d-spatial.tex +++ b/chapters/ch05-3d-spatial.tex @@ -2,9 +2,9 @@ \section{篇章导读} -三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入''现代化办公椅''的文本描述,AI便能生成一个可编辑的3D模型。 +三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入“现代化办公椅”的文本描述,AI便能生成一个可编辑的3D模型。 -这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何''看见''和''重建''空间,并探索空间智能在设计领域的广阔应用。 +这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何“看见”和“重建”空间,并探索空间智能在设计领域的广阔应用。 \section{三维数据表示} @@ -131,7 +131,7 @@ \item 内存消耗与分辨率的立方成正比 \item - 分辨率有限时存在''方块效应'' + 分辨率有限时存在“方块效应” \item 适合3D卷积神经网络处理 \end{itemize} @@ -703,7 +703,7 @@ MVS稠密匹配 \subsubsection{核心思想} -不再显式存储3D模型(点云/网格),而是用一个神经网络来''记住''整个三维场景: +不再显式存储3D模型(点云/网格),而是用一个神经网络来“记住”整个三维场景: \begin{lstlisting} 传统: 场景 → 存储为点云/网格/体素 @@ -859,7 +859,7 @@ NeRF的隐式表示虽然质量高,但速度慢、难以编辑。3D Gaussian S \subsection{3D生成模型} -从2023年开始,AI不仅能''重建''已有场景,还能从零''生成''新的3D内容。 +从2023年开始,AI不仅能“重建”已有场景,还能从零“生成”新的3D内容。 \subsubsection{Text-to-3D (文本生成3D)} @@ -1070,7 +1070,7 @@ print(f"颜色形状: {color.shape}, 密度形状: {density.shape}") \subsection{从3D感知到空间推理} -前两节我们学习了AI如何''感知''和''重建''三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。 +前两节我们学习了AI如何“感知”和“重建”三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。 \begin{lstlisting} 3D能力层次: @@ -1308,7 +1308,7 @@ AI增强GIS: \item 数字孪生的四个层次在设计实践中分别对应哪些具体工具和方法? \item - 设想一个''认知孪生''校园,它能做哪些事情?需要哪些技术支撑? + 设想一个“认知孪生”校园,它能做哪些事情?需要哪些技术支撑? \end{enumerate} \subsection{关键术语} @@ -1682,7 +1682,7 @@ print("城市模型已保存为 city_model.obj") \item \textbf{技术路线对比}:NeRF和3D Gaussian Splatting分别代表了隐式和显式的场景表示路线。请从设计应用的角度分析:哪些设计场景更适合NeRF,哪些更适合3DGS?未来两者会融合还是分化? \item - \textbf{空间智能畅想}:设想你正在设计一个''AI空间设计师助手'',它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。 + \textbf{空间智能畅想}:设想你正在设计一个“AI空间设计师助手”,它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。 \end{enumerate} \section{关键术语} diff --git a/chapters/ch06-generative.tex b/chapters/ch06-generative.tex index fc214a7..6f85b29 100644 --- a/chapters/ch06-generative.tex +++ b/chapters/ch06-generative.tex @@ -2,7 +2,7 @@ \section{篇章导读} -生成式AI(Generative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的''创意伙伴''(Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从''分析''到''创造''的转变,正是生成式AI最激动人心的地方。 +生成式AI(Generative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的“创意伙伴”(Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从“分析”到“创造”的转变,正是生成式AI最激动人心的地方。 本章将从生成模型的基本原理出发,系统介绍从自编码器(AE)、对抗生成网络(GAN)到扩散模型(Diffusion Model)的技术演进,并深入探讨AIGC工具链在设计领域的实际应用。 @@ -19,7 +19,7 @@ 输入 → 编码器 (Encoder) → 潜在表示 (Latent) → 解码器 (Decoder) → 重构输出 \end{lstlisting} -自编码器的工作方式可以理解为''先压缩,再还原'':编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。 +自编码器的工作方式可以理解为“先压缩,再还原”:编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。 \textbf{局限性:} @@ -76,7 +76,7 @@ VAE的关键在于将潜在空间约束为\textbf{标准正态分布}。这意 } \begin{quote} -\textbf{设计类比}:VAE就像一位理解了''风格空间''的画师——他不仅会临摹,还能在''风格空间''中探索,画出从未见过但风格一致的新作品。 +\textbf{设计类比}:VAE就像一位理解了“风格空间”的画师——他不仅会临摹,还能在“风格空间”中探索,画出从未见过但风格一致的新作品。 \end{quote} @@ -104,7 +104,7 @@ GAN的训练过程可以类比为\textbf{伪造者与鉴定师}的博弈: \item \textbf{鉴定师}(判别器)不断提升辨别能力,区分真画和假画 \item - 随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的''杰作'' + 随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的“杰作” \end{itemize} \textbf{训练过程:} @@ -174,7 +174,7 @@ CycleGAN解决了一个重要的实际问题:\textbf{无需成对训练数据} CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景转夜晚、夏季景观转冬季等。 \begin{quote} -\textbf{设计思考}:GAN系列模型展示了''对抗''这一全新的训练范式——不是告诉模型''正确答案是什么'',而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。 +\textbf{设计思考}:GAN系列模型展示了“对抗”这一全新的训练范式——不是告诉模型“正确答案是什么”,而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。 \end{quote} @@ -220,7 +220,7 @@ x₀ ≈ 原始图像 损失函数:L = ||ε - ε_θ(x_t, t)||² \end{lstlisting} -模型不需要学习''好图像长什么样'',而是学习''噪声长什么样''——这是一个更容易学习的目标。 +模型不需要学习“好图像长什么样”,而是学习“噪声长什么样”——这是一个更容易学习的目标。 \subsection{Stable Diffusion架构} @@ -311,15 +311,15 @@ CLIP & 文图对齐 & 确保生成的图像与文本描述语义一致 \\ \item \textbf{主体描述}:画面核心内容 \item - \textbf{风格指定}:如''水彩画''\,``赛博朋克''``极简主义'' + \textbf{风格指定}:如“水彩画”\,``赛博朋克“``极简主义” \item - \textbf{质量修饰}:如''高清''\,``细节丰富''``4K'' + \textbf{质量修饰}:如“高清”\,``细节丰富“``4K” \item - \textbf{光照氛围}:如''黄金时段光线''\,``柔和阴影'' + \textbf{光照氛围}:如“黄金时段光线”\,``柔和阴影'' \end{itemize} \begin{quote} -\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是''设计任务书'',CLIP编码器理解需求,U-Net是''设计师的大脑'',而VAE解码器将脑海中的概念转化为可见的图纸。 +\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是“设计任务书”,CLIP编码器理解需求,U-Net是“设计师的大脑”,而VAE解码器将脑海中的概念转化为可见的图纸。 \end{quote} @@ -404,7 +404,7 @@ Canny边缘 & Canny Edge & 检测图像轮廓 & 草图控制、线稿渲染 \\ 基础模型 + LoRA_A + LoRA_B = 混合风格生成 \end{lstlisting} -设计师可以针对特定设计风格训练专属LoRA,如''新中式风格''\,``日式极简风格''等,实现个性化的AI生成。 +设计师可以针对特定设计风格训练专属LoRA,如“新中式风格”\,``日式极简风格''等,实现个性化的AI生成。 \subsection{ComfyUI:模块化工作流} diff --git a/chapters/ch07-agent.tex b/chapters/ch07-agent.tex index 7bb2a03..57924aa 100644 --- a/chapters/ch07-agent.tex +++ b/chapters/ch07-agent.tex @@ -2,9 +2,9 @@ \section{篇章导读} -AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响应''到''主动行动'',从''单一能力''到''系统协同''。如果说前几章介绍的AI模型是''工具'',那么AI Agent就是能\textbf{自主使用工具的助手}。 +AI Agent(智能体)代表了人工智能的下一个前沿:从“被动响应”到“主动行动”,从“单一能力”到“系统协同”。如果说前几章介绍的AI模型是“工具”,那么AI Agent就是能\textbf{自主使用工具的助手}。 -想象这样一幅场景:你告诉AI''帮我分析这块场地的开发潜力'',它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。 +想象这样一幅场景:你告诉AI“帮我分析这块场地的开发潜力”,它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。 本章将从规则系统出发,系统介绍LLM-based Agent的架构、推理模式、多Agent协作机制,以及在设计领域的应用前景。 @@ -13,7 +13,7 @@ AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响 \subsection{规则系统时代} -最早的''智能系统''基于\textbf{规则(Rules)},即''如果满足条件A,则执行动作B''。 +最早的“智能系统”基于\textbf{规则(Rules)},即“如果满足条件A,则执行动作B”。 \textbf{典型结构:} @@ -39,7 +39,7 @@ else: \item 维护困难——规则数量膨胀后,系统变得难以理解和更新 \item - 缺乏理解——系统并不''理解''规则背后的含义,只是机械执行 + 缺乏理解——系统并不“理解”规则背后的含义,只是机械执行 \end{itemize} \subsection{传统规划方法} @@ -72,7 +72,7 @@ else: \end{longtable} } -LLM之所以能成为Agent的''大脑'',关键在于它具备了: +LLM之所以能成为Agent的“大脑”,关键在于它具备了: \begin{itemize} \tightlist @@ -123,7 +123,7 @@ LLM之所以能成为Agent的''大脑'',关键在于它具备了: - 工具反馈:查询结果、执行状态、错误信息 \end{lstlisting} -感知的关键在于\textbf{理解意图}——用户说''设计一个公园'',Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。 +感知的关键在于\textbf{理解意图}——用户说“设计一个公园”,Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。 \subsection{规划(Planning)} @@ -236,7 +236,7 @@ CoT的价值在于\textbf{让思考过程可见},这不仅提升了推理的 \subsection{ReAct(Reasoning + Acting)}\label{reactreasoning-acting} -ReAct模式将\textbf{推理与行动交替进行},形成''思考-行动-观察''的循环。 +ReAct模式将\textbf{推理与行动交替进行},形成“思考-行动-观察”的循环。 \textbf{基本循环:} @@ -392,7 +392,7 @@ Agent角色 \item \textbf{Agent团队}:多个Agent组成固定团队,各有专长 \item - \textbf{Agent市场}:Agent可以''雇佣''其他Agent完成特定子任务 + \textbf{Agent市场}:Agent可以“雇佣”其他Agent完成特定子任务 \item \textbf{Agent社会}:大量Agent在开放环境中自主交互和协作 \end{itemize} @@ -627,11 +627,11 @@ AI协作能力: \item \textbf{推理模式}:CoT和ReAct各适用于什么场景?请分别举一个设计领域的应用案例。 \item - \textbf{多Agent设计}:如果要设计一个''城市规划审批Agent系统'',你会设计哪些Agent角色?它们之间如何协作? + \textbf{多Agent设计}:如果要设计一个“城市规划审批Agent系统”,你会设计哪些Agent角色?它们之间如何协作? \item \textbf{HITL实践}:在设计流程中,哪些环节应该由AI自动完成,哪些环节必须保留人工审核?请给出你的判断依据。 \item - \textbf{MCP理解}:MCP协议如何解决设计领域AI应用的''数据孤岛''问题?以一个具体的建筑设计场景为例进行说明。 + \textbf{MCP理解}:MCP协议如何解决设计领域AI应用的“数据孤岛”问题?以一个具体的建筑设计场景为例进行说明。 \item \textbf{未来展望}:你认为AI Agent在未来10年会如何改变设计行业的就业结构?设计师应该如何准备? \end{enumerate} diff --git a/chapters/ch08-rl.tex b/chapters/ch08-rl.tex index c625d43..4101995 100644 --- a/chapters/ch08-rl.tex +++ b/chapters/ch08-rl.tex @@ -6,7 +6,7 @@ 2016年,AlphaGo击败围棋世界冠军李世石,让强化学习走入公众视野。此后,从蛋白质结构预测(AlphaFold)到大语言模型的人类对齐(RLHF),强化学习已深入AI的各个核心领域,成为现代人工智能不可或缺的基石。 -本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解''智能体如何在复杂世界中做出决策''的关键框架。 +本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解“智能体如何在复杂世界中做出决策”的关键框架。 \section{学习目标} @@ -103,7 +103,7 @@ R & 奖励函数(Reward Function) & R(s,a),在状态s采取动作a获得 \[G_t = r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + ... = \sum_{k=0}^{\infty} \gamma^k r_{t+k}\] -为了评估''处于某个状态有多好'',我们定义两种价值函数: +为了评估“处于某个状态有多好”,我们定义两种价值函数: \textbf{状态价值函数(State Value Function)V(s)}:在状态s下,遵循策略π所能获得的期望累积奖励。 @@ -113,7 +113,7 @@ R & 奖励函数(Reward Function) & R(s,a),在状态s采取动作a获得 \[Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]\] -两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下''哪个动作最好''。 +两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下“哪个动作最好”。 \section{Q-Learning}\label{q-learning} @@ -137,7 +137,7 @@ DQN的两个关键创新: \textbf{经验回放(Experience Replay)}:将智能体的经历 (s, a, r, s') 存储在回放缓冲区中,训练时随机采样小批量数据。这打破了数据之间的时间相关性,提高了训练稳定性。 -\textbf{目标网络(Target Network)}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了''追逐移动目标''的不稳定性。 +\textbf{目标网络(Target Network)}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了“追逐移动目标”的不稳定性。 \begin{lstlisting}[language=Python] # DQN核心思路伪代码 @@ -275,7 +275,7 @@ for s in range(n_states): \end{lstlisting} \begin{quote} -\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它''该怎么走'',它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。 +\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它“该怎么走”,它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。 \end{quote} @@ -373,7 +373,7 @@ Critic提供一个\textbf{基线(Baseline)},使得梯度估计的方差大 \[A(s, a) = Q(s, a) - V(s)\] -优势函数衡量的是''采取动作a比平均水平好多少''。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。 +优势函数衡量的是“采取动作a比平均水平好多少”。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。 \section{PPO:近端策略优化} @@ -463,9 +463,9 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新 AlphaGo的核心技术组合: -\textbf{策略网络(Policy Network)}:学习''下一步应该下在哪里'',输入棋盘状态,输出每个位置落子的概率分布。 +\textbf{策略网络(Policy Network)}:学习“下一步应该下在哪里”,输入棋盘状态,输出每个位置落子的概率分布。 -\textbf{价值网络(Value Network)}:学习''当前局面谁更可能赢'',输入棋盘状态,输出一个-1到1之间的胜率评估。 +\textbf{价值网络(Value Network)}:学习“当前局面谁更可能赢”,输入棋盘状态,输出一个-1到1之间的胜率评估。 \textbf{蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)}:在策略网络的指导下进行前瞻搜索,通过模拟大量对局来评估每个候选落子点的价值。 @@ -512,7 +512,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类: \end{longtable} } -AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为''错误''的棋,最终却证明是更优的选择。 +AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为“错误”的棋,最终却证明是更优的选择。 \section{AlphaFold(2020)}\label{alphafold2020} @@ -560,10 +560,10 @@ AlphaFold的意义对设计领域尤其深远: └──────────────────────────────────────────┘ \end{lstlisting} -这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过''搜索 + 深度学习 + 计算''的组合来获得突破。 +这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过“搜索 + 深度学习 + 计算”的组合来获得突破。 \begin{quote} -\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从''玩具问题''走向''真实世界问题''的趋势。设计领域正是这种真实世界问题的重要阵地。 +\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从“玩具问题”走向“真实世界问题”的趋势。设计领域正是这种真实世界问题的重要阵地。 \end{quote} @@ -588,7 +588,7 @@ AlphaFold的意义对设计领域尤其深远: \textbf{对齐(Alignment)} 的目标是让AI模型的行为符合人类的价值观和期望,使其成为安全、有用、诚实的助手。而\textbf{RLHF(Reinforcement Learning from Human Feedback)} 是目前最成功的对齐方法。 \begin{quote} -\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型''能力'',而RLHF赋予模型''方向''——让能力服务于人类的目标。 +\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型“能力”,而RLHF赋予模型“方向”——让能力服务于人类的目标。 \end{quote} \section{RLHF:从人类反馈中学习} @@ -669,7 +669,7 @@ for step in range(training_steps): RLHF需要大量人工标注,成本高昂。\textbf{RLAIF(Reinforcement Learning from AI Feedback)} 用AI替代人类标注者来提供反馈: -\textbf{Constitutional AI(宪法AI)} 由Anthropic提出,其核心思想是让AI通过一组''宪法原则''进行自我纠正: +\textbf{Constitutional AI(宪法AI)} 由Anthropic提出,其核心思想是让AI通过一组“宪法原则”进行自我纠正: \begin{lstlisting} Constitutional AI 流程: @@ -699,9 +699,9 @@ Constitutional AI 流程: \section{什么是具身智能?} -\textbf{具身智能(Embodied AI)} 是指拥有物理或虚拟''身体''的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。 +\textbf{具身智能(Embodied AI)} 是指拥有物理或虚拟“身体”的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。 -传统AI(如大语言模型)是一个''缸中之脑''——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环: +传统AI(如大语言模型)是一个“缸中之脑”——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环: \begin{lstlisting} ┌───────────────────────────────────────────┐ @@ -850,7 +850,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\ \section{设计应用} -强化学习为设计领域提供了从''被动工具''到''主动智能体''的范式转变。以下是一些具有代表性的应用场景。 +强化学习为设计领域提供了从“被动工具”到“主动智能体”的范式转变。以下是一些具有代表性的应用场景。 \section{空间布局优化} @@ -875,7 +875,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\ - 空间浪费惩罚 \end{lstlisting} -与传统优化算法相比,强化学习方法的优势在于能够学习到布局的''风格''和''策略'',而不仅是找到单一最优解。 +与传统优化算法相比,强化学习方法的优势在于能够学习到布局的“风格”和“策略”,而不仅是找到单一最优解。 \section{路径规划与导航}