fix(latex): 修复中文引号渲染,''...'' → "..."(139处)

pandoc 转换将中文双引号变为两个ASCII单引号,导致LaTeX中
左右引号均渲染为右引号。替换为Unicode中文引号以正确显示。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
2026-05-29 14:05:08 +08:00
parent 57c04644d2
commit 9fd6eccde5
11 changed files with 104 additions and 104 deletions
@@ -113,7 +113,7 @@ AutoDL & 按时计费 & 中期项目 \\
所以整个链条是:\textbf{包管理器下载编译好的二进制 → 放到 PATH 目录 → shell 通过 PATH 找到它 → execve 加载到内存 →}
\textbf{二进制内部调用 OS API 完成实际工作}。没有任何''魔法'',本质上就是文件操作和进程管理的组合。
\textbf{二进制内部调用 OS API 完成实际工作}。没有任何“魔法”,本质上就是文件操作和进程管理的组合。
\subsubsection{程序设计语言与软件开发}
@@ -175,7 +175,7 @@ RubyWeb开发(Ruby on Rails
特点:开发灵活、调试方便,但运行速度通常慢于编译型语言。
\textbf{混合模式}Java 采用''编译为字节码 → 虚拟机解释执行''的混合方式,兼顾了跨平台和性能。
\textbf{混合模式}Java 采用编译为字节码 → 虚拟机解释执行的混合方式,兼顾了跨平台和性能。
\paragraph{常见编程语言概览}
@@ -289,7 +289,7 @@ pip install torch torchvision
\subparagraph{Python概述与特点}\label{pythonux6982ux8ff0ux4e0eux7279ux70b9}
Python由Guido van Rossum于1991年发布,以''优雅''\,``简洁''\,``可读性强''为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。
Python由Guido van Rossum于1991年发布,以“优雅”\,``简洁\,``可读性强为设计哲学。它是当前AI和数据科学领域使用最广泛的编程语言。
\textbf{核心特点}: - 语法简洁,接近自然语言,入门门槛低 - 丰富的第三方库生态(AI、数据处理、Web等) - 跨平台运行(Windows、macOS、Linux - 活跃的开源社区支持
@@ -10,7 +10,7 @@
Vibe Coding\textbf{模糊想法 → AI辅助 → 迭代完善}
Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达''想要什么''
Vibe Coding是一种以AI为核心的编程新模式:开发者用自然语言描述意图,AI生成代码,再通过迭代对话逐步完善。对于编程经验较少的设计专业读者而言,这种模式大幅降低了技术门槛------不需要记住语法细节,只需要清楚地表达想要什么
\paragraph{工作流程}
@@ -138,7 +138,7 @@ Claude Code提供VSCode扩展,在编辑器中获得同样的AI辅助能力:
在编辑器中选中代码后,可以直接向Claude提问或请求修改
\end{enumerate}
\textbf{常用场景} - 选中一段代码,请求''解释这段代码'' - 选中函数,请求''添加错误处理'' - 在Claude面板中输入''帮我写单元测试''
\textbf{常用场景} - 选中一段代码,请求解释这段代码 - 选中函数,请求添加错误处理 - 在Claude面板中输入帮我写单元测试
\paragraph{典型项目工作流}
@@ -361,7 +361,7 @@ c & d
\textbf{核心特性} - \textbf{本地存储}:所有笔记以Markdown文件保存在本地,数据完全自主 - \textbf{双向链接}:用 {[}{[}笔记名{]}{]} 在笔记之间建立链接,形成知识网络 - \textbf{图谱视图}:可视化笔记之间的关联关系 - \textbf{插件生态}:丰富的社区插件扩展功能(如日历、看板、模板等) - \textbf{实时预览}:编辑Markdown时实时渲染效果
\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装''目录''插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来
\textbf{使用建议}: - 用Obsidian打开本教材的根目录,即可获得完整的阅读与编辑体验 - 建议安装“目录”插件,方便在长文档中快速导航 - 利用双向链接功能,将学习笔记与教材内容关联起来
\subsubsection{Git版本管理与GitHub协作}\label{gitux7248ux672cux7ba1ux7406ux4e0egithubux534fux4f5c}
+1 -1
View File
@@ -35,7 +35,7 @@
AI技术仍在飞速发展,本书的内容不可避免地会随着时间推移而需要更新。但书中所传达的核心思想——理解原理、拥抱工具、人机协作——将具有持久的价值。
感谢AI技术本身——本书的写作过程中广泛使用了Claude、ChatGPT等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。
感谢AI技术本身——本书的写作过程中广泛使用了Claude Code等AI工具进行资料整理、内容润色和代码验证,这本身就是"AI赋能工作"的一次实践。
设计的人工智能时代才刚刚开始。希望这本书能成为读者进入这个新时代的一块踏脚石,从而汇聚起万千努力,能够成为点燃"通用设计智能"的星星之火。
+6 -6
View File
@@ -47,7 +47,7 @@
\subsection{案例背景}
Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现''拿了就走''的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。
Amazon Go 是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现拿了就走的购物体验。这一案例展示了多种 AI 技术如何协同工作,共同重构一个完整的线下场景。
\subsection{技术要素}
@@ -70,7 +70,7 @@ Amazon Go 的 AI 技术栈融合了多项前沿技术:
\subsection{启示}
Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''拿了就走'',AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。
Amazon Go 展示了 AI 技术如何重构传统场景。从扫码支付”到“拿了就走,AI 让交互变得更加自然。这个案例也说明,设计领域中许多看似复杂的环境感知与交互问题,都可以通过多技术的组合来加以解决。
\section{AI 发展时间线(2016--2024}
@@ -128,7 +128,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''
音频生成:音乐、配音、音效
\end{itemize}
\textbf{设计影响}:从''工具辅助''到''生成伙伴''
\textbf{设计影响}:从工具辅助”到“生成伙伴
\subsection{Agent(智能体)}
@@ -148,7 +148,7 @@ Amazon Go 展示了 AI 技术如何重构传统场景。从''扫码支付''到''
\textbf{工具(Tool Use}:调用外部资源
\end{itemize}
\textbf{设计影响}:从''被动执行''到''主动协作''
\textbf{设计影响}:从被动执行”到“主动协作
\subsection{AI4SAI for Science}\label{ai4sai-for-science}
@@ -497,9 +497,9 @@ y = a₁x₁ + a₂x₂ + b & 多输入神经元 \\
\def\labelenumi{\arabic{enumi}.}
\tightlist
\item
万能逼近定理告诉我们神经网络''能''做任何事,但没有说''如何''高效学习。这个区别意味着什么?
万能逼近定理告诉我们神经网络“能”做任何事,但没有说“如何”高效学习。这个区别意味着什么?
\item
Scaling Law 是否意味着''越大越好''?在资源有限的情况下,应该如何权衡?
Scaling Law 是否意味着越大越好?在资源有限的情况下,应该如何权衡?
\item
从函数式视角理解 AI,对你理解设计问题有何启发?
\end{enumerate}
+15 -15
View File
@@ -1,6 +1,6 @@
\chapter{设计人工智能的理论框架}
本章建立全书的核心理论框架。我们从''函数描述世界''的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。
本章建立全书的核心理论框架。我们从函数描述世界的理念出发,引入数据模态(Data Modality)作为理解AI技术的组织原则,梳理从小模型到大模型的统一演进规律,并以多层感知机(MLP)作为一切深度学习的基础模型进行系统讲解。
\section{篇章导读}
@@ -8,7 +8,7 @@
无论是处理文本、图像还是三维空间数据,AI的本质工作都是一样的——从数据中学习映射函数 \(y = f(x; \theta)\)。区别仅在于输入数据的形态不同,因此需要不同的网络结构来高效处理。
本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立''环境-智能体-任务''实践框架,降低上手门槛
本章将: - 从函数式视角理解AI的本质 - 建立基于数据模态的全书知识地图 - 揭示所有AI技术背后的统一演进规律 - 深入讲解MLP这一最基础的神经网络 - 建立环境-智能体-任务实践框架,降低上手门槛
\section{函数式AI视角}
@@ -18,7 +18,7 @@
\begin{itemize}
\tightlist
\item
理解''Functions Describe the World''的核心理念
理解Functions Describe the World的核心理念
\item
掌握从Excel线性回归到神经网络的演进逻辑
\item
@@ -126,7 +126,7 @@ plt.grid(True, alpha=0.3)
plt.show()
\end{lstlisting}
这段代码展示了一个完整的''从数据中学习函数''的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}
这段代码展示了一个完整的从数据中学习函数的过程。虽然这只是最简单的线性回归,但它已经包含了AI的核心思想:\textbf{给定数据,自动确定函数参数}
\subsection{数据驱动 vs 规则驱动}
@@ -159,7 +159,7 @@ result = model.predict(new_image) # 自动判断
优势: - 自动发现人类难以表达的规律 - 数据越多,性能越好 - 可以处理复杂的、非线性的关系 - 适应性强,可迁移到新任务
\begin{quote}
\textbf{设计思维的转变}:从''设计规则''到''设计数据''。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。
\textbf{设计思维的转变}:从设计规则”到“设计数据。在AI时代,设计师不仅要设计规则(设计语言、规范),还要设计和管理训练数据,因为数据决定了AI学到的函数。
\end{quote}
@@ -319,7 +319,7 @@ AI同样需要针对不同模态的数据采用不同的处理方式。一种数
\textbf{第四阶段:大模型时代(Foundation Models}
参数规模达到十亿甚至万亿级别的模型,展现出''涌现能力''Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。
参数规模达到十亿甚至万亿级别的模型,展现出涌现能力Emergent Abilities)——模型规模大到一定程度后,突然具备了小模型没有的新能力。
特点: - 单一模型处理多种任务(通用性) - 涌现能力:规模带来质变 - 少样本甚至零样本学习 - Scaling Law:性能随规模持续提升
@@ -412,7 +412,7 @@ FPFH → PointNet → Point-BERT → Point-E
\item
\textbf{预训练时代是设计师的最佳入口}。利用预训练模型,设计师不需要海量数据和强大算力,就能将AI应用到设计实践中。
\item
\textbf{大模型时代带来''民主化''}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。
\textbf{大模型时代带来民主化}。大模型通过自然语言交互降低了AI的使用门槛,设计师可以用自然语言指挥AI完成设计任务。
\end{enumerate}
@@ -589,7 +589,7 @@ print(f"最终输出: {y.flatten()}")
\subsection{激活函数}
激活函数(Activation Function)是神经网络的''灵魂''。没有激活函数,无论网络有多少层,都等价于一个单层线性变换:
激活函数(Activation Function)是神经网络的“灵魂”。没有激活函数,无论网络有多少层,都等价于一个单层线性变换:
\[y = W_2(W_1x) = (W_2W_1)x = W'x\]
@@ -624,7 +624,7 @@ Sigmoid & \(\sigma(z) = \frac{1}{1+e^{-z}}\) & (0, 1) & 输出可解释为概率
ReLU & \(\text{ReLU}(z) = \max(0, z)\) & {[}0, +∞) & 计算简单高效;缓解梯度消失 & \textbf{隐藏层首选} \\
Tanh & \(\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}\) & (-1, 1) & 零中心化;两端梯度消失 & 循环网络隐藏层 \\
Softmax & \(\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_j e^{z_j}}\) & (0, 1),和为1 & 输出为概率分布 & 多分类输出层 \\
LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU''死神经元''问题 & 深层网络隐藏层 \\
LeakyReLU & \(\text{LeakyReLU}(z) = \max(\alpha z, z)\) & (-∞, +∞) & 解决ReLU死神经元问题 & 深层网络隐藏层 \\
\end{longtable}
}
@@ -646,12 +646,12 @@ ReLU: Sigmoid: Tanh:
\end{lstlisting}
\begin{quote}
\textbf{设计类比}:激活函数就像是设计中的''非线性思维''。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了''跳跃''和''拐弯''的能力,让网络能够表达复杂的设计关系。
\textbf{设计类比}:激活函数就像是设计中的非线性思维。如果只有线性思维(没有激活函数),无论思考多少层,结论都是线性的——就像在一条直线上来回走。激活函数引入了“跳跃”和“拐弯”的能力,让网络能够表达复杂的设计关系。
\end{quote}
\subsection{损失函数}
损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的''指南针''
损失函数(Loss Function)衡量模型预测值与真实值之间的差距,是训练过程的指南针
\textbf{常用损失函数}
@@ -695,7 +695,7 @@ ReLU: Sigmoid: Tanh:
\subsection{反向传播与梯度下降}
反向传播(Backpropagation)是训练神经网络的核心算法,它解决了''如何高效计算每个参数对损失的影响程度''这一问题。
反向传播(Backpropagation)是训练神经网络的核心算法,它解决了如何高效计算每个参数对损失的影响程度这一问题。
\textbf{核心思想:梯度下降}
@@ -832,7 +832,7 @@ print(f"真实参数: W = [2.0, 3.0], b = [1.0]")
\begin{itemize}
\tightlist
\item
理解''环境-智能体-任务''三元框架
理解环境-智能体-任务三元框架
\item
认识环境配置是AI实践中的关键瓶颈
\item
@@ -927,7 +927,7 @@ GPU/CUDA配置 & 驱动版本与CUDA版本不匹配 & ★★★★★ \\
}
\begin{quote}
\textbf{核心观点}:环境问题不是''技术能力不足''的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。
\textbf{核心观点}:环境问题不是技术能力不足的问题,而是\textbf{基础设施鸿沟}。正如设计师不需要理解CAD软件的底层渲染引擎才能画图,学习AI也不应该被环境配置阻挡在门外。
\end{quote}
\subsection{降低门槛的实践策略}
@@ -1049,7 +1049,7 @@ d2l.ai(动手学深度学习) & 代码驱动,PyTorch/MXNet/TensorFlow多
\endhead
\bottomrule\noalign{}
\endlastfoot
Hugging Face & 模型和数据集的''GitHub'',可在线体验 \\
Hugging Face & 模型和数据集的GitHub,可在线体验 \\
Civitai & Stable Diffusion模型分享社区 \\
Papers With Code & 论文+代码+排行榜,追踪最新技术 \\
\end{longtable}
+14 -14
View File
@@ -4,7 +4,7 @@
一维数据(1D Data)是人工智能处理的最基础、也是最重要的数据形态。你正在阅读的文字、你说出的一句话、股票市场的价格走势、建筑室内温度随时间的变化——这些都是一维序列数据。
与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了''和''饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。
与图像(二维)和三维模型(三维)不同,一维数据的核心特征是\textbf{有序性}:每一个元素的含义不仅取决于它本身,还取决于它在序列中的位置以及与前后元素的关系。``我吃饭了“和”饭我吃了''虽然包含相同的字,但含义截然不同——这就是序列的魅力与挑战。
本章将带你踏上一段激动人心的技术演进之旅:从早期的小型循环神经网络(RNN),到注意力机制的革命性突破,再到 Transformer 架构的横空出世,最终见证大语言模型(LLM)如何改变整个 AI 格局。这条从小模型到大模型的技术脉络,不仅是深度学习最精彩的故事之一,也直接关系到今天每一位设计师如何使用 AI 工具。
@@ -75,14 +75,14 @@
"光线 充足" → 设计优点
\end{lstlisting}
模型需要''记住''之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。
模型需要“记住”之前看到的内容,才能理解当前内容。这正是\textbf{循环神经网络}要解决的核心问题。
\section{RNN:循环神经网络}
\subsection{核心思想}
RNNRecurrent Neural Network)通过\textbf{隐藏状态}Hidden State)在时间步之间传递信息,实现''记忆''功能。
RNNRecurrent Neural Network)通过\textbf{隐藏状态}Hidden State)在时间步之间传递信息,实现“记忆”功能。
\begin{lstlisting}
时间展开视图:
@@ -128,7 +128,7 @@ RNNRecurrent Neural Network)通过\textbf{隐藏状态}Hidden State
时间步7:看到"空间感" → h₇ = "完整理解:客厅用开放式布局来增加空间感"
\end{lstlisting}
每一步,RNN 都在累积和更新对文本的理解。这就是''记忆''的力量。
每一步,RNN 都在累积和更新对文本的理解。这就是“记忆”的力量。
\subsection{PyTorch 代码示例}
@@ -189,14 +189,14 @@ RNN 需要通过反向传播跨越多个时间步来更新参数。当序列较
RNN 处理长序列时遇到同样的问题!
\end{lstlisting}
在实际应用中,标准 RNN 通常只能''记住''5-10步之前的信息。对于''这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高''这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。
在实际应用中,标准 RNN 通常只能“记住”5-10步之前的信息。对于这个设计方案虽然外观简洁大方,功能分区合理,但是整体造价偏高这样跨越多个分句的评价,RNN 可能会遗忘前半部分的内容。
\section{LSTM:长短期记忆网络}
\subsection{设计哲学}
LSTMLong Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的''信息高速公路'',让信息可以长距离传递而不被稀释。
LSTMLong Short-Term Memory)由 Hochreiter 和 Schmidhuber 于1997年提出,核心创新是引入\textbf{细胞状态}(Cell State)——一条贯穿整个序列的信息高速公路,让信息可以长距离传递而不被稀释。
\begin{lstlisting}
LSTM 单元内部结构:
@@ -220,7 +220,7 @@ LSTM 单元内部结构:
\subsection{三道门:遗忘、输入、输出}
LSTM 通过三个''门''Gate)来精确控制信息的流动:
LSTM 通过三个“门”Gate)来精确控制信息的流动:
\textbf{1. 遗忘门(Forget Gate}:决定从细胞状态中丢弃什么信息
@@ -428,7 +428,7 @@ RNN 的局限 & 具体影响 \\
\subsection{核心思想}
自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置''交流'',一步到位地获取全局信息。
自注意力让序列中的每个位置都能\textbf{直接}与所有其他位置“交流”,一步到位地获取全局信息。
\begin{lstlisting}
传统 RNN(串行传递信息):
@@ -553,7 +553,7 @@ print(f"输出形状: {output.shape}") # (1, 4, 64)
\subsection{为什么需要多头?}
单个注意力头只能学习一种''关注模式''。现实中的语言理解需要同时关注多种关系:
单个注意力头只能学习一种关注模式。现实中的语言理解需要同时关注多种关系:
\begin{lstlisting}
句子:"设计师用木质材料打造了温馨的北欧风格客厅"
@@ -619,7 +619,7 @@ class MultiHeadAttention(nn.Module):
\subsection{为什么需要位置信息?}
Self-Attention 本身是''位置无关''的——它把输入看作一个集合(Set),而不是序列(Sequence):
Self-Attention 本身是位置无关的——它把输入看作一个集合(Set),而不是序列(Sequence):
\begin{lstlisting}
输入 A"客厅 在 北面"
@@ -833,9 +833,9 @@ class FeedForward(nn.Module):
输出 → 传递给下一层或最终线性层
\end{lstlisting}
\subsection{Masked Self-Attention:为什么要''掩码''}
\subsection{Masked Self-Attention:为什么要“掩码”}
在生成文本时,模型不能''偷看''未来的词:
在生成文本时,模型不能“偷看”未来的词:
\begin{lstlisting}
生成 "现代 简约 风格 客厅"
@@ -1191,7 +1191,7 @@ Transformer 论文发表后的几年里,研究者们发现了一个关键规
\section{RAG:检索增强生成}
\subsection{问题:大模型的''幻觉''}
\subsection{问题:大模型的“幻觉”}
LLM 会自信地编造不存在的事实:
@@ -1338,7 +1338,7 @@ answer = llm.generate(augmented_prompt)
\subsection{核心原则}
Prompt Engineering 是与大语言模型有效沟通的''艺术与科学''
Prompt Engineering 是与大语言模型有效沟通的艺术与科学
\begin{lstlisting}
原则一:明确任务
+16 -16
View File
@@ -6,7 +6,7 @@
人类感知世界,约80\%的信息来自视觉。对于设计师而言,图像不仅是设计成果的呈现形式,更是灵感来源、分析对象和沟通媒介。
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从''识别图片中的猫''一步步发展到''理解任意场景中的任意内容'',以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从识别图片中的猫一步步发展到理解任意场景中的任意内容,以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
通过本章学习,你将:
@@ -75,7 +75,7 @@ CNN通过三个关键设计解决了MLP的上述缺陷:
\end{longtable}
}
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种''从局部到整体''的视觉处理方式。
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种从局部到整体的视觉处理方式。
\subsection{卷积操作}
@@ -242,7 +242,7 @@ LeNet (1998) AlexNet (2012) VGG (2014) ResNet (2015)
\endlastfoot
LeNet-5 & 1998 & 5层 & 首个成功的CNN & 手写数字识别,邮局实用 \\
AlexNet & 2012 & 8层 & ReLU、Dropout、GPU训练 & ImageNet竞赛冠军,深度学习复兴 \\
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明''更深=更好''的简洁设计 \\
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明更深=更好的简洁设计 \\
ResNet & 2015 & 152层+ & 残差连接(Skip Connection & 突破深度瓶颈,可训练极深网络 \\
\end{longtable}
}
@@ -293,7 +293,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\end{itemize}
\begin{quote}
\textbf{设计思维链接}:残差连接的思想类似于设计中的''增量修改''——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种''在已有基础上做调整''的策略,在参数空间中比''从零开始学习''高效得多。
\textbf{设计思维链接}:残差连接的思想类似于设计中的增量修改——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种在已有基础上做调整的策略,在参数空间中比从零开始学习高效得多。
\end{quote}
@@ -301,7 +301,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\subsection{从分类到检测}
图像分类回答的问题是''这是什么'',而目标检测需要同时回答两个问题:
图像分类回答的问题是这是什么,而目标检测需要同时回答两个问题:
\begin{lstlisting}
分类: "这是一张建筑的照片" → what
@@ -332,7 +332,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\subsection{两阶段检测器}
两阶段方法的思路是''先找候选区域,再分类判别'',精度高但速度较慢。
两阶段方法的思路是先找候选区域,再分类判别,精度高但速度较慢。
\textbf{演进路线}
@@ -586,7 +586,7 @@ DeepLab由Google团队提出,其核心创新是\textbf{空洞卷积(Atrous C
2020年,Google团队提出了 \textbf{ViTVision Transformer},首次证明纯Transformer架构可以在图像任务上达到甚至超越CNN的性能,开启了视觉领域的Transformer时代。
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个''词''Token),然后送入标准Transformer编码器处理。
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个“词”Token),然后送入标准Transformer编码器处理。
\begin{lstlisting}
输入图像 (224×224×3) 切分为图块 线性嵌入
@@ -744,7 +744,7 @@ Swin Transformer的设计使其兼具CNN的层级特征提取优势和Transforme
└─────────┘ └──────────┘
\end{lstlisting}
CLIP的训练目标:对于N个''图像-文本''配对,最大化正确配对的相似度,最小化错误配对的相似度。
CLIP的训练目标:对于N个图像-文本配对,最大化正确配对的相似度,最小化错误配对的相似度。
\textbf{零样本分类}
@@ -764,7 +764,7 @@ CLIP的意义在于:\textbf{用自然语言定义视觉概念},打破了传
\subsection{SAM:分割一切}
\textbf{SAMSegment Anything Model, Meta, 2023}是一个''可提示''的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
\textbf{SAMSegment Anything Model, Meta, 2023}是一个可提示的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
\begin{lstlisting}
SAM 的三种提示方式
@@ -796,7 +796,7 @@ SAM 的三种提示方式
\textbf{海量数据集}:SA-1B数据集包含10亿级自动标注的分割掩码
\end{itemize}
SAM的设计理念是成为视觉领域的''基础模型''——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
SAM的设计理念是成为视觉领域的基础模型——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
\subsection{DINOv2:自监督视觉特征}
@@ -834,7 +834,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
\subsection{视觉-语言模型}
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅''看图说话'',而是真正理解图像内容并可以回答关于图像的复杂问题。
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅看图说话,而是真正理解图像内容并可以回答关于图像的复杂问题。
\textbf{典型任务与模型}
@@ -949,7 +949,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
\item
\textbf{智能标签}:自动为设计素材添加语义标签,无需人工标注
\item
\textbf{自然语言检索}:用文字描述查找设计参考图(如''带玻璃幕墙的现代商业建筑''
\textbf{自然语言检索}:用文字描述查找设计参考图(如带玻璃幕墙的现代商业建筑
\item
\textbf{风格分类}:自动识别设计作品的风格特征
\item
@@ -971,7 +971,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
后现代/...) 未知风格) 的设计案例)
\end{lstlisting}
结合CLIP的零样本能力,设计师可以自定义风格类别(如''新中式''\,``极简主义''``有机建筑''等),无需收集训练数据即可进行风格分类。
结合CLIP的零样本能力,设计师可以自定义风格类别(如新中式\,``极简主义``有机建筑等),无需收集训练数据即可进行风格分类。
\section{本章小结}
@@ -1004,9 +1004,9 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
\item
\textbf{架构对比}:CNN通过局部卷积提取特征,ViT通过全局自注意力建立关系。在设计场景中(如建筑立面分析、街景品质评估),你认为哪种架构更适合?为什么?
\item
\textbf{零样本能力}CLIP实现了''用自然语言做图像分类''的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的''宜居性'',你会如何设计提示文本?考虑需要哪些视觉线索。
\textbf{零样本能力}CLIP实现了用自然语言做图像分类的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的宜居性,你会如何设计提示文本?考虑需要哪些视觉线索。
\item
\textbf{大模型与传统方法}SAM号称可以''分割一切''。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
\textbf{大模型与传统方法}SAM号称可以分割一切。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
\end{enumerate}
@@ -1032,7 +1032,7 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
卷积神经网络 & Convolutional Neural Network (CNN) & 利用卷积操作提取局部特征的神经网络 \\
卷积核/滤波器 & Kernel / Filter & 卷积操作中用于特征提取的小矩阵 \\
池化 & Pooling & 降低特征图空间尺寸的下采样操作 \\
感受野 & Receptive Field & 神经元能''看到''的输入区域大小 \\
感受野 & Receptive Field & 神经元能“看到”的输入区域大小 \\
残差连接 & Residual/Skip Connection & 将输入直接加到输出上,解决深层网络退化问题 \\
目标检测 & Object Detection & 同时识别图像中目标的类别和位置 \\
边界框 & Bounding Box & 用矩形框标出目标位置的表示方法 \\
@@ -2,9 +2,9 @@
\section{篇章导读}
三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入''现代化办公椅''的文本描述,AI便能生成一个可编辑的3D模型。
三维数据是AI与物理世界之间最直接的桥梁。从建筑到城市规划,从景观到工业设计,空间理解始终是设计实践的核心能力。一架无人机飞过城市上空,激光雷达 (LiDAR) 每秒发射数十万束激光,返回的每一个点都在描述一个真实的空间坐标——这些点汇聚成点云,构成数字世界的三维基础。一个设计师用手机扫描房间,几秒钟后便得到完整的三维模型;一位规划师输入现代化办公椅的文本描述,AI便能生成一个可编辑的3D模型。
这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何''看见''和''重建''空间,并探索空间智能在设计领域的广阔应用。
这些场景不再是科幻。从传统的多视图立体匹配 (MVS) 到神经辐射场 (NeRF),从三维高斯溅射 (3D Gaussian Splatting) 到大规模空间智能模型,三维AI正在经历从小模型到大模型、从感知到推理的范式跃迁。本章将带你走进三维数据的世界,理解AI如何“看见”和“重建”空间,并探索空间智能在设计领域的广阔应用。
\section{三维数据表示}
@@ -131,7 +131,7 @@
\item
内存消耗与分辨率的立方成正比
\item
分辨率有限时存在''方块效应''
分辨率有限时存在方块效应
\item
适合3D卷积神经网络处理
\end{itemize}
@@ -703,7 +703,7 @@ MVS稠密匹配
\subsubsection{核心思想}
不再显式存储3D模型(点云/网格),而是用一个神经网络来''记住''整个三维场景:
不再显式存储3D模型(点云/网格),而是用一个神经网络来“记住”整个三维场景:
\begin{lstlisting}
传统: 场景 → 存储为点云/网格/体素
@@ -859,7 +859,7 @@ NeRF的隐式表示虽然质量高,但速度慢、难以编辑。3D Gaussian S
\subsection{3D生成模型}
从2023年开始,AI不仅能''重建''已有场景,还能从零''生成''新的3D内容。
从2023年开始,AI不仅能“重建”已有场景,还能从零“生成”新的3D内容。
\subsubsection{Text-to-3D (文本生成3D)}
@@ -1070,7 +1070,7 @@ print(f"颜色形状: {color.shape}, 密度形状: {density.shape}")
\subsection{从3D感知到空间推理}
前两节我们学习了AI如何''感知''和''重建''三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。
前两节我们学习了AI如何“感知”和“重建”三维世界。空间智能 (Spatial Intelligence) 则更进一步——不仅要感知空间,还要理解和推理空间中的关系、规律与语义。
\begin{lstlisting}
3D能力层次:
@@ -1308,7 +1308,7 @@ AI增强GIS:
\item
数字孪生的四个层次在设计实践中分别对应哪些具体工具和方法?
\item
设想一个''认知孪生''校园,它能做哪些事情?需要哪些技术支撑?
设想一个认知孪生校园,它能做哪些事情?需要哪些技术支撑?
\end{enumerate}
\subsection{关键术语}
@@ -1682,7 +1682,7 @@ print("城市模型已保存为 city_model.obj")
\item
\textbf{技术路线对比}NeRF和3D Gaussian Splatting分别代表了隐式和显式的场景表示路线。请从设计应用的角度分析:哪些设计场景更适合NeRF,哪些更适合3DGS?未来两者会融合还是分化?
\item
\textbf{空间智能畅想}:设想你正在设计一个''AI空间设计师助手'',它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。
\textbf{空间智能畅想}:设想你正在设计一个AI空间设计师助手,它能理解建筑平面图、3D模型和自然语言描述。请描述这个系统的核心功能模块,以及每个模块需要用到本章学到的哪些技术。
\end{enumerate}
\section{关键术语}
+11 -11
View File
@@ -2,7 +2,7 @@
\section{篇章导读}
生成式AIGenerative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的''创意伙伴''Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从''分析''到''创造''的转变,正是生成式AI最激动人心的地方。
生成式AIGenerative AI)正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI不再仅仅是分析和识别的工具,而是成为人类的创意伙伴Creative Partner)。设计师可以用文字描述一个想法,AI便能将其转化为可视化的图像;建筑师可以勾勒一个草图,AI便能渲染出逼真的效果图。这种从“分析”到“创造”的转变,正是生成式AI最激动人心的地方。
本章将从生成模型的基本原理出发,系统介绍从自编码器(AE)、对抗生成网络(GAN)到扩散模型(Diffusion Model)的技术演进,并深入探讨AIGC工具链在设计领域的实际应用。
@@ -19,7 +19,7 @@
输入 → 编码器 (Encoder) → 潜在表示 (Latent) → 解码器 (Decoder) → 重构输出
\end{lstlisting}
自编码器的工作方式可以理解为''先压缩,再还原'':编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
自编码器的工作方式可以理解为先压缩,再还原:编码器将输入数据压缩到一个低维的潜在空间(Latent Space),解码器再从潜在表示中还原出原始数据。通过训练使还原输出尽可能接近原始输入,模型便学会了数据的关键特征。
\textbf{局限性:}
@@ -76,7 +76,7 @@ VAE的关键在于将潜在空间约束为\textbf{标准正态分布}。这意
}
\begin{quote}
\textbf{设计类比}VAE就像一位理解了''风格空间''的画师——他不仅会临摹,还能在''风格空间''中探索,画出从未见过但风格一致的新作品。
\textbf{设计类比}VAE就像一位理解了风格空间的画师——他不仅会临摹,还能在风格空间中探索,画出从未见过但风格一致的新作品。
\end{quote}
@@ -104,7 +104,7 @@ GAN的训练过程可以类比为\textbf{伪造者与鉴定师}的博弈:
\item
\textbf{鉴定师}(判别器)不断提升辨别能力,区分真画和假画
\item
随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的''杰作''
随着对抗的持续,伪造者的技术越来越高超,最终能制造出连鉴定师都无法分辨的“杰作”
\end{itemize}
\textbf{训练过程:}
@@ -174,7 +174,7 @@ CycleGAN解决了一个重要的实际问题:\textbf{无需成对训练数据}
CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景转夜晚、夏季景观转冬季等。
\begin{quote}
\textbf{设计思考}GAN系列模型展示了''对抗''这一全新的训练范式——不是告诉模型''正确答案是什么'',而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
\textbf{设计思考}GAN系列模型展示了“对抗”这一全新的训练范式——不是告诉模型正确答案是什么,而是让两个模型在竞争中共同进化。这种思想在设计领域同样适用:方案生成与方案评审的对抗,可以推动设计质量的提升。
\end{quote}
@@ -220,7 +220,7 @@ x₀ ≈ 原始图像
损失函数:L = ||ε - ε_θ(x_t, t)||²
\end{lstlisting}
模型不需要学习''好图像长什么样'',而是学习''噪声长什么样''——这是一个更容易学习的目标。
模型不需要学习好图像长什么样,而是学习噪声长什么样——这是一个更容易学习的目标。
\subsection{Stable Diffusion架构}
@@ -311,15 +311,15 @@ CLIP & 文图对齐 & 确保生成的图像与文本描述语义一致 \\
\item
\textbf{主体描述}:画面核心内容
\item
\textbf{风格指定}:如''水彩画''\,``赛博朋克''``极简主义''
\textbf{风格指定}:如水彩画\,``赛博朋克``极简主义
\item
\textbf{质量修饰}:如''高清''\,``细节丰富''``4K''
\textbf{质量修饰}:如“高清”\,``细节丰富``4K
\item
\textbf{光照氛围}:如''黄金时段光线''\,``柔和阴影''
\textbf{光照氛围}:如黄金时段光线\,``柔和阴影''
\end{itemize}
\begin{quote}
\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是''设计任务书''CLIP编码器理解需求,U-Net是''设计师的大脑'',而VAE解码器将脑海中的概念转化为可见的图纸。
\textbf{设计类比}:文生图过程就像一位设计师根据客户的文字需求进行创作。提示词是设计任务书CLIP编码器理解需求,U-Net是设计师的大脑,而VAE解码器将脑海中的概念转化为可见的图纸。
\end{quote}
@@ -404,7 +404,7 @@ Canny边缘 & Canny Edge & 检测图像轮廓 & 草图控制、线稿渲染 \\
基础模型 + LoRA_A + LoRA_B = 混合风格生成
\end{lstlisting}
设计师可以针对特定设计风格训练专属LoRA,如''新中式风格''\,``日式极简风格''等,实现个性化的AI生成。
设计师可以针对特定设计风格训练专属LoRA,如新中式风格\,``日式极简风格''等,实现个性化的AI生成。
\subsection{ComfyUI:模块化工作流}
+10 -10
View File
@@ -2,9 +2,9 @@
\section{篇章导读}
AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响应''到''主动行动'',从''单一能力''到''系统协同''。如果说前几章介绍的AI模型是''工具'',那么AI Agent就是能\textbf{自主使用工具的助手}
AI Agent(智能体)代表了人工智能的下一个前沿:从被动响应”到“主动行动”,从“单一能力”到“系统协同。如果说前几章介绍的AI模型是“工具”,那么AI Agent就是能\textbf{自主使用工具的助手}
想象这样一幅场景:你告诉AI''帮我分析这块场地的开发潜力'',它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。
想象这样一幅场景:你告诉AI帮我分析这块场地的开发潜力,它不再只是被动地等待你一步步指令,而是主动调用地图工具获取地块信息、查询规划数据库核对用地性质、分析日照和交通数据、最终生成一份完整的场地分析报告。这就是AI Agent——一个能感知环境、制定计划、调用工具并持续改进的智能系统。
本章将从规则系统出发,系统介绍LLM-based Agent的架构、推理模式、多Agent协作机制,以及在设计领域的应用前景。
@@ -13,7 +13,7 @@ AI Agent(智能体)代表了人工智能的下一个前沿:从''被动响
\subsection{规则系统时代}
最早的''智能系统''基于\textbf{规则(Rules},即''如果满足条件A,则执行动作B''
最早的智能系统基于\textbf{规则(Rules},即如果满足条件A,则执行动作B
\textbf{典型结构:}
@@ -39,7 +39,7 @@ else:
\item
维护困难——规则数量膨胀后,系统变得难以理解和更新
\item
缺乏理解——系统并不''理解''规则背后的含义,只是机械执行
缺乏理解——系统并不“理解”规则背后的含义,只是机械执行
\end{itemize}
\subsection{传统规划方法}
@@ -72,7 +72,7 @@ else:
\end{longtable}
}
LLM之所以能成为Agent的''大脑'',关键在于它具备了:
LLM之所以能成为Agent的“大脑”,关键在于它具备了:
\begin{itemize}
\tightlist
@@ -123,7 +123,7 @@ LLM之所以能成为Agent的''大脑'',关键在于它具备了:
- 工具反馈:查询结果、执行状态、错误信息
\end{lstlisting}
感知的关键在于\textbf{理解意图}——用户说''设计一个公园'',Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。
感知的关键在于\textbf{理解意图}——用户说设计一个公园,Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。
\subsection{规划(Planning}
@@ -236,7 +236,7 @@ CoT的价值在于\textbf{让思考过程可见},这不仅提升了推理的
\subsection{ReActReasoning + Acting}\label{reactreasoning-acting}
ReAct模式将\textbf{推理与行动交替进行},形成''思考-行动-观察''的循环。
ReAct模式将\textbf{推理与行动交替进行},形成思考-行动-观察的循环。
\textbf{基本循环:}
@@ -392,7 +392,7 @@ Agent角色
\item
\textbf{Agent团队}:多个Agent组成固定团队,各有专长
\item
\textbf{Agent市场}Agent可以''雇佣''其他Agent完成特定子任务
\textbf{Agent市场}Agent可以“雇佣”其他Agent完成特定子任务
\item
\textbf{Agent社会}:大量Agent在开放环境中自主交互和协作
\end{itemize}
@@ -627,11 +627,11 @@ AI协作能力:
\item
\textbf{推理模式}:CoT和ReAct各适用于什么场景?请分别举一个设计领域的应用案例。
\item
\textbf{多Agent设计}:如果要设计一个''城市规划审批Agent系统'',你会设计哪些Agent角色?它们之间如何协作?
\textbf{多Agent设计}:如果要设计一个城市规划审批Agent系统,你会设计哪些Agent角色?它们之间如何协作?
\item
\textbf{HITL实践}:在设计流程中,哪些环节应该由AI自动完成,哪些环节必须保留人工审核?请给出你的判断依据。
\item
\textbf{MCP理解}MCP协议如何解决设计领域AI应用的''数据孤岛''问题?以一个具体的建筑设计场景为例进行说明。
\textbf{MCP理解}MCP协议如何解决设计领域AI应用的数据孤岛问题?以一个具体的建筑设计场景为例进行说明。
\item
\textbf{未来展望}:你认为AI Agent在未来10年会如何改变设计行业的就业结构?设计师应该如何准备?
\end{enumerate}
+17 -17
View File
@@ -6,7 +6,7 @@
2016年,AlphaGo击败围棋世界冠军李世石,让强化学习走入公众视野。此后,从蛋白质结构预测(AlphaFold)到大语言模型的人类对齐(RLHF),强化学习已深入AI的各个核心领域,成为现代人工智能不可或缺的基石。
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解''智能体如何在复杂世界中做出决策''的关键框架。
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解智能体如何在复杂世界中做出决策的关键框架。
\section{学习目标}
@@ -103,7 +103,7 @@ R & 奖励函数(Reward Function & R(s,a),在状态s采取动作a获得
\[G_t = r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + ... = \sum_{k=0}^{\infty} \gamma^k r_{t+k}\]
为了评估''处于某个状态有多好'',我们定义两种价值函数:
为了评估处于某个状态有多好,我们定义两种价值函数:
\textbf{状态价值函数(State Value FunctionV(s)}:在状态s下,遵循策略π所能获得的期望累积奖励。
@@ -113,7 +113,7 @@ R & 奖励函数(Reward Function & R(s,a),在状态s采取动作a获得
\[Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]\]
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下''哪个动作最好''
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下哪个动作最好
\section{Q-Learning}\label{q-learning}
@@ -137,7 +137,7 @@ DQN的两个关键创新:
\textbf{经验回放(Experience Replay}:将智能体的经历 (s, a, r, s') 存储在回放缓冲区中,训练时随机采样小批量数据。这打破了数据之间的时间相关性,提高了训练稳定性。
\textbf{目标网络(Target Network}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了''追逐移动目标''的不稳定性。
\textbf{目标网络(Target Network}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了追逐移动目标的不稳定性。
\begin{lstlisting}[language=Python]
# DQN核心思路伪代码
@@ -275,7 +275,7 @@ for s in range(n_states):
\end{lstlisting}
\begin{quote}
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它''该怎么走'',它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它该怎么走,它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
\end{quote}
@@ -373,7 +373,7 @@ Critic提供一个\textbf{基线(Baseline},使得梯度估计的方差大
\[A(s, a) = Q(s, a) - V(s)\]
优势函数衡量的是''采取动作a比平均水平好多少''。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
优势函数衡量的是采取动作a比平均水平好多少。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
\section{PPO:近端策略优化}
@@ -463,9 +463,9 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新
AlphaGo的核心技术组合:
\textbf{策略网络(Policy Network}:学习''下一步应该下在哪里'',输入棋盘状态,输出每个位置落子的概率分布。
\textbf{策略网络(Policy Network}:学习下一步应该下在哪里,输入棋盘状态,输出每个位置落子的概率分布。
\textbf{价值网络(Value Network}:学习''当前局面谁更可能赢'',输入棋盘状态,输出一个-1到1之间的胜率评估。
\textbf{价值网络(Value Network}:学习当前局面谁更可能赢,输入棋盘状态,输出一个-1到1之间的胜率评估。
\textbf{蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS}:在策略网络的指导下进行前瞻搜索,通过模拟大量对局来评估每个候选落子点的价值。
@@ -512,7 +512,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类:
\end{longtable}
}
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为''错误''的棋,最终却证明是更优的选择。
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为“错误”的棋,最终却证明是更优的选择。
\section{AlphaFold2020}\label{alphafold2020}
@@ -560,10 +560,10 @@ AlphaFold的意义对设计领域尤其深远:
└──────────────────────────────────────────┘
\end{lstlisting}
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过''搜索 + 深度学习 + 计算''的组合来获得突破。
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过搜索 + 深度学习 + 计算的组合来获得突破。
\begin{quote}
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从''玩具问题''走向''真实世界问题''的趋势。设计领域正是这种真实世界问题的重要阵地。
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从玩具问题”走向“真实世界问题的趋势。设计领域正是这种真实世界问题的重要阵地。
\end{quote}
@@ -588,7 +588,7 @@ AlphaFold的意义对设计领域尤其深远:
\textbf{对齐(Alignment} 的目标是让AI模型的行为符合人类的价值观和期望,使其成为安全、有用、诚实的助手。而\textbf{RLHFReinforcement Learning from Human Feedback} 是目前最成功的对齐方法。
\begin{quote}
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型''能力'',而RLHF赋予模型''方向''——让能力服务于人类的目标。
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型“能力”,而RLHF赋予模型“方向”——让能力服务于人类的目标。
\end{quote}
\section{RLHF:从人类反馈中学习}
@@ -669,7 +669,7 @@ for step in range(training_steps):
RLHF需要大量人工标注,成本高昂。\textbf{RLAIFReinforcement Learning from AI Feedback} 用AI替代人类标注者来提供反馈:
\textbf{Constitutional AI(宪法AI} 由Anthropic提出,其核心思想是让AI通过一组''宪法原则''进行自我纠正:
\textbf{Constitutional AI(宪法AI} 由Anthropic提出,其核心思想是让AI通过一组宪法原则进行自我纠正:
\begin{lstlisting}
Constitutional AI 流程:
@@ -699,9 +699,9 @@ Constitutional AI 流程:
\section{什么是具身智能?}
\textbf{具身智能(Embodied AI} 是指拥有物理或虚拟''身体''的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
\textbf{具身智能(Embodied AI} 是指拥有物理或虚拟“身体”的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
传统AI(如大语言模型)是一个''缸中之脑''——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
传统AI(如大语言模型)是一个缸中之脑——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
\begin{lstlisting}
┌───────────────────────────────────────────┐
@@ -850,7 +850,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
\section{设计应用}
强化学习为设计领域提供了从''被动工具''到''主动智能体''的范式转变。以下是一些具有代表性的应用场景。
强化学习为设计领域提供了从被动工具”到“主动智能体的范式转变。以下是一些具有代表性的应用场景。
\section{空间布局优化}
@@ -875,7 +875,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
- 空间浪费惩罚
\end{lstlisting}
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的''风格''和''策略'',而不仅是找到单一最优解。
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的“风格”和“策略”,而不仅是找到单一最优解。
\section{路径规划与导航}