fix(latex): 修复中文引号渲染,''...'' → "..."(139处)

pandoc 转换将中文双引号变为两个ASCII单引号,导致LaTeX中
左右引号均渲染为右引号。替换为Unicode中文引号以正确显示。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
2026-05-29 14:05:08 +08:00
parent acfcca58f5
commit c9d2ce8a69
11 changed files with 104 additions and 104 deletions
+17 -17
View File
@@ -6,7 +6,7 @@
2016年,AlphaGo击败围棋世界冠军李世石,让强化学习走入公众视野。此后,从蛋白质结构预测(AlphaFold)到大语言模型的人类对齐(RLHF),强化学习已深入AI的各个核心领域,成为现代人工智能不可或缺的基石。
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解''智能体如何在复杂世界中做出决策''的关键框架。
本章将系统介绍强化学习的基础原理、核心算法、里程碑突破,以及它在大模型对齐和设计领域的应用。我们将看到,强化学习不仅是一种算法工具,更是理解智能体如何在复杂世界中做出决策的关键框架。
\section{学习目标}
@@ -103,7 +103,7 @@ R & 奖励函数(Reward Function & R(s,a),在状态s采取动作a获得
\[G_t = r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + ... = \sum_{k=0}^{\infty} \gamma^k r_{t+k}\]
为了评估''处于某个状态有多好'',我们定义两种价值函数:
为了评估处于某个状态有多好,我们定义两种价值函数:
\textbf{状态价值函数(State Value FunctionV(s)}:在状态s下,遵循策略π所能获得的期望累积奖励。
@@ -113,7 +113,7 @@ R & 奖励函数(Reward Function & R(s,a),在状态s采取动作a获得
\[Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]\]
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下''哪个动作最好''
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下哪个动作最好
\section{Q-Learning}\label{q-learning}
@@ -137,7 +137,7 @@ DQN的两个关键创新:
\textbf{经验回放(Experience Replay}:将智能体的经历 (s, a, r, s') 存储在回放缓冲区中,训练时随机采样小批量数据。这打破了数据之间的时间相关性,提高了训练稳定性。
\textbf{目标网络(Target Network}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了''追逐移动目标''的不稳定性。
\textbf{目标网络(Target Network}:使用一个独立的目标网络来计算目标值,每隔一定步数才更新。这避免了追逐移动目标的不稳定性。
\begin{lstlisting}[language=Python]
# DQN核心思路伪代码
@@ -275,7 +275,7 @@ for s in range(n_states):
\end{lstlisting}
\begin{quote}
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它''该怎么走'',它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
\textbf{小贴士}:这个简单示例展示了强化学习的核心思想——智能体不需要任何人告诉它该怎么走,它只通过不断尝试和接收奖励反馈,就自己发现了最优路径。这正是强化学习区别于监督学习的本质。
\end{quote}
@@ -373,7 +373,7 @@ Critic提供一个\textbf{基线(Baseline},使得梯度估计的方差大
\[A(s, a) = Q(s, a) - V(s)\]
优势函数衡量的是''采取动作a比平均水平好多少''。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
优势函数衡量的是采取动作a比平均水平好多少。如果A \textgreater{} 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
\section{PPO:近端策略优化}
@@ -463,9 +463,9 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新
AlphaGo的核心技术组合:
\textbf{策略网络(Policy Network}:学习''下一步应该下在哪里'',输入棋盘状态,输出每个位置落子的概率分布。
\textbf{策略网络(Policy Network}:学习下一步应该下在哪里,输入棋盘状态,输出每个位置落子的概率分布。
\textbf{价值网络(Value Network}:学习''当前局面谁更可能赢'',输入棋盘状态,输出一个-1到1之间的胜率评估。
\textbf{价值网络(Value Network}:学习当前局面谁更可能赢,输入棋盘状态,输出一个-1到1之间的胜率评估。
\textbf{蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS}:在策略网络的指导下进行前瞻搜索,通过模拟大量对局来评估每个候选落子点的价值。
@@ -512,7 +512,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类:
\end{longtable}
}
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为''错误''的棋,最终却证明是更优的选择。
AlphaZero的启示:\textbf{当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略}。在对弈中,AlphaZero经常下出人类专家认为“错误”的棋,最终却证明是更优的选择。
\section{AlphaFold2020}\label{alphafold2020}
@@ -560,10 +560,10 @@ AlphaFold的意义对设计领域尤其深远:
└──────────────────────────────────────────┘
\end{lstlisting}
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过''搜索 + 深度学习 + 计算''的组合来获得突破。
这一范式对设计领域的启示:复杂的设计问题(如城市规划、建筑布局)也可能通过搜索 + 深度学习 + 计算的组合来获得突破。
\begin{quote}
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从''玩具问题''走向''真实世界问题''的趋势。设计领域正是这种真实世界问题的重要阵地。
\textbf{从游戏AI到科学发现}:Alpha系列的演进轨迹——从游戏(封闭规则、明确目标)到蛋白质折叠(开放规则、复杂约束)——暗示了强化学习从玩具问题”走向“真实世界问题的趋势。设计领域正是这种真实世界问题的重要阵地。
\end{quote}
@@ -588,7 +588,7 @@ AlphaFold的意义对设计领域尤其深远:
\textbf{对齐(Alignment} 的目标是让AI模型的行为符合人类的价值观和期望,使其成为安全、有用、诚实的助手。而\textbf{RLHFReinforcement Learning from Human Feedback} 是目前最成功的对齐方法。
\begin{quote}
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型''能力'',而RLHF赋予模型''方向''——让能力服务于人类的目标。
\textbf{回顾第3章}:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型“能力”,而RLHF赋予模型“方向”——让能力服务于人类的目标。
\end{quote}
\section{RLHF:从人类反馈中学习}
@@ -669,7 +669,7 @@ for step in range(training_steps):
RLHF需要大量人工标注,成本高昂。\textbf{RLAIFReinforcement Learning from AI Feedback} 用AI替代人类标注者来提供反馈:
\textbf{Constitutional AI(宪法AI} 由Anthropic提出,其核心思想是让AI通过一组''宪法原则''进行自我纠正:
\textbf{Constitutional AI(宪法AI} 由Anthropic提出,其核心思想是让AI通过一组宪法原则进行自我纠正:
\begin{lstlisting}
Constitutional AI 流程:
@@ -699,9 +699,9 @@ Constitutional AI 流程:
\section{什么是具身智能?}
\textbf{具身智能(Embodied AI} 是指拥有物理或虚拟''身体''的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
\textbf{具身智能(Embodied AI} 是指拥有物理或虚拟“身体”的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
传统AI(如大语言模型)是一个''缸中之脑''——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
传统AI(如大语言模型)是一个缸中之脑——只有信息处理能力,没有物理交互。具身智能则强调\textbf{感知-决策-行动}的闭环:
\begin{lstlisting}
┌───────────────────────────────────────────┐
@@ -850,7 +850,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
\section{设计应用}
强化学习为设计领域提供了从''被动工具''到''主动智能体''的范式转变。以下是一些具有代表性的应用场景。
强化学习为设计领域提供了从被动工具”到“主动智能体的范式转变。以下是一些具有代表性的应用场景。
\section{空间布局优化}
@@ -875,7 +875,7 @@ MuJoCo系列 & 物理仿真 & 材料与结构 \\
- 空间浪费惩罚
\end{lstlisting}
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的''风格''和''策略'',而不仅是找到单一最优解。
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的“风格”和“策略”,而不仅是找到单一最优解。
\section{路径规划与导航}