fix(latex): 修复中文引号遗漏,补丁 ``...'' → "..."(15处)

上次修复了 ''...'' 模式,遗漏了 ``...'' 包裹中文的情况。
补充修复 ch02-ch08 及 ap01-ap02 中的混合引号。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
2026-05-29 14:10:44 +08:00
parent c9d2ce8a69
commit fa7d851bac
9 changed files with 16 additions and 16 deletions
+1 -1
View File
@@ -645,7 +645,7 @@ RLHF分为三个阶段:
在这个阶段,SFT模型成为RL的智能体: - \textbf{状态}:用户的问题 - \textbf{动作}:生成的回答 - \textbf{奖励}:奖励模型给出的分数 - \textbf{算法}PPO,保证训练的稳定性
同时,通过\textbf{KL散度惩罚(KL Divergence Penalty} 约束模型不要偏离原始SFT模型太远,防止''奖励黑客(Reward Hacking``——模型学会生成奖励模型给高分但实际无意义的内容。
同时,通过\textbf{KL散度惩罚(KL Divergence Penalty} 约束模型不要偏离原始SFT模型太远,防止"奖励黑客(Reward Hacking"——模型学会生成奖励模型给高分但实际无意义的内容。
\begin{lstlisting}[language=Python]
# RLHF第三阶段伪代码