fix(latex): 修复中文引号渲染,''...'' → "..."(139处)

pandoc 转换将中文双引号变为两个ASCII单引号,导致LaTeX中
左右引号均渲染为右引号。替换为Unicode中文引号以正确显示。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
2026-05-29 14:05:08 +08:00
parent 57c04644d2
commit 9fd6eccde5
11 changed files with 104 additions and 104 deletions
+16 -16
View File
@@ -6,7 +6,7 @@
人类感知世界,约80\%的信息来自视觉。对于设计师而言,图像不仅是设计成果的呈现形式,更是灵感来源、分析对象和沟通媒介。
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从''识别图片中的猫''一步步发展到''理解任意场景中的任意内容'',以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
本章将沿着一条清晰的技术演进主线展开:\textbf{从小模型时代(CNN)到大模型时代(Vision Transformer),再到多模态大视觉模型}。我们将看到,计算机视觉如何从识别图片中的猫一步步发展到理解任意场景中的任意内容,以及这些技术如何赋能建筑识别、街景分析、设计素材管理等设计实践。
通过本章学习,你将:
@@ -75,7 +75,7 @@ CNN通过三个关键设计解决了MLP的上述缺陷:
\end{longtable}
}
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种''从局部到整体''的视觉处理方式。
\textbf{直觉理解}:人在识别一张建筑照片时,不会同时关注所有像素,而是先看局部特征(窗户、门、柱子),再组合成整体判断。CNN正是模拟了这种从局部到整体的视觉处理方式。
\subsection{卷积操作}
@@ -242,7 +242,7 @@ LeNet (1998) AlexNet (2012) VGG (2014) ResNet (2015)
\endlastfoot
LeNet-5 & 1998 & 5层 & 首个成功的CNN & 手写数字识别,邮局实用 \\
AlexNet & 2012 & 8层 & ReLU、Dropout、GPU训练 & ImageNet竞赛冠军,深度学习复兴 \\
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明''更深=更好''的简洁设计 \\
VGGNet & 2014 & 16-19层 & 3×3小卷积核堆叠 & 证明更深=更好的简洁设计 \\
ResNet & 2015 & 152层+ & 残差连接(Skip Connection & 突破深度瓶颈,可训练极深网络 \\
\end{longtable}
}
@@ -293,7 +293,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\end{itemize}
\begin{quote}
\textbf{设计思维链接}:残差连接的思想类似于设计中的''增量修改''——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种''在已有基础上做调整''的策略,在参数空间中比''从零开始学习''高效得多。
\textbf{设计思维链接}:残差连接的思想类似于设计中的增量修改——在保留原有方案(x)的基础上进行改进(F(x)),而非推倒重来。这种在已有基础上做调整的策略,在参数空间中比从零开始学习高效得多。
\end{quote}
@@ -301,7 +301,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\subsection{从分类到检测}
图像分类回答的问题是''这是什么'',而目标检测需要同时回答两个问题:
图像分类回答的问题是这是什么,而目标检测需要同时回答两个问题:
\begin{lstlisting}
分类: "这是一张建筑的照片" → what
@@ -332,7 +332,7 @@ ResNet的核心创新是\textbf{残差连接(Residual Connection}
\subsection{两阶段检测器}
两阶段方法的思路是''先找候选区域,再分类判别'',精度高但速度较慢。
两阶段方法的思路是先找候选区域,再分类判别,精度高但速度较慢。
\textbf{演进路线}
@@ -586,7 +586,7 @@ DeepLab由Google团队提出,其核心创新是\textbf{空洞卷积(Atrous C
2020年,Google团队提出了 \textbf{ViTVision Transformer},首次证明纯Transformer架构可以在图像任务上达到甚至超越CNN的性能,开启了视觉领域的Transformer时代。
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个''词''Token),然后送入标准Transformer编码器处理。
\textbf{ViT的核心思路}:将图像切割为固定大小的图块(Patch),将每个图块视为一个“词”Token),然后送入标准Transformer编码器处理。
\begin{lstlisting}
输入图像 (224×224×3) 切分为图块 线性嵌入
@@ -744,7 +744,7 @@ Swin Transformer的设计使其兼具CNN的层级特征提取优势和Transforme
└─────────┘ └──────────┘
\end{lstlisting}
CLIP的训练目标:对于N个''图像-文本''配对,最大化正确配对的相似度,最小化错误配对的相似度。
CLIP的训练目标:对于N个图像-文本配对,最大化正确配对的相似度,最小化错误配对的相似度。
\textbf{零样本分类}
@@ -764,7 +764,7 @@ CLIP的意义在于:\textbf{用自然语言定义视觉概念},打破了传
\subsection{SAM:分割一切}
\textbf{SAMSegment Anything Model, Meta, 2023}是一个''可提示''的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
\textbf{SAMSegment Anything Model, Meta, 2023}是一个可提示的通用分割模型,能够根据各种提示(点、框、文本)分割图像中的任意目标。
\begin{lstlisting}
SAM 的三种提示方式
@@ -796,7 +796,7 @@ SAM 的三种提示方式
\textbf{海量数据集}:SA-1B数据集包含10亿级自动标注的分割掩码
\end{itemize}
SAM的设计理念是成为视觉领域的''基础模型''——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
SAM的设计理念是成为视觉领域的基础模型——像大语言模型处理文本一样,成为处理视觉分割任务的基础设施。
\subsection{DINOv2:自监督视觉特征}
@@ -834,7 +834,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
\subsection{视觉-语言模型}
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅''看图说话'',而是真正理解图像内容并可以回答关于图像的复杂问题。
大视觉模型发展的一个重要趋势是\textbf{视觉与语言模态的融合}。模型不再仅看图说话,而是真正理解图像内容并可以回答关于图像的复杂问题。
\textbf{典型任务与模型}
@@ -949,7 +949,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
\item
\textbf{智能标签}:自动为设计素材添加语义标签,无需人工标注
\item
\textbf{自然语言检索}:用文字描述查找设计参考图(如''带玻璃幕墙的现代商业建筑''
\textbf{自然语言检索}:用文字描述查找设计参考图(如带玻璃幕墙的现代商业建筑
\item
\textbf{风格分类}:自动识别设计作品的风格特征
\item
@@ -971,7 +971,7 @@ DINOv2学到的特征具有惊人的语义对齐能力——无需文本训练
后现代/...) 未知风格) 的设计案例)
\end{lstlisting}
结合CLIP的零样本能力,设计师可以自定义风格类别(如''新中式''\,``极简主义''``有机建筑''等),无需收集训练数据即可进行风格分类。
结合CLIP的零样本能力,设计师可以自定义风格类别(如新中式\,``极简主义``有机建筑等),无需收集训练数据即可进行风格分类。
\section{本章小结}
@@ -1004,9 +1004,9 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
\item
\textbf{架构对比}:CNN通过局部卷积提取特征,ViT通过全局自注意力建立关系。在设计场景中(如建筑立面分析、街景品质评估),你认为哪种架构更适合?为什么?
\item
\textbf{零样本能力}CLIP实现了''用自然语言做图像分类''的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的''宜居性'',你会如何设计提示文本?考虑需要哪些视觉线索。
\textbf{零样本能力}CLIP实现了用自然语言做图像分类的零样本能力。如果你是一名城市设计师,想用CLIP分析城市街景的宜居性,你会如何设计提示文本?考虑需要哪些视觉线索。
\item
\textbf{大模型与传统方法}SAM号称可以''分割一切''。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
\textbf{大模型与传统方法}SAM号称可以分割一切。在专业设计领域(如建筑精细构件识别、景观植物种类分割),通用大模型和针对特定任务训练的小模型各有什么优势和局限?你会如何选择?
\end{enumerate}
@@ -1032,7 +1032,7 @@ CNN时代 (2012-2020) Transformer时代 (2020-)
卷积神经网络 & Convolutional Neural Network (CNN) & 利用卷积操作提取局部特征的神经网络 \\
卷积核/滤波器 & Kernel / Filter & 卷积操作中用于特征提取的小矩阵 \\
池化 & Pooling & 降低特征图空间尺寸的下采样操作 \\
感受野 & Receptive Field & 神经元能''看到''的输入区域大小 \\
感受野 & Receptive Field & 神经元能“看到”的输入区域大小 \\
残差连接 & Residual/Skip Connection & 将输入直接加到输出上,解决深层网络退化问题 \\
目标检测 & Object Detection & 同时识别图像中目标的类别和位置 \\
边界框 & Bounding Box & 用矩形框标出目标位置的表示方法 \\