初始化:从 docx 拆分为独立 Markdown 章节

将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件,
按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
2026-04-25 10:32:58 +08:00
commit e58b95d227
42 changed files with 4857 additions and 0 deletions
+10
View File
@@ -0,0 +1,10 @@
# Editor / Tool configs
.DS_Store
.claude/
.claudian/
.obsidian/
.pandoc/
# Original source (kept for reference, not tracked)
*.docx
learning_markdown.md
+150
View File
@@ -0,0 +1,150 @@
## 学习目标
了解AI技术发展的关键时间节点
理解AI四大赛道及其应用场景
掌握设计领域AI应用的现状与趋势
# Amazon GoAI赋能的典型案例
## 案例背景
Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。
## 技术要素
Amazon Go的AI技术栈融合了多项前沿技术:
--------------------------------------------------
技术 作用 应用场景
------------ ---------------- --------------------
5G通信 低延迟数据传输 实时视频流处理
3D传感器 深度信息获取 空间定位与手势识别
计算机视觉 图像理解 商品识别、行为分析
传感器融合 多源数据整合 精确定位与跟踪
--------------------------------------------------
## 启示
Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走"AI让交互变得更加自然。
# AI赋能的时间线:2016-2024
## 第一阶段:觉醒期 (2016-2018)
**2016**AlphaGo击败李世石,AI进入公众视野
**2017**Transformer架构诞生,为大模型时代奠基
**2018**BERT预训练模型问世,NLP任务取得突破
## 第二阶段:爆发期 (2019-2022)
**2019**GPT-2展示强大的文本生成能力
**2020**:GPT-3发布,少样本学习能力震惊业界
**2022**ChatGPT发布,AI对话能力达到新高度
## 第三阶段:应用期 (2023-2024)
**2023**:多模态大模型、AI Agent概念兴起
**2024**:具身智能、端侧AI加速落地
# AI四大赛道
## 1. AIGC (AI-Generated Content)
**定义**:人工智能生成内容
**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效
**设计影响**:从"工具辅助"到"生成伙伴"
## 2. Agent (智能体)
**定义**:能够自主感知、规划、执行的系统
**核心能力** - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源
**设计影响**:从"被动执行"到"主动协作"
## 3. AI4S (AI for Science)
**定义**AI驱动科学发现
**应用领域** - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化
**设计影响**:数据驱动的设计决策
## 4. AIED (AI in Education)
**定义**AI在教育领域的应用
**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建
**设计影响**:设计教育与人才培养模式变革
# 设计领域AI应用趋势
## 当前应用
----------------------------------------
领域 AI应用 成熟度
---------- -------------------- --------
建筑设计 图纸生成、方案优化 中
景观设计 场地分析、植被配置 中
室内设计 家具布局、风格迁移 高
平面设计 Logo生成、排版辅助 高
交互设计 用户研究、原型生成 低
----------------------------------------
## 未来趋势
1.**从单点工具到系统化解决方案**
2.**从生成内容到生成决策**
3.**从人机协作到人机共生**
# 思考与练习
1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力
2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么?
3.Amazon Go案例中,哪些AI技术可以迁移到设计领域?
# 关键术语
--------------------------------------------------------
中文 英文 说明
----------------- --------------- ----------------------
生成式AI AIGC AI-Generated Content
智能体 Agent 自主决策系统
AI for Science AI4S AI驱动科学研究
AI in Education AIED AI教育应用
传感器融合 Sensor Fusion 多传感器数据整合
--------------------------------------------------------
# 延伸阅读
[Amazon Go技术解析](https://amazon.go/technology)
[AIGC产业发展报告](https://www.caict.ac.cn/)
[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进
+226
View File
@@ -0,0 +1,226 @@
# 学习目标
理解AI范式的三次演进
掌握万能逼近定理的直观意义
建立神经网络技术栈的完整认知
理解Scaling Law与模型规模效应
# AI范式的三次演进
## 第一范式:规则系统 (Symbolic AI)
**时期**1950s - 1980s
**核心思想**:人类专家编写规则
**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱
**典型应用**:专家系统、棋类游戏
## 第二范式:机器学习 (Machine Learning)
**时期**1990s - 2010s
**核心思想**:从数据中学习规律
**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定
**典型应用**:推荐系统、图像分类、语音识别
## 第三范式:深度学习 (Deep Learning)
**时期**2012 - 至今
**核心思想**:端到端学习,自动提取特征
**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强
**典型应用**:大语言模型、生成式AI、自动驾驶
# 万能逼近定理
## 定理表述
**Universal Approximation Theorem (1989)**
一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。
## 直观理解
想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面
## 启示
这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。
这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。
# 神经网络技术栈全景
`┌─────────────────────────────────────────────────────────────┐`\
`│ ``应用层`` │`\
`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\
`├─────────────────────────────────────────────────────────────┤`\
`│ ``模型层`` │`\
`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\
`├─────────────────────────────────────────────────────────────┤`\
`│ ``算法层`` │`\
`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\
`├─────────────────────────────────────────────────────────────┤`\
`│ ``数学层`` │`\
`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\
`└─────────────────────────────────────────────────────────────┘`
## 技术演进路径
------------------------------------------
时代 代表技术 突破点
------- ------------- --------------------
1980s MLP 万能逼近定理
1990s CNN 局部连接、权重共享
2000s RNN/LSTM 序列建模
2010s GNN 图结构数据
2017 Transformer Self-Attention
2020s Diffusion 生成质量突破
------------------------------------------
## 模型家族关系
`MLP (``多层感知机``)`\
` │`\
` ┌──────────────┼──────────────┐`\
` │ │ │`\
` CNN GNN RNN`\
` (``空间数据``) (``图数据``) (``序列数据``)`\
` │ │ │`\
` └──────────────┼──────────────┘`\
` │`\
` Transformer`\
` │`\
` ┌──────────────┼──────────────┐`\
` │ │ │`\
` GPT``系列`` BERT Diffusion`\
` (``生成式``) (``理解式``) (``图像生成``)`
# Scaling Law:规模即智能
## 什么是Scaling Law
Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系:
**模型性能 ≈ f(计算量, 数据量, 参数量)**
## 核心发现
### 1.性能随规模对数增长
o模型越大,性能越好
o增长是可预测的
#### 2.计算效率最关键
o计算量增加10倍 → 性能提升约1.5倍
o数据量和参数量也有类似规律
#### 3.没有看到天花板
o在现有规模下,性能提升仍在继续
### 启示
**大模型时代**:规模成为竞争壁垒
**数据为王**:高质量数据比模型架构更重要
**算力需求**:AI发展依赖硬件进步
从函数式视角看AI演进
### 核心理念
**"Functions Describe the World"(函数描述世界)**
物理定律:F = ma
经济规律:Supply = Demand(Price)
神经网络:y = f(x; θ)
### AI即函数组合
`输入数据`` x`\
` │`\
` ▼`\
`┌─────────┐`\
`│ f₁(x) │ ``第一层函数:特征提取`\
`└─────────┘`\
` │`\
` ▼`\
`┌─────────┐`\
`│ f₂(h) │ ``第二层函数:模式识别`\
`└─────────┘`\
` │`\
` ▼`\
`┌─────────┐`\
`│ f₃(z) │ ``第三层函数:决策输出`\
`└─────────┘`\
` │`\
` ▼`\
`输出`` y`
从Excel到神经网络
------------------------------------
Excel 神经网络
--------------------- --------------
y = ax + b 单层感知机
y = a₁x₁ + a₂x₂ + b 多输入神经元
嵌套IF函数 多层网络
宏函数 自动微分
------------------------------------
## 思考与练习
1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么?
2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡?
3.从函数式视角理解AI,对你理解设计问题有何启发?
## 关键术语
-------------------------------------------------------------------------------------
中文 英文 说明
---------------------- --------------------------------- ----------------------------
万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证
缩放定律 Scaling Law 模型性能与规模的关系
前馈网络 Feed-Forward Network 信息单向传播的神经网络
多层感知机 MLP Multi-Layer Perceptron
端到端学习 End-to-End Learning 从输入直接学习到输出
-------------------------------------------------------------------------------------
## 延伸阅读
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)
[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem)
[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x)
+51
View File
@@ -0,0 +1,51 @@
# 第一篇:导论
本篇建立读者对人工智能的宏观认知,介绍AI的发展历程和范式演进,帮助读者理解AI技术的全貌和发展趋势。
## 篇章导读
人工智能正在深刻改变设计的边界。从自动绘图到智能生成,从数据分析到自主决策,AI技术为设计领域带来了前所未有的可能性。
本篇将回答两个核心问题: 1. **AI是什么,它将如何影响设计?** 2. **AI技术是如何演进的,我们应该关注哪些方向?**
通过本篇学习,你将建立对AI的宏观认知,理解技术发展的脉络,为后续深入学习打下基础。
## 章节目录
[00.1 AI发展历程](00.1-ai-overview.md) - 从Amazon Go到AI赋能
[00.2 AI范式演进](00.2-ai-paradigm.md) - 技术栈全景与发展趋势
## 学习目标
完成本篇后,你将能够:
描述AI发展的关键节点和技术突破
理解AI四大赛道的区别和应用场景
掌握神经网络技术家族的演进脉络
建立AI技术栈的完整认知框架
## 核心概念
------------------------------------------------------------------
概念 英文 说明
----------------- ------- ----------------------------------------
生成式AI AIGC AI-Generated Content,人工智能生成内容
智能体 Agent 能够自主感知、决策和行动的系统
AI for Science AI4S AI驱动科学发现
AI in Education AIED AI在教育领域的应用
------------------------------------------------------------------
## 延伸思考
1.AI技术发展呈现加速趋势,这对设计行业意味着什么?
2.在AIGC、Agent、AI4S、AIED四个方向中,你认为哪个对设计领域影响最大?
3.了解AI技术演进后,你认为设计师应该掌握哪些AI相关技能? \# 00.1 AI发展历程
+165
View File
@@ -0,0 +1,165 @@
### 学习目标
理解"Functions Describe the World"的核心理念
掌握从Excel到神经网络的演进逻辑
理解函数组合与层级抽象的思想
### 核心理念:函数描述世界
#### 从物理定律说起
物理学用简洁的函数描述复杂现象:
----------------------------------
现象 函数 发现者
---------- -------------- --------
自由落体 h = ½gt² 伽利略
万有引力 F = Gm₁m₂/r² 牛顿
电磁感应 ε = -dΦ/dt 法拉第
----------------------------------
这些函数的共同特点:**用数学关系描述客观规律**
#### AI的函数观
AI延续了这一传统:**用函数从数据中学习规律**
`数据`` → ``函数`` → ``预测``/``决策`\
` x → f(x) → y`
从Excel到神经网络
线性回归:y = ax + b
在Excel中,我们经常做线性拟合:
`房价`` ≈ 0.015 × ``面积`` + 50``万`\
` y = a × x + b`
这就是一个最简单的"AI模型"**单变量线性函数**
多元回归:y = a₁x₁ + a₂x₂ + ... + b
增加更多特征:
`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万`
这就是**单层神经元**的数学形式!
函数组合:层级嵌套
现实世界的关系往往是非线性的,需要函数组合:
`h₁ = f₁(x) # ``第一层:提取特征`
`h₂ = f₂(h₁) # ``第二层:组合特征`
`y = f₃(h₂) # ``第三层:输出结果`
这就是**多层神经网络**的本质!
### 函数组合的威力
为什么需要多层?
**单层函数**只能学习简单的线性关系
**多层函数**可以学习任意复杂的非线性关系
直观例子:识别圆形
`输入:像素点灰度值`\
` ↓`\
`第一层:检测边缘(梯度变化)`\
` ↓`\
`第二层:组合边缘成弧线`\
` ↓`\
`第三层:判断是否闭合`` → ``圆形`
每一层都是一个函数,层层组合形成复杂能力。
### 数据驱动 vs 规则驱动
#### 规则驱动
`# ``传统编程:人工编写规则`\
`def`` ``is_circle``(image):`\
` edges ``=`` ``detect_edges``(image)`\
` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\
` ``return`` ``True`\
` ``return`` ``False`
**问题**:规则难以穷举,无法处理复杂情况
#### 数据驱动
`# AI``:从数据中学习函数`\
`f ``=`` ``neural_network``()`\
`train(f, ``thousands_of_examples``)`\
`result ``=`` f(``new_image``) ``# ``自动判断`
**优势**:自动发现规律,适应复杂情况
### 神经网络的函数本质
数学表示
一个L层神经网络:
`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))`
其中每一层:
`h = ``σ(``Wx`` + b)`
W:权重矩阵(可学习参数)
b:偏置向量(可学习参数)
σ:激活函数(引入非线性)
#### 视觉理解
`输入层`` ``隐藏层`` ``输出层`\
` x ``h₁,h₂,h``₃ y`\
` ● ──────────→ ○ ──────────→ ●`\
` │ ○ │`\
` ● ──────────→ ○ ──────────→ ●`\
` │ ○ │`\
` ● ──────────→ ○ ──────────→ ●`\
` ``权重``W₁ ``权重``W₂`
箭头上的权重就是函数的参数,通过学习自动确定。
### 思考与练习
1.列举3个日常生活中"用函数描述世界"的例子
2.为什么单层函数无法学习异或(XOR)问题?
3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决?
### 关键术语
------------------------------------------------------------
中文 英文 说明
---------- --------------------- ---------------------------
线性回归 Linear Regression y = ax + b 形式的函数拟合
多元回归 Multiple Regression 多输入变量的线性模型
权重 Weight 神经网络中的可学习参数
偏置 Bias 调整输出基准的参数
非线性 Non-linearity 无法用直线表示的关系
------------------------------------------------------------
### 延伸阅读
[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍
+221
View File
@@ -0,0 +1,221 @@
### 学习目标
理解MLP的基本结构
掌握前向传播的计算过程
了解激活函数的作用和类型
理解反向传播的基本思想
### MLP结构
#### 什么是MLP
**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。
网络架构
`输入层`` ``隐藏层`` ``输出层`\
` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\
` │ x₁ │ │ h₁ │ │ y₁ │`\
` │ x₂ │───→│ h₂ │───→│ y₂ │`\
` │ x₃ │ │ h₃ │ │ y₃ │`\
` │ ... │ │ ... │ │ ... │`\
` │ xₙ │ │ hₘ │ │ yₖ │`\
` └─────────┘ └─────────────┘ └─────────┘`\
` │ │ │`\
` └───────────────┴────────────────┘`\
` ``全连接(每个神经元相连)`
#### 层次说明
----------------------------------------
层类型 作用 神经元数量
-------- ---------------- --------------
输入层 接收原始数据 取决于特征数
隐藏层 特征变换与组合 自由设计
输出层 产生最终结果 取决于任务
----------------------------------------
### 前向传播
#### 单个神经元
`# ``线性部分`\
`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\
\
`# ``激活函数`\
`h ``=`` σ(z)`
#### 完整网络
对于L层网络:
`# ``第``1``层`
`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)`
`# ``第``2``层`
`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)`
`# ...`
`# ``第``L``层`
y = σₗ(Wₗh_{l-1} + bₗ)
#### 数据流动
`输入向量`` x₀`\
` │`\
` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\
` │ │`\
` │ └─→ σ₁(z₁) = h₁`\
` │ │`\
` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\
` │ │`\
` └─→ σ₂(z₂) = h₂`\
` │`\
` └─→ ... → y`
### 激活函数
#### 为什么需要激活函数?
没有激活函数,多层网络就等价于单层线性变换:
`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x`
激活函数引入**非线性**,使网络能够学习复杂模式。
#### 常用激活函数
--------------------------------------------------------------------
激活函数 公式 特点 应用场景
---------- ----------------------------- ------------ --------------
Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层
ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选
Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层
Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络
--------------------------------------------------------------------
#### 视觉对比
`ReLU``: Sigmoid: Tanh:`\
` ↑ ___ ___`\
` │ / ╲`\
` │ / ╲`\
` │____ / ╲___`\
` │ ______ / │`\
` └──────── / └──`\
` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞`
### 损失函数与优化
#### 损失函数
损失函数衡量模型预测与真实值的差距:
---------------------------------------
任务 损失函数 公式
-------- ---------- -------------------
回归 均方误差 MSE = Σ(ŷ-y)²/n
二分类 交叉熵 CE = -y·log(ŷ)
多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ)
---------------------------------------
#### 优化目标
`最小化损失函数:`\
`min L(f(x; θ), y)`\
\
`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数`
#### 梯度下降
`重复直到收敛:`\
` θ = θ - α·∇L(θ)`\
\
`其中:`\
` θ``:参数`\
` α``:学习率`\
` ∇L(θ)``:损失函数的梯度`
### 反向传播
核心思想
从输出层向输入层反向计算梯度:
`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差`
链式法则
`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\
` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)`
直观理解
1.**前向传播**:计算每个神经元的输出
2.**计算误差**:比较输出与真实值
3.**反向传播**:将误差反向传递
4.**更新权重**:根据误差调整参数
### MLP vs 传统模型
--------------------------------------
特性 MLP 传统机器学习
------------ ---------- --------------
特征工程 自动学习 人工设计
非线性能力 强 中/弱
数据需求 大量 中等
可解释性 低 高
训练时间 长 短
--------------------------------------
### 思考与练习
1.为什么隐藏层越多,网络表达能力越强?
2.ReLU为什么比Sigmoid更适合隐藏层?
3.如果所有权重初始化为0,会发生什么?
### 关键术语
----------------------------------------------------------
中文 英文 说明
---------- ------------------ ----------------------------
前向传播 Forward Pass 数据从输入到输出的计算过程
反向传播 Backpropagation 计算梯度的算法
损失函数 Loss Function 衡量预测误差的函数
梯度下降 Gradient Descent 优化算法
学习率 Learning Rate 参数更新的步长
----------------------------------------------------------
### 延伸阅读
[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html)
[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding
+226
View File
@@ -0,0 +1,226 @@
## 学习目标
掌握Python AI开发环境配置
了解核心科学计算库
理解Vibe Coding的AI辅助编程新模式
### Python环境配置
#### Anaconda vs Miniconda
-----------------------------------------------
工具 大小 特点 适用场景
----------- --------- ------------ ------------
Anaconda \~500MB 预装常用库 初学者推荐
Miniconda \~50MB 仅含conda 精简安装
-----------------------------------------------
#### 安装步骤
##### 1.下载安装
o访问 https://www.anaconda.com/download
o选择Python 3.x版本
o按提示安装
##### 2.创建虚拟环境
`conda`` create ``-n`` ai-env python=3.10`\
`conda`` activate ai-env`
##### 3.安装核心库
`conda`` install ``numpy`` pandas ``scipy`\
`pip`` install torch ``torchvision`
### 核心科学计算库
#### NumPy:数值计算基础
`import`` ``numpy`` ``as`` np`\
\
`# ``创建数组`\
`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\
\
`# ``矩阵运算`\
`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\
`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\
\
`# ``激活函数`\
`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU`
#### Pandas:数据处理
`import`` pandas ``as`` pd`\
\
`# ``读取数据`\
`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\
\
`# ``数据清洗`\
`df`` ``=`` ``df.dropna``()`\
`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\
\
`# ``统计分析`\
`df.describe``()`
#### SciPy:科学计算
`from`` ``scipy`` ``import`` optimize`\
`from`` ``scipy.spatial`` ``import`` distance`\
\
`# ``优化问题`\
`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\
\
`# ``距离计算`\
`dist`` ``=`` ``distance.euclidean``(point1, point2)`
### 开发工具选择
#### VSCode
**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快
**AI开发常用插件** - Python - Jupyter - Pylance - Copilot
## Cursor
**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程
**使用场景**: - 快速原型开发 - 代码重构 - 学习新API
## Jupyter Notebook
**特点**: - 交互式编程 - 可视化友好 - 文档即代码
**使用场景**: - 数据探索 - 算法实验 - 教学演示
# Vibe CodingAI辅助编程
## 什么是Vibe Coding
传统编程:**明确需求 → 设计算法 → 编写代码**
Vibe Coding**模糊想法 → AI辅助 → 迭代完善**
## 工作流程
### 1. 描述意图(自然语言)
`"``帮我创建一个简单的神经网络``"`
###
`2. AI``生成代码`
### → 自动生成完整代码框架
`3. ``运行测试`
`→ ``发现问题或需要调整`
`4. ``迭代优化`
`"``把隐藏层改成``128``个神经元``"`
`→ AI``自动修改代码`
`5. ``理解学习`
→ 阅读AI生成的代码,学习最佳实践
## 实践技巧
---------------------------------
技巧 说明
---------- ----------------------
明确需求 详细描述输入输出
分步实现 复杂功能拆解为小任务
验证结果 检查生成的代码
学习思考 理解AI为什么这样写
---------------------------------
## 工具推荐
--------------------------------------------
工具 特点 适用场景
---------------- ---------------- ----------
GitHub Copilot 代码补全 日常开发
Cursor 对话式编程 快速原型
ChatGPT/Claude 代码生成与解释 学习咨询
Replit Agent 端到端开发 小型项目
--------------------------------------------
## 开发工作流
项目结构
`project/`\
`├── data/ # ``数据文件`\
`├── notebooks/ # ``Jupyter``笔记本`\
`├── ``src``/ # ``源代码`\
`│ ├── models/ # ``模型定义`\
`│ ├── utils/ # ``工具函数`\
`│ └── train.py # ``训练脚本`\
`├── requirements.txt # ``依赖列表`\
`└── README.md # ``项目说明`
### 典型工作流
`# 1. ``创建环境`\
`conda`` create ``-n`` ``myproject`` python=3.10`\
`conda`` activate ``myproject`\
\
`# 2. ``安装依赖`\
`pip`` install ``-r`` requirements.txt`\
\
`# 3. ``开发迭代`\
`# - ``在``notebook``中实验`\
`# - ``整理到``src``/``目录`\
`# - ``运行测试`\
\
`# 4. ``保存环境`\
`conda`` env export ``>`` ``environment.yml`
## 思考与练习
1.对比Anaconda和Miniconda,什么时候该用哪个?
2.尝试用Cursor/Copilot生成一个简单的神经网络代码
3.Vibe Coding如何改变传统的编程学习方式?
## 关键术语
-----------------------------------------------------------
中文 英文 说明
---------- ----------------------- ------------------------
虚拟环境 Virtual Environment 隔离的Python运行环境
依赖管理 Dependency Management 管理项目所需的库
代码补全 Code Completion 自动补全正在输入的代码
原型开发 Prototyping 快速构建可运行版本
迭代优化 Iterative Refinement 逐步改进代码
-----------------------------------------------------------
## 延伸阅读
[Anaconda官方文档](https://docs.anaconda.com/)
[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html)
[Cursor使用指南](https://cursor.com/docs)
+49
View File
@@ -0,0 +1,49 @@
# 第二篇:数学与编程基础
本篇从函数式视角理解AI,介绍神经网络的基本原理和Python编程工具,为后续学习打下基础。
## 篇章导读
理解AI不需要高深的数学背景。核心理念是:**神经网络就是由简单函数组合而成的复杂函数**。
从Excel的线性回归到深度神经网络,本质上是同样的思想:**用函数来描述和预测世界**。
本篇将: - 从函数式视角理解AI - 介绍多层感知机的基本原理 - 讲解Python编程工具和AI辅助编程
## 章节目录
[01.1 函数式AI视角](01.1-math-foundation.md) - "Functions Describe the World"
[01.2 多层感知机](01.2-mlp-basics.md) - MLP结构与原理
[01.3 编程工具与Vibe Coding](01.3-programming.md) - Python环境与AI辅助编程
## 学习目标
完成本篇后,你将能够:
从函数组合角度理解神经网络
描述MLP的基本结构和工作原理
配置Python AI开发环境
使用AI工具辅助编程学习
## 核心概念
-----------------------------------------------------------
概念 英文 说明
------------ --------------------- ------------------------
多层感知机 MLP Multi-Layer Perceptron
前向传播 Forward Pass 数据通过网络的过程
激活函数 Activation Function 引入非线性的函数
损失函数 Loss Function 衡量预测误差的函数
反向传播 Backpropagation 计算梯度的算法
-----------------------------------------------------------
## 01.1 函数式AI视角
+145
View File
@@ -0,0 +1,145 @@
### 学习目标
理解CNN的核心思想:局部连接与权重共享
掌握卷积、激活、池化三大组件
了解CNN与MLP的区别和联系
### 为什么需要CNN
MLP的问题
将图像展平成一维向量输入MLP
`28×28``图像`` → 784``维向量`` → MLP`
**问题** 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习
#### CNN的解决方案
------------------------------------------------------------
特性 说明 优势
------------ -------------------------- --------------------
局部连接 每个神经元只连接局部区域 符合图像局部相关性
权重共享 同一卷积核扫描全图 大幅减少参数
层次化特征 低层→高层特征抽象 自动学习特征表达
------------------------------------------------------------
### CNN三大组件
#### 1. 卷积层 (Convolution)
**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征
`输入图像`` ``卷积核`` ``特征图`\
`┌─────────┐ ┌─────┐ ┌─────────┐`\
`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\
`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\
`│ 7 8 9 │ │ │ │ │`\
`└─────────┘ └─────┘ └─────────┘`
**计算示例**
`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4`
**多通道卷积**
`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)`
#### 2. 激活层 (Activation)
通常使用ReLU
`output ``=`` ``max``(``0``, ``feature_map``)`
作用:引入非线性,使网络能学习复杂模式
#### 3. 池化层 (Pooling)
**最大池化** (Max Pooling)
`2×2``窗口`` → ``取最大值`\
`┌─────┐ ┌───┐`\
`│3 1 │ │ 3 │`\
`│2 5 │ → │ │`\
`└─────┘ │ 5 │`\
` └───┘`
作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野
### CNN架构示例
#### LeNet-5 (经典架构)
`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\
` ↓`\
` ``全连接层`` → ``输出`
#### VGG-16 (深层架构)
`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\
` → [Conv×3 + Pool] ×3 → FC×3 → ``输出`
### CNN vs MLP
-------------------------------------
特性 MLP CNN
---------- -------------- -----------
连接方式 全连接 局部连接
权重 每个连接独立 同层共享
空间结构 忽略 保留
参数量 大 小
适用任务 结构化数据 图像/语音
-------------------------------------
### 经典网络架构演进
`LeNet`` (1998) → ``首次定义``CNN``结构`\
` ↓`\
`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\
` ↓`\
`VGG (2014) → ``更深网络,``3×3``小卷积核`\
` ↓`\
`GoogLeNet`` (2014) → Inception``模块,多尺度`\
` ↓`\
`ResNet`` (2015) → ``残差连接,``152``层`\
` ↓`\
`EfficientNet`` (2019) → ``复合缩放,高效`
### 思考与练习
1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)?
2.感受野如何随着网络深度增加?
3.设计一个简单的CNN用于手写数字识别
### 关键术语
-------------------------------------------------------
中文 英文 说明
-------- ----------------- ----------------------------
卷积核 Kernel/Filter 用于特征提取的小矩阵
步幅 Stride 卷积核滑动的步长
填充 Padding 边缘补零以保持尺寸
感受野 Receptive Field 神经元响应的输入区域
通道 Channel 图像的颜色维度或特征图数量
-------------------------------------------------------
### 延伸阅读
[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/)
[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测
+168
View File
@@ -0,0 +1,168 @@
## 学习目标
理解目标检测与图像分类的区别
掌握YOLO系列的发展脉络
了解目标检测在设计中的应用
### 从分类到检测
#### 图像分类
`输入图像`` → CNN → ``类别标签`\
`"``猫``" (``单标签``)`
#### 目标检测
`输入图像`` → CNN → [``位置``, ``类别``]`\
`[``边界框``, "``猫``", 0.95]`\
`[``边界框``, "``狗``", 0.87]`
**核心差异**:检测需要同时解决"是什么"和"在哪里"
### 检测器类型
#### Two-Stage检测器
`第一阶段:候选区域生成`\
` RPN (Region Proposal Network)`\
\
`第二阶段:分类与回归`\
` ``对每个候选框进行精确预测`\
\
`代表:``R-CNN, Fast R-CNN, Faster R-CNN`
特点:准确率高,速度慢
#### One-Stage检测器
`直接预测:一次性输出所有边界框和类别`\
\
`代表:``YOLO, SSD, ``RetinaNet`
特点:速度快,实时性好
### YOLO系列演进
#### YOLO v1 (2016)
**核心思想**:将检测转化为回归问题
`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框`
创新点: - 端到端训练 - 实时检测 (45 FPS)
#### YOLO v2-v4
----------------------------------
版本 主要改进
------ ---------------------------
v2 Batch Normalization, 锚框
v3 多尺度预测
v4 CSPDarknet, PANet
v5 PyTorch实现,工程优化
v8 重新设计,更易用
----------------------------------
#### YOLO工作流程
##### 1. 输入图像 (640×640)
`↓`
##### 2. Backbone特征提取
`↓`
##### 3. Neck特征融合 (FPN + PAN)
`↓`
##### 4. Head检测输出
`- ``边界框坐标`
`- ``目标置信度`
`- ``类别概率`
### 评估指标
#### IoU (交并比)
`IoU`` = ``预测框与真实框的交集`` / ``并集`\
\
` ┌─────────┐`\
` │ ``预测框`` │`\
` │ ┌───┐ │`\
` │ │``真`` │ │`\
` └──┼──┼─┘`\
` └───┘`\
\
`IoU`` = ``重叠面积`` / ``总面积`
### mAP (平均精度均值)
在不同IoU阈值(0.5, 0.75...)下的平均精度
综合衡量定位准确度和分类准确度
### COCO数据集
80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明
## 设计领域应用
建筑识别
`卫星图像`` → YOLO → ``建筑物边界框`\
` ↓`\
`自动生成建筑轮廓`
场景分析
`室内照片`` → ``目标检测`` → ``家具识别`\
` ↓`\
`空间布局分析`
遗产保护
`无人机影像`` → ``建筑病害检测`\
` ↓`\
`自动化巡检与记录`
## 思考与练习
1.Two-Stage和One-Stage检测器的权衡是什么?
2.为什么YOLO能实现实时检测?
3.目标检测在规划设计中有哪些潜在应用?
## 关键术语
-------------------------------------------------------
中文 英文 说明
-------------- -------------- -------------------------
边界框 Bounding Box 矩形目标框
锚框 Anchor Box 预定义的候选框
非极大值抑制 NMS 去除重复检测
交并比 IoU Intersection over Union
平均精度 AP Average Precision
-------------------------------------------------------
## 延伸阅读
[Ultralytics YOLO文档](https://docs.ultralytics.com/)
[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析
@@ -0,0 +1,136 @@
## 学习目标
理解图像分析的三种层级
掌握语义分割与实例分割的区别
了解分割技术在空间分析中的应用
## 图像分析层级
### Pixel-Level (像素级)
`每个像素独立处理`\
`问题:不考虑上下文`
### Patch-Level (图块级)
`以图像块为单位`\
`特点:保留局部空间关系`\
`应用:``CNN``卷积操作`
### Object-Level (对象级)
`以完整对象为单位`\
`特点:语义完整`\
`应用:目标检测、分割`
### 语义分割 vs 实例分割
#### 语义分割 (Semantic Segmentation)
`所有同类对象归为一类`\
`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]`
特点: - 同类别用同一种颜色 - 不区分个体数量
#### 实例分割 (Instance Segmentation)
`每个对象单独分割`\
`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]`
特点: - 区分同类对象的不同个体 - 更精细的场景理解
### 分割网络架构
#### FCN (全卷积网络)
`CNN``特征提取`` → ``上采样`` → ``像素级预测`
创新:用卷积层替代全连接层,输出热力图
#### U-Net
`编码器`` → ``瓶颈层`` → ``解码器`\
` ↓ ↑`\
`跳跃连接`` ───────────────┘`
特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构
#### DeepLab系列
空洞卷积 (Atrous Convolution)
扩大感受野而不降低分辨率
ASPP (空洞空间金字塔池化)
### 空间分析应用
#### 遥感影像分析
`卫星图像`` → ``语义分割`` → ``土地利用分类`\
` ↓`\
`- ``建筑用地`\
`- ``农用地`\
`- ``水体`\
`- ``森林`
#### 城市形态分析
`街景图像`` → ``分割`` → ``空间品质评估`\
` ↓`\
`- ``绿视率`\
`- ``天空开阔度`\
`- ``建筑密度`
#### 景观格局分析
`高分辨率影像`` → ``生态源地识别`\
` ↓`\
`景观连接性评估`
### 分割与检测对比
--------------------------------
特性 目标检测 语义分割
-------- ---------- ------------
输出 矩形框 像素级标注
精度 粗糙 精细
计算量 较低 较高
应用 目标定位 场景理解
--------------------------------
### 思考与练习
1.语义分割和实例分割分别在什么场景下更有用?
2.U-Net的跳跃连接为什么重要?
3.分割技术如何辅助规划设计决策?
### 关键术语
-----------------------------------------------------
中文 英文 说明
---------- ----------------------- ------------------
语义分割 Semantic Segmentation 按类别分割像素
实例分割 Instance Segmentation 按对象个体分割
热力图 Heatmap 像素级预测结果
空洞卷积 Atrous Convolution 扩大感受野的卷积
跳跃连接 Skip Connection 跨层连接
-----------------------------------------------------
### 延伸阅读
[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038)
[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597)
+33
View File
@@ -0,0 +1,33 @@
# 第三篇:计算机视觉与空间图像
本篇深入讲解计算机视觉的核心技术CNN,以及目标检测和语义分割在空间分析中的应用。
## 篇章导读
计算机视觉让机器"看见"世界。从图像分类到目标检测,从语义分割到场景理解,视觉技术正在改变设计领域对空间信息的处理方式。
本篇将系统介绍CNN原理及其在空间分析中的应用。
## 章节目录
[02.1 CNN基础原理](02.1-cnn-foundation.md) - 卷积神经网络三大组件
[02.2 目标检测](02.2-object-detection.md) - YOLO系列与应用
[02.3 语义分割与空间分析](02.3-semantic-segmentation.md) - 图像分析层级
## 核心概念
---------------------------------------------------------------
概念 英文 说明
-------------- ----------------- ------------------------------
卷积神经网络 CNN Convolutional Neural Network
特征图 Feature Map 卷积操作的输出
感受野 Receptive Field 神经元能"看到"的输入区域
池化 Pooling 下采样操作
---------------------------------------------------------------
## 02.1 CNN基础原理
+156
View File
@@ -0,0 +1,156 @@
### 学习目标
理解Self-Attention的动机和原理
掌握Q、K、V的计算过程
了解Multi-Head Attention的优势
### 为什么需要Attention
#### 序列标注问题
`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\
`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)`
传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算
Self-Attention - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算
### Self-Attention原理
#### 核心思想 {#核心思想-1}
为每个输出元素,计算输入序列中所有元素的相关性:
`对于每个位置``i```\
` yᵢ = Σ (``注意力权重`` × ``对应输入值``)`
#### Q、K、V计算
`输入``X → ``三个线性变换`\
` ↓`\
`Q (Query): "``我想找什么``"`\
`K (Key): "``我有什么标签``"`\
`V (Value): "``我的实际内容``"`
#### 注意力分数计算
`1. ``计算相似度:``Score = Q × Kᵀ`
`2. ``缩放:``Score = Score / √dₖ`
`3. ``Softmax````Weight = ``softmax``(Score)`
`4. ``加权求和:``Output = Weight × V`
#### 直观理解 {#直观理解-2}
`查询:``"``苹果``"`\
` ↓`\
`与所有``Key``计算相似度`\
` ↓`\
`权重高的``Key``对应``Value``贡献更大`\
` ↓`\
`输出:融合上下文的``"``苹果``"``表示`
### Multi-Head Attention
单头 vs 多头
**单头注意力**
`一组``Q``、``K``、``V → ``一个注意力表示`
**多头注意力**
`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接`
#### 多头优势
---------------------
头 关注内容
-------- ------------
Head 1 语法关系
Head 2 语义指代
Head 3 长距离依赖
... ...
---------------------
多头让模型从不同角度理解序列。
### Positional Encoding
#### 问题
Self-Attention本身是**置换不变**的:
`Attention(``[A, B, C]) = Attention([B, A, C])`
但序列位置很重要!
#### 解决方案
添加位置信息:
`输入`` = X + ``PositionalEncoding`
常用方法: - 正弦/余弦位置编码 - 可学习位置编码
### Self-Attention vs CNN
感受野对比
------------------------------------
层级 CNN Self-Attention
------ ------------ ----------------
单层 局部感受野 全局感受野
深层 逐层扩大 始终全局
------------------------------------
计算复杂度
--------------------------------------
操作 CNN Self-Attention
-------- ------------ ----------------
复杂度 O(k²·C) O(n²·d)
n 图像尺寸 序列长度
k 卷积核大小 \-
--------------------------------------
### 思考与练习
1.为什么Attention需要Scaling (除以√dₖ)
2.Multi-Head Attention中,头数越多越好吗?
3.Self-Attention如何应用在图像上?
### 关键术语
------------------------------------------------------
中文 英文 说明
---------- -------------------- ----------------------
查询 Query 查询向量
键 Key 键向量
值 Value 值向量
缩放点积 Scaled Dot-Product 注意力计算方式
掩码 Mask 屏蔽某些位置的注意力
------------------------------------------------------
### 延伸阅读
[Attention Is All You Need](https://arxiv.org/abs/1706.03762)
[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构
+157
View File
@@ -0,0 +1,157 @@
### 学习目标
理解Transformer的Encoder-Decoder结构
掌握各组件的作用和连接方式
了解Token处理流程
### 整体架构
`输入``Token``序列`` → Encoder → ``编码表示`\
` ↓`\
`输出``Token``序列`` ← Decoder ← ``编码表示`
### Encoder层
单层结构
`输入``X`\
` ↓`\
`Multi-Head Self-Attention`\
` ↓`\
`Add & Norm (``残差连接`` + ``层归一化``)`\
` ↓`\
`Feed-Forward Network (FFN)`\
` ↓`\
`Add & Norm`\
` ↓`\
`输出``H`
#### 残差连接
`输出`` = F(x) + x`
作用: - 缓解梯度消失 - 便于训练深层网络
#### 层归一化
`输出`` = ``LayerNorm``(x + F(x))`
作用: - 稳定训练 - 加速收敛
#### FFN (前馈网络)
`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂`
本质:两层全连接网络,非线性变换
### Decoder层
#### 结构
`输入``X`\
` ↓`\
`Masked Self-Attention (``只能看之前的位置``)`\
` ↓`\
`Add & Norm`\
` ↓`\
`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\
` ↓`\
`Add & Norm`\
` ↓`\
`FFN`\
` ↓`\
`Add & Norm`\
` ↓`\
`输出`` (``接``Softmax``预测概率``)`
#### Cross-Attention
`Q: Decoder``的隐藏状态`\
`K, V: Encoder``的输出`
作用:让Decoder关注Encoder的相关部分
## Token处理流程
### 输入处理
`文本`` → Tokenize → Token IDs`\
` ↓`\
` Embedding``层`\
` ↓`\
` ``位置编码相加`\
` ↓`\
` Encoder/Decoder`
### 输出处理
`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\
` ↓`\
` ``选择最大值`
## 训练与推理
训练阶段
`教师强制`` (Teacher Forcing)```\
` ``真实标签作为``Decoder``输入`\
` ``可以并行计算`
推理阶段
`自回归生成`` (Autoregressive)```\
` ``生成一个``Token → ``加入输入`` → ``生成下一个`\
` ``串行计算`
## Transformer变体
BERT (Encoder-only)
`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示`
应用:分类、NER、问答
GPT (Decoder-only)
`输入`` → Decoder → ``下一个``Token``预测`
应用:文本生成
T5 (Encoder-Decoder)
`输入`` → Encoder → ``表示`` → Decoder → ``输出`
应用:翻译、摘要
## 思考与练习
1. 为什么Decoder需要Masked Attention
2. Encoder-only和Decoder-only模型各有什么优势?
3. Transformer如何处理超长序列?
## 关键术语
----------------------------------------------------------
中文 英文 说明
--------------- --------------------- --------------------
残差连接 Residual Connection 跨层连接
层归一化 Layer Normalization 归一化层
教师强制 Teacher Forcing 训练时使用真实标签
自回归 Autoregressive 基于前序生成后续
编码器-解码器 Encoder-Decoder Seq2Seq架构
----------------------------------------------------------
## 延伸阅读
1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html)
[Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用
+166
View File
@@ -0,0 +1,166 @@
## 学习目标
3. 理解从Transformer到ChatGPT的演进
掌握RAG、RLHF等关键技术
了解Prompt工程在设计中的应用
## 从Transformer到ChatGPT
### GPT系列演进
------------------------------------------------------
模型 发布时间 参数量 特点
--------- ---------- -------- ------------------------
GPT-1 2018 117M 验证Decoder-only可行性
GPT-2 2019 1.5B 展示零样本能力
GPT-3 2020 175B 少样本学习震撼业界
ChatGPT 2022 \~ 对话能力达到新高度
GPT-4 2023 \~ 多模态能力
------------------------------------------------------
### 训练范式
`预训练`` (Pre-training)```\
` ``大规模文本`` → ``无监督学习`` → ``语言模型`\
\
`微调`` (Fine-tuning)```\
` ``特定任务`` → ``有监督学习`` → ``任务模型`
## RAG:检索增强生成
### 核心思想 {#核心思想-2}
用户提问 → 检索相关文档 → LLM生成答案
外部知识库
### RAG架构
#### 文档索引
`文档`` → ``切分`` → Embedding → ``向量数据库`
####
`2. ``检索阶段`
#### 问题 → Embedding → 相似度搜索 → 相关文档
`3. ``生成阶段`
问题 + 相关文档 → LLM → 答案
### RAG优势
---------------------------
特点 说明
---------- ----------------
减少幻觉 基于检索的事实
可更新 更新知识库即可
可解释 显示参考来源
---------------------------
## RLHF:人类反馈强化学习
### 为什么需要RLHF
预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出
### RLHF三阶段
#### 有监督微调 (SFT)
`人工标注对话`` → ``微调模型`
`2. ``奖励模型`` (RM)`
#### 多个输出 → 人类排序 → 训练奖励模型
`3. ``强化学习`` (RL)`
PPO算法 → 优化策略
### 效果
1. 输出更符合人类偏好
减少有害内容
提高回答质量
## Prompt工程
### Prompt设计原则
#### 明确任务
`好:请总结以下文本的主要观点`\
`差:看看这段文字`
#### 提供示例
`任务:情感分类`\
`示例:`\
`"``这部电影太棒了!``" → ``正面`\
`"``服务态度很差。``" → ``负面`\
`现在分类:``"..."`
### 指定格式
`请按以下格式输出:`\
`- ``观点``1````...`\
`- ``观点``2````...`\
`- ``结论:``...`
## 设计领域应用
-------------------------------------------------------
任务 Prompt示例
---------- --------------------------------------------
方案生成 "设计一个50人的办公空间,要求开放式布局"
代码生成 "写一个Python脚本计算建筑容积率"
文档撰写 "帮我写一份景观设计说明书的框架"
-------------------------------------------------------
## 思考与练习
1. RAG和微调(Fine-tuning)各适用于什么场景?
2. 如何评估LLM输出的质量?
3. Prompt工程在设计工作流中能解决什么问题?
## 关键术语
------------------------------------------------------------------------------------
中文 英文 说明
------------------ -------------------- --------------------------------------------
检索增强生成 RAG Retrieval-Augmented Generation
人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback
提示工程 Prompt Engineering 设计输入以引导模型输出
向量数据库 Vector Database 存储和检索向量表示
幻觉 Hallucination 模型编造错误信息
------------------------------------------------------------------------------------
## 延伸阅读
1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165)
[Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155)
[LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/)
+33
View File
@@ -0,0 +1,33 @@
# 第四篇:Transformer与大模型
本篇介绍革命性的Transformer架构和大语言模型,理解Self-Attention机制和LLM应用。
## 篇章导读
Transformer是AI领域最重要的架构创新之一。它不仅彻底改变了自然语言处理,还通过Attention机制启发了计算机视觉的范式变革。
本篇将从注意力机制出发,深入理解Transformer架构,并探讨大语言模型在设计领域的应用。
## 章节目录
[03.1 注意力机制](03.1-attention.md) - Self-Attention原理
[03.2 Transformer架构](03.2-transformer.md) - Encoder-Decoder结构
[03.3 大语言模型应用](03.3-llm-application.md) - ChatGPT、RAG与Prompt工程
## 核心概念
-------------------------------------------------------
概念 英文 说明
------------ --------------------- --------------------
注意力机制 Attention 关注输入的重要部分
自注意力 Self-Attention 序列内部的关系建模
位置编码 Positional Encoding 保留序列位置信息
令牌 Token 文本的基本单位
-------------------------------------------------------
## 03.1 注意力机制
+151
View File
@@ -0,0 +1,151 @@
### 学习目标
1. 理解生成模型的发展脉络
掌握Diffusion模型的基本原理
了解各类生成模型的优缺点
### 生成模型家族
#### AE (Autoencoder,自编码器)
`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构`
思想:学习数据的压缩表示
问题:生成的图像模糊,缺乏多样性
#### VAE (Variational AE,变分自编码器)
`潜在空间约束为标准正态分布`\
` ↓`\
`可以随机采样`` → ``解码`` → ``生成新图像`
改进:引入概率分布,增强生成能力
#### GAN (Generative Adversarial Network)
`生成器:生成假图像`\
`判别器:判断真假`\
` ↓`\
`对抗训练,相互博弈`
优势:生成图像质量高 问题:训练不稳定,模式崩溃
#### Diffusion Model (扩散模型)
`前向:逐步加噪`` → ``纯噪声`\
`反向:学习去噪`` → ``还原图像`
优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3
### Diffusion原理
#### 前向过程 (加噪)
`原图`` x₀`\
` ↓ ``加高斯噪声`\
`x₁ = x₀ + ε₁`\
` ↓ ``加噪声`\
`x₂ = x₁ + ε₂`\
` ↓ ...`\
`x_T`` = ``纯噪声`
#### 反向过程 (去噪)
`纯噪声`` ``x_T`\
` ↓ ``去噪`\
`x_{T-1} = ``去噪网络``(``x_T``)`\
` ↓ ``去噪`\
`x_{T-2} = ``去噪网络``(x_{T-1})`\
` ↓ ...`\
`x₀ = ``原始图像`
#### 训练目标
`去噪网络学习预测:`\
` ``添加的噪声`` ε`\
` ``或`\
` ``原始图像`` x₀`
### Stable Diffusion架构
#### 潜在空间扩散
`为了效率,在潜在空间操作:`\
\
`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\
` ↓`\
` VAE``解码`` → ``图像`
#### 核心组件
-------------------------------------
组件 作用
-------------- ----------------------
VAE 图像与潜在空间的转换
U-Net 去噪网络
Text Encoder 处理文本提示词
CLIP 文图对齐
-------------------------------------
### 文生图工作流
#### 输入提示词
`"``一只猫,水彩画风格``"`
####
`2. ``文本编码`
#### → 文本向量表示
`3. ``初始化`
#### → 随机噪声
`4. ``去噪循环`
`for t in T...1:`
`噪声`` → ``预测噪声`` → ``去噪`
`5. ``解码输出`
→ 潜在表示 → VAE解码 → 图像
### 思考与练习
1. Diffusion为什么比GAN训练更稳定?
2. 潜在空间扩散有什么优势?
3. 文生图如何实现风格控制?
### 关键术语
---------------------------------------------------
中文 英文 说明
---------- ----------------- ----------------------
潜在空间 Latent Space 压缩后的数据表示空间
去噪 Denoising 移除噪声的过程
提示词 Prompt 指导生成的文本描述
潜变量 Latent Variable 不可直接观测的变量
模式崩溃 Mode Collapse GAN生成多样性不足
---------------------------------------------------
### 延伸阅读
1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239)
[High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链
+180
View File
@@ -0,0 +1,180 @@
## 学习目标
3. 掌握ControlNet的条件控制机制
理解LoRA高效微调原理
了解ComfyUI工作流搭建
## ControlNet:精确控制
核心问题
纯文生图:难以精确控制空间结构
### ControlNet解决
`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\
` ↓`\
`条件`` → ControlNet → ``主模型`` → ``输出图像`
### 条件类型
------------------------------------
条件 说明 应用
-------------- ---------- ----------
Canny 边缘检测 轮廓控制
Depth 深度图 空间关系
Pose 人体姿态 人物生成
Normal 法线图 表面细节
Segmentation 分割图 区域控制
------------------------------------
### 应用场景
`草图`` → ControlNet → ``精细效果图`\
`平面图`` → ControlNet → ``三维渲染`\
`结构图`` → ControlNet → ``风格化设计`
LoRA:高效微调
问题
全量微调大模型:计算资源需求巨大
LoRA原理
`原始权重`` W ``固定`\
` ↓`\
`添加低秩分解:`\
` ΔW = A × B`\
` (``d×r``) × (``r×d``)`\
` ↓`\
`新输出`` = ``Wx`` + ``ABx`
优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格
### 应用方式
`基础模型`` + ``LoRA`` A = ``风格``A`\
`基础模型`` + ``LoRA`` B = ``风格``B`\
`基础模型`` + ``LoRA`` A + B = ``混合风格`
## ComfyUI:模块化工作流
### 核心特点
`节点化连接`\
` ↓`\
`可视化流程`\
` ↓`\
`灵活定制`
### 典型节点
---------------------------------
节点类型 功能
------------------ --------------
Load Checkpoint 加载模型
CLIP Text Encode 文本编码
KSampler 采样生成
VAE Decode 潜在空间解码
Save Image 保存图像
ControlNet 条件控制
LoRA Loader 加载LoRA
---------------------------------
### 工作流示例
`文本提示`` → CLIP``编码`` →`\
` ↓`\
`正负提示`` ────→ ``KSampler`` ← ControlNet`\
` ↓`\
` VAE``解码`\
` ↓`\
` ``保存图像`
## 设计领域应用案例
### 建筑设计
`草图生成`` → ControlNet (Canny) → ``效果图`\
`方案变体`` → ``LoRA``风格微调`` → ``多方案对比`
### 室内设计
`户型图`` → ControlNet → ``三维效果图`\
`风格迁移`` → ``LoRA`` → ``不同材质方案`
---------------------------------------
工具 核心价值
------------------ --------------------
Midjourney 快速创意探索
Stable Diffusion 本地部署,可控生成
ControlNet 精确结构控制
ComfyUI 定制化工作流
---------------------------------------
## 版权与伦理
### 版权问题
6. AI训练数据的版权归属
AI生成作品的版权保护
风格模仿的法律边界
### 伦理考量
9. 深度伪造 (Deepfake)
虚假信息传播
创作者职业影响
## 思考与练习
1. ControlNet如何平衡条件控制与创造性?
2. LoRA和全量微调各适用于什么场景?
3. AIGC工具如何融入设计工作流?
## 关键术语
------------------------------------------------------
中文 英文 说明
---------- --------------------- ---------------------
条件控制 Conditional Control 引导生成过程
低秩适应 LoRA Low-Rank Adaptation
工作流 Workflow 节点化的处理流程
采样器 Sampler 去噪采样算法
潜在空间 Latent Space 压缩的特征空间
------------------------------------------------------
## 延伸阅读
1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543)
[LoRA官方论文](https://arxiv.org/abs/2106.09685)
[ComfyUI文档](https://docs.comfy.org/)
+31
View File
@@ -0,0 +1,31 @@
# 第五篇:生成式AI
本篇讲解生成模型的发展脉络和AIGC工具链,探索AI在设计创造领域的应用。
## 篇章导读
生成式AI正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI正在成为人类的"创意伙伴"。
本篇将系统介绍生成模型的演进和AIGC工具链。
## 章节目录
1. [04.1 生成模型演进](04.1-diffusion.md) - 从VAE/GAN到Diffusion
[04.2 AIGC设计工具链](04.2-aigc-tools.md) - ControlNet、LoRA与ComfyUI
## 核心概念
-----------------------------------------------------------
概念 英文 说明
-------------- ----------- --------------------------------
自编码器 AE Autoencoder
变分自编码器 VAE Variational Autoencoder
生成对抗网络 GAN Generative Adversarial Network
扩散模型 Diffusion Denoising Diffusion Model
-----------------------------------------------------------
## 04.1 生成模型演进
+148
View File
@@ -0,0 +1,148 @@
## 学习目标
1. 理解从规则到LLM-based Agent的演进
掌握Agent的核心组件
了解ReAct和CoT推理模式
## 从规则到LLM Agent
### 规则系统时代
`if`` ``condition_A``:`\
` ``action_``B``(``)`\
`elif`` ``condition_C``:`\
` ``action_D``()`\
`else``:`\
` ``action_E``()`
局限:规则难以穷举,无法应对新情况
### LLM-based Agent
`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出`
优势: - 自然语言交互 - 上下文理解 - 泛化能力强
## Agent核心组件
### 感知 (Perception)
`输入信息`` → ``理解与解析`\
` - ``用户指令`\
` - ``环境状态`\
` - ``工具反馈`
### 规划 (Planning)
`目标`` → ``分解为子任务`\
` - ``任务分析`\
` - ``步骤规划`\
` - ``依赖管理`
### 记忆 (Memory)
`┌─────────────────────────────┐`\
`│ ``短期记忆`` (Short-term) │`\
`│ ``对话上下文、临时状态`` │`\
`├─────────────────────────────┤`\
`│ ``长期记忆`` (Long-term) │`\
`│ ``知识库、经验积累`` │`\
`└─────────────────────────────┘`
### 工具调用 (Tool Use)
`可用工具集:`\
` - ``数据库查询`\
` - API``调用`\
` - ``文件操作`\
` - ``代码执行`\
` ...`
## 推理模式
Chain of Thought (CoT)
`问题`` → ``思考链`` → ``答案`
`"``设计一个公园``"`
` ↓`
1. `分析场地条件`
2. `2. ``确定功能分区`
3. `3. ``布局路径系统`
`4. ``选择植物配置`
`↓`
完整方案
### ReAct (Reasoning + Acting)
`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\
\
`思考:需要查询场地数据`\
`行动:调用``GIS``工具`\
`观察:获取到高程信息`\
`思考:基于高程做排水设计`\
`行动:生成排水方案`\
`...`
## Agent架构示例
单Agent架构
`┌─────────────────────────────┐`\
`│ LLM Core │`\
`│ (``规划、推理、决策``) │`\
`├─────────────────────────────┤`\
`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\
`│ │``感知``││``记忆``││``工具``││``反思``│ │`\
`│ └───┘ └───┘ └───┘ └───┘ │`\
`└─────────────────────────────┘`\
` ↓`\
` ``执行任务`
### 多Agent协作
`┌─────────┐ ┌─────────┐ ┌─────────┐`\
`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\
`└─────────┘ └─────────┘ └─────────┘`\
` ↓ ↓ ↓`\
` ``任务分解`` ``数据分析`` ``方案生成`
## 思考与练习
1. 单Agent和多Agent系统各有什么优势?
2. 如何设计Agent的记忆系统?
3. CoT和ReAct各适用于什么场景?
## 关键术语
--------------------------------------------
中文 英文 说明
---------- ------------ --------------------
思考链 CoT Chain of Thought
推理行动 ReAct Reasoning + Acting
记忆 Memory 存储和检索信息
反思 Reflection 自我评估与改进
工具使用 Tool Use 调用外部能力
--------------------------------------------
## 延伸阅读
1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/)
[ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能
+157
View File
@@ -0,0 +1,157 @@
# 学习目标
3. 理解具身智能的概念和特点
了解数字孪生与物理世界的交互
掌握强化学习在具身AI中的应用
# 什么是具身智能
## 定义
**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。
## 与传统AI的区别
------------------------------------
特性 传统AI 具身AI
---------- ------------ ------------
交互方式 数据输入 主动探索
学习方式 从数据学习 从交互学习
输出形式 预测/生成 行动/操作
------------------------------------
# 数字孪生
## 概念
`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制`
## 应用层次
--------------------------------
层次 内容 应用
---------- ---------- ----------
几何孪生 三维模型 可视化
物理孪生 物理仿真 性能分析
行为孪生 行为模拟 场景预测
认知孪生 决策支持 智能控制
--------------------------------
# 强化学习基础
## 核心要素
`┌─────────────────────────────────────┐`\
`│ │`\
`│ ``环境`` ← ``状态`` ──────→ Agent │`\
`│ ↑ │ │`\
`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\
`│ │`\
`└─────────────────────────────────────┘`
## 训练循环
1. `观察环境状态`
2. `选择行动`
3. `执行行动`
4. `获得奖励`
5. `更新策略`
6. `重复``...`
## Gymnasium环境
`import gymnasium as gym`\
\
`env = ``gym.make``("CartPole-v1")`\
`state, _ = ``env.reset``()`\
\
`for _ in range(1000):`\
` action = policy(state)`\
` state, reward, done, _, _ = ``env.step``(action)`\
` if done:`\
` break`
# 具身AI应用场景
## 机器人设计
`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\
` ↓`\
`建筑机器人、施工机器人`
## 虚拟角色
`游戏``NPC``、虚拟助手、元宇宙居民`\
` ↓`\
`自然行为、智能对话`
## 仿真训练
`虚拟环境`` → ``训练策略`` → ``迁移到真实`\
` ↓`\
`降低试错成本`
# 虚拟到真实的迁移
## 挑战
-----------------------------------
问题 说明
-------------- --------------------
Sim2Real Gap 仿真与现实的差异
感官差异 虚拟与真实感知不同
物理特性 真实物理更复杂
-----------------------------------
## 解决方案
1. 域随机化 (Domain Randomization)
真实数据混合
在线微调
# 思考与练习
1. 具身智能在规划设计中有哪些应用前景?
2. 数字孪生如何辅助设计决策?
3. Sim2Real迁移的主要挑战是什么?
# 关键术语
--------------------------------------------------
中文 英文 说明
---------- -------------- ------------------------
具身智能 Embodied AI 有身体形式的AI
数字孪生 Digital Twin 物理世界的数字映射
强化学习 RL Reinforcement Learning
状态 State 环境的当前情况
动作 Action Agent对环境的影响
--------------------------------------------------
# 延伸阅读
1. [Gymnasium文档](https://gymnasium.org.cn/)
[DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP
+215
View File
@@ -0,0 +1,215 @@
# 学习目标
3. 理解MCP协议的核心思想
掌握HITL协作模式
了解Agent在规划设计中的落地场景
# MCP协议
## 什么是MCP
**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。
## 核心价值
`传统方式:`\
` AI``模型`` → ``各自独立`` → ``数据孤岛`\
\
`MCP``方式:`\
` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据`
MCP架构
`┌─────────────────────────────────────┐`\
`│ AI Application │`\
`│ (Claude, ``ChatGPT``, ``等``) │`\
`└─────────────┬───────────────────────┘`\
` │ MCP`\
`┌─────────────┴───────────────────────┐`\
`│ MCP Client │`\
`├─────────────────────────────────────┤`\
`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\
`│ │File │ │DB │ │API │ ... │`\
`│ │``Server│ │Server│ │Server│ │`\
`│ └──────┘ └──────┘ └──────┘ │`\
`└─────────────────────────────────────┘`
# HITL:人机协作模式
## 什么是HITL
**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。
## HITL层次
----------------------------------
层次 人类角色 自动化程度
---------- ---------- ------------
完全自动 无 100%
人工审核 监督者 80-90%
交互决策 合作伙伴 50-70%
人工主导 操作者 \<50%
----------------------------------
## 规划设计中的HITL
`AI``生成方案`\
` ↓`\
`设计师审核`` ← ``修改意见`` → AI``调整`\
` ↓`\
`最终确认`
# 规划设计Agent案例
## 场景分析Agent
`输入:场地数据`
`↓`
`分析流程:`
1. `地形分析`` (``坡度、高程``)`
2. `气候分析`` (``日照、风向``)`
3. `交通分析`` (``可达性``)`
4. `视觉分析`` (``视域、景观``)`
`↓`
`输出:场地分析报告`
## 方案生成Agent
`输入:设计要求`` + ``场地分析`
`↓`
`生成流程:`
1. `理解需求`` (``CoT``推理``)`
2. `布局功能`` (``工具调用``)`
3. `连接路径`` (``图算法``)`
4. `优化调整`` (``迭代改进``)`
`↓`
`输出:初步设计方案`
## 合规审查Agent
`输入:设计方案`
`↓`
`审查流程:`
1. `调用规范库`
2. `逐条核对`
3. `标记问题`
4. `生成报告`
`↓`
`输出:合规审查意见`
# Agent落地挑战
技术挑战
---------------------------
挑战 说明
---------- ----------------
准确性 复杂任务易出错
可解释性 决策过程不透明
鲁棒性 边界情况处理
---------------------------
应用挑战
-----------------------------
挑战 说明
------------ ----------------
工作流整合 与现有流程融合
责任界定 AI错误的后果
成本控制 API调用费用
-----------------------------
## 解决方向
1. 分级应用:简单任务自动化,复杂任务辅助
渐进式:从局部到整体
人机协同:关键环节人工确认
# 未来展望:AI设计师
### 短期 (1-2年)
`AI``作为工具`\
` - ``数据分析`\
` - ``方案生成`\
` - ``合规检查`
### 中期 (3-5年)
`AI``作为助手`\
` - ``创意启发`\
` - ``方案优化`\
` - ``文档撰写`
### 长期 (5-10年)
`AI``作为合作伙伴`\
` - ``共同创造`\
` - ``自主决策`\
` - ``专业评审`
## 思考与练习
1. MCP如何解决AI应用的"数据孤岛"问题?
2. 规划设计中哪些环节适合引入HITL?
3. AI设计师如何与人类设计师协作?
## 关键术语
----------------------------------------------------------------
中文 英文 说明
---------------- ---------------------- ------------------------
模型上下文协议 MCP Model Context Protocol
人在回路 HITL Human-in-the-Loop
数据孤岛 Data Silo 独立的数据存储
协议 Protocol 通信标准
工作流整合 Workflow Integration 融入现有流程
----------------------------------------------------------------
## 延伸阅读
1. [MCP官方文档](https://modelcontextprotocol.io/)
[Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629)
+33
View File
@@ -0,0 +1,33 @@
# 第六篇:AI Agent与自主设计
本篇探讨AI Agent的架构和具身智能,展望AI在规划设计中的应用前景。
## 篇章导读
AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行动",从"单一能力"到"系统协同"。
本篇将系统介绍Agent架构和在设计领域的应用。
# 章节目录
1. [05.1 AI Agent架构](05.1-agent-architecture.md) - LLM-based Agent与核心组件
[05.2 具身智能](05.2-embodied-ai.md) - 数字孪生与物理世界交互
[05.3 规划设计应用与MCP](05.3-design-application.md) - MCP协议与HITL协作
# 核心概念
-------------------------------------------------------
概念 英文 说明
---------------- ------------- ------------------------
智能体 Agent 自主决策和行动的系统
具身智能 Embodied AI 有物理实体的智能
人机协作 HITL Human-in-the-Loop
模型上下文协议 MCP Model Context Protocol
-------------------------------------------------------
# 05.1 AI Agent架构
+17
View File
@@ -0,0 +1,17 @@
# 第七部分:数字媒体设计
本部分探讨AI在数字媒体创作领域的应用,包括视觉设计、交互设计和内容生成。
## 篇章导读
数字媒体是AI应用最活跃的领域之一。从图像生成到视频制作,从界面设计到交互体验,AIGC工具正在重塑数字媒体创作的流程和范式。
本部分将系统介绍AI在视觉设计和交互设计中的应用。
## 章节目录
1. [第16章 视觉设计与AIGC](#第16章-视觉设计与aicgc)
[第17章 交互设计](#第17章-交互设计-1)
# 第16章 视觉设计与AIGC
@@ -0,0 +1,72 @@
## 学习目标
1. 了解AIGC在视觉设计中的应用场景
掌握图像生成和风格迁移的基本方法
理解AI辅助品牌视觉设计的流程
## 核心应用
图像生成与风格迁移
---------------------------------------------------------------------------------------
应用类型 说明 工具示例
-------------------------- ---------------------- -------------------------------------
文生图 从文本描述生成图像 Midjourney, Stable Diffusion
图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting
风格迁移 将图像转换为目标风格 Neural Style Transfer
矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI
---------------------------------------------------------------------------------------
Logo与图标设计
### AI辅助流程:
#### 需求分析
`- ``品牌定位`
`- ``目标受众`
`- ``设计风格偏好`
####
`2. ``概念生成`
`- AI``生成多个设计方案`
#### - 快速迭代探索
`3. ``细化优化`
`- ``设计师精修`
`- ``矢量化处理`
- 品牌规范整理
**工具推荐** - LogoAI:自动Logo生成 - Looka:品牌设计套件 - BrandmarkLogo和品牌身份
品牌视觉系统生成
**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成
## 案例分析
**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展
**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比
## 思考与练习
1. AIGC如何改变设计师的创意流程?
2. 在品牌设计中,如何平衡AI生成与原创性?
3. 选择一个AIGC工具,尝试完成一个视觉设计任务
@@ -0,0 +1,76 @@
### 学习目标
1. 了解AI在交互设计中的应用
掌握用户界面自动生成的原理
理解用户体验分析的方法
### 核心应用
用户界面生成
--------------------------------------------------------
功能 说明 工具示例
---------- -------------------- ------------------------
布局生成 自动生成页面布局 Uizard, Galileo AI
组件推荐 基于上下文推荐组件 Figma AI, Motiff
设计系统 自动生成设计规范 Designer, Figma Tokens
原型生成 从描述生成交互原型 TLDraw, Diagram
--------------------------------------------------------
交互原型自动化
**流程**
`用户需求`` → AI``理解`` → ``生成原型`\
` ↓`\
` ``设计师调整优化`\
` ↓`\
` ``可交互原型`
**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档
用户体验分析
**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析
### 案例分析
**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试
**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化
### 思考与练习
1. AI生成的界面如何保证可用性?
2. 在交互设计中,人类设计师的核心价值是什么?
3. 尝试用AI工具生成一个简单的交互原型
### 关键术语
--------------------------------------------------
中文 英文 说明
---------- ---------------- ----------------------
风格迁移 Style Transfer 将图像转换为目标风格
矢量化 Vectorization 转换为可缩放矢量格式
原型 Prototype 可交互的设计模型
设计系统 Design System 组件化设计规范
--------------------------------------------------
### 延伸阅读
1. [Midjourney官方文档](https://docs.midjourney.com/)
[Stable Diffusion提示词指南](https://stable-diffusion-art.com/)
[Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI)
@@ -0,0 +1,17 @@
# 第八部分:环境设计
本部分探讨AI在室内设计、景观设计等环境设计领域的应用。
## 篇章导读
环境设计关注人类与物理空间的关系。AI技术正在改变环境设计的各个环节,从场地分析到方案生成,从效果预览到可持续评估。
本部分将介绍AI在室内设计和景观设计中的应用。
## 章节目录
1. [第18章 室内设计](#第18章-室内设计-1)
[第19章 景观设计](#第19章-景观设计-1)
# 第18章 室内设计
@@ -0,0 +1,62 @@
## 学习目标
1. 了解AI在室内设计中的应用流程
掌握平面图智能生成的方法
理解VR/AR在室内设计预览中的作用
## 核心应用
平面图智能生成
**传统流程 vs AI辅助**
----------------------------------------
环节 传统方式 AI辅助
---------- -------------- --------------
需求分析 人工沟通 自然语言理解
方案生成 手绘/CAD绘制 自动生成布局
家具选择 手动搜索 智能推荐
效果预览 3D建模渲染 实时生成
----------------------------------------
**AI工具** - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型
家具布局优化
**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡
**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习
材质与风格推荐
**推荐流程**
`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\
` ↓`\
` ``生成效果预览`\
` ↓`\
` ``用户反馈迭代`
VR/AR预览
**技术实现** - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果
**工具** - Enscape:实时渲染插件 - Twinmotion:快速可视化 - ArkioVR协作设计
## 案例分析
**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单
## 思考与练习
1. AI如何平衡功能性和美学?
2. VR/AR如何改变室内设计工作流?
3. 尝试使用AI室内设计工具完成一个小空间设计
@@ -0,0 +1,78 @@
### 学习目标
1. 了解AI在景观设计中的应用
掌握场地分析与评估的方法
理解生态效益模拟的技术
### 核心应用
场地分析与评估
**分析维度**
------------------------------------------------
维度 内容 AI方法
------------ -------------------- --------------
地形地貌 高程、坡度、坡向 DEM分析
植被覆盖 类型、密度、健康度 遥感图像分类
水文系统 水系、排水、汇水 水文模拟
视觉景观 视域、视线廊道 视域分析
气候舒适度 风环境、日照、温度 环境模拟
------------------------------------------------
**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模
植被配置优化
**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候
**AI方法** - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果
景观元素生成
**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计
生态效益模拟
**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解
### 案例分析
**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计
### 思考与练习
1. AI如何处理景观设计中的复杂约束?
2. 生态效益模拟的数据从哪里来?
3. 选择一个景观设计场景,分析AI可应用的环节
### 关键术语
-----------------------------------------------
中文 英文 说明
---------- --------------------- --------------
平面图 Floor Plan 水平剖切图
布局优化 Layout Optimization 空间排列优化
动线 Circulation 人员流动路径
视域分析 Viewshed Analysis 可见范围分析
生态效益 Ecological Benefit 生态服务价值
-----------------------------------------------
### 延伸阅读
1. [Landscape Architecture + AI](https://landscapeperformance.org/)
[GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture)
@@ -0,0 +1,17 @@
# 第九部分:工业设计
本部分探讨AI在产品设计、造型优化和制造准备中的应用。
## 篇章导读
工业设计融合美学、工程和商业考量。AI技术正在改变产品开发流程,从概念生成到制造准备,从结构优化到材料选择。
本部分将介绍AI在工业设计中的关键应用。
## 章节目录
1. [第20章 产品造型设计](#第20章-产品造型设计-1)
[第21章 设计优化与制造](#第21章-设计优化与制造-1)
# 第20章 产品造型设计
@@ -0,0 +1,54 @@
## 学习目标
1. 了解AI辅助产品概念设计的方法
掌握草图生成和三维建模的AI工具
理解形态优化的基本原理
## 核心应用
概念草图生成
**流程**
`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\
` ↓`\
` ``设计师选择与迭代`
**工具** - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化
三维建模辅助
**AI辅助功能**
----------------------------------------------------
功能 说明 工具
---------- ------------------- ---------------------
草图转3D 2D草图生成3D模型 Shapr3D, Point-E
模型优化 自动布线、倒角 ZBrush, Blender插件
纹理生成 自动生成材质贴图 Adobe Substance 3D
渲染加速 快速生成产品渲染 NVIDIA Canvas
----------------------------------------------------
形态优化
**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制
**AI方法** - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化
案例分析
**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审
思考与练习
1. AI生成的概念如何保持原创性?
2. 形态优化中如何平衡美学和功能?
3. 尝试用AI工具生成一个产品概念
@@ -0,0 +1,78 @@
学习目标
1. 了解AI在结构优化中的应用
掌握材料选择和可制造性分析方法
理解AI辅助制造准备的技术
### 核心应用
结构优化
**拓扑优化**
`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\
` ↓`\
` ``轻量化与强度平衡`
**AI方法** - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构
**工具** - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化
材料选择
**AI辅助决策**
---------------------------
考虑因素 AI方法
---------- ----------------
力学性能 材料数据库检索
成本 价格预测模型
可持续性 环境影响评估
可加工性 工艺兼容性分析
---------------------------
可制造性分析
**分析内容** - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性
**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算
### 案例分析 {#案例分析-5}
**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造
### 思考与练习 {#思考与练习-21}
1. 拓扑优化的结果如何满足生产工艺要求?
2. AI如何帮助选择可持续材料?
3. 选择一个简单产品,分析AI可优化的环节
### 关键术语
-----------------------------------------------------
中文 英文 说明
------------ ----------------------- ----------------
概念设计 Concept Design 初步设计阶段
拓扑优化 Topology Optimization 结构布局优化
生成式设计 Generative Design AI驱动设计生成
可制造性 Manufacturability 生产可行性
轻量化 Lightweight 减少重量
-----------------------------------------------------
### 延伸阅读
1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design)
[nTopology技术文档](https://ntopology.com/resources/)
+17
View File
@@ -0,0 +1,17 @@
# 第十部分:城市设计
本部分探讨AI在城市规划、空间分析和城市管理中的应用。
## 篇章导读
城市是复杂的系统。AI技术正在为城市设计提供新的视角和工具,从宏观规划到微观设计,从现状分析到未来预测。
本部分将介绍AI在城市设计中的关键应用。
## 章节目录
1. [第22章 城市空间分析](#第22章-城市空间分析-1)
[第23章 规划设计与评估](#第23章-规划设计与其评估)
# 第22章 城市空间分析
@@ -0,0 +1,58 @@
## 学习目标 {#学习目标-24}
1. 了解AI在城市空间分析中的应用
掌握遥感影像和城市形态识别的方法
理解人口与活动分析的技术
## 核心应用
遥感影像分析
### 分析内容:
------------------------------------
内容 方法 应用
---------- ---------- --------------
土地利用 图像分类 规划现状调查
建筑识别 目标检测 建筑普查
变化检测 时序分析 城市扩张监测
环境质量 指数反演 生态评估
------------------------------------
### 技术流程:
`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\
` ↓`\
` ``规划决策支持`
城市形态识别
**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间
**AI方法** - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型
人口与活动分析
**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据
**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点
**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测
## 案例分析 {#案例分析-6}
**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议
## 思考与练习 {#思考与练习-22}
1. 多源数据如何保护隐私?
2. AI分析如何考虑城市的独特性?
3. 选择一个城市问题,分析AI可提供的帮助
@@ -0,0 +1,90 @@
### 学习目标 {#学习目标-25}
1. 了解AI辅助规划设计的方法
掌握交通网络和设施布局优化的技术
理解规划方案评估的AI应用
### 核心应用
用地规划生成
**传统流程 vs AI辅助**
--------------------------------
环节 传统方式 AI辅助
---------- ---------- ----------
现状分析 人工统计 自动识别
方案生成 手绘/CAD 规则生成
规范检查 人工核对 自动验证
方案评估 定性分析 量化评估
--------------------------------
**生成方法** - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计
交通网络优化
**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小
**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测
公共设施布局
**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配
**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题
规划方案评估
**评估维度**
--------------------------------------
维度 指标 AI方法
---------- ---------------- ----------
空间效率 容积率、密度 空间分析
交通影响 出行距离、拥堵 交通模拟
环境影响 碳排放、绿地 环境模型
社会效益 公平性、满意度 社会模型
--------------------------------------
### 案例分析 {#案例分析-7}
**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定
### 思考与练习 {#思考与练习-23}
1. AI生成的规划方案如何体现人文关怀?
2. 如何平衡不同评估维度的冲突?
3. 选择一个规划问题,分析AI的潜在作用
### 关键术语
----------------------------------------------------
中文 英文 说明
------------ ---------------- ----------------------
土地利用 Land Use 土地功能分布
遥感 Remote Sensing 远距离探测技术
图神经网络 GNN Graph Neural Network
通达性 Accessibility 到达便利程度
服务半径 Service Radius 设施服务范围
----------------------------------------------------
### 延伸阅读
1. [Urban AI](https://urbanai.io/)
[Google Environmental Insights Explorer](https://insights.sustainability.google/)
@@ -0,0 +1,17 @@
# 第十一部分:生态设计
本部分探讨AI在生态保护、环境治理和可持续发展中的应用。
## 篇章导读
生态设计关注人类活动与自然环境的和谐。AI技术为生态分析、规划和修复提供了新的工具和方法。
本部分将介绍AI在生态设计中的应用。
## 章节目录
1. [第24章 生态分析与评估](#第24章-生态分析与评估-1)
[第25章 生态规划与修复](#第25章-生态规划与修复-1)
# 第24章 生态分析与评估
@@ -0,0 +1,62 @@
## 学习目标 {#学习目标-26}
1. 了解AI在生态系统服务评估中的应用
掌握生物多样性分析的方法
理解环境质量监测的技术
## 核心应用
生态系统服务评估
**服务类型**
--------------------------------------------
类型 内容 AI应用
---------- ------------------ --------------
供给服务 食物、水、纤维 产量预测
调节服务 气候、洪水、疾病 风险评估
文化服务 娱乐、旅游 游客行为分析
支持服务 营养循环、生境 过程模拟
--------------------------------------------
**评估方法** - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测
生物多样性分析
**分析层次**
--------------------------------------------
层次 内容 AI方法
---------------- ------------ --------------
遗传多样性 基因变异 基因序列分析
物种多样性 物种丰富度 图像识别
生态系统多样性 生境类型 景观分类
--------------------------------------------
**技术应用** - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测
环境质量监测
**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染
**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析
## 案例分析 {#案例分析-8}
**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成
## 思考与练习 {#思考与练习-24}
1. AI如何处理生态数据的复杂性和不确定性?
2. 生物多样性自动识别的准确率如何保证?
3. 选择一个生态问题,分析AI可提供的帮助
@@ -0,0 +1,68 @@
## 学习目标 {#学习目标-27}
1. 了解AI在生态源地识别中的应用
掌握生态网络构建的方法
理解生态修复方案的优化技术
## 核心应用
生态源地识别
**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区
**AI方法** - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序
生态网络构建
**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境
**构建流程**
`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估`
**AI技术** - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计
修复方案优化
**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理
**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性
**AI应用** - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整
## 案例分析 {#案例分析-9}
**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略
## 思考与练习 {#思考与练习-25}
1. 生态网络如何应对气候变化?
2. AI优化的修复方案如何考虑长期效应?
3. 选择一个生态修复场景,分析AI的应用点
## 关键术语
---------------------------------------------------------------
中文 英文 说明
-------------- ----------------------------- ------------------
生态系统服务 Ecosystem Services 自然对人类的益处
生物多样性 Biodiversity 生物种类丰富度
生态源地 Ecological Source 生态核心区
生态廊道 Ecological Corridor 生态连接通道
生态安全格局 Ecological Security Pattern 生态空间布局
---------------------------------------------------------------
## 延伸阅读
1. [Circuitscape](https://circuitscape.org/)
[InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest)
+415
View File
@@ -0,0 +1,415 @@
**作者**CC4SI项目组 **版本**v1.0.0 **更新日期**2026年4月
全书目录
### [上篇:原理与技术](part1-principles/)
# [第一部分:导论](01-introduction/01-introduction.md)
建立读者对人工智能的宏观认知,介绍AI的发展历程和技术范式演进。
> •[第1章 AI发展历程](01-introduction/01-introduction.md#第1章-ai发展历程)
oAmazon Go案例:技术融合
oAI赋能的时间线:2016-2024
oAI四大赛道:AIGC、Agent、AI4S、AIED
o设计领域AI应用趋势
## [第2章 AI范式演进](01-introduction/01-introduction.md#第2章-ai范式演进)
o从规则系统到大模型的三次范式演进
o万能逼近定理与神经网络基础
o神经网络技术栈全景
oScaling Law与模型规模效应
# [第二部分:数学与编程基础](02-foundations/02-foundations.md)
从函数式视角理解AI,介绍神经网络的基本原理和Python编程工具。
> •[第3章 函数式AI视角](02-foundations/02-foundations.md#第3章-函数式ai视角)
o"Functions Describe the World"核心理念
o从Excel到神经网络的演进逻辑
o函数组合与层级抽象
o数据驱动 vs 规则驱动
> •[第4章 多层感知机](02-foundations/02-foundations.md#第4章-多层感知机)
oMLP结构与前向传播
o激活函数:Sigmoid、ReLU、Softmax
o损失函数与优化
o反向传播原理
# [第三部分:计算机视觉原理](03-computer-vision/03-computer-vision.md)
深入讲解计算机视觉的核心技术CNN,以及目标检测和语义分割的基本原理。
[第5章 CNN基础原理](03-computer-vision/03-computer-vision.md#第5章-cnn基础原理)
o为什么需要CNN:局部连接与权重共享
o卷积、激活、池化三大组件
oCNN vs MLP的区别与联系
o经典网络架构:LeNet、AlexNet、VGG、ResNet
[第6章 目标检测](03-computer-vision/03-computer-vision.md#第6章-目标检测)
o从分类到检测的跃迁
oTwo-Stage vs One-Stage检测器
oYOLO系列演进与技术原理
o评估指标:IoU、mAP、COCO数据集
## [第7章 语义分割与空间分析](03-computer-vision/03-computer-vision.md#第7章-语义分割与空间分析)
o图像分析层级:Pixel/patch/Object-Level
o语义分割 vs 实例分割
o分割网络架构:FCN、U-Net、DeepLab
o空间分析应用场景
# [第四部分:Transformer与大模型](04-transformer/04-transformer.md)
介绍革命性的Transformer架构和大语言模型的核心技术。
## [第8章 注意力机制](04-transformer/04-transformer.md#第8章-注意力机制)
oSelf-Attention的动机与原理
oQ、K、V计算过程
oMulti-Head Attention多头注意力
oPositional Encoding位置编码
oSelf-Attention vs CNN对比
## [第9章 Transformer架构](04-transformer/04-transformer.md#第9章-transformer架构)
oEncoder-Decoder结构详解
oEncoder层:Self-Attention + FFN
oDecoder层:Masked + Cross-Attention
o残差连接与层归一化
oToken处理流程
## [第10章 大语言模型技术](04-transformer/04-transformer.md#第10章-大语言模型技术)
o从Transformer到ChatGPT的演进
o预训练与微调范式
oRAG检索增强生成原理
oRLHF人类反馈强化学习
oPrompt工程基础
# [第五部分:生成式AI](05-generative-ai/05-generative-ai.md)
讲解生成模型的发展脉络和Diffusion模型的核心技术。
## [第11章 生成模型演进](05-generative-ai/05-generative-ai.md#第11章-生成模型演进)
o自编码器AE与变分自编码器VAE
o生成对抗网络GAN原理
oDiffusion扩散模型:前向与反向过程
oStable Diffusion架构解析
## [第12章 AIGC工具与技术](05-generative-ai/05-generative-ai.md#第12章-aigc工具与技术)
oControlNet:精确条件控制
oLoRA高效微调技术
oComfyUI模块化工作流
o版权与伦理问题
# [第六部分:AI Agent](06-agent/06-agent.md)
探讨AI Agent的架构、具身智能和自主决策技术。
## [第13章 AI Agent架构](06-agent/06-agent.md#第13章-ai-agent架构)
o从规则系统到LLM-based Agent
oAgent核心组件:感知、规划、记忆、工具
oChain of Thought推理链
oReAct推理行动模式
o单Agent vs 多Agent协作
## [第14章 具身智能](06-agent/06-agent.md#第14章-具身智能)
o具身智能的概念与特点
o数字孪生与物理世界交互
o强化学习基础与Gymnasium环境
o虚拟到真实的迁移挑战
## [第15章 协作与协议](06-agent/06-agent.md#第15章-协作与协议)
oMCP模型上下文协议
oHITL人机协作模式
oAgent落地挑战与解决方向
# [下篇:设计领域应用](part2-applications/)
## [第七部分:数字媒体设计](07-digital-media/07-digital-media.md)
AI在数字媒体创作中的应用,包括视觉设计、交互设计和内容生成。
### [第16章 视觉设计与AIGC](07-digital-media/07-digital-media.md#第16章-视觉设计与aicgc)
o图像生成与风格迁移
oLogo与图标设计
o品牌视觉系统生成
o案例分析
### [第17章 交互设计](07-digital-media/07-digital-media.md#第17章-交互设计)
o用户界面生成
o交互原型自动化
o用户体验分析
o案例分析
## [第八部分:环境设计](08-environmental-design/08-environmental-design.md)
AI在室内设计、景观设计等环境设计领域的应用。
### [第18章 室内设计](08-environmental-design/08-environmental-design.md#第18章-室内设计)
o平面图智能生成
o家具布局优化
o材质与风格推荐
oVR/AR预览
o案例分析
### [第19章 景观设计](08-environmental-design/08-environmental-design.md#第19章-景观设计)
o场地分析与评估
o植被配置优化
o景观元素生成
o生态效益模拟
o案例分析
## [第九部分:工业设计](09-industrial-design/09-industrial-design.md)
AI在产品设计、造型优化和制造准备中的应用。
### [第20章 产品造型设计](09-industrial-design/09-industrial-design.md#第20章-产品造型设计)
o概念草图生成
o三维建模辅助
o形态优化
o案例分析
### [第21章 设计优化与制造](09-industrial-design/09-industrial-design.md#第21章-设计优化与制造)
o结构优化(拓扑优化)
o材料选择
o可制造性分析
o案例分析
## [第十部分:城市设计](10-urban-design/10-urban-design.md)
AI在城市规划、空间分析和城市管理中的应用。
### [第22章 城市空间分析](10-urban-design/10-urban-design.md#第22章-城市空间分析)
o遥感影像分析
o城市形态识别
o人口与活动分析
o案例分析
### [第23章 规划设计与评估](10-urban-design/10-urban-design.md#第23章-规划设计与其评估)
o用地规划生成
o交通网络优化
o公共设施布局
o规划方案评估
o案例分析
## [第十一部分:生态设计](11-ecological-design/11-ecological-design.md)
AI在生态保护、环境治理和可持续发展中的应用。
### [第24章 生态分析与评估](11-ecological-design/11-ecological-design.md#第24章-生态分析与评估)
o生态系统服务评估
o生物多样性分析
o环境质量监测
o案例分析
### [第25章 生态规划与修复](11-ecological-design/11-ecological-design.md#第25章-生态规划与修复)
o生态源地识别
o生态网络构建
o修复方案优化
o案例分析
[附录](appendix/)
[附录A:编程工具与资源](appendix/tools.md)
Python环境配置
深度学习框架
AIGC工具链
Agent开发框架
在线学习资源
[附录B:参考文献](appendix/references.md)
基础理论论文
计算机视觉论文
Transformer与大模型论文
生成式AI论文
AI Agent论文
设计AI应用论文
推荐书籍与在线资源
[附录C:关键术语表](appendix/glossary.md)
中英文术语对照
按章节索引
学习路径建议
面向设计专业学生
上篇选读:01 → 02 → 05 → 06\
下篇重点:根据专业方向选择\
附录:工具资源
# 面向技术实现者
上篇系统学习:全部章节\
下篇按需学习:了解应用场景\
附录:工具资源 + 参考文献
# 面向研究者
上篇重点:02 → 03 → 04\
下篇选读:关注前沿应用\
附录:参考文献
# 核心概念索引
----------------------------------------------------
概念 相关章节 英文术语
------------------ ---------------- ----------------
生成式AI 01, 11, 12, 16 AIGC
智能体 01, 13, 14, 15 AI Agent
卷积神经网络 05, 06, 07 CNN
注意力机制 08, 09, 10 Self-Attention
大语言模型 10, 15 LLM
扩散模型 11, 12, 16 Diffusion
具身智能 14 Embodied AI
检索增强生成 10, 15 RAG
人类反馈强化学习 10 RLHF
模型上下文协议 15 MCP
人机协作 15 HITL
----------------------------------------------------
# 内容特色
**原理先行**:上篇系统讲解AI核心技术原理
**应用导向**:下篇聚焦五大设计领域的AI应用
**案例驱动**:每个应用领域配有真实案例分析
**工具支撑**:附录提供完整的工具与资源指南
**中英双语**:专业术语保留英文,便于深入阅读
# 版本历史
**v1.0.0** (2026-04) - 初始版本发布
**License**: CC BY-NC-SA 4.0
+318
View File
@@ -0,0 +1,318 @@
附录C:关键术语表
本附录按章节整理书中涉及的关键中英文术语。
## A
-------------------------------------------------------
中文 英文 章节
------------------ ----------------------------- ------
自编码器 Autoencoder, AE 11
注意力机制 Attention 8
人类反馈强化学习 RLHF 10
人工智能 AI, Artificial Intelligence 1
AI for Science AI4S 1
AI in Education AIED 1
-------------------------------------------------------
## B
----------------------------------
中文 英文 章节
------------ -------------- ------
边界框 Bounding Box 6
生物多样性 Biodiversity 24
----------------------------------
## C
-------------------------------------------
中文 英文 章节
-------------- ------------------ ---------
卷积神经网络 CNN 5, 6, 7
卷积核 Kernel/Filter 5
因果推断 Causal Inference \-
连通性 Connectivity 25
交叉熵 Cross Entropy 4
-------------------------------------------
## D
-----------------------------------------
中文 英文 章节
-------------- ------------------- ------
扩散模型 Diffusion Model 11
数字孪生 Digital Twin 14
深度学习 Deep Learning 2
设计生成式AI Generative Design 20
-----------------------------------------
## E
------------------------------------------
中文 英文 章节
-------------- -------------------- ------
生态系统服务 Ecosystem Services 24
具身智能 Embodied AI 14
编码器 Encoder 9
解码器 Decoder 9
------------------------------------------
## F
---------------------------------------------
中文 英文 章节
---------- --------------------------- ------
特征图 Feature Map 5
前馈网络 FFN, Feed-Forward Network 2, 9
俯瞰 Foundation Model \-
---------------------------------------------
## G
---------------------------------------------
中文 英文 章节
-------------- ------------------ -----------
生成对抗网络 GAN 11
生成式AI AIGC 1, 11, 16
梯度下降 Gradient Descent 4
图神经网络 GNN 2
---------------------------------------------
## H
-----------------------------------
中文 英文 章节
-------- ------------------- ------
HITL Human-in-the-Loop 15
隐藏层 Hidden Layer 3
超参数 Hyperparameter \-
-----------------------------------
## I
-----------------------------------------
中文 英文 章节
---------- ----------------------- ------
交并比 IoU 6
图像分类 Image Classification 6
实例分割 Instance Segmentation 7
-----------------------------------------
## K
---------------------------------
中文 英文 章节
-------- ----------------- ------
键 Key 8
核函数 Kernel Function \-
---------------------------------
## L
-----------------------------------------
中文 英文 章节
------------ --------------------- ------
大语言模型 LLM 10
损失函数 Loss Function 4
学习率 Learning Rate 4
LoRA Low-Rank Adaptation 12
潜在空间 Latent Space 11
-----------------------------------------
## M
--------------------------------------------
中文 英文 章节
------------ ------------------------ ------
多头注意力 Multi-Head Attention 8
多层感知机 MLP 3, 4
多模态 Multimodal 10
MCP Model Context Protocol 15
平均精度 mAP 6
--------------------------------------------
## N
--------------------------------------
中文 英文 章节
-------------- ---------------- ------
归一化 Normalization 9
神经网络 Neural Network 2
非极大值抑制 NMS 6
--------------------------------------
## O
---------------------------------------------
中文 英文 章节
----------------- -------------------- ------
目标检测 Object Detection 6
优化器 Optimizer 4
One-Stage检测器 One-Stage Detector 6
---------------------------------------------
## P
---------------------------------------
中文 英文 章节
---------- --------------------- ------
位置编码 Positional Encoding 8
池化 Pooling 5
提示工程 Prompt Engineering 10
预训练 Pre-training 10
像素 Pixel 7
---------------------------------------
## Q
---------------------------
中文 英文 章节
------- ------------ ------
查询 Query 8
Q学习 Q-Learning 14
---------------------------
## R
------------------------------------------------------
中文 英文 章节
-------------- -------------------------------- ------
RAG Retrieval-Augmented Generation 10
ReAct Reasoning + Acting 13
强化学习 RL, Reinforcement Learning 14
循环神经网络 RNN 2
残差连接 Residual Connection 9
值 Value 8
感受野 Receptive Field 5
------------------------------------------------------
## S
-----------------------------------------------
中文 英文 章节
---------------- ----------------------- ------
Self-Attention 自注意力 8
语义分割 Semantic Segmentation 7
Scaling Law 缩放定律 2
Sigmoid 激活函数 4
Softmax 激活函数 4
境况 State 14
潜变量 Latent Variable 11
支持向量机 SVM \-
-----------------------------------------------
## T
--------------------------------------------
中文 英文 章节
------------- ----------------------- ------
Transformer Transformer架构 9
拓扑优化 Topology Optimization 21
Token 令牌/词元 9
目标检测 Two-Stage Detector 6
--------------------------------------------
## U
-------------------------------------------------------
中文 英文 章节
-------------- --------------------------------- ------
万能逼近定理 Universal Approximation Theorem 2
U-Net 分割网络架构 7
-------------------------------------------------------
## V
--------------------------------------------------
中文 英文 章节
----------------- ------------------------- ------
VAE Variational Autoencoder 11
向量数据库 Vector Database 10
视觉Transformer Vision Transformer 5
--------------------------------------------------
## W
----------------------------------
中文 英文 章节
---------- ---------------- ------
权重 Weight 3
权重共享 Weight Sharing 5
权重衰减 Weight Decay \-
----------------------------------
## Y
-----------------------------------
中文 英文 章节
------- -------------------- ------
YOLO You Only Look Once 6
-----------------------------------
**更新日期**2026年4月
+127
View File
@@ -0,0 +1,127 @@
参考文献
本部分整理教材中引用的论文、书籍和在线资源。
论文
# 基础理论
4. Universal Approximation Theorem (1989)
Scaling Laws for Neural Language Models (2020)
# 计算机视觉
6. AlexNet (2012) - ImageNet Classification with Deep Convolutional Neural Networks
ResNet (2015) - Deep Residual Learning for Image Recognition
YOLO (2016) - You Only Look Once: Unified, Real-Time Object Detection
U-Net (2015) - Convolutional Networks for Biomedical Image Segmentation
# Transformer与大模型
10. Attention Is All You Need (2017)
BERT: Pre-training of Deep Bidirectional Transformers (2018)
GPT-3: Language Models are Few-Shot Learners (2020)
Training Language Models to Follow Instructions with Human Feedback (2022)
# 生成式AI
14. Denoising Diffusion Probabilistic Models (2020)
High-Resolution Image Synthesis with Latent Diffusion Models (2022)
ControlNet (2023)
# AI Agent
1. LLM Powered Autonomous Agents (2023)
2. ReAct: Synergizing Reasoning and Acting in Language Models (2022)
3.
# 书籍
5. 深度学习
6. Deep Learning (Ian Goodfellow et al.)
7. Neural Networks and Deep Learning (Michael Nielsen)
8. 强化学习
9. Reinforcement Learning: An Introduction (Sutton & Barto)
10.
# 在线资源
12. 课程
13. CS231n: Convolutional Neural Networks for Visual Recognition
14. Fast.ai Practical Deep Learning for Coders
## 工具文档
16. PyTorch: https://pytorch.org/docs/
17. Ultralytics YOLO: https://docs.ultralytics.com/
18. LangChain: https://python.langchain.com/
## 博客
20. Lil'Log (Lilian Weng): https://lilianweng.github.io/
21. The Illustrated Transformer: https://jalammar.github.io/illustrated-transformer/
22.
# 设计AI相关
## 学术期刊
25. Landscape and Urban Planning
26. Environment and Planning B: Urban Analytics and City Science
27. Automation in Construction
## 会议
29. CAAD Futures
30. ACADIA
31. eCAADe
32.
# 数据集
## 计算机视觉
35. ImageNet
36. COCO (Common Objects in Context)
37. MNIST
## 空间数据
39. OpenStreetMap
40. 路网数据、POI数据等
# 许可说明
部分内容引用自公开资源,遵循相应许可协议使用。
**最后更新**2026年4月
+207
View File
@@ -0,0 +1,207 @@
附录A:编程工具与资源
本附录整理AI学习和实践所需的编程工具、框架和资源。
# Python环境配置
## Anaconda/Miniconda
-----------------------------------------------------------------------------------------------------------------
工具 大小 特点 下载地址
------------- ---------------- ---------------- -----------------------------------------------------------------
Anaconda \~500MB 预装常用库 [anaconda.com](https://www.anaconda.com/download)
Miniconda \~50MB 精简安装 [docs.conda.io](https://docs.conda.io/en/latest/miniconda.html)
-----------------------------------------------------------------------------------------------------------------
## 安装步骤
\# 1. 下载并安装Miniconda\
\# 2. 创建虚拟环境\
conda create -n ai-env python=3.10\
\
\# 3. 激活环境\
conda activate ai-env\
\
\# 4. 安装核心库\
pip install torch torchvision numpy pandas scipy
# 深度学习框架
## PyTorch
`pip`` install torch ``torchvision`` ``torchaudio`
**特点**: - 动态计算图 - 研究友好 - 广泛的社区支持
**资源** - [官方文档](https://pytorch.org/docs/) - [中文教程](https://pytorch.zhangxiann.com/)
## TensorFlow
`pip`` install ``tensorflow`
**特点**: - 生产部署优化 - Keras高级API - 跨平台支持
# 计算机视觉工具
OpenCV
`pip`` install ``opencv``-python`
**功能**:图像处理、视频分析
Ultralytics YOLO
`pip`` install ``ultralytics`
**功能**:目标检测、实例分割
**使用示例**
`from`` ``ultralytics`` ``import`` YOLO`\
\
`model ``=`` YOLO(``'yolov8n.pt'``)`\
`results ``=`` model(``'image.jpg'``)`
# AIGC工具链
## Stable Diffusion
**WebUI**[Automatic1111](https://github.com/AUTOMATIC1111/stable-diffusion-webui)
**ComfyUI**[GitHub](https://github.com/comfyanonymous/ComfyUI)
**API调用**
`from`` diffusers ``import`` ``StableDiffusionPipeline`\
\
`pipe ``=`` StableDiffusionPipeline.from_pretrained(``"runwayml/stable-diffusion-v1-5"``)`\
`image ``=`` ``pipe(``"a photo of an astronaut riding a horse on mars"``).images[``0``]`
## ControlNet
`from`` diffusers ``import`` ``StableDiffusionControlNetPipeline`\
\
`controlnet`` ``=`` ControlNetModel.from_pretrained(``"lllyasviel/sd-controlnet-canny"``)`\
`pipe ``=`` StableDiffusionControlNetPipeline.from_``pretrained(``"runwayml/stable-diffusion-v1-5"``, ``controlnet``=``controlnet``)`
## Midjourney
**平台**Discord **文档**[docs.midjourney.com](https://docs.midjourney.com/)
# Agent开发框架
## LangChain
`pip`` install ``langchain`` ``langchain-openai`
**功能**LLM应用开发框架
**核心组件** - ModelsLLM接口 - Prompts:提示管理 - Chains:链式调用 - Agents:智能体 - Memory:记忆管理
LangGraph
`pip`` install ``langgraph`
**功能**:状态机式Agent开发
LlamaIndex
`pip`` install llama-index`
**功能**:数据索引与检索(RAG
# 开发工具
VSCode
**AI开发常用插件** - Python - Pylance - Jupyter - Copilot
## Cursor
**特点**AI原生IDE **网址**[cursor.com](https://cursor.com/)
## Jupyter Lab
`pip`` install ``jupyterlab`\
`jupyter`` lab`
# 在线学习资源
## 课程
--------------------------------------------------------------------------------------------------------------------------------------------------
名称 平台 链接
------------------- ----------------------- ------------------------------------------------------------------------------------------------------
CS231n Stanford [cs231n.stanford.edu](http://cs231n.stanford.edu/)
Fast.ai fast.ai [course.fast.ai](https://course.fast.ai/)
吴恩达深度学习 Coursera [coursera.org/specializations/deep-learning](https://www.coursera.org/specializations/deep-learning)
--------------------------------------------------------------------------------------------------------------------------------------------------
## 博客与文档
1. [Lil'Log](https://lilianweng.github.io/) - AI深度文章
[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/)
[Distill.pub](https://distill.pub/) - 可视化论文
## 数据集
-------------------------------------------------------------------------------------------------------
数据集 内容 链接
-------------------------- ---------------------- -----------------------------------------------------
ImageNet 图像分类 [image-net.org](https://www.image-net.org/)
COCO 目标检测 [cocodataset.org](https://cocodataset.org/)
OpenStreetMap 地图数据 [openstreetmap.org](https://www.openstreetmap.org/)
-------------------------------------------------------------------------------------------------------
# 模型资源
## Hugging Face
**网址**[huggingface.co](https://huggingface.co/)
**功能**: - 模型仓库 - 数据集 - Spaces在线演示
## 常用模型
-----------------------------------------------------------------------------
任务 推荐模型 Hugging Face ID
------------ --------------------- ------------------------------------------
文生图 Stable Diffusion XL stabilityai/stable-diffusion-xl-base-1.0
目标检测 YOLOv8 Ultralytics
语义分割 SAM segment-anything
大语言模型 Llama 3 meta-llama/Meta-Llama-3-8B
-----------------------------------------------------------------------------
# 硬件资源
## 云平台
----------------------------------------
平台 特点 适合场景
------------------ ---------- ----------
Google Colab 免费GPU 学习实验
Kaggle Notebooks 免费GPU 竞赛
AutoDL 按时计费 中期项目
阿里云PAI 国内稳定 生产部署
----------------------------------------
## 本地GPU
推荐配置: - GPURTX 3060 (12GB) 或更高 - 内存:16GB+ - 存储:至少100GB SSD
# 最后更新
2026年4月