合并子章节到父文件,每个篇章归为单文件
将 11 个目录下的 26 个子章节文件合并到对应的父文件中, 用 --- 分隔各子章节,移除冗余的章节目录索引。 每个篇章现在是独立的单文件,结构更简洁。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
@@ -1,150 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
了解AI技术发展的关键时间节点
|
||||
|
||||
理解AI四大赛道及其应用场景
|
||||
|
||||
掌握设计领域AI应用的现状与趋势
|
||||
|
||||
# Amazon Go:AI赋能的典型案例
|
||||
|
||||
## 案例背景
|
||||
|
||||
Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。
|
||||
|
||||
## 技术要素
|
||||
|
||||
Amazon Go的AI技术栈融合了多项前沿技术:
|
||||
|
||||
--------------------------------------------------
|
||||
技术 作用 应用场景
|
||||
------------ ---------------- --------------------
|
||||
5G通信 低延迟数据传输 实时视频流处理
|
||||
|
||||
3D传感器 深度信息获取 空间定位与手势识别
|
||||
|
||||
计算机视觉 图像理解 商品识别、行为分析
|
||||
|
||||
传感器融合 多源数据整合 精确定位与跟踪
|
||||
--------------------------------------------------
|
||||
|
||||
## 启示
|
||||
|
||||
Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走",AI让交互变得更加自然。
|
||||
|
||||
# AI赋能的时间线:2016-2024
|
||||
|
||||
## 第一阶段:觉醒期 (2016-2018)
|
||||
|
||||
**2016**:AlphaGo击败李世石,AI进入公众视野
|
||||
|
||||
**2017**:Transformer架构诞生,为大模型时代奠基
|
||||
|
||||
**2018**:BERT预训练模型问世,NLP任务取得突破
|
||||
|
||||
## 第二阶段:爆发期 (2019-2022)
|
||||
|
||||
**2019**:GPT-2展示强大的文本生成能力
|
||||
|
||||
**2020**:GPT-3发布,少样本学习能力震惊业界
|
||||
|
||||
**2022**:ChatGPT发布,AI对话能力达到新高度
|
||||
|
||||
## 第三阶段:应用期 (2023-2024)
|
||||
|
||||
**2023**:多模态大模型、AI Agent概念兴起
|
||||
|
||||
**2024**:具身智能、端侧AI加速落地
|
||||
|
||||
# AI四大赛道
|
||||
|
||||
## 1. AIGC (AI-Generated Content)
|
||||
|
||||
**定义**:人工智能生成内容
|
||||
|
||||
**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效
|
||||
|
||||
**设计影响**:从"工具辅助"到"生成伙伴"
|
||||
|
||||
## 2. Agent (智能体)
|
||||
|
||||
**定义**:能够自主感知、规划、执行的系统
|
||||
|
||||
**核心能力**: - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源
|
||||
|
||||
**设计影响**:从"被动执行"到"主动协作"
|
||||
|
||||
## 3. AI4S (AI for Science)
|
||||
|
||||
**定义**:AI驱动科学发现
|
||||
|
||||
**应用领域**: - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化
|
||||
|
||||
**设计影响**:数据驱动的设计决策
|
||||
|
||||
## 4. AIED (AI in Education)
|
||||
|
||||
**定义**:AI在教育领域的应用
|
||||
|
||||
**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建
|
||||
|
||||
**设计影响**:设计教育与人才培养模式变革
|
||||
|
||||
# 设计领域AI应用趋势
|
||||
|
||||
## 当前应用
|
||||
|
||||
----------------------------------------
|
||||
领域 AI应用 成熟度
|
||||
---------- -------------------- --------
|
||||
建筑设计 图纸生成、方案优化 中
|
||||
|
||||
景观设计 场地分析、植被配置 中
|
||||
|
||||
室内设计 家具布局、风格迁移 高
|
||||
|
||||
平面设计 Logo生成、排版辅助 高
|
||||
|
||||
交互设计 用户研究、原型生成 低
|
||||
----------------------------------------
|
||||
|
||||
## 未来趋势
|
||||
|
||||
1.**从单点工具到系统化解决方案**
|
||||
|
||||
2.**从生成内容到生成决策**
|
||||
|
||||
3.**从人机协作到人机共生**
|
||||
|
||||
# 思考与练习
|
||||
|
||||
1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力
|
||||
|
||||
2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么?
|
||||
|
||||
3.Amazon Go案例中,哪些AI技术可以迁移到设计领域?
|
||||
|
||||
# 关键术语
|
||||
|
||||
--------------------------------------------------------
|
||||
中文 英文 说明
|
||||
----------------- --------------- ----------------------
|
||||
生成式AI AIGC AI-Generated Content
|
||||
|
||||
智能体 Agent 自主决策系统
|
||||
|
||||
AI for Science AI4S AI驱动科学研究
|
||||
|
||||
AI in Education AIED AI教育应用
|
||||
|
||||
传感器融合 Sensor Fusion 多传感器数据整合
|
||||
--------------------------------------------------------
|
||||
|
||||
# 延伸阅读
|
||||
|
||||
[Amazon Go技术解析](https://amazon.go/technology)
|
||||
|
||||
[AIGC产业发展报告](https://www.caict.ac.cn/)
|
||||
|
||||
[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进
|
||||
@@ -1,226 +0,0 @@
|
||||
|
||||
# 学习目标
|
||||
|
||||
理解AI范式的三次演进
|
||||
|
||||
掌握万能逼近定理的直观意义
|
||||
|
||||
建立神经网络技术栈的完整认知
|
||||
|
||||
理解Scaling Law与模型规模效应
|
||||
|
||||
# AI范式的三次演进
|
||||
|
||||
## 第一范式:规则系统 (Symbolic AI)
|
||||
|
||||
**时期**:1950s - 1980s
|
||||
|
||||
**核心思想**:人类专家编写规则
|
||||
|
||||
**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱
|
||||
|
||||
**典型应用**:专家系统、棋类游戏
|
||||
|
||||
## 第二范式:机器学习 (Machine Learning)
|
||||
|
||||
**时期**:1990s - 2010s
|
||||
|
||||
**核心思想**:从数据中学习规律
|
||||
|
||||
**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定
|
||||
|
||||
**典型应用**:推荐系统、图像分类、语音识别
|
||||
|
||||
## 第三范式:深度学习 (Deep Learning)
|
||||
|
||||
**时期**:2012 - 至今
|
||||
|
||||
**核心思想**:端到端学习,自动提取特征
|
||||
|
||||
**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强
|
||||
|
||||
**典型应用**:大语言模型、生成式AI、自动驾驶
|
||||
|
||||
# 万能逼近定理
|
||||
|
||||
## 定理表述
|
||||
|
||||
**Universal Approximation Theorem (1989)**:
|
||||
|
||||
一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。
|
||||
|
||||
## 直观理解
|
||||
|
||||
想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面
|
||||
|
||||
## 启示
|
||||
|
||||
这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。
|
||||
|
||||
这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。
|
||||
|
||||
# 神经网络技术栈全景
|
||||
|
||||
`┌─────────────────────────────────────────────────────────────┐`\
|
||||
`│ ``应用层`` │`\
|
||||
`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``模型层`` │`\
|
||||
`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``算法层`` │`\
|
||||
`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``数学层`` │`\
|
||||
`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\
|
||||
`└─────────────────────────────────────────────────────────────┘`
|
||||
|
||||
## 技术演进路径
|
||||
|
||||
------------------------------------------
|
||||
时代 代表技术 突破点
|
||||
------- ------------- --------------------
|
||||
1980s MLP 万能逼近定理
|
||||
|
||||
1990s CNN 局部连接、权重共享
|
||||
|
||||
2000s RNN/LSTM 序列建模
|
||||
|
||||
2010s GNN 图结构数据
|
||||
|
||||
2017 Transformer Self-Attention
|
||||
|
||||
2020s Diffusion 生成质量突破
|
||||
------------------------------------------
|
||||
|
||||
## 模型家族关系
|
||||
|
||||
`MLP (``多层感知机``)`\
|
||||
` │`\
|
||||
` ┌──────────────┼──────────────┐`\
|
||||
` │ │ │`\
|
||||
` CNN GNN RNN`\
|
||||
` (``空间数据``) (``图数据``) (``序列数据``)`\
|
||||
` │ │ │`\
|
||||
` └──────────────┼──────────────┘`\
|
||||
` │`\
|
||||
` Transformer`\
|
||||
` │`\
|
||||
` ┌──────────────┼──────────────┐`\
|
||||
` │ │ │`\
|
||||
` GPT``系列`` BERT Diffusion`\
|
||||
` (``生成式``) (``理解式``) (``图像生成``)`
|
||||
|
||||
# Scaling Law:规模即智能
|
||||
|
||||
## 什么是Scaling Law
|
||||
|
||||
Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系:
|
||||
|
||||
**模型性能 ≈ f(计算量, 数据量, 参数量)**
|
||||
|
||||
## 核心发现
|
||||
|
||||
### 1.性能随规模对数增长
|
||||
|
||||
o模型越大,性能越好
|
||||
|
||||
o增长是可预测的
|
||||
|
||||
#### 2.计算效率最关键
|
||||
|
||||
o计算量增加10倍 → 性能提升约1.5倍
|
||||
|
||||
o数据量和参数量也有类似规律
|
||||
|
||||
#### 3.没有看到天花板
|
||||
|
||||
o在现有规模下,性能提升仍在继续
|
||||
|
||||
### 启示
|
||||
|
||||
**大模型时代**:规模成为竞争壁垒
|
||||
|
||||
**数据为王**:高质量数据比模型架构更重要
|
||||
|
||||
**算力需求**:AI发展依赖硬件进步
|
||||
|
||||
从函数式视角看AI演进
|
||||
|
||||
### 核心理念
|
||||
|
||||
**"Functions Describe the World"(函数描述世界)**
|
||||
|
||||
物理定律:F = ma
|
||||
|
||||
经济规律:Supply = Demand(Price)
|
||||
|
||||
神经网络:y = f(x; θ)
|
||||
|
||||
### AI即函数组合
|
||||
|
||||
`输入数据`` x`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₁(x) │ ``第一层函数:特征提取`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₂(h) │ ``第二层函数:模式识别`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₃(z) │ ``第三层函数:决策输出`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`输出`` y`
|
||||
|
||||
从Excel到神经网络
|
||||
|
||||
------------------------------------
|
||||
Excel 神经网络
|
||||
--------------------- --------------
|
||||
y = ax + b 单层感知机
|
||||
|
||||
y = a₁x₁ + a₂x₂ + b 多输入神经元
|
||||
|
||||
嵌套IF函数 多层网络
|
||||
|
||||
宏函数 自动微分
|
||||
------------------------------------
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么?
|
||||
|
||||
2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡?
|
||||
|
||||
3.从函数式视角理解AI,对你理解设计问题有何启发?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-------------------------------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------------------- --------------------------------- ----------------------------
|
||||
万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证
|
||||
|
||||
缩放定律 Scaling Law 模型性能与规模的关系
|
||||
|
||||
前馈网络 Feed-Forward Network 信息单向传播的神经网络
|
||||
|
||||
多层感知机 MLP Multi-Layer Perceptron
|
||||
|
||||
端到端学习 End-to-End Learning 从输入直接学习到输出
|
||||
-------------------------------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)
|
||||
|
||||
[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem)
|
||||
|
||||
[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x)
|
||||
@@ -1,6 +1,6 @@
|
||||
# 第一篇:导论
|
||||
|
||||
本篇建立读者对人工智能的宏观认知,介绍AI的发展历程和范式演进,帮助读者理解AI技术的全貌和发展趋势。
|
||||
本篇作为全书的开篇,旨在帮助读者建立对人工智能的宏观认知框架。我们将从AI的发展历程出发,回顾从早期符号主义到深度学习、再到大模型时代的关键技术突破与转折节点;进而梳理AI的范式演进,从感知智能到生成式智能、从单一任务到通用智能的发展脉络,帮助读者理解AI技术的全貌和未来趋势。这一宏观视角的建立,将为后续各篇中AI与设计实践的结合提供必要的技术认知基础。
|
||||
|
||||
## 篇章导读
|
||||
|
||||
@@ -10,42 +10,382 @@
|
||||
|
||||
通过本篇学习,你将建立对AI的宏观认知,理解技术发展的脉络,为后续深入学习打下基础。
|
||||
|
||||
## 章节目录
|
||||
|
||||
[00.1 AI发展历程](00.1-ai-overview.md) - 从Amazon Go到AI赋能
|
||||
|
||||
[00.2 AI范式演进](00.2-ai-paradigm.md) - 技术栈全景与发展趋势
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
完成本篇后,你将能够:
|
||||
了解AI技术发展的关键时间节点
|
||||
|
||||
描述AI发展的关键节点和技术突破
|
||||
理解AI四大赛道及其应用场景
|
||||
|
||||
理解AI四大赛道的区别和应用场景
|
||||
掌握设计领域AI应用的现状与趋势
|
||||
|
||||
掌握神经网络技术家族的演进脉络
|
||||
# Amazon Go:AI赋能的典型案例
|
||||
|
||||
建立AI技术栈的完整认知框架
|
||||
## 案例背景
|
||||
|
||||
## 核心概念
|
||||
Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。
|
||||
|
||||
------------------------------------------------------------------
|
||||
概念 英文 说明
|
||||
----------------- ------- ----------------------------------------
|
||||
生成式AI AIGC AI-Generated Content,人工智能生成内容
|
||||
## 技术要素
|
||||
|
||||
智能体 Agent 能够自主感知、决策和行动的系统
|
||||
Amazon Go的AI技术栈融合了多项前沿技术:
|
||||
|
||||
AI for Science AI4S AI驱动科学发现
|
||||
--------------------------------------------------
|
||||
技术 作用 应用场景
|
||||
------------ ---------------- --------------------
|
||||
5G通信 低延迟数据传输 实时视频流处理
|
||||
|
||||
AI in Education AIED AI在教育领域的应用
|
||||
------------------------------------------------------------------
|
||||
3D传感器 深度信息获取 空间定位与手势识别
|
||||
|
||||
## 延伸思考
|
||||
计算机视觉 图像理解 商品识别、行为分析
|
||||
|
||||
1.AI技术发展呈现加速趋势,这对设计行业意味着什么?
|
||||
传感器融合 多源数据整合 精确定位与跟踪
|
||||
--------------------------------------------------
|
||||
|
||||
2.在AIGC、Agent、AI4S、AIED四个方向中,你认为哪个对设计领域影响最大?
|
||||
## 启示
|
||||
|
||||
3.了解AI技术演进后,你认为设计师应该掌握哪些AI相关技能? \# 00.1 AI发展历程
|
||||
Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走",AI让交互变得更加自然。
|
||||
|
||||
# AI赋能的时间线:2016-2024
|
||||
|
||||
## 第一阶段:觉醒期 (2016-2018)
|
||||
|
||||
**2016**:AlphaGo击败李世石,AI进入公众视野
|
||||
|
||||
**2017**:Transformer架构诞生,为大模型时代奠基
|
||||
|
||||
**2018**:BERT预训练模型问世,NLP任务取得突破
|
||||
|
||||
## 第二阶段:爆发期 (2019-2022)
|
||||
|
||||
**2019**:GPT-2展示强大的文本生成能力
|
||||
|
||||
**2020**:GPT-3发布,少样本学习能力震惊业界
|
||||
|
||||
**2022**:ChatGPT发布,AI对话能力达到新高度
|
||||
|
||||
## 第三阶段:应用期 (2023-2024)
|
||||
|
||||
**2023**:多模态大模型、AI Agent概念兴起
|
||||
|
||||
**2024**:具身智能、端侧AI加速落地
|
||||
|
||||
# AI四大赛道
|
||||
|
||||
## 1. AIGC (AI-Generated Content)
|
||||
|
||||
**定义**:人工智能生成内容
|
||||
|
||||
**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效
|
||||
|
||||
**设计影响**:从"工具辅助"到"生成伙伴"
|
||||
|
||||
## 2. Agent (智能体)
|
||||
|
||||
**定义**:能够自主感知、规划、执行的系统
|
||||
|
||||
**核心能力**: - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源
|
||||
|
||||
**设计影响**:从"被动执行"到"主动协作"
|
||||
|
||||
## 3. AI4S (AI for Science)
|
||||
|
||||
**定义**:AI驱动科学发现
|
||||
|
||||
**应用领域**: - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化
|
||||
|
||||
**设计影响**:数据驱动的设计决策
|
||||
|
||||
## 4. AIED (AI in Education)
|
||||
|
||||
**定义**:AI在教育领域的应用
|
||||
|
||||
**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建
|
||||
|
||||
**设计影响**:设计教育与人才培养模式变革
|
||||
|
||||
# 设计领域AI应用趋势
|
||||
|
||||
## 当前应用
|
||||
|
||||
----------------------------------------
|
||||
领域 AI应用 成熟度
|
||||
---------- -------------------- --------
|
||||
建筑设计 图纸生成、方案优化 中
|
||||
|
||||
景观设计 场地分析、植被配置 中
|
||||
|
||||
室内设计 家具布局、风格迁移 高
|
||||
|
||||
平面设计 Logo生成、排版辅助 高
|
||||
|
||||
交互设计 用户研究、原型生成 低
|
||||
----------------------------------------
|
||||
|
||||
## 未来趋势
|
||||
|
||||
1.**从单点工具到系统化解决方案**
|
||||
|
||||
2.**从生成内容到生成决策**
|
||||
|
||||
3.**从人机协作到人机共生**
|
||||
|
||||
# 思考与练习
|
||||
|
||||
1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力
|
||||
|
||||
2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么?
|
||||
|
||||
3.Amazon Go案例中,哪些AI技术可以迁移到设计领域?
|
||||
|
||||
# 关键术语
|
||||
|
||||
--------------------------------------------------------
|
||||
中文 英文 说明
|
||||
----------------- --------------- ----------------------
|
||||
生成式AI AIGC AI-Generated Content
|
||||
|
||||
智能体 Agent 自主决策系统
|
||||
|
||||
AI for Science AI4S AI驱动科学研究
|
||||
|
||||
AI in Education AIED AI教育应用
|
||||
|
||||
传感器融合 Sensor Fusion 多传感器数据整合
|
||||
--------------------------------------------------------
|
||||
|
||||
# 延伸阅读
|
||||
|
||||
[Amazon Go技术解析](https://amazon.go/technology)
|
||||
|
||||
[AIGC产业发展报告](https://www.caict.ac.cn/)
|
||||
|
||||
[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进
|
||||
|
||||
---
|
||||
|
||||
# 学习目标
|
||||
|
||||
理解AI范式的三次演进
|
||||
|
||||
掌握万能逼近定理的直观意义
|
||||
|
||||
建立神经网络技术栈的完整认知
|
||||
|
||||
理解Scaling Law与模型规模效应
|
||||
|
||||
# AI范式的三次演进
|
||||
|
||||
## 第一范式:规则系统 (Symbolic AI)
|
||||
|
||||
**时期**:1950s - 1980s
|
||||
|
||||
**核心思想**:人类专家编写规则
|
||||
|
||||
**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱
|
||||
|
||||
**典型应用**:专家系统、棋类游戏
|
||||
|
||||
## 第二范式:机器学习 (Machine Learning)
|
||||
|
||||
**时期**:1990s - 2010s
|
||||
|
||||
**核心思想**:从数据中学习规律
|
||||
|
||||
**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定
|
||||
|
||||
**典型应用**:推荐系统、图像分类、语音识别
|
||||
|
||||
## 第三范式:深度学习 (Deep Learning)
|
||||
|
||||
**时期**:2012 - 至今
|
||||
|
||||
**核心思想**:端到端学习,自动提取特征
|
||||
|
||||
**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强
|
||||
|
||||
**典型应用**:大语言模型、生成式AI、自动驾驶
|
||||
|
||||
# 万能逼近定理
|
||||
|
||||
## 定理表述
|
||||
|
||||
**Universal Approximation Theorem (1989)**:
|
||||
|
||||
一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。
|
||||
|
||||
## 直观理解
|
||||
|
||||
想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面
|
||||
|
||||
## 启示
|
||||
|
||||
这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。
|
||||
|
||||
这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。
|
||||
|
||||
# 神经网络技术栈全景
|
||||
|
||||
`┌─────────────────────────────────────────────────────────────┐`\
|
||||
`│ ``应用层`` │`\
|
||||
`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``模型层`` │`\
|
||||
`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``算法层`` │`\
|
||||
`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\
|
||||
`├─────────────────────────────────────────────────────────────┤`\
|
||||
`│ ``数学层`` │`\
|
||||
`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\
|
||||
`└─────────────────────────────────────────────────────────────┘`
|
||||
|
||||
## 技术演进路径
|
||||
|
||||
------------------------------------------
|
||||
时代 代表技术 突破点
|
||||
------- ------------- --------------------
|
||||
1980s MLP 万能逼近定理
|
||||
|
||||
1990s CNN 局部连接、权重共享
|
||||
|
||||
2000s RNN/LSTM 序列建模
|
||||
|
||||
2010s GNN 图结构数据
|
||||
|
||||
2017 Transformer Self-Attention
|
||||
|
||||
2020s Diffusion 生成质量突破
|
||||
------------------------------------------
|
||||
|
||||
## 模型家族关系
|
||||
|
||||
`MLP (``多层感知机``)`\
|
||||
` │`\
|
||||
` ┌──────────────┼──────────────┐`\
|
||||
` │ │ │`\
|
||||
` CNN GNN RNN`\
|
||||
` (``空间数据``) (``图数据``) (``序列数据``)`\
|
||||
` │ │ │`\
|
||||
` └──────────────┼──────────────┘`\
|
||||
` │`\
|
||||
` Transformer`\
|
||||
` │`\
|
||||
` ┌──────────────┼──────────────┐`\
|
||||
` │ │ │`\
|
||||
` GPT``系列`` BERT Diffusion`\
|
||||
` (``生成式``) (``理解式``) (``图像生成``)`
|
||||
|
||||
# Scaling Law:规模即智能
|
||||
|
||||
## 什么是Scaling Law
|
||||
|
||||
Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系:
|
||||
|
||||
**模型性能 ≈ f(计算量, 数据量, 参数量)**
|
||||
|
||||
## 核心发现
|
||||
|
||||
### 1.性能随规模对数增长
|
||||
|
||||
o模型越大,性能越好
|
||||
|
||||
o增长是可预测的
|
||||
|
||||
#### 2.计算效率最关键
|
||||
|
||||
o计算量增加10倍 → 性能提升约1.5倍
|
||||
|
||||
o数据量和参数量也有类似规律
|
||||
|
||||
#### 3.没有看到天花板
|
||||
|
||||
o在现有规模下,性能提升仍在继续
|
||||
|
||||
### 启示
|
||||
|
||||
**大模型时代**:规模成为竞争壁垒
|
||||
|
||||
**数据为王**:高质量数据比模型架构更重要
|
||||
|
||||
**算力需求**:AI发展依赖硬件进步
|
||||
|
||||
从函数式视角看AI演进
|
||||
|
||||
### 核心理念
|
||||
|
||||
**"Functions Describe the World"(函数描述世界)**
|
||||
|
||||
物理定律:F = ma
|
||||
|
||||
经济规律:Supply = Demand(Price)
|
||||
|
||||
神经网络:y = f(x; θ)
|
||||
|
||||
### AI即函数组合
|
||||
|
||||
`输入数据`` x`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₁(x) │ ``第一层函数:特征提取`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₂(h) │ ``第二层函数:模式识别`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`┌─────────┐`\
|
||||
`│ f₃(z) │ ``第三层函数:决策输出`\
|
||||
`└─────────┘`\
|
||||
` │`\
|
||||
` ▼`\
|
||||
`输出`` y`
|
||||
|
||||
从Excel到神经网络
|
||||
|
||||
------------------------------------
|
||||
Excel 神经网络
|
||||
--------------------- --------------
|
||||
y = ax + b 单层感知机
|
||||
|
||||
y = a₁x₁ + a₂x₂ + b 多输入神经元
|
||||
|
||||
嵌套IF函数 多层网络
|
||||
|
||||
宏函数 自动微分
|
||||
------------------------------------
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么?
|
||||
|
||||
2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡?
|
||||
|
||||
3.从函数式视角理解AI,对你理解设计问题有何启发?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-------------------------------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------------------- --------------------------------- ----------------------------
|
||||
万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证
|
||||
|
||||
缩放定律 Scaling Law 模型性能与规模的关系
|
||||
|
||||
前馈网络 Feed-Forward Network 信息单向传播的神经网络
|
||||
|
||||
多层感知机 MLP Multi-Layer Perceptron
|
||||
|
||||
端到端学习 End-to-End Learning 从输入直接学习到输出
|
||||
-------------------------------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)
|
||||
|
||||
[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem)
|
||||
|
||||
[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x)
|
||||
|
||||
@@ -1,165 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解"Functions Describe the World"的核心理念
|
||||
|
||||
掌握从Excel到神经网络的演进逻辑
|
||||
|
||||
理解函数组合与层级抽象的思想
|
||||
|
||||
### 核心理念:函数描述世界
|
||||
|
||||
#### 从物理定律说起
|
||||
|
||||
物理学用简洁的函数描述复杂现象:
|
||||
|
||||
----------------------------------
|
||||
现象 函数 发现者
|
||||
---------- -------------- --------
|
||||
自由落体 h = ½gt² 伽利略
|
||||
|
||||
万有引力 F = Gm₁m₂/r² 牛顿
|
||||
|
||||
电磁感应 ε = -dΦ/dt 法拉第
|
||||
----------------------------------
|
||||
|
||||
这些函数的共同特点:**用数学关系描述客观规律**
|
||||
|
||||
#### AI的函数观
|
||||
|
||||
AI延续了这一传统:**用函数从数据中学习规律**
|
||||
|
||||
`数据`` → ``函数`` → ``预测``/``决策`\
|
||||
` x → f(x) → y`
|
||||
|
||||
从Excel到神经网络
|
||||
|
||||
线性回归:y = ax + b
|
||||
|
||||
在Excel中,我们经常做线性拟合:
|
||||
|
||||
`房价`` ≈ 0.015 × ``面积`` + 50``万`\
|
||||
` y = a × x + b`
|
||||
|
||||
这就是一个最简单的"AI模型":**单变量线性函数**
|
||||
|
||||
多元回归:y = a₁x₁ + a₂x₂ + ... + b
|
||||
|
||||
增加更多特征:
|
||||
|
||||
`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万`
|
||||
|
||||
这就是**单层神经元**的数学形式!
|
||||
|
||||
函数组合:层级嵌套
|
||||
|
||||
现实世界的关系往往是非线性的,需要函数组合:
|
||||
|
||||
`h₁ = f₁(x) # ``第一层:提取特征`
|
||||
|
||||
`h₂ = f₂(h₁) # ``第二层:组合特征`
|
||||
|
||||
`y = f₃(h₂) # ``第三层:输出结果`
|
||||
|
||||
这就是**多层神经网络**的本质!
|
||||
|
||||
### 函数组合的威力
|
||||
|
||||
为什么需要多层?
|
||||
|
||||
**单层函数**只能学习简单的线性关系
|
||||
|
||||
**多层函数**可以学习任意复杂的非线性关系
|
||||
|
||||
直观例子:识别圆形
|
||||
|
||||
`输入:像素点灰度值`\
|
||||
` ↓`\
|
||||
`第一层:检测边缘(梯度变化)`\
|
||||
` ↓`\
|
||||
`第二层:组合边缘成弧线`\
|
||||
` ↓`\
|
||||
`第三层:判断是否闭合`` → ``圆形`
|
||||
|
||||
每一层都是一个函数,层层组合形成复杂能力。
|
||||
|
||||
### 数据驱动 vs 规则驱动
|
||||
|
||||
#### 规则驱动
|
||||
|
||||
`# ``传统编程:人工编写规则`\
|
||||
`def`` ``is_circle``(image):`\
|
||||
` edges ``=`` ``detect_edges``(image)`\
|
||||
` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\
|
||||
` ``return`` ``True`\
|
||||
` ``return`` ``False`
|
||||
|
||||
**问题**:规则难以穷举,无法处理复杂情况
|
||||
|
||||
#### 数据驱动
|
||||
|
||||
`# AI``:从数据中学习函数`\
|
||||
`f ``=`` ``neural_network``()`\
|
||||
`train(f, ``thousands_of_examples``)`\
|
||||
`result ``=`` f(``new_image``) ``# ``自动判断`
|
||||
|
||||
**优势**:自动发现规律,适应复杂情况
|
||||
|
||||
### 神经网络的函数本质
|
||||
|
||||
数学表示
|
||||
|
||||
一个L层神经网络:
|
||||
|
||||
`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))`
|
||||
|
||||
其中每一层:
|
||||
|
||||
`h = ``σ(``Wx`` + b)`
|
||||
|
||||
W:权重矩阵(可学习参数)
|
||||
|
||||
b:偏置向量(可学习参数)
|
||||
|
||||
σ:激活函数(引入非线性)
|
||||
|
||||
#### 视觉理解
|
||||
|
||||
`输入层`` ``隐藏层`` ``输出层`\
|
||||
` x ``h₁,h₂,h``₃ y`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` │ ○ │`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` │ ○ │`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` ``权重``W₁ ``权重``W₂`
|
||||
|
||||
箭头上的权重就是函数的参数,通过学习自动确定。
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.列举3个日常生活中"用函数描述世界"的例子
|
||||
|
||||
2.为什么单层函数无法学习异或(XOR)问题?
|
||||
|
||||
3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决?
|
||||
|
||||
### 关键术语
|
||||
|
||||
------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- ---------------------------
|
||||
线性回归 Linear Regression y = ax + b 形式的函数拟合
|
||||
|
||||
多元回归 Multiple Regression 多输入变量的线性模型
|
||||
|
||||
权重 Weight 神经网络中的可学习参数
|
||||
|
||||
偏置 Bias 调整输出基准的参数
|
||||
|
||||
非线性 Non-linearity 无法用直线表示的关系
|
||||
------------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍
|
||||
@@ -1,221 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解MLP的基本结构
|
||||
|
||||
掌握前向传播的计算过程
|
||||
|
||||
了解激活函数的作用和类型
|
||||
|
||||
理解反向传播的基本思想
|
||||
|
||||
### MLP结构
|
||||
|
||||
#### 什么是MLP
|
||||
|
||||
**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。
|
||||
|
||||
网络架构
|
||||
|
||||
`输入层`` ``隐藏层`` ``输出层`\
|
||||
` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\
|
||||
` │ x₁ │ │ h₁ │ │ y₁ │`\
|
||||
` │ x₂ │───→│ h₂ │───→│ y₂ │`\
|
||||
` │ x₃ │ │ h₃ │ │ y₃ │`\
|
||||
` │ ... │ │ ... │ │ ... │`\
|
||||
` │ xₙ │ │ hₘ │ │ yₖ │`\
|
||||
` └─────────┘ └─────────────┘ └─────────┘`\
|
||||
` │ │ │`\
|
||||
` └───────────────┴────────────────┘`\
|
||||
` ``全连接(每个神经元相连)`
|
||||
|
||||
#### 层次说明
|
||||
|
||||
----------------------------------------
|
||||
层类型 作用 神经元数量
|
||||
-------- ---------------- --------------
|
||||
输入层 接收原始数据 取决于特征数
|
||||
|
||||
隐藏层 特征变换与组合 自由设计
|
||||
|
||||
输出层 产生最终结果 取决于任务
|
||||
----------------------------------------
|
||||
|
||||
### 前向传播
|
||||
|
||||
#### 单个神经元
|
||||
|
||||
`# ``线性部分`\
|
||||
`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\
|
||||
\
|
||||
`# ``激活函数`\
|
||||
`h ``=`` σ(z)`
|
||||
|
||||
#### 完整网络
|
||||
|
||||
对于L层网络:
|
||||
|
||||
`# ``第``1``层`
|
||||
|
||||
`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)`
|
||||
|
||||
`# ``第``2``层`
|
||||
|
||||
`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)`
|
||||
|
||||
`# ...`
|
||||
|
||||
`# ``第``L``层`
|
||||
|
||||
y = σₗ(Wₗh_{l-1} + bₗ)
|
||||
|
||||
#### 数据流动
|
||||
|
||||
`输入向量`` x₀`\
|
||||
` │`\
|
||||
` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\
|
||||
` │ │`\
|
||||
` │ └─→ σ₁(z₁) = h₁`\
|
||||
` │ │`\
|
||||
` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\
|
||||
` │ │`\
|
||||
` └─→ σ₂(z₂) = h₂`\
|
||||
` │`\
|
||||
` └─→ ... → y`
|
||||
|
||||
### 激活函数
|
||||
|
||||
#### 为什么需要激活函数?
|
||||
|
||||
没有激活函数,多层网络就等价于单层线性变换:
|
||||
|
||||
`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x`
|
||||
|
||||
激活函数引入**非线性**,使网络能够学习复杂模式。
|
||||
|
||||
#### 常用激活函数
|
||||
|
||||
--------------------------------------------------------------------
|
||||
激活函数 公式 特点 应用场景
|
||||
---------- ----------------------------- ------------ --------------
|
||||
Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层
|
||||
|
||||
ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选
|
||||
|
||||
Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层
|
||||
|
||||
Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络
|
||||
--------------------------------------------------------------------
|
||||
|
||||
#### 视觉对比
|
||||
|
||||
`ReLU``: Sigmoid: Tanh:`\
|
||||
` ↑ ___ ___`\
|
||||
` │ / ╲`\
|
||||
` │ / ╲`\
|
||||
` │____ / ╲___`\
|
||||
` │ ______ / │`\
|
||||
` └──────── / └──`\
|
||||
` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞`
|
||||
|
||||
### 损失函数与优化
|
||||
|
||||
#### 损失函数
|
||||
|
||||
损失函数衡量模型预测与真实值的差距:
|
||||
|
||||
---------------------------------------
|
||||
任务 损失函数 公式
|
||||
-------- ---------- -------------------
|
||||
回归 均方误差 MSE = Σ(ŷ-y)²/n
|
||||
|
||||
二分类 交叉熵 CE = -y·log(ŷ)
|
||||
|
||||
多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ)
|
||||
---------------------------------------
|
||||
|
||||
#### 优化目标
|
||||
|
||||
`最小化损失函数:`\
|
||||
`min L(f(x; θ), y)`\
|
||||
\
|
||||
`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数`
|
||||
|
||||
#### 梯度下降
|
||||
|
||||
`重复直到收敛:`\
|
||||
` θ = θ - α·∇L(θ)`\
|
||||
\
|
||||
`其中:`\
|
||||
` θ``:参数`\
|
||||
` α``:学习率`\
|
||||
` ∇L(θ)``:损失函数的梯度`
|
||||
|
||||
### 反向传播
|
||||
|
||||
核心思想
|
||||
|
||||
从输出层向输入层反向计算梯度:
|
||||
|
||||
`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差`
|
||||
|
||||
链式法则
|
||||
|
||||
`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\
|
||||
` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)`
|
||||
|
||||
直观理解
|
||||
|
||||
1.**前向传播**:计算每个神经元的输出
|
||||
|
||||
2.**计算误差**:比较输出与真实值
|
||||
|
||||
3.**反向传播**:将误差反向传递
|
||||
|
||||
4.**更新权重**:根据误差调整参数
|
||||
|
||||
### MLP vs 传统模型
|
||||
|
||||
--------------------------------------
|
||||
特性 MLP 传统机器学习
|
||||
------------ ---------- --------------
|
||||
特征工程 自动学习 人工设计
|
||||
|
||||
非线性能力 强 中/弱
|
||||
|
||||
数据需求 大量 中等
|
||||
|
||||
可解释性 低 高
|
||||
|
||||
训练时间 长 短
|
||||
--------------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么隐藏层越多,网络表达能力越强?
|
||||
|
||||
2.ReLU为什么比Sigmoid更适合隐藏层?
|
||||
|
||||
3.如果所有权重初始化为0,会发生什么?
|
||||
|
||||
### 关键术语
|
||||
|
||||
----------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ------------------ ----------------------------
|
||||
前向传播 Forward Pass 数据从输入到输出的计算过程
|
||||
|
||||
反向传播 Backpropagation 计算梯度的算法
|
||||
|
||||
损失函数 Loss Function 衡量预测误差的函数
|
||||
|
||||
梯度下降 Gradient Descent 优化算法
|
||||
|
||||
学习率 Learning Rate 参数更新的步长
|
||||
----------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html)
|
||||
|
||||
[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding
|
||||
@@ -1,226 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
掌握Python AI开发环境配置
|
||||
|
||||
了解核心科学计算库
|
||||
|
||||
理解Vibe Coding的AI辅助编程新模式
|
||||
|
||||
### Python环境配置
|
||||
|
||||
#### Anaconda vs Miniconda
|
||||
|
||||
-----------------------------------------------
|
||||
工具 大小 特点 适用场景
|
||||
----------- --------- ------------ ------------
|
||||
Anaconda \~500MB 预装常用库 初学者推荐
|
||||
|
||||
Miniconda \~50MB 仅含conda 精简安装
|
||||
-----------------------------------------------
|
||||
|
||||
#### 安装步骤
|
||||
|
||||
##### 1.下载安装
|
||||
|
||||
o访问 https://www.anaconda.com/download
|
||||
|
||||
o选择Python 3.x版本
|
||||
|
||||
o按提示安装
|
||||
|
||||
##### 2.创建虚拟环境
|
||||
|
||||
`conda`` create ``-n`` ai-env python=3.10`\
|
||||
`conda`` activate ai-env`
|
||||
|
||||
##### 3.安装核心库
|
||||
|
||||
`conda`` install ``numpy`` pandas ``scipy`\
|
||||
`pip`` install torch ``torchvision`
|
||||
|
||||
### 核心科学计算库
|
||||
|
||||
#### NumPy:数值计算基础
|
||||
|
||||
`import`` ``numpy`` ``as`` np`\
|
||||
\
|
||||
`# ``创建数组`\
|
||||
`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\
|
||||
\
|
||||
`# ``矩阵运算`\
|
||||
`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\
|
||||
`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\
|
||||
\
|
||||
`# ``激活函数`\
|
||||
`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU`
|
||||
|
||||
#### Pandas:数据处理
|
||||
|
||||
`import`` pandas ``as`` pd`\
|
||||
\
|
||||
`# ``读取数据`\
|
||||
`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\
|
||||
\
|
||||
`# ``数据清洗`\
|
||||
`df`` ``=`` ``df.dropna``()`\
|
||||
`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\
|
||||
\
|
||||
`# ``统计分析`\
|
||||
`df.describe``()`
|
||||
|
||||
#### SciPy:科学计算
|
||||
|
||||
`from`` ``scipy`` ``import`` optimize`\
|
||||
`from`` ``scipy.spatial`` ``import`` distance`\
|
||||
\
|
||||
`# ``优化问题`\
|
||||
`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\
|
||||
\
|
||||
`# ``距离计算`\
|
||||
`dist`` ``=`` ``distance.euclidean``(point1, point2)`
|
||||
|
||||
### 开发工具选择
|
||||
|
||||
#### VSCode
|
||||
|
||||
**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快
|
||||
|
||||
**AI开发常用插件**: - Python - Jupyter - Pylance - Copilot
|
||||
|
||||
## Cursor
|
||||
|
||||
**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程
|
||||
|
||||
**使用场景**: - 快速原型开发 - 代码重构 - 学习新API
|
||||
|
||||
## Jupyter Notebook
|
||||
|
||||
**特点**: - 交互式编程 - 可视化友好 - 文档即代码
|
||||
|
||||
**使用场景**: - 数据探索 - 算法实验 - 教学演示
|
||||
|
||||
# Vibe Coding:AI辅助编程
|
||||
|
||||
## 什么是Vibe Coding
|
||||
|
||||
传统编程:**明确需求 → 设计算法 → 编写代码**
|
||||
|
||||
Vibe Coding:**模糊想法 → AI辅助 → 迭代完善**
|
||||
|
||||
## 工作流程
|
||||
|
||||
### 1. 描述意图(自然语言)
|
||||
|
||||
`"``帮我创建一个简单的神经网络``"`
|
||||
|
||||
###
|
||||
|
||||
`2. AI``生成代码`
|
||||
|
||||
### → 自动生成完整代码框架
|
||||
|
||||
`3. ``运行测试`
|
||||
|
||||
`→ ``发现问题或需要调整`
|
||||
|
||||
`4. ``迭代优化`
|
||||
|
||||
`"``把隐藏层改成``128``个神经元``"`
|
||||
|
||||
`→ AI``自动修改代码`
|
||||
|
||||
`5. ``理解学习`
|
||||
|
||||
→ 阅读AI生成的代码,学习最佳实践
|
||||
|
||||
## 实践技巧
|
||||
|
||||
---------------------------------
|
||||
技巧 说明
|
||||
---------- ----------------------
|
||||
明确需求 详细描述输入输出
|
||||
|
||||
分步实现 复杂功能拆解为小任务
|
||||
|
||||
验证结果 检查生成的代码
|
||||
|
||||
学习思考 理解AI为什么这样写
|
||||
---------------------------------
|
||||
|
||||
## 工具推荐
|
||||
|
||||
--------------------------------------------
|
||||
工具 特点 适用场景
|
||||
---------------- ---------------- ----------
|
||||
GitHub Copilot 代码补全 日常开发
|
||||
|
||||
Cursor 对话式编程 快速原型
|
||||
|
||||
ChatGPT/Claude 代码生成与解释 学习咨询
|
||||
|
||||
Replit Agent 端到端开发 小型项目
|
||||
--------------------------------------------
|
||||
|
||||
## 开发工作流
|
||||
|
||||
项目结构
|
||||
|
||||
`project/`\
|
||||
`├── data/ # ``数据文件`\
|
||||
`├── notebooks/ # ``Jupyter``笔记本`\
|
||||
`├── ``src``/ # ``源代码`\
|
||||
`│ ├── models/ # ``模型定义`\
|
||||
`│ ├── utils/ # ``工具函数`\
|
||||
`│ └── train.py # ``训练脚本`\
|
||||
`├── requirements.txt # ``依赖列表`\
|
||||
`└── README.md # ``项目说明`
|
||||
|
||||
### 典型工作流
|
||||
|
||||
`# 1. ``创建环境`\
|
||||
`conda`` create ``-n`` ``myproject`` python=3.10`\
|
||||
`conda`` activate ``myproject`\
|
||||
\
|
||||
`# 2. ``安装依赖`\
|
||||
`pip`` install ``-r`` requirements.txt`\
|
||||
\
|
||||
`# 3. ``开发迭代`\
|
||||
`# - ``在``notebook``中实验`\
|
||||
`# - ``整理到``src``/``目录`\
|
||||
`# - ``运行测试`\
|
||||
\
|
||||
`# 4. ``保存环境`\
|
||||
`conda`` env export ``>`` ``environment.yml`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.对比Anaconda和Miniconda,什么时候该用哪个?
|
||||
|
||||
2.尝试用Cursor/Copilot生成一个简单的神经网络代码
|
||||
|
||||
3.Vibe Coding如何改变传统的编程学习方式?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-----------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ----------------------- ------------------------
|
||||
虚拟环境 Virtual Environment 隔离的Python运行环境
|
||||
|
||||
依赖管理 Dependency Management 管理项目所需的库
|
||||
|
||||
代码补全 Code Completion 自动补全正在输入的代码
|
||||
|
||||
原型开发 Prototyping 快速构建可运行版本
|
||||
|
||||
迭代优化 Iterative Refinement 逐步改进代码
|
||||
-----------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
[Anaconda官方文档](https://docs.anaconda.com/)
|
||||
|
||||
[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html)
|
||||
|
||||
[Cursor使用指南](https://cursor.com/docs)
|
||||
@@ -10,40 +10,620 @@
|
||||
|
||||
本篇将: - 从函数式视角理解AI - 介绍多层感知机的基本原理 - 讲解Python编程工具和AI辅助编程
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
[01.1 函数式AI视角](01.1-math-foundation.md) - "Functions Describe the World"
|
||||
### 学习目标
|
||||
|
||||
[01.2 多层感知机](01.2-mlp-basics.md) - MLP结构与原理
|
||||
理解"Functions Describe the World"的核心理念
|
||||
|
||||
[01.3 编程工具与Vibe Coding](01.3-programming.md) - Python环境与AI辅助编程
|
||||
掌握从Excel到神经网络的演进逻辑
|
||||
|
||||
理解函数组合与层级抽象的思想
|
||||
|
||||
### 核心理念:函数描述世界
|
||||
|
||||
#### 从物理定律说起
|
||||
|
||||
物理学用简洁的函数描述复杂现象:
|
||||
|
||||
----------------------------------
|
||||
现象 函数 发现者
|
||||
---------- -------------- --------
|
||||
自由落体 h = ½gt² 伽利略
|
||||
|
||||
万有引力 F = Gm₁m₂/r² 牛顿
|
||||
|
||||
电磁感应 ε = -dΦ/dt 法拉第
|
||||
----------------------------------
|
||||
|
||||
这些函数的共同特点:**用数学关系描述客观规律**
|
||||
|
||||
#### AI的函数观
|
||||
|
||||
AI延续了这一传统:**用函数从数据中学习规律**
|
||||
|
||||
`数据`` → ``函数`` → ``预测``/``决策`\
|
||||
` x → f(x) → y`
|
||||
|
||||
从Excel到神经网络
|
||||
|
||||
线性回归:y = ax + b
|
||||
|
||||
在Excel中,我们经常做线性拟合:
|
||||
|
||||
`房价`` ≈ 0.015 × ``面积`` + 50``万`\
|
||||
` y = a × x + b`
|
||||
|
||||
这就是一个最简单的"AI模型":**单变量线性函数**
|
||||
|
||||
多元回归:y = a₁x₁ + a₂x₂ + ... + b
|
||||
|
||||
增加更多特征:
|
||||
|
||||
`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万`
|
||||
|
||||
这就是**单层神经元**的数学形式!
|
||||
|
||||
函数组合:层级嵌套
|
||||
|
||||
现实世界的关系往往是非线性的,需要函数组合:
|
||||
|
||||
`h₁ = f₁(x) # ``第一层:提取特征`
|
||||
|
||||
`h₂ = f₂(h₁) # ``第二层:组合特征`
|
||||
|
||||
`y = f₃(h₂) # ``第三层:输出结果`
|
||||
|
||||
这就是**多层神经网络**的本质!
|
||||
|
||||
### 函数组合的威力
|
||||
|
||||
为什么需要多层?
|
||||
|
||||
**单层函数**只能学习简单的线性关系
|
||||
|
||||
**多层函数**可以学习任意复杂的非线性关系
|
||||
|
||||
直观例子:识别圆形
|
||||
|
||||
`输入:像素点灰度值`\
|
||||
` ↓`\
|
||||
`第一层:检测边缘(梯度变化)`\
|
||||
` ↓`\
|
||||
`第二层:组合边缘成弧线`\
|
||||
` ↓`\
|
||||
`第三层:判断是否闭合`` → ``圆形`
|
||||
|
||||
每一层都是一个函数,层层组合形成复杂能力。
|
||||
|
||||
### 数据驱动 vs 规则驱动
|
||||
|
||||
#### 规则驱动
|
||||
|
||||
`# ``传统编程:人工编写规则`\
|
||||
`def`` ``is_circle``(image):`\
|
||||
` edges ``=`` ``detect_edges``(image)`\
|
||||
` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\
|
||||
` ``return`` ``True`\
|
||||
` ``return`` ``False`
|
||||
|
||||
**问题**:规则难以穷举,无法处理复杂情况
|
||||
|
||||
#### 数据驱动
|
||||
|
||||
`# AI``:从数据中学习函数`\
|
||||
`f ``=`` ``neural_network``()`\
|
||||
`train(f, ``thousands_of_examples``)`\
|
||||
`result ``=`` f(``new_image``) ``# ``自动判断`
|
||||
|
||||
**优势**:自动发现规律,适应复杂情况
|
||||
|
||||
### 神经网络的函数本质
|
||||
|
||||
数学表示
|
||||
|
||||
一个L层神经网络:
|
||||
|
||||
`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))`
|
||||
|
||||
其中每一层:
|
||||
|
||||
`h = ``σ(``Wx`` + b)`
|
||||
|
||||
W:权重矩阵(可学习参数)
|
||||
|
||||
b:偏置向量(可学习参数)
|
||||
|
||||
σ:激活函数(引入非线性)
|
||||
|
||||
#### 视觉理解
|
||||
|
||||
`输入层`` ``隐藏层`` ``输出层`\
|
||||
` x ``h₁,h₂,h``₃ y`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` │ ○ │`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` │ ○ │`\
|
||||
` ● ──────────→ ○ ──────────→ ●`\
|
||||
` ``权重``W₁ ``权重``W₂`
|
||||
|
||||
箭头上的权重就是函数的参数,通过学习自动确定。
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.列举3个日常生活中"用函数描述世界"的例子
|
||||
|
||||
2.为什么单层函数无法学习异或(XOR)问题?
|
||||
|
||||
3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决?
|
||||
|
||||
### 关键术语
|
||||
|
||||
------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- ---------------------------
|
||||
线性回归 Linear Regression y = ax + b 形式的函数拟合
|
||||
|
||||
多元回归 Multiple Regression 多输入变量的线性模型
|
||||
|
||||
权重 Weight 神经网络中的可学习参数
|
||||
|
||||
偏置 Bias 调整输出基准的参数
|
||||
|
||||
非线性 Non-linearity 无法用直线表示的关系
|
||||
------------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍
|
||||
|
||||
---
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解MLP的基本结构
|
||||
|
||||
掌握前向传播的计算过程
|
||||
|
||||
了解激活函数的作用和类型
|
||||
|
||||
理解反向传播的基本思想
|
||||
|
||||
### MLP结构
|
||||
|
||||
#### 什么是MLP
|
||||
|
||||
**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。
|
||||
|
||||
网络架构
|
||||
|
||||
`输入层`` ``隐藏层`` ``输出层`\
|
||||
` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\
|
||||
` │ x₁ │ │ h₁ │ │ y₁ │`\
|
||||
` │ x₂ │───→│ h₂ │───→│ y₂ │`\
|
||||
` │ x₃ │ │ h₃ │ │ y₃ │`\
|
||||
` │ ... │ │ ... │ │ ... │`\
|
||||
` │ xₙ │ │ hₘ │ │ yₖ │`\
|
||||
` └─────────┘ └─────────────┘ └─────────┘`\
|
||||
` │ │ │`\
|
||||
` └───────────────┴────────────────┘`\
|
||||
` ``全连接(每个神经元相连)`
|
||||
|
||||
#### 层次说明
|
||||
|
||||
----------------------------------------
|
||||
层类型 作用 神经元数量
|
||||
-------- ---------------- --------------
|
||||
输入层 接收原始数据 取决于特征数
|
||||
|
||||
隐藏层 特征变换与组合 自由设计
|
||||
|
||||
输出层 产生最终结果 取决于任务
|
||||
----------------------------------------
|
||||
|
||||
### 前向传播
|
||||
|
||||
#### 单个神经元
|
||||
|
||||
`# ``线性部分`\
|
||||
`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\
|
||||
\
|
||||
`# ``激活函数`\
|
||||
`h ``=`` σ(z)`
|
||||
|
||||
#### 完整网络
|
||||
|
||||
对于L层网络:
|
||||
|
||||
`# ``第``1``层`
|
||||
|
||||
`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)`
|
||||
|
||||
`# ``第``2``层`
|
||||
|
||||
`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)`
|
||||
|
||||
`# ...`
|
||||
|
||||
`# ``第``L``层`
|
||||
|
||||
y = σₗ(Wₗh_{l-1} + bₗ)
|
||||
|
||||
#### 数据流动
|
||||
|
||||
`输入向量`` x₀`\
|
||||
` │`\
|
||||
` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\
|
||||
` │ │`\
|
||||
` │ └─→ σ₁(z₁) = h₁`\
|
||||
` │ │`\
|
||||
` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\
|
||||
` │ │`\
|
||||
` └─→ σ₂(z₂) = h₂`\
|
||||
` │`\
|
||||
` └─→ ... → y`
|
||||
|
||||
### 激活函数
|
||||
|
||||
#### 为什么需要激活函数?
|
||||
|
||||
没有激活函数,多层网络就等价于单层线性变换:
|
||||
|
||||
`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x`
|
||||
|
||||
激活函数引入**非线性**,使网络能够学习复杂模式。
|
||||
|
||||
#### 常用激活函数
|
||||
|
||||
--------------------------------------------------------------------
|
||||
激活函数 公式 特点 应用场景
|
||||
---------- ----------------------------- ------------ --------------
|
||||
Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层
|
||||
|
||||
ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选
|
||||
|
||||
Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层
|
||||
|
||||
Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络
|
||||
--------------------------------------------------------------------
|
||||
|
||||
#### 视觉对比
|
||||
|
||||
`ReLU``: Sigmoid: Tanh:`\
|
||||
` ↑ ___ ___`\
|
||||
` │ / ╲`\
|
||||
` │ / ╲`\
|
||||
` │____ / ╲___`\
|
||||
` │ ______ / │`\
|
||||
` └──────── / └──`\
|
||||
` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞`
|
||||
|
||||
### 损失函数与优化
|
||||
|
||||
#### 损失函数
|
||||
|
||||
损失函数衡量模型预测与真实值的差距:
|
||||
|
||||
---------------------------------------
|
||||
任务 损失函数 公式
|
||||
-------- ---------- -------------------
|
||||
回归 均方误差 MSE = Σ(ŷ-y)²/n
|
||||
|
||||
二分类 交叉熵 CE = -y·log(ŷ)
|
||||
|
||||
多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ)
|
||||
---------------------------------------
|
||||
|
||||
#### 优化目标
|
||||
|
||||
`最小化损失函数:`\
|
||||
`min L(f(x; θ), y)`\
|
||||
\
|
||||
`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数`
|
||||
|
||||
#### 梯度下降
|
||||
|
||||
`重复直到收敛:`\
|
||||
` θ = θ - α·∇L(θ)`\
|
||||
\
|
||||
`其中:`\
|
||||
` θ``:参数`\
|
||||
` α``:学习率`\
|
||||
` ∇L(θ)``:损失函数的梯度`
|
||||
|
||||
### 反向传播
|
||||
|
||||
核心思想
|
||||
|
||||
从输出层向输入层反向计算梯度:
|
||||
|
||||
`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差`
|
||||
|
||||
链式法则
|
||||
|
||||
`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\
|
||||
` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)`
|
||||
|
||||
直观理解
|
||||
|
||||
1.**前向传播**:计算每个神经元的输出
|
||||
|
||||
2.**计算误差**:比较输出与真实值
|
||||
|
||||
3.**反向传播**:将误差反向传递
|
||||
|
||||
4.**更新权重**:根据误差调整参数
|
||||
|
||||
### MLP vs 传统模型
|
||||
|
||||
--------------------------------------
|
||||
特性 MLP 传统机器学习
|
||||
------------ ---------- --------------
|
||||
特征工程 自动学习 人工设计
|
||||
|
||||
非线性能力 强 中/弱
|
||||
|
||||
数据需求 大量 中等
|
||||
|
||||
可解释性 低 高
|
||||
|
||||
训练时间 长 短
|
||||
--------------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么隐藏层越多,网络表达能力越强?
|
||||
|
||||
2.ReLU为什么比Sigmoid更适合隐藏层?
|
||||
|
||||
3.如果所有权重初始化为0,会发生什么?
|
||||
|
||||
### 关键术语
|
||||
|
||||
----------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ------------------ ----------------------------
|
||||
前向传播 Forward Pass 数据从输入到输出的计算过程
|
||||
|
||||
反向传播 Backpropagation 计算梯度的算法
|
||||
|
||||
损失函数 Loss Function 衡量预测误差的函数
|
||||
|
||||
梯度下降 Gradient Descent 优化算法
|
||||
|
||||
学习率 Learning Rate 参数更新的步长
|
||||
----------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html)
|
||||
|
||||
[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding
|
||||
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
完成本篇后,你将能够:
|
||||
掌握Python AI开发环境配置
|
||||
|
||||
从函数组合角度理解神经网络
|
||||
了解核心科学计算库
|
||||
|
||||
描述MLP的基本结构和工作原理
|
||||
理解Vibe Coding的AI辅助编程新模式
|
||||
|
||||
配置Python AI开发环境
|
||||
### Python环境配置
|
||||
|
||||
使用AI工具辅助编程学习
|
||||
#### Anaconda vs Miniconda
|
||||
|
||||
## 核心概念
|
||||
-----------------------------------------------
|
||||
工具 大小 特点 适用场景
|
||||
----------- --------- ------------ ------------
|
||||
Anaconda \~500MB 预装常用库 初学者推荐
|
||||
|
||||
Miniconda \~50MB 仅含conda 精简安装
|
||||
-----------------------------------------------
|
||||
|
||||
#### 安装步骤
|
||||
|
||||
##### 1.下载安装
|
||||
|
||||
o访问 https://www.anaconda.com/download
|
||||
|
||||
o选择Python 3.x版本
|
||||
|
||||
o按提示安装
|
||||
|
||||
##### 2.创建虚拟环境
|
||||
|
||||
`conda`` create ``-n`` ai-env python=3.10`\
|
||||
`conda`` activate ai-env`
|
||||
|
||||
##### 3.安装核心库
|
||||
|
||||
`conda`` install ``numpy`` pandas ``scipy`\
|
||||
`pip`` install torch ``torchvision`
|
||||
|
||||
### 核心科学计算库
|
||||
|
||||
#### NumPy:数值计算基础
|
||||
|
||||
`import`` ``numpy`` ``as`` np`\
|
||||
\
|
||||
`# ``创建数组`\
|
||||
`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\
|
||||
\
|
||||
`# ``矩阵运算`\
|
||||
`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\
|
||||
`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\
|
||||
\
|
||||
`# ``激活函数`\
|
||||
`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU`
|
||||
|
||||
#### Pandas:数据处理
|
||||
|
||||
`import`` pandas ``as`` pd`\
|
||||
\
|
||||
`# ``读取数据`\
|
||||
`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\
|
||||
\
|
||||
`# ``数据清洗`\
|
||||
`df`` ``=`` ``df.dropna``()`\
|
||||
`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\
|
||||
\
|
||||
`# ``统计分析`\
|
||||
`df.describe``()`
|
||||
|
||||
#### SciPy:科学计算
|
||||
|
||||
`from`` ``scipy`` ``import`` optimize`\
|
||||
`from`` ``scipy.spatial`` ``import`` distance`\
|
||||
\
|
||||
`# ``优化问题`\
|
||||
`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\
|
||||
\
|
||||
`# ``距离计算`\
|
||||
`dist`` ``=`` ``distance.euclidean``(point1, point2)`
|
||||
|
||||
### 开发工具选择
|
||||
|
||||
#### VSCode
|
||||
|
||||
**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快
|
||||
|
||||
**AI开发常用插件**: - Python - Jupyter - Pylance - Copilot
|
||||
|
||||
## Cursor
|
||||
|
||||
**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程
|
||||
|
||||
**使用场景**: - 快速原型开发 - 代码重构 - 学习新API
|
||||
|
||||
## Jupyter Notebook
|
||||
|
||||
**特点**: - 交互式编程 - 可视化友好 - 文档即代码
|
||||
|
||||
**使用场景**: - 数据探索 - 算法实验 - 教学演示
|
||||
|
||||
# Vibe Coding:AI辅助编程
|
||||
|
||||
## 什么是Vibe Coding
|
||||
|
||||
传统编程:**明确需求 → 设计算法 → 编写代码**
|
||||
|
||||
Vibe Coding:**模糊想法 → AI辅助 → 迭代完善**
|
||||
|
||||
## 工作流程
|
||||
|
||||
### 1. 描述意图(自然语言)
|
||||
|
||||
`"``帮我创建一个简单的神经网络``"`
|
||||
|
||||
###
|
||||
|
||||
`2. AI``生成代码`
|
||||
|
||||
### → 自动生成完整代码框架
|
||||
|
||||
`3. ``运行测试`
|
||||
|
||||
`→ ``发现问题或需要调整`
|
||||
|
||||
`4. ``迭代优化`
|
||||
|
||||
`"``把隐藏层改成``128``个神经元``"`
|
||||
|
||||
`→ AI``自动修改代码`
|
||||
|
||||
`5. ``理解学习`
|
||||
|
||||
→ 阅读AI生成的代码,学习最佳实践
|
||||
|
||||
## 实践技巧
|
||||
|
||||
---------------------------------
|
||||
技巧 说明
|
||||
---------- ----------------------
|
||||
明确需求 详细描述输入输出
|
||||
|
||||
分步实现 复杂功能拆解为小任务
|
||||
|
||||
验证结果 检查生成的代码
|
||||
|
||||
学习思考 理解AI为什么这样写
|
||||
---------------------------------
|
||||
|
||||
## 工具推荐
|
||||
|
||||
--------------------------------------------
|
||||
工具 特点 适用场景
|
||||
---------------- ---------------- ----------
|
||||
GitHub Copilot 代码补全 日常开发
|
||||
|
||||
Cursor 对话式编程 快速原型
|
||||
|
||||
ChatGPT/Claude 代码生成与解释 学习咨询
|
||||
|
||||
Replit Agent 端到端开发 小型项目
|
||||
--------------------------------------------
|
||||
|
||||
## 开发工作流
|
||||
|
||||
项目结构
|
||||
|
||||
`project/`\
|
||||
`├── data/ # ``数据文件`\
|
||||
`├── notebooks/ # ``Jupyter``笔记本`\
|
||||
`├── ``src``/ # ``源代码`\
|
||||
`│ ├── models/ # ``模型定义`\
|
||||
`│ ├── utils/ # ``工具函数`\
|
||||
`│ └── train.py # ``训练脚本`\
|
||||
`├── requirements.txt # ``依赖列表`\
|
||||
`└── README.md # ``项目说明`
|
||||
|
||||
### 典型工作流
|
||||
|
||||
`# 1. ``创建环境`\
|
||||
`conda`` create ``-n`` ``myproject`` python=3.10`\
|
||||
`conda`` activate ``myproject`\
|
||||
\
|
||||
`# 2. ``安装依赖`\
|
||||
`pip`` install ``-r`` requirements.txt`\
|
||||
\
|
||||
`# 3. ``开发迭代`\
|
||||
`# - ``在``notebook``中实验`\
|
||||
`# - ``整理到``src``/``目录`\
|
||||
`# - ``运行测试`\
|
||||
\
|
||||
`# 4. ``保存环境`\
|
||||
`conda`` env export ``>`` ``environment.yml`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.对比Anaconda和Miniconda,什么时候该用哪个?
|
||||
|
||||
2.尝试用Cursor/Copilot生成一个简单的神经网络代码
|
||||
|
||||
3.Vibe Coding如何改变传统的编程学习方式?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-----------------------------------------------------------
|
||||
概念 英文 说明
|
||||
------------ --------------------- ------------------------
|
||||
多层感知机 MLP Multi-Layer Perceptron
|
||||
中文 英文 说明
|
||||
---------- ----------------------- ------------------------
|
||||
虚拟环境 Virtual Environment 隔离的Python运行环境
|
||||
|
||||
前向传播 Forward Pass 数据通过网络的过程
|
||||
依赖管理 Dependency Management 管理项目所需的库
|
||||
|
||||
激活函数 Activation Function 引入非线性的函数
|
||||
代码补全 Code Completion 自动补全正在输入的代码
|
||||
|
||||
损失函数 Loss Function 衡量预测误差的函数
|
||||
原型开发 Prototyping 快速构建可运行版本
|
||||
|
||||
反向传播 Backpropagation 计算梯度的算法
|
||||
迭代优化 Iterative Refinement 逐步改进代码
|
||||
-----------------------------------------------------------
|
||||
|
||||
## 01.1 函数式AI视角
|
||||
## 延伸阅读
|
||||
|
||||
[Anaconda官方文档](https://docs.anaconda.com/)
|
||||
|
||||
[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html)
|
||||
|
||||
[Cursor使用指南](https://cursor.com/docs)
|
||||
|
||||
@@ -1,145 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解CNN的核心思想:局部连接与权重共享
|
||||
|
||||
掌握卷积、激活、池化三大组件
|
||||
|
||||
了解CNN与MLP的区别和联系
|
||||
|
||||
### 为什么需要CNN
|
||||
|
||||
MLP的问题
|
||||
|
||||
将图像展平成一维向量输入MLP:
|
||||
|
||||
`28×28``图像`` → 784``维向量`` → MLP`
|
||||
|
||||
**问题**: 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习
|
||||
|
||||
#### CNN的解决方案
|
||||
|
||||
------------------------------------------------------------
|
||||
特性 说明 优势
|
||||
------------ -------------------------- --------------------
|
||||
局部连接 每个神经元只连接局部区域 符合图像局部相关性
|
||||
|
||||
权重共享 同一卷积核扫描全图 大幅减少参数
|
||||
|
||||
层次化特征 低层→高层特征抽象 自动学习特征表达
|
||||
------------------------------------------------------------
|
||||
|
||||
### CNN三大组件
|
||||
|
||||
#### 1. 卷积层 (Convolution)
|
||||
|
||||
**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征
|
||||
|
||||
`输入图像`` ``卷积核`` ``特征图`\
|
||||
`┌─────────┐ ┌─────┐ ┌─────────┐`\
|
||||
`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\
|
||||
`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\
|
||||
`│ 7 8 9 │ │ │ │ │`\
|
||||
`└─────────┘ └─────┘ └─────────┘`
|
||||
|
||||
**计算示例**:
|
||||
|
||||
`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4`
|
||||
|
||||
**多通道卷积**:
|
||||
|
||||
`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)`
|
||||
|
||||
#### 2. 激活层 (Activation)
|
||||
|
||||
通常使用ReLU:
|
||||
|
||||
`output ``=`` ``max``(``0``, ``feature_map``)`
|
||||
|
||||
作用:引入非线性,使网络能学习复杂模式
|
||||
|
||||
#### 3. 池化层 (Pooling)
|
||||
|
||||
**最大池化** (Max Pooling):
|
||||
|
||||
`2×2``窗口`` → ``取最大值`\
|
||||
`┌─────┐ ┌───┐`\
|
||||
`│3 1 │ │ 3 │`\
|
||||
`│2 5 │ → │ │`\
|
||||
`└─────┘ │ 5 │`\
|
||||
` └───┘`
|
||||
|
||||
作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野
|
||||
|
||||
### CNN架构示例
|
||||
|
||||
#### LeNet-5 (经典架构)
|
||||
|
||||
`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\
|
||||
` ↓`\
|
||||
` ``全连接层`` → ``输出`
|
||||
|
||||
#### VGG-16 (深层架构)
|
||||
|
||||
`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\
|
||||
` → [Conv×3 + Pool] ×3 → FC×3 → ``输出`
|
||||
|
||||
### CNN vs MLP
|
||||
|
||||
-------------------------------------
|
||||
特性 MLP CNN
|
||||
---------- -------------- -----------
|
||||
连接方式 全连接 局部连接
|
||||
|
||||
权重 每个连接独立 同层共享
|
||||
|
||||
空间结构 忽略 保留
|
||||
|
||||
参数量 大 小
|
||||
|
||||
适用任务 结构化数据 图像/语音
|
||||
-------------------------------------
|
||||
|
||||
### 经典网络架构演进
|
||||
|
||||
`LeNet`` (1998) → ``首次定义``CNN``结构`\
|
||||
` ↓`\
|
||||
`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\
|
||||
` ↓`\
|
||||
`VGG (2014) → ``更深网络,``3×3``小卷积核`\
|
||||
` ↓`\
|
||||
`GoogLeNet`` (2014) → Inception``模块,多尺度`\
|
||||
` ↓`\
|
||||
`ResNet`` (2015) → ``残差连接,``152``层`\
|
||||
` ↓`\
|
||||
`EfficientNet`` (2019) → ``复合缩放,高效`
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)?
|
||||
|
||||
2.感受野如何随着网络深度增加?
|
||||
|
||||
3.设计一个简单的CNN用于手写数字识别
|
||||
|
||||
### 关键术语
|
||||
|
||||
-------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------- ----------------- ----------------------------
|
||||
卷积核 Kernel/Filter 用于特征提取的小矩阵
|
||||
|
||||
步幅 Stride 卷积核滑动的步长
|
||||
|
||||
填充 Padding 边缘补零以保持尺寸
|
||||
|
||||
感受野 Receptive Field 神经元响应的输入区域
|
||||
|
||||
通道 Channel 图像的颜色维度或特征图数量
|
||||
-------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/)
|
||||
|
||||
[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测
|
||||
@@ -1,168 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
理解目标检测与图像分类的区别
|
||||
|
||||
掌握YOLO系列的发展脉络
|
||||
|
||||
了解目标检测在设计中的应用
|
||||
|
||||
### 从分类到检测
|
||||
|
||||
#### 图像分类
|
||||
|
||||
`输入图像`` → CNN → ``类别标签`\
|
||||
`"``猫``" (``单标签``)`
|
||||
|
||||
#### 目标检测
|
||||
|
||||
`输入图像`` → CNN → [``位置``, ``类别``]`\
|
||||
`[``边界框``, "``猫``", 0.95]`\
|
||||
`[``边界框``, "``狗``", 0.87]`
|
||||
|
||||
**核心差异**:检测需要同时解决"是什么"和"在哪里"
|
||||
|
||||
### 检测器类型
|
||||
|
||||
#### Two-Stage检测器
|
||||
|
||||
`第一阶段:候选区域生成`\
|
||||
` RPN (Region Proposal Network)`\
|
||||
\
|
||||
`第二阶段:分类与回归`\
|
||||
` ``对每个候选框进行精确预测`\
|
||||
\
|
||||
`代表:``R-CNN, Fast R-CNN, Faster R-CNN`
|
||||
|
||||
特点:准确率高,速度慢
|
||||
|
||||
#### One-Stage检测器
|
||||
|
||||
`直接预测:一次性输出所有边界框和类别`\
|
||||
\
|
||||
`代表:``YOLO, SSD, ``RetinaNet`
|
||||
|
||||
特点:速度快,实时性好
|
||||
|
||||
### YOLO系列演进
|
||||
|
||||
#### YOLO v1 (2016)
|
||||
|
||||
**核心思想**:将检测转化为回归问题
|
||||
|
||||
`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框`
|
||||
|
||||
创新点: - 端到端训练 - 实时检测 (45 FPS)
|
||||
|
||||
#### YOLO v2-v4
|
||||
|
||||
----------------------------------
|
||||
版本 主要改进
|
||||
------ ---------------------------
|
||||
v2 Batch Normalization, 锚框
|
||||
|
||||
v3 多尺度预测
|
||||
|
||||
v4 CSPDarknet, PANet
|
||||
|
||||
v5 PyTorch实现,工程优化
|
||||
|
||||
v8 重新设计,更易用
|
||||
----------------------------------
|
||||
|
||||
#### YOLO工作流程
|
||||
|
||||
##### 1. 输入图像 (640×640)
|
||||
|
||||
`↓`
|
||||
|
||||
##### 2. Backbone特征提取
|
||||
|
||||
`↓`
|
||||
|
||||
##### 3. Neck特征融合 (FPN + PAN)
|
||||
|
||||
`↓`
|
||||
|
||||
##### 4. Head检测输出
|
||||
|
||||
`- ``边界框坐标`
|
||||
|
||||
`- ``目标置信度`
|
||||
|
||||
`- ``类别概率`
|
||||
|
||||
### 评估指标
|
||||
|
||||
#### IoU (交并比)
|
||||
|
||||
`IoU`` = ``预测框与真实框的交集`` / ``并集`\
|
||||
\
|
||||
` ┌─────────┐`\
|
||||
` │ ``预测框`` │`\
|
||||
` │ ┌───┐ │`\
|
||||
` │ │``真`` │ │`\
|
||||
` └──┼──┼─┘`\
|
||||
` └───┘`\
|
||||
\
|
||||
`IoU`` = ``重叠面积`` / ``总面积`
|
||||
|
||||
### mAP (平均精度均值)
|
||||
|
||||
在不同IoU阈值(0.5, 0.75...)下的平均精度
|
||||
|
||||
综合衡量定位准确度和分类准确度
|
||||
|
||||
### COCO数据集
|
||||
|
||||
80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明
|
||||
|
||||
## 设计领域应用
|
||||
|
||||
建筑识别
|
||||
|
||||
`卫星图像`` → YOLO → ``建筑物边界框`\
|
||||
` ↓`\
|
||||
`自动生成建筑轮廓`
|
||||
|
||||
场景分析
|
||||
|
||||
`室内照片`` → ``目标检测`` → ``家具识别`\
|
||||
` ↓`\
|
||||
`空间布局分析`
|
||||
|
||||
遗产保护
|
||||
|
||||
`无人机影像`` → ``建筑病害检测`\
|
||||
` ↓`\
|
||||
`自动化巡检与记录`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.Two-Stage和One-Stage检测器的权衡是什么?
|
||||
|
||||
2.为什么YOLO能实现实时检测?
|
||||
|
||||
3.目标检测在规划设计中有哪些潜在应用?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------------- -------------- -------------------------
|
||||
边界框 Bounding Box 矩形目标框
|
||||
|
||||
锚框 Anchor Box 预定义的候选框
|
||||
|
||||
非极大值抑制 NMS 去除重复检测
|
||||
|
||||
交并比 IoU Intersection over Union
|
||||
|
||||
平均精度 AP Average Precision
|
||||
-------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
[Ultralytics YOLO文档](https://docs.ultralytics.com/)
|
||||
|
||||
[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析
|
||||
@@ -1,136 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
理解图像分析的三种层级
|
||||
|
||||
掌握语义分割与实例分割的区别
|
||||
|
||||
了解分割技术在空间分析中的应用
|
||||
|
||||
## 图像分析层级
|
||||
|
||||
### Pixel-Level (像素级)
|
||||
|
||||
`每个像素独立处理`\
|
||||
`问题:不考虑上下文`
|
||||
|
||||
### Patch-Level (图块级)
|
||||
|
||||
`以图像块为单位`\
|
||||
`特点:保留局部空间关系`\
|
||||
`应用:``CNN``卷积操作`
|
||||
|
||||
### Object-Level (对象级)
|
||||
|
||||
`以完整对象为单位`\
|
||||
`特点:语义完整`\
|
||||
`应用:目标检测、分割`
|
||||
|
||||
### 语义分割 vs 实例分割
|
||||
|
||||
#### 语义分割 (Semantic Segmentation)
|
||||
|
||||
`所有同类对象归为一类`\
|
||||
`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]`
|
||||
|
||||
特点: - 同类别用同一种颜色 - 不区分个体数量
|
||||
|
||||
#### 实例分割 (Instance Segmentation)
|
||||
|
||||
`每个对象单独分割`\
|
||||
`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]`
|
||||
|
||||
特点: - 区分同类对象的不同个体 - 更精细的场景理解
|
||||
|
||||
### 分割网络架构
|
||||
|
||||
#### FCN (全卷积网络)
|
||||
|
||||
`CNN``特征提取`` → ``上采样`` → ``像素级预测`
|
||||
|
||||
创新:用卷积层替代全连接层,输出热力图
|
||||
|
||||
#### U-Net
|
||||
|
||||
`编码器`` → ``瓶颈层`` → ``解码器`\
|
||||
` ↓ ↑`\
|
||||
`跳跃连接`` ───────────────┘`
|
||||
|
||||
特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构
|
||||
|
||||
#### DeepLab系列
|
||||
|
||||
空洞卷积 (Atrous Convolution)
|
||||
|
||||
扩大感受野而不降低分辨率
|
||||
|
||||
ASPP (空洞空间金字塔池化)
|
||||
|
||||
### 空间分析应用
|
||||
|
||||
#### 遥感影像分析
|
||||
|
||||
`卫星图像`` → ``语义分割`` → ``土地利用分类`\
|
||||
` ↓`\
|
||||
`- ``建筑用地`\
|
||||
`- ``农用地`\
|
||||
`- ``水体`\
|
||||
`- ``森林`
|
||||
|
||||
#### 城市形态分析
|
||||
|
||||
`街景图像`` → ``分割`` → ``空间品质评估`\
|
||||
` ↓`\
|
||||
`- ``绿视率`\
|
||||
`- ``天空开阔度`\
|
||||
`- ``建筑密度`
|
||||
|
||||
#### 景观格局分析
|
||||
|
||||
`高分辨率影像`` → ``生态源地识别`\
|
||||
` ↓`\
|
||||
`景观连接性评估`
|
||||
|
||||
### 分割与检测对比
|
||||
|
||||
--------------------------------
|
||||
特性 目标检测 语义分割
|
||||
-------- ---------- ------------
|
||||
输出 矩形框 像素级标注
|
||||
|
||||
精度 粗糙 精细
|
||||
|
||||
计算量 较低 较高
|
||||
|
||||
应用 目标定位 场景理解
|
||||
--------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.语义分割和实例分割分别在什么场景下更有用?
|
||||
|
||||
2.U-Net的跳跃连接为什么重要?
|
||||
|
||||
3.分割技术如何辅助规划设计决策?
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ----------------------- ------------------
|
||||
语义分割 Semantic Segmentation 按类别分割像素
|
||||
|
||||
实例分割 Instance Segmentation 按对象个体分割
|
||||
|
||||
热力图 Heatmap 像素级预测结果
|
||||
|
||||
空洞卷积 Atrous Convolution 扩大感受野的卷积
|
||||
|
||||
跳跃连接 Skip Connection 跨层连接
|
||||
-----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038)
|
||||
|
||||
[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597)
|
||||
@@ -8,26 +8,457 @@
|
||||
|
||||
本篇将系统介绍CNN原理及其在空间分析中的应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
[02.1 CNN基础原理](02.1-cnn-foundation.md) - 卷积神经网络三大组件
|
||||
### 学习目标
|
||||
|
||||
[02.2 目标检测](02.2-object-detection.md) - YOLO系列与应用
|
||||
理解CNN的核心思想:局部连接与权重共享
|
||||
|
||||
[02.3 语义分割与空间分析](02.3-semantic-segmentation.md) - 图像分析层级
|
||||
掌握卷积、激活、池化三大组件
|
||||
|
||||
## 核心概念
|
||||
了解CNN与MLP的区别和联系
|
||||
|
||||
---------------------------------------------------------------
|
||||
概念 英文 说明
|
||||
-------------- ----------------- ------------------------------
|
||||
卷积神经网络 CNN Convolutional Neural Network
|
||||
### 为什么需要CNN
|
||||
|
||||
特征图 Feature Map 卷积操作的输出
|
||||
MLP的问题
|
||||
|
||||
感受野 Receptive Field 神经元能"看到"的输入区域
|
||||
将图像展平成一维向量输入MLP:
|
||||
|
||||
池化 Pooling 下采样操作
|
||||
---------------------------------------------------------------
|
||||
`28×28``图像`` → 784``维向量`` → MLP`
|
||||
|
||||
## 02.1 CNN基础原理
|
||||
**问题**: 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习
|
||||
|
||||
#### CNN的解决方案
|
||||
|
||||
------------------------------------------------------------
|
||||
特性 说明 优势
|
||||
------------ -------------------------- --------------------
|
||||
局部连接 每个神经元只连接局部区域 符合图像局部相关性
|
||||
|
||||
权重共享 同一卷积核扫描全图 大幅减少参数
|
||||
|
||||
层次化特征 低层→高层特征抽象 自动学习特征表达
|
||||
------------------------------------------------------------
|
||||
|
||||
### CNN三大组件
|
||||
|
||||
#### 1. 卷积层 (Convolution)
|
||||
|
||||
**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征
|
||||
|
||||
`输入图像`` ``卷积核`` ``特征图`\
|
||||
`┌─────────┐ ┌─────┐ ┌─────────┐`\
|
||||
`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\
|
||||
`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\
|
||||
`│ 7 8 9 │ │ │ │ │`\
|
||||
`└─────────┘ └─────┘ └─────────┘`
|
||||
|
||||
**计算示例**:
|
||||
|
||||
`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4`
|
||||
|
||||
**多通道卷积**:
|
||||
|
||||
`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)`
|
||||
|
||||
#### 2. 激活层 (Activation)
|
||||
|
||||
通常使用ReLU:
|
||||
|
||||
`output ``=`` ``max``(``0``, ``feature_map``)`
|
||||
|
||||
作用:引入非线性,使网络能学习复杂模式
|
||||
|
||||
#### 3. 池化层 (Pooling)
|
||||
|
||||
**最大池化** (Max Pooling):
|
||||
|
||||
`2×2``窗口`` → ``取最大值`\
|
||||
`┌─────┐ ┌───┐`\
|
||||
`│3 1 │ │ 3 │`\
|
||||
`│2 5 │ → │ │`\
|
||||
`└─────┘ │ 5 │`\
|
||||
` └───┘`
|
||||
|
||||
作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野
|
||||
|
||||
### CNN架构示例
|
||||
|
||||
#### LeNet-5 (经典架构)
|
||||
|
||||
`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\
|
||||
` ↓`\
|
||||
` ``全连接层`` → ``输出`
|
||||
|
||||
#### VGG-16 (深层架构)
|
||||
|
||||
`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\
|
||||
` → [Conv×3 + Pool] ×3 → FC×3 → ``输出`
|
||||
|
||||
### CNN vs MLP
|
||||
|
||||
-------------------------------------
|
||||
特性 MLP CNN
|
||||
---------- -------------- -----------
|
||||
连接方式 全连接 局部连接
|
||||
|
||||
权重 每个连接独立 同层共享
|
||||
|
||||
空间结构 忽略 保留
|
||||
|
||||
参数量 大 小
|
||||
|
||||
适用任务 结构化数据 图像/语音
|
||||
-------------------------------------
|
||||
|
||||
### 经典网络架构演进
|
||||
|
||||
`LeNet`` (1998) → ``首次定义``CNN``结构`\
|
||||
` ↓`\
|
||||
`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\
|
||||
` ↓`\
|
||||
`VGG (2014) → ``更深网络,``3×3``小卷积核`\
|
||||
` ↓`\
|
||||
`GoogLeNet`` (2014) → Inception``模块,多尺度`\
|
||||
` ↓`\
|
||||
`ResNet`` (2015) → ``残差连接,``152``层`\
|
||||
` ↓`\
|
||||
`EfficientNet`` (2019) → ``复合缩放,高效`
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)?
|
||||
|
||||
2.感受野如何随着网络深度增加?
|
||||
|
||||
3.设计一个简单的CNN用于手写数字识别
|
||||
|
||||
### 关键术语
|
||||
|
||||
-------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------- ----------------- ----------------------------
|
||||
卷积核 Kernel/Filter 用于特征提取的小矩阵
|
||||
|
||||
步幅 Stride 卷积核滑动的步长
|
||||
|
||||
填充 Padding 边缘补零以保持尺寸
|
||||
|
||||
感受野 Receptive Field 神经元响应的输入区域
|
||||
|
||||
通道 Channel 图像的颜色维度或特征图数量
|
||||
-------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/)
|
||||
|
||||
[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测
|
||||
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
理解目标检测与图像分类的区别
|
||||
|
||||
掌握YOLO系列的发展脉络
|
||||
|
||||
了解目标检测在设计中的应用
|
||||
|
||||
### 从分类到检测
|
||||
|
||||
#### 图像分类
|
||||
|
||||
`输入图像`` → CNN → ``类别标签`\
|
||||
`"``猫``" (``单标签``)`
|
||||
|
||||
#### 目标检测
|
||||
|
||||
`输入图像`` → CNN → [``位置``, ``类别``]`\
|
||||
`[``边界框``, "``猫``", 0.95]`\
|
||||
`[``边界框``, "``狗``", 0.87]`
|
||||
|
||||
**核心差异**:检测需要同时解决"是什么"和"在哪里"
|
||||
|
||||
### 检测器类型
|
||||
|
||||
#### Two-Stage检测器
|
||||
|
||||
`第一阶段:候选区域生成`\
|
||||
` RPN (Region Proposal Network)`\
|
||||
\
|
||||
`第二阶段:分类与回归`\
|
||||
` ``对每个候选框进行精确预测`\
|
||||
\
|
||||
`代表:``R-CNN, Fast R-CNN, Faster R-CNN`
|
||||
|
||||
特点:准确率高,速度慢
|
||||
|
||||
#### One-Stage检测器
|
||||
|
||||
`直接预测:一次性输出所有边界框和类别`\
|
||||
\
|
||||
`代表:``YOLO, SSD, ``RetinaNet`
|
||||
|
||||
特点:速度快,实时性好
|
||||
|
||||
### YOLO系列演进
|
||||
|
||||
#### YOLO v1 (2016)
|
||||
|
||||
**核心思想**:将检测转化为回归问题
|
||||
|
||||
`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框`
|
||||
|
||||
创新点: - 端到端训练 - 实时检测 (45 FPS)
|
||||
|
||||
#### YOLO v2-v4
|
||||
|
||||
----------------------------------
|
||||
版本 主要改进
|
||||
------ ---------------------------
|
||||
v2 Batch Normalization, 锚框
|
||||
|
||||
v3 多尺度预测
|
||||
|
||||
v4 CSPDarknet, PANet
|
||||
|
||||
v5 PyTorch实现,工程优化
|
||||
|
||||
v8 重新设计,更易用
|
||||
----------------------------------
|
||||
|
||||
#### YOLO工作流程
|
||||
|
||||
##### 1. 输入图像 (640×640)
|
||||
|
||||
`↓`
|
||||
|
||||
##### 2. Backbone特征提取
|
||||
|
||||
`↓`
|
||||
|
||||
##### 3. Neck特征融合 (FPN + PAN)
|
||||
|
||||
`↓`
|
||||
|
||||
##### 4. Head检测输出
|
||||
|
||||
`- ``边界框坐标`
|
||||
|
||||
`- ``目标置信度`
|
||||
|
||||
`- ``类别概率`
|
||||
|
||||
### 评估指标
|
||||
|
||||
#### IoU (交并比)
|
||||
|
||||
`IoU`` = ``预测框与真实框的交集`` / ``并集`\
|
||||
\
|
||||
` ┌─────────┐`\
|
||||
` │ ``预测框`` │`\
|
||||
` │ ┌───┐ │`\
|
||||
` │ │``真`` │ │`\
|
||||
` └──┼──┼─┘`\
|
||||
` └───┘`\
|
||||
\
|
||||
`IoU`` = ``重叠面积`` / ``总面积`
|
||||
|
||||
### mAP (平均精度均值)
|
||||
|
||||
在不同IoU阈值(0.5, 0.75...)下的平均精度
|
||||
|
||||
综合衡量定位准确度和分类准确度
|
||||
|
||||
### COCO数据集
|
||||
|
||||
80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明
|
||||
|
||||
## 设计领域应用
|
||||
|
||||
建筑识别
|
||||
|
||||
`卫星图像`` → YOLO → ``建筑物边界框`\
|
||||
` ↓`\
|
||||
`自动生成建筑轮廓`
|
||||
|
||||
场景分析
|
||||
|
||||
`室内照片`` → ``目标检测`` → ``家具识别`\
|
||||
` ↓`\
|
||||
`空间布局分析`
|
||||
|
||||
遗产保护
|
||||
|
||||
`无人机影像`` → ``建筑病害检测`\
|
||||
` ↓`\
|
||||
`自动化巡检与记录`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1.Two-Stage和One-Stage检测器的权衡是什么?
|
||||
|
||||
2.为什么YOLO能实现实时检测?
|
||||
|
||||
3.目标检测在规划设计中有哪些潜在应用?
|
||||
|
||||
## 关键术语
|
||||
|
||||
-------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------------- -------------- -------------------------
|
||||
边界框 Bounding Box 矩形目标框
|
||||
|
||||
锚框 Anchor Box 预定义的候选框
|
||||
|
||||
非极大值抑制 NMS 去除重复检测
|
||||
|
||||
交并比 IoU Intersection over Union
|
||||
|
||||
平均精度 AP Average Precision
|
||||
-------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
[Ultralytics YOLO文档](https://docs.ultralytics.com/)
|
||||
|
||||
[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析
|
||||
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
理解图像分析的三种层级
|
||||
|
||||
掌握语义分割与实例分割的区别
|
||||
|
||||
了解分割技术在空间分析中的应用
|
||||
|
||||
## 图像分析层级
|
||||
|
||||
### Pixel-Level (像素级)
|
||||
|
||||
`每个像素独立处理`\
|
||||
`问题:不考虑上下文`
|
||||
|
||||
### Patch-Level (图块级)
|
||||
|
||||
`以图像块为单位`\
|
||||
`特点:保留局部空间关系`\
|
||||
`应用:``CNN``卷积操作`
|
||||
|
||||
### Object-Level (对象级)
|
||||
|
||||
`以完整对象为单位`\
|
||||
`特点:语义完整`\
|
||||
`应用:目标检测、分割`
|
||||
|
||||
### 语义分割 vs 实例分割
|
||||
|
||||
#### 语义分割 (Semantic Segmentation)
|
||||
|
||||
`所有同类对象归为一类`\
|
||||
`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]`
|
||||
|
||||
特点: - 同类别用同一种颜色 - 不区分个体数量
|
||||
|
||||
#### 实例分割 (Instance Segmentation)
|
||||
|
||||
`每个对象单独分割`\
|
||||
`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]`
|
||||
|
||||
特点: - 区分同类对象的不同个体 - 更精细的场景理解
|
||||
|
||||
### 分割网络架构
|
||||
|
||||
#### FCN (全卷积网络)
|
||||
|
||||
`CNN``特征提取`` → ``上采样`` → ``像素级预测`
|
||||
|
||||
创新:用卷积层替代全连接层,输出热力图
|
||||
|
||||
#### U-Net
|
||||
|
||||
`编码器`` → ``瓶颈层`` → ``解码器`\
|
||||
` ↓ ↑`\
|
||||
`跳跃连接`` ───────────────┘`
|
||||
|
||||
特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构
|
||||
|
||||
#### DeepLab系列
|
||||
|
||||
空洞卷积 (Atrous Convolution)
|
||||
|
||||
扩大感受野而不降低分辨率
|
||||
|
||||
ASPP (空洞空间金字塔池化)
|
||||
|
||||
### 空间分析应用
|
||||
|
||||
#### 遥感影像分析
|
||||
|
||||
`卫星图像`` → ``语义分割`` → ``土地利用分类`\
|
||||
` ↓`\
|
||||
`- ``建筑用地`\
|
||||
`- ``农用地`\
|
||||
`- ``水体`\
|
||||
`- ``森林`
|
||||
|
||||
#### 城市形态分析
|
||||
|
||||
`街景图像`` → ``分割`` → ``空间品质评估`\
|
||||
` ↓`\
|
||||
`- ``绿视率`\
|
||||
`- ``天空开阔度`\
|
||||
`- ``建筑密度`
|
||||
|
||||
#### 景观格局分析
|
||||
|
||||
`高分辨率影像`` → ``生态源地识别`\
|
||||
` ↓`\
|
||||
`景观连接性评估`
|
||||
|
||||
### 分割与检测对比
|
||||
|
||||
--------------------------------
|
||||
特性 目标检测 语义分割
|
||||
-------- ---------- ------------
|
||||
输出 矩形框 像素级标注
|
||||
|
||||
精度 粗糙 精细
|
||||
|
||||
计算量 较低 较高
|
||||
|
||||
应用 目标定位 场景理解
|
||||
--------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.语义分割和实例分割分别在什么场景下更有用?
|
||||
|
||||
2.U-Net的跳跃连接为什么重要?
|
||||
|
||||
3.分割技术如何辅助规划设计决策?
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ----------------------- ------------------
|
||||
语义分割 Semantic Segmentation 按类别分割像素
|
||||
|
||||
实例分割 Instance Segmentation 按对象个体分割
|
||||
|
||||
热力图 Heatmap 像素级预测结果
|
||||
|
||||
空洞卷积 Atrous Convolution 扩大感受野的卷积
|
||||
|
||||
跳跃连接 Skip Connection 跨层连接
|
||||
-----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038)
|
||||
|
||||
[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597)
|
||||
|
||||
@@ -1,156 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解Self-Attention的动机和原理
|
||||
|
||||
掌握Q、K、V的计算过程
|
||||
|
||||
了解Multi-Head Attention的优势
|
||||
|
||||
### 为什么需要Attention
|
||||
|
||||
#### 序列标注问题
|
||||
|
||||
`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\
|
||||
`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)`
|
||||
|
||||
传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算
|
||||
|
||||
Self-Attention: - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算
|
||||
|
||||
### Self-Attention原理
|
||||
|
||||
#### 核心思想 {#核心思想-1}
|
||||
|
||||
为每个输出元素,计算输入序列中所有元素的相关性:
|
||||
|
||||
`对于每个位置``i``:`\
|
||||
` yᵢ = Σ (``注意力权重`` × ``对应输入值``)`
|
||||
|
||||
#### Q、K、V计算
|
||||
|
||||
`输入``X → ``三个线性变换`\
|
||||
` ↓`\
|
||||
`Q (Query): "``我想找什么``"`\
|
||||
`K (Key): "``我有什么标签``"`\
|
||||
`V (Value): "``我的实际内容``"`
|
||||
|
||||
#### 注意力分数计算
|
||||
|
||||
`1. ``计算相似度:``Score = Q × Kᵀ`
|
||||
|
||||
`2. ``缩放:``Score = Score / √dₖ`
|
||||
|
||||
`3. ``Softmax``:``Weight = ``softmax``(Score)`
|
||||
|
||||
`4. ``加权求和:``Output = Weight × V`
|
||||
|
||||
#### 直观理解 {#直观理解-2}
|
||||
|
||||
`查询:``"``苹果``"`\
|
||||
` ↓`\
|
||||
`与所有``Key``计算相似度`\
|
||||
` ↓`\
|
||||
`权重高的``Key``对应``Value``贡献更大`\
|
||||
` ↓`\
|
||||
`输出:融合上下文的``"``苹果``"``表示`
|
||||
|
||||
### Multi-Head Attention
|
||||
|
||||
单头 vs 多头
|
||||
|
||||
**单头注意力**:
|
||||
|
||||
`一组``Q``、``K``、``V → ``一个注意力表示`
|
||||
|
||||
**多头注意力**:
|
||||
|
||||
`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接`
|
||||
|
||||
#### 多头优势
|
||||
|
||||
---------------------
|
||||
头 关注内容
|
||||
-------- ------------
|
||||
Head 1 语法关系
|
||||
|
||||
Head 2 语义指代
|
||||
|
||||
Head 3 长距离依赖
|
||||
|
||||
... ...
|
||||
---------------------
|
||||
|
||||
多头让模型从不同角度理解序列。
|
||||
|
||||
### Positional Encoding
|
||||
|
||||
#### 问题
|
||||
|
||||
Self-Attention本身是**置换不变**的:
|
||||
|
||||
`Attention(``[A, B, C]) = Attention([B, A, C])`
|
||||
|
||||
但序列位置很重要!
|
||||
|
||||
#### 解决方案
|
||||
|
||||
添加位置信息:
|
||||
|
||||
`输入`` = X + ``PositionalEncoding`
|
||||
|
||||
常用方法: - 正弦/余弦位置编码 - 可学习位置编码
|
||||
|
||||
### Self-Attention vs CNN
|
||||
|
||||
感受野对比
|
||||
|
||||
------------------------------------
|
||||
层级 CNN Self-Attention
|
||||
------ ------------ ----------------
|
||||
单层 局部感受野 全局感受野
|
||||
|
||||
深层 逐层扩大 始终全局
|
||||
------------------------------------
|
||||
|
||||
计算复杂度
|
||||
|
||||
--------------------------------------
|
||||
操作 CNN Self-Attention
|
||||
-------- ------------ ----------------
|
||||
复杂度 O(k²·C) O(n²·d)
|
||||
|
||||
n 图像尺寸 序列长度
|
||||
|
||||
k 卷积核大小 \-
|
||||
--------------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么Attention需要Scaling (除以√dₖ)?
|
||||
|
||||
2.Multi-Head Attention中,头数越多越好吗?
|
||||
|
||||
3.Self-Attention如何应用在图像上?
|
||||
|
||||
### 关键术语
|
||||
|
||||
------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- -------------------- ----------------------
|
||||
查询 Query 查询向量
|
||||
|
||||
键 Key 键向量
|
||||
|
||||
值 Value 值向量
|
||||
|
||||
缩放点积 Scaled Dot-Product 注意力计算方式
|
||||
|
||||
掩码 Mask 屏蔽某些位置的注意力
|
||||
------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Attention Is All You Need](https://arxiv.org/abs/1706.03762)
|
||||
|
||||
[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构
|
||||
@@ -1,157 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解Transformer的Encoder-Decoder结构
|
||||
|
||||
掌握各组件的作用和连接方式
|
||||
|
||||
了解Token处理流程
|
||||
|
||||
### 整体架构
|
||||
|
||||
`输入``Token``序列`` → Encoder → ``编码表示`\
|
||||
` ↓`\
|
||||
`输出``Token``序列`` ← Decoder ← ``编码表示`
|
||||
|
||||
### Encoder层
|
||||
|
||||
单层结构
|
||||
|
||||
`输入``X`\
|
||||
` ↓`\
|
||||
`Multi-Head Self-Attention`\
|
||||
` ↓`\
|
||||
`Add & Norm (``残差连接`` + ``层归一化``)`\
|
||||
` ↓`\
|
||||
`Feed-Forward Network (FFN)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`输出``H`
|
||||
|
||||
#### 残差连接
|
||||
|
||||
`输出`` = F(x) + x`
|
||||
|
||||
作用: - 缓解梯度消失 - 便于训练深层网络
|
||||
|
||||
#### 层归一化
|
||||
|
||||
`输出`` = ``LayerNorm``(x + F(x))`
|
||||
|
||||
作用: - 稳定训练 - 加速收敛
|
||||
|
||||
#### FFN (前馈网络)
|
||||
|
||||
`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂`
|
||||
|
||||
本质:两层全连接网络,非线性变换
|
||||
|
||||
### Decoder层
|
||||
|
||||
#### 结构
|
||||
|
||||
`输入``X`\
|
||||
` ↓`\
|
||||
`Masked Self-Attention (``只能看之前的位置``)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`FFN`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`输出`` (``接``Softmax``预测概率``)`
|
||||
|
||||
#### Cross-Attention
|
||||
|
||||
`Q: Decoder``的隐藏状态`\
|
||||
`K, V: Encoder``的输出`
|
||||
|
||||
作用:让Decoder关注Encoder的相关部分
|
||||
|
||||
## Token处理流程
|
||||
|
||||
### 输入处理
|
||||
|
||||
`文本`` → Tokenize → Token IDs`\
|
||||
` ↓`\
|
||||
` Embedding``层`\
|
||||
` ↓`\
|
||||
` ``位置编码相加`\
|
||||
` ↓`\
|
||||
` Encoder/Decoder`
|
||||
|
||||
### 输出处理
|
||||
|
||||
`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\
|
||||
` ↓`\
|
||||
` ``选择最大值`
|
||||
|
||||
## 训练与推理
|
||||
|
||||
训练阶段
|
||||
|
||||
`教师强制`` (Teacher Forcing)``:`\
|
||||
` ``真实标签作为``Decoder``输入`\
|
||||
` ``可以并行计算`
|
||||
|
||||
推理阶段
|
||||
|
||||
`自回归生成`` (Autoregressive)``:`\
|
||||
` ``生成一个``Token → ``加入输入`` → ``生成下一个`\
|
||||
` ``串行计算`
|
||||
|
||||
## Transformer变体
|
||||
|
||||
BERT (Encoder-only)
|
||||
|
||||
`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示`
|
||||
|
||||
应用:分类、NER、问答
|
||||
|
||||
GPT (Decoder-only)
|
||||
|
||||
`输入`` → Decoder → ``下一个``Token``预测`
|
||||
|
||||
应用:文本生成
|
||||
|
||||
T5 (Encoder-Decoder)
|
||||
|
||||
`输入`` → Encoder → ``表示`` → Decoder → ``输出`
|
||||
|
||||
应用:翻译、摘要
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. 为什么Decoder需要Masked Attention?
|
||||
|
||||
2. Encoder-only和Decoder-only模型各有什么优势?
|
||||
|
||||
3. Transformer如何处理超长序列?
|
||||
|
||||
## 关键术语
|
||||
|
||||
----------------------------------------------------------
|
||||
中文 英文 说明
|
||||
--------------- --------------------- --------------------
|
||||
残差连接 Residual Connection 跨层连接
|
||||
|
||||
层归一化 Layer Normalization 归一化层
|
||||
|
||||
教师强制 Teacher Forcing 训练时使用真实标签
|
||||
|
||||
自回归 Autoregressive 基于前序生成后续
|
||||
|
||||
编码器-解码器 Encoder-Decoder Seq2Seq架构
|
||||
----------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html)
|
||||
|
||||
[Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用
|
||||
@@ -1,166 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
3. 理解从Transformer到ChatGPT的演进
|
||||
|
||||
掌握RAG、RLHF等关键技术
|
||||
|
||||
了解Prompt工程在设计中的应用
|
||||
|
||||
## 从Transformer到ChatGPT
|
||||
|
||||
### GPT系列演进
|
||||
|
||||
------------------------------------------------------
|
||||
模型 发布时间 参数量 特点
|
||||
--------- ---------- -------- ------------------------
|
||||
GPT-1 2018 117M 验证Decoder-only可行性
|
||||
|
||||
GPT-2 2019 1.5B 展示零样本能力
|
||||
|
||||
GPT-3 2020 175B 少样本学习震撼业界
|
||||
|
||||
ChatGPT 2022 \~ 对话能力达到新高度
|
||||
|
||||
GPT-4 2023 \~ 多模态能力
|
||||
------------------------------------------------------
|
||||
|
||||
### 训练范式
|
||||
|
||||
`预训练`` (Pre-training)``:`\
|
||||
` ``大规模文本`` → ``无监督学习`` → ``语言模型`\
|
||||
\
|
||||
`微调`` (Fine-tuning)``:`\
|
||||
` ``特定任务`` → ``有监督学习`` → ``任务模型`
|
||||
|
||||
## RAG:检索增强生成
|
||||
|
||||
### 核心思想 {#核心思想-2}
|
||||
|
||||
用户提问 → 检索相关文档 → LLM生成答案
|
||||
↑
|
||||
外部知识库
|
||||
|
||||
### RAG架构
|
||||
|
||||
#### 文档索引
|
||||
|
||||
`文档`` → ``切分`` → Embedding → ``向量数据库`
|
||||
|
||||
####
|
||||
|
||||
`2. ``检索阶段`
|
||||
|
||||
#### 问题 → Embedding → 相似度搜索 → 相关文档
|
||||
|
||||
`3. ``生成阶段`
|
||||
|
||||
问题 + 相关文档 → LLM → 答案
|
||||
|
||||
### RAG优势
|
||||
|
||||
---------------------------
|
||||
特点 说明
|
||||
---------- ----------------
|
||||
减少幻觉 基于检索的事实
|
||||
|
||||
可更新 更新知识库即可
|
||||
|
||||
可解释 显示参考来源
|
||||
---------------------------
|
||||
|
||||
## RLHF:人类反馈强化学习
|
||||
|
||||
### 为什么需要RLHF
|
||||
|
||||
预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出
|
||||
|
||||
### RLHF三阶段
|
||||
|
||||
#### 有监督微调 (SFT)
|
||||
|
||||
`人工标注对话`` → ``微调模型`
|
||||
|
||||
`2. ``奖励模型`` (RM)`
|
||||
|
||||
#### 多个输出 → 人类排序 → 训练奖励模型
|
||||
|
||||
`3. ``强化学习`` (RL)`
|
||||
|
||||
PPO算法 → 优化策略
|
||||
|
||||
### 效果
|
||||
|
||||
1. 输出更符合人类偏好
|
||||
|
||||
减少有害内容
|
||||
|
||||
提高回答质量
|
||||
|
||||
## Prompt工程
|
||||
|
||||
### Prompt设计原则
|
||||
|
||||
#### 明确任务
|
||||
|
||||
`好:请总结以下文本的主要观点`\
|
||||
`差:看看这段文字`
|
||||
|
||||
#### 提供示例
|
||||
|
||||
`任务:情感分类`\
|
||||
`示例:`\
|
||||
`"``这部电影太棒了!``" → ``正面`\
|
||||
`"``服务态度很差。``" → ``负面`\
|
||||
`现在分类:``"..."`
|
||||
|
||||
### 指定格式
|
||||
|
||||
`请按以下格式输出:`\
|
||||
`- ``观点``1``:``...`\
|
||||
`- ``观点``2``:``...`\
|
||||
`- ``结论:``...`
|
||||
|
||||
## 设计领域应用
|
||||
|
||||
-------------------------------------------------------
|
||||
任务 Prompt示例
|
||||
---------- --------------------------------------------
|
||||
方案生成 "设计一个50人的办公空间,要求开放式布局"
|
||||
|
||||
代码生成 "写一个Python脚本计算建筑容积率"
|
||||
|
||||
文档撰写 "帮我写一份景观设计说明书的框架"
|
||||
-------------------------------------------------------
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. RAG和微调(Fine-tuning)各适用于什么场景?
|
||||
|
||||
2. 如何评估LLM输出的质量?
|
||||
|
||||
3. Prompt工程在设计工作流中能解决什么问题?
|
||||
|
||||
## 关键术语
|
||||
|
||||
------------------------------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------------ -------------------- --------------------------------------------
|
||||
检索增强生成 RAG Retrieval-Augmented Generation
|
||||
|
||||
人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback
|
||||
|
||||
提示工程 Prompt Engineering 设计输入以引导模型输出
|
||||
|
||||
向量数据库 Vector Database 存储和检索向量表示
|
||||
|
||||
幻觉 Hallucination 模型编造错误信息
|
||||
------------------------------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165)
|
||||
|
||||
[Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155)
|
||||
|
||||
[LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/)
|
||||
@@ -8,26 +8,487 @@ Transformer是AI领域最重要的架构创新之一。它不仅彻底改变了
|
||||
|
||||
本篇将从注意力机制出发,深入理解Transformer架构,并探讨大语言模型在设计领域的应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
[03.1 注意力机制](03.1-attention.md) - Self-Attention原理
|
||||
### 学习目标
|
||||
|
||||
[03.2 Transformer架构](03.2-transformer.md) - Encoder-Decoder结构
|
||||
理解Self-Attention的动机和原理
|
||||
|
||||
[03.3 大语言模型应用](03.3-llm-application.md) - ChatGPT、RAG与Prompt工程
|
||||
掌握Q、K、V的计算过程
|
||||
|
||||
## 核心概念
|
||||
了解Multi-Head Attention的优势
|
||||
|
||||
### 为什么需要Attention
|
||||
|
||||
#### 序列标注问题
|
||||
|
||||
`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\
|
||||
`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)`
|
||||
|
||||
传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算
|
||||
|
||||
Self-Attention: - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算
|
||||
|
||||
### Self-Attention原理
|
||||
|
||||
#### 核心思想 {#核心思想-1}
|
||||
|
||||
为每个输出元素,计算输入序列中所有元素的相关性:
|
||||
|
||||
`对于每个位置``i``:`\
|
||||
` yᵢ = Σ (``注意力权重`` × ``对应输入值``)`
|
||||
|
||||
#### Q、K、V计算
|
||||
|
||||
`输入``X → ``三个线性变换`\
|
||||
` ↓`\
|
||||
`Q (Query): "``我想找什么``"`\
|
||||
`K (Key): "``我有什么标签``"`\
|
||||
`V (Value): "``我的实际内容``"`
|
||||
|
||||
#### 注意力分数计算
|
||||
|
||||
`1. ``计算相似度:``Score = Q × Kᵀ`
|
||||
|
||||
`2. ``缩放:``Score = Score / √dₖ`
|
||||
|
||||
`3. ``Softmax``:``Weight = ``softmax``(Score)`
|
||||
|
||||
`4. ``加权求和:``Output = Weight × V`
|
||||
|
||||
#### 直观理解 {#直观理解-2}
|
||||
|
||||
`查询:``"``苹果``"`\
|
||||
` ↓`\
|
||||
`与所有``Key``计算相似度`\
|
||||
` ↓`\
|
||||
`权重高的``Key``对应``Value``贡献更大`\
|
||||
` ↓`\
|
||||
`输出:融合上下文的``"``苹果``"``表示`
|
||||
|
||||
### Multi-Head Attention
|
||||
|
||||
单头 vs 多头
|
||||
|
||||
**单头注意力**:
|
||||
|
||||
`一组``Q``、``K``、``V → ``一个注意力表示`
|
||||
|
||||
**多头注意力**:
|
||||
|
||||
`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接`
|
||||
|
||||
#### 多头优势
|
||||
|
||||
---------------------
|
||||
头 关注内容
|
||||
-------- ------------
|
||||
Head 1 语法关系
|
||||
|
||||
Head 2 语义指代
|
||||
|
||||
Head 3 长距离依赖
|
||||
|
||||
... ...
|
||||
---------------------
|
||||
|
||||
多头让模型从不同角度理解序列。
|
||||
|
||||
### Positional Encoding
|
||||
|
||||
#### 问题
|
||||
|
||||
Self-Attention本身是**置换不变**的:
|
||||
|
||||
`Attention(``[A, B, C]) = Attention([B, A, C])`
|
||||
|
||||
但序列位置很重要!
|
||||
|
||||
#### 解决方案
|
||||
|
||||
添加位置信息:
|
||||
|
||||
`输入`` = X + ``PositionalEncoding`
|
||||
|
||||
常用方法: - 正弦/余弦位置编码 - 可学习位置编码
|
||||
|
||||
### Self-Attention vs CNN
|
||||
|
||||
感受野对比
|
||||
|
||||
------------------------------------
|
||||
层级 CNN Self-Attention
|
||||
------ ------------ ----------------
|
||||
单层 局部感受野 全局感受野
|
||||
|
||||
深层 逐层扩大 始终全局
|
||||
------------------------------------
|
||||
|
||||
计算复杂度
|
||||
|
||||
--------------------------------------
|
||||
操作 CNN Self-Attention
|
||||
-------- ------------ ----------------
|
||||
复杂度 O(k²·C) O(n²·d)
|
||||
|
||||
n 图像尺寸 序列长度
|
||||
|
||||
k 卷积核大小 \-
|
||||
--------------------------------------
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1.为什么Attention需要Scaling (除以√dₖ)?
|
||||
|
||||
2.Multi-Head Attention中,头数越多越好吗?
|
||||
|
||||
3.Self-Attention如何应用在图像上?
|
||||
|
||||
### 关键术语
|
||||
|
||||
------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- -------------------- ----------------------
|
||||
查询 Query 查询向量
|
||||
|
||||
键 Key 键向量
|
||||
|
||||
值 Value 值向量
|
||||
|
||||
缩放点积 Scaled Dot-Product 注意力计算方式
|
||||
|
||||
掩码 Mask 屏蔽某些位置的注意力
|
||||
------------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
[Attention Is All You Need](https://arxiv.org/abs/1706.03762)
|
||||
|
||||
[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构
|
||||
|
||||
---
|
||||
|
||||
### 学习目标
|
||||
|
||||
理解Transformer的Encoder-Decoder结构
|
||||
|
||||
掌握各组件的作用和连接方式
|
||||
|
||||
了解Token处理流程
|
||||
|
||||
### 整体架构
|
||||
|
||||
`输入``Token``序列`` → Encoder → ``编码表示`\
|
||||
` ↓`\
|
||||
`输出``Token``序列`` ← Decoder ← ``编码表示`
|
||||
|
||||
### Encoder层
|
||||
|
||||
单层结构
|
||||
|
||||
`输入``X`\
|
||||
` ↓`\
|
||||
`Multi-Head Self-Attention`\
|
||||
` ↓`\
|
||||
`Add & Norm (``残差连接`` + ``层归一化``)`\
|
||||
` ↓`\
|
||||
`Feed-Forward Network (FFN)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`输出``H`
|
||||
|
||||
#### 残差连接
|
||||
|
||||
`输出`` = F(x) + x`
|
||||
|
||||
作用: - 缓解梯度消失 - 便于训练深层网络
|
||||
|
||||
#### 层归一化
|
||||
|
||||
`输出`` = ``LayerNorm``(x + F(x))`
|
||||
|
||||
作用: - 稳定训练 - 加速收敛
|
||||
|
||||
#### FFN (前馈网络)
|
||||
|
||||
`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂`
|
||||
|
||||
本质:两层全连接网络,非线性变换
|
||||
|
||||
### Decoder层
|
||||
|
||||
#### 结构
|
||||
|
||||
`输入``X`\
|
||||
` ↓`\
|
||||
`Masked Self-Attention (``只能看之前的位置``)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`FFN`\
|
||||
` ↓`\
|
||||
`Add & Norm`\
|
||||
` ↓`\
|
||||
`输出`` (``接``Softmax``预测概率``)`
|
||||
|
||||
#### Cross-Attention
|
||||
|
||||
`Q: Decoder``的隐藏状态`\
|
||||
`K, V: Encoder``的输出`
|
||||
|
||||
作用:让Decoder关注Encoder的相关部分
|
||||
|
||||
## Token处理流程
|
||||
|
||||
### 输入处理
|
||||
|
||||
`文本`` → Tokenize → Token IDs`\
|
||||
` ↓`\
|
||||
` Embedding``层`\
|
||||
` ↓`\
|
||||
` ``位置编码相加`\
|
||||
` ↓`\
|
||||
` Encoder/Decoder`
|
||||
|
||||
### 输出处理
|
||||
|
||||
`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\
|
||||
` ↓`\
|
||||
` ``选择最大值`
|
||||
|
||||
## 训练与推理
|
||||
|
||||
训练阶段
|
||||
|
||||
`教师强制`` (Teacher Forcing)``:`\
|
||||
` ``真实标签作为``Decoder``输入`\
|
||||
` ``可以并行计算`
|
||||
|
||||
推理阶段
|
||||
|
||||
`自回归生成`` (Autoregressive)``:`\
|
||||
` ``生成一个``Token → ``加入输入`` → ``生成下一个`\
|
||||
` ``串行计算`
|
||||
|
||||
## Transformer变体
|
||||
|
||||
BERT (Encoder-only)
|
||||
|
||||
`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示`
|
||||
|
||||
应用:分类、NER、问答
|
||||
|
||||
GPT (Decoder-only)
|
||||
|
||||
`输入`` → Decoder → ``下一个``Token``预测`
|
||||
|
||||
应用:文本生成
|
||||
|
||||
T5 (Encoder-Decoder)
|
||||
|
||||
`输入`` → Encoder → ``表示`` → Decoder → ``输出`
|
||||
|
||||
应用:翻译、摘要
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. 为什么Decoder需要Masked Attention?
|
||||
|
||||
2. Encoder-only和Decoder-only模型各有什么优势?
|
||||
|
||||
3. Transformer如何处理超长序列?
|
||||
|
||||
## 关键术语
|
||||
|
||||
----------------------------------------------------------
|
||||
中文 英文 说明
|
||||
--------------- --------------------- --------------------
|
||||
残差连接 Residual Connection 跨层连接
|
||||
|
||||
层归一化 Layer Normalization 归一化层
|
||||
|
||||
教师强制 Teacher Forcing 训练时使用真实标签
|
||||
|
||||
自回归 Autoregressive 基于前序生成后续
|
||||
|
||||
编码器-解码器 Encoder-Decoder Seq2Seq架构
|
||||
----------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html)
|
||||
|
||||
[Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用
|
||||
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
3. 理解从Transformer到ChatGPT的演进
|
||||
|
||||
掌握RAG、RLHF等关键技术
|
||||
|
||||
了解Prompt工程在设计中的应用
|
||||
|
||||
## 从Transformer到ChatGPT
|
||||
|
||||
### GPT系列演进
|
||||
|
||||
------------------------------------------------------
|
||||
模型 发布时间 参数量 特点
|
||||
--------- ---------- -------- ------------------------
|
||||
GPT-1 2018 117M 验证Decoder-only可行性
|
||||
|
||||
GPT-2 2019 1.5B 展示零样本能力
|
||||
|
||||
GPT-3 2020 175B 少样本学习震撼业界
|
||||
|
||||
ChatGPT 2022 \~ 对话能力达到新高度
|
||||
|
||||
GPT-4 2023 \~ 多模态能力
|
||||
------------------------------------------------------
|
||||
|
||||
### 训练范式
|
||||
|
||||
`预训练`` (Pre-training)``:`\
|
||||
` ``大规模文本`` → ``无监督学习`` → ``语言模型`\
|
||||
\
|
||||
`微调`` (Fine-tuning)``:`\
|
||||
` ``特定任务`` → ``有监督学习`` → ``任务模型`
|
||||
|
||||
## RAG:检索增强生成
|
||||
|
||||
### 核心思想 {#核心思想-2}
|
||||
|
||||
用户提问 → 检索相关文档 → LLM生成答案
|
||||
↑
|
||||
外部知识库
|
||||
|
||||
### RAG架构
|
||||
|
||||
#### 文档索引
|
||||
|
||||
`文档`` → ``切分`` → Embedding → ``向量数据库`
|
||||
|
||||
####
|
||||
|
||||
`2. ``检索阶段`
|
||||
|
||||
#### 问题 → Embedding → 相似度搜索 → 相关文档
|
||||
|
||||
`3. ``生成阶段`
|
||||
|
||||
问题 + 相关文档 → LLM → 答案
|
||||
|
||||
### RAG优势
|
||||
|
||||
---------------------------
|
||||
特点 说明
|
||||
---------- ----------------
|
||||
减少幻觉 基于检索的事实
|
||||
|
||||
可更新 更新知识库即可
|
||||
|
||||
可解释 显示参考来源
|
||||
---------------------------
|
||||
|
||||
## RLHF:人类反馈强化学习
|
||||
|
||||
### 为什么需要RLHF
|
||||
|
||||
预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出
|
||||
|
||||
### RLHF三阶段
|
||||
|
||||
#### 有监督微调 (SFT)
|
||||
|
||||
`人工标注对话`` → ``微调模型`
|
||||
|
||||
`2. ``奖励模型`` (RM)`
|
||||
|
||||
#### 多个输出 → 人类排序 → 训练奖励模型
|
||||
|
||||
`3. ``强化学习`` (RL)`
|
||||
|
||||
PPO算法 → 优化策略
|
||||
|
||||
### 效果
|
||||
|
||||
1. 输出更符合人类偏好
|
||||
|
||||
减少有害内容
|
||||
|
||||
提高回答质量
|
||||
|
||||
## Prompt工程
|
||||
|
||||
### Prompt设计原则
|
||||
|
||||
#### 明确任务
|
||||
|
||||
`好:请总结以下文本的主要观点`\
|
||||
`差:看看这段文字`
|
||||
|
||||
#### 提供示例
|
||||
|
||||
`任务:情感分类`\
|
||||
`示例:`\
|
||||
`"``这部电影太棒了!``" → ``正面`\
|
||||
`"``服务态度很差。``" → ``负面`\
|
||||
`现在分类:``"..."`
|
||||
|
||||
### 指定格式
|
||||
|
||||
`请按以下格式输出:`\
|
||||
`- ``观点``1``:``...`\
|
||||
`- ``观点``2``:``...`\
|
||||
`- ``结论:``...`
|
||||
|
||||
## 设计领域应用
|
||||
|
||||
-------------------------------------------------------
|
||||
概念 英文 说明
|
||||
------------ --------------------- --------------------
|
||||
注意力机制 Attention 关注输入的重要部分
|
||||
任务 Prompt示例
|
||||
---------- --------------------------------------------
|
||||
方案生成 "设计一个50人的办公空间,要求开放式布局"
|
||||
|
||||
自注意力 Self-Attention 序列内部的关系建模
|
||||
代码生成 "写一个Python脚本计算建筑容积率"
|
||||
|
||||
位置编码 Positional Encoding 保留序列位置信息
|
||||
|
||||
令牌 Token 文本的基本单位
|
||||
文档撰写 "帮我写一份景观设计说明书的框架"
|
||||
-------------------------------------------------------
|
||||
|
||||
## 03.1 注意力机制
|
||||
## 思考与练习
|
||||
|
||||
1. RAG和微调(Fine-tuning)各适用于什么场景?
|
||||
|
||||
2. 如何评估LLM输出的质量?
|
||||
|
||||
3. Prompt工程在设计工作流中能解决什么问题?
|
||||
|
||||
## 关键术语
|
||||
|
||||
------------------------------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------------ -------------------- --------------------------------------------
|
||||
检索增强生成 RAG Retrieval-Augmented Generation
|
||||
|
||||
人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback
|
||||
|
||||
提示工程 Prompt Engineering 设计输入以引导模型输出
|
||||
|
||||
向量数据库 Vector Database 存储和检索向量表示
|
||||
|
||||
幻觉 Hallucination 模型编造错误信息
|
||||
------------------------------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165)
|
||||
|
||||
[Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155)
|
||||
|
||||
[LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/)
|
||||
|
||||
@@ -1,151 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
1. 理解生成模型的发展脉络
|
||||
|
||||
掌握Diffusion模型的基本原理
|
||||
|
||||
了解各类生成模型的优缺点
|
||||
|
||||
### 生成模型家族
|
||||
|
||||
#### AE (Autoencoder,自编码器)
|
||||
|
||||
`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构`
|
||||
|
||||
思想:学习数据的压缩表示
|
||||
|
||||
问题:生成的图像模糊,缺乏多样性
|
||||
|
||||
#### VAE (Variational AE,变分自编码器)
|
||||
|
||||
`潜在空间约束为标准正态分布`\
|
||||
` ↓`\
|
||||
`可以随机采样`` → ``解码`` → ``生成新图像`
|
||||
|
||||
改进:引入概率分布,增强生成能力
|
||||
|
||||
#### GAN (Generative Adversarial Network)
|
||||
|
||||
`生成器:生成假图像`\
|
||||
`判别器:判断真假`\
|
||||
` ↓`\
|
||||
`对抗训练,相互博弈`
|
||||
|
||||
优势:生成图像质量高 问题:训练不稳定,模式崩溃
|
||||
|
||||
#### Diffusion Model (扩散模型)
|
||||
|
||||
`前向:逐步加噪`` → ``纯噪声`\
|
||||
`反向:学习去噪`` → ``还原图像`
|
||||
|
||||
优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3
|
||||
|
||||
### Diffusion原理
|
||||
|
||||
#### 前向过程 (加噪)
|
||||
|
||||
`原图`` x₀`\
|
||||
` ↓ ``加高斯噪声`\
|
||||
`x₁ = x₀ + ε₁`\
|
||||
` ↓ ``加噪声`\
|
||||
`x₂ = x₁ + ε₂`\
|
||||
` ↓ ...`\
|
||||
`x_T`` = ``纯噪声`
|
||||
|
||||
#### 反向过程 (去噪)
|
||||
|
||||
`纯噪声`` ``x_T`\
|
||||
` ↓ ``去噪`\
|
||||
`x_{T-1} = ``去噪网络``(``x_T``)`\
|
||||
` ↓ ``去噪`\
|
||||
`x_{T-2} = ``去噪网络``(x_{T-1})`\
|
||||
` ↓ ...`\
|
||||
`x₀ = ``原始图像`
|
||||
|
||||
#### 训练目标
|
||||
|
||||
`去噪网络学习预测:`\
|
||||
` ``添加的噪声`` ε`\
|
||||
` ``或`\
|
||||
` ``原始图像`` x₀`
|
||||
|
||||
### Stable Diffusion架构
|
||||
|
||||
#### 潜在空间扩散
|
||||
|
||||
`为了效率,在潜在空间操作:`\
|
||||
\
|
||||
`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\
|
||||
` ↓`\
|
||||
` VAE``解码`` → ``图像`
|
||||
|
||||
#### 核心组件
|
||||
|
||||
-------------------------------------
|
||||
组件 作用
|
||||
-------------- ----------------------
|
||||
VAE 图像与潜在空间的转换
|
||||
|
||||
U-Net 去噪网络
|
||||
|
||||
Text Encoder 处理文本提示词
|
||||
|
||||
CLIP 文图对齐
|
||||
-------------------------------------
|
||||
|
||||
### 文生图工作流
|
||||
|
||||
#### 输入提示词
|
||||
|
||||
`"``一只猫,水彩画风格``"`
|
||||
|
||||
####
|
||||
|
||||
`2. ``文本编码`
|
||||
|
||||
#### → 文本向量表示
|
||||
|
||||
`3. ``初始化`
|
||||
|
||||
#### → 随机噪声
|
||||
|
||||
`4. ``去噪循环`
|
||||
|
||||
`for t in T...1:`
|
||||
|
||||
`噪声`` → ``预测噪声`` → ``去噪`
|
||||
|
||||
`5. ``解码输出`
|
||||
|
||||
→ 潜在表示 → VAE解码 → 图像
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. Diffusion为什么比GAN训练更稳定?
|
||||
|
||||
2. 潜在空间扩散有什么优势?
|
||||
|
||||
3. 文生图如何实现风格控制?
|
||||
|
||||
### 关键术语
|
||||
|
||||
---------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ----------------- ----------------------
|
||||
潜在空间 Latent Space 压缩后的数据表示空间
|
||||
|
||||
去噪 Denoising 移除噪声的过程
|
||||
|
||||
提示词 Prompt 指导生成的文本描述
|
||||
|
||||
潜变量 Latent Variable 不可直接观测的变量
|
||||
|
||||
模式崩溃 Mode Collapse GAN生成多样性不足
|
||||
---------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239)
|
||||
|
||||
[High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链
|
||||
@@ -1,180 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
3. 掌握ControlNet的条件控制机制
|
||||
|
||||
理解LoRA高效微调原理
|
||||
|
||||
了解ComfyUI工作流搭建
|
||||
|
||||
## ControlNet:精确控制
|
||||
|
||||
核心问题
|
||||
|
||||
纯文生图:难以精确控制空间结构
|
||||
|
||||
### ControlNet解决
|
||||
|
||||
`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\
|
||||
` ↓`\
|
||||
`条件`` → ControlNet → ``主模型`` → ``输出图像`
|
||||
|
||||
### 条件类型
|
||||
|
||||
------------------------------------
|
||||
条件 说明 应用
|
||||
-------------- ---------- ----------
|
||||
Canny 边缘检测 轮廓控制
|
||||
|
||||
Depth 深度图 空间关系
|
||||
|
||||
Pose 人体姿态 人物生成
|
||||
|
||||
Normal 法线图 表面细节
|
||||
|
||||
Segmentation 分割图 区域控制
|
||||
------------------------------------
|
||||
|
||||
### 应用场景
|
||||
|
||||
`草图`` → ControlNet → ``精细效果图`\
|
||||
`平面图`` → ControlNet → ``三维渲染`\
|
||||
`结构图`` → ControlNet → ``风格化设计`
|
||||
|
||||
LoRA:高效微调
|
||||
|
||||
问题
|
||||
|
||||
全量微调大模型:计算资源需求巨大
|
||||
|
||||
LoRA原理
|
||||
|
||||
`原始权重`` W ``固定`\
|
||||
` ↓`\
|
||||
`添加低秩分解:`\
|
||||
` ΔW = A × B`\
|
||||
` (``d×r``) × (``r×d``)`\
|
||||
` ↓`\
|
||||
`新输出`` = ``Wx`` + ``ABx`
|
||||
|
||||
优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格
|
||||
|
||||
### 应用方式
|
||||
|
||||
`基础模型`` + ``LoRA`` A = ``风格``A`\
|
||||
`基础模型`` + ``LoRA`` B = ``风格``B`\
|
||||
`基础模型`` + ``LoRA`` A + B = ``混合风格`
|
||||
|
||||
## ComfyUI:模块化工作流
|
||||
|
||||
### 核心特点
|
||||
|
||||
`节点化连接`\
|
||||
` ↓`\
|
||||
`可视化流程`\
|
||||
` ↓`\
|
||||
`灵活定制`
|
||||
|
||||
### 典型节点
|
||||
|
||||
---------------------------------
|
||||
节点类型 功能
|
||||
------------------ --------------
|
||||
Load Checkpoint 加载模型
|
||||
|
||||
CLIP Text Encode 文本编码
|
||||
|
||||
KSampler 采样生成
|
||||
|
||||
VAE Decode 潜在空间解码
|
||||
|
||||
Save Image 保存图像
|
||||
|
||||
ControlNet 条件控制
|
||||
|
||||
LoRA Loader 加载LoRA
|
||||
---------------------------------
|
||||
|
||||
### 工作流示例
|
||||
|
||||
`文本提示`` → CLIP``编码`` →`\
|
||||
` ↓`\
|
||||
`正负提示`` ────→ ``KSampler`` ← ControlNet`\
|
||||
` ↓`\
|
||||
` VAE``解码`\
|
||||
` ↓`\
|
||||
` ``保存图像`
|
||||
|
||||
## 设计领域应用案例
|
||||
|
||||
### 建筑设计
|
||||
|
||||
`草图生成`` → ControlNet (Canny) → ``效果图`\
|
||||
`方案变体`` → ``LoRA``风格微调`` → ``多方案对比`
|
||||
|
||||
### 室内设计
|
||||
|
||||
`户型图`` → ControlNet → ``三维效果图`\
|
||||
`风格迁移`` → ``LoRA`` → ``不同材质方案`
|
||||
|
||||
---------------------------------------
|
||||
工具 核心价值
|
||||
------------------ --------------------
|
||||
Midjourney 快速创意探索
|
||||
|
||||
Stable Diffusion 本地部署,可控生成
|
||||
|
||||
ControlNet 精确结构控制
|
||||
|
||||
ComfyUI 定制化工作流
|
||||
---------------------------------------
|
||||
|
||||
## 版权与伦理
|
||||
|
||||
### 版权问题
|
||||
|
||||
6. AI训练数据的版权归属
|
||||
|
||||
AI生成作品的版权保护
|
||||
|
||||
风格模仿的法律边界
|
||||
|
||||
### 伦理考量
|
||||
|
||||
9. 深度伪造 (Deepfake)
|
||||
|
||||
虚假信息传播
|
||||
|
||||
创作者职业影响
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. ControlNet如何平衡条件控制与创造性?
|
||||
|
||||
2. LoRA和全量微调各适用于什么场景?
|
||||
|
||||
3. AIGC工具如何融入设计工作流?
|
||||
|
||||
## 关键术语
|
||||
|
||||
------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- ---------------------
|
||||
条件控制 Conditional Control 引导生成过程
|
||||
|
||||
低秩适应 LoRA Low-Rank Adaptation
|
||||
|
||||
工作流 Workflow 节点化的处理流程
|
||||
|
||||
采样器 Sampler 去噪采样算法
|
||||
|
||||
潜在空间 Latent Space 压缩的特征空间
|
||||
------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543)
|
||||
|
||||
[LoRA官方论文](https://arxiv.org/abs/2106.09685)
|
||||
|
||||
[ComfyUI文档](https://docs.comfy.org/)
|
||||
@@ -8,24 +8,337 @@
|
||||
|
||||
本篇将系统介绍生成模型的演进和AIGC工具链。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [04.1 生成模型演进](04.1-diffusion.md) - 从VAE/GAN到Diffusion
|
||||
### 学习目标
|
||||
|
||||
[04.2 AIGC设计工具链](04.2-aigc-tools.md) - ControlNet、LoRA与ComfyUI
|
||||
1. 理解生成模型的发展脉络
|
||||
|
||||
## 核心概念
|
||||
掌握Diffusion模型的基本原理
|
||||
|
||||
-----------------------------------------------------------
|
||||
概念 英文 说明
|
||||
-------------- ----------- --------------------------------
|
||||
自编码器 AE Autoencoder
|
||||
了解各类生成模型的优缺点
|
||||
|
||||
变分自编码器 VAE Variational Autoencoder
|
||||
### 生成模型家族
|
||||
|
||||
生成对抗网络 GAN Generative Adversarial Network
|
||||
#### AE (Autoencoder,自编码器)
|
||||
|
||||
扩散模型 Diffusion Denoising Diffusion Model
|
||||
-----------------------------------------------------------
|
||||
`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构`
|
||||
|
||||
## 04.1 生成模型演进
|
||||
思想:学习数据的压缩表示
|
||||
|
||||
问题:生成的图像模糊,缺乏多样性
|
||||
|
||||
#### VAE (Variational AE,变分自编码器)
|
||||
|
||||
`潜在空间约束为标准正态分布`\
|
||||
` ↓`\
|
||||
`可以随机采样`` → ``解码`` → ``生成新图像`
|
||||
|
||||
改进:引入概率分布,增强生成能力
|
||||
|
||||
#### GAN (Generative Adversarial Network)
|
||||
|
||||
`生成器:生成假图像`\
|
||||
`判别器:判断真假`\
|
||||
` ↓`\
|
||||
`对抗训练,相互博弈`
|
||||
|
||||
优势:生成图像质量高 问题:训练不稳定,模式崩溃
|
||||
|
||||
#### Diffusion Model (扩散模型)
|
||||
|
||||
`前向:逐步加噪`` → ``纯噪声`\
|
||||
`反向:学习去噪`` → ``还原图像`
|
||||
|
||||
优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3
|
||||
|
||||
### Diffusion原理
|
||||
|
||||
#### 前向过程 (加噪)
|
||||
|
||||
`原图`` x₀`\
|
||||
` ↓ ``加高斯噪声`\
|
||||
`x₁ = x₀ + ε₁`\
|
||||
` ↓ ``加噪声`\
|
||||
`x₂ = x₁ + ε₂`\
|
||||
` ↓ ...`\
|
||||
`x_T`` = ``纯噪声`
|
||||
|
||||
#### 反向过程 (去噪)
|
||||
|
||||
`纯噪声`` ``x_T`\
|
||||
` ↓ ``去噪`\
|
||||
`x_{T-1} = ``去噪网络``(``x_T``)`\
|
||||
` ↓ ``去噪`\
|
||||
`x_{T-2} = ``去噪网络``(x_{T-1})`\
|
||||
` ↓ ...`\
|
||||
`x₀ = ``原始图像`
|
||||
|
||||
#### 训练目标
|
||||
|
||||
`去噪网络学习预测:`\
|
||||
` ``添加的噪声`` ε`\
|
||||
` ``或`\
|
||||
` ``原始图像`` x₀`
|
||||
|
||||
### Stable Diffusion架构
|
||||
|
||||
#### 潜在空间扩散
|
||||
|
||||
`为了效率,在潜在空间操作:`\
|
||||
\
|
||||
`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\
|
||||
` ↓`\
|
||||
` VAE``解码`` → ``图像`
|
||||
|
||||
#### 核心组件
|
||||
|
||||
-------------------------------------
|
||||
组件 作用
|
||||
-------------- ----------------------
|
||||
VAE 图像与潜在空间的转换
|
||||
|
||||
U-Net 去噪网络
|
||||
|
||||
Text Encoder 处理文本提示词
|
||||
|
||||
CLIP 文图对齐
|
||||
-------------------------------------
|
||||
|
||||
### 文生图工作流
|
||||
|
||||
#### 输入提示词
|
||||
|
||||
`"``一只猫,水彩画风格``"`
|
||||
|
||||
####
|
||||
|
||||
`2. ``文本编码`
|
||||
|
||||
#### → 文本向量表示
|
||||
|
||||
`3. ``初始化`
|
||||
|
||||
#### → 随机噪声
|
||||
|
||||
`4. ``去噪循环`
|
||||
|
||||
`for t in T...1:`
|
||||
|
||||
`噪声`` → ``预测噪声`` → ``去噪`
|
||||
|
||||
`5. ``解码输出`
|
||||
|
||||
→ 潜在表示 → VAE解码 → 图像
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. Diffusion为什么比GAN训练更稳定?
|
||||
|
||||
2. 潜在空间扩散有什么优势?
|
||||
|
||||
3. 文生图如何实现风格控制?
|
||||
|
||||
### 关键术语
|
||||
|
||||
---------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ----------------- ----------------------
|
||||
潜在空间 Latent Space 压缩后的数据表示空间
|
||||
|
||||
去噪 Denoising 移除噪声的过程
|
||||
|
||||
提示词 Prompt 指导生成的文本描述
|
||||
|
||||
潜变量 Latent Variable 不可直接观测的变量
|
||||
|
||||
模式崩溃 Mode Collapse GAN生成多样性不足
|
||||
---------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239)
|
||||
|
||||
[High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链
|
||||
|
||||
---
|
||||
|
||||
## 学习目标
|
||||
|
||||
3. 掌握ControlNet的条件控制机制
|
||||
|
||||
理解LoRA高效微调原理
|
||||
|
||||
了解ComfyUI工作流搭建
|
||||
|
||||
## ControlNet:精确控制
|
||||
|
||||
核心问题
|
||||
|
||||
纯文生图:难以精确控制空间结构
|
||||
|
||||
### ControlNet解决
|
||||
|
||||
`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\
|
||||
` ↓`\
|
||||
`条件`` → ControlNet → ``主模型`` → ``输出图像`
|
||||
|
||||
### 条件类型
|
||||
|
||||
------------------------------------
|
||||
条件 说明 应用
|
||||
-------------- ---------- ----------
|
||||
Canny 边缘检测 轮廓控制
|
||||
|
||||
Depth 深度图 空间关系
|
||||
|
||||
Pose 人体姿态 人物生成
|
||||
|
||||
Normal 法线图 表面细节
|
||||
|
||||
Segmentation 分割图 区域控制
|
||||
------------------------------------
|
||||
|
||||
### 应用场景
|
||||
|
||||
`草图`` → ControlNet → ``精细效果图`\
|
||||
`平面图`` → ControlNet → ``三维渲染`\
|
||||
`结构图`` → ControlNet → ``风格化设计`
|
||||
|
||||
LoRA:高效微调
|
||||
|
||||
问题
|
||||
|
||||
全量微调大模型:计算资源需求巨大
|
||||
|
||||
LoRA原理
|
||||
|
||||
`原始权重`` W ``固定`\
|
||||
` ↓`\
|
||||
`添加低秩分解:`\
|
||||
` ΔW = A × B`\
|
||||
` (``d×r``) × (``r×d``)`\
|
||||
` ↓`\
|
||||
`新输出`` = ``Wx`` + ``ABx`
|
||||
|
||||
优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格
|
||||
|
||||
### 应用方式
|
||||
|
||||
`基础模型`` + ``LoRA`` A = ``风格``A`\
|
||||
`基础模型`` + ``LoRA`` B = ``风格``B`\
|
||||
`基础模型`` + ``LoRA`` A + B = ``混合风格`
|
||||
|
||||
## ComfyUI:模块化工作流
|
||||
|
||||
### 核心特点
|
||||
|
||||
`节点化连接`\
|
||||
` ↓`\
|
||||
`可视化流程`\
|
||||
` ↓`\
|
||||
`灵活定制`
|
||||
|
||||
### 典型节点
|
||||
|
||||
---------------------------------
|
||||
节点类型 功能
|
||||
------------------ --------------
|
||||
Load Checkpoint 加载模型
|
||||
|
||||
CLIP Text Encode 文本编码
|
||||
|
||||
KSampler 采样生成
|
||||
|
||||
VAE Decode 潜在空间解码
|
||||
|
||||
Save Image 保存图像
|
||||
|
||||
ControlNet 条件控制
|
||||
|
||||
LoRA Loader 加载LoRA
|
||||
---------------------------------
|
||||
|
||||
### 工作流示例
|
||||
|
||||
`文本提示`` → CLIP``编码`` →`\
|
||||
` ↓`\
|
||||
`正负提示`` ────→ ``KSampler`` ← ControlNet`\
|
||||
` ↓`\
|
||||
` VAE``解码`\
|
||||
` ↓`\
|
||||
` ``保存图像`
|
||||
|
||||
## 设计领域应用案例
|
||||
|
||||
### 建筑设计
|
||||
|
||||
`草图生成`` → ControlNet (Canny) → ``效果图`\
|
||||
`方案变体`` → ``LoRA``风格微调`` → ``多方案对比`
|
||||
|
||||
### 室内设计
|
||||
|
||||
`户型图`` → ControlNet → ``三维效果图`\
|
||||
`风格迁移`` → ``LoRA`` → ``不同材质方案`
|
||||
|
||||
---------------------------------------
|
||||
工具 核心价值
|
||||
------------------ --------------------
|
||||
Midjourney 快速创意探索
|
||||
|
||||
Stable Diffusion 本地部署,可控生成
|
||||
|
||||
ControlNet 精确结构控制
|
||||
|
||||
ComfyUI 定制化工作流
|
||||
---------------------------------------
|
||||
|
||||
## 版权与伦理
|
||||
|
||||
### 版权问题
|
||||
|
||||
6. AI训练数据的版权归属
|
||||
|
||||
AI生成作品的版权保护
|
||||
|
||||
风格模仿的法律边界
|
||||
|
||||
### 伦理考量
|
||||
|
||||
9. 深度伪造 (Deepfake)
|
||||
|
||||
虚假信息传播
|
||||
|
||||
创作者职业影响
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. ControlNet如何平衡条件控制与创造性?
|
||||
|
||||
2. LoRA和全量微调各适用于什么场景?
|
||||
|
||||
3. AIGC工具如何融入设计工作流?
|
||||
|
||||
## 关键术语
|
||||
|
||||
------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- ---------------------
|
||||
条件控制 Conditional Control 引导生成过程
|
||||
|
||||
低秩适应 LoRA Low-Rank Adaptation
|
||||
|
||||
工作流 Workflow 节点化的处理流程
|
||||
|
||||
采样器 Sampler 去噪采样算法
|
||||
|
||||
潜在空间 Latent Space 压缩的特征空间
|
||||
------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543)
|
||||
|
||||
[LoRA官方论文](https://arxiv.org/abs/2106.09685)
|
||||
|
||||
[ComfyUI文档](https://docs.comfy.org/)
|
||||
|
||||
@@ -1,148 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
1. 理解从规则到LLM-based Agent的演进
|
||||
|
||||
掌握Agent的核心组件
|
||||
|
||||
了解ReAct和CoT推理模式
|
||||
|
||||
## 从规则到LLM Agent
|
||||
|
||||
### 规则系统时代
|
||||
|
||||
`if`` ``condition_A``:`\
|
||||
` ``action_``B``(``)`\
|
||||
`elif`` ``condition_C``:`\
|
||||
` ``action_D``()`\
|
||||
`else``:`\
|
||||
` ``action_E``()`
|
||||
|
||||
局限:规则难以穷举,无法应对新情况
|
||||
|
||||
### LLM-based Agent
|
||||
|
||||
`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出`
|
||||
|
||||
优势: - 自然语言交互 - 上下文理解 - 泛化能力强
|
||||
|
||||
## Agent核心组件
|
||||
|
||||
### 感知 (Perception)
|
||||
|
||||
`输入信息`` → ``理解与解析`\
|
||||
` - ``用户指令`\
|
||||
` - ``环境状态`\
|
||||
` - ``工具反馈`
|
||||
|
||||
### 规划 (Planning)
|
||||
|
||||
`目标`` → ``分解为子任务`\
|
||||
` - ``任务分析`\
|
||||
` - ``步骤规划`\
|
||||
` - ``依赖管理`
|
||||
|
||||
### 记忆 (Memory)
|
||||
|
||||
`┌─────────────────────────────┐`\
|
||||
`│ ``短期记忆`` (Short-term) │`\
|
||||
`│ ``对话上下文、临时状态`` │`\
|
||||
`├─────────────────────────────┤`\
|
||||
`│ ``长期记忆`` (Long-term) │`\
|
||||
`│ ``知识库、经验积累`` │`\
|
||||
`└─────────────────────────────┘`
|
||||
|
||||
### 工具调用 (Tool Use)
|
||||
|
||||
`可用工具集:`\
|
||||
` - ``数据库查询`\
|
||||
` - API``调用`\
|
||||
` - ``文件操作`\
|
||||
` - ``代码执行`\
|
||||
` ...`
|
||||
|
||||
## 推理模式
|
||||
|
||||
Chain of Thought (CoT)
|
||||
|
||||
`问题`` → ``思考链`` → ``答案`
|
||||
|
||||
`"``设计一个公园``"`
|
||||
|
||||
` ↓`
|
||||
|
||||
1. `分析场地条件`
|
||||
|
||||
2. `2. ``确定功能分区`
|
||||
|
||||
3. `3. ``布局路径系统`
|
||||
|
||||
`4. ``选择植物配置`
|
||||
|
||||
`↓`
|
||||
|
||||
完整方案
|
||||
|
||||
### ReAct (Reasoning + Acting)
|
||||
|
||||
`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\
|
||||
\
|
||||
`思考:需要查询场地数据`\
|
||||
`行动:调用``GIS``工具`\
|
||||
`观察:获取到高程信息`\
|
||||
`思考:基于高程做排水设计`\
|
||||
`行动:生成排水方案`\
|
||||
`...`
|
||||
|
||||
## Agent架构示例
|
||||
|
||||
单Agent架构
|
||||
|
||||
`┌─────────────────────────────┐`\
|
||||
`│ LLM Core │`\
|
||||
`│ (``规划、推理、决策``) │`\
|
||||
`├─────────────────────────────┤`\
|
||||
`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\
|
||||
`│ │``感知``││``记忆``││``工具``││``反思``│ │`\
|
||||
`│ └───┘ └───┘ └───┘ └───┘ │`\
|
||||
`└─────────────────────────────┘`\
|
||||
` ↓`\
|
||||
` ``执行任务`
|
||||
|
||||
### 多Agent协作
|
||||
|
||||
`┌─────────┐ ┌─────────┐ ┌─────────┐`\
|
||||
`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\
|
||||
`└─────────┘ └─────────┘ └─────────┘`\
|
||||
` ↓ ↓ ↓`\
|
||||
` ``任务分解`` ``数据分析`` ``方案生成`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. 单Agent和多Agent系统各有什么优势?
|
||||
|
||||
2. 如何设计Agent的记忆系统?
|
||||
|
||||
3. CoT和ReAct各适用于什么场景?
|
||||
|
||||
## 关键术语
|
||||
|
||||
--------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ------------ --------------------
|
||||
思考链 CoT Chain of Thought
|
||||
|
||||
推理行动 ReAct Reasoning + Acting
|
||||
|
||||
记忆 Memory 存储和检索信息
|
||||
|
||||
反思 Reflection 自我评估与改进
|
||||
|
||||
工具使用 Tool Use 调用外部能力
|
||||
--------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/)
|
||||
|
||||
[ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能
|
||||
@@ -1,157 +0,0 @@
|
||||
|
||||
# 学习目标
|
||||
|
||||
3. 理解具身智能的概念和特点
|
||||
|
||||
了解数字孪生与物理世界的交互
|
||||
|
||||
掌握强化学习在具身AI中的应用
|
||||
|
||||
# 什么是具身智能
|
||||
|
||||
## 定义
|
||||
|
||||
**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。
|
||||
|
||||
## 与传统AI的区别
|
||||
|
||||
------------------------------------
|
||||
特性 传统AI 具身AI
|
||||
---------- ------------ ------------
|
||||
交互方式 数据输入 主动探索
|
||||
|
||||
学习方式 从数据学习 从交互学习
|
||||
|
||||
输出形式 预测/生成 行动/操作
|
||||
------------------------------------
|
||||
|
||||
# 数字孪生
|
||||
|
||||
## 概念
|
||||
|
||||
`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制`
|
||||
|
||||
## 应用层次
|
||||
|
||||
--------------------------------
|
||||
层次 内容 应用
|
||||
---------- ---------- ----------
|
||||
几何孪生 三维模型 可视化
|
||||
|
||||
物理孪生 物理仿真 性能分析
|
||||
|
||||
行为孪生 行为模拟 场景预测
|
||||
|
||||
认知孪生 决策支持 智能控制
|
||||
--------------------------------
|
||||
|
||||
# 强化学习基础
|
||||
|
||||
## 核心要素
|
||||
|
||||
`┌─────────────────────────────────────┐`\
|
||||
`│ │`\
|
||||
`│ ``环境`` ← ``状态`` ──────→ Agent │`\
|
||||
`│ ↑ │ │`\
|
||||
`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\
|
||||
`│ │`\
|
||||
`└─────────────────────────────────────┘`
|
||||
|
||||
## 训练循环
|
||||
|
||||
1. `观察环境状态`
|
||||
|
||||
2. `选择行动`
|
||||
|
||||
3. `执行行动`
|
||||
|
||||
4. `获得奖励`
|
||||
|
||||
5. `更新策略`
|
||||
|
||||
6. `重复``...`
|
||||
|
||||
## Gymnasium环境
|
||||
|
||||
`import gymnasium as gym`\
|
||||
\
|
||||
`env = ``gym.make``("CartPole-v1")`\
|
||||
`state, _ = ``env.reset``()`\
|
||||
\
|
||||
`for _ in range(1000):`\
|
||||
` action = policy(state)`\
|
||||
` state, reward, done, _, _ = ``env.step``(action)`\
|
||||
` if done:`\
|
||||
` break`
|
||||
|
||||
# 具身AI应用场景
|
||||
|
||||
## 机器人设计
|
||||
|
||||
`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\
|
||||
` ↓`\
|
||||
`建筑机器人、施工机器人`
|
||||
|
||||
## 虚拟角色
|
||||
|
||||
`游戏``NPC``、虚拟助手、元宇宙居民`\
|
||||
` ↓`\
|
||||
`自然行为、智能对话`
|
||||
|
||||
## 仿真训练
|
||||
|
||||
`虚拟环境`` → ``训练策略`` → ``迁移到真实`\
|
||||
` ↓`\
|
||||
`降低试错成本`
|
||||
|
||||
# 虚拟到真实的迁移
|
||||
|
||||
## 挑战
|
||||
|
||||
-----------------------------------
|
||||
问题 说明
|
||||
-------------- --------------------
|
||||
Sim2Real Gap 仿真与现实的差异
|
||||
|
||||
感官差异 虚拟与真实感知不同
|
||||
|
||||
物理特性 真实物理更复杂
|
||||
-----------------------------------
|
||||
|
||||
## 解决方案
|
||||
|
||||
1. 域随机化 (Domain Randomization)
|
||||
|
||||
真实数据混合
|
||||
|
||||
在线微调
|
||||
|
||||
# 思考与练习
|
||||
|
||||
1. 具身智能在规划设计中有哪些应用前景?
|
||||
|
||||
2. 数字孪生如何辅助设计决策?
|
||||
|
||||
3. Sim2Real迁移的主要挑战是什么?
|
||||
|
||||
# 关键术语
|
||||
|
||||
--------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- -------------- ------------------------
|
||||
具身智能 Embodied AI 有身体形式的AI
|
||||
|
||||
数字孪生 Digital Twin 物理世界的数字映射
|
||||
|
||||
强化学习 RL Reinforcement Learning
|
||||
|
||||
状态 State 环境的当前情况
|
||||
|
||||
动作 Action Agent对环境的影响
|
||||
--------------------------------------------------
|
||||
|
||||
# 延伸阅读
|
||||
|
||||
1. [Gymnasium文档](https://gymnasium.org.cn/)
|
||||
|
||||
[DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP
|
||||
@@ -1,215 +0,0 @@
|
||||
|
||||
# 学习目标
|
||||
|
||||
3. 理解MCP协议的核心思想
|
||||
|
||||
掌握HITL协作模式
|
||||
|
||||
了解Agent在规划设计中的落地场景
|
||||
|
||||
# MCP协议
|
||||
|
||||
## 什么是MCP
|
||||
|
||||
**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。
|
||||
|
||||
## 核心价值
|
||||
|
||||
`传统方式:`\
|
||||
` AI``模型`` → ``各自独立`` → ``数据孤岛`\
|
||||
\
|
||||
`MCP``方式:`\
|
||||
` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据`
|
||||
|
||||
MCP架构
|
||||
|
||||
`┌─────────────────────────────────────┐`\
|
||||
`│ AI Application │`\
|
||||
`│ (Claude, ``ChatGPT``, ``等``) │`\
|
||||
`└─────────────┬───────────────────────┘`\
|
||||
` │ MCP`\
|
||||
`┌─────────────┴───────────────────────┐`\
|
||||
`│ MCP Client │`\
|
||||
`├─────────────────────────────────────┤`\
|
||||
`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\
|
||||
`│ │File │ │DB │ │API │ ... │`\
|
||||
`│ │``Server│ │Server│ │Server│ │`\
|
||||
`│ └──────┘ └──────┘ └──────┘ │`\
|
||||
`└─────────────────────────────────────┘`
|
||||
|
||||
# HITL:人机协作模式
|
||||
|
||||
## 什么是HITL
|
||||
|
||||
**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。
|
||||
|
||||
## HITL层次
|
||||
|
||||
----------------------------------
|
||||
层次 人类角色 自动化程度
|
||||
---------- ---------- ------------
|
||||
完全自动 无 100%
|
||||
|
||||
人工审核 监督者 80-90%
|
||||
|
||||
交互决策 合作伙伴 50-70%
|
||||
|
||||
人工主导 操作者 \<50%
|
||||
----------------------------------
|
||||
|
||||
## 规划设计中的HITL
|
||||
|
||||
`AI``生成方案`\
|
||||
` ↓`\
|
||||
`设计师审核`` ← ``修改意见`` → AI``调整`\
|
||||
` ↓`\
|
||||
`最终确认`
|
||||
|
||||
# 规划设计Agent案例
|
||||
|
||||
## 场景分析Agent
|
||||
|
||||
`输入:场地数据`
|
||||
|
||||
`↓`
|
||||
|
||||
`分析流程:`
|
||||
|
||||
1. `地形分析`` (``坡度、高程``)`
|
||||
|
||||
2. `气候分析`` (``日照、风向``)`
|
||||
|
||||
3. `交通分析`` (``可达性``)`
|
||||
|
||||
4. `视觉分析`` (``视域、景观``)`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:场地分析报告`
|
||||
|
||||
## 方案生成Agent
|
||||
|
||||
`输入:设计要求`` + ``场地分析`
|
||||
|
||||
`↓`
|
||||
|
||||
`生成流程:`
|
||||
|
||||
1. `理解需求`` (``CoT``推理``)`
|
||||
|
||||
2. `布局功能`` (``工具调用``)`
|
||||
|
||||
3. `连接路径`` (``图算法``)`
|
||||
|
||||
4. `优化调整`` (``迭代改进``)`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:初步设计方案`
|
||||
|
||||
## 合规审查Agent
|
||||
|
||||
`输入:设计方案`
|
||||
|
||||
`↓`
|
||||
|
||||
`审查流程:`
|
||||
|
||||
1. `调用规范库`
|
||||
|
||||
2. `逐条核对`
|
||||
|
||||
3. `标记问题`
|
||||
|
||||
4. `生成报告`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:合规审查意见`
|
||||
|
||||
# Agent落地挑战
|
||||
|
||||
技术挑战
|
||||
|
||||
---------------------------
|
||||
挑战 说明
|
||||
---------- ----------------
|
||||
准确性 复杂任务易出错
|
||||
|
||||
可解释性 决策过程不透明
|
||||
|
||||
鲁棒性 边界情况处理
|
||||
---------------------------
|
||||
|
||||
应用挑战
|
||||
|
||||
-----------------------------
|
||||
挑战 说明
|
||||
------------ ----------------
|
||||
工作流整合 与现有流程融合
|
||||
|
||||
责任界定 AI错误的后果
|
||||
|
||||
成本控制 API调用费用
|
||||
-----------------------------
|
||||
|
||||
## 解决方向
|
||||
|
||||
1. 分级应用:简单任务自动化,复杂任务辅助
|
||||
|
||||
渐进式:从局部到整体
|
||||
|
||||
人机协同:关键环节人工确认
|
||||
|
||||
# 未来展望:AI设计师
|
||||
|
||||
### 短期 (1-2年)
|
||||
|
||||
`AI``作为工具`\
|
||||
` - ``数据分析`\
|
||||
` - ``方案生成`\
|
||||
` - ``合规检查`
|
||||
|
||||
### 中期 (3-5年)
|
||||
|
||||
`AI``作为助手`\
|
||||
` - ``创意启发`\
|
||||
` - ``方案优化`\
|
||||
` - ``文档撰写`
|
||||
|
||||
### 长期 (5-10年)
|
||||
|
||||
`AI``作为合作伙伴`\
|
||||
` - ``共同创造`\
|
||||
` - ``自主决策`\
|
||||
` - ``专业评审`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. MCP如何解决AI应用的"数据孤岛"问题?
|
||||
|
||||
2. 规划设计中哪些环节适合引入HITL?
|
||||
|
||||
3. AI设计师如何与人类设计师协作?
|
||||
|
||||
## 关键术语
|
||||
|
||||
----------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------------- ---------------------- ------------------------
|
||||
模型上下文协议 MCP Model Context Protocol
|
||||
|
||||
人在回路 HITL Human-in-the-Loop
|
||||
|
||||
数据孤岛 Data Silo 独立的数据存储
|
||||
|
||||
协议 Protocol 通信标准
|
||||
|
||||
工作流整合 Workflow Integration 融入现有流程
|
||||
----------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [MCP官方文档](https://modelcontextprotocol.io/)
|
||||
|
||||
[Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629)
|
||||
+516
-14
@@ -8,26 +8,528 @@ AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行
|
||||
|
||||
本篇将系统介绍Agent架构和在设计领域的应用。
|
||||
|
||||
# 章节目录
|
||||
---
|
||||
|
||||
1. [05.1 AI Agent架构](05.1-agent-architecture.md) - LLM-based Agent与核心组件
|
||||
## 学习目标
|
||||
|
||||
[05.2 具身智能](05.2-embodied-ai.md) - 数字孪生与物理世界交互
|
||||
1. 理解从规则到LLM-based Agent的演进
|
||||
|
||||
[05.3 规划设计应用与MCP](05.3-design-application.md) - MCP协议与HITL协作
|
||||
掌握Agent的核心组件
|
||||
|
||||
# 核心概念
|
||||
了解ReAct和CoT推理模式
|
||||
|
||||
-------------------------------------------------------
|
||||
概念 英文 说明
|
||||
---------------- ------------- ------------------------
|
||||
智能体 Agent 自主决策和行动的系统
|
||||
## 从规则到LLM Agent
|
||||
|
||||
具身智能 Embodied AI 有物理实体的智能
|
||||
### 规则系统时代
|
||||
|
||||
人机协作 HITL Human-in-the-Loop
|
||||
`if`` ``condition_A``:`\
|
||||
` ``action_``B``(``)`\
|
||||
`elif`` ``condition_C``:`\
|
||||
` ``action_D``()`\
|
||||
`else``:`\
|
||||
` ``action_E``()`
|
||||
|
||||
模型上下文协议 MCP Model Context Protocol
|
||||
-------------------------------------------------------
|
||||
局限:规则难以穷举,无法应对新情况
|
||||
|
||||
# 05.1 AI Agent架构
|
||||
### LLM-based Agent
|
||||
|
||||
`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出`
|
||||
|
||||
优势: - 自然语言交互 - 上下文理解 - 泛化能力强
|
||||
|
||||
## Agent核心组件
|
||||
|
||||
### 感知 (Perception)
|
||||
|
||||
`输入信息`` → ``理解与解析`\
|
||||
` - ``用户指令`\
|
||||
` - ``环境状态`\
|
||||
` - ``工具反馈`
|
||||
|
||||
### 规划 (Planning)
|
||||
|
||||
`目标`` → ``分解为子任务`\
|
||||
` - ``任务分析`\
|
||||
` - ``步骤规划`\
|
||||
` - ``依赖管理`
|
||||
|
||||
### 记忆 (Memory)
|
||||
|
||||
`┌─────────────────────────────┐`\
|
||||
`│ ``短期记忆`` (Short-term) │`\
|
||||
`│ ``对话上下文、临时状态`` │`\
|
||||
`├─────────────────────────────┤`\
|
||||
`│ ``长期记忆`` (Long-term) │`\
|
||||
`│ ``知识库、经验积累`` │`\
|
||||
`└─────────────────────────────┘`
|
||||
|
||||
### 工具调用 (Tool Use)
|
||||
|
||||
`可用工具集:`\
|
||||
` - ``数据库查询`\
|
||||
` - API``调用`\
|
||||
` - ``文件操作`\
|
||||
` - ``代码执行`\
|
||||
` ...`
|
||||
|
||||
## 推理模式
|
||||
|
||||
Chain of Thought (CoT)
|
||||
|
||||
`问题`` → ``思考链`` → ``答案`
|
||||
|
||||
`"``设计一个公园``"`
|
||||
|
||||
` ↓`
|
||||
|
||||
1. `分析场地条件`
|
||||
|
||||
2. `2. ``确定功能分区`
|
||||
|
||||
3. `3. ``布局路径系统`
|
||||
|
||||
`4. ``选择植物配置`
|
||||
|
||||
`↓`
|
||||
|
||||
完整方案
|
||||
|
||||
### ReAct (Reasoning + Acting)
|
||||
|
||||
`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\
|
||||
\
|
||||
`思考:需要查询场地数据`\
|
||||
`行动:调用``GIS``工具`\
|
||||
`观察:获取到高程信息`\
|
||||
`思考:基于高程做排水设计`\
|
||||
`行动:生成排水方案`\
|
||||
`...`
|
||||
|
||||
## Agent架构示例
|
||||
|
||||
单Agent架构
|
||||
|
||||
`┌─────────────────────────────┐`\
|
||||
`│ LLM Core │`\
|
||||
`│ (``规划、推理、决策``) │`\
|
||||
`├─────────────────────────────┤`\
|
||||
`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\
|
||||
`│ │``感知``││``记忆``││``工具``││``反思``│ │`\
|
||||
`│ └───┘ └───┘ └───┘ └───┘ │`\
|
||||
`└─────────────────────────────┘`\
|
||||
` ↓`\
|
||||
` ``执行任务`
|
||||
|
||||
### 多Agent协作
|
||||
|
||||
`┌─────────┐ ┌─────────┐ ┌─────────┐`\
|
||||
`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\
|
||||
`└─────────┘ └─────────┘ └─────────┘`\
|
||||
` ↓ ↓ ↓`\
|
||||
` ``任务分解`` ``数据分析`` ``方案生成`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. 单Agent和多Agent系统各有什么优势?
|
||||
|
||||
2. 如何设计Agent的记忆系统?
|
||||
|
||||
3. CoT和ReAct各适用于什么场景?
|
||||
|
||||
## 关键术语
|
||||
|
||||
--------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ------------ --------------------
|
||||
思考链 CoT Chain of Thought
|
||||
|
||||
推理行动 ReAct Reasoning + Acting
|
||||
|
||||
记忆 Memory 存储和检索信息
|
||||
|
||||
反思 Reflection 自我评估与改进
|
||||
|
||||
工具使用 Tool Use 调用外部能力
|
||||
--------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/)
|
||||
|
||||
[ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能
|
||||
|
||||
---
|
||||
|
||||
# 学习目标
|
||||
|
||||
3. 理解具身智能的概念和特点
|
||||
|
||||
了解数字孪生与物理世界的交互
|
||||
|
||||
掌握强化学习在具身AI中的应用
|
||||
|
||||
# 什么是具身智能
|
||||
|
||||
## 定义
|
||||
|
||||
**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。
|
||||
|
||||
## 与传统AI的区别
|
||||
|
||||
------------------------------------
|
||||
特性 传统AI 具身AI
|
||||
---------- ------------ ------------
|
||||
交互方式 数据输入 主动探索
|
||||
|
||||
学习方式 从数据学习 从交互学习
|
||||
|
||||
输出形式 预测/生成 行动/操作
|
||||
------------------------------------
|
||||
|
||||
# 数字孪生
|
||||
|
||||
## 概念
|
||||
|
||||
`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制`
|
||||
|
||||
## 应用层次
|
||||
|
||||
--------------------------------
|
||||
层次 内容 应用
|
||||
---------- ---------- ----------
|
||||
几何孪生 三维模型 可视化
|
||||
|
||||
物理孪生 物理仿真 性能分析
|
||||
|
||||
行为孪生 行为模拟 场景预测
|
||||
|
||||
认知孪生 决策支持 智能控制
|
||||
--------------------------------
|
||||
|
||||
# 强化学习基础
|
||||
|
||||
## 核心要素
|
||||
|
||||
`┌─────────────────────────────────────┐`\
|
||||
`│ │`\
|
||||
`│ ``环境`` ← ``状态`` ──────→ Agent │`\
|
||||
`│ ↑ │ │`\
|
||||
`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\
|
||||
`│ │`\
|
||||
`└─────────────────────────────────────┘`
|
||||
|
||||
## 训练循环
|
||||
|
||||
1. `观察环境状态`
|
||||
|
||||
2. `选择行动`
|
||||
|
||||
3. `执行行动`
|
||||
|
||||
4. `获得奖励`
|
||||
|
||||
5. `更新策略`
|
||||
|
||||
6. `重复``...`
|
||||
|
||||
## Gymnasium环境
|
||||
|
||||
`import gymnasium as gym`\
|
||||
\
|
||||
`env = ``gym.make``("CartPole-v1")`\
|
||||
`state, _ = ``env.reset``()`\
|
||||
\
|
||||
`for _ in range(1000):`\
|
||||
` action = policy(state)`\
|
||||
` state, reward, done, _, _ = ``env.step``(action)`\
|
||||
` if done:`\
|
||||
` break`
|
||||
|
||||
# 具身AI应用场景
|
||||
|
||||
## 机器人设计
|
||||
|
||||
`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\
|
||||
` ↓`\
|
||||
`建筑机器人、施工机器人`
|
||||
|
||||
## 虚拟角色
|
||||
|
||||
`游戏``NPC``、虚拟助手、元宇宙居民`\
|
||||
` ↓`\
|
||||
`自然行为、智能对话`
|
||||
|
||||
## 仿真训练
|
||||
|
||||
`虚拟环境`` → ``训练策略`` → ``迁移到真实`\
|
||||
` ↓`\
|
||||
`降低试错成本`
|
||||
|
||||
# 虚拟到真实的迁移
|
||||
|
||||
## 挑战
|
||||
|
||||
-----------------------------------
|
||||
问题 说明
|
||||
-------------- --------------------
|
||||
Sim2Real Gap 仿真与现实的差异
|
||||
|
||||
感官差异 虚拟与真实感知不同
|
||||
|
||||
物理特性 真实物理更复杂
|
||||
-----------------------------------
|
||||
|
||||
## 解决方案
|
||||
|
||||
1. 域随机化 (Domain Randomization)
|
||||
|
||||
真实数据混合
|
||||
|
||||
在线微调
|
||||
|
||||
# 思考与练习
|
||||
|
||||
1. 具身智能在规划设计中有哪些应用前景?
|
||||
|
||||
2. 数字孪生如何辅助设计决策?
|
||||
|
||||
3. Sim2Real迁移的主要挑战是什么?
|
||||
|
||||
# 关键术语
|
||||
|
||||
--------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- -------------- ------------------------
|
||||
具身智能 Embodied AI 有身体形式的AI
|
||||
|
||||
数字孪生 Digital Twin 物理世界的数字映射
|
||||
|
||||
强化学习 RL Reinforcement Learning
|
||||
|
||||
状态 State 环境的当前情况
|
||||
|
||||
动作 Action Agent对环境的影响
|
||||
--------------------------------------------------
|
||||
|
||||
# 延伸阅读
|
||||
|
||||
1. [Gymnasium文档](https://gymnasium.org.cn/)
|
||||
|
||||
[DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP
|
||||
|
||||
---
|
||||
|
||||
# 学习目标
|
||||
|
||||
3. 理解MCP协议的核心思想
|
||||
|
||||
掌握HITL协作模式
|
||||
|
||||
了解Agent在规划设计中的落地场景
|
||||
|
||||
# MCP协议
|
||||
|
||||
## 什么是MCP
|
||||
|
||||
**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。
|
||||
|
||||
## 核心价值
|
||||
|
||||
`传统方式:`\
|
||||
` AI``模型`` → ``各自独立`` → ``数据孤岛`\
|
||||
\
|
||||
`MCP``方式:`\
|
||||
` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据`
|
||||
|
||||
MCP架构
|
||||
|
||||
`┌─────────────────────────────────────┐`\
|
||||
`│ AI Application │`\
|
||||
`│ (Claude, ``ChatGPT``, ``等``) │`\
|
||||
`└─────────────┬───────────────────────┘`\
|
||||
` │ MCP`\
|
||||
`┌─────────────┴───────────────────────┐`\
|
||||
`│ MCP Client │`\
|
||||
`├─────────────────────────────────────┤`\
|
||||
`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\
|
||||
`│ │File │ │DB │ │API │ ... │`\
|
||||
`│ │``Server│ │Server│ │Server│ │`\
|
||||
`│ └──────┘ └──────┘ └──────┘ │`\
|
||||
`└─────────────────────────────────────┘`
|
||||
|
||||
# HITL:人机协作模式
|
||||
|
||||
## 什么是HITL
|
||||
|
||||
**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。
|
||||
|
||||
## HITL层次
|
||||
|
||||
----------------------------------
|
||||
层次 人类角色 自动化程度
|
||||
---------- ---------- ------------
|
||||
完全自动 无 100%
|
||||
|
||||
人工审核 监督者 80-90%
|
||||
|
||||
交互决策 合作伙伴 50-70%
|
||||
|
||||
人工主导 操作者 \<50%
|
||||
----------------------------------
|
||||
|
||||
## 规划设计中的HITL
|
||||
|
||||
`AI``生成方案`\
|
||||
` ↓`\
|
||||
`设计师审核`` ← ``修改意见`` → AI``调整`\
|
||||
` ↓`\
|
||||
`最终确认`
|
||||
|
||||
# 规划设计Agent案例
|
||||
|
||||
## 场景分析Agent
|
||||
|
||||
`输入:场地数据`
|
||||
|
||||
`↓`
|
||||
|
||||
`分析流程:`
|
||||
|
||||
1. `地形分析`` (``坡度、高程``)`
|
||||
|
||||
2. `气候分析`` (``日照、风向``)`
|
||||
|
||||
3. `交通分析`` (``可达性``)`
|
||||
|
||||
4. `视觉分析`` (``视域、景观``)`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:场地分析报告`
|
||||
|
||||
## 方案生成Agent
|
||||
|
||||
`输入:设计要求`` + ``场地分析`
|
||||
|
||||
`↓`
|
||||
|
||||
`生成流程:`
|
||||
|
||||
1. `理解需求`` (``CoT``推理``)`
|
||||
|
||||
2. `布局功能`` (``工具调用``)`
|
||||
|
||||
3. `连接路径`` (``图算法``)`
|
||||
|
||||
4. `优化调整`` (``迭代改进``)`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:初步设计方案`
|
||||
|
||||
## 合规审查Agent
|
||||
|
||||
`输入:设计方案`
|
||||
|
||||
`↓`
|
||||
|
||||
`审查流程:`
|
||||
|
||||
1. `调用规范库`
|
||||
|
||||
2. `逐条核对`
|
||||
|
||||
3. `标记问题`
|
||||
|
||||
4. `生成报告`
|
||||
|
||||
`↓`
|
||||
|
||||
`输出:合规审查意见`
|
||||
|
||||
# Agent落地挑战
|
||||
|
||||
技术挑战
|
||||
|
||||
---------------------------
|
||||
挑战 说明
|
||||
---------- ----------------
|
||||
准确性 复杂任务易出错
|
||||
|
||||
可解释性 决策过程不透明
|
||||
|
||||
鲁棒性 边界情况处理
|
||||
---------------------------
|
||||
|
||||
应用挑战
|
||||
|
||||
-----------------------------
|
||||
挑战 说明
|
||||
------------ ----------------
|
||||
工作流整合 与现有流程融合
|
||||
|
||||
责任界定 AI错误的后果
|
||||
|
||||
成本控制 API调用费用
|
||||
-----------------------------
|
||||
|
||||
## 解决方向
|
||||
|
||||
1. 分级应用:简单任务自动化,复杂任务辅助
|
||||
|
||||
渐进式:从局部到整体
|
||||
|
||||
人机协同:关键环节人工确认
|
||||
|
||||
# 未来展望:AI设计师
|
||||
|
||||
### 短期 (1-2年)
|
||||
|
||||
`AI``作为工具`\
|
||||
` - ``数据分析`\
|
||||
` - ``方案生成`\
|
||||
` - ``合规检查`
|
||||
|
||||
### 中期 (3-5年)
|
||||
|
||||
`AI``作为助手`\
|
||||
` - ``创意启发`\
|
||||
` - ``方案优化`\
|
||||
` - ``文档撰写`
|
||||
|
||||
### 长期 (5-10年)
|
||||
|
||||
`AI``作为合作伙伴`\
|
||||
` - ``共同创造`\
|
||||
` - ``自主决策`\
|
||||
` - ``专业评审`
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. MCP如何解决AI应用的"数据孤岛"问题?
|
||||
|
||||
2. 规划设计中哪些环节适合引入HITL?
|
||||
|
||||
3. AI设计师如何与人类设计师协作?
|
||||
|
||||
## 关键术语
|
||||
|
||||
----------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------------- ---------------------- ------------------------
|
||||
模型上下文协议 MCP Model Context Protocol
|
||||
|
||||
人在回路 HITL Human-in-the-Loop
|
||||
|
||||
数据孤岛 Data Silo 独立的数据存储
|
||||
|
||||
协议 Protocol 通信标准
|
||||
|
||||
工作流整合 Workflow Integration 融入现有流程
|
||||
----------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [MCP官方文档](https://modelcontextprotocol.io/)
|
||||
|
||||
[Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629)
|
||||
|
||||
@@ -8,10 +8,154 @@
|
||||
|
||||
本部分将系统介绍AI在视觉设计和交互设计中的应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [第16章 视觉设计与AIGC](#第16章-视觉设计与aicgc)
|
||||
## 学习目标
|
||||
|
||||
[第17章 交互设计](#第17章-交互设计-1)
|
||||
1. 了解AIGC在视觉设计中的应用场景
|
||||
|
||||
# 第16章 视觉设计与AIGC
|
||||
掌握图像生成和风格迁移的基本方法
|
||||
|
||||
理解AI辅助品牌视觉设计的流程
|
||||
|
||||
## 核心应用
|
||||
|
||||
图像生成与风格迁移
|
||||
|
||||
---------------------------------------------------------------------------------------
|
||||
应用类型 说明 工具示例
|
||||
-------------------------- ---------------------- -------------------------------------
|
||||
文生图 从文本描述生成图像 Midjourney, Stable Diffusion
|
||||
|
||||
图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting
|
||||
|
||||
风格迁移 将图像转换为目标风格 Neural Style Transfer
|
||||
|
||||
矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI
|
||||
---------------------------------------------------------------------------------------
|
||||
|
||||
Logo与图标设计
|
||||
|
||||
### AI辅助流程:
|
||||
|
||||
#### 需求分析
|
||||
|
||||
`- ``品牌定位`
|
||||
|
||||
`- ``目标受众`
|
||||
|
||||
`- ``设计风格偏好`
|
||||
|
||||
####
|
||||
|
||||
`2. ``概念生成`
|
||||
|
||||
`- AI``生成多个设计方案`
|
||||
|
||||
#### - 快速迭代探索
|
||||
|
||||
`3. ``细化优化`
|
||||
|
||||
`- ``设计师精修`
|
||||
|
||||
`- ``矢量化处理`
|
||||
|
||||
- 品牌规范整理
|
||||
|
||||
**工具推荐**: - LogoAI:自动Logo生成 - Looka:品牌设计套件 - Brandmark:Logo和品牌身份
|
||||
|
||||
品牌视觉系统生成
|
||||
|
||||
**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成
|
||||
|
||||
## 案例分析
|
||||
|
||||
**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展
|
||||
|
||||
**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. AIGC如何改变设计师的创意流程?
|
||||
|
||||
2. 在品牌设计中,如何平衡AI生成与原创性?
|
||||
|
||||
3. 选择一个AIGC工具,尝试完成一个视觉设计任务
|
||||
|
||||
---
|
||||
|
||||
### 学习目标
|
||||
|
||||
1. 了解AI在交互设计中的应用
|
||||
|
||||
掌握用户界面自动生成的原理
|
||||
|
||||
理解用户体验分析的方法
|
||||
|
||||
### 核心应用
|
||||
|
||||
用户界面生成
|
||||
|
||||
--------------------------------------------------------
|
||||
功能 说明 工具示例
|
||||
---------- -------------------- ------------------------
|
||||
布局生成 自动生成页面布局 Uizard, Galileo AI
|
||||
|
||||
组件推荐 基于上下文推荐组件 Figma AI, Motiff
|
||||
|
||||
设计系统 自动生成设计规范 Designer, Figma Tokens
|
||||
|
||||
原型生成 从描述生成交互原型 TLDraw, Diagram
|
||||
--------------------------------------------------------
|
||||
|
||||
交互原型自动化
|
||||
|
||||
**流程**:
|
||||
|
||||
`用户需求`` → AI``理解`` → ``生成原型`\
|
||||
` ↓`\
|
||||
` ``设计师调整优化`\
|
||||
` ↓`\
|
||||
` ``可交互原型`
|
||||
|
||||
**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档
|
||||
|
||||
用户体验分析
|
||||
|
||||
**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析
|
||||
|
||||
### 案例分析
|
||||
|
||||
**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试
|
||||
|
||||
**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. AI生成的界面如何保证可用性?
|
||||
|
||||
2. 在交互设计中,人类设计师的核心价值是什么?
|
||||
|
||||
3. 尝试用AI工具生成一个简单的交互原型
|
||||
|
||||
### 关键术语
|
||||
|
||||
--------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ---------------- ----------------------
|
||||
风格迁移 Style Transfer 将图像转换为目标风格
|
||||
|
||||
矢量化 Vectorization 转换为可缩放矢量格式
|
||||
|
||||
原型 Prototype 可交互的设计模型
|
||||
|
||||
设计系统 Design System 组件化设计规范
|
||||
--------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Midjourney官方文档](https://docs.midjourney.com/)
|
||||
|
||||
[Stable Diffusion提示词指南](https://stable-diffusion-art.com/)
|
||||
|
||||
[Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI)
|
||||
|
||||
@@ -1,72 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
1. 了解AIGC在视觉设计中的应用场景
|
||||
|
||||
掌握图像生成和风格迁移的基本方法
|
||||
|
||||
理解AI辅助品牌视觉设计的流程
|
||||
|
||||
## 核心应用
|
||||
|
||||
图像生成与风格迁移
|
||||
|
||||
---------------------------------------------------------------------------------------
|
||||
应用类型 说明 工具示例
|
||||
-------------------------- ---------------------- -------------------------------------
|
||||
文生图 从文本描述生成图像 Midjourney, Stable Diffusion
|
||||
|
||||
图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting
|
||||
|
||||
风格迁移 将图像转换为目标风格 Neural Style Transfer
|
||||
|
||||
矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI
|
||||
---------------------------------------------------------------------------------------
|
||||
|
||||
Logo与图标设计
|
||||
|
||||
### AI辅助流程:
|
||||
|
||||
#### 需求分析
|
||||
|
||||
`- ``品牌定位`
|
||||
|
||||
`- ``目标受众`
|
||||
|
||||
`- ``设计风格偏好`
|
||||
|
||||
####
|
||||
|
||||
`2. ``概念生成`
|
||||
|
||||
`- AI``生成多个设计方案`
|
||||
|
||||
#### - 快速迭代探索
|
||||
|
||||
`3. ``细化优化`
|
||||
|
||||
`- ``设计师精修`
|
||||
|
||||
`- ``矢量化处理`
|
||||
|
||||
- 品牌规范整理
|
||||
|
||||
**工具推荐**: - LogoAI:自动Logo生成 - Looka:品牌设计套件 - Brandmark:Logo和品牌身份
|
||||
|
||||
品牌视觉系统生成
|
||||
|
||||
**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成
|
||||
|
||||
## 案例分析
|
||||
|
||||
**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展
|
||||
|
||||
**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. AIGC如何改变设计师的创意流程?
|
||||
|
||||
2. 在品牌设计中,如何平衡AI生成与原创性?
|
||||
|
||||
3. 选择一个AIGC工具,尝试完成一个视觉设计任务
|
||||
@@ -1,76 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
1. 了解AI在交互设计中的应用
|
||||
|
||||
掌握用户界面自动生成的原理
|
||||
|
||||
理解用户体验分析的方法
|
||||
|
||||
### 核心应用
|
||||
|
||||
用户界面生成
|
||||
|
||||
--------------------------------------------------------
|
||||
功能 说明 工具示例
|
||||
---------- -------------------- ------------------------
|
||||
布局生成 自动生成页面布局 Uizard, Galileo AI
|
||||
|
||||
组件推荐 基于上下文推荐组件 Figma AI, Motiff
|
||||
|
||||
设计系统 自动生成设计规范 Designer, Figma Tokens
|
||||
|
||||
原型生成 从描述生成交互原型 TLDraw, Diagram
|
||||
--------------------------------------------------------
|
||||
|
||||
交互原型自动化
|
||||
|
||||
**流程**:
|
||||
|
||||
`用户需求`` → AI``理解`` → ``生成原型`\
|
||||
` ↓`\
|
||||
` ``设计师调整优化`\
|
||||
` ↓`\
|
||||
` ``可交互原型`
|
||||
|
||||
**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档
|
||||
|
||||
用户体验分析
|
||||
|
||||
**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析
|
||||
|
||||
### 案例分析
|
||||
|
||||
**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试
|
||||
|
||||
**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. AI生成的界面如何保证可用性?
|
||||
|
||||
2. 在交互设计中,人类设计师的核心价值是什么?
|
||||
|
||||
3. 尝试用AI工具生成一个简单的交互原型
|
||||
|
||||
### 关键术语
|
||||
|
||||
--------------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- ---------------- ----------------------
|
||||
风格迁移 Style Transfer 将图像转换为目标风格
|
||||
|
||||
矢量化 Vectorization 转换为可缩放矢量格式
|
||||
|
||||
原型 Prototype 可交互的设计模型
|
||||
|
||||
设计系统 Design System 组件化设计规范
|
||||
--------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Midjourney官方文档](https://docs.midjourney.com/)
|
||||
|
||||
[Stable Diffusion提示词指南](https://stable-diffusion-art.com/)
|
||||
|
||||
[Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI)
|
||||
@@ -8,10 +8,146 @@
|
||||
|
||||
本部分将介绍AI在室内设计和景观设计中的应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [第18章 室内设计](#第18章-室内设计-1)
|
||||
## 学习目标
|
||||
|
||||
[第19章 景观设计](#第19章-景观设计-1)
|
||||
1. 了解AI在室内设计中的应用流程
|
||||
|
||||
# 第18章 室内设计
|
||||
掌握平面图智能生成的方法
|
||||
|
||||
理解VR/AR在室内设计预览中的作用
|
||||
|
||||
## 核心应用
|
||||
|
||||
平面图智能生成
|
||||
|
||||
**传统流程 vs AI辅助**:
|
||||
|
||||
----------------------------------------
|
||||
环节 传统方式 AI辅助
|
||||
---------- -------------- --------------
|
||||
需求分析 人工沟通 自然语言理解
|
||||
|
||||
方案生成 手绘/CAD绘制 自动生成布局
|
||||
|
||||
家具选择 手动搜索 智能推荐
|
||||
|
||||
效果预览 3D建模渲染 实时生成
|
||||
----------------------------------------
|
||||
|
||||
**AI工具**: - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型
|
||||
|
||||
家具布局优化
|
||||
|
||||
**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡
|
||||
|
||||
**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习
|
||||
|
||||
材质与风格推荐
|
||||
|
||||
**推荐流程**:
|
||||
|
||||
`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\
|
||||
` ↓`\
|
||||
` ``生成效果预览`\
|
||||
` ↓`\
|
||||
` ``用户反馈迭代`
|
||||
|
||||
VR/AR预览
|
||||
|
||||
**技术实现**: - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果
|
||||
|
||||
**工具**: - Enscape:实时渲染插件 - Twinmotion:快速可视化 - Arkio:VR协作设计
|
||||
|
||||
## 案例分析
|
||||
|
||||
**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. AI如何平衡功能性和美学?
|
||||
|
||||
2. VR/AR如何改变室内设计工作流?
|
||||
|
||||
3. 尝试使用AI室内设计工具完成一个小空间设计
|
||||
|
||||
---
|
||||
|
||||
### 学习目标
|
||||
|
||||
1. 了解AI在景观设计中的应用
|
||||
|
||||
掌握场地分析与评估的方法
|
||||
|
||||
理解生态效益模拟的技术
|
||||
|
||||
### 核心应用
|
||||
|
||||
场地分析与评估
|
||||
|
||||
**分析维度**:
|
||||
|
||||
------------------------------------------------
|
||||
维度 内容 AI方法
|
||||
------------ -------------------- --------------
|
||||
地形地貌 高程、坡度、坡向 DEM分析
|
||||
|
||||
植被覆盖 类型、密度、健康度 遥感图像分类
|
||||
|
||||
水文系统 水系、排水、汇水 水文模拟
|
||||
|
||||
视觉景观 视域、视线廊道 视域分析
|
||||
|
||||
气候舒适度 风环境、日照、温度 环境模拟
|
||||
------------------------------------------------
|
||||
|
||||
**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模
|
||||
|
||||
植被配置优化
|
||||
|
||||
**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候
|
||||
|
||||
**AI方法**: - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果
|
||||
|
||||
景观元素生成
|
||||
|
||||
**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计
|
||||
|
||||
生态效益模拟
|
||||
|
||||
**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解
|
||||
|
||||
### 案例分析
|
||||
|
||||
**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. AI如何处理景观设计中的复杂约束?
|
||||
|
||||
2. 生态效益模拟的数据从哪里来?
|
||||
|
||||
3. 选择一个景观设计场景,分析AI可应用的环节
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- --------------
|
||||
平面图 Floor Plan 水平剖切图
|
||||
|
||||
布局优化 Layout Optimization 空间排列优化
|
||||
|
||||
动线 Circulation 人员流动路径
|
||||
|
||||
视域分析 Viewshed Analysis 可见范围分析
|
||||
|
||||
生态效益 Ecological Benefit 生态服务价值
|
||||
-----------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Landscape Architecture + AI](https://landscapeperformance.org/)
|
||||
|
||||
[GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture)
|
||||
|
||||
@@ -1,62 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
1. 了解AI在室内设计中的应用流程
|
||||
|
||||
掌握平面图智能生成的方法
|
||||
|
||||
理解VR/AR在室内设计预览中的作用
|
||||
|
||||
## 核心应用
|
||||
|
||||
平面图智能生成
|
||||
|
||||
**传统流程 vs AI辅助**:
|
||||
|
||||
----------------------------------------
|
||||
环节 传统方式 AI辅助
|
||||
---------- -------------- --------------
|
||||
需求分析 人工沟通 自然语言理解
|
||||
|
||||
方案生成 手绘/CAD绘制 自动生成布局
|
||||
|
||||
家具选择 手动搜索 智能推荐
|
||||
|
||||
效果预览 3D建模渲染 实时生成
|
||||
----------------------------------------
|
||||
|
||||
**AI工具**: - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型
|
||||
|
||||
家具布局优化
|
||||
|
||||
**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡
|
||||
|
||||
**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习
|
||||
|
||||
材质与风格推荐
|
||||
|
||||
**推荐流程**:
|
||||
|
||||
`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\
|
||||
` ↓`\
|
||||
` ``生成效果预览`\
|
||||
` ↓`\
|
||||
` ``用户反馈迭代`
|
||||
|
||||
VR/AR预览
|
||||
|
||||
**技术实现**: - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果
|
||||
|
||||
**工具**: - Enscape:实时渲染插件 - Twinmotion:快速可视化 - Arkio:VR协作设计
|
||||
|
||||
## 案例分析
|
||||
|
||||
**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单
|
||||
|
||||
## 思考与练习
|
||||
|
||||
1. AI如何平衡功能性和美学?
|
||||
|
||||
2. VR/AR如何改变室内设计工作流?
|
||||
|
||||
3. 尝试使用AI室内设计工具完成一个小空间设计
|
||||
@@ -1,78 +0,0 @@
|
||||
|
||||
### 学习目标
|
||||
|
||||
1. 了解AI在景观设计中的应用
|
||||
|
||||
掌握场地分析与评估的方法
|
||||
|
||||
理解生态效益模拟的技术
|
||||
|
||||
### 核心应用
|
||||
|
||||
场地分析与评估
|
||||
|
||||
**分析维度**:
|
||||
|
||||
------------------------------------------------
|
||||
维度 内容 AI方法
|
||||
------------ -------------------- --------------
|
||||
地形地貌 高程、坡度、坡向 DEM分析
|
||||
|
||||
植被覆盖 类型、密度、健康度 遥感图像分类
|
||||
|
||||
水文系统 水系、排水、汇水 水文模拟
|
||||
|
||||
视觉景观 视域、视线廊道 视域分析
|
||||
|
||||
气候舒适度 风环境、日照、温度 环境模拟
|
||||
------------------------------------------------
|
||||
|
||||
**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模
|
||||
|
||||
植被配置优化
|
||||
|
||||
**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候
|
||||
|
||||
**AI方法**: - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果
|
||||
|
||||
景观元素生成
|
||||
|
||||
**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计
|
||||
|
||||
生态效益模拟
|
||||
|
||||
**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解
|
||||
|
||||
### 案例分析
|
||||
|
||||
**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计
|
||||
|
||||
### 思考与练习
|
||||
|
||||
1. AI如何处理景观设计中的复杂约束?
|
||||
|
||||
2. 生态效益模拟的数据从哪里来?
|
||||
|
||||
3. 选择一个景观设计场景,分析AI可应用的环节
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------
|
||||
中文 英文 说明
|
||||
---------- --------------------- --------------
|
||||
平面图 Floor Plan 水平剖切图
|
||||
|
||||
布局优化 Layout Optimization 空间排列优化
|
||||
|
||||
动线 Circulation 人员流动路径
|
||||
|
||||
视域分析 Viewshed Analysis 可见范围分析
|
||||
|
||||
生态效益 Ecological Benefit 生态服务价值
|
||||
-----------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Landscape Architecture + AI](https://landscapeperformance.org/)
|
||||
|
||||
[GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture)
|
||||
@@ -8,10 +8,138 @@
|
||||
|
||||
本部分将介绍AI在工业设计中的关键应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [第20章 产品造型设计](#第20章-产品造型设计-1)
|
||||
## 学习目标
|
||||
|
||||
[第21章 设计优化与制造](#第21章-设计优化与制造-1)
|
||||
1. 了解AI辅助产品概念设计的方法
|
||||
|
||||
# 第20章 产品造型设计
|
||||
掌握草图生成和三维建模的AI工具
|
||||
|
||||
理解形态优化的基本原理
|
||||
|
||||
## 核心应用
|
||||
|
||||
概念草图生成
|
||||
|
||||
**流程**:
|
||||
|
||||
`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\
|
||||
` ↓`\
|
||||
` ``设计师选择与迭代`
|
||||
|
||||
**工具**: - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化
|
||||
|
||||
三维建模辅助
|
||||
|
||||
**AI辅助功能**:
|
||||
|
||||
----------------------------------------------------
|
||||
功能 说明 工具
|
||||
---------- ------------------- ---------------------
|
||||
草图转3D 2D草图生成3D模型 Shapr3D, Point-E
|
||||
|
||||
模型优化 自动布线、倒角 ZBrush, Blender插件
|
||||
|
||||
纹理生成 自动生成材质贴图 Adobe Substance 3D
|
||||
|
||||
渲染加速 快速生成产品渲染 NVIDIA Canvas
|
||||
----------------------------------------------------
|
||||
|
||||
形态优化
|
||||
|
||||
**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制
|
||||
|
||||
**AI方法**: - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化
|
||||
|
||||
案例分析
|
||||
|
||||
**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审
|
||||
|
||||
思考与练习
|
||||
|
||||
1. AI生成的概念如何保持原创性?
|
||||
|
||||
2. 形态优化中如何平衡美学和功能?
|
||||
|
||||
3. 尝试用AI工具生成一个产品概念
|
||||
|
||||
---
|
||||
|
||||
学习目标
|
||||
|
||||
1. 了解AI在结构优化中的应用
|
||||
|
||||
掌握材料选择和可制造性分析方法
|
||||
|
||||
理解AI辅助制造准备的技术
|
||||
|
||||
### 核心应用
|
||||
|
||||
结构优化
|
||||
|
||||
**拓扑优化**:
|
||||
|
||||
`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\
|
||||
` ↓`\
|
||||
` ``轻量化与强度平衡`
|
||||
|
||||
**AI方法**: - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构
|
||||
|
||||
**工具**: - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化
|
||||
|
||||
材料选择
|
||||
|
||||
**AI辅助决策**:
|
||||
|
||||
---------------------------
|
||||
考虑因素 AI方法
|
||||
---------- ----------------
|
||||
力学性能 材料数据库检索
|
||||
|
||||
成本 价格预测模型
|
||||
|
||||
可持续性 环境影响评估
|
||||
|
||||
可加工性 工艺兼容性分析
|
||||
---------------------------
|
||||
|
||||
可制造性分析
|
||||
|
||||
**分析内容**: - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性
|
||||
|
||||
**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算
|
||||
|
||||
### 案例分析 {#案例分析-5}
|
||||
|
||||
**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造
|
||||
|
||||
### 思考与练习 {#思考与练习-21}
|
||||
|
||||
1. 拓扑优化的结果如何满足生产工艺要求?
|
||||
|
||||
2. AI如何帮助选择可持续材料?
|
||||
|
||||
3. 选择一个简单产品,分析AI可优化的环节
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------ ----------------------- ----------------
|
||||
概念设计 Concept Design 初步设计阶段
|
||||
|
||||
拓扑优化 Topology Optimization 结构布局优化
|
||||
|
||||
生成式设计 Generative Design AI驱动设计生成
|
||||
|
||||
可制造性 Manufacturability 生产可行性
|
||||
|
||||
轻量化 Lightweight 减少重量
|
||||
-----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design)
|
||||
|
||||
[nTopology技术文档](https://ntopology.com/resources/)
|
||||
|
||||
@@ -1,54 +0,0 @@
|
||||
|
||||
## 学习目标
|
||||
|
||||
1. 了解AI辅助产品概念设计的方法
|
||||
|
||||
掌握草图生成和三维建模的AI工具
|
||||
|
||||
理解形态优化的基本原理
|
||||
|
||||
## 核心应用
|
||||
|
||||
概念草图生成
|
||||
|
||||
**流程**:
|
||||
|
||||
`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\
|
||||
` ↓`\
|
||||
` ``设计师选择与迭代`
|
||||
|
||||
**工具**: - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化
|
||||
|
||||
三维建模辅助
|
||||
|
||||
**AI辅助功能**:
|
||||
|
||||
----------------------------------------------------
|
||||
功能 说明 工具
|
||||
---------- ------------------- ---------------------
|
||||
草图转3D 2D草图生成3D模型 Shapr3D, Point-E
|
||||
|
||||
模型优化 自动布线、倒角 ZBrush, Blender插件
|
||||
|
||||
纹理生成 自动生成材质贴图 Adobe Substance 3D
|
||||
|
||||
渲染加速 快速生成产品渲染 NVIDIA Canvas
|
||||
----------------------------------------------------
|
||||
|
||||
形态优化
|
||||
|
||||
**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制
|
||||
|
||||
**AI方法**: - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化
|
||||
|
||||
案例分析
|
||||
|
||||
**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审
|
||||
|
||||
思考与练习
|
||||
|
||||
1. AI生成的概念如何保持原创性?
|
||||
|
||||
2. 形态优化中如何平衡美学和功能?
|
||||
|
||||
3. 尝试用AI工具生成一个产品概念
|
||||
@@ -1,78 +0,0 @@
|
||||
|
||||
学习目标
|
||||
|
||||
1. 了解AI在结构优化中的应用
|
||||
|
||||
掌握材料选择和可制造性分析方法
|
||||
|
||||
理解AI辅助制造准备的技术
|
||||
|
||||
### 核心应用
|
||||
|
||||
结构优化
|
||||
|
||||
**拓扑优化**:
|
||||
|
||||
`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\
|
||||
` ↓`\
|
||||
` ``轻量化与强度平衡`
|
||||
|
||||
**AI方法**: - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构
|
||||
|
||||
**工具**: - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化
|
||||
|
||||
材料选择
|
||||
|
||||
**AI辅助决策**:
|
||||
|
||||
---------------------------
|
||||
考虑因素 AI方法
|
||||
---------- ----------------
|
||||
力学性能 材料数据库检索
|
||||
|
||||
成本 价格预测模型
|
||||
|
||||
可持续性 环境影响评估
|
||||
|
||||
可加工性 工艺兼容性分析
|
||||
---------------------------
|
||||
|
||||
可制造性分析
|
||||
|
||||
**分析内容**: - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性
|
||||
|
||||
**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算
|
||||
|
||||
### 案例分析 {#案例分析-5}
|
||||
|
||||
**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造
|
||||
|
||||
### 思考与练习 {#思考与练习-21}
|
||||
|
||||
1. 拓扑优化的结果如何满足生产工艺要求?
|
||||
|
||||
2. AI如何帮助选择可持续材料?
|
||||
|
||||
3. 选择一个简单产品,分析AI可优化的环节
|
||||
|
||||
### 关键术语
|
||||
|
||||
-----------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------ ----------------------- ----------------
|
||||
概念设计 Concept Design 初步设计阶段
|
||||
|
||||
拓扑优化 Topology Optimization 结构布局优化
|
||||
|
||||
生成式设计 Generative Design AI驱动设计生成
|
||||
|
||||
可制造性 Manufacturability 生产可行性
|
||||
|
||||
轻量化 Lightweight 减少重量
|
||||
-----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design)
|
||||
|
||||
[nTopology技术文档](https://ntopology.com/resources/)
|
||||
@@ -8,10 +8,154 @@
|
||||
|
||||
本部分将介绍AI在城市设计中的关键应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [第22章 城市空间分析](#第22章-城市空间分析-1)
|
||||
## 学习目标 {#学习目标-24}
|
||||
|
||||
[第23章 规划设计与评估](#第23章-规划设计与其评估)
|
||||
1. 了解AI在城市空间分析中的应用
|
||||
|
||||
# 第22章 城市空间分析
|
||||
掌握遥感影像和城市形态识别的方法
|
||||
|
||||
理解人口与活动分析的技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
遥感影像分析
|
||||
|
||||
### 分析内容:
|
||||
|
||||
------------------------------------
|
||||
内容 方法 应用
|
||||
---------- ---------- --------------
|
||||
土地利用 图像分类 规划现状调查
|
||||
|
||||
建筑识别 目标检测 建筑普查
|
||||
|
||||
变化检测 时序分析 城市扩张监测
|
||||
|
||||
环境质量 指数反演 生态评估
|
||||
------------------------------------
|
||||
|
||||
### 技术流程:
|
||||
|
||||
`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\
|
||||
` ↓`\
|
||||
` ``规划决策支持`
|
||||
|
||||
城市形态识别
|
||||
|
||||
**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间
|
||||
|
||||
**AI方法**: - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型
|
||||
|
||||
人口与活动分析
|
||||
|
||||
**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据
|
||||
|
||||
**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点
|
||||
|
||||
**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测
|
||||
|
||||
## 案例分析 {#案例分析-6}
|
||||
|
||||
**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议
|
||||
|
||||
## 思考与练习 {#思考与练习-22}
|
||||
|
||||
1. 多源数据如何保护隐私?
|
||||
|
||||
2. AI分析如何考虑城市的独特性?
|
||||
|
||||
3. 选择一个城市问题,分析AI可提供的帮助
|
||||
|
||||
---
|
||||
|
||||
### 学习目标 {#学习目标-25}
|
||||
|
||||
1. 了解AI辅助规划设计的方法
|
||||
|
||||
掌握交通网络和设施布局优化的技术
|
||||
|
||||
理解规划方案评估的AI应用
|
||||
|
||||
### 核心应用
|
||||
|
||||
用地规划生成
|
||||
|
||||
**传统流程 vs AI辅助**:
|
||||
|
||||
--------------------------------
|
||||
环节 传统方式 AI辅助
|
||||
---------- ---------- ----------
|
||||
现状分析 人工统计 自动识别
|
||||
|
||||
方案生成 手绘/CAD 规则生成
|
||||
|
||||
规范检查 人工核对 自动验证
|
||||
|
||||
方案评估 定性分析 量化评估
|
||||
--------------------------------
|
||||
|
||||
**生成方法**: - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计
|
||||
|
||||
交通网络优化
|
||||
|
||||
**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小
|
||||
|
||||
**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测
|
||||
|
||||
公共设施布局
|
||||
|
||||
**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配
|
||||
|
||||
**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题
|
||||
|
||||
规划方案评估
|
||||
|
||||
**评估维度**:
|
||||
|
||||
--------------------------------------
|
||||
维度 指标 AI方法
|
||||
---------- ---------------- ----------
|
||||
空间效率 容积率、密度 空间分析
|
||||
|
||||
交通影响 出行距离、拥堵 交通模拟
|
||||
|
||||
环境影响 碳排放、绿地 环境模型
|
||||
|
||||
社会效益 公平性、满意度 社会模型
|
||||
--------------------------------------
|
||||
|
||||
### 案例分析 {#案例分析-7}
|
||||
|
||||
**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定
|
||||
|
||||
### 思考与练习 {#思考与练习-23}
|
||||
|
||||
1. AI生成的规划方案如何体现人文关怀?
|
||||
|
||||
2. 如何平衡不同评估维度的冲突?
|
||||
|
||||
3. 选择一个规划问题,分析AI的潜在作用
|
||||
|
||||
### 关键术语
|
||||
|
||||
----------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------ ---------------- ----------------------
|
||||
土地利用 Land Use 土地功能分布
|
||||
|
||||
遥感 Remote Sensing 远距离探测技术
|
||||
|
||||
图神经网络 GNN Graph Neural Network
|
||||
|
||||
通达性 Accessibility 到达便利程度
|
||||
|
||||
服务半径 Service Radius 设施服务范围
|
||||
----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Urban AI](https://urbanai.io/)
|
||||
|
||||
[Google Environmental Insights Explorer](https://insights.sustainability.google/)
|
||||
|
||||
@@ -1,58 +0,0 @@
|
||||
|
||||
## 学习目标 {#学习目标-24}
|
||||
|
||||
1. 了解AI在城市空间分析中的应用
|
||||
|
||||
掌握遥感影像和城市形态识别的方法
|
||||
|
||||
理解人口与活动分析的技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
遥感影像分析
|
||||
|
||||
### 分析内容:
|
||||
|
||||
------------------------------------
|
||||
内容 方法 应用
|
||||
---------- ---------- --------------
|
||||
土地利用 图像分类 规划现状调查
|
||||
|
||||
建筑识别 目标检测 建筑普查
|
||||
|
||||
变化检测 时序分析 城市扩张监测
|
||||
|
||||
环境质量 指数反演 生态评估
|
||||
------------------------------------
|
||||
|
||||
### 技术流程:
|
||||
|
||||
`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\
|
||||
` ↓`\
|
||||
` ``规划决策支持`
|
||||
|
||||
城市形态识别
|
||||
|
||||
**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间
|
||||
|
||||
**AI方法**: - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型
|
||||
|
||||
人口与活动分析
|
||||
|
||||
**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据
|
||||
|
||||
**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点
|
||||
|
||||
**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测
|
||||
|
||||
## 案例分析 {#案例分析-6}
|
||||
|
||||
**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议
|
||||
|
||||
## 思考与练习 {#思考与练习-22}
|
||||
|
||||
1. 多源数据如何保护隐私?
|
||||
|
||||
2. AI分析如何考虑城市的独特性?
|
||||
|
||||
3. 选择一个城市问题,分析AI可提供的帮助
|
||||
@@ -1,90 +0,0 @@
|
||||
|
||||
### 学习目标 {#学习目标-25}
|
||||
|
||||
1. 了解AI辅助规划设计的方法
|
||||
|
||||
掌握交通网络和设施布局优化的技术
|
||||
|
||||
理解规划方案评估的AI应用
|
||||
|
||||
### 核心应用
|
||||
|
||||
用地规划生成
|
||||
|
||||
**传统流程 vs AI辅助**:
|
||||
|
||||
--------------------------------
|
||||
环节 传统方式 AI辅助
|
||||
---------- ---------- ----------
|
||||
现状分析 人工统计 自动识别
|
||||
|
||||
方案生成 手绘/CAD 规则生成
|
||||
|
||||
规范检查 人工核对 自动验证
|
||||
|
||||
方案评估 定性分析 量化评估
|
||||
--------------------------------
|
||||
|
||||
**生成方法**: - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计
|
||||
|
||||
交通网络优化
|
||||
|
||||
**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小
|
||||
|
||||
**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测
|
||||
|
||||
公共设施布局
|
||||
|
||||
**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配
|
||||
|
||||
**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题
|
||||
|
||||
规划方案评估
|
||||
|
||||
**评估维度**:
|
||||
|
||||
--------------------------------------
|
||||
维度 指标 AI方法
|
||||
---------- ---------------- ----------
|
||||
空间效率 容积率、密度 空间分析
|
||||
|
||||
交通影响 出行距离、拥堵 交通模拟
|
||||
|
||||
环境影响 碳排放、绿地 环境模型
|
||||
|
||||
社会效益 公平性、满意度 社会模型
|
||||
--------------------------------------
|
||||
|
||||
### 案例分析 {#案例分析-7}
|
||||
|
||||
**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定
|
||||
|
||||
### 思考与练习 {#思考与练习-23}
|
||||
|
||||
1. AI生成的规划方案如何体现人文关怀?
|
||||
|
||||
2. 如何平衡不同评估维度的冲突?
|
||||
|
||||
3. 选择一个规划问题,分析AI的潜在作用
|
||||
|
||||
### 关键术语
|
||||
|
||||
----------------------------------------------------
|
||||
中文 英文 说明
|
||||
------------ ---------------- ----------------------
|
||||
土地利用 Land Use 土地功能分布
|
||||
|
||||
遥感 Remote Sensing 远距离探测技术
|
||||
|
||||
图神经网络 GNN Graph Neural Network
|
||||
|
||||
通达性 Accessibility 到达便利程度
|
||||
|
||||
服务半径 Service Radius 设施服务范围
|
||||
----------------------------------------------------
|
||||
|
||||
### 延伸阅读
|
||||
|
||||
1. [Urban AI](https://urbanai.io/)
|
||||
|
||||
[Google Environmental Insights Explorer](https://insights.sustainability.google/)
|
||||
@@ -8,10 +8,136 @@
|
||||
|
||||
本部分将介绍AI在生态设计中的应用。
|
||||
|
||||
## 章节目录
|
||||
---
|
||||
|
||||
1. [第24章 生态分析与评估](#第24章-生态分析与评估-1)
|
||||
## 学习目标 {#学习目标-26}
|
||||
|
||||
[第25章 生态规划与修复](#第25章-生态规划与修复-1)
|
||||
1. 了解AI在生态系统服务评估中的应用
|
||||
|
||||
# 第24章 生态分析与评估
|
||||
掌握生物多样性分析的方法
|
||||
|
||||
理解环境质量监测的技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
生态系统服务评估
|
||||
|
||||
**服务类型**:
|
||||
|
||||
--------------------------------------------
|
||||
类型 内容 AI应用
|
||||
---------- ------------------ --------------
|
||||
供给服务 食物、水、纤维 产量预测
|
||||
|
||||
调节服务 气候、洪水、疾病 风险评估
|
||||
|
||||
文化服务 娱乐、旅游 游客行为分析
|
||||
|
||||
支持服务 营养循环、生境 过程模拟
|
||||
--------------------------------------------
|
||||
|
||||
**评估方法**: - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测
|
||||
|
||||
生物多样性分析
|
||||
|
||||
**分析层次**:
|
||||
|
||||
--------------------------------------------
|
||||
层次 内容 AI方法
|
||||
---------------- ------------ --------------
|
||||
遗传多样性 基因变异 基因序列分析
|
||||
|
||||
物种多样性 物种丰富度 图像识别
|
||||
|
||||
生态系统多样性 生境类型 景观分类
|
||||
--------------------------------------------
|
||||
|
||||
**技术应用**: - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测
|
||||
|
||||
环境质量监测
|
||||
|
||||
**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染
|
||||
|
||||
**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析
|
||||
|
||||
## 案例分析 {#案例分析-8}
|
||||
|
||||
**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成
|
||||
|
||||
## 思考与练习 {#思考与练习-24}
|
||||
|
||||
1. AI如何处理生态数据的复杂性和不确定性?
|
||||
|
||||
2. 生物多样性自动识别的准确率如何保证?
|
||||
|
||||
3. 选择一个生态问题,分析AI可提供的帮助
|
||||
|
||||
---
|
||||
|
||||
## 学习目标 {#学习目标-27}
|
||||
|
||||
1. 了解AI在生态源地识别中的应用
|
||||
|
||||
掌握生态网络构建的方法
|
||||
|
||||
理解生态修复方案的优化技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
生态源地识别
|
||||
|
||||
**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区
|
||||
|
||||
**AI方法**: - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序
|
||||
|
||||
生态网络构建
|
||||
|
||||
**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境
|
||||
|
||||
**构建流程**:
|
||||
|
||||
`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估`
|
||||
|
||||
**AI技术**: - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计
|
||||
|
||||
修复方案优化
|
||||
|
||||
**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理
|
||||
|
||||
**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性
|
||||
|
||||
**AI应用**: - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整
|
||||
|
||||
## 案例分析 {#案例分析-9}
|
||||
|
||||
**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略
|
||||
|
||||
## 思考与练习 {#思考与练习-25}
|
||||
|
||||
1. 生态网络如何应对气候变化?
|
||||
|
||||
2. AI优化的修复方案如何考虑长期效应?
|
||||
|
||||
3. 选择一个生态修复场景,分析AI的应用点
|
||||
|
||||
## 关键术语
|
||||
|
||||
---------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------------- ----------------------------- ------------------
|
||||
生态系统服务 Ecosystem Services 自然对人类的益处
|
||||
|
||||
生物多样性 Biodiversity 生物种类丰富度
|
||||
|
||||
生态源地 Ecological Source 生态核心区
|
||||
|
||||
生态廊道 Ecological Corridor 生态连接通道
|
||||
|
||||
生态安全格局 Ecological Security Pattern 生态空间布局
|
||||
---------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [Circuitscape](https://circuitscape.org/)
|
||||
|
||||
[InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest)
|
||||
|
||||
@@ -1,62 +0,0 @@
|
||||
|
||||
## 学习目标 {#学习目标-26}
|
||||
|
||||
1. 了解AI在生态系统服务评估中的应用
|
||||
|
||||
掌握生物多样性分析的方法
|
||||
|
||||
理解环境质量监测的技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
生态系统服务评估
|
||||
|
||||
**服务类型**:
|
||||
|
||||
--------------------------------------------
|
||||
类型 内容 AI应用
|
||||
---------- ------------------ --------------
|
||||
供给服务 食物、水、纤维 产量预测
|
||||
|
||||
调节服务 气候、洪水、疾病 风险评估
|
||||
|
||||
文化服务 娱乐、旅游 游客行为分析
|
||||
|
||||
支持服务 营养循环、生境 过程模拟
|
||||
--------------------------------------------
|
||||
|
||||
**评估方法**: - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测
|
||||
|
||||
生物多样性分析
|
||||
|
||||
**分析层次**:
|
||||
|
||||
--------------------------------------------
|
||||
层次 内容 AI方法
|
||||
---------------- ------------ --------------
|
||||
遗传多样性 基因变异 基因序列分析
|
||||
|
||||
物种多样性 物种丰富度 图像识别
|
||||
|
||||
生态系统多样性 生境类型 景观分类
|
||||
--------------------------------------------
|
||||
|
||||
**技术应用**: - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测
|
||||
|
||||
环境质量监测
|
||||
|
||||
**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染
|
||||
|
||||
**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析
|
||||
|
||||
## 案例分析 {#案例分析-8}
|
||||
|
||||
**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成
|
||||
|
||||
## 思考与练习 {#思考与练习-24}
|
||||
|
||||
1. AI如何处理生态数据的复杂性和不确定性?
|
||||
|
||||
2. 生物多样性自动识别的准确率如何保证?
|
||||
|
||||
3. 选择一个生态问题,分析AI可提供的帮助
|
||||
@@ -1,68 +0,0 @@
|
||||
|
||||
## 学习目标 {#学习目标-27}
|
||||
|
||||
1. 了解AI在生态源地识别中的应用
|
||||
|
||||
掌握生态网络构建的方法
|
||||
|
||||
理解生态修复方案的优化技术
|
||||
|
||||
## 核心应用
|
||||
|
||||
生态源地识别
|
||||
|
||||
**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区
|
||||
|
||||
**AI方法**: - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序
|
||||
|
||||
生态网络构建
|
||||
|
||||
**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境
|
||||
|
||||
**构建流程**:
|
||||
|
||||
`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估`
|
||||
|
||||
**AI技术**: - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计
|
||||
|
||||
修复方案优化
|
||||
|
||||
**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理
|
||||
|
||||
**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性
|
||||
|
||||
**AI应用**: - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整
|
||||
|
||||
## 案例分析 {#案例分析-9}
|
||||
|
||||
**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略
|
||||
|
||||
## 思考与练习 {#思考与练习-25}
|
||||
|
||||
1. 生态网络如何应对气候变化?
|
||||
|
||||
2. AI优化的修复方案如何考虑长期效应?
|
||||
|
||||
3. 选择一个生态修复场景,分析AI的应用点
|
||||
|
||||
## 关键术语
|
||||
|
||||
---------------------------------------------------------------
|
||||
中文 英文 说明
|
||||
-------------- ----------------------------- ------------------
|
||||
生态系统服务 Ecosystem Services 自然对人类的益处
|
||||
|
||||
生物多样性 Biodiversity 生物种类丰富度
|
||||
|
||||
生态源地 Ecological Source 生态核心区
|
||||
|
||||
生态廊道 Ecological Corridor 生态连接通道
|
||||
|
||||
生态安全格局 Ecological Security Pattern 生态空间布局
|
||||
---------------------------------------------------------------
|
||||
|
||||
## 延伸阅读
|
||||
|
||||
1. [Circuitscape](https://circuitscape.org/)
|
||||
|
||||
[InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest)
|
||||
Reference in New Issue
Block a user