From fac0133db54125b2dd3c4347a40bb5f98a9fb97f Mon Sep 17 00:00:00 2001 From: pengxiao Date: Sat, 25 Apr 2026 10:48:05 +0800 Subject: [PATCH] =?UTF-8?q?=E5=90=88=E5=B9=B6=E5=AD=90=E7=AB=A0=E8=8A=82?= =?UTF-8?q?=E5=88=B0=E7=88=B6=E6=96=87=E4=BB=B6=EF=BC=8C=E6=AF=8F=E4=B8=AA?= =?UTF-8?q?=E7=AF=87=E7=AB=A0=E5=BD=92=E4=B8=BA=E5=8D=95=E6=96=87=E4=BB=B6?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 将 11 个目录下的 26 个子章节文件合并到对应的父文件中, 用 --- 分隔各子章节,移除冗余的章节目录索引。 每个篇章现在是独立的单文件,结构更简洁。 Co-Authored-By: Claude Opus 4.7 --- 01-introduction/00.1-ai-overview.md | 150 ----- 01-introduction/00.2-ai-paradigm.md | 226 ------- 01-introduction/01-introduction.md | 388 ++++++++++- 02-foundations/01.1-math-foundation.md | 165 ----- 02-foundations/01.2-mlp-basics.md | 221 ------- 02-foundations/01.3-programming.md | 226 ------- 02-foundations/02-foundations.md | 616 +++++++++++++++++- 03-computer-vision/02.1-cnn-foundation.md | 145 ----- 03-computer-vision/02.2-object-detection.md | 168 ----- .../02.3-semantic-segmentation.md | 136 ---- 03-computer-vision/03-computer-vision.md | 459 ++++++++++++- 04-transformer/03.1-attention.md | 156 ----- 04-transformer/03.2-transformer.md | 157 ----- 04-transformer/03.3-llm-application.md | 166 ----- 04-transformer/04-transformer.md | 487 +++++++++++++- 05-generative-ai/04.1-diffusion.md | 151 ----- 05-generative-ai/04.2-aigc-tools.md | 180 ----- 05-generative-ai/05-generative-ai.md | 339 +++++++++- 06-agent/05.1-agent-architecture.md | 148 ----- 06-agent/05.2-embodied-ai.md | 157 ----- 06-agent/05.3-design-application.md | 215 ------ 06-agent/06-agent.md | 530 ++++++++++++++- 07-digital-media/07-digital-media.md | 152 ++++- 07-digital-media/ch16-visual-design-aigc.md | 72 -- 07-digital-media/ch17-interaction-design.md | 76 --- .../08-environmental-design.md | 144 +++- .../ch18-interior-design.md | 62 -- .../ch19-landscape-design.md | 78 --- 09-industrial-design/09-industrial-design.md | 136 +++- 09-industrial-design/ch20-product-design.md | 54 -- .../ch21-design-optimization.md | 78 --- 10-urban-design/10-urban-design.md | 152 ++++- .../ch22-urban-spatial-analysis.md | 58 -- 10-urban-design/ch23-planning-evaluation.md | 90 --- 11-ecological-design/11-ecological-design.md | 134 +++- .../ch24-ecological-analysis.md | 62 -- .../ch25-ecological-planning.md | 68 -- 37 files changed, 3421 insertions(+), 3581 deletions(-) delete mode 100644 01-introduction/00.1-ai-overview.md delete mode 100644 01-introduction/00.2-ai-paradigm.md delete mode 100644 02-foundations/01.1-math-foundation.md delete mode 100644 02-foundations/01.2-mlp-basics.md delete mode 100644 02-foundations/01.3-programming.md delete mode 100644 03-computer-vision/02.1-cnn-foundation.md delete mode 100644 03-computer-vision/02.2-object-detection.md delete mode 100644 03-computer-vision/02.3-semantic-segmentation.md delete mode 100644 04-transformer/03.1-attention.md delete mode 100644 04-transformer/03.2-transformer.md delete mode 100644 04-transformer/03.3-llm-application.md delete mode 100644 05-generative-ai/04.1-diffusion.md delete mode 100644 05-generative-ai/04.2-aigc-tools.md delete mode 100644 06-agent/05.1-agent-architecture.md delete mode 100644 06-agent/05.2-embodied-ai.md delete mode 100644 06-agent/05.3-design-application.md delete mode 100644 07-digital-media/ch16-visual-design-aigc.md delete mode 100644 07-digital-media/ch17-interaction-design.md delete mode 100644 08-environmental-design/ch18-interior-design.md delete mode 100644 08-environmental-design/ch19-landscape-design.md delete mode 100644 09-industrial-design/ch20-product-design.md delete mode 100644 09-industrial-design/ch21-design-optimization.md delete mode 100644 10-urban-design/ch22-urban-spatial-analysis.md delete mode 100644 10-urban-design/ch23-planning-evaluation.md delete mode 100644 11-ecological-design/ch24-ecological-analysis.md delete mode 100644 11-ecological-design/ch25-ecological-planning.md diff --git a/01-introduction/00.1-ai-overview.md b/01-introduction/00.1-ai-overview.md deleted file mode 100644 index bf74286..0000000 --- a/01-introduction/00.1-ai-overview.md +++ /dev/null @@ -1,150 +0,0 @@ - -## 学习目标 - -了解AI技术发展的关键时间节点 - -理解AI四大赛道及其应用场景 - -掌握设计领域AI应用的现状与趋势 - -# Amazon Go:AI赋能的典型案例 - -## 案例背景 - -Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。 - -## 技术要素 - -Amazon Go的AI技术栈融合了多项前沿技术: - - -------------------------------------------------- - 技术 作用 应用场景 - ------------ ---------------- -------------------- - 5G通信 低延迟数据传输 实时视频流处理 - - 3D传感器 深度信息获取 空间定位与手势识别 - - 计算机视觉 图像理解 商品识别、行为分析 - - 传感器融合 多源数据整合 精确定位与跟踪 - -------------------------------------------------- - -## 启示 - -Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走",AI让交互变得更加自然。 - -# AI赋能的时间线:2016-2024 - -## 第一阶段:觉醒期 (2016-2018) - -**2016**:AlphaGo击败李世石,AI进入公众视野 - -**2017**:Transformer架构诞生,为大模型时代奠基 - -**2018**:BERT预训练模型问世,NLP任务取得突破 - -## 第二阶段:爆发期 (2019-2022) - -**2019**:GPT-2展示强大的文本生成能力 - -**2020**:GPT-3发布,少样本学习能力震惊业界 - -**2022**:ChatGPT发布,AI对话能力达到新高度 - -## 第三阶段:应用期 (2023-2024) - -**2023**:多模态大模型、AI Agent概念兴起 - -**2024**:具身智能、端侧AI加速落地 - -# AI四大赛道 - -## 1. AIGC (AI-Generated Content) - -**定义**:人工智能生成内容 - -**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效 - -**设计影响**:从"工具辅助"到"生成伙伴" - -## 2. Agent (智能体) - -**定义**:能够自主感知、规划、执行的系统 - -**核心能力**: - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源 - -**设计影响**:从"被动执行"到"主动协作" - -## 3. AI4S (AI for Science) - -**定义**:AI驱动科学发现 - -**应用领域**: - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化 - -**设计影响**:数据驱动的设计决策 - -## 4. AIED (AI in Education) - -**定义**:AI在教育领域的应用 - -**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建 - -**设计影响**:设计教育与人才培养模式变革 - -# 设计领域AI应用趋势 - -## 当前应用 - - ---------------------------------------- - 领域 AI应用 成熟度 - ---------- -------------------- -------- - 建筑设计 图纸生成、方案优化 中 - - 景观设计 场地分析、植被配置 中 - - 室内设计 家具布局、风格迁移 高 - - 平面设计 Logo生成、排版辅助 高 - - 交互设计 用户研究、原型生成 低 - ---------------------------------------- - -## 未来趋势 - -1.**从单点工具到系统化解决方案** - -2.**从生成内容到生成决策** - -3.**从人机协作到人机共生** - -# 思考与练习 - -1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力 - -2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么? - -3.Amazon Go案例中,哪些AI技术可以迁移到设计领域? - -# 关键术语 - - -------------------------------------------------------- - 中文 英文 说明 - ----------------- --------------- ---------------------- - 生成式AI AIGC AI-Generated Content - - 智能体 Agent 自主决策系统 - - AI for Science AI4S AI驱动科学研究 - - AI in Education AIED AI教育应用 - - 传感器融合 Sensor Fusion 多传感器数据整合 - -------------------------------------------------------- - -# 延伸阅读 - -[Amazon Go技术解析](https://amazon.go/technology) - -[AIGC产业发展报告](https://www.caict.ac.cn/) - -[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进 diff --git a/01-introduction/00.2-ai-paradigm.md b/01-introduction/00.2-ai-paradigm.md deleted file mode 100644 index ed76512..0000000 --- a/01-introduction/00.2-ai-paradigm.md +++ /dev/null @@ -1,226 +0,0 @@ - -# 学习目标 - -理解AI范式的三次演进 - -掌握万能逼近定理的直观意义 - -建立神经网络技术栈的完整认知 - -理解Scaling Law与模型规模效应 - -# AI范式的三次演进 - -## 第一范式:规则系统 (Symbolic AI) - -**时期**:1950s - 1980s - -**核心思想**:人类专家编写规则 - -**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱 - -**典型应用**:专家系统、棋类游戏 - -## 第二范式:机器学习 (Machine Learning) - -**时期**:1990s - 2010s - -**核心思想**:从数据中学习规律 - -**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定 - -**典型应用**:推荐系统、图像分类、语音识别 - -## 第三范式:深度学习 (Deep Learning) - -**时期**:2012 - 至今 - -**核心思想**:端到端学习,自动提取特征 - -**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强 - -**典型应用**:大语言模型、生成式AI、自动驾驶 - -# 万能逼近定理 - -## 定理表述 - -**Universal Approximation Theorem (1989)**: - -一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。 - -## 直观理解 - -想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面 - -## 启示 - -这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。 - -这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。 - -# 神经网络技术栈全景 - -`┌─────────────────────────────────────────────────────────────┐`\ -`│ ``应用层`` │`\ -`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\ -`├─────────────────────────────────────────────────────────────┤`\ -`│ ``模型层`` │`\ -`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\ -`├─────────────────────────────────────────────────────────────┤`\ -`│ ``算法层`` │`\ -`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\ -`├─────────────────────────────────────────────────────────────┤`\ -`│ ``数学层`` │`\ -`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\ -`└─────────────────────────────────────────────────────────────┘` - -## 技术演进路径 - - ------------------------------------------ - 时代 代表技术 突破点 - ------- ------------- -------------------- - 1980s MLP 万能逼近定理 - - 1990s CNN 局部连接、权重共享 - - 2000s RNN/LSTM 序列建模 - - 2010s GNN 图结构数据 - - 2017 Transformer Self-Attention - - 2020s Diffusion 生成质量突破 - ------------------------------------------ - -## 模型家族关系 - -`MLP (``多层感知机``)`\ -` │`\ -` ┌──────────────┼──────────────┐`\ -` │ │ │`\ -` CNN GNN RNN`\ -` (``空间数据``) (``图数据``) (``序列数据``)`\ -` │ │ │`\ -` └──────────────┼──────────────┘`\ -` │`\ -` Transformer`\ -` │`\ -` ┌──────────────┼──────────────┐`\ -` │ │ │`\ -` GPT``系列`` BERT Diffusion`\ -` (``生成式``) (``理解式``) (``图像生成``)` - -# Scaling Law:规模即智能 - -## 什么是Scaling Law - -Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系: - -**模型性能 ≈ f(计算量, 数据量, 参数量)** - -## 核心发现 - -### 1.性能随规模对数增长 - -o模型越大,性能越好 - -o增长是可预测的 - -#### 2.计算效率最关键 - -o计算量增加10倍 → 性能提升约1.5倍 - -o数据量和参数量也有类似规律 - -#### 3.没有看到天花板 - -o在现有规模下,性能提升仍在继续 - -### 启示 - -**大模型时代**:规模成为竞争壁垒 - -**数据为王**:高质量数据比模型架构更重要 - -**算力需求**:AI发展依赖硬件进步 - -从函数式视角看AI演进 - -### 核心理念 - -**"Functions Describe the World"(函数描述世界)** - -物理定律:F = ma - -经济规律:Supply = Demand(Price) - -神经网络:y = f(x; θ) - -### AI即函数组合 - -`输入数据`` x`\ -` │`\ -` ▼`\ -`┌─────────┐`\ -`│ f₁(x) │ ``第一层函数:特征提取`\ -`└─────────┘`\ -` │`\ -` ▼`\ -`┌─────────┐`\ -`│ f₂(h) │ ``第二层函数:模式识别`\ -`└─────────┘`\ -` │`\ -` ▼`\ -`┌─────────┐`\ -`│ f₃(z) │ ``第三层函数:决策输出`\ -`└─────────┘`\ -` │`\ -` ▼`\ -`输出`` y` - -从Excel到神经网络 - - ------------------------------------ - Excel 神经网络 - --------------------- -------------- - y = ax + b 单层感知机 - - y = a₁x₁ + a₂x₂ + b 多输入神经元 - - 嵌套IF函数 多层网络 - - 宏函数 自动微分 - ------------------------------------ - -## 思考与练习 - -1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么? - -2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡? - -3.从函数式视角理解AI,对你理解设计问题有何启发? - -## 关键术语 - - ------------------------------------------------------------------------------------- - 中文 英文 说明 - ---------------------- --------------------------------- ---------------------------- - 万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证 - - 缩放定律 Scaling Law 模型性能与规模的关系 - - 前馈网络 Feed-Forward Network 信息单向传播的神经网络 - - 多层感知机 MLP Multi-Layer Perceptron - - 端到端学习 End-to-End Learning 从输入直接学习到输出 - ------------------------------------------------------------------------------------- - -## 延伸阅读 - -[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) - -[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem) - -[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x) diff --git a/01-introduction/01-introduction.md b/01-introduction/01-introduction.md index ba9bc69..9e5adec 100644 --- a/01-introduction/01-introduction.md +++ b/01-introduction/01-introduction.md @@ -1,6 +1,6 @@ # 第一篇:导论 -本篇建立读者对人工智能的宏观认知,介绍AI的发展历程和范式演进,帮助读者理解AI技术的全貌和发展趋势。 +本篇作为全书的开篇,旨在帮助读者建立对人工智能的宏观认知框架。我们将从AI的发展历程出发,回顾从早期符号主义到深度学习、再到大模型时代的关键技术突破与转折节点;进而梳理AI的范式演进,从感知智能到生成式智能、从单一任务到通用智能的发展脉络,帮助读者理解AI技术的全貌和未来趋势。这一宏观视角的建立,将为后续各篇中AI与设计实践的结合提供必要的技术认知基础。 ## 篇章导读 @@ -10,42 +10,382 @@ 通过本篇学习,你将建立对AI的宏观认知,理解技术发展的脉络,为后续深入学习打下基础。 -## 章节目录 - -[00.1 AI发展历程](00.1-ai-overview.md) - 从Amazon Go到AI赋能 - -[00.2 AI范式演进](00.2-ai-paradigm.md) - 技术栈全景与发展趋势 +--- ## 学习目标 -完成本篇后,你将能够: +了解AI技术发展的关键时间节点 -描述AI发展的关键节点和技术突破 +理解AI四大赛道及其应用场景 -理解AI四大赛道的区别和应用场景 +掌握设计领域AI应用的现状与趋势 -掌握神经网络技术家族的演进脉络 +# Amazon Go:AI赋能的典型案例 -建立AI技术栈的完整认知框架 +## 案例背景 -## 核心概念 +Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。 - ------------------------------------------------------------------ - 概念 英文 说明 - ----------------- ------- ---------------------------------------- - 生成式AI AIGC AI-Generated Content,人工智能生成内容 +## 技术要素 - 智能体 Agent 能够自主感知、决策和行动的系统 +Amazon Go的AI技术栈融合了多项前沿技术: - AI for Science AI4S AI驱动科学发现 + -------------------------------------------------- + 技术 作用 应用场景 + ------------ ---------------- -------------------- + 5G通信 低延迟数据传输 实时视频流处理 - AI in Education AIED AI在教育领域的应用 - ------------------------------------------------------------------ + 3D传感器 深度信息获取 空间定位与手势识别 -## 延伸思考 + 计算机视觉 图像理解 商品识别、行为分析 -1.AI技术发展呈现加速趋势,这对设计行业意味着什么? + 传感器融合 多源数据整合 精确定位与跟踪 + -------------------------------------------------- -2.在AIGC、Agent、AI4S、AIED四个方向中,你认为哪个对设计领域影响最大? +## 启示 -3.了解AI技术演进后,你认为设计师应该掌握哪些AI相关技能? \# 00.1 AI发展历程 +Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走",AI让交互变得更加自然。 + +# AI赋能的时间线:2016-2024 + +## 第一阶段:觉醒期 (2016-2018) + +**2016**:AlphaGo击败李世石,AI进入公众视野 + +**2017**:Transformer架构诞生,为大模型时代奠基 + +**2018**:BERT预训练模型问世,NLP任务取得突破 + +## 第二阶段:爆发期 (2019-2022) + +**2019**:GPT-2展示强大的文本生成能力 + +**2020**:GPT-3发布,少样本学习能力震惊业界 + +**2022**:ChatGPT发布,AI对话能力达到新高度 + +## 第三阶段:应用期 (2023-2024) + +**2023**:多模态大模型、AI Agent概念兴起 + +**2024**:具身智能、端侧AI加速落地 + +# AI四大赛道 + +## 1. AIGC (AI-Generated Content) + +**定义**:人工智能生成内容 + +**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效 + +**设计影响**:从"工具辅助"到"生成伙伴" + +## 2. Agent (智能体) + +**定义**:能够自主感知、规划、执行的系统 + +**核心能力**: - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源 + +**设计影响**:从"被动执行"到"主动协作" + +## 3. AI4S (AI for Science) + +**定义**:AI驱动科学发现 + +**应用领域**: - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化 + +**设计影响**:数据驱动的设计决策 + +## 4. AIED (AI in Education) + +**定义**:AI在教育领域的应用 + +**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建 + +**设计影响**:设计教育与人才培养模式变革 + +# 设计领域AI应用趋势 + +## 当前应用 + + ---------------------------------------- + 领域 AI应用 成熟度 + ---------- -------------------- -------- + 建筑设计 图纸生成、方案优化 中 + + 景观设计 场地分析、植被配置 中 + + 室内设计 家具布局、风格迁移 高 + + 平面设计 Logo生成、排版辅助 高 + + 交互设计 用户研究、原型生成 低 + ---------------------------------------- + +## 未来趋势 + +1.**从单点工具到系统化解决方案** + +2.**从生成内容到生成决策** + +3.**从人机协作到人机共生** + +# 思考与练习 + +1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力 + +2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么? + +3.Amazon Go案例中,哪些AI技术可以迁移到设计领域? + +# 关键术语 + + -------------------------------------------------------- + 中文 英文 说明 + ----------------- --------------- ---------------------- + 生成式AI AIGC AI-Generated Content + + 智能体 Agent 自主决策系统 + + AI for Science AI4S AI驱动科学研究 + + AI in Education AIED AI教育应用 + + 传感器融合 Sensor Fusion 多传感器数据整合 + -------------------------------------------------------- + +# 延伸阅读 + +[Amazon Go技术解析](https://amazon.go/technology) + +[AIGC产业发展报告](https://www.caict.ac.cn/) + +[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进 + +--- + +# 学习目标 + +理解AI范式的三次演进 + +掌握万能逼近定理的直观意义 + +建立神经网络技术栈的完整认知 + +理解Scaling Law与模型规模效应 + +# AI范式的三次演进 + +## 第一范式:规则系统 (Symbolic AI) + +**时期**:1950s - 1980s + +**核心思想**:人类专家编写规则 + +**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱 + +**典型应用**:专家系统、棋类游戏 + +## 第二范式:机器学习 (Machine Learning) + +**时期**:1990s - 2010s + +**核心思想**:从数据中学习规律 + +**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定 + +**典型应用**:推荐系统、图像分类、语音识别 + +## 第三范式:深度学习 (Deep Learning) + +**时期**:2012 - 至今 + +**核心思想**:端到端学习,自动提取特征 + +**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强 + +**典型应用**:大语言模型、生成式AI、自动驾驶 + +# 万能逼近定理 + +## 定理表述 + +**Universal Approximation Theorem (1989)**: + +一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。 + +## 直观理解 + +想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面 + +## 启示 + +这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。 + +这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。 + +# 神经网络技术栈全景 + +`┌─────────────────────────────────────────────────────────────┐`\ +`│ ``应用层`` │`\ +`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``模型层`` │`\ +`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``算法层`` │`\ +`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``数学层`` │`\ +`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\ +`└─────────────────────────────────────────────────────────────┘` + +## 技术演进路径 + + ------------------------------------------ + 时代 代表技术 突破点 + ------- ------------- -------------------- + 1980s MLP 万能逼近定理 + + 1990s CNN 局部连接、权重共享 + + 2000s RNN/LSTM 序列建模 + + 2010s GNN 图结构数据 + + 2017 Transformer Self-Attention + + 2020s Diffusion 生成质量突破 + ------------------------------------------ + +## 模型家族关系 + +`MLP (``多层感知机``)`\ +` │`\ +` ┌──────────────┼──────────────┐`\ +` │ │ │`\ +` CNN GNN RNN`\ +` (``空间数据``) (``图数据``) (``序列数据``)`\ +` │ │ │`\ +` └──────────────┼──────────────┘`\ +` │`\ +` Transformer`\ +` │`\ +` ┌──────────────┼──────────────┐`\ +` │ │ │`\ +` GPT``系列`` BERT Diffusion`\ +` (``生成式``) (``理解式``) (``图像生成``)` + +# Scaling Law:规模即智能 + +## 什么是Scaling Law + +Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系: + +**模型性能 ≈ f(计算量, 数据量, 参数量)** + +## 核心发现 + +### 1.性能随规模对数增长 + +o模型越大,性能越好 + +o增长是可预测的 + +#### 2.计算效率最关键 + +o计算量增加10倍 → 性能提升约1.5倍 + +o数据量和参数量也有类似规律 + +#### 3.没有看到天花板 + +o在现有规模下,性能提升仍在继续 + +### 启示 + +**大模型时代**:规模成为竞争壁垒 + +**数据为王**:高质量数据比模型架构更重要 + +**算力需求**:AI发展依赖硬件进步 + +从函数式视角看AI演进 + +### 核心理念 + +**"Functions Describe the World"(函数描述世界)** + +物理定律:F = ma + +经济规律:Supply = Demand(Price) + +神经网络:y = f(x; θ) + +### AI即函数组合 + +`输入数据`` x`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₁(x) │ ``第一层函数:特征提取`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₂(h) │ ``第二层函数:模式识别`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₃(z) │ ``第三层函数:决策输出`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`输出`` y` + +从Excel到神经网络 + + ------------------------------------ + Excel 神经网络 + --------------------- -------------- + y = ax + b 单层感知机 + + y = a₁x₁ + a₂x₂ + b 多输入神经元 + + 嵌套IF函数 多层网络 + + 宏函数 自动微分 + ------------------------------------ + +## 思考与练习 + +1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么? + +2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡? + +3.从函数式视角理解AI,对你理解设计问题有何启发? + +## 关键术语 + + ------------------------------------------------------------------------------------- + 中文 英文 说明 + ---------------------- --------------------------------- ---------------------------- + 万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证 + + 缩放定律 Scaling Law 模型性能与规模的关系 + + 前馈网络 Feed-Forward Network 信息单向传播的神经网络 + + 多层感知机 MLP Multi-Layer Perceptron + + 端到端学习 End-to-End Learning 从输入直接学习到输出 + ------------------------------------------------------------------------------------- + +## 延伸阅读 + +[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) + +[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem) + +[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x) diff --git a/02-foundations/01.1-math-foundation.md b/02-foundations/01.1-math-foundation.md deleted file mode 100644 index adf403e..0000000 --- a/02-foundations/01.1-math-foundation.md +++ /dev/null @@ -1,165 +0,0 @@ - -### 学习目标 - -理解"Functions Describe the World"的核心理念 - -掌握从Excel到神经网络的演进逻辑 - -理解函数组合与层级抽象的思想 - -### 核心理念:函数描述世界 - -#### 从物理定律说起 - -物理学用简洁的函数描述复杂现象: - - ---------------------------------- - 现象 函数 发现者 - ---------- -------------- -------- - 自由落体 h = ½gt² 伽利略 - - 万有引力 F = Gm₁m₂/r² 牛顿 - - 电磁感应 ε = -dΦ/dt 法拉第 - ---------------------------------- - -这些函数的共同特点:**用数学关系描述客观规律** - -#### AI的函数观 - -AI延续了这一传统:**用函数从数据中学习规律** - -`数据`` → ``函数`` → ``预测``/``决策`\ -` x → f(x) → y` - -从Excel到神经网络 - -线性回归:y = ax + b - -在Excel中,我们经常做线性拟合: - -`房价`` ≈ 0.015 × ``面积`` + 50``万`\ -` y = a × x + b` - -这就是一个最简单的"AI模型":**单变量线性函数** - -多元回归:y = a₁x₁ + a₂x₂ + ... + b - -增加更多特征: - -`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万` - -这就是**单层神经元**的数学形式! - -函数组合:层级嵌套 - -现实世界的关系往往是非线性的,需要函数组合: - -`h₁ = f₁(x) # ``第一层:提取特征` - -`h₂ = f₂(h₁) # ``第二层:组合特征` - -`y = f₃(h₂) # ``第三层:输出结果` - -这就是**多层神经网络**的本质! - -### 函数组合的威力 - -为什么需要多层? - -**单层函数**只能学习简单的线性关系 - -**多层函数**可以学习任意复杂的非线性关系 - -直观例子:识别圆形 - -`输入:像素点灰度值`\ -` ↓`\ -`第一层:检测边缘(梯度变化)`\ -` ↓`\ -`第二层:组合边缘成弧线`\ -` ↓`\ -`第三层:判断是否闭合`` → ``圆形` - -每一层都是一个函数,层层组合形成复杂能力。 - -### 数据驱动 vs 规则驱动 - -#### 规则驱动 - -`# ``传统编程:人工编写规则`\ -`def`` ``is_circle``(image):`\ -` edges ``=`` ``detect_edges``(image)`\ -` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\ -` ``return`` ``True`\ -` ``return`` ``False` - -**问题**:规则难以穷举,无法处理复杂情况 - -#### 数据驱动 - -`# AI``:从数据中学习函数`\ -`f ``=`` ``neural_network``()`\ -`train(f, ``thousands_of_examples``)`\ -`result ``=`` f(``new_image``) ``# ``自动判断` - -**优势**:自动发现规律,适应复杂情况 - -### 神经网络的函数本质 - -数学表示 - -一个L层神经网络: - -`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))` - -其中每一层: - -`h = ``σ(``Wx`` + b)` - -W:权重矩阵(可学习参数) - -b:偏置向量(可学习参数) - -σ:激活函数(引入非线性) - -#### 视觉理解 - -`输入层`` ``隐藏层`` ``输出层`\ -` x ``h₁,h₂,h``₃ y`\ -` ● ──────────→ ○ ──────────→ ●`\ -` │ ○ │`\ -` ● ──────────→ ○ ──────────→ ●`\ -` │ ○ │`\ -` ● ──────────→ ○ ──────────→ ●`\ -` ``权重``W₁ ``权重``W₂` - -箭头上的权重就是函数的参数,通过学习自动确定。 - -### 思考与练习 - -1.列举3个日常生活中"用函数描述世界"的例子 - -2.为什么单层函数无法学习异或(XOR)问题? - -3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决? - -### 关键术语 - - ------------------------------------------------------------ - 中文 英文 说明 - ---------- --------------------- --------------------------- - 线性回归 Linear Regression y = ax + b 形式的函数拟合 - - 多元回归 Multiple Regression 多输入变量的线性模型 - - 权重 Weight 神经网络中的可学习参数 - - 偏置 Bias 调整输出基准的参数 - - 非线性 Non-linearity 无法用直线表示的关系 - ------------------------------------------------------------ - -### 延伸阅读 - -[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍 diff --git a/02-foundations/01.2-mlp-basics.md b/02-foundations/01.2-mlp-basics.md deleted file mode 100644 index 41ed0b8..0000000 --- a/02-foundations/01.2-mlp-basics.md +++ /dev/null @@ -1,221 +0,0 @@ - -### 学习目标 - -理解MLP的基本结构 - -掌握前向传播的计算过程 - -了解激活函数的作用和类型 - -理解反向传播的基本思想 - -### MLP结构 - -#### 什么是MLP - -**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。 - -网络架构 - -`输入层`` ``隐藏层`` ``输出层`\ -` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\ -` │ x₁ │ │ h₁ │ │ y₁ │`\ -` │ x₂ │───→│ h₂ │───→│ y₂ │`\ -` │ x₃ │ │ h₃ │ │ y₃ │`\ -` │ ... │ │ ... │ │ ... │`\ -` │ xₙ │ │ hₘ │ │ yₖ │`\ -` └─────────┘ └─────────────┘ └─────────┘`\ -` │ │ │`\ -` └───────────────┴────────────────┘`\ -` ``全连接(每个神经元相连)` - -#### 层次说明 - - ---------------------------------------- - 层类型 作用 神经元数量 - -------- ---------------- -------------- - 输入层 接收原始数据 取决于特征数 - - 隐藏层 特征变换与组合 自由设计 - - 输出层 产生最终结果 取决于任务 - ---------------------------------------- - -### 前向传播 - -#### 单个神经元 - -`# ``线性部分`\ -`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\ -\ -`# ``激活函数`\ -`h ``=`` σ(z)` - -#### 完整网络 - -对于L层网络: - -`# ``第``1``层` - -`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)` - -`# ``第``2``层` - -`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)` - -`# ...` - -`# ``第``L``层` - - y = σₗ(Wₗh_{l-1} + bₗ) - -#### 数据流动 - -`输入向量`` x₀`\ -` │`\ -` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\ -` │ │`\ -` │ └─→ σ₁(z₁) = h₁`\ -` │ │`\ -` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\ -` │ │`\ -` └─→ σ₂(z₂) = h₂`\ -` │`\ -` └─→ ... → y` - -### 激活函数 - -#### 为什么需要激活函数? - -没有激活函数,多层网络就等价于单层线性变换: - -`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x` - -激活函数引入**非线性**,使网络能够学习复杂模式。 - -#### 常用激活函数 - - -------------------------------------------------------------------- - 激活函数 公式 特点 应用场景 - ---------- ----------------------------- ------------ -------------- - Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层 - - ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选 - - Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层 - - Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络 - -------------------------------------------------------------------- - -#### 视觉对比 - -`ReLU``: Sigmoid: Tanh:`\ -` ↑ ___ ___`\ -` │ / ╲`\ -` │ / ╲`\ -` │____ / ╲___`\ -` │ ______ / │`\ -` └──────── / └──`\ -` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞` - -### 损失函数与优化 - -#### 损失函数 - -损失函数衡量模型预测与真实值的差距: - - --------------------------------------- - 任务 损失函数 公式 - -------- ---------- ------------------- - 回归 均方误差 MSE = Σ(ŷ-y)²/n - - 二分类 交叉熵 CE = -y·log(ŷ) - - 多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ) - --------------------------------------- - -#### 优化目标 - -`最小化损失函数:`\ -`min L(f(x; θ), y)`\ -\ -`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数` - -#### 梯度下降 - -`重复直到收敛:`\ -` θ = θ - α·∇L(θ)`\ -\ -`其中:`\ -` θ``:参数`\ -` α``:学习率`\ -` ∇L(θ)``:损失函数的梯度` - -### 反向传播 - -核心思想 - -从输出层向输入层反向计算梯度: - -`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差` - -链式法则 - -`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\ -` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)` - -直观理解 - -1.**前向传播**:计算每个神经元的输出 - -2.**计算误差**:比较输出与真实值 - -3.**反向传播**:将误差反向传递 - -4.**更新权重**:根据误差调整参数 - -### MLP vs 传统模型 - - -------------------------------------- - 特性 MLP 传统机器学习 - ------------ ---------- -------------- - 特征工程 自动学习 人工设计 - - 非线性能力 强 中/弱 - - 数据需求 大量 中等 - - 可解释性 低 高 - - 训练时间 长 短 - -------------------------------------- - -### 思考与练习 - -1.为什么隐藏层越多,网络表达能力越强? - -2.ReLU为什么比Sigmoid更适合隐藏层? - -3.如果所有权重初始化为0,会发生什么? - -### 关键术语 - - ---------------------------------------------------------- - 中文 英文 说明 - ---------- ------------------ ---------------------------- - 前向传播 Forward Pass 数据从输入到输出的计算过程 - - 反向传播 Backpropagation 计算梯度的算法 - - 损失函数 Loss Function 衡量预测误差的函数 - - 梯度下降 Gradient Descent 优化算法 - - 学习率 Learning Rate 参数更新的步长 - ---------------------------------------------------------- - -### 延伸阅读 - -[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html) - -[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding diff --git a/02-foundations/01.3-programming.md b/02-foundations/01.3-programming.md deleted file mode 100644 index 738e3ba..0000000 --- a/02-foundations/01.3-programming.md +++ /dev/null @@ -1,226 +0,0 @@ - -## 学习目标 - -掌握Python AI开发环境配置 - -了解核心科学计算库 - -理解Vibe Coding的AI辅助编程新模式 - -### Python环境配置 - -#### Anaconda vs Miniconda - - ----------------------------------------------- - 工具 大小 特点 适用场景 - ----------- --------- ------------ ------------ - Anaconda \~500MB 预装常用库 初学者推荐 - - Miniconda \~50MB 仅含conda 精简安装 - ----------------------------------------------- - -#### 安装步骤 - -##### 1.下载安装 - -o访问 https://www.anaconda.com/download - -o选择Python 3.x版本 - -o按提示安装 - -##### 2.创建虚拟环境 - -`conda`` create ``-n`` ai-env python=3.10`\ -`conda`` activate ai-env` - -##### 3.安装核心库 - -`conda`` install ``numpy`` pandas ``scipy`\ -`pip`` install torch ``torchvision` - -### 核心科学计算库 - -#### NumPy:数值计算基础 - -`import`` ``numpy`` ``as`` np`\ -\ -`# ``创建数组`\ -`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\ -\ -`# ``矩阵运算`\ -`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\ -`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\ -\ -`# ``激活函数`\ -`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU` - -#### Pandas:数据处理 - -`import`` pandas ``as`` pd`\ -\ -`# ``读取数据`\ -`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\ -\ -`# ``数据清洗`\ -`df`` ``=`` ``df.dropna``()`\ -`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\ -\ -`# ``统计分析`\ -`df.describe``()` - -#### SciPy:科学计算 - -`from`` ``scipy`` ``import`` optimize`\ -`from`` ``scipy.spatial`` ``import`` distance`\ -\ -`# ``优化问题`\ -`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\ -\ -`# ``距离计算`\ -`dist`` ``=`` ``distance.euclidean``(point1, point2)` - -### 开发工具选择 - -#### VSCode - -**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快 - -**AI开发常用插件**: - Python - Jupyter - Pylance - Copilot - -## Cursor - -**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程 - -**使用场景**: - 快速原型开发 - 代码重构 - 学习新API - -## Jupyter Notebook - -**特点**: - 交互式编程 - 可视化友好 - 文档即代码 - -**使用场景**: - 数据探索 - 算法实验 - 教学演示 - -# Vibe Coding:AI辅助编程 - -## 什么是Vibe Coding - -传统编程:**明确需求 → 设计算法 → 编写代码** - -Vibe Coding:**模糊想法 → AI辅助 → 迭代完善** - -## 工作流程 - -### 1. 描述意图(自然语言) - -`"``帮我创建一个简单的神经网络``"` - -### - -`2. AI``生成代码` - -### → 自动生成完整代码框架 - -`3. ``运行测试` - -`→ ``发现问题或需要调整` - -`4. ``迭代优化` - -`"``把隐藏层改成``128``个神经元``"` - -`→ AI``自动修改代码` - -`5. ``理解学习` - - → 阅读AI生成的代码,学习最佳实践 - -## 实践技巧 - - --------------------------------- - 技巧 说明 - ---------- ---------------------- - 明确需求 详细描述输入输出 - - 分步实现 复杂功能拆解为小任务 - - 验证结果 检查生成的代码 - - 学习思考 理解AI为什么这样写 - --------------------------------- - -## 工具推荐 - - -------------------------------------------- - 工具 特点 适用场景 - ---------------- ---------------- ---------- - GitHub Copilot 代码补全 日常开发 - - Cursor 对话式编程 快速原型 - - ChatGPT/Claude 代码生成与解释 学习咨询 - - Replit Agent 端到端开发 小型项目 - -------------------------------------------- - -## 开发工作流 - -项目结构 - -`project/`\ -`├── data/ # ``数据文件`\ -`├── notebooks/ # ``Jupyter``笔记本`\ -`├── ``src``/ # ``源代码`\ -`│ ├── models/ # ``模型定义`\ -`│ ├── utils/ # ``工具函数`\ -`│ └── train.py # ``训练脚本`\ -`├── requirements.txt # ``依赖列表`\ -`└── README.md # ``项目说明` - -### 典型工作流 - -`# 1. ``创建环境`\ -`conda`` create ``-n`` ``myproject`` python=3.10`\ -`conda`` activate ``myproject`\ -\ -`# 2. ``安装依赖`\ -`pip`` install ``-r`` requirements.txt`\ -\ -`# 3. ``开发迭代`\ -`# - ``在``notebook``中实验`\ -`# - ``整理到``src``/``目录`\ -`# - ``运行测试`\ -\ -`# 4. ``保存环境`\ -`conda`` env export ``>`` ``environment.yml` - -## 思考与练习 - -1.对比Anaconda和Miniconda,什么时候该用哪个? - -2.尝试用Cursor/Copilot生成一个简单的神经网络代码 - -3.Vibe Coding如何改变传统的编程学习方式? - -## 关键术语 - - ----------------------------------------------------------- - 中文 英文 说明 - ---------- ----------------------- ------------------------ - 虚拟环境 Virtual Environment 隔离的Python运行环境 - - 依赖管理 Dependency Management 管理项目所需的库 - - 代码补全 Code Completion 自动补全正在输入的代码 - - 原型开发 Prototyping 快速构建可运行版本 - - 迭代优化 Iterative Refinement 逐步改进代码 - ----------------------------------------------------------- - -## 延伸阅读 - -[Anaconda官方文档](https://docs.anaconda.com/) - -[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html) - -[Cursor使用指南](https://cursor.com/docs) diff --git a/02-foundations/02-foundations.md b/02-foundations/02-foundations.md index dd1b01e..61cef75 100644 --- a/02-foundations/02-foundations.md +++ b/02-foundations/02-foundations.md @@ -10,40 +10,620 @@ 本篇将: - 从函数式视角理解AI - 介绍多层感知机的基本原理 - 讲解Python编程工具和AI辅助编程 -## 章节目录 +--- -[01.1 函数式AI视角](01.1-math-foundation.md) - "Functions Describe the World" +### 学习目标 -[01.2 多层感知机](01.2-mlp-basics.md) - MLP结构与原理 +理解"Functions Describe the World"的核心理念 -[01.3 编程工具与Vibe Coding](01.3-programming.md) - Python环境与AI辅助编程 +掌握从Excel到神经网络的演进逻辑 + +理解函数组合与层级抽象的思想 + +### 核心理念:函数描述世界 + +#### 从物理定律说起 + +物理学用简洁的函数描述复杂现象: + + ---------------------------------- + 现象 函数 发现者 + ---------- -------------- -------- + 自由落体 h = ½gt² 伽利略 + + 万有引力 F = Gm₁m₂/r² 牛顿 + + 电磁感应 ε = -dΦ/dt 法拉第 + ---------------------------------- + +这些函数的共同特点:**用数学关系描述客观规律** + +#### AI的函数观 + +AI延续了这一传统:**用函数从数据中学习规律** + +`数据`` → ``函数`` → ``预测``/``决策`\ +` x → f(x) → y` + +从Excel到神经网络 + +线性回归:y = ax + b + +在Excel中,我们经常做线性拟合: + +`房价`` ≈ 0.015 × ``面积`` + 50``万`\ +` y = a × x + b` + +这就是一个最简单的"AI模型":**单变量线性函数** + +多元回归:y = a₁x₁ + a₂x₂ + ... + b + +增加更多特征: + +`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万` + +这就是**单层神经元**的数学形式! + +函数组合:层级嵌套 + +现实世界的关系往往是非线性的,需要函数组合: + +`h₁ = f₁(x) # ``第一层:提取特征` + +`h₂ = f₂(h₁) # ``第二层:组合特征` + +`y = f₃(h₂) # ``第三层:输出结果` + +这就是**多层神经网络**的本质! + +### 函数组合的威力 + +为什么需要多层? + +**单层函数**只能学习简单的线性关系 + +**多层函数**可以学习任意复杂的非线性关系 + +直观例子:识别圆形 + +`输入:像素点灰度值`\ +` ↓`\ +`第一层:检测边缘(梯度变化)`\ +` ↓`\ +`第二层:组合边缘成弧线`\ +` ↓`\ +`第三层:判断是否闭合`` → ``圆形` + +每一层都是一个函数,层层组合形成复杂能力。 + +### 数据驱动 vs 规则驱动 + +#### 规则驱动 + +`# ``传统编程:人工编写规则`\ +`def`` ``is_circle``(image):`\ +` edges ``=`` ``detect_edges``(image)`\ +` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\ +` ``return`` ``True`\ +` ``return`` ``False` + +**问题**:规则难以穷举,无法处理复杂情况 + +#### 数据驱动 + +`# AI``:从数据中学习函数`\ +`f ``=`` ``neural_network``()`\ +`train(f, ``thousands_of_examples``)`\ +`result ``=`` f(``new_image``) ``# ``自动判断` + +**优势**:自动发现规律,适应复杂情况 + +### 神经网络的函数本质 + +数学表示 + +一个L层神经网络: + +`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))` + +其中每一层: + +`h = ``σ(``Wx`` + b)` + +W:权重矩阵(可学习参数) + +b:偏置向量(可学习参数) + +σ:激活函数(引入非线性) + +#### 视觉理解 + +`输入层`` ``隐藏层`` ``输出层`\ +` x ``h₁,h₂,h``₃ y`\ +` ● ──────────→ ○ ──────────→ ●`\ +` │ ○ │`\ +` ● ──────────→ ○ ──────────→ ●`\ +` │ ○ │`\ +` ● ──────────→ ○ ──────────→ ●`\ +` ``权重``W₁ ``权重``W₂` + +箭头上的权重就是函数的参数,通过学习自动确定。 + +### 思考与练习 + +1.列举3个日常生活中"用函数描述世界"的例子 + +2.为什么单层函数无法学习异或(XOR)问题? + +3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决? + +### 关键术语 + + ------------------------------------------------------------ + 中文 英文 说明 + ---------- --------------------- --------------------------- + 线性回归 Linear Regression y = ax + b 形式的函数拟合 + + 多元回归 Multiple Regression 多输入变量的线性模型 + + 权重 Weight 神经网络中的可学习参数 + + 偏置 Bias 调整输出基准的参数 + + 非线性 Non-linearity 无法用直线表示的关系 + ------------------------------------------------------------ + +### 延伸阅读 + +[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍 + +--- + +### 学习目标 + +理解MLP的基本结构 + +掌握前向传播的计算过程 + +了解激活函数的作用和类型 + +理解反向传播的基本思想 + +### MLP结构 + +#### 什么是MLP + +**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。 + +网络架构 + +`输入层`` ``隐藏层`` ``输出层`\ +` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\ +` │ x₁ │ │ h₁ │ │ y₁ │`\ +` │ x₂ │───→│ h₂ │───→│ y₂ │`\ +` │ x₃ │ │ h₃ │ │ y₃ │`\ +` │ ... │ │ ... │ │ ... │`\ +` │ xₙ │ │ hₘ │ │ yₖ │`\ +` └─────────┘ └─────────────┘ └─────────┘`\ +` │ │ │`\ +` └───────────────┴────────────────┘`\ +` ``全连接(每个神经元相连)` + +#### 层次说明 + + ---------------------------------------- + 层类型 作用 神经元数量 + -------- ---------------- -------------- + 输入层 接收原始数据 取决于特征数 + + 隐藏层 特征变换与组合 自由设计 + + 输出层 产生最终结果 取决于任务 + ---------------------------------------- + +### 前向传播 + +#### 单个神经元 + +`# ``线性部分`\ +`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\ +\ +`# ``激活函数`\ +`h ``=`` σ(z)` + +#### 完整网络 + +对于L层网络: + +`# ``第``1``层` + +`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)` + +`# ``第``2``层` + +`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)` + +`# ...` + +`# ``第``L``层` + + y = σₗ(Wₗh_{l-1} + bₗ) + +#### 数据流动 + +`输入向量`` x₀`\ +` │`\ +` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\ +` │ │`\ +` │ └─→ σ₁(z₁) = h₁`\ +` │ │`\ +` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\ +` │ │`\ +` └─→ σ₂(z₂) = h₂`\ +` │`\ +` └─→ ... → y` + +### 激活函数 + +#### 为什么需要激活函数? + +没有激活函数,多层网络就等价于单层线性变换: + +`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x` + +激活函数引入**非线性**,使网络能够学习复杂模式。 + +#### 常用激活函数 + + -------------------------------------------------------------------- + 激活函数 公式 特点 应用场景 + ---------- ----------------------------- ------------ -------------- + Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层 + + ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选 + + Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层 + + Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络 + -------------------------------------------------------------------- + +#### 视觉对比 + +`ReLU``: Sigmoid: Tanh:`\ +` ↑ ___ ___`\ +` │ / ╲`\ +` │ / ╲`\ +` │____ / ╲___`\ +` │ ______ / │`\ +` └──────── / └──`\ +` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞` + +### 损失函数与优化 + +#### 损失函数 + +损失函数衡量模型预测与真实值的差距: + + --------------------------------------- + 任务 损失函数 公式 + -------- ---------- ------------------- + 回归 均方误差 MSE = Σ(ŷ-y)²/n + + 二分类 交叉熵 CE = -y·log(ŷ) + + 多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ) + --------------------------------------- + +#### 优化目标 + +`最小化损失函数:`\ +`min L(f(x; θ), y)`\ +\ +`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数` + +#### 梯度下降 + +`重复直到收敛:`\ +` θ = θ - α·∇L(θ)`\ +\ +`其中:`\ +` θ``:参数`\ +` α``:学习率`\ +` ∇L(θ)``:损失函数的梯度` + +### 反向传播 + +核心思想 + +从输出层向输入层反向计算梯度: + +`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差` + +链式法则 + +`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\ +` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)` + +直观理解 + +1.**前向传播**:计算每个神经元的输出 + +2.**计算误差**:比较输出与真实值 + +3.**反向传播**:将误差反向传递 + +4.**更新权重**:根据误差调整参数 + +### MLP vs 传统模型 + + -------------------------------------- + 特性 MLP 传统机器学习 + ------------ ---------- -------------- + 特征工程 自动学习 人工设计 + + 非线性能力 强 中/弱 + + 数据需求 大量 中等 + + 可解释性 低 高 + + 训练时间 长 短 + -------------------------------------- + +### 思考与练习 + +1.为什么隐藏层越多,网络表达能力越强? + +2.ReLU为什么比Sigmoid更适合隐藏层? + +3.如果所有权重初始化为0,会发生什么? + +### 关键术语 + + ---------------------------------------------------------- + 中文 英文 说明 + ---------- ------------------ ---------------------------- + 前向传播 Forward Pass 数据从输入到输出的计算过程 + + 反向传播 Backpropagation 计算梯度的算法 + + 损失函数 Loss Function 衡量预测误差的函数 + + 梯度下降 Gradient Descent 优化算法 + + 学习率 Learning Rate 参数更新的步长 + ---------------------------------------------------------- + +### 延伸阅读 + +[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html) + +[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding + +--- ## 学习目标 -完成本篇后,你将能够: +掌握Python AI开发环境配置 -从函数组合角度理解神经网络 +了解核心科学计算库 -描述MLP的基本结构和工作原理 +理解Vibe Coding的AI辅助编程新模式 -配置Python AI开发环境 +### Python环境配置 -使用AI工具辅助编程学习 +#### Anaconda vs Miniconda -## 核心概念 + ----------------------------------------------- + 工具 大小 特点 适用场景 + ----------- --------- ------------ ------------ + Anaconda \~500MB 预装常用库 初学者推荐 + + Miniconda \~50MB 仅含conda 精简安装 + ----------------------------------------------- + +#### 安装步骤 + +##### 1.下载安装 + +o访问 https://www.anaconda.com/download + +o选择Python 3.x版本 + +o按提示安装 + +##### 2.创建虚拟环境 + +`conda`` create ``-n`` ai-env python=3.10`\ +`conda`` activate ai-env` + +##### 3.安装核心库 + +`conda`` install ``numpy`` pandas ``scipy`\ +`pip`` install torch ``torchvision` + +### 核心科学计算库 + +#### NumPy:数值计算基础 + +`import`` ``numpy`` ``as`` np`\ +\ +`# ``创建数组`\ +`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\ +\ +`# ``矩阵运算`\ +`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\ +`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\ +\ +`# ``激活函数`\ +`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU` + +#### Pandas:数据处理 + +`import`` pandas ``as`` pd`\ +\ +`# ``读取数据`\ +`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\ +\ +`# ``数据清洗`\ +`df`` ``=`` ``df.dropna``()`\ +`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\ +\ +`# ``统计分析`\ +`df.describe``()` + +#### SciPy:科学计算 + +`from`` ``scipy`` ``import`` optimize`\ +`from`` ``scipy.spatial`` ``import`` distance`\ +\ +`# ``优化问题`\ +`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\ +\ +`# ``距离计算`\ +`dist`` ``=`` ``distance.euclidean``(point1, point2)` + +### 开发工具选择 + +#### VSCode + +**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快 + +**AI开发常用插件**: - Python - Jupyter - Pylance - Copilot + +## Cursor + +**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程 + +**使用场景**: - 快速原型开发 - 代码重构 - 学习新API + +## Jupyter Notebook + +**特点**: - 交互式编程 - 可视化友好 - 文档即代码 + +**使用场景**: - 数据探索 - 算法实验 - 教学演示 + +# Vibe Coding:AI辅助编程 + +## 什么是Vibe Coding + +传统编程:**明确需求 → 设计算法 → 编写代码** + +Vibe Coding:**模糊想法 → AI辅助 → 迭代完善** + +## 工作流程 + +### 1. 描述意图(自然语言) + +`"``帮我创建一个简单的神经网络``"` + +### + +`2. AI``生成代码` + +### → 自动生成完整代码框架 + +`3. ``运行测试` + +`→ ``发现问题或需要调整` + +`4. ``迭代优化` + +`"``把隐藏层改成``128``个神经元``"` + +`→ AI``自动修改代码` + +`5. ``理解学习` + + → 阅读AI生成的代码,学习最佳实践 + +## 实践技巧 + + --------------------------------- + 技巧 说明 + ---------- ---------------------- + 明确需求 详细描述输入输出 + + 分步实现 复杂功能拆解为小任务 + + 验证结果 检查生成的代码 + + 学习思考 理解AI为什么这样写 + --------------------------------- + +## 工具推荐 + + -------------------------------------------- + 工具 特点 适用场景 + ---------------- ---------------- ---------- + GitHub Copilot 代码补全 日常开发 + + Cursor 对话式编程 快速原型 + + ChatGPT/Claude 代码生成与解释 学习咨询 + + Replit Agent 端到端开发 小型项目 + -------------------------------------------- + +## 开发工作流 + +项目结构 + +`project/`\ +`├── data/ # ``数据文件`\ +`├── notebooks/ # ``Jupyter``笔记本`\ +`├── ``src``/ # ``源代码`\ +`│ ├── models/ # ``模型定义`\ +`│ ├── utils/ # ``工具函数`\ +`│ └── train.py # ``训练脚本`\ +`├── requirements.txt # ``依赖列表`\ +`└── README.md # ``项目说明` + +### 典型工作流 + +`# 1. ``创建环境`\ +`conda`` create ``-n`` ``myproject`` python=3.10`\ +`conda`` activate ``myproject`\ +\ +`# 2. ``安装依赖`\ +`pip`` install ``-r`` requirements.txt`\ +\ +`# 3. ``开发迭代`\ +`# - ``在``notebook``中实验`\ +`# - ``整理到``src``/``目录`\ +`# - ``运行测试`\ +\ +`# 4. ``保存环境`\ +`conda`` env export ``>`` ``environment.yml` + +## 思考与练习 + +1.对比Anaconda和Miniconda,什么时候该用哪个? + +2.尝试用Cursor/Copilot生成一个简单的神经网络代码 + +3.Vibe Coding如何改变传统的编程学习方式? + +## 关键术语 ----------------------------------------------------------- - 概念 英文 说明 - ------------ --------------------- ------------------------ - 多层感知机 MLP Multi-Layer Perceptron + 中文 英文 说明 + ---------- ----------------------- ------------------------ + 虚拟环境 Virtual Environment 隔离的Python运行环境 - 前向传播 Forward Pass 数据通过网络的过程 + 依赖管理 Dependency Management 管理项目所需的库 - 激活函数 Activation Function 引入非线性的函数 + 代码补全 Code Completion 自动补全正在输入的代码 - 损失函数 Loss Function 衡量预测误差的函数 + 原型开发 Prototyping 快速构建可运行版本 - 反向传播 Backpropagation 计算梯度的算法 + 迭代优化 Iterative Refinement 逐步改进代码 ----------------------------------------------------------- -## 01.1 函数式AI视角 +## 延伸阅读 + +[Anaconda官方文档](https://docs.anaconda.com/) + +[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html) + +[Cursor使用指南](https://cursor.com/docs) diff --git a/03-computer-vision/02.1-cnn-foundation.md b/03-computer-vision/02.1-cnn-foundation.md deleted file mode 100644 index fa54d3b..0000000 --- a/03-computer-vision/02.1-cnn-foundation.md +++ /dev/null @@ -1,145 +0,0 @@ - -### 学习目标 - -理解CNN的核心思想:局部连接与权重共享 - -掌握卷积、激活、池化三大组件 - -了解CNN与MLP的区别和联系 - -### 为什么需要CNN - -MLP的问题 - -将图像展平成一维向量输入MLP: - -`28×28``图像`` → 784``维向量`` → MLP` - -**问题**: 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习 - -#### CNN的解决方案 - - ------------------------------------------------------------ - 特性 说明 优势 - ------------ -------------------------- -------------------- - 局部连接 每个神经元只连接局部区域 符合图像局部相关性 - - 权重共享 同一卷积核扫描全图 大幅减少参数 - - 层次化特征 低层→高层特征抽象 自动学习特征表达 - ------------------------------------------------------------ - -### CNN三大组件 - -#### 1. 卷积层 (Convolution) - -**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征 - -`输入图像`` ``卷积核`` ``特征图`\ -`┌─────────┐ ┌─────┐ ┌─────────┐`\ -`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\ -`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\ -`│ 7 8 9 │ │ │ │ │`\ -`└─────────┘ └─────┘ └─────────┘` - -**计算示例**: - -`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4` - -**多通道卷积**: - -`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)` - -#### 2. 激活层 (Activation) - -通常使用ReLU: - -`output ``=`` ``max``(``0``, ``feature_map``)` - -作用:引入非线性,使网络能学习复杂模式 - -#### 3. 池化层 (Pooling) - -**最大池化** (Max Pooling): - -`2×2``窗口`` → ``取最大值`\ -`┌─────┐ ┌───┐`\ -`│3 1 │ │ 3 │`\ -`│2 5 │ → │ │`\ -`└─────┘ │ 5 │`\ -` └───┘` - -作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野 - -### CNN架构示例 - -#### LeNet-5 (经典架构) - -`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\ -` ↓`\ -` ``全连接层`` → ``输出` - -#### VGG-16 (深层架构) - -`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\ -` → [Conv×3 + Pool] ×3 → FC×3 → ``输出` - -### CNN vs MLP - - ------------------------------------- - 特性 MLP CNN - ---------- -------------- ----------- - 连接方式 全连接 局部连接 - - 权重 每个连接独立 同层共享 - - 空间结构 忽略 保留 - - 参数量 大 小 - - 适用任务 结构化数据 图像/语音 - ------------------------------------- - -### 经典网络架构演进 - -`LeNet`` (1998) → ``首次定义``CNN``结构`\ -` ↓`\ -`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\ -` ↓`\ -`VGG (2014) → ``更深网络,``3×3``小卷积核`\ -` ↓`\ -`GoogLeNet`` (2014) → Inception``模块,多尺度`\ -` ↓`\ -`ResNet`` (2015) → ``残差连接,``152``层`\ -` ↓`\ -`EfficientNet`` (2019) → ``复合缩放,高效` - -### 思考与练习 - -1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)? - -2.感受野如何随着网络深度增加? - -3.设计一个简单的CNN用于手写数字识别 - -### 关键术语 - - ------------------------------------------------------- - 中文 英文 说明 - -------- ----------------- ---------------------------- - 卷积核 Kernel/Filter 用于特征提取的小矩阵 - - 步幅 Stride 卷积核滑动的步长 - - 填充 Padding 边缘补零以保持尺寸 - - 感受野 Receptive Field 神经元响应的输入区域 - - 通道 Channel 图像的颜色维度或特征图数量 - ------------------------------------------------------- - -### 延伸阅读 - -[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/) - -[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测 diff --git a/03-computer-vision/02.2-object-detection.md b/03-computer-vision/02.2-object-detection.md deleted file mode 100644 index 53d7277..0000000 --- a/03-computer-vision/02.2-object-detection.md +++ /dev/null @@ -1,168 +0,0 @@ - -## 学习目标 - -理解目标检测与图像分类的区别 - -掌握YOLO系列的发展脉络 - -了解目标检测在设计中的应用 - -### 从分类到检测 - -#### 图像分类 - -`输入图像`` → CNN → ``类别标签`\ -`"``猫``" (``单标签``)` - -#### 目标检测 - -`输入图像`` → CNN → [``位置``, ``类别``]`\ -`[``边界框``, "``猫``", 0.95]`\ -`[``边界框``, "``狗``", 0.87]` - -**核心差异**:检测需要同时解决"是什么"和"在哪里" - -### 检测器类型 - -#### Two-Stage检测器 - -`第一阶段:候选区域生成`\ -` RPN (Region Proposal Network)`\ -\ -`第二阶段:分类与回归`\ -` ``对每个候选框进行精确预测`\ -\ -`代表:``R-CNN, Fast R-CNN, Faster R-CNN` - -特点:准确率高,速度慢 - -#### One-Stage检测器 - -`直接预测:一次性输出所有边界框和类别`\ -\ -`代表:``YOLO, SSD, ``RetinaNet` - -特点:速度快,实时性好 - -### YOLO系列演进 - -#### YOLO v1 (2016) - -**核心思想**:将检测转化为回归问题 - -`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框` - -创新点: - 端到端训练 - 实时检测 (45 FPS) - -#### YOLO v2-v4 - - ---------------------------------- - 版本 主要改进 - ------ --------------------------- - v2 Batch Normalization, 锚框 - - v3 多尺度预测 - - v4 CSPDarknet, PANet - - v5 PyTorch实现,工程优化 - - v8 重新设计,更易用 - ---------------------------------- - -#### YOLO工作流程 - -##### 1. 输入图像 (640×640) - -`↓` - -##### 2. Backbone特征提取 - -`↓` - -##### 3. Neck特征融合 (FPN + PAN) - -`↓` - -##### 4. Head检测输出 - -`- ``边界框坐标` - -`- ``目标置信度` - -`- ``类别概率` - -### 评估指标 - -#### IoU (交并比) - -`IoU`` = ``预测框与真实框的交集`` / ``并集`\ -\ -` ┌─────────┐`\ -` │ ``预测框`` │`\ -` │ ┌───┐ │`\ -` │ │``真`` │ │`\ -` └──┼──┼─┘`\ -` └───┘`\ -\ -`IoU`` = ``重叠面积`` / ``总面积` - -### mAP (平均精度均值) - -在不同IoU阈值(0.5, 0.75...)下的平均精度 - -综合衡量定位准确度和分类准确度 - -### COCO数据集 - -80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明 - -## 设计领域应用 - -建筑识别 - -`卫星图像`` → YOLO → ``建筑物边界框`\ -` ↓`\ -`自动生成建筑轮廓` - -场景分析 - -`室内照片`` → ``目标检测`` → ``家具识别`\ -` ↓`\ -`空间布局分析` - -遗产保护 - -`无人机影像`` → ``建筑病害检测`\ -` ↓`\ -`自动化巡检与记录` - -## 思考与练习 - -1.Two-Stage和One-Stage检测器的权衡是什么? - -2.为什么YOLO能实现实时检测? - -3.目标检测在规划设计中有哪些潜在应用? - -## 关键术语 - - ------------------------------------------------------- - 中文 英文 说明 - -------------- -------------- ------------------------- - 边界框 Bounding Box 矩形目标框 - - 锚框 Anchor Box 预定义的候选框 - - 非极大值抑制 NMS 去除重复检测 - - 交并比 IoU Intersection over Union - - 平均精度 AP Average Precision - ------------------------------------------------------- - -## 延伸阅读 - -[Ultralytics YOLO文档](https://docs.ultralytics.com/) - -[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析 diff --git a/03-computer-vision/02.3-semantic-segmentation.md b/03-computer-vision/02.3-semantic-segmentation.md deleted file mode 100644 index eae0df7..0000000 --- a/03-computer-vision/02.3-semantic-segmentation.md +++ /dev/null @@ -1,136 +0,0 @@ - -## 学习目标 - -理解图像分析的三种层级 - -掌握语义分割与实例分割的区别 - -了解分割技术在空间分析中的应用 - -## 图像分析层级 - -### Pixel-Level (像素级) - -`每个像素独立处理`\ -`问题:不考虑上下文` - -### Patch-Level (图块级) - -`以图像块为单位`\ -`特点:保留局部空间关系`\ -`应用:``CNN``卷积操作` - -### Object-Level (对象级) - -`以完整对象为单位`\ -`特点:语义完整`\ -`应用:目标检测、分割` - -### 语义分割 vs 实例分割 - -#### 语义分割 (Semantic Segmentation) - -`所有同类对象归为一类`\ -`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]` - -特点: - 同类别用同一种颜色 - 不区分个体数量 - -#### 实例分割 (Instance Segmentation) - -`每个对象单独分割`\ -`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]` - -特点: - 区分同类对象的不同个体 - 更精细的场景理解 - -### 分割网络架构 - -#### FCN (全卷积网络) - -`CNN``特征提取`` → ``上采样`` → ``像素级预测` - -创新:用卷积层替代全连接层,输出热力图 - -#### U-Net - -`编码器`` → ``瓶颈层`` → ``解码器`\ -` ↓ ↑`\ -`跳跃连接`` ───────────────┘` - -特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构 - -#### DeepLab系列 - -空洞卷积 (Atrous Convolution) - -扩大感受野而不降低分辨率 - -ASPP (空洞空间金字塔池化) - -### 空间分析应用 - -#### 遥感影像分析 - -`卫星图像`` → ``语义分割`` → ``土地利用分类`\ -` ↓`\ -`- ``建筑用地`\ -`- ``农用地`\ -`- ``水体`\ -`- ``森林` - -#### 城市形态分析 - -`街景图像`` → ``分割`` → ``空间品质评估`\ -` ↓`\ -`- ``绿视率`\ -`- ``天空开阔度`\ -`- ``建筑密度` - -#### 景观格局分析 - -`高分辨率影像`` → ``生态源地识别`\ -` ↓`\ -`景观连接性评估` - -### 分割与检测对比 - - -------------------------------- - 特性 目标检测 语义分割 - -------- ---------- ------------ - 输出 矩形框 像素级标注 - - 精度 粗糙 精细 - - 计算量 较低 较高 - - 应用 目标定位 场景理解 - -------------------------------- - -### 思考与练习 - -1.语义分割和实例分割分别在什么场景下更有用? - -2.U-Net的跳跃连接为什么重要? - -3.分割技术如何辅助规划设计决策? - -### 关键术语 - - ----------------------------------------------------- - 中文 英文 说明 - ---------- ----------------------- ------------------ - 语义分割 Semantic Segmentation 按类别分割像素 - - 实例分割 Instance Segmentation 按对象个体分割 - - 热力图 Heatmap 像素级预测结果 - - 空洞卷积 Atrous Convolution 扩大感受野的卷积 - - 跳跃连接 Skip Connection 跨层连接 - ----------------------------------------------------- - -### 延伸阅读 - -[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038) - -[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597) diff --git a/03-computer-vision/03-computer-vision.md b/03-computer-vision/03-computer-vision.md index 8306877..3489960 100644 --- a/03-computer-vision/03-computer-vision.md +++ b/03-computer-vision/03-computer-vision.md @@ -8,26 +8,457 @@ 本篇将系统介绍CNN原理及其在空间分析中的应用。 -## 章节目录 +--- -[02.1 CNN基础原理](02.1-cnn-foundation.md) - 卷积神经网络三大组件 +### 学习目标 -[02.2 目标检测](02.2-object-detection.md) - YOLO系列与应用 +理解CNN的核心思想:局部连接与权重共享 -[02.3 语义分割与空间分析](02.3-semantic-segmentation.md) - 图像分析层级 +掌握卷积、激活、池化三大组件 -## 核心概念 +了解CNN与MLP的区别和联系 - --------------------------------------------------------------- - 概念 英文 说明 - -------------- ----------------- ------------------------------ - 卷积神经网络 CNN Convolutional Neural Network +### 为什么需要CNN - 特征图 Feature Map 卷积操作的输出 +MLP的问题 - 感受野 Receptive Field 神经元能"看到"的输入区域 +将图像展平成一维向量输入MLP: - 池化 Pooling 下采样操作 - --------------------------------------------------------------- +`28×28``图像`` → 784``维向量`` → MLP` -## 02.1 CNN基础原理 +**问题**: 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习 + +#### CNN的解决方案 + + ------------------------------------------------------------ + 特性 说明 优势 + ------------ -------------------------- -------------------- + 局部连接 每个神经元只连接局部区域 符合图像局部相关性 + + 权重共享 同一卷积核扫描全图 大幅减少参数 + + 层次化特征 低层→高层特征抽象 自动学习特征表达 + ------------------------------------------------------------ + +### CNN三大组件 + +#### 1. 卷积层 (Convolution) + +**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征 + +`输入图像`` ``卷积核`` ``特征图`\ +`┌─────────┐ ┌─────┐ ┌─────────┐`\ +`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\ +`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\ +`│ 7 8 9 │ │ │ │ │`\ +`└─────────┘ └─────┘ └─────────┘` + +**计算示例**: + +`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4` + +**多通道卷积**: + +`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)` + +#### 2. 激活层 (Activation) + +通常使用ReLU: + +`output ``=`` ``max``(``0``, ``feature_map``)` + +作用:引入非线性,使网络能学习复杂模式 + +#### 3. 池化层 (Pooling) + +**最大池化** (Max Pooling): + +`2×2``窗口`` → ``取最大值`\ +`┌─────┐ ┌───┐`\ +`│3 1 │ │ 3 │`\ +`│2 5 │ → │ │`\ +`└─────┘ │ 5 │`\ +` └───┘` + +作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野 + +### CNN架构示例 + +#### LeNet-5 (经典架构) + +`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\ +` ↓`\ +` ``全连接层`` → ``输出` + +#### VGG-16 (深层架构) + +`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\ +` → [Conv×3 + Pool] ×3 → FC×3 → ``输出` + +### CNN vs MLP + + ------------------------------------- + 特性 MLP CNN + ---------- -------------- ----------- + 连接方式 全连接 局部连接 + + 权重 每个连接独立 同层共享 + + 空间结构 忽略 保留 + + 参数量 大 小 + + 适用任务 结构化数据 图像/语音 + ------------------------------------- + +### 经典网络架构演进 + +`LeNet`` (1998) → ``首次定义``CNN``结构`\ +` ↓`\ +`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\ +` ↓`\ +`VGG (2014) → ``更深网络,``3×3``小卷积核`\ +` ↓`\ +`GoogLeNet`` (2014) → Inception``模块,多尺度`\ +` ↓`\ +`ResNet`` (2015) → ``残差连接,``152``层`\ +` ↓`\ +`EfficientNet`` (2019) → ``复合缩放,高效` + +### 思考与练习 + +1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)? + +2.感受野如何随着网络深度增加? + +3.设计一个简单的CNN用于手写数字识别 + +### 关键术语 + + ------------------------------------------------------- + 中文 英文 说明 + -------- ----------------- ---------------------------- + 卷积核 Kernel/Filter 用于特征提取的小矩阵 + + 步幅 Stride 卷积核滑动的步长 + + 填充 Padding 边缘补零以保持尺寸 + + 感受野 Receptive Field 神经元响应的输入区域 + + 通道 Channel 图像的颜色维度或特征图数量 + ------------------------------------------------------- + +### 延伸阅读 + +[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/) + +[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测 + +--- + +## 学习目标 + +理解目标检测与图像分类的区别 + +掌握YOLO系列的发展脉络 + +了解目标检测在设计中的应用 + +### 从分类到检测 + +#### 图像分类 + +`输入图像`` → CNN → ``类别标签`\ +`"``猫``" (``单标签``)` + +#### 目标检测 + +`输入图像`` → CNN → [``位置``, ``类别``]`\ +`[``边界框``, "``猫``", 0.95]`\ +`[``边界框``, "``狗``", 0.87]` + +**核心差异**:检测需要同时解决"是什么"和"在哪里" + +### 检测器类型 + +#### Two-Stage检测器 + +`第一阶段:候选区域生成`\ +` RPN (Region Proposal Network)`\ +\ +`第二阶段:分类与回归`\ +` ``对每个候选框进行精确预测`\ +\ +`代表:``R-CNN, Fast R-CNN, Faster R-CNN` + +特点:准确率高,速度慢 + +#### One-Stage检测器 + +`直接预测:一次性输出所有边界框和类别`\ +\ +`代表:``YOLO, SSD, ``RetinaNet` + +特点:速度快,实时性好 + +### YOLO系列演进 + +#### YOLO v1 (2016) + +**核心思想**:将检测转化为回归问题 + +`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框` + +创新点: - 端到端训练 - 实时检测 (45 FPS) + +#### YOLO v2-v4 + + ---------------------------------- + 版本 主要改进 + ------ --------------------------- + v2 Batch Normalization, 锚框 + + v3 多尺度预测 + + v4 CSPDarknet, PANet + + v5 PyTorch实现,工程优化 + + v8 重新设计,更易用 + ---------------------------------- + +#### YOLO工作流程 + +##### 1. 输入图像 (640×640) + +`↓` + +##### 2. Backbone特征提取 + +`↓` + +##### 3. Neck特征融合 (FPN + PAN) + +`↓` + +##### 4. Head检测输出 + +`- ``边界框坐标` + +`- ``目标置信度` + +`- ``类别概率` + +### 评估指标 + +#### IoU (交并比) + +`IoU`` = ``预测框与真实框的交集`` / ``并集`\ +\ +` ┌─────────┐`\ +` │ ``预测框`` │`\ +` │ ┌───┐ │`\ +` │ │``真`` │ │`\ +` └──┼──┼─┘`\ +` └───┘`\ +\ +`IoU`` = ``重叠面积`` / ``总面积` + +### mAP (平均精度均值) + +在不同IoU阈值(0.5, 0.75...)下的平均精度 + +综合衡量定位准确度和分类准确度 + +### COCO数据集 + +80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明 + +## 设计领域应用 + +建筑识别 + +`卫星图像`` → YOLO → ``建筑物边界框`\ +` ↓`\ +`自动生成建筑轮廓` + +场景分析 + +`室内照片`` → ``目标检测`` → ``家具识别`\ +` ↓`\ +`空间布局分析` + +遗产保护 + +`无人机影像`` → ``建筑病害检测`\ +` ↓`\ +`自动化巡检与记录` + +## 思考与练习 + +1.Two-Stage和One-Stage检测器的权衡是什么? + +2.为什么YOLO能实现实时检测? + +3.目标检测在规划设计中有哪些潜在应用? + +## 关键术语 + + ------------------------------------------------------- + 中文 英文 说明 + -------------- -------------- ------------------------- + 边界框 Bounding Box 矩形目标框 + + 锚框 Anchor Box 预定义的候选框 + + 非极大值抑制 NMS 去除重复检测 + + 交并比 IoU Intersection over Union + + 平均精度 AP Average Precision + ------------------------------------------------------- + +## 延伸阅读 + +[Ultralytics YOLO文档](https://docs.ultralytics.com/) + +[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析 + +--- + +## 学习目标 + +理解图像分析的三种层级 + +掌握语义分割与实例分割的区别 + +了解分割技术在空间分析中的应用 + +## 图像分析层级 + +### Pixel-Level (像素级) + +`每个像素独立处理`\ +`问题:不考虑上下文` + +### Patch-Level (图块级) + +`以图像块为单位`\ +`特点:保留局部空间关系`\ +`应用:``CNN``卷积操作` + +### Object-Level (对象级) + +`以完整对象为单位`\ +`特点:语义完整`\ +`应用:目标检测、分割` + +### 语义分割 vs 实例分割 + +#### 语义分割 (Semantic Segmentation) + +`所有同类对象归为一类`\ +`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]` + +特点: - 同类别用同一种颜色 - 不区分个体数量 + +#### 实例分割 (Instance Segmentation) + +`每个对象单独分割`\ +`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]` + +特点: - 区分同类对象的不同个体 - 更精细的场景理解 + +### 分割网络架构 + +#### FCN (全卷积网络) + +`CNN``特征提取`` → ``上采样`` → ``像素级预测` + +创新:用卷积层替代全连接层,输出热力图 + +#### U-Net + +`编码器`` → ``瓶颈层`` → ``解码器`\ +` ↓ ↑`\ +`跳跃连接`` ───────────────┘` + +特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构 + +#### DeepLab系列 + +空洞卷积 (Atrous Convolution) + +扩大感受野而不降低分辨率 + +ASPP (空洞空间金字塔池化) + +### 空间分析应用 + +#### 遥感影像分析 + +`卫星图像`` → ``语义分割`` → ``土地利用分类`\ +` ↓`\ +`- ``建筑用地`\ +`- ``农用地`\ +`- ``水体`\ +`- ``森林` + +#### 城市形态分析 + +`街景图像`` → ``分割`` → ``空间品质评估`\ +` ↓`\ +`- ``绿视率`\ +`- ``天空开阔度`\ +`- ``建筑密度` + +#### 景观格局分析 + +`高分辨率影像`` → ``生态源地识别`\ +` ↓`\ +`景观连接性评估` + +### 分割与检测对比 + + -------------------------------- + 特性 目标检测 语义分割 + -------- ---------- ------------ + 输出 矩形框 像素级标注 + + 精度 粗糙 精细 + + 计算量 较低 较高 + + 应用 目标定位 场景理解 + -------------------------------- + +### 思考与练习 + +1.语义分割和实例分割分别在什么场景下更有用? + +2.U-Net的跳跃连接为什么重要? + +3.分割技术如何辅助规划设计决策? + +### 关键术语 + + ----------------------------------------------------- + 中文 英文 说明 + ---------- ----------------------- ------------------ + 语义分割 Semantic Segmentation 按类别分割像素 + + 实例分割 Instance Segmentation 按对象个体分割 + + 热力图 Heatmap 像素级预测结果 + + 空洞卷积 Atrous Convolution 扩大感受野的卷积 + + 跳跃连接 Skip Connection 跨层连接 + ----------------------------------------------------- + +### 延伸阅读 + +[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038) + +[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597) diff --git a/04-transformer/03.1-attention.md b/04-transformer/03.1-attention.md deleted file mode 100644 index 7d80b61..0000000 --- a/04-transformer/03.1-attention.md +++ /dev/null @@ -1,156 +0,0 @@ - -### 学习目标 - -理解Self-Attention的动机和原理 - -掌握Q、K、V的计算过程 - -了解Multi-Head Attention的优势 - -### 为什么需要Attention - -#### 序列标注问题 - -`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\ -`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)` - -传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算 - -Self-Attention: - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算 - -### Self-Attention原理 - -#### 核心思想 {#核心思想-1} - -为每个输出元素,计算输入序列中所有元素的相关性: - -`对于每个位置``i``:`\ -` yᵢ = Σ (``注意力权重`` × ``对应输入值``)` - -#### Q、K、V计算 - -`输入``X → ``三个线性变换`\ -` ↓`\ -`Q (Query): "``我想找什么``"`\ -`K (Key): "``我有什么标签``"`\ -`V (Value): "``我的实际内容``"` - -#### 注意力分数计算 - -`1. ``计算相似度:``Score = Q × Kᵀ` - -`2. ``缩放:``Score = Score / √dₖ` - -`3. ``Softmax``:``Weight = ``softmax``(Score)` - -`4. ``加权求和:``Output = Weight × V` - -#### 直观理解 {#直观理解-2} - -`查询:``"``苹果``"`\ -` ↓`\ -`与所有``Key``计算相似度`\ -` ↓`\ -`权重高的``Key``对应``Value``贡献更大`\ -` ↓`\ -`输出:融合上下文的``"``苹果``"``表示` - -### Multi-Head Attention - -单头 vs 多头 - -**单头注意力**: - -`一组``Q``、``K``、``V → ``一个注意力表示` - -**多头注意力**: - -`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接` - -#### 多头优势 - - --------------------- - 头 关注内容 - -------- ------------ - Head 1 语法关系 - - Head 2 语义指代 - - Head 3 长距离依赖 - - ... ... - --------------------- - -多头让模型从不同角度理解序列。 - -### Positional Encoding - -#### 问题 - -Self-Attention本身是**置换不变**的: - -`Attention(``[A, B, C]) = Attention([B, A, C])` - -但序列位置很重要! - -#### 解决方案 - -添加位置信息: - -`输入`` = X + ``PositionalEncoding` - -常用方法: - 正弦/余弦位置编码 - 可学习位置编码 - -### Self-Attention vs CNN - -感受野对比 - - ------------------------------------ - 层级 CNN Self-Attention - ------ ------------ ---------------- - 单层 局部感受野 全局感受野 - - 深层 逐层扩大 始终全局 - ------------------------------------ - -计算复杂度 - - -------------------------------------- - 操作 CNN Self-Attention - -------- ------------ ---------------- - 复杂度 O(k²·C) O(n²·d) - - n 图像尺寸 序列长度 - - k 卷积核大小 \- - -------------------------------------- - -### 思考与练习 - -1.为什么Attention需要Scaling (除以√dₖ)? - -2.Multi-Head Attention中,头数越多越好吗? - -3.Self-Attention如何应用在图像上? - -### 关键术语 - - ------------------------------------------------------ - 中文 英文 说明 - ---------- -------------------- ---------------------- - 查询 Query 查询向量 - - 键 Key 键向量 - - 值 Value 值向量 - - 缩放点积 Scaled Dot-Product 注意力计算方式 - - 掩码 Mask 屏蔽某些位置的注意力 - ------------------------------------------------------ - -### 延伸阅读 - -[Attention Is All You Need](https://arxiv.org/abs/1706.03762) - -[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构 diff --git a/04-transformer/03.2-transformer.md b/04-transformer/03.2-transformer.md deleted file mode 100644 index 4b53a60..0000000 --- a/04-transformer/03.2-transformer.md +++ /dev/null @@ -1,157 +0,0 @@ - -### 学习目标 - -理解Transformer的Encoder-Decoder结构 - -掌握各组件的作用和连接方式 - -了解Token处理流程 - -### 整体架构 - -`输入``Token``序列`` → Encoder → ``编码表示`\ -` ↓`\ -`输出``Token``序列`` ← Decoder ← ``编码表示` - -### Encoder层 - -单层结构 - -`输入``X`\ -` ↓`\ -`Multi-Head Self-Attention`\ -` ↓`\ -`Add & Norm (``残差连接`` + ``层归一化``)`\ -` ↓`\ -`Feed-Forward Network (FFN)`\ -` ↓`\ -`Add & Norm`\ -` ↓`\ -`输出``H` - -#### 残差连接 - -`输出`` = F(x) + x` - -作用: - 缓解梯度消失 - 便于训练深层网络 - -#### 层归一化 - -`输出`` = ``LayerNorm``(x + F(x))` - -作用: - 稳定训练 - 加速收敛 - -#### FFN (前馈网络) - -`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂` - -本质:两层全连接网络,非线性变换 - -### Decoder层 - -#### 结构 - -`输入``X`\ -` ↓`\ -`Masked Self-Attention (``只能看之前的位置``)`\ -` ↓`\ -`Add & Norm`\ -` ↓`\ -`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\ -` ↓`\ -`Add & Norm`\ -` ↓`\ -`FFN`\ -` ↓`\ -`Add & Norm`\ -` ↓`\ -`输出`` (``接``Softmax``预测概率``)` - -#### Cross-Attention - -`Q: Decoder``的隐藏状态`\ -`K, V: Encoder``的输出` - -作用:让Decoder关注Encoder的相关部分 - -## Token处理流程 - -### 输入处理 - -`文本`` → Tokenize → Token IDs`\ -` ↓`\ -` Embedding``层`\ -` ↓`\ -` ``位置编码相加`\ -` ↓`\ -` Encoder/Decoder` - -### 输出处理 - -`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\ -` ↓`\ -` ``选择最大值` - -## 训练与推理 - -训练阶段 - -`教师强制`` (Teacher Forcing)``:`\ -` ``真实标签作为``Decoder``输入`\ -` ``可以并行计算` - -推理阶段 - -`自回归生成`` (Autoregressive)``:`\ -` ``生成一个``Token → ``加入输入`` → ``生成下一个`\ -` ``串行计算` - -## Transformer变体 - -BERT (Encoder-only) - -`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示` - -应用:分类、NER、问答 - -GPT (Decoder-only) - -`输入`` → Decoder → ``下一个``Token``预测` - -应用:文本生成 - -T5 (Encoder-Decoder) - -`输入`` → Encoder → ``表示`` → Decoder → ``输出` - -应用:翻译、摘要 - -## 思考与练习 - -1. 为什么Decoder需要Masked Attention? - -2. Encoder-only和Decoder-only模型各有什么优势? - -3. Transformer如何处理超长序列? - -## 关键术语 - - ---------------------------------------------------------- - 中文 英文 说明 - --------------- --------------------- -------------------- - 残差连接 Residual Connection 跨层连接 - - 层归一化 Layer Normalization 归一化层 - - 教师强制 Teacher Forcing 训练时使用真实标签 - - 自回归 Autoregressive 基于前序生成后续 - - 编码器-解码器 Encoder-Decoder Seq2Seq架构 - ---------------------------------------------------------- - -## 延伸阅读 - -1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html) - - [Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用 diff --git a/04-transformer/03.3-llm-application.md b/04-transformer/03.3-llm-application.md deleted file mode 100644 index c62ae88..0000000 --- a/04-transformer/03.3-llm-application.md +++ /dev/null @@ -1,166 +0,0 @@ - -## 学习目标 - -3. 理解从Transformer到ChatGPT的演进 - - 掌握RAG、RLHF等关键技术 - - 了解Prompt工程在设计中的应用 - -## 从Transformer到ChatGPT - -### GPT系列演进 - - ------------------------------------------------------ - 模型 发布时间 参数量 特点 - --------- ---------- -------- ------------------------ - GPT-1 2018 117M 验证Decoder-only可行性 - - GPT-2 2019 1.5B 展示零样本能力 - - GPT-3 2020 175B 少样本学习震撼业界 - - ChatGPT 2022 \~ 对话能力达到新高度 - - GPT-4 2023 \~ 多模态能力 - ------------------------------------------------------ - -### 训练范式 - -`预训练`` (Pre-training)``:`\ -` ``大规模文本`` → ``无监督学习`` → ``语言模型`\ -\ -`微调`` (Fine-tuning)``:`\ -` ``特定任务`` → ``有监督学习`` → ``任务模型` - -## RAG:检索增强生成 - -### 核心思想 {#核心思想-2} - - 用户提问 → 检索相关文档 → LLM生成答案 - ↑ - 外部知识库 - -### RAG架构 - -#### 文档索引 - -`文档`` → ``切分`` → Embedding → ``向量数据库` - -#### - -`2. ``检索阶段` - -#### 问题 → Embedding → 相似度搜索 → 相关文档 - -`3. ``生成阶段` - - 问题 + 相关文档 → LLM → 答案 - -### RAG优势 - - --------------------------- - 特点 说明 - ---------- ---------------- - 减少幻觉 基于检索的事实 - - 可更新 更新知识库即可 - - 可解释 显示参考来源 - --------------------------- - -## RLHF:人类反馈强化学习 - -### 为什么需要RLHF - -预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出 - -### RLHF三阶段 - -#### 有监督微调 (SFT) - -`人工标注对话`` → ``微调模型` - -`2. ``奖励模型`` (RM)` - -#### 多个输出 → 人类排序 → 训练奖励模型 - -`3. ``强化学习`` (RL)` - - PPO算法 → 优化策略 - -### 效果 - -1. 输出更符合人类偏好 - - 减少有害内容 - - 提高回答质量 - -## Prompt工程 - -### Prompt设计原则 - -#### 明确任务 - -`好:请总结以下文本的主要观点`\ -`差:看看这段文字` - -#### 提供示例 - -`任务:情感分类`\ -`示例:`\ -`"``这部电影太棒了!``" → ``正面`\ -`"``服务态度很差。``" → ``负面`\ -`现在分类:``"..."` - -### 指定格式 - -`请按以下格式输出:`\ -`- ``观点``1``:``...`\ -`- ``观点``2``:``...`\ -`- ``结论:``...` - -## 设计领域应用 - - ------------------------------------------------------- - 任务 Prompt示例 - ---------- -------------------------------------------- - 方案生成 "设计一个50人的办公空间,要求开放式布局" - - 代码生成 "写一个Python脚本计算建筑容积率" - - 文档撰写 "帮我写一份景观设计说明书的框架" - ------------------------------------------------------- - -## 思考与练习 - -1. RAG和微调(Fine-tuning)各适用于什么场景? - -2. 如何评估LLM输出的质量? - -3. Prompt工程在设计工作流中能解决什么问题? - -## 关键术语 - - ------------------------------------------------------------------------------------ - 中文 英文 说明 - ------------------ -------------------- -------------------------------------------- - 检索增强生成 RAG Retrieval-Augmented Generation - - 人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback - - 提示工程 Prompt Engineering 设计输入以引导模型输出 - - 向量数据库 Vector Database 存储和检索向量表示 - - 幻觉 Hallucination 模型编造错误信息 - ------------------------------------------------------------------------------------ - -## 延伸阅读 - -1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165) - - [Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155) - - [LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/) diff --git a/04-transformer/04-transformer.md b/04-transformer/04-transformer.md index 16b607f..bc905b3 100644 --- a/04-transformer/04-transformer.md +++ b/04-transformer/04-transformer.md @@ -8,26 +8,487 @@ Transformer是AI领域最重要的架构创新之一。它不仅彻底改变了 本篇将从注意力机制出发,深入理解Transformer架构,并探讨大语言模型在设计领域的应用。 -## 章节目录 +--- -[03.1 注意力机制](03.1-attention.md) - Self-Attention原理 +### 学习目标 -[03.2 Transformer架构](03.2-transformer.md) - Encoder-Decoder结构 +理解Self-Attention的动机和原理 -[03.3 大语言模型应用](03.3-llm-application.md) - ChatGPT、RAG与Prompt工程 +掌握Q、K、V的计算过程 -## 核心概念 +了解Multi-Head Attention的优势 + +### 为什么需要Attention + +#### 序列标注问题 + +`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\ +`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)` + +传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算 + +Self-Attention: - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算 + +### Self-Attention原理 + +#### 核心思想 {#核心思想-1} + +为每个输出元素,计算输入序列中所有元素的相关性: + +`对于每个位置``i``:`\ +` yᵢ = Σ (``注意力权重`` × ``对应输入值``)` + +#### Q、K、V计算 + +`输入``X → ``三个线性变换`\ +` ↓`\ +`Q (Query): "``我想找什么``"`\ +`K (Key): "``我有什么标签``"`\ +`V (Value): "``我的实际内容``"` + +#### 注意力分数计算 + +`1. ``计算相似度:``Score = Q × Kᵀ` + +`2. ``缩放:``Score = Score / √dₖ` + +`3. ``Softmax``:``Weight = ``softmax``(Score)` + +`4. ``加权求和:``Output = Weight × V` + +#### 直观理解 {#直观理解-2} + +`查询:``"``苹果``"`\ +` ↓`\ +`与所有``Key``计算相似度`\ +` ↓`\ +`权重高的``Key``对应``Value``贡献更大`\ +` ↓`\ +`输出:融合上下文的``"``苹果``"``表示` + +### Multi-Head Attention + +单头 vs 多头 + +**单头注意力**: + +`一组``Q``、``K``、``V → ``一个注意力表示` + +**多头注意力**: + +`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接` + +#### 多头优势 + + --------------------- + 头 关注内容 + -------- ------------ + Head 1 语法关系 + + Head 2 语义指代 + + Head 3 长距离依赖 + + ... ... + --------------------- + +多头让模型从不同角度理解序列。 + +### Positional Encoding + +#### 问题 + +Self-Attention本身是**置换不变**的: + +`Attention(``[A, B, C]) = Attention([B, A, C])` + +但序列位置很重要! + +#### 解决方案 + +添加位置信息: + +`输入`` = X + ``PositionalEncoding` + +常用方法: - 正弦/余弦位置编码 - 可学习位置编码 + +### Self-Attention vs CNN + +感受野对比 + + ------------------------------------ + 层级 CNN Self-Attention + ------ ------------ ---------------- + 单层 局部感受野 全局感受野 + + 深层 逐层扩大 始终全局 + ------------------------------------ + +计算复杂度 + + -------------------------------------- + 操作 CNN Self-Attention + -------- ------------ ---------------- + 复杂度 O(k²·C) O(n²·d) + + n 图像尺寸 序列长度 + + k 卷积核大小 \- + -------------------------------------- + +### 思考与练习 + +1.为什么Attention需要Scaling (除以√dₖ)? + +2.Multi-Head Attention中,头数越多越好吗? + +3.Self-Attention如何应用在图像上? + +### 关键术语 + + ------------------------------------------------------ + 中文 英文 说明 + ---------- -------------------- ---------------------- + 查询 Query 查询向量 + + 键 Key 键向量 + + 值 Value 值向量 + + 缩放点积 Scaled Dot-Product 注意力计算方式 + + 掩码 Mask 屏蔽某些位置的注意力 + ------------------------------------------------------ + +### 延伸阅读 + +[Attention Is All You Need](https://arxiv.org/abs/1706.03762) + +[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构 + +--- + +### 学习目标 + +理解Transformer的Encoder-Decoder结构 + +掌握各组件的作用和连接方式 + +了解Token处理流程 + +### 整体架构 + +`输入``Token``序列`` → Encoder → ``编码表示`\ +` ↓`\ +`输出``Token``序列`` ← Decoder ← ``编码表示` + +### Encoder层 + +单层结构 + +`输入``X`\ +` ↓`\ +`Multi-Head Self-Attention`\ +` ↓`\ +`Add & Norm (``残差连接`` + ``层归一化``)`\ +` ↓`\ +`Feed-Forward Network (FFN)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`输出``H` + +#### 残差连接 + +`输出`` = F(x) + x` + +作用: - 缓解梯度消失 - 便于训练深层网络 + +#### 层归一化 + +`输出`` = ``LayerNorm``(x + F(x))` + +作用: - 稳定训练 - 加速收敛 + +#### FFN (前馈网络) + +`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂` + +本质:两层全连接网络,非线性变换 + +### Decoder层 + +#### 结构 + +`输入``X`\ +` ↓`\ +`Masked Self-Attention (``只能看之前的位置``)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`FFN`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`输出`` (``接``Softmax``预测概率``)` + +#### Cross-Attention + +`Q: Decoder``的隐藏状态`\ +`K, V: Encoder``的输出` + +作用:让Decoder关注Encoder的相关部分 + +## Token处理流程 + +### 输入处理 + +`文本`` → Tokenize → Token IDs`\ +` ↓`\ +` Embedding``层`\ +` ↓`\ +` ``位置编码相加`\ +` ↓`\ +` Encoder/Decoder` + +### 输出处理 + +`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\ +` ↓`\ +` ``选择最大值` + +## 训练与推理 + +训练阶段 + +`教师强制`` (Teacher Forcing)``:`\ +` ``真实标签作为``Decoder``输入`\ +` ``可以并行计算` + +推理阶段 + +`自回归生成`` (Autoregressive)``:`\ +` ``生成一个``Token → ``加入输入`` → ``生成下一个`\ +` ``串行计算` + +## Transformer变体 + +BERT (Encoder-only) + +`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示` + +应用:分类、NER、问答 + +GPT (Decoder-only) + +`输入`` → Decoder → ``下一个``Token``预测` + +应用:文本生成 + +T5 (Encoder-Decoder) + +`输入`` → Encoder → ``表示`` → Decoder → ``输出` + +应用:翻译、摘要 + +## 思考与练习 + +1. 为什么Decoder需要Masked Attention? + +2. Encoder-only和Decoder-only模型各有什么优势? + +3. Transformer如何处理超长序列? + +## 关键术语 + + ---------------------------------------------------------- + 中文 英文 说明 + --------------- --------------------- -------------------- + 残差连接 Residual Connection 跨层连接 + + 层归一化 Layer Normalization 归一化层 + + 教师强制 Teacher Forcing 训练时使用真实标签 + + 自回归 Autoregressive 基于前序生成后续 + + 编码器-解码器 Encoder-Decoder Seq2Seq架构 + ---------------------------------------------------------- + +## 延伸阅读 + +1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html) + + [Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用 + +--- + +## 学习目标 + +3. 理解从Transformer到ChatGPT的演进 + + 掌握RAG、RLHF等关键技术 + + 了解Prompt工程在设计中的应用 + +## 从Transformer到ChatGPT + +### GPT系列演进 + + ------------------------------------------------------ + 模型 发布时间 参数量 特点 + --------- ---------- -------- ------------------------ + GPT-1 2018 117M 验证Decoder-only可行性 + + GPT-2 2019 1.5B 展示零样本能力 + + GPT-3 2020 175B 少样本学习震撼业界 + + ChatGPT 2022 \~ 对话能力达到新高度 + + GPT-4 2023 \~ 多模态能力 + ------------------------------------------------------ + +### 训练范式 + +`预训练`` (Pre-training)``:`\ +` ``大规模文本`` → ``无监督学习`` → ``语言模型`\ +\ +`微调`` (Fine-tuning)``:`\ +` ``特定任务`` → ``有监督学习`` → ``任务模型` + +## RAG:检索增强生成 + +### 核心思想 {#核心思想-2} + + 用户提问 → 检索相关文档 → LLM生成答案 + ↑ + 外部知识库 + +### RAG架构 + +#### 文档索引 + +`文档`` → ``切分`` → Embedding → ``向量数据库` + +#### + +`2. ``检索阶段` + +#### 问题 → Embedding → 相似度搜索 → 相关文档 + +`3. ``生成阶段` + + 问题 + 相关文档 → LLM → 答案 + +### RAG优势 + + --------------------------- + 特点 说明 + ---------- ---------------- + 减少幻觉 基于检索的事实 + + 可更新 更新知识库即可 + + 可解释 显示参考来源 + --------------------------- + +## RLHF:人类反馈强化学习 + +### 为什么需要RLHF + +预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出 + +### RLHF三阶段 + +#### 有监督微调 (SFT) + +`人工标注对话`` → ``微调模型` + +`2. ``奖励模型`` (RM)` + +#### 多个输出 → 人类排序 → 训练奖励模型 + +`3. ``强化学习`` (RL)` + + PPO算法 → 优化策略 + +### 效果 + +1. 输出更符合人类偏好 + + 减少有害内容 + + 提高回答质量 + +## Prompt工程 + +### Prompt设计原则 + +#### 明确任务 + +`好:请总结以下文本的主要观点`\ +`差:看看这段文字` + +#### 提供示例 + +`任务:情感分类`\ +`示例:`\ +`"``这部电影太棒了!``" → ``正面`\ +`"``服务态度很差。``" → ``负面`\ +`现在分类:``"..."` + +### 指定格式 + +`请按以下格式输出:`\ +`- ``观点``1``:``...`\ +`- ``观点``2``:``...`\ +`- ``结论:``...` + +## 设计领域应用 ------------------------------------------------------- - 概念 英文 说明 - ------------ --------------------- -------------------- - 注意力机制 Attention 关注输入的重要部分 + 任务 Prompt示例 + ---------- -------------------------------------------- + 方案生成 "设计一个50人的办公空间,要求开放式布局" - 自注意力 Self-Attention 序列内部的关系建模 + 代码生成 "写一个Python脚本计算建筑容积率" - 位置编码 Positional Encoding 保留序列位置信息 - - 令牌 Token 文本的基本单位 + 文档撰写 "帮我写一份景观设计说明书的框架" ------------------------------------------------------- -## 03.1 注意力机制 +## 思考与练习 + +1. RAG和微调(Fine-tuning)各适用于什么场景? + +2. 如何评估LLM输出的质量? + +3. Prompt工程在设计工作流中能解决什么问题? + +## 关键术语 + + ------------------------------------------------------------------------------------ + 中文 英文 说明 + ------------------ -------------------- -------------------------------------------- + 检索增强生成 RAG Retrieval-Augmented Generation + + 人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback + + 提示工程 Prompt Engineering 设计输入以引导模型输出 + + 向量数据库 Vector Database 存储和检索向量表示 + + 幻觉 Hallucination 模型编造错误信息 + ------------------------------------------------------------------------------------ + +## 延伸阅读 + +1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165) + + [Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155) + + [LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/) diff --git a/05-generative-ai/04.1-diffusion.md b/05-generative-ai/04.1-diffusion.md deleted file mode 100644 index 31447c9..0000000 --- a/05-generative-ai/04.1-diffusion.md +++ /dev/null @@ -1,151 +0,0 @@ - -### 学习目标 - -1. 理解生成模型的发展脉络 - - 掌握Diffusion模型的基本原理 - - 了解各类生成模型的优缺点 - -### 生成模型家族 - -#### AE (Autoencoder,自编码器) - -`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构` - -思想:学习数据的压缩表示 - -问题:生成的图像模糊,缺乏多样性 - -#### VAE (Variational AE,变分自编码器) - -`潜在空间约束为标准正态分布`\ -` ↓`\ -`可以随机采样`` → ``解码`` → ``生成新图像` - -改进:引入概率分布,增强生成能力 - -#### GAN (Generative Adversarial Network) - -`生成器:生成假图像`\ -`判别器:判断真假`\ -` ↓`\ -`对抗训练,相互博弈` - -优势:生成图像质量高 问题:训练不稳定,模式崩溃 - -#### Diffusion Model (扩散模型) - -`前向:逐步加噪`` → ``纯噪声`\ -`反向:学习去噪`` → ``还原图像` - -优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3 - -### Diffusion原理 - -#### 前向过程 (加噪) - -`原图`` x₀`\ -` ↓ ``加高斯噪声`\ -`x₁ = x₀ + ε₁`\ -` ↓ ``加噪声`\ -`x₂ = x₁ + ε₂`\ -` ↓ ...`\ -`x_T`` = ``纯噪声` - -#### 反向过程 (去噪) - -`纯噪声`` ``x_T`\ -` ↓ ``去噪`\ -`x_{T-1} = ``去噪网络``(``x_T``)`\ -` ↓ ``去噪`\ -`x_{T-2} = ``去噪网络``(x_{T-1})`\ -` ↓ ...`\ -`x₀ = ``原始图像` - -#### 训练目标 - -`去噪网络学习预测:`\ -` ``添加的噪声`` ε`\ -` ``或`\ -` ``原始图像`` x₀` - -### Stable Diffusion架构 - -#### 潜在空间扩散 - -`为了效率,在潜在空间操作:`\ -\ -`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\ -` ↓`\ -` VAE``解码`` → ``图像` - -#### 核心组件 - - ------------------------------------- - 组件 作用 - -------------- ---------------------- - VAE 图像与潜在空间的转换 - - U-Net 去噪网络 - - Text Encoder 处理文本提示词 - - CLIP 文图对齐 - ------------------------------------- - -### 文生图工作流 - -#### 输入提示词 - -`"``一只猫,水彩画风格``"` - -#### - -`2. ``文本编码` - -#### → 文本向量表示 - -`3. ``初始化` - -#### → 随机噪声 - -`4. ``去噪循环` - -`for t in T...1:` - -`噪声`` → ``预测噪声`` → ``去噪` - -`5. ``解码输出` - - → 潜在表示 → VAE解码 → 图像 - -### 思考与练习 - -1. Diffusion为什么比GAN训练更稳定? - -2. 潜在空间扩散有什么优势? - -3. 文生图如何实现风格控制? - -### 关键术语 - - --------------------------------------------------- - 中文 英文 说明 - ---------- ----------------- ---------------------- - 潜在空间 Latent Space 压缩后的数据表示空间 - - 去噪 Denoising 移除噪声的过程 - - 提示词 Prompt 指导生成的文本描述 - - 潜变量 Latent Variable 不可直接观测的变量 - - 模式崩溃 Mode Collapse GAN生成多样性不足 - --------------------------------------------------- - -### 延伸阅读 - -1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239) - - [High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链 diff --git a/05-generative-ai/04.2-aigc-tools.md b/05-generative-ai/04.2-aigc-tools.md deleted file mode 100644 index ab7965c..0000000 --- a/05-generative-ai/04.2-aigc-tools.md +++ /dev/null @@ -1,180 +0,0 @@ - -## 学习目标 - -3. 掌握ControlNet的条件控制机制 - - 理解LoRA高效微调原理 - - 了解ComfyUI工作流搭建 - -## ControlNet:精确控制 - -核心问题 - -纯文生图:难以精确控制空间结构 - -### ControlNet解决 - -`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\ -` ↓`\ -`条件`` → ControlNet → ``主模型`` → ``输出图像` - -### 条件类型 - - ------------------------------------ - 条件 说明 应用 - -------------- ---------- ---------- - Canny 边缘检测 轮廓控制 - - Depth 深度图 空间关系 - - Pose 人体姿态 人物生成 - - Normal 法线图 表面细节 - - Segmentation 分割图 区域控制 - ------------------------------------ - -### 应用场景 - -`草图`` → ControlNet → ``精细效果图`\ -`平面图`` → ControlNet → ``三维渲染`\ -`结构图`` → ControlNet → ``风格化设计` - -LoRA:高效微调 - -问题 - -全量微调大模型:计算资源需求巨大 - -LoRA原理 - -`原始权重`` W ``固定`\ -` ↓`\ -`添加低秩分解:`\ -` ΔW = A × B`\ -` (``d×r``) × (``r×d``)`\ -` ↓`\ -`新输出`` = ``Wx`` + ``ABx` - -优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格 - -### 应用方式 - -`基础模型`` + ``LoRA`` A = ``风格``A`\ -`基础模型`` + ``LoRA`` B = ``风格``B`\ -`基础模型`` + ``LoRA`` A + B = ``混合风格` - -## ComfyUI:模块化工作流 - -### 核心特点 - -`节点化连接`\ -` ↓`\ -`可视化流程`\ -` ↓`\ -`灵活定制` - -### 典型节点 - - --------------------------------- - 节点类型 功能 - ------------------ -------------- - Load Checkpoint 加载模型 - - CLIP Text Encode 文本编码 - - KSampler 采样生成 - - VAE Decode 潜在空间解码 - - Save Image 保存图像 - - ControlNet 条件控制 - - LoRA Loader 加载LoRA - --------------------------------- - -### 工作流示例 - -`文本提示`` → CLIP``编码`` →`\ -` ↓`\ -`正负提示`` ────→ ``KSampler`` ← ControlNet`\ -` ↓`\ -` VAE``解码`\ -` ↓`\ -` ``保存图像` - -## 设计领域应用案例 - -### 建筑设计 - -`草图生成`` → ControlNet (Canny) → ``效果图`\ -`方案变体`` → ``LoRA``风格微调`` → ``多方案对比` - -### 室内设计 - -`户型图`` → ControlNet → ``三维效果图`\ -`风格迁移`` → ``LoRA`` → ``不同材质方案` - - --------------------------------------- - 工具 核心价值 - ------------------ -------------------- - Midjourney 快速创意探索 - - Stable Diffusion 本地部署,可控生成 - - ControlNet 精确结构控制 - - ComfyUI 定制化工作流 - --------------------------------------- - -## 版权与伦理 - -### 版权问题 - -6. AI训练数据的版权归属 - - AI生成作品的版权保护 - - 风格模仿的法律边界 - -### 伦理考量 - -9. 深度伪造 (Deepfake) - - 虚假信息传播 - - 创作者职业影响 - -## 思考与练习 - -1. ControlNet如何平衡条件控制与创造性? - -2. LoRA和全量微调各适用于什么场景? - -3. AIGC工具如何融入设计工作流? - -## 关键术语 - - ------------------------------------------------------ - 中文 英文 说明 - ---------- --------------------- --------------------- - 条件控制 Conditional Control 引导生成过程 - - 低秩适应 LoRA Low-Rank Adaptation - - 工作流 Workflow 节点化的处理流程 - - 采样器 Sampler 去噪采样算法 - - 潜在空间 Latent Space 压缩的特征空间 - ------------------------------------------------------ - -## 延伸阅读 - -1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543) - - [LoRA官方论文](https://arxiv.org/abs/2106.09685) - - [ComfyUI文档](https://docs.comfy.org/) diff --git a/05-generative-ai/05-generative-ai.md b/05-generative-ai/05-generative-ai.md index 8a497a0..34dabdc 100644 --- a/05-generative-ai/05-generative-ai.md +++ b/05-generative-ai/05-generative-ai.md @@ -8,24 +8,337 @@ 本篇将系统介绍生成模型的演进和AIGC工具链。 -## 章节目录 +--- -1. [04.1 生成模型演进](04.1-diffusion.md) - 从VAE/GAN到Diffusion +### 学习目标 - [04.2 AIGC设计工具链](04.2-aigc-tools.md) - ControlNet、LoRA与ComfyUI +1. 理解生成模型的发展脉络 -## 核心概念 + 掌握Diffusion模型的基本原理 - ----------------------------------------------------------- - 概念 英文 说明 - -------------- ----------- -------------------------------- - 自编码器 AE Autoencoder + 了解各类生成模型的优缺点 - 变分自编码器 VAE Variational Autoencoder +### 生成模型家族 - 生成对抗网络 GAN Generative Adversarial Network +#### AE (Autoencoder,自编码器) - 扩散模型 Diffusion Denoising Diffusion Model - ----------------------------------------------------------- +`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构` -## 04.1 生成模型演进 +思想:学习数据的压缩表示 + +问题:生成的图像模糊,缺乏多样性 + +#### VAE (Variational AE,变分自编码器) + +`潜在空间约束为标准正态分布`\ +` ↓`\ +`可以随机采样`` → ``解码`` → ``生成新图像` + +改进:引入概率分布,增强生成能力 + +#### GAN (Generative Adversarial Network) + +`生成器:生成假图像`\ +`判别器:判断真假`\ +` ↓`\ +`对抗训练,相互博弈` + +优势:生成图像质量高 问题:训练不稳定,模式崩溃 + +#### Diffusion Model (扩散模型) + +`前向:逐步加噪`` → ``纯噪声`\ +`反向:学习去噪`` → ``还原图像` + +优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3 + +### Diffusion原理 + +#### 前向过程 (加噪) + +`原图`` x₀`\ +` ↓ ``加高斯噪声`\ +`x₁ = x₀ + ε₁`\ +` ↓ ``加噪声`\ +`x₂ = x₁ + ε₂`\ +` ↓ ...`\ +`x_T`` = ``纯噪声` + +#### 反向过程 (去噪) + +`纯噪声`` ``x_T`\ +` ↓ ``去噪`\ +`x_{T-1} = ``去噪网络``(``x_T``)`\ +` ↓ ``去噪`\ +`x_{T-2} = ``去噪网络``(x_{T-1})`\ +` ↓ ...`\ +`x₀ = ``原始图像` + +#### 训练目标 + +`去噪网络学习预测:`\ +` ``添加的噪声`` ε`\ +` ``或`\ +` ``原始图像`` x₀` + +### Stable Diffusion架构 + +#### 潜在空间扩散 + +`为了效率,在潜在空间操作:`\ +\ +`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\ +` ↓`\ +` VAE``解码`` → ``图像` + +#### 核心组件 + + ------------------------------------- + 组件 作用 + -------------- ---------------------- + VAE 图像与潜在空间的转换 + + U-Net 去噪网络 + + Text Encoder 处理文本提示词 + + CLIP 文图对齐 + ------------------------------------- + +### 文生图工作流 + +#### 输入提示词 + +`"``一只猫,水彩画风格``"` + +#### + +`2. ``文本编码` + +#### → 文本向量表示 + +`3. ``初始化` + +#### → 随机噪声 + +`4. ``去噪循环` + +`for t in T...1:` + +`噪声`` → ``预测噪声`` → ``去噪` + +`5. ``解码输出` + + → 潜在表示 → VAE解码 → 图像 + +### 思考与练习 + +1. Diffusion为什么比GAN训练更稳定? + +2. 潜在空间扩散有什么优势? + +3. 文生图如何实现风格控制? + +### 关键术语 + + --------------------------------------------------- + 中文 英文 说明 + ---------- ----------------- ---------------------- + 潜在空间 Latent Space 压缩后的数据表示空间 + + 去噪 Denoising 移除噪声的过程 + + 提示词 Prompt 指导生成的文本描述 + + 潜变量 Latent Variable 不可直接观测的变量 + + 模式崩溃 Mode Collapse GAN生成多样性不足 + --------------------------------------------------- + +### 延伸阅读 + +1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239) + + [High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链 + +--- + +## 学习目标 + +3. 掌握ControlNet的条件控制机制 + + 理解LoRA高效微调原理 + + 了解ComfyUI工作流搭建 + +## ControlNet:精确控制 + +核心问题 + +纯文生图:难以精确控制空间结构 + +### ControlNet解决 + +`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\ +` ↓`\ +`条件`` → ControlNet → ``主模型`` → ``输出图像` + +### 条件类型 + + ------------------------------------ + 条件 说明 应用 + -------------- ---------- ---------- + Canny 边缘检测 轮廓控制 + + Depth 深度图 空间关系 + + Pose 人体姿态 人物生成 + + Normal 法线图 表面细节 + + Segmentation 分割图 区域控制 + ------------------------------------ + +### 应用场景 + +`草图`` → ControlNet → ``精细效果图`\ +`平面图`` → ControlNet → ``三维渲染`\ +`结构图`` → ControlNet → ``风格化设计` + +LoRA:高效微调 + +问题 + +全量微调大模型:计算资源需求巨大 + +LoRA原理 + +`原始权重`` W ``固定`\ +` ↓`\ +`添加低秩分解:`\ +` ΔW = A × B`\ +` (``d×r``) × (``r×d``)`\ +` ↓`\ +`新输出`` = ``Wx`` + ``ABx` + +优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格 + +### 应用方式 + +`基础模型`` + ``LoRA`` A = ``风格``A`\ +`基础模型`` + ``LoRA`` B = ``风格``B`\ +`基础模型`` + ``LoRA`` A + B = ``混合风格` + +## ComfyUI:模块化工作流 + +### 核心特点 + +`节点化连接`\ +` ↓`\ +`可视化流程`\ +` ↓`\ +`灵活定制` + +### 典型节点 + + --------------------------------- + 节点类型 功能 + ------------------ -------------- + Load Checkpoint 加载模型 + + CLIP Text Encode 文本编码 + + KSampler 采样生成 + + VAE Decode 潜在空间解码 + + Save Image 保存图像 + + ControlNet 条件控制 + + LoRA Loader 加载LoRA + --------------------------------- + +### 工作流示例 + +`文本提示`` → CLIP``编码`` →`\ +` ↓`\ +`正负提示`` ────→ ``KSampler`` ← ControlNet`\ +` ↓`\ +` VAE``解码`\ +` ↓`\ +` ``保存图像` + +## 设计领域应用案例 + +### 建筑设计 + +`草图生成`` → ControlNet (Canny) → ``效果图`\ +`方案变体`` → ``LoRA``风格微调`` → ``多方案对比` + +### 室内设计 + +`户型图`` → ControlNet → ``三维效果图`\ +`风格迁移`` → ``LoRA`` → ``不同材质方案` + + --------------------------------------- + 工具 核心价值 + ------------------ -------------------- + Midjourney 快速创意探索 + + Stable Diffusion 本地部署,可控生成 + + ControlNet 精确结构控制 + + ComfyUI 定制化工作流 + --------------------------------------- + +## 版权与伦理 + +### 版权问题 + +6. AI训练数据的版权归属 + + AI生成作品的版权保护 + + 风格模仿的法律边界 + +### 伦理考量 + +9. 深度伪造 (Deepfake) + + 虚假信息传播 + + 创作者职业影响 + +## 思考与练习 + +1. ControlNet如何平衡条件控制与创造性? + +2. LoRA和全量微调各适用于什么场景? + +3. AIGC工具如何融入设计工作流? + +## 关键术语 + + ------------------------------------------------------ + 中文 英文 说明 + ---------- --------------------- --------------------- + 条件控制 Conditional Control 引导生成过程 + + 低秩适应 LoRA Low-Rank Adaptation + + 工作流 Workflow 节点化的处理流程 + + 采样器 Sampler 去噪采样算法 + + 潜在空间 Latent Space 压缩的特征空间 + ------------------------------------------------------ + +## 延伸阅读 + +1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543) + + [LoRA官方论文](https://arxiv.org/abs/2106.09685) + + [ComfyUI文档](https://docs.comfy.org/) diff --git a/06-agent/05.1-agent-architecture.md b/06-agent/05.1-agent-architecture.md deleted file mode 100644 index 9da32f5..0000000 --- a/06-agent/05.1-agent-architecture.md +++ /dev/null @@ -1,148 +0,0 @@ - -## 学习目标 - -1. 理解从规则到LLM-based Agent的演进 - - 掌握Agent的核心组件 - - 了解ReAct和CoT推理模式 - -## 从规则到LLM Agent - -### 规则系统时代 - -`if`` ``condition_A``:`\ -` ``action_``B``(``)`\ -`elif`` ``condition_C``:`\ -` ``action_D``()`\ -`else``:`\ -` ``action_E``()` - -局限:规则难以穷举,无法应对新情况 - -### LLM-based Agent - -`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出` - -优势: - 自然语言交互 - 上下文理解 - 泛化能力强 - -## Agent核心组件 - -### 感知 (Perception) - -`输入信息`` → ``理解与解析`\ -` - ``用户指令`\ -` - ``环境状态`\ -` - ``工具反馈` - -### 规划 (Planning) - -`目标`` → ``分解为子任务`\ -` - ``任务分析`\ -` - ``步骤规划`\ -` - ``依赖管理` - -### 记忆 (Memory) - -`┌─────────────────────────────┐`\ -`│ ``短期记忆`` (Short-term) │`\ -`│ ``对话上下文、临时状态`` │`\ -`├─────────────────────────────┤`\ -`│ ``长期记忆`` (Long-term) │`\ -`│ ``知识库、经验积累`` │`\ -`└─────────────────────────────┘` - -### 工具调用 (Tool Use) - -`可用工具集:`\ -` - ``数据库查询`\ -` - API``调用`\ -` - ``文件操作`\ -` - ``代码执行`\ -` ...` - -## 推理模式 - -Chain of Thought (CoT) - -`问题`` → ``思考链`` → ``答案` - -`"``设计一个公园``"` - -` ↓` - -1. `分析场地条件` - -2. `2. ``确定功能分区` - -3. `3. ``布局路径系统` - -`4. ``选择植物配置` - -`↓` - - 完整方案 - -### ReAct (Reasoning + Acting) - -`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\ -\ -`思考:需要查询场地数据`\ -`行动:调用``GIS``工具`\ -`观察:获取到高程信息`\ -`思考:基于高程做排水设计`\ -`行动:生成排水方案`\ -`...` - -## Agent架构示例 - -单Agent架构 - -`┌─────────────────────────────┐`\ -`│ LLM Core │`\ -`│ (``规划、推理、决策``) │`\ -`├─────────────────────────────┤`\ -`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\ -`│ │``感知``││``记忆``││``工具``││``反思``│ │`\ -`│ └───┘ └───┘ └───┘ └───┘ │`\ -`└─────────────────────────────┘`\ -` ↓`\ -` ``执行任务` - -### 多Agent协作 - -`┌─────────┐ ┌─────────┐ ┌─────────┐`\ -`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\ -`└─────────┘ └─────────┘ └─────────┘`\ -` ↓ ↓ ↓`\ -` ``任务分解`` ``数据分析`` ``方案生成` - -## 思考与练习 - -1. 单Agent和多Agent系统各有什么优势? - -2. 如何设计Agent的记忆系统? - -3. CoT和ReAct各适用于什么场景? - -## 关键术语 - - -------------------------------------------- - 中文 英文 说明 - ---------- ------------ -------------------- - 思考链 CoT Chain of Thought - - 推理行动 ReAct Reasoning + Acting - - 记忆 Memory 存储和检索信息 - - 反思 Reflection 自我评估与改进 - - 工具使用 Tool Use 调用外部能力 - -------------------------------------------- - -## 延伸阅读 - -1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/) - - [ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能 diff --git a/06-agent/05.2-embodied-ai.md b/06-agent/05.2-embodied-ai.md deleted file mode 100644 index d41cb2f..0000000 --- a/06-agent/05.2-embodied-ai.md +++ /dev/null @@ -1,157 +0,0 @@ - -# 学习目标 - -3. 理解具身智能的概念和特点 - - 了解数字孪生与物理世界的交互 - - 掌握强化学习在具身AI中的应用 - -# 什么是具身智能 - -## 定义 - -**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。 - -## 与传统AI的区别 - - ------------------------------------ - 特性 传统AI 具身AI - ---------- ------------ ------------ - 交互方式 数据输入 主动探索 - - 学习方式 从数据学习 从交互学习 - - 输出形式 预测/生成 行动/操作 - ------------------------------------ - -# 数字孪生 - -## 概念 - -`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制` - -## 应用层次 - - -------------------------------- - 层次 内容 应用 - ---------- ---------- ---------- - 几何孪生 三维模型 可视化 - - 物理孪生 物理仿真 性能分析 - - 行为孪生 行为模拟 场景预测 - - 认知孪生 决策支持 智能控制 - -------------------------------- - -# 强化学习基础 - -## 核心要素 - -`┌─────────────────────────────────────┐`\ -`│ │`\ -`│ ``环境`` ← ``状态`` ──────→ Agent │`\ -`│ ↑ │ │`\ -`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\ -`│ │`\ -`└─────────────────────────────────────┘` - -## 训练循环 - -1. `观察环境状态` - -2. `选择行动` - -3. `执行行动` - -4. `获得奖励` - -5. `更新策略` - -6. `重复``...` - -## Gymnasium环境 - -`import gymnasium as gym`\ -\ -`env = ``gym.make``("CartPole-v1")`\ -`state, _ = ``env.reset``()`\ -\ -`for _ in range(1000):`\ -` action = policy(state)`\ -` state, reward, done, _, _ = ``env.step``(action)`\ -` if done:`\ -` break` - -# 具身AI应用场景 - -## 机器人设计 - -`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\ -` ↓`\ -`建筑机器人、施工机器人` - -## 虚拟角色 - -`游戏``NPC``、虚拟助手、元宇宙居民`\ -` ↓`\ -`自然行为、智能对话` - -## 仿真训练 - -`虚拟环境`` → ``训练策略`` → ``迁移到真实`\ -` ↓`\ -`降低试错成本` - -# 虚拟到真实的迁移 - -## 挑战 - - ----------------------------------- - 问题 说明 - -------------- -------------------- - Sim2Real Gap 仿真与现实的差异 - - 感官差异 虚拟与真实感知不同 - - 物理特性 真实物理更复杂 - ----------------------------------- - -## 解决方案 - -1. 域随机化 (Domain Randomization) - - 真实数据混合 - - 在线微调 - -# 思考与练习 - -1. 具身智能在规划设计中有哪些应用前景? - -2. 数字孪生如何辅助设计决策? - -3. Sim2Real迁移的主要挑战是什么? - -# 关键术语 - - -------------------------------------------------- - 中文 英文 说明 - ---------- -------------- ------------------------ - 具身智能 Embodied AI 有身体形式的AI - - 数字孪生 Digital Twin 物理世界的数字映射 - - 强化学习 RL Reinforcement Learning - - 状态 State 环境的当前情况 - - 动作 Action Agent对环境的影响 - -------------------------------------------------- - -# 延伸阅读 - -1. [Gymnasium文档](https://gymnasium.org.cn/) - - [DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP diff --git a/06-agent/05.3-design-application.md b/06-agent/05.3-design-application.md deleted file mode 100644 index a183941..0000000 --- a/06-agent/05.3-design-application.md +++ /dev/null @@ -1,215 +0,0 @@ - -# 学习目标 - -3. 理解MCP协议的核心思想 - - 掌握HITL协作模式 - - 了解Agent在规划设计中的落地场景 - -# MCP协议 - -## 什么是MCP - -**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。 - -## 核心价值 - -`传统方式:`\ -` AI``模型`` → ``各自独立`` → ``数据孤岛`\ -\ -`MCP``方式:`\ -` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据` - -MCP架构 - -`┌─────────────────────────────────────┐`\ -`│ AI Application │`\ -`│ (Claude, ``ChatGPT``, ``等``) │`\ -`└─────────────┬───────────────────────┘`\ -` │ MCP`\ -`┌─────────────┴───────────────────────┐`\ -`│ MCP Client │`\ -`├─────────────────────────────────────┤`\ -`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\ -`│ │File │ │DB │ │API │ ... │`\ -`│ │``Server│ │Server│ │Server│ │`\ -`│ └──────┘ └──────┘ └──────┘ │`\ -`└─────────────────────────────────────┘` - -# HITL:人机协作模式 - -## 什么是HITL - -**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。 - -## HITL层次 - - ---------------------------------- - 层次 人类角色 自动化程度 - ---------- ---------- ------------ - 完全自动 无 100% - - 人工审核 监督者 80-90% - - 交互决策 合作伙伴 50-70% - - 人工主导 操作者 \<50% - ---------------------------------- - -## 规划设计中的HITL - -`AI``生成方案`\ -` ↓`\ -`设计师审核`` ← ``修改意见`` → AI``调整`\ -` ↓`\ -`最终确认` - -# 规划设计Agent案例 - -## 场景分析Agent - -`输入:场地数据` - -`↓` - -`分析流程:` - -1. `地形分析`` (``坡度、高程``)` - -2. `气候分析`` (``日照、风向``)` - -3. `交通分析`` (``可达性``)` - -4. `视觉分析`` (``视域、景观``)` - -`↓` - -`输出:场地分析报告` - -## 方案生成Agent - -`输入:设计要求`` + ``场地分析` - -`↓` - -`生成流程:` - -1. `理解需求`` (``CoT``推理``)` - -2. `布局功能`` (``工具调用``)` - -3. `连接路径`` (``图算法``)` - -4. `优化调整`` (``迭代改进``)` - -`↓` - -`输出:初步设计方案` - -## 合规审查Agent - -`输入:设计方案` - -`↓` - -`审查流程:` - -1. `调用规范库` - -2. `逐条核对` - -3. `标记问题` - -4. `生成报告` - -`↓` - -`输出:合规审查意见` - -# Agent落地挑战 - -技术挑战 - - --------------------------- - 挑战 说明 - ---------- ---------------- - 准确性 复杂任务易出错 - - 可解释性 决策过程不透明 - - 鲁棒性 边界情况处理 - --------------------------- - -应用挑战 - - ----------------------------- - 挑战 说明 - ------------ ---------------- - 工作流整合 与现有流程融合 - - 责任界定 AI错误的后果 - - 成本控制 API调用费用 - ----------------------------- - -## 解决方向 - -1. 分级应用:简单任务自动化,复杂任务辅助 - - 渐进式:从局部到整体 - - 人机协同:关键环节人工确认 - -# 未来展望:AI设计师 - -### 短期 (1-2年) - -`AI``作为工具`\ -` - ``数据分析`\ -` - ``方案生成`\ -` - ``合规检查` - -### 中期 (3-5年) - -`AI``作为助手`\ -` - ``创意启发`\ -` - ``方案优化`\ -` - ``文档撰写` - -### 长期 (5-10年) - -`AI``作为合作伙伴`\ -` - ``共同创造`\ -` - ``自主决策`\ -` - ``专业评审` - -## 思考与练习 - -1. MCP如何解决AI应用的"数据孤岛"问题? - -2. 规划设计中哪些环节适合引入HITL? - -3. AI设计师如何与人类设计师协作? - -## 关键术语 - - ---------------------------------------------------------------- - 中文 英文 说明 - ---------------- ---------------------- ------------------------ - 模型上下文协议 MCP Model Context Protocol - - 人在回路 HITL Human-in-the-Loop - - 数据孤岛 Data Silo 独立的数据存储 - - 协议 Protocol 通信标准 - - 工作流整合 Workflow Integration 融入现有流程 - ---------------------------------------------------------------- - -## 延伸阅读 - -1. [MCP官方文档](https://modelcontextprotocol.io/) - - [Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629) diff --git a/06-agent/06-agent.md b/06-agent/06-agent.md index 55746a1..91a6255 100644 --- a/06-agent/06-agent.md +++ b/06-agent/06-agent.md @@ -8,26 +8,528 @@ AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行 本篇将系统介绍Agent架构和在设计领域的应用。 -# 章节目录 +--- -1. [05.1 AI Agent架构](05.1-agent-architecture.md) - LLM-based Agent与核心组件 +## 学习目标 - [05.2 具身智能](05.2-embodied-ai.md) - 数字孪生与物理世界交互 +1. 理解从规则到LLM-based Agent的演进 - [05.3 规划设计应用与MCP](05.3-design-application.md) - MCP协议与HITL协作 + 掌握Agent的核心组件 -# 核心概念 + 了解ReAct和CoT推理模式 - ------------------------------------------------------- - 概念 英文 说明 - ---------------- ------------- ------------------------ - 智能体 Agent 自主决策和行动的系统 +## 从规则到LLM Agent - 具身智能 Embodied AI 有物理实体的智能 +### 规则系统时代 - 人机协作 HITL Human-in-the-Loop +`if`` ``condition_A``:`\ +` ``action_``B``(``)`\ +`elif`` ``condition_C``:`\ +` ``action_D``()`\ +`else``:`\ +` ``action_E``()` - 模型上下文协议 MCP Model Context Protocol - ------------------------------------------------------- +局限:规则难以穷举,无法应对新情况 -# 05.1 AI Agent架构 +### LLM-based Agent + +`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出` + +优势: - 自然语言交互 - 上下文理解 - 泛化能力强 + +## Agent核心组件 + +### 感知 (Perception) + +`输入信息`` → ``理解与解析`\ +` - ``用户指令`\ +` - ``环境状态`\ +` - ``工具反馈` + +### 规划 (Planning) + +`目标`` → ``分解为子任务`\ +` - ``任务分析`\ +` - ``步骤规划`\ +` - ``依赖管理` + +### 记忆 (Memory) + +`┌─────────────────────────────┐`\ +`│ ``短期记忆`` (Short-term) │`\ +`│ ``对话上下文、临时状态`` │`\ +`├─────────────────────────────┤`\ +`│ ``长期记忆`` (Long-term) │`\ +`│ ``知识库、经验积累`` │`\ +`└─────────────────────────────┘` + +### 工具调用 (Tool Use) + +`可用工具集:`\ +` - ``数据库查询`\ +` - API``调用`\ +` - ``文件操作`\ +` - ``代码执行`\ +` ...` + +## 推理模式 + +Chain of Thought (CoT) + +`问题`` → ``思考链`` → ``答案` + +`"``设计一个公园``"` + +` ↓` + +1. `分析场地条件` + +2. `2. ``确定功能分区` + +3. `3. ``布局路径系统` + +`4. ``选择植物配置` + +`↓` + + 完整方案 + +### ReAct (Reasoning + Acting) + +`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\ +\ +`思考:需要查询场地数据`\ +`行动:调用``GIS``工具`\ +`观察:获取到高程信息`\ +`思考:基于高程做排水设计`\ +`行动:生成排水方案`\ +`...` + +## Agent架构示例 + +单Agent架构 + +`┌─────────────────────────────┐`\ +`│ LLM Core │`\ +`│ (``规划、推理、决策``) │`\ +`├─────────────────────────────┤`\ +`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\ +`│ │``感知``││``记忆``││``工具``││``反思``│ │`\ +`│ └───┘ └───┘ └───┘ └───┘ │`\ +`└─────────────────────────────┘`\ +` ↓`\ +` ``执行任务` + +### 多Agent协作 + +`┌─────────┐ ┌─────────┐ ┌─────────┐`\ +`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\ +`└─────────┘ └─────────┘ └─────────┘`\ +` ↓ ↓ ↓`\ +` ``任务分解`` ``数据分析`` ``方案生成` + +## 思考与练习 + +1. 单Agent和多Agent系统各有什么优势? + +2. 如何设计Agent的记忆系统? + +3. CoT和ReAct各适用于什么场景? + +## 关键术语 + + -------------------------------------------- + 中文 英文 说明 + ---------- ------------ -------------------- + 思考链 CoT Chain of Thought + + 推理行动 ReAct Reasoning + Acting + + 记忆 Memory 存储和检索信息 + + 反思 Reflection 自我评估与改进 + + 工具使用 Tool Use 调用外部能力 + -------------------------------------------- + +## 延伸阅读 + +1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/) + + [ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能 + +--- + +# 学习目标 + +3. 理解具身智能的概念和特点 + + 了解数字孪生与物理世界的交互 + + 掌握强化学习在具身AI中的应用 + +# 什么是具身智能 + +## 定义 + +**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。 + +## 与传统AI的区别 + + ------------------------------------ + 特性 传统AI 具身AI + ---------- ------------ ------------ + 交互方式 数据输入 主动探索 + + 学习方式 从数据学习 从交互学习 + + 输出形式 预测/生成 行动/操作 + ------------------------------------ + +# 数字孪生 + +## 概念 + +`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制` + +## 应用层次 + + -------------------------------- + 层次 内容 应用 + ---------- ---------- ---------- + 几何孪生 三维模型 可视化 + + 物理孪生 物理仿真 性能分析 + + 行为孪生 行为模拟 场景预测 + + 认知孪生 决策支持 智能控制 + -------------------------------- + +# 强化学习基础 + +## 核心要素 + +`┌─────────────────────────────────────┐`\ +`│ │`\ +`│ ``环境`` ← ``状态`` ──────→ Agent │`\ +`│ ↑ │ │`\ +`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\ +`│ │`\ +`└─────────────────────────────────────┘` + +## 训练循环 + +1. `观察环境状态` + +2. `选择行动` + +3. `执行行动` + +4. `获得奖励` + +5. `更新策略` + +6. `重复``...` + +## Gymnasium环境 + +`import gymnasium as gym`\ +\ +`env = ``gym.make``("CartPole-v1")`\ +`state, _ = ``env.reset``()`\ +\ +`for _ in range(1000):`\ +` action = policy(state)`\ +` state, reward, done, _, _ = ``env.step``(action)`\ +` if done:`\ +` break` + +# 具身AI应用场景 + +## 机器人设计 + +`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\ +` ↓`\ +`建筑机器人、施工机器人` + +## 虚拟角色 + +`游戏``NPC``、虚拟助手、元宇宙居民`\ +` ↓`\ +`自然行为、智能对话` + +## 仿真训练 + +`虚拟环境`` → ``训练策略`` → ``迁移到真实`\ +` ↓`\ +`降低试错成本` + +# 虚拟到真实的迁移 + +## 挑战 + + ----------------------------------- + 问题 说明 + -------------- -------------------- + Sim2Real Gap 仿真与现实的差异 + + 感官差异 虚拟与真实感知不同 + + 物理特性 真实物理更复杂 + ----------------------------------- + +## 解决方案 + +1. 域随机化 (Domain Randomization) + + 真实数据混合 + + 在线微调 + +# 思考与练习 + +1. 具身智能在规划设计中有哪些应用前景? + +2. 数字孪生如何辅助设计决策? + +3. Sim2Real迁移的主要挑战是什么? + +# 关键术语 + + -------------------------------------------------- + 中文 英文 说明 + ---------- -------------- ------------------------ + 具身智能 Embodied AI 有身体形式的AI + + 数字孪生 Digital Twin 物理世界的数字映射 + + 强化学习 RL Reinforcement Learning + + 状态 State 环境的当前情况 + + 动作 Action Agent对环境的影响 + -------------------------------------------------- + +# 延伸阅读 + +1. [Gymnasium文档](https://gymnasium.org.cn/) + + [DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP + +--- + +# 学习目标 + +3. 理解MCP协议的核心思想 + + 掌握HITL协作模式 + + 了解Agent在规划设计中的落地场景 + +# MCP协议 + +## 什么是MCP + +**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。 + +## 核心价值 + +`传统方式:`\ +` AI``模型`` → ``各自独立`` → ``数据孤岛`\ +\ +`MCP``方式:`\ +` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据` + +MCP架构 + +`┌─────────────────────────────────────┐`\ +`│ AI Application │`\ +`│ (Claude, ``ChatGPT``, ``等``) │`\ +`└─────────────┬───────────────────────┘`\ +` │ MCP`\ +`┌─────────────┴───────────────────────┐`\ +`│ MCP Client │`\ +`├─────────────────────────────────────┤`\ +`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\ +`│ │File │ │DB │ │API │ ... │`\ +`│ │``Server│ │Server│ │Server│ │`\ +`│ └──────┘ └──────┘ └──────┘ │`\ +`└─────────────────────────────────────┘` + +# HITL:人机协作模式 + +## 什么是HITL + +**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。 + +## HITL层次 + + ---------------------------------- + 层次 人类角色 自动化程度 + ---------- ---------- ------------ + 完全自动 无 100% + + 人工审核 监督者 80-90% + + 交互决策 合作伙伴 50-70% + + 人工主导 操作者 \<50% + ---------------------------------- + +## 规划设计中的HITL + +`AI``生成方案`\ +` ↓`\ +`设计师审核`` ← ``修改意见`` → AI``调整`\ +` ↓`\ +`最终确认` + +# 规划设计Agent案例 + +## 场景分析Agent + +`输入:场地数据` + +`↓` + +`分析流程:` + +1. `地形分析`` (``坡度、高程``)` + +2. `气候分析`` (``日照、风向``)` + +3. `交通分析`` (``可达性``)` + +4. `视觉分析`` (``视域、景观``)` + +`↓` + +`输出:场地分析报告` + +## 方案生成Agent + +`输入:设计要求`` + ``场地分析` + +`↓` + +`生成流程:` + +1. `理解需求`` (``CoT``推理``)` + +2. `布局功能`` (``工具调用``)` + +3. `连接路径`` (``图算法``)` + +4. `优化调整`` (``迭代改进``)` + +`↓` + +`输出:初步设计方案` + +## 合规审查Agent + +`输入:设计方案` + +`↓` + +`审查流程:` + +1. `调用规范库` + +2. `逐条核对` + +3. `标记问题` + +4. `生成报告` + +`↓` + +`输出:合规审查意见` + +# Agent落地挑战 + +技术挑战 + + --------------------------- + 挑战 说明 + ---------- ---------------- + 准确性 复杂任务易出错 + + 可解释性 决策过程不透明 + + 鲁棒性 边界情况处理 + --------------------------- + +应用挑战 + + ----------------------------- + 挑战 说明 + ------------ ---------------- + 工作流整合 与现有流程融合 + + 责任界定 AI错误的后果 + + 成本控制 API调用费用 + ----------------------------- + +## 解决方向 + +1. 分级应用:简单任务自动化,复杂任务辅助 + + 渐进式:从局部到整体 + + 人机协同:关键环节人工确认 + +# 未来展望:AI设计师 + +### 短期 (1-2年) + +`AI``作为工具`\ +` - ``数据分析`\ +` - ``方案生成`\ +` - ``合规检查` + +### 中期 (3-5年) + +`AI``作为助手`\ +` - ``创意启发`\ +` - ``方案优化`\ +` - ``文档撰写` + +### 长期 (5-10年) + +`AI``作为合作伙伴`\ +` - ``共同创造`\ +` - ``自主决策`\ +` - ``专业评审` + +## 思考与练习 + +1. MCP如何解决AI应用的"数据孤岛"问题? + +2. 规划设计中哪些环节适合引入HITL? + +3. AI设计师如何与人类设计师协作? + +## 关键术语 + + ---------------------------------------------------------------- + 中文 英文 说明 + ---------------- ---------------------- ------------------------ + 模型上下文协议 MCP Model Context Protocol + + 人在回路 HITL Human-in-the-Loop + + 数据孤岛 Data Silo 独立的数据存储 + + 协议 Protocol 通信标准 + + 工作流整合 Workflow Integration 融入现有流程 + ---------------------------------------------------------------- + +## 延伸阅读 + +1. [MCP官方文档](https://modelcontextprotocol.io/) + + [Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629) diff --git a/07-digital-media/07-digital-media.md b/07-digital-media/07-digital-media.md index 26ddf82..2383024 100644 --- a/07-digital-media/07-digital-media.md +++ b/07-digital-media/07-digital-media.md @@ -8,10 +8,154 @@ 本部分将系统介绍AI在视觉设计和交互设计中的应用。 -## 章节目录 +--- -1. [第16章 视觉设计与AIGC](#第16章-视觉设计与aicgc) +## 学习目标 - [第17章 交互设计](#第17章-交互设计-1) +1. 了解AIGC在视觉设计中的应用场景 -# 第16章 视觉设计与AIGC + 掌握图像生成和风格迁移的基本方法 + + 理解AI辅助品牌视觉设计的流程 + +## 核心应用 + +图像生成与风格迁移 + + --------------------------------------------------------------------------------------- + 应用类型 说明 工具示例 + -------------------------- ---------------------- ------------------------------------- + 文生图 从文本描述生成图像 Midjourney, Stable Diffusion + + 图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting + + 风格迁移 将图像转换为目标风格 Neural Style Transfer + + 矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI + --------------------------------------------------------------------------------------- + +Logo与图标设计 + +### AI辅助流程: + +#### 需求分析 + +`- ``品牌定位` + +`- ``目标受众` + +`- ``设计风格偏好` + +#### + +`2. ``概念生成` + +`- AI``生成多个设计方案` + +#### - 快速迭代探索 + +`3. ``细化优化` + +`- ``设计师精修` + +`- ``矢量化处理` + + - 品牌规范整理 + +**工具推荐**: - LogoAI:自动Logo生成 - Looka:品牌设计套件 - Brandmark:Logo和品牌身份 + +品牌视觉系统生成 + +**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成 + +## 案例分析 + +**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展 + +**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比 + +## 思考与练习 + +1. AIGC如何改变设计师的创意流程? + +2. 在品牌设计中,如何平衡AI生成与原创性? + +3. 选择一个AIGC工具,尝试完成一个视觉设计任务 + +--- + +### 学习目标 + +1. 了解AI在交互设计中的应用 + + 掌握用户界面自动生成的原理 + + 理解用户体验分析的方法 + +### 核心应用 + +用户界面生成 + + -------------------------------------------------------- + 功能 说明 工具示例 + ---------- -------------------- ------------------------ + 布局生成 自动生成页面布局 Uizard, Galileo AI + + 组件推荐 基于上下文推荐组件 Figma AI, Motiff + + 设计系统 自动生成设计规范 Designer, Figma Tokens + + 原型生成 从描述生成交互原型 TLDraw, Diagram + -------------------------------------------------------- + +交互原型自动化 + +**流程**: + +`用户需求`` → AI``理解`` → ``生成原型`\ +` ↓`\ +` ``设计师调整优化`\ +` ↓`\ +` ``可交互原型` + +**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档 + +用户体验分析 + +**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析 + +### 案例分析 + +**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试 + +**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化 + +### 思考与练习 + +1. AI生成的界面如何保证可用性? + +2. 在交互设计中,人类设计师的核心价值是什么? + +3. 尝试用AI工具生成一个简单的交互原型 + +### 关键术语 + + -------------------------------------------------- + 中文 英文 说明 + ---------- ---------------- ---------------------- + 风格迁移 Style Transfer 将图像转换为目标风格 + + 矢量化 Vectorization 转换为可缩放矢量格式 + + 原型 Prototype 可交互的设计模型 + + 设计系统 Design System 组件化设计规范 + -------------------------------------------------- + +### 延伸阅读 + +1. [Midjourney官方文档](https://docs.midjourney.com/) + + [Stable Diffusion提示词指南](https://stable-diffusion-art.com/) + + [Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI) diff --git a/07-digital-media/ch16-visual-design-aigc.md b/07-digital-media/ch16-visual-design-aigc.md deleted file mode 100644 index 117a2e3..0000000 --- a/07-digital-media/ch16-visual-design-aigc.md +++ /dev/null @@ -1,72 +0,0 @@ - -## 学习目标 - -1. 了解AIGC在视觉设计中的应用场景 - - 掌握图像生成和风格迁移的基本方法 - - 理解AI辅助品牌视觉设计的流程 - -## 核心应用 - -图像生成与风格迁移 - - --------------------------------------------------------------------------------------- - 应用类型 说明 工具示例 - -------------------------- ---------------------- ------------------------------------- - 文生图 从文本描述生成图像 Midjourney, Stable Diffusion - - 图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting - - 风格迁移 将图像转换为目标风格 Neural Style Transfer - - 矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI - --------------------------------------------------------------------------------------- - -Logo与图标设计 - -### AI辅助流程: - -#### 需求分析 - -`- ``品牌定位` - -`- ``目标受众` - -`- ``设计风格偏好` - -#### - -`2. ``概念生成` - -`- AI``生成多个设计方案` - -#### - 快速迭代探索 - -`3. ``细化优化` - -`- ``设计师精修` - -`- ``矢量化处理` - - - 品牌规范整理 - -**工具推荐**: - LogoAI:自动Logo生成 - Looka:品牌设计套件 - Brandmark:Logo和品牌身份 - -品牌视觉系统生成 - -**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成 - -## 案例分析 - -**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展 - -**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比 - -## 思考与练习 - -1. AIGC如何改变设计师的创意流程? - -2. 在品牌设计中,如何平衡AI生成与原创性? - -3. 选择一个AIGC工具,尝试完成一个视觉设计任务 diff --git a/07-digital-media/ch17-interaction-design.md b/07-digital-media/ch17-interaction-design.md deleted file mode 100644 index 0c1cd4b..0000000 --- a/07-digital-media/ch17-interaction-design.md +++ /dev/null @@ -1,76 +0,0 @@ - -### 学习目标 - -1. 了解AI在交互设计中的应用 - - 掌握用户界面自动生成的原理 - - 理解用户体验分析的方法 - -### 核心应用 - -用户界面生成 - - -------------------------------------------------------- - 功能 说明 工具示例 - ---------- -------------------- ------------------------ - 布局生成 自动生成页面布局 Uizard, Galileo AI - - 组件推荐 基于上下文推荐组件 Figma AI, Motiff - - 设计系统 自动生成设计规范 Designer, Figma Tokens - - 原型生成 从描述生成交互原型 TLDraw, Diagram - -------------------------------------------------------- - -交互原型自动化 - -**流程**: - -`用户需求`` → AI``理解`` → ``生成原型`\ -` ↓`\ -` ``设计师调整优化`\ -` ↓`\ -` ``可交互原型` - -**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档 - -用户体验分析 - -**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析 - -### 案例分析 - -**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试 - -**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化 - -### 思考与练习 - -1. AI生成的界面如何保证可用性? - -2. 在交互设计中,人类设计师的核心价值是什么? - -3. 尝试用AI工具生成一个简单的交互原型 - -### 关键术语 - - -------------------------------------------------- - 中文 英文 说明 - ---------- ---------------- ---------------------- - 风格迁移 Style Transfer 将图像转换为目标风格 - - 矢量化 Vectorization 转换为可缩放矢量格式 - - 原型 Prototype 可交互的设计模型 - - 设计系统 Design System 组件化设计规范 - -------------------------------------------------- - -### 延伸阅读 - -1. [Midjourney官方文档](https://docs.midjourney.com/) - - [Stable Diffusion提示词指南](https://stable-diffusion-art.com/) - - [Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI) diff --git a/08-environmental-design/08-environmental-design.md b/08-environmental-design/08-environmental-design.md index 45a8df7..31ab3aa 100644 --- a/08-environmental-design/08-environmental-design.md +++ b/08-environmental-design/08-environmental-design.md @@ -8,10 +8,146 @@ 本部分将介绍AI在室内设计和景观设计中的应用。 -## 章节目录 +--- -1. [第18章 室内设计](#第18章-室内设计-1) +## 学习目标 - [第19章 景观设计](#第19章-景观设计-1) +1. 了解AI在室内设计中的应用流程 -# 第18章 室内设计 + 掌握平面图智能生成的方法 + + 理解VR/AR在室内设计预览中的作用 + +## 核心应用 + +平面图智能生成 + +**传统流程 vs AI辅助**: + + ---------------------------------------- + 环节 传统方式 AI辅助 + ---------- -------------- -------------- + 需求分析 人工沟通 自然语言理解 + + 方案生成 手绘/CAD绘制 自动生成布局 + + 家具选择 手动搜索 智能推荐 + + 效果预览 3D建模渲染 实时生成 + ---------------------------------------- + +**AI工具**: - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型 + +家具布局优化 + +**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡 + +**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习 + +材质与风格推荐 + +**推荐流程**: + +`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\ +` ↓`\ +` ``生成效果预览`\ +` ↓`\ +` ``用户反馈迭代` + +VR/AR预览 + +**技术实现**: - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果 + +**工具**: - Enscape:实时渲染插件 - Twinmotion:快速可视化 - Arkio:VR协作设计 + +## 案例分析 + +**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单 + +## 思考与练习 + +1. AI如何平衡功能性和美学? + +2. VR/AR如何改变室内设计工作流? + +3. 尝试使用AI室内设计工具完成一个小空间设计 + +--- + +### 学习目标 + +1. 了解AI在景观设计中的应用 + + 掌握场地分析与评估的方法 + + 理解生态效益模拟的技术 + +### 核心应用 + +场地分析与评估 + +**分析维度**: + + ------------------------------------------------ + 维度 内容 AI方法 + ------------ -------------------- -------------- + 地形地貌 高程、坡度、坡向 DEM分析 + + 植被覆盖 类型、密度、健康度 遥感图像分类 + + 水文系统 水系、排水、汇水 水文模拟 + + 视觉景观 视域、视线廊道 视域分析 + + 气候舒适度 风环境、日照、温度 环境模拟 + ------------------------------------------------ + +**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模 + +植被配置优化 + +**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候 + +**AI方法**: - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果 + +景观元素生成 + +**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计 + +生态效益模拟 + +**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解 + +### 案例分析 + +**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计 + +### 思考与练习 + +1. AI如何处理景观设计中的复杂约束? + +2. 生态效益模拟的数据从哪里来? + +3. 选择一个景观设计场景,分析AI可应用的环节 + +### 关键术语 + + ----------------------------------------------- + 中文 英文 说明 + ---------- --------------------- -------------- + 平面图 Floor Plan 水平剖切图 + + 布局优化 Layout Optimization 空间排列优化 + + 动线 Circulation 人员流动路径 + + 视域分析 Viewshed Analysis 可见范围分析 + + 生态效益 Ecological Benefit 生态服务价值 + ----------------------------------------------- + +### 延伸阅读 + +1. [Landscape Architecture + AI](https://landscapeperformance.org/) + + [GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture) diff --git a/08-environmental-design/ch18-interior-design.md b/08-environmental-design/ch18-interior-design.md deleted file mode 100644 index a3ec7f0..0000000 --- a/08-environmental-design/ch18-interior-design.md +++ /dev/null @@ -1,62 +0,0 @@ - -## 学习目标 - -1. 了解AI在室内设计中的应用流程 - - 掌握平面图智能生成的方法 - - 理解VR/AR在室内设计预览中的作用 - -## 核心应用 - -平面图智能生成 - -**传统流程 vs AI辅助**: - - ---------------------------------------- - 环节 传统方式 AI辅助 - ---------- -------------- -------------- - 需求分析 人工沟通 自然语言理解 - - 方案生成 手绘/CAD绘制 自动生成布局 - - 家具选择 手动搜索 智能推荐 - - 效果预览 3D建模渲染 实时生成 - ---------------------------------------- - -**AI工具**: - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型 - -家具布局优化 - -**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡 - -**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习 - -材质与风格推荐 - -**推荐流程**: - -`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\ -` ↓`\ -` ``生成效果预览`\ -` ↓`\ -` ``用户反馈迭代` - -VR/AR预览 - -**技术实现**: - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果 - -**工具**: - Enscape:实时渲染插件 - Twinmotion:快速可视化 - Arkio:VR协作设计 - -## 案例分析 - -**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单 - -## 思考与练习 - -1. AI如何平衡功能性和美学? - -2. VR/AR如何改变室内设计工作流? - -3. 尝试使用AI室内设计工具完成一个小空间设计 diff --git a/08-environmental-design/ch19-landscape-design.md b/08-environmental-design/ch19-landscape-design.md deleted file mode 100644 index d63dab7..0000000 --- a/08-environmental-design/ch19-landscape-design.md +++ /dev/null @@ -1,78 +0,0 @@ - -### 学习目标 - -1. 了解AI在景观设计中的应用 - - 掌握场地分析与评估的方法 - - 理解生态效益模拟的技术 - -### 核心应用 - -场地分析与评估 - -**分析维度**: - - ------------------------------------------------ - 维度 内容 AI方法 - ------------ -------------------- -------------- - 地形地貌 高程、坡度、坡向 DEM分析 - - 植被覆盖 类型、密度、健康度 遥感图像分类 - - 水文系统 水系、排水、汇水 水文模拟 - - 视觉景观 视域、视线廊道 视域分析 - - 气候舒适度 风环境、日照、温度 环境模拟 - ------------------------------------------------ - -**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模 - -植被配置优化 - -**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候 - -**AI方法**: - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果 - -景观元素生成 - -**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计 - -生态效益模拟 - -**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解 - -### 案例分析 - -**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计 - -### 思考与练习 - -1. AI如何处理景观设计中的复杂约束? - -2. 生态效益模拟的数据从哪里来? - -3. 选择一个景观设计场景,分析AI可应用的环节 - -### 关键术语 - - ----------------------------------------------- - 中文 英文 说明 - ---------- --------------------- -------------- - 平面图 Floor Plan 水平剖切图 - - 布局优化 Layout Optimization 空间排列优化 - - 动线 Circulation 人员流动路径 - - 视域分析 Viewshed Analysis 可见范围分析 - - 生态效益 Ecological Benefit 生态服务价值 - ----------------------------------------------- - -### 延伸阅读 - -1. [Landscape Architecture + AI](https://landscapeperformance.org/) - - [GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture) diff --git a/09-industrial-design/09-industrial-design.md b/09-industrial-design/09-industrial-design.md index 721a3b1..19c86e7 100644 --- a/09-industrial-design/09-industrial-design.md +++ b/09-industrial-design/09-industrial-design.md @@ -8,10 +8,138 @@ 本部分将介绍AI在工业设计中的关键应用。 -## 章节目录 +--- -1. [第20章 产品造型设计](#第20章-产品造型设计-1) +## 学习目标 - [第21章 设计优化与制造](#第21章-设计优化与制造-1) +1. 了解AI辅助产品概念设计的方法 -# 第20章 产品造型设计 + 掌握草图生成和三维建模的AI工具 + + 理解形态优化的基本原理 + +## 核心应用 + +概念草图生成 + +**流程**: + +`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\ +` ↓`\ +` ``设计师选择与迭代` + +**工具**: - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化 + +三维建模辅助 + +**AI辅助功能**: + + ---------------------------------------------------- + 功能 说明 工具 + ---------- ------------------- --------------------- + 草图转3D 2D草图生成3D模型 Shapr3D, Point-E + + 模型优化 自动布线、倒角 ZBrush, Blender插件 + + 纹理生成 自动生成材质贴图 Adobe Substance 3D + + 渲染加速 快速生成产品渲染 NVIDIA Canvas + ---------------------------------------------------- + +形态优化 + +**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制 + +**AI方法**: - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化 + +案例分析 + +**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审 + +思考与练习 + +1. AI生成的概念如何保持原创性? + +2. 形态优化中如何平衡美学和功能? + +3. 尝试用AI工具生成一个产品概念 + +--- + +学习目标 + +1. 了解AI在结构优化中的应用 + + 掌握材料选择和可制造性分析方法 + + 理解AI辅助制造准备的技术 + +### 核心应用 + +结构优化 + +**拓扑优化**: + +`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\ +` ↓`\ +` ``轻量化与强度平衡` + +**AI方法**: - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构 + +**工具**: - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化 + +材料选择 + +**AI辅助决策**: + + --------------------------- + 考虑因素 AI方法 + ---------- ---------------- + 力学性能 材料数据库检索 + + 成本 价格预测模型 + + 可持续性 环境影响评估 + + 可加工性 工艺兼容性分析 + --------------------------- + +可制造性分析 + +**分析内容**: - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性 + +**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算 + +### 案例分析 {#案例分析-5} + +**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造 + +### 思考与练习 {#思考与练习-21} + +1. 拓扑优化的结果如何满足生产工艺要求? + +2. AI如何帮助选择可持续材料? + +3. 选择一个简单产品,分析AI可优化的环节 + +### 关键术语 + + ----------------------------------------------------- + 中文 英文 说明 + ------------ ----------------------- ---------------- + 概念设计 Concept Design 初步设计阶段 + + 拓扑优化 Topology Optimization 结构布局优化 + + 生成式设计 Generative Design AI驱动设计生成 + + 可制造性 Manufacturability 生产可行性 + + 轻量化 Lightweight 减少重量 + ----------------------------------------------------- + +### 延伸阅读 + +1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design) + + [nTopology技术文档](https://ntopology.com/resources/) diff --git a/09-industrial-design/ch20-product-design.md b/09-industrial-design/ch20-product-design.md deleted file mode 100644 index 4b3e920..0000000 --- a/09-industrial-design/ch20-product-design.md +++ /dev/null @@ -1,54 +0,0 @@ - -## 学习目标 - -1. 了解AI辅助产品概念设计的方法 - - 掌握草图生成和三维建模的AI工具 - - 理解形态优化的基本原理 - -## 核心应用 - -概念草图生成 - -**流程**: - -`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\ -` ↓`\ -` ``设计师选择与迭代` - -**工具**: - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化 - -三维建模辅助 - -**AI辅助功能**: - - ---------------------------------------------------- - 功能 说明 工具 - ---------- ------------------- --------------------- - 草图转3D 2D草图生成3D模型 Shapr3D, Point-E - - 模型优化 自动布线、倒角 ZBrush, Blender插件 - - 纹理生成 自动生成材质贴图 Adobe Substance 3D - - 渲染加速 快速生成产品渲染 NVIDIA Canvas - ---------------------------------------------------- - -形态优化 - -**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制 - -**AI方法**: - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化 - -案例分析 - -**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审 - -思考与练习 - -1. AI生成的概念如何保持原创性? - -2. 形态优化中如何平衡美学和功能? - -3. 尝试用AI工具生成一个产品概念 diff --git a/09-industrial-design/ch21-design-optimization.md b/09-industrial-design/ch21-design-optimization.md deleted file mode 100644 index a628975..0000000 --- a/09-industrial-design/ch21-design-optimization.md +++ /dev/null @@ -1,78 +0,0 @@ - -学习目标 - -1. 了解AI在结构优化中的应用 - - 掌握材料选择和可制造性分析方法 - - 理解AI辅助制造准备的技术 - -### 核心应用 - -结构优化 - -**拓扑优化**: - -`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\ -` ↓`\ -` ``轻量化与强度平衡` - -**AI方法**: - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构 - -**工具**: - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化 - -材料选择 - -**AI辅助决策**: - - --------------------------- - 考虑因素 AI方法 - ---------- ---------------- - 力学性能 材料数据库检索 - - 成本 价格预测模型 - - 可持续性 环境影响评估 - - 可加工性 工艺兼容性分析 - --------------------------- - -可制造性分析 - -**分析内容**: - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性 - -**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算 - -### 案例分析 {#案例分析-5} - -**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造 - -### 思考与练习 {#思考与练习-21} - -1. 拓扑优化的结果如何满足生产工艺要求? - -2. AI如何帮助选择可持续材料? - -3. 选择一个简单产品,分析AI可优化的环节 - -### 关键术语 - - ----------------------------------------------------- - 中文 英文 说明 - ------------ ----------------------- ---------------- - 概念设计 Concept Design 初步设计阶段 - - 拓扑优化 Topology Optimization 结构布局优化 - - 生成式设计 Generative Design AI驱动设计生成 - - 可制造性 Manufacturability 生产可行性 - - 轻量化 Lightweight 减少重量 - ----------------------------------------------------- - -### 延伸阅读 - -1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design) - - [nTopology技术文档](https://ntopology.com/resources/) diff --git a/10-urban-design/10-urban-design.md b/10-urban-design/10-urban-design.md index c951acc..a25f929 100644 --- a/10-urban-design/10-urban-design.md +++ b/10-urban-design/10-urban-design.md @@ -8,10 +8,154 @@ 本部分将介绍AI在城市设计中的关键应用。 -## 章节目录 +--- -1. [第22章 城市空间分析](#第22章-城市空间分析-1) +## 学习目标 {#学习目标-24} - [第23章 规划设计与评估](#第23章-规划设计与其评估) +1. 了解AI在城市空间分析中的应用 -# 第22章 城市空间分析 + 掌握遥感影像和城市形态识别的方法 + + 理解人口与活动分析的技术 + +## 核心应用 + +遥感影像分析 + +### 分析内容: + + ------------------------------------ + 内容 方法 应用 + ---------- ---------- -------------- + 土地利用 图像分类 规划现状调查 + + 建筑识别 目标检测 建筑普查 + + 变化检测 时序分析 城市扩张监测 + + 环境质量 指数反演 生态评估 + ------------------------------------ + +### 技术流程: + +`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\ +` ↓`\ +` ``规划决策支持` + +城市形态识别 + +**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间 + +**AI方法**: - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型 + +人口与活动分析 + +**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据 + +**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点 + +**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测 + +## 案例分析 {#案例分析-6} + +**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议 + +## 思考与练习 {#思考与练习-22} + +1. 多源数据如何保护隐私? + +2. AI分析如何考虑城市的独特性? + +3. 选择一个城市问题,分析AI可提供的帮助 + +--- + +### 学习目标 {#学习目标-25} + +1. 了解AI辅助规划设计的方法 + + 掌握交通网络和设施布局优化的技术 + + 理解规划方案评估的AI应用 + +### 核心应用 + +用地规划生成 + +**传统流程 vs AI辅助**: + + -------------------------------- + 环节 传统方式 AI辅助 + ---------- ---------- ---------- + 现状分析 人工统计 自动识别 + + 方案生成 手绘/CAD 规则生成 + + 规范检查 人工核对 自动验证 + + 方案评估 定性分析 量化评估 + -------------------------------- + +**生成方法**: - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计 + +交通网络优化 + +**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小 + +**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测 + +公共设施布局 + +**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配 + +**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题 + +规划方案评估 + +**评估维度**: + + -------------------------------------- + 维度 指标 AI方法 + ---------- ---------------- ---------- + 空间效率 容积率、密度 空间分析 + + 交通影响 出行距离、拥堵 交通模拟 + + 环境影响 碳排放、绿地 环境模型 + + 社会效益 公平性、满意度 社会模型 + -------------------------------------- + +### 案例分析 {#案例分析-7} + +**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定 + +### 思考与练习 {#思考与练习-23} + +1. AI生成的规划方案如何体现人文关怀? + +2. 如何平衡不同评估维度的冲突? + +3. 选择一个规划问题,分析AI的潜在作用 + +### 关键术语 + + ---------------------------------------------------- + 中文 英文 说明 + ------------ ---------------- ---------------------- + 土地利用 Land Use 土地功能分布 + + 遥感 Remote Sensing 远距离探测技术 + + 图神经网络 GNN Graph Neural Network + + 通达性 Accessibility 到达便利程度 + + 服务半径 Service Radius 设施服务范围 + ---------------------------------------------------- + +### 延伸阅读 + +1. [Urban AI](https://urbanai.io/) + + [Google Environmental Insights Explorer](https://insights.sustainability.google/) diff --git a/10-urban-design/ch22-urban-spatial-analysis.md b/10-urban-design/ch22-urban-spatial-analysis.md deleted file mode 100644 index c349041..0000000 --- a/10-urban-design/ch22-urban-spatial-analysis.md +++ /dev/null @@ -1,58 +0,0 @@ - -## 学习目标 {#学习目标-24} - -1. 了解AI在城市空间分析中的应用 - - 掌握遥感影像和城市形态识别的方法 - - 理解人口与活动分析的技术 - -## 核心应用 - -遥感影像分析 - -### 分析内容: - - ------------------------------------ - 内容 方法 应用 - ---------- ---------- -------------- - 土地利用 图像分类 规划现状调查 - - 建筑识别 目标检测 建筑普查 - - 变化检测 时序分析 城市扩张监测 - - 环境质量 指数反演 生态评估 - ------------------------------------ - -### 技术流程: - -`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\ -` ↓`\ -` ``规划决策支持` - -城市形态识别 - -**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间 - -**AI方法**: - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型 - -人口与活动分析 - -**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据 - -**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点 - -**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测 - -## 案例分析 {#案例分析-6} - -**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议 - -## 思考与练习 {#思考与练习-22} - -1. 多源数据如何保护隐私? - -2. AI分析如何考虑城市的独特性? - -3. 选择一个城市问题,分析AI可提供的帮助 diff --git a/10-urban-design/ch23-planning-evaluation.md b/10-urban-design/ch23-planning-evaluation.md deleted file mode 100644 index ad77dbe..0000000 --- a/10-urban-design/ch23-planning-evaluation.md +++ /dev/null @@ -1,90 +0,0 @@ - -### 学习目标 {#学习目标-25} - -1. 了解AI辅助规划设计的方法 - - 掌握交通网络和设施布局优化的技术 - - 理解规划方案评估的AI应用 - -### 核心应用 - -用地规划生成 - -**传统流程 vs AI辅助**: - - -------------------------------- - 环节 传统方式 AI辅助 - ---------- ---------- ---------- - 现状分析 人工统计 自动识别 - - 方案生成 手绘/CAD 规则生成 - - 规范检查 人工核对 自动验证 - - 方案评估 定性分析 量化评估 - -------------------------------- - -**生成方法**: - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计 - -交通网络优化 - -**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小 - -**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测 - -公共设施布局 - -**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配 - -**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题 - -规划方案评估 - -**评估维度**: - - -------------------------------------- - 维度 指标 AI方法 - ---------- ---------------- ---------- - 空间效率 容积率、密度 空间分析 - - 交通影响 出行距离、拥堵 交通模拟 - - 环境影响 碳排放、绿地 环境模型 - - 社会效益 公平性、满意度 社会模型 - -------------------------------------- - -### 案例分析 {#案例分析-7} - -**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定 - -### 思考与练习 {#思考与练习-23} - -1. AI生成的规划方案如何体现人文关怀? - -2. 如何平衡不同评估维度的冲突? - -3. 选择一个规划问题,分析AI的潜在作用 - -### 关键术语 - - ---------------------------------------------------- - 中文 英文 说明 - ------------ ---------------- ---------------------- - 土地利用 Land Use 土地功能分布 - - 遥感 Remote Sensing 远距离探测技术 - - 图神经网络 GNN Graph Neural Network - - 通达性 Accessibility 到达便利程度 - - 服务半径 Service Radius 设施服务范围 - ---------------------------------------------------- - -### 延伸阅读 - -1. [Urban AI](https://urbanai.io/) - - [Google Environmental Insights Explorer](https://insights.sustainability.google/) diff --git a/11-ecological-design/11-ecological-design.md b/11-ecological-design/11-ecological-design.md index a18cf7d..561ea29 100644 --- a/11-ecological-design/11-ecological-design.md +++ b/11-ecological-design/11-ecological-design.md @@ -8,10 +8,136 @@ 本部分将介绍AI在生态设计中的应用。 -## 章节目录 +--- -1. [第24章 生态分析与评估](#第24章-生态分析与评估-1) +## 学习目标 {#学习目标-26} - [第25章 生态规划与修复](#第25章-生态规划与修复-1) +1. 了解AI在生态系统服务评估中的应用 -# 第24章 生态分析与评估 + 掌握生物多样性分析的方法 + + 理解环境质量监测的技术 + +## 核心应用 + +生态系统服务评估 + +**服务类型**: + + -------------------------------------------- + 类型 内容 AI应用 + ---------- ------------------ -------------- + 供给服务 食物、水、纤维 产量预测 + + 调节服务 气候、洪水、疾病 风险评估 + + 文化服务 娱乐、旅游 游客行为分析 + + 支持服务 营养循环、生境 过程模拟 + -------------------------------------------- + +**评估方法**: - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测 + +生物多样性分析 + +**分析层次**: + + -------------------------------------------- + 层次 内容 AI方法 + ---------------- ------------ -------------- + 遗传多样性 基因变异 基因序列分析 + + 物种多样性 物种丰富度 图像识别 + + 生态系统多样性 生境类型 景观分类 + -------------------------------------------- + +**技术应用**: - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测 + +环境质量监测 + +**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染 + +**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析 + +## 案例分析 {#案例分析-8} + +**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成 + +## 思考与练习 {#思考与练习-24} + +1. AI如何处理生态数据的复杂性和不确定性? + +2. 生物多样性自动识别的准确率如何保证? + +3. 选择一个生态问题,分析AI可提供的帮助 + +--- + +## 学习目标 {#学习目标-27} + +1. 了解AI在生态源地识别中的应用 + + 掌握生态网络构建的方法 + + 理解生态修复方案的优化技术 + +## 核心应用 + +生态源地识别 + +**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区 + +**AI方法**: - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序 + +生态网络构建 + +**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境 + +**构建流程**: + +`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估` + +**AI技术**: - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计 + +修复方案优化 + +**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理 + +**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性 + +**AI应用**: - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整 + +## 案例分析 {#案例分析-9} + +**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略 + +## 思考与练习 {#思考与练习-25} + +1. 生态网络如何应对气候变化? + +2. AI优化的修复方案如何考虑长期效应? + +3. 选择一个生态修复场景,分析AI的应用点 + +## 关键术语 + + --------------------------------------------------------------- + 中文 英文 说明 + -------------- ----------------------------- ------------------ + 生态系统服务 Ecosystem Services 自然对人类的益处 + + 生物多样性 Biodiversity 生物种类丰富度 + + 生态源地 Ecological Source 生态核心区 + + 生态廊道 Ecological Corridor 生态连接通道 + + 生态安全格局 Ecological Security Pattern 生态空间布局 + --------------------------------------------------------------- + +## 延伸阅读 + +1. [Circuitscape](https://circuitscape.org/) + + [InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest) diff --git a/11-ecological-design/ch24-ecological-analysis.md b/11-ecological-design/ch24-ecological-analysis.md deleted file mode 100644 index 0f41e2f..0000000 --- a/11-ecological-design/ch24-ecological-analysis.md +++ /dev/null @@ -1,62 +0,0 @@ - -## 学习目标 {#学习目标-26} - -1. 了解AI在生态系统服务评估中的应用 - - 掌握生物多样性分析的方法 - - 理解环境质量监测的技术 - -## 核心应用 - -生态系统服务评估 - -**服务类型**: - - -------------------------------------------- - 类型 内容 AI应用 - ---------- ------------------ -------------- - 供给服务 食物、水、纤维 产量预测 - - 调节服务 气候、洪水、疾病 风险评估 - - 文化服务 娱乐、旅游 游客行为分析 - - 支持服务 营养循环、生境 过程模拟 - -------------------------------------------- - -**评估方法**: - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测 - -生物多样性分析 - -**分析层次**: - - -------------------------------------------- - 层次 内容 AI方法 - ---------------- ------------ -------------- - 遗传多样性 基因变异 基因序列分析 - - 物种多样性 物种丰富度 图像识别 - - 生态系统多样性 生境类型 景观分类 - -------------------------------------------- - -**技术应用**: - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测 - -环境质量监测 - -**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染 - -**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析 - -## 案例分析 {#案例分析-8} - -**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成 - -## 思考与练习 {#思考与练习-24} - -1. AI如何处理生态数据的复杂性和不确定性? - -2. 生物多样性自动识别的准确率如何保证? - -3. 选择一个生态问题,分析AI可提供的帮助 diff --git a/11-ecological-design/ch25-ecological-planning.md b/11-ecological-design/ch25-ecological-planning.md deleted file mode 100644 index 4d60a55..0000000 --- a/11-ecological-design/ch25-ecological-planning.md +++ /dev/null @@ -1,68 +0,0 @@ - -## 学习目标 {#学习目标-27} - -1. 了解AI在生态源地识别中的应用 - - 掌握生态网络构建的方法 - - 理解生态修复方案的优化技术 - -## 核心应用 - -生态源地识别 - -**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区 - -**AI方法**: - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序 - -生态网络构建 - -**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境 - -**构建流程**: - -`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估` - -**AI技术**: - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计 - -修复方案优化 - -**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理 - -**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性 - -**AI应用**: - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整 - -## 案例分析 {#案例分析-9} - -**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略 - -## 思考与练习 {#思考与练习-25} - -1. 生态网络如何应对气候变化? - -2. AI优化的修复方案如何考虑长期效应? - -3. 选择一个生态修复场景,分析AI的应用点 - -## 关键术语 - - --------------------------------------------------------------- - 中文 英文 说明 - -------------- ----------------------------- ------------------ - 生态系统服务 Ecosystem Services 自然对人类的益处 - - 生物多样性 Biodiversity 生物种类丰富度 - - 生态源地 Ecological Source 生态核心区 - - 生态廊道 Ecological Corridor 生态连接通道 - - 生态安全格局 Ecological Security Pattern 生态空间布局 - --------------------------------------------------------------- - -## 延伸阅读 - -1. [Circuitscape](https://circuitscape.org/) - - [InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest)