From e58b95d227260a74cd685c4f7c20a0c19bb646ad Mon Sep 17 00:00:00 2001 From: pengxiao Date: Sat, 25 Apr 2026 10:32:58 +0800 Subject: [PATCH] =?UTF-8?q?=E5=88=9D=E5=A7=8B=E5=8C=96=EF=BC=9A=E4=BB=8E?= =?UTF-8?q?=20docx=20=E6=8B=86=E5=88=86=E4=B8=BA=E7=8B=AC=E7=AB=8B=20Markd?= =?UTF-8?q?own=20=E7=AB=A0=E8=8A=82?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件, 按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。 Co-Authored-By: Claude Opus 4.7 --- .gitignore | 10 + 01-introduction/00.1-ai-overview.md | 150 +++++++ 01-introduction/00.2-ai-paradigm.md | 226 ++++++++++ 01-introduction/01-introduction.md | 51 +++ 02-foundations/01.1-math-foundation.md | 165 +++++++ 02-foundations/01.2-mlp-basics.md | 221 ++++++++++ 02-foundations/01.3-programming.md | 226 ++++++++++ 02-foundations/02-foundations.md | 49 +++ 03-computer-vision/02.1-cnn-foundation.md | 145 ++++++ 03-computer-vision/02.2-object-detection.md | 168 +++++++ .../02.3-semantic-segmentation.md | 136 ++++++ 03-computer-vision/03-computer-vision.md | 33 ++ 04-transformer/03.1-attention.md | 156 +++++++ 04-transformer/03.2-transformer.md | 157 +++++++ 04-transformer/03.3-llm-application.md | 166 +++++++ 04-transformer/04-transformer.md | 33 ++ 05-generative-ai/04.1-diffusion.md | 151 +++++++ 05-generative-ai/04.2-aigc-tools.md | 180 ++++++++ 05-generative-ai/05-generative-ai.md | 31 ++ 06-agent/05.1-agent-architecture.md | 148 +++++++ 06-agent/05.2-embodied-ai.md | 157 +++++++ 06-agent/05.3-design-application.md | 215 +++++++++ 06-agent/06-agent.md | 33 ++ 07-digital-media/07-digital-media.md | 17 + 07-digital-media/ch16-visual-design-aigc.md | 72 +++ 07-digital-media/ch17-interaction-design.md | 76 ++++ .../08-environmental-design.md | 17 + .../ch18-interior-design.md | 62 +++ .../ch19-landscape-design.md | 78 ++++ 09-industrial-design/09-industrial-design.md | 17 + 09-industrial-design/ch20-product-design.md | 54 +++ .../ch21-design-optimization.md | 78 ++++ 10-urban-design/10-urban-design.md | 17 + .../ch22-urban-spatial-analysis.md | 58 +++ 10-urban-design/ch23-planning-evaluation.md | 90 ++++ 11-ecological-design/11-ecological-design.md | 17 + .../ch24-ecological-analysis.md | 62 +++ .../ch25-ecological-planning.md | 68 +++ README.md | 415 ++++++++++++++++++ appendix/glossary.md | 318 ++++++++++++++ appendix/references.md | 127 ++++++ appendix/tools.md | 207 +++++++++ 42 files changed, 4857 insertions(+) create mode 100644 .gitignore create mode 100644 01-introduction/00.1-ai-overview.md create mode 100644 01-introduction/00.2-ai-paradigm.md create mode 100644 01-introduction/01-introduction.md create mode 100644 02-foundations/01.1-math-foundation.md create mode 100644 02-foundations/01.2-mlp-basics.md create mode 100644 02-foundations/01.3-programming.md create mode 100644 02-foundations/02-foundations.md create mode 100644 03-computer-vision/02.1-cnn-foundation.md create mode 100644 03-computer-vision/02.2-object-detection.md create mode 100644 03-computer-vision/02.3-semantic-segmentation.md create mode 100644 03-computer-vision/03-computer-vision.md create mode 100644 04-transformer/03.1-attention.md create mode 100644 04-transformer/03.2-transformer.md create mode 100644 04-transformer/03.3-llm-application.md create mode 100644 04-transformer/04-transformer.md create mode 100644 05-generative-ai/04.1-diffusion.md create mode 100644 05-generative-ai/04.2-aigc-tools.md create mode 100644 05-generative-ai/05-generative-ai.md create mode 100644 06-agent/05.1-agent-architecture.md create mode 100644 06-agent/05.2-embodied-ai.md create mode 100644 06-agent/05.3-design-application.md create mode 100644 06-agent/06-agent.md create mode 100644 07-digital-media/07-digital-media.md create mode 100644 07-digital-media/ch16-visual-design-aigc.md create mode 100644 07-digital-media/ch17-interaction-design.md create mode 100644 08-environmental-design/08-environmental-design.md create mode 100644 08-environmental-design/ch18-interior-design.md create mode 100644 08-environmental-design/ch19-landscape-design.md create mode 100644 09-industrial-design/09-industrial-design.md create mode 100644 09-industrial-design/ch20-product-design.md create mode 100644 09-industrial-design/ch21-design-optimization.md create mode 100644 10-urban-design/10-urban-design.md create mode 100644 10-urban-design/ch22-urban-spatial-analysis.md create mode 100644 10-urban-design/ch23-planning-evaluation.md create mode 100644 11-ecological-design/11-ecological-design.md create mode 100644 11-ecological-design/ch24-ecological-analysis.md create mode 100644 11-ecological-design/ch25-ecological-planning.md create mode 100644 README.md create mode 100644 appendix/glossary.md create mode 100644 appendix/references.md create mode 100644 appendix/tools.md diff --git a/.gitignore b/.gitignore new file mode 100644 index 0000000..0e3e044 --- /dev/null +++ b/.gitignore @@ -0,0 +1,10 @@ +# Editor / Tool configs +.DS_Store +.claude/ +.claudian/ +.obsidian/ +.pandoc/ + +# Original source (kept for reference, not tracked) +*.docx +learning_markdown.md diff --git a/01-introduction/00.1-ai-overview.md b/01-introduction/00.1-ai-overview.md new file mode 100644 index 0000000..bf74286 --- /dev/null +++ b/01-introduction/00.1-ai-overview.md @@ -0,0 +1,150 @@ + +## 学习目标 + +了解AI技术发展的关键时间节点 + +理解AI四大赛道及其应用场景 + +掌握设计领域AI应用的现状与趋势 + +# Amazon Go:AI赋能的典型案例 + +## 案例背景 + +Amazon Go是亚马逊推出的无人便利店,通过计算机视觉和传感器融合技术,实现"拿了就走"的购物体验。 + +## 技术要素 + +Amazon Go的AI技术栈融合了多项前沿技术: + + -------------------------------------------------- + 技术 作用 应用场景 + ------------ ---------------- -------------------- + 5G通信 低延迟数据传输 实时视频流处理 + + 3D传感器 深度信息获取 空间定位与手势识别 + + 计算机视觉 图像理解 商品识别、行为分析 + + 传感器融合 多源数据整合 精确定位与跟踪 + -------------------------------------------------- + +## 启示 + +Amazon Go展示了AI技术如何重构传统场景。从"扫码支付"到"拿了就走",AI让交互变得更加自然。 + +# AI赋能的时间线:2016-2024 + +## 第一阶段:觉醒期 (2016-2018) + +**2016**:AlphaGo击败李世石,AI进入公众视野 + +**2017**:Transformer架构诞生,为大模型时代奠基 + +**2018**:BERT预训练模型问世,NLP任务取得突破 + +## 第二阶段:爆发期 (2019-2022) + +**2019**:GPT-2展示强大的文本生成能力 + +**2020**:GPT-3发布,少样本学习能力震惊业界 + +**2022**:ChatGPT发布,AI对话能力达到新高度 + +## 第三阶段:应用期 (2023-2024) + +**2023**:多模态大模型、AI Agent概念兴起 + +**2024**:具身智能、端侧AI加速落地 + +# AI四大赛道 + +## 1. AIGC (AI-Generated Content) + +**定义**:人工智能生成内容 + +**应用领域**: - 文本生成:文章、报告、代码 - 图像生成:设计稿、效果图、图标 - 视频生成:短视频、动画、特效 - 音频生成:音乐、配音、音效 + +**设计影响**:从"工具辅助"到"生成伙伴" + +## 2. Agent (智能体) + +**定义**:能够自主感知、规划、执行的系统 + +**核心能力**: - 感知 (Perception):理解环境信息 - 规划 (Planning):制定行动方案 - 记忆 (Memory):存储和检索经验 - 工具 (Tool Use):调用外部资源 + +**设计影响**:从"被动执行"到"主动协作" + +## 3. AI4S (AI for Science) + +**定义**:AI驱动科学发现 + +**应用领域**: - 蛋白质结构预测 (AlphaFold) - 材料科学计算 - 气候变化模拟 - 城市系统优化 + +**设计影响**:数据驱动的设计决策 + +## 4. AIED (AI in Education) + +**定义**:AI在教育领域的应用 + +**应用场景**: - 个性化学习路径 - 智能答疑与辅导 - 学习行为分析 - 知识图谱构建 + +**设计影响**:设计教育与人才培养模式变革 + +# 设计领域AI应用趋势 + +## 当前应用 + + ---------------------------------------- + 领域 AI应用 成熟度 + ---------- -------------------- -------- + 建筑设计 图纸生成、方案优化 中 + + 景观设计 场地分析、植被配置 中 + + 室内设计 家具布局、风格迁移 高 + + 平面设计 Logo生成、排版辅助 高 + + 交互设计 用户研究、原型生成 低 + ---------------------------------------- + +## 未来趋势 + +1.**从单点工具到系统化解决方案** + +2.**从生成内容到生成决策** + +3.**从人机协作到人机共生** + +# 思考与练习 + +1.选择你熟悉的设计领域,分析AI在该领域的应用现状和潜力 + +2.思考AI四大赛道中,哪一个对你的专业影响最大?为什么? + +3.Amazon Go案例中,哪些AI技术可以迁移到设计领域? + +# 关键术语 + + -------------------------------------------------------- + 中文 英文 说明 + ----------------- --------------- ---------------------- + 生成式AI AIGC AI-Generated Content + + 智能体 Agent 自主决策系统 + + AI for Science AI4S AI驱动科学研究 + + AI in Education AIED AI教育应用 + + 传感器融合 Sensor Fusion 多传感器数据整合 + -------------------------------------------------------- + +# 延伸阅读 + +[Amazon Go技术解析](https://amazon.go/technology) + +[AIGC产业发展报告](https://www.caict.ac.cn/) + +[AI Agent综述论文](https://arxiv.org/pdf/2308.11432v2) \# 00.2 AI范式演进 diff --git a/01-introduction/00.2-ai-paradigm.md b/01-introduction/00.2-ai-paradigm.md new file mode 100644 index 0000000..ed76512 --- /dev/null +++ b/01-introduction/00.2-ai-paradigm.md @@ -0,0 +1,226 @@ + +# 学习目标 + +理解AI范式的三次演进 + +掌握万能逼近定理的直观意义 + +建立神经网络技术栈的完整认知 + +理解Scaling Law与模型规模效应 + +# AI范式的三次演进 + +## 第一范式:规则系统 (Symbolic AI) + +**时期**:1950s - 1980s + +**核心思想**:人类专家编写规则 + +**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱 + +**典型应用**:专家系统、棋类游戏 + +## 第二范式:机器学习 (Machine Learning) + +**时期**:1990s - 2010s + +**核心思想**:从数据中学习规律 + +**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定 + +**典型应用**:推荐系统、图像分类、语音识别 + +## 第三范式:深度学习 (Deep Learning) + +**时期**:2012 - 至今 + +**核心思想**:端到端学习,自动提取特征 + +**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强 + +**典型应用**:大语言模型、生成式AI、自动驾驶 + +# 万能逼近定理 + +## 定理表述 + +**Universal Approximation Theorem (1989)**: + +一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。 + +## 直观理解 + +想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面 + +## 启示 + +这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。 + +这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。 + +# 神经网络技术栈全景 + +`┌─────────────────────────────────────────────────────────────┐`\ +`│ ``应用层`` │`\ +`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``模型层`` │`\ +`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``算法层`` │`\ +`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\ +`├─────────────────────────────────────────────────────────────┤`\ +`│ ``数学层`` │`\ +`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\ +`└─────────────────────────────────────────────────────────────┘` + +## 技术演进路径 + + ------------------------------------------ + 时代 代表技术 突破点 + ------- ------------- -------------------- + 1980s MLP 万能逼近定理 + + 1990s CNN 局部连接、权重共享 + + 2000s RNN/LSTM 序列建模 + + 2010s GNN 图结构数据 + + 2017 Transformer Self-Attention + + 2020s Diffusion 生成质量突破 + ------------------------------------------ + +## 模型家族关系 + +`MLP (``多层感知机``)`\ +` │`\ +` ┌──────────────┼──────────────┐`\ +` │ │ │`\ +` CNN GNN RNN`\ +` (``空间数据``) (``图数据``) (``序列数据``)`\ +` │ │ │`\ +` └──────────────┼──────────────┘`\ +` │`\ +` Transformer`\ +` │`\ +` ┌──────────────┼──────────────┐`\ +` │ │ │`\ +` GPT``系列`` BERT Diffusion`\ +` (``生成式``) (``理解式``) (``图像生成``)` + +# Scaling Law:规模即智能 + +## 什么是Scaling Law + +Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系: + +**模型性能 ≈ f(计算量, 数据量, 参数量)** + +## 核心发现 + +### 1.性能随规模对数增长 + +o模型越大,性能越好 + +o增长是可预测的 + +#### 2.计算效率最关键 + +o计算量增加10倍 → 性能提升约1.5倍 + +o数据量和参数量也有类似规律 + +#### 3.没有看到天花板 + +o在现有规模下,性能提升仍在继续 + +### 启示 + +**大模型时代**:规模成为竞争壁垒 + +**数据为王**:高质量数据比模型架构更重要 + +**算力需求**:AI发展依赖硬件进步 + +从函数式视角看AI演进 + +### 核心理念 + +**"Functions Describe the World"(函数描述世界)** + +物理定律:F = ma + +经济规律:Supply = Demand(Price) + +神经网络:y = f(x; θ) + +### AI即函数组合 + +`输入数据`` x`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₁(x) │ ``第一层函数:特征提取`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₂(h) │ ``第二层函数:模式识别`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`┌─────────┐`\ +`│ f₃(z) │ ``第三层函数:决策输出`\ +`└─────────┘`\ +` │`\ +` ▼`\ +`输出`` y` + +从Excel到神经网络 + + ------------------------------------ + Excel 神经网络 + --------------------- -------------- + y = ax + b 单层感知机 + + y = a₁x₁ + a₂x₂ + b 多输入神经元 + + 嵌套IF函数 多层网络 + + 宏函数 自动微分 + ------------------------------------ + +## 思考与练习 + +1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么? + +2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡? + +3.从函数式视角理解AI,对你理解设计问题有何启发? + +## 关键术语 + + ------------------------------------------------------------------------------------- + 中文 英文 说明 + ---------------------- --------------------------------- ---------------------------- + 万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证 + + 缩放定律 Scaling Law 模型性能与规模的关系 + + 前馈网络 Feed-Forward Network 信息单向传播的神经网络 + + 多层感知机 MLP Multi-Layer Perceptron + + 端到端学习 End-to-End Learning 从输入直接学习到输出 + ------------------------------------------------------------------------------------- + +## 延伸阅读 + +[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) + +[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem) + +[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x) diff --git a/01-introduction/01-introduction.md b/01-introduction/01-introduction.md new file mode 100644 index 0000000..ba9bc69 --- /dev/null +++ b/01-introduction/01-introduction.md @@ -0,0 +1,51 @@ +# 第一篇:导论 + +本篇建立读者对人工智能的宏观认知,介绍AI的发展历程和范式演进,帮助读者理解AI技术的全貌和发展趋势。 + +## 篇章导读 + +人工智能正在深刻改变设计的边界。从自动绘图到智能生成,从数据分析到自主决策,AI技术为设计领域带来了前所未有的可能性。 + +本篇将回答两个核心问题: 1. **AI是什么,它将如何影响设计?** 2. **AI技术是如何演进的,我们应该关注哪些方向?** + +通过本篇学习,你将建立对AI的宏观认知,理解技术发展的脉络,为后续深入学习打下基础。 + +## 章节目录 + +[00.1 AI发展历程](00.1-ai-overview.md) - 从Amazon Go到AI赋能 + +[00.2 AI范式演进](00.2-ai-paradigm.md) - 技术栈全景与发展趋势 + +## 学习目标 + +完成本篇后,你将能够: + +描述AI发展的关键节点和技术突破 + +理解AI四大赛道的区别和应用场景 + +掌握神经网络技术家族的演进脉络 + +建立AI技术栈的完整认知框架 + +## 核心概念 + + ------------------------------------------------------------------ + 概念 英文 说明 + ----------------- ------- ---------------------------------------- + 生成式AI AIGC AI-Generated Content,人工智能生成内容 + + 智能体 Agent 能够自主感知、决策和行动的系统 + + AI for Science AI4S AI驱动科学发现 + + AI in Education AIED AI在教育领域的应用 + ------------------------------------------------------------------ + +## 延伸思考 + +1.AI技术发展呈现加速趋势,这对设计行业意味着什么? + +2.在AIGC、Agent、AI4S、AIED四个方向中,你认为哪个对设计领域影响最大? + +3.了解AI技术演进后,你认为设计师应该掌握哪些AI相关技能? \# 00.1 AI发展历程 diff --git a/02-foundations/01.1-math-foundation.md b/02-foundations/01.1-math-foundation.md new file mode 100644 index 0000000..adf403e --- /dev/null +++ b/02-foundations/01.1-math-foundation.md @@ -0,0 +1,165 @@ + +### 学习目标 + +理解"Functions Describe the World"的核心理念 + +掌握从Excel到神经网络的演进逻辑 + +理解函数组合与层级抽象的思想 + +### 核心理念:函数描述世界 + +#### 从物理定律说起 + +物理学用简洁的函数描述复杂现象: + + ---------------------------------- + 现象 函数 发现者 + ---------- -------------- -------- + 自由落体 h = ½gt² 伽利略 + + 万有引力 F = Gm₁m₂/r² 牛顿 + + 电磁感应 ε = -dΦ/dt 法拉第 + ---------------------------------- + +这些函数的共同特点:**用数学关系描述客观规律** + +#### AI的函数观 + +AI延续了这一传统:**用函数从数据中学习规律** + +`数据`` → ``函数`` → ``预测``/``决策`\ +` x → f(x) → y` + +从Excel到神经网络 + +线性回归:y = ax + b + +在Excel中,我们经常做线性拟合: + +`房价`` ≈ 0.015 × ``面积`` + 50``万`\ +` y = a × x + b` + +这就是一个最简单的"AI模型":**单变量线性函数** + +多元回归:y = a₁x₁ + a₂x₂ + ... + b + +增加更多特征: + +`房价`` ≈ 0.01 × ``面积`` + 0.5 × ``卧室数`` + 0.3 × ``地段评分`` - 20``万` + +这就是**单层神经元**的数学形式! + +函数组合:层级嵌套 + +现实世界的关系往往是非线性的,需要函数组合: + +`h₁ = f₁(x) # ``第一层:提取特征` + +`h₂ = f₂(h₁) # ``第二层:组合特征` + +`y = f₃(h₂) # ``第三层:输出结果` + +这就是**多层神经网络**的本质! + +### 函数组合的威力 + +为什么需要多层? + +**单层函数**只能学习简单的线性关系 + +**多层函数**可以学习任意复杂的非线性关系 + +直观例子:识别圆形 + +`输入:像素点灰度值`\ +` ↓`\ +`第一层:检测边缘(梯度变化)`\ +` ↓`\ +`第二层:组合边缘成弧线`\ +` ↓`\ +`第三层:判断是否闭合`` → ``圆形` + +每一层都是一个函数,层层组合形成复杂能力。 + +### 数据驱动 vs 规则驱动 + +#### 规则驱动 + +`# ``传统编程:人工编写规则`\ +`def`` ``is_circle``(image):`\ +` edges ``=`` ``detect_edges``(image)`\ +` ``if`` ``edges.is_closed``() ``and`` ``edges.is_round``():`\ +` ``return`` ``True`\ +` ``return`` ``False` + +**问题**:规则难以穷举,无法处理复杂情况 + +#### 数据驱动 + +`# AI``:从数据中学习函数`\ +`f ``=`` ``neural_network``()`\ +`train(f, ``thousands_of_examples``)`\ +`result ``=`` f(``new_image``) ``# ``自动判断` + +**优势**:自动发现规律,适应复杂情况 + +### 神经网络的函数本质 + +数学表示 + +一个L层神经网络: + +`y = ``f_L``(f_{L-``1}(``...f_₂(f₁(x))))` + +其中每一层: + +`h = ``σ(``Wx`` + b)` + +W:权重矩阵(可学习参数) + +b:偏置向量(可学习参数) + +σ:激活函数(引入非线性) + +#### 视觉理解 + +`输入层`` ``隐藏层`` ``输出层`\ +` x ``h₁,h₂,h``₃ y`\ +` ● ──────────→ ○ ──────────→ ●`\ +` │ ○ │`\ +` ● ──────────→ ○ ──────────→ ●`\ +` │ ○ │`\ +` ● ──────────→ ○ ──────────→ ●`\ +` ``权重``W₁ ``权重``W₂` + +箭头上的权重就是函数的参数,通过学习自动确定。 + +### 思考与练习 + +1.列举3个日常生活中"用函数描述世界"的例子 + +2.为什么单层函数无法学习异或(XOR)问题? + +3.思考:设计中有哪些问题可以用"数据驱动函数"的思路解决? + +### 关键术语 + + ------------------------------------------------------------ + 中文 英文 说明 + ---------- --------------------- --------------------------- + 线性回归 Linear Regression y = ax + b 形式的函数拟合 + + 多元回归 Multiple Regression 多输入变量的线性模型 + + 权重 Weight 神经网络中的可学习参数 + + 偏置 Bias 调整输出基准的参数 + + 非线性 Non-linearity 无法用直线表示的关系 + ------------------------------------------------------------ + +### 延伸阅读 + +[Neural Networks and Deep Learning](http://neuralnetworksanddeeplearning.com/) - 在线书籍 diff --git a/02-foundations/01.2-mlp-basics.md b/02-foundations/01.2-mlp-basics.md new file mode 100644 index 0000000..41ed0b8 --- /dev/null +++ b/02-foundations/01.2-mlp-basics.md @@ -0,0 +1,221 @@ + +### 学习目标 + +理解MLP的基本结构 + +掌握前向传播的计算过程 + +了解激活函数的作用和类型 + +理解反向传播的基本思想 + +### MLP结构 + +#### 什么是MLP + +**MLP (Multi-Layer Perceptron)**:多层感知机,是最基础的神经网络结构。 + +网络架构 + +`输入层`` ``隐藏层`` ``输出层`\ +` ┌─────────┐ ┌─────────────┐ ┌─────────┐`\ +` │ x₁ │ │ h₁ │ │ y₁ │`\ +` │ x₂ │───→│ h₂ │───→│ y₂ │`\ +` │ x₃ │ │ h₃ │ │ y₃ │`\ +` │ ... │ │ ... │ │ ... │`\ +` │ xₙ │ │ hₘ │ │ yₖ │`\ +` └─────────┘ └─────────────┘ └─────────┘`\ +` │ │ │`\ +` └───────────────┴────────────────┘`\ +` ``全连接(每个神经元相连)` + +#### 层次说明 + + ---------------------------------------- + 层类型 作用 神经元数量 + -------- ---------------- -------------- + 输入层 接收原始数据 取决于特征数 + + 隐藏层 特征变换与组合 自由设计 + + 输出层 产生最终结果 取决于任务 + ---------------------------------------- + +### 前向传播 + +#### 单个神经元 + +`# ``线性部分`\ +`z ``=`` ``w₁x``₁ ``+`` ``w₂x``₂ ``+`` ... ``+`` ``wₙx``ₙ ``+`` b`\ +\ +`# ``激活函数`\ +`h ``=`` σ(z)` + +#### 完整网络 + +对于L层网络: + +`# ``第``1``层` + +`h₁ ``=`` σ``₁(``W₁x`` ``+`` b₁)` + +`# ``第``2``层` + +`h₂ ``=`` σ``₂(``W₂h``₁ ``+`` b₂)` + +`# ...` + +`# ``第``L``层` + + y = σₗ(Wₗh_{l-1} + bₗ) + +#### 数据流动 + +`输入向量`` x₀`\ +` │`\ +` ├─→ W₁, b₁ ──→ z₁ = ``W₁x``₀ + b₁`\ +` │ │`\ +` │ └─→ σ₁(z₁) = h₁`\ +` │ │`\ +` └──────────────────────────────├─→ W₂, b₂ ──→ z₂ = ``W₂h``₁ + b₂`\ +` │ │`\ +` └─→ σ₂(z₂) = h₂`\ +` │`\ +` └─→ ... → y` + +### 激活函数 + +#### 为什么需要激活函数? + +没有激活函数,多层网络就等价于单层线性变换: + +`y = W₂(``W₁x``) = (W₂W``₁)x`` = ``W'x` + +激活函数引入**非线性**,使网络能够学习复杂模式。 + +#### 常用激活函数 + + -------------------------------------------------------------------- + 激活函数 公式 特点 应用场景 + ---------- ----------------------------- ------------ -------------- + Sigmoid σ(z) = 1/(1+e⁻ᶻ) 输出(0,1) 二分类输出层 + + ReLU ReLU(z) = max(0,z) 简单高效 隐藏层首选 + + Softmax softmax(zᵢ) = eᶻⁱ/Σeᶻʲ 输出和为1 多分类输出层 + + Tanh tanh(z) = (eᶻ-e⁻ᶻ)/(eᶻ+e⁻ᶻ) 输出(-1,1) 循环网络 + -------------------------------------------------------------------- + +#### 视觉对比 + +`ReLU``: Sigmoid: Tanh:`\ +` ↑ ___ ___`\ +` │ / ╲`\ +` │ / ╲`\ +` │____ / ╲___`\ +` │ ______ / │`\ +` └──────── / └──`\ +` -``∞ 0`` +∞ -∞ 0 +∞ -∞ 0 +∞` + +### 损失函数与优化 + +#### 损失函数 + +损失函数衡量模型预测与真实值的差距: + + --------------------------------------- + 任务 损失函数 公式 + -------- ---------- ------------------- + 回归 均方误差 MSE = Σ(ŷ-y)²/n + + 二分类 交叉熵 CE = -y·log(ŷ) + + 多分类 交叉熵 CE = -Σyᵢ·log(ŷᵢ) + --------------------------------------- + +#### 优化目标 + +`最小化损失函数:`\ +`min L(f(x; θ), y)`\ +\ +`其中`` θ = {W₁, b₁, W₂, b₂, ...} ``是所有可学习参数` + +#### 梯度下降 + +`重复直到收敛:`\ +` θ = θ - α·∇L(θ)`\ +\ +`其中:`\ +` θ``:参数`\ +` α``:学习率`\ +` ∇L(θ)``:损失函数的梯度` + +### 反向传播 + +核心思想 + +从输出层向输入层反向计算梯度: + +`输出层误差`` → ``隐藏层误差`` → ... → ``输入层误差` + +链式法则 + +`∂L/∂W₁ = (∂L/∂y) · (∂y/∂h₂) · (∂h₂/∂z₂) ·`\ +` `` (``∂z₂/∂h₁) · (∂h₁/∂z₁) · (∂z₁/∂W₁)` + +直观理解 + +1.**前向传播**:计算每个神经元的输出 + +2.**计算误差**:比较输出与真实值 + +3.**反向传播**:将误差反向传递 + +4.**更新权重**:根据误差调整参数 + +### MLP vs 传统模型 + + -------------------------------------- + 特性 MLP 传统机器学习 + ------------ ---------- -------------- + 特征工程 自动学习 人工设计 + + 非线性能力 强 中/弱 + + 数据需求 大量 中等 + + 可解释性 低 高 + + 训练时间 长 短 + -------------------------------------- + +### 思考与练习 + +1.为什么隐藏层越多,网络表达能力越强? + +2.ReLU为什么比Sigmoid更适合隐藏层? + +3.如果所有权重初始化为0,会发生什么? + +### 关键术语 + + ---------------------------------------------------------- + 中文 英文 说明 + ---------- ------------------ ---------------------------- + 前向传播 Forward Pass 数据从输入到输出的计算过程 + + 反向传播 Backpropagation 计算梯度的算法 + + 损失函数 Loss Function 衡量预测误差的函数 + + 梯度下降 Gradient Descent 优化算法 + + 学习率 Learning Rate 参数更新的步长 + ---------------------------------------------------------- + +### 延伸阅读 + +[Neural Networks and Deep Learning - Chapter 1](http://neuralnetworksanddeeplearning.com/chap1.html) + +[Yes you should understand backprop](https://medium.com/@karpathy/yes-you-should-understand-backprop-e2f06eab496b) \# 01.3 编程工具与Vibe Coding diff --git a/02-foundations/01.3-programming.md b/02-foundations/01.3-programming.md new file mode 100644 index 0000000..738e3ba --- /dev/null +++ b/02-foundations/01.3-programming.md @@ -0,0 +1,226 @@ + +## 学习目标 + +掌握Python AI开发环境配置 + +了解核心科学计算库 + +理解Vibe Coding的AI辅助编程新模式 + +### Python环境配置 + +#### Anaconda vs Miniconda + + ----------------------------------------------- + 工具 大小 特点 适用场景 + ----------- --------- ------------ ------------ + Anaconda \~500MB 预装常用库 初学者推荐 + + Miniconda \~50MB 仅含conda 精简安装 + ----------------------------------------------- + +#### 安装步骤 + +##### 1.下载安装 + +o访问 https://www.anaconda.com/download + +o选择Python 3.x版本 + +o按提示安装 + +##### 2.创建虚拟环境 + +`conda`` create ``-n`` ai-env python=3.10`\ +`conda`` activate ai-env` + +##### 3.安装核心库 + +`conda`` install ``numpy`` pandas ``scipy`\ +`pip`` install torch ``torchvision` + +### 核心科学计算库 + +#### NumPy:数值计算基础 + +`import`` ``numpy`` ``as`` np`\ +\ +`# ``创建数组`\ +`x ``=`` ``np.array``([``1``, ``2``, ``3``, ``4``])`\ +\ +`# ``矩阵运算`\ +`W ``=`` ``np.random.randn``(``4``, ``3``) ``# 4×3``权重矩阵`\ +`h ``=`` np.dot(x, W) ``# ``矩阵乘法`\ +\ +`# ``激活函数`\ +`relu`` ``=`` ``np.maximum``(``0``, h) ``# ``ReLU` + +#### Pandas:数据处理 + +`import`` pandas ``as`` pd`\ +\ +`# ``读取数据`\ +`df`` ``=`` ``pd.read_csv``(``'data.csv'``)`\ +\ +`# ``数据清洗`\ +`df`` ``=`` ``df.dropna``()`\ +`df`` ``=`` ``df`` normalized ``=`` (``df`` ``-`` ``df.mean``()) ``/`` ``df.std``()`\ +\ +`# ``统计分析`\ +`df.describe``()` + +#### SciPy:科学计算 + +`from`` ``scipy`` ``import`` optimize`\ +`from`` ``scipy.spatial`` ``import`` distance`\ +\ +`# ``优化问题`\ +`result ``=`` ``optimize.minimize``(``loss_func``, x0)`\ +\ +`# ``距离计算`\ +`dist`` ``=`` ``distance.euclidean``(point1, point2)` + +### 开发工具选择 + +#### VSCode + +**特点**: - 微软开源,免费 - 丰富的插件生态 - 轻量级,启动快 + +**AI开发常用插件**: - Python - Jupyter - Pylance - Copilot + +## Cursor + +**特点**: - AI原生IDE - 代码补全与生成 - 自然语言编程 + +**使用场景**: - 快速原型开发 - 代码重构 - 学习新API + +## Jupyter Notebook + +**特点**: - 交互式编程 - 可视化友好 - 文档即代码 + +**使用场景**: - 数据探索 - 算法实验 - 教学演示 + +# Vibe Coding:AI辅助编程 + +## 什么是Vibe Coding + +传统编程:**明确需求 → 设计算法 → 编写代码** + +Vibe Coding:**模糊想法 → AI辅助 → 迭代完善** + +## 工作流程 + +### 1. 描述意图(自然语言) + +`"``帮我创建一个简单的神经网络``"` + +### + +`2. AI``生成代码` + +### → 自动生成完整代码框架 + +`3. ``运行测试` + +`→ ``发现问题或需要调整` + +`4. ``迭代优化` + +`"``把隐藏层改成``128``个神经元``"` + +`→ AI``自动修改代码` + +`5. ``理解学习` + + → 阅读AI生成的代码,学习最佳实践 + +## 实践技巧 + + --------------------------------- + 技巧 说明 + ---------- ---------------------- + 明确需求 详细描述输入输出 + + 分步实现 复杂功能拆解为小任务 + + 验证结果 检查生成的代码 + + 学习思考 理解AI为什么这样写 + --------------------------------- + +## 工具推荐 + + -------------------------------------------- + 工具 特点 适用场景 + ---------------- ---------------- ---------- + GitHub Copilot 代码补全 日常开发 + + Cursor 对话式编程 快速原型 + + ChatGPT/Claude 代码生成与解释 学习咨询 + + Replit Agent 端到端开发 小型项目 + -------------------------------------------- + +## 开发工作流 + +项目结构 + +`project/`\ +`├── data/ # ``数据文件`\ +`├── notebooks/ # ``Jupyter``笔记本`\ +`├── ``src``/ # ``源代码`\ +`│ ├── models/ # ``模型定义`\ +`│ ├── utils/ # ``工具函数`\ +`│ └── train.py # ``训练脚本`\ +`├── requirements.txt # ``依赖列表`\ +`└── README.md # ``项目说明` + +### 典型工作流 + +`# 1. ``创建环境`\ +`conda`` create ``-n`` ``myproject`` python=3.10`\ +`conda`` activate ``myproject`\ +\ +`# 2. ``安装依赖`\ +`pip`` install ``-r`` requirements.txt`\ +\ +`# 3. ``开发迭代`\ +`# - ``在``notebook``中实验`\ +`# - ``整理到``src``/``目录`\ +`# - ``运行测试`\ +\ +`# 4. ``保存环境`\ +`conda`` env export ``>`` ``environment.yml` + +## 思考与练习 + +1.对比Anaconda和Miniconda,什么时候该用哪个? + +2.尝试用Cursor/Copilot生成一个简单的神经网络代码 + +3.Vibe Coding如何改变传统的编程学习方式? + +## 关键术语 + + ----------------------------------------------------------- + 中文 英文 说明 + ---------- ----------------------- ------------------------ + 虚拟环境 Virtual Environment 隔离的Python运行环境 + + 依赖管理 Dependency Management 管理项目所需的库 + + 代码补全 Code Completion 自动补全正在输入的代码 + + 原型开发 Prototyping 快速构建可运行版本 + + 迭代优化 Iterative Refinement 逐步改进代码 + ----------------------------------------------------------- + +## 延伸阅读 + +[Anaconda官方文档](https://docs.anaconda.com/) + +[NumPy快速入门](https://numpy.org/doc/stable/user/quickstart.html) + +[Cursor使用指南](https://cursor.com/docs) diff --git a/02-foundations/02-foundations.md b/02-foundations/02-foundations.md new file mode 100644 index 0000000..dd1b01e --- /dev/null +++ b/02-foundations/02-foundations.md @@ -0,0 +1,49 @@ +# 第二篇:数学与编程基础 + +本篇从函数式视角理解AI,介绍神经网络的基本原理和Python编程工具,为后续学习打下基础。 + +## 篇章导读 + +理解AI不需要高深的数学背景。核心理念是:**神经网络就是由简单函数组合而成的复杂函数**。 + +从Excel的线性回归到深度神经网络,本质上是同样的思想:**用函数来描述和预测世界**。 + +本篇将: - 从函数式视角理解AI - 介绍多层感知机的基本原理 - 讲解Python编程工具和AI辅助编程 + +## 章节目录 + +[01.1 函数式AI视角](01.1-math-foundation.md) - "Functions Describe the World" + +[01.2 多层感知机](01.2-mlp-basics.md) - MLP结构与原理 + +[01.3 编程工具与Vibe Coding](01.3-programming.md) - Python环境与AI辅助编程 + +## 学习目标 + +完成本篇后,你将能够: + +从函数组合角度理解神经网络 + +描述MLP的基本结构和工作原理 + +配置Python AI开发环境 + +使用AI工具辅助编程学习 + +## 核心概念 + + ----------------------------------------------------------- + 概念 英文 说明 + ------------ --------------------- ------------------------ + 多层感知机 MLP Multi-Layer Perceptron + + 前向传播 Forward Pass 数据通过网络的过程 + + 激活函数 Activation Function 引入非线性的函数 + + 损失函数 Loss Function 衡量预测误差的函数 + + 反向传播 Backpropagation 计算梯度的算法 + ----------------------------------------------------------- + +## 01.1 函数式AI视角 diff --git a/03-computer-vision/02.1-cnn-foundation.md b/03-computer-vision/02.1-cnn-foundation.md new file mode 100644 index 0000000..fa54d3b --- /dev/null +++ b/03-computer-vision/02.1-cnn-foundation.md @@ -0,0 +1,145 @@ + +### 学习目标 + +理解CNN的核心思想:局部连接与权重共享 + +掌握卷积、激活、池化三大组件 + +了解CNN与MLP的区别和联系 + +### 为什么需要CNN + +MLP的问题 + +将图像展平成一维向量输入MLP: + +`28×28``图像`` → 784``维向量`` → MLP` + +**问题**: 1. 参数量巨大:784×1000 = 784,000个参数 2. 忽略空间结构:相邻像素的关系被破坏 3. 缺乏平移不变性:物体移位后需要重新学习 + +#### CNN的解决方案 + + ------------------------------------------------------------ + 特性 说明 优势 + ------------ -------------------------- -------------------- + 局部连接 每个神经元只连接局部区域 符合图像局部相关性 + + 权重共享 同一卷积核扫描全图 大幅减少参数 + + 层次化特征 低层→高层特征抽象 自动学习特征表达 + ------------------------------------------------------------ + +### CNN三大组件 + +#### 1. 卷积层 (Convolution) + +**卷积操作**:用卷积核(Filter)在图像上滑动,计算局部特征 + +`输入图像`` ``卷积核`` ``特征图`\ +`┌─────────┐ ┌─────┐ ┌─────────┐`\ +`│ 1 2 3 │ │ 1 0 │ │ 8 10 │`\ +`│ 4 5 6 │ ⊗ │ 0 -1 │ = │ 14 16 │`\ +`│ 7 8 9 │ │ │ │ │`\ +`└─────────┘ └─────┘ └─────────┘` + +**计算示例**: + +`输出``(1,1) = 1×1 + 2×0 + 4×0 + 5×(-1) = 1 - 5 = -4` + +**多通道卷积**: + +`RGB``图像`` (3``通道``) + ``卷积核`` (3×3×3) → ``特征图`` (``单通道``)` + +#### 2. 激活层 (Activation) + +通常使用ReLU: + +`output ``=`` ``max``(``0``, ``feature_map``)` + +作用:引入非线性,使网络能学习复杂模式 + +#### 3. 池化层 (Pooling) + +**最大池化** (Max Pooling): + +`2×2``窗口`` → ``取最大值`\ +`┌─────┐ ┌───┐`\ +`│3 1 │ │ 3 │`\ +`│2 5 │ → │ │`\ +`└─────┘ │ 5 │`\ +` └───┘` + +作用: - 降低维度,减少计算量 - 增强平移不变性 - 扩大感受野 + +### CNN架构示例 + +#### LeNet-5 (经典架构) + +`输入``(32×32) → ``卷积层`` → ``池化层`` → ``卷积层`` → ``池化层`\ +` ↓`\ +` ``全连接层`` → ``输出` + +#### VGG-16 (深层架构) + +`输入`` → [Conv×3 + Pool] ×2 → [Conv×3 + Pool] ×3`\ +` → [Conv×3 + Pool] ×3 → FC×3 → ``输出` + +### CNN vs MLP + + ------------------------------------- + 特性 MLP CNN + ---------- -------------- ----------- + 连接方式 全连接 局部连接 + + 权重 每个连接独立 同层共享 + + 空间结构 忽略 保留 + + 参数量 大 小 + + 适用任务 结构化数据 图像/语音 + ------------------------------------- + +### 经典网络架构演进 + +`LeNet`` (1998) → ``首次定义``CNN``结构`\ +` ↓`\ +`AlexNet`` (2012) → ``深度学习爆发,``ReLU``激活`\ +` ↓`\ +`VGG (2014) → ``更深网络,``3×3``小卷积核`\ +` ↓`\ +`GoogLeNet`` (2014) → Inception``模块,多尺度`\ +` ↓`\ +`ResNet`` (2015) → ``残差连接,``152``层`\ +` ↓`\ +`EfficientNet`` (2019) → ``复合缩放,高效` + +### 思考与练习 + +1.为什么卷积核通常选择奇数尺寸(3×3, 5×5)? + +2.感受野如何随着网络深度增加? + +3.设计一个简单的CNN用于手写数字识别 + +### 关键术语 + + ------------------------------------------------------- + 中文 英文 说明 + -------- ----------------- ---------------------------- + 卷积核 Kernel/Filter 用于特征提取的小矩阵 + + 步幅 Stride 卷积核滑动的步长 + + 填充 Padding 边缘补零以保持尺寸 + + 感受野 Receptive Field 神经元响应的输入区域 + + 通道 Channel 图像的颜色维度或特征图数量 + ------------------------------------------------------- + +### 延伸阅读 + +[CS231n: Convolutional Neural Networks](http://cs231n.stanford.edu/) + +[Understanding CNNs](https://poloclub.github.io/cnn-explainer/) \# 02.2 目标检测 diff --git a/03-computer-vision/02.2-object-detection.md b/03-computer-vision/02.2-object-detection.md new file mode 100644 index 0000000..53d7277 --- /dev/null +++ b/03-computer-vision/02.2-object-detection.md @@ -0,0 +1,168 @@ + +## 学习目标 + +理解目标检测与图像分类的区别 + +掌握YOLO系列的发展脉络 + +了解目标检测在设计中的应用 + +### 从分类到检测 + +#### 图像分类 + +`输入图像`` → CNN → ``类别标签`\ +`"``猫``" (``单标签``)` + +#### 目标检测 + +`输入图像`` → CNN → [``位置``, ``类别``]`\ +`[``边界框``, "``猫``", 0.95]`\ +`[``边界框``, "``狗``", 0.87]` + +**核心差异**:检测需要同时解决"是什么"和"在哪里" + +### 检测器类型 + +#### Two-Stage检测器 + +`第一阶段:候选区域生成`\ +` RPN (Region Proposal Network)`\ +\ +`第二阶段:分类与回归`\ +` ``对每个候选框进行精确预测`\ +\ +`代表:``R-CNN, Fast R-CNN, Faster R-CNN` + +特点:准确率高,速度慢 + +#### One-Stage检测器 + +`直接预测:一次性输出所有边界框和类别`\ +\ +`代表:``YOLO, SSD, ``RetinaNet` + +特点:速度快,实时性好 + +### YOLO系列演进 + +#### YOLO v1 (2016) + +**核心思想**:将检测转化为回归问题 + +`输入图像`` → S×S``网格`` → ``每个网格预测``B``个边界框` + +创新点: - 端到端训练 - 实时检测 (45 FPS) + +#### YOLO v2-v4 + + ---------------------------------- + 版本 主要改进 + ------ --------------------------- + v2 Batch Normalization, 锚框 + + v3 多尺度预测 + + v4 CSPDarknet, PANet + + v5 PyTorch实现,工程优化 + + v8 重新设计,更易用 + ---------------------------------- + +#### YOLO工作流程 + +##### 1. 输入图像 (640×640) + +`↓` + +##### 2. Backbone特征提取 + +`↓` + +##### 3. Neck特征融合 (FPN + PAN) + +`↓` + +##### 4. Head检测输出 + +`- ``边界框坐标` + +`- ``目标置信度` + +`- ``类别概率` + +### 评估指标 + +#### IoU (交并比) + +`IoU`` = ``预测框与真实框的交集`` / ``并集`\ +\ +` ┌─────────┐`\ +` │ ``预测框`` │`\ +` │ ┌───┐ │`\ +` │ │``真`` │ │`\ +` └──┼──┼─┘`\ +` └───┘`\ +\ +`IoU`` = ``重叠面积`` / ``总面积` + +### mAP (平均精度均值) + +在不同IoU阈值(0.5, 0.75...)下的平均精度 + +综合衡量定位准确度和分类准确度 + +### COCO数据集 + +80类物体,包含: - 目标检测 - 实例分割 - 关键点检测 - 图像说明 + +## 设计领域应用 + +建筑识别 + +`卫星图像`` → YOLO → ``建筑物边界框`\ +` ↓`\ +`自动生成建筑轮廓` + +场景分析 + +`室内照片`` → ``目标检测`` → ``家具识别`\ +` ↓`\ +`空间布局分析` + +遗产保护 + +`无人机影像`` → ``建筑病害检测`\ +` ↓`\ +`自动化巡检与记录` + +## 思考与练习 + +1.Two-Stage和One-Stage检测器的权衡是什么? + +2.为什么YOLO能实现实时检测? + +3.目标检测在规划设计中有哪些潜在应用? + +## 关键术语 + + ------------------------------------------------------- + 中文 英文 说明 + -------------- -------------- ------------------------- + 边界框 Bounding Box 矩形目标框 + + 锚框 Anchor Box 预定义的候选框 + + 非极大值抑制 NMS 去除重复检测 + + 交并比 IoU Intersection over Union + + 平均精度 AP Average Precision + ------------------------------------------------------- + +## 延伸阅读 + +[Ultralytics YOLO文档](https://docs.ultralytics.com/) + +[COCO数据集](https://cocodataset.org/) \# 02.3 语义分割与空间分析 diff --git a/03-computer-vision/02.3-semantic-segmentation.md b/03-computer-vision/02.3-semantic-segmentation.md new file mode 100644 index 0000000..eae0df7 --- /dev/null +++ b/03-computer-vision/02.3-semantic-segmentation.md @@ -0,0 +1,136 @@ + +## 学习目标 + +理解图像分析的三种层级 + +掌握语义分割与实例分割的区别 + +了解分割技术在空间分析中的应用 + +## 图像分析层级 + +### Pixel-Level (像素级) + +`每个像素独立处理`\ +`问题:不考虑上下文` + +### Patch-Level (图块级) + +`以图像块为单位`\ +`特点:保留局部空间关系`\ +`应用:``CNN``卷积操作` + +### Object-Level (对象级) + +`以完整对象为单位`\ +`特点:语义完整`\ +`应用:目标检测、分割` + +### 语义分割 vs 实例分割 + +#### 语义分割 (Semantic Segmentation) + +`所有同类对象归为一类`\ +`图像`` → [``道路``, ``建筑``, ``车辆``, ``行人``, ...]` + +特点: - 同类别用同一种颜色 - 不区分个体数量 + +#### 实例分割 (Instance Segmentation) + +`每个对象单独分割`\ +`图像`` → [``建筑``1, ``建筑``2, ``车``1, ``车``2, ...]` + +特点: - 区分同类对象的不同个体 - 更精细的场景理解 + +### 分割网络架构 + +#### FCN (全卷积网络) + +`CNN``特征提取`` → ``上采样`` → ``像素级预测` + +创新:用卷积层替代全连接层,输出热力图 + +#### U-Net + +`编码器`` → ``瓶颈层`` → ``解码器`\ +` ↓ ↑`\ +`跳跃连接`` ───────────────┘` + +特点: - U型对称结构 - 跳跃连接融合多尺度特征 - 医学图像分割经典架构 + +#### DeepLab系列 + +空洞卷积 (Atrous Convolution) + +扩大感受野而不降低分辨率 + +ASPP (空洞空间金字塔池化) + +### 空间分析应用 + +#### 遥感影像分析 + +`卫星图像`` → ``语义分割`` → ``土地利用分类`\ +` ↓`\ +`- ``建筑用地`\ +`- ``农用地`\ +`- ``水体`\ +`- ``森林` + +#### 城市形态分析 + +`街景图像`` → ``分割`` → ``空间品质评估`\ +` ↓`\ +`- ``绿视率`\ +`- ``天空开阔度`\ +`- ``建筑密度` + +#### 景观格局分析 + +`高分辨率影像`` → ``生态源地识别`\ +` ↓`\ +`景观连接性评估` + +### 分割与检测对比 + + -------------------------------- + 特性 目标检测 语义分割 + -------- ---------- ------------ + 输出 矩形框 像素级标注 + + 精度 粗糙 精细 + + 计算量 较低 较高 + + 应用 目标定位 场景理解 + -------------------------------- + +### 思考与练习 + +1.语义分割和实例分割分别在什么场景下更有用? + +2.U-Net的跳跃连接为什么重要? + +3.分割技术如何辅助规划设计决策? + +### 关键术语 + + ----------------------------------------------------- + 中文 英文 说明 + ---------- ----------------------- ------------------ + 语义分割 Semantic Segmentation 按类别分割像素 + + 实例分割 Instance Segmentation 按对象个体分割 + + 热力图 Heatmap 像素级预测结果 + + 空洞卷积 Atrous Convolution 扩大感受野的卷积 + + 跳跃连接 Skip Connection 跨层连接 + ----------------------------------------------------- + +### 延伸阅读 + +[Fully Convolutional Networks](https://arxiv.org/abs/1411.4038) + +[U-Net: Convolutional Networks for Biomedical Image Segmentation](https://arxiv.org/abs/1505.04597) diff --git a/03-computer-vision/03-computer-vision.md b/03-computer-vision/03-computer-vision.md new file mode 100644 index 0000000..8306877 --- /dev/null +++ b/03-computer-vision/03-computer-vision.md @@ -0,0 +1,33 @@ +# 第三篇:计算机视觉与空间图像 + +本篇深入讲解计算机视觉的核心技术CNN,以及目标检测和语义分割在空间分析中的应用。 + +## 篇章导读 + +计算机视觉让机器"看见"世界。从图像分类到目标检测,从语义分割到场景理解,视觉技术正在改变设计领域对空间信息的处理方式。 + +本篇将系统介绍CNN原理及其在空间分析中的应用。 + +## 章节目录 + +[02.1 CNN基础原理](02.1-cnn-foundation.md) - 卷积神经网络三大组件 + +[02.2 目标检测](02.2-object-detection.md) - YOLO系列与应用 + +[02.3 语义分割与空间分析](02.3-semantic-segmentation.md) - 图像分析层级 + +## 核心概念 + + --------------------------------------------------------------- + 概念 英文 说明 + -------------- ----------------- ------------------------------ + 卷积神经网络 CNN Convolutional Neural Network + + 特征图 Feature Map 卷积操作的输出 + + 感受野 Receptive Field 神经元能"看到"的输入区域 + + 池化 Pooling 下采样操作 + --------------------------------------------------------------- + +## 02.1 CNN基础原理 diff --git a/04-transformer/03.1-attention.md b/04-transformer/03.1-attention.md new file mode 100644 index 0000000..7d80b61 --- /dev/null +++ b/04-transformer/03.1-attention.md @@ -0,0 +1,156 @@ + +### 学习目标 + +理解Self-Attention的动机和原理 + +掌握Q、K、V的计算过程 + +了解Multi-Head Attention的优势 + +### 为什么需要Attention + +#### 序列标注问题 + +`输入序列:``x₁, x₂, ..., xₙ (N``个元素``)`\ +`输出序列:``y₁, y₂, ..., yₙ' (N'``个元素``)` + +传统方法 (RNN/FCN): - 固定窗口大小 - 长距离依赖丢失 - 难以并行计算 + +Self-Attention: - 每个元素都能关注所有元素 - 直接建模任意距离依赖 - 可以并行计算 + +### Self-Attention原理 + +#### 核心思想 {#核心思想-1} + +为每个输出元素,计算输入序列中所有元素的相关性: + +`对于每个位置``i``:`\ +` yᵢ = Σ (``注意力权重`` × ``对应输入值``)` + +#### Q、K、V计算 + +`输入``X → ``三个线性变换`\ +` ↓`\ +`Q (Query): "``我想找什么``"`\ +`K (Key): "``我有什么标签``"`\ +`V (Value): "``我的实际内容``"` + +#### 注意力分数计算 + +`1. ``计算相似度:``Score = Q × Kᵀ` + +`2. ``缩放:``Score = Score / √dₖ` + +`3. ``Softmax``:``Weight = ``softmax``(Score)` + +`4. ``加权求和:``Output = Weight × V` + +#### 直观理解 {#直观理解-2} + +`查询:``"``苹果``"`\ +` ↓`\ +`与所有``Key``计算相似度`\ +` ↓`\ +`权重高的``Key``对应``Value``贡献更大`\ +` ↓`\ +`输出:融合上下文的``"``苹果``"``表示` + +### Multi-Head Attention + +单头 vs 多头 + +**单头注意力**: + +`一组``Q``、``K``、``V → ``一个注意力表示` + +**多头注意力**: + +`多组``Q``、``K``、``V → ``多个注意力表示`` → ``拼接` + +#### 多头优势 + + --------------------- + 头 关注内容 + -------- ------------ + Head 1 语法关系 + + Head 2 语义指代 + + Head 3 长距离依赖 + + ... ... + --------------------- + +多头让模型从不同角度理解序列。 + +### Positional Encoding + +#### 问题 + +Self-Attention本身是**置换不变**的: + +`Attention(``[A, B, C]) = Attention([B, A, C])` + +但序列位置很重要! + +#### 解决方案 + +添加位置信息: + +`输入`` = X + ``PositionalEncoding` + +常用方法: - 正弦/余弦位置编码 - 可学习位置编码 + +### Self-Attention vs CNN + +感受野对比 + + ------------------------------------ + 层级 CNN Self-Attention + ------ ------------ ---------------- + 单层 局部感受野 全局感受野 + + 深层 逐层扩大 始终全局 + ------------------------------------ + +计算复杂度 + + -------------------------------------- + 操作 CNN Self-Attention + -------- ------------ ---------------- + 复杂度 O(k²·C) O(n²·d) + + n 图像尺寸 序列长度 + + k 卷积核大小 \- + -------------------------------------- + +### 思考与练习 + +1.为什么Attention需要Scaling (除以√dₖ)? + +2.Multi-Head Attention中,头数越多越好吗? + +3.Self-Attention如何应用在图像上? + +### 关键术语 + + ------------------------------------------------------ + 中文 英文 说明 + ---------- -------------------- ---------------------- + 查询 Query 查询向量 + + 键 Key 键向量 + + 值 Value 值向量 + + 缩放点积 Scaled Dot-Product 注意力计算方式 + + 掩码 Mask 屏蔽某些位置的注意力 + ------------------------------------------------------ + +### 延伸阅读 + +[Attention Is All You Need](https://arxiv.org/abs/1706.03762) + +[The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) \# 03.2 Transformer架构 diff --git a/04-transformer/03.2-transformer.md b/04-transformer/03.2-transformer.md new file mode 100644 index 0000000..4b53a60 --- /dev/null +++ b/04-transformer/03.2-transformer.md @@ -0,0 +1,157 @@ + +### 学习目标 + +理解Transformer的Encoder-Decoder结构 + +掌握各组件的作用和连接方式 + +了解Token处理流程 + +### 整体架构 + +`输入``Token``序列`` → Encoder → ``编码表示`\ +` ↓`\ +`输出``Token``序列`` ← Decoder ← ``编码表示` + +### Encoder层 + +单层结构 + +`输入``X`\ +` ↓`\ +`Multi-Head Self-Attention`\ +` ↓`\ +`Add & Norm (``残差连接`` + ``层归一化``)`\ +` ↓`\ +`Feed-Forward Network (FFN)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`输出``H` + +#### 残差连接 + +`输出`` = F(x) + x` + +作用: - 缓解梯度消失 - 便于训练深层网络 + +#### 层归一化 + +`输出`` = ``LayerNorm``(x + F(x))` + +作用: - 稳定训练 - 加速收敛 + +#### FFN (前馈网络) + +`FFN(x) = ``ReLU``(``xW``₁ + b₁)W₂ + b₂` + +本质:两层全连接网络,非线性变换 + +### Decoder层 + +#### 结构 + +`输入``X`\ +` ↓`\ +`Masked Self-Attention (``只能看之前的位置``)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`Cross-Attention (Query``来自``Decoder, Key/Value``来自``Encoder)`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`FFN`\ +` ↓`\ +`Add & Norm`\ +` ↓`\ +`输出`` (``接``Softmax``预测概率``)` + +#### Cross-Attention + +`Q: Decoder``的隐藏状态`\ +`K, V: Encoder``的输出` + +作用:让Decoder关注Encoder的相关部分 + +## Token处理流程 + +### 输入处理 + +`文本`` → Tokenize → Token IDs`\ +` ↓`\ +` Embedding``层`\ +` ↓`\ +` ``位置编码相加`\ +` ↓`\ +` Encoder/Decoder` + +### 输出处理 + +`Decoder``输出`` → ``线性层`` → ``Softmax`` → ``概率分布`\ +` ↓`\ +` ``选择最大值` + +## 训练与推理 + +训练阶段 + +`教师强制`` (Teacher Forcing)``:`\ +` ``真实标签作为``Decoder``输入`\ +` ``可以并行计算` + +推理阶段 + +`自回归生成`` (Autoregressive)``:`\ +` ``生成一个``Token → ``加入输入`` → ``生成下一个`\ +` ``串行计算` + +## Transformer变体 + +BERT (Encoder-only) + +`输入`` → Encoder → [CLS]``表示`` / ``每个``Token``表示` + +应用:分类、NER、问答 + +GPT (Decoder-only) + +`输入`` → Decoder → ``下一个``Token``预测` + +应用:文本生成 + +T5 (Encoder-Decoder) + +`输入`` → Encoder → ``表示`` → Decoder → ``输出` + +应用:翻译、摘要 + +## 思考与练习 + +1. 为什么Decoder需要Masked Attention? + +2. Encoder-only和Decoder-only模型各有什么优势? + +3. Transformer如何处理超长序列? + +## 关键术语 + + ---------------------------------------------------------- + 中文 英文 说明 + --------------- --------------------- -------------------- + 残差连接 Residual Connection 跨层连接 + + 层归一化 Layer Normalization 归一化层 + + 教师强制 Teacher Forcing 训练时使用真实标签 + + 自回归 Autoregressive 基于前序生成后续 + + 编码器-解码器 Encoder-Decoder Seq2Seq架构 + ---------------------------------------------------------- + +## 延伸阅读 + +1. [The Annotated Transformer](https://nlp.seas.harvard.edu/2018/04/03/attention.html) + + [Visualizing A Machine Learning Model](https://poloclub.github.io/transformer-explainer/) \# 03.3 大语言模型应用 diff --git a/04-transformer/03.3-llm-application.md b/04-transformer/03.3-llm-application.md new file mode 100644 index 0000000..c62ae88 --- /dev/null +++ b/04-transformer/03.3-llm-application.md @@ -0,0 +1,166 @@ + +## 学习目标 + +3. 理解从Transformer到ChatGPT的演进 + + 掌握RAG、RLHF等关键技术 + + 了解Prompt工程在设计中的应用 + +## 从Transformer到ChatGPT + +### GPT系列演进 + + ------------------------------------------------------ + 模型 发布时间 参数量 特点 + --------- ---------- -------- ------------------------ + GPT-1 2018 117M 验证Decoder-only可行性 + + GPT-2 2019 1.5B 展示零样本能力 + + GPT-3 2020 175B 少样本学习震撼业界 + + ChatGPT 2022 \~ 对话能力达到新高度 + + GPT-4 2023 \~ 多模态能力 + ------------------------------------------------------ + +### 训练范式 + +`预训练`` (Pre-training)``:`\ +` ``大规模文本`` → ``无监督学习`` → ``语言模型`\ +\ +`微调`` (Fine-tuning)``:`\ +` ``特定任务`` → ``有监督学习`` → ``任务模型` + +## RAG:检索增强生成 + +### 核心思想 {#核心思想-2} + + 用户提问 → 检索相关文档 → LLM生成答案 + ↑ + 外部知识库 + +### RAG架构 + +#### 文档索引 + +`文档`` → ``切分`` → Embedding → ``向量数据库` + +#### + +`2. ``检索阶段` + +#### 问题 → Embedding → 相似度搜索 → 相关文档 + +`3. ``生成阶段` + + 问题 + 相关文档 → LLM → 答案 + +### RAG优势 + + --------------------------- + 特点 说明 + ---------- ---------------- + 减少幻觉 基于检索的事实 + + 可更新 更新知识库即可 + + 可解释 显示参考来源 + --------------------------- + +## RLHF:人类反馈强化学习 + +### 为什么需要RLHF + +预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出 + +### RLHF三阶段 + +#### 有监督微调 (SFT) + +`人工标注对话`` → ``微调模型` + +`2. ``奖励模型`` (RM)` + +#### 多个输出 → 人类排序 → 训练奖励模型 + +`3. ``强化学习`` (RL)` + + PPO算法 → 优化策略 + +### 效果 + +1. 输出更符合人类偏好 + + 减少有害内容 + + 提高回答质量 + +## Prompt工程 + +### Prompt设计原则 + +#### 明确任务 + +`好:请总结以下文本的主要观点`\ +`差:看看这段文字` + +#### 提供示例 + +`任务:情感分类`\ +`示例:`\ +`"``这部电影太棒了!``" → ``正面`\ +`"``服务态度很差。``" → ``负面`\ +`现在分类:``"..."` + +### 指定格式 + +`请按以下格式输出:`\ +`- ``观点``1``:``...`\ +`- ``观点``2``:``...`\ +`- ``结论:``...` + +## 设计领域应用 + + ------------------------------------------------------- + 任务 Prompt示例 + ---------- -------------------------------------------- + 方案生成 "设计一个50人的办公空间,要求开放式布局" + + 代码生成 "写一个Python脚本计算建筑容积率" + + 文档撰写 "帮我写一份景观设计说明书的框架" + ------------------------------------------------------- + +## 思考与练习 + +1. RAG和微调(Fine-tuning)各适用于什么场景? + +2. 如何评估LLM输出的质量? + +3. Prompt工程在设计工作流中能解决什么问题? + +## 关键术语 + + ------------------------------------------------------------------------------------ + 中文 英文 说明 + ------------------ -------------------- -------------------------------------------- + 检索增强生成 RAG Retrieval-Augmented Generation + + 人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback + + 提示工程 Prompt Engineering 设计输入以引导模型输出 + + 向量数据库 Vector Database 存储和检索向量表示 + + 幻觉 Hallucination 模型编造错误信息 + ------------------------------------------------------------------------------------ + +## 延伸阅读 + +1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165) + + [Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155) + + [LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/) diff --git a/04-transformer/04-transformer.md b/04-transformer/04-transformer.md new file mode 100644 index 0000000..16b607f --- /dev/null +++ b/04-transformer/04-transformer.md @@ -0,0 +1,33 @@ +# 第四篇:Transformer与大模型 + +本篇介绍革命性的Transformer架构和大语言模型,理解Self-Attention机制和LLM应用。 + +## 篇章导读 + +Transformer是AI领域最重要的架构创新之一。它不仅彻底改变了自然语言处理,还通过Attention机制启发了计算机视觉的范式变革。 + +本篇将从注意力机制出发,深入理解Transformer架构,并探讨大语言模型在设计领域的应用。 + +## 章节目录 + +[03.1 注意力机制](03.1-attention.md) - Self-Attention原理 + +[03.2 Transformer架构](03.2-transformer.md) - Encoder-Decoder结构 + +[03.3 大语言模型应用](03.3-llm-application.md) - ChatGPT、RAG与Prompt工程 + +## 核心概念 + + ------------------------------------------------------- + 概念 英文 说明 + ------------ --------------------- -------------------- + 注意力机制 Attention 关注输入的重要部分 + + 自注意力 Self-Attention 序列内部的关系建模 + + 位置编码 Positional Encoding 保留序列位置信息 + + 令牌 Token 文本的基本单位 + ------------------------------------------------------- + +## 03.1 注意力机制 diff --git a/05-generative-ai/04.1-diffusion.md b/05-generative-ai/04.1-diffusion.md new file mode 100644 index 0000000..31447c9 --- /dev/null +++ b/05-generative-ai/04.1-diffusion.md @@ -0,0 +1,151 @@ + +### 学习目标 + +1. 理解生成模型的发展脉络 + + 掌握Diffusion模型的基本原理 + + 了解各类生成模型的优缺点 + +### 生成模型家族 + +#### AE (Autoencoder,自编码器) + +`输入`` → ``编码器`` → ``潜在表示`` → ``解码器`` → ``重构` + +思想:学习数据的压缩表示 + +问题:生成的图像模糊,缺乏多样性 + +#### VAE (Variational AE,变分自编码器) + +`潜在空间约束为标准正态分布`\ +` ↓`\ +`可以随机采样`` → ``解码`` → ``生成新图像` + +改进:引入概率分布,增强生成能力 + +#### GAN (Generative Adversarial Network) + +`生成器:生成假图像`\ +`判别器:判断真假`\ +` ↓`\ +`对抗训练,相互博弈` + +优势:生成图像质量高 问题:训练不稳定,模式崩溃 + +#### Diffusion Model (扩散模型) + +`前向:逐步加噪`` → ``纯噪声`\ +`反向:学习去噪`` → ``还原图像` + +优势:训练稳定,生成质量极高 代表:Stable Diffusion, DALL-E 3 + +### Diffusion原理 + +#### 前向过程 (加噪) + +`原图`` x₀`\ +` ↓ ``加高斯噪声`\ +`x₁ = x₀ + ε₁`\ +` ↓ ``加噪声`\ +`x₂ = x₁ + ε₂`\ +` ↓ ...`\ +`x_T`` = ``纯噪声` + +#### 反向过程 (去噪) + +`纯噪声`` ``x_T`\ +` ↓ ``去噪`\ +`x_{T-1} = ``去噪网络``(``x_T``)`\ +` ↓ ``去噪`\ +`x_{T-2} = ``去噪网络``(x_{T-1})`\ +` ↓ ...`\ +`x₀ = ``原始图像` + +#### 训练目标 + +`去噪网络学习预测:`\ +` ``添加的噪声`` ε`\ +` ``或`\ +` ``原始图像`` x₀` + +### Stable Diffusion架构 + +#### 潜在空间扩散 + +`为了效率,在潜在空间操作:`\ +\ +`图像`` → VAE``编码`` → ``潜在表示`` → ``扩散`` → ``去噪`\ +` ↓`\ +` VAE``解码`` → ``图像` + +#### 核心组件 + + ------------------------------------- + 组件 作用 + -------------- ---------------------- + VAE 图像与潜在空间的转换 + + U-Net 去噪网络 + + Text Encoder 处理文本提示词 + + CLIP 文图对齐 + ------------------------------------- + +### 文生图工作流 + +#### 输入提示词 + +`"``一只猫,水彩画风格``"` + +#### + +`2. ``文本编码` + +#### → 文本向量表示 + +`3. ``初始化` + +#### → 随机噪声 + +`4. ``去噪循环` + +`for t in T...1:` + +`噪声`` → ``预测噪声`` → ``去噪` + +`5. ``解码输出` + + → 潜在表示 → VAE解码 → 图像 + +### 思考与练习 + +1. Diffusion为什么比GAN训练更稳定? + +2. 潜在空间扩散有什么优势? + +3. 文生图如何实现风格控制? + +### 关键术语 + + --------------------------------------------------- + 中文 英文 说明 + ---------- ----------------- ---------------------- + 潜在空间 Latent Space 压缩后的数据表示空间 + + 去噪 Denoising 移除噪声的过程 + + 提示词 Prompt 指导生成的文本描述 + + 潜变量 Latent Variable 不可直接观测的变量 + + 模式崩溃 Mode Collapse GAN生成多样性不足 + --------------------------------------------------- + +### 延伸阅读 + +1. [Denoising Diffusion Probabilistic Models](https://arxiv.org/abs/2006.11239) + + [High-Resolution Image Synthesis with Latent Diffusion Models](https://arxiv.org/abs/2112.10752) \# 04.2 AIGC设计工具链 diff --git a/05-generative-ai/04.2-aigc-tools.md b/05-generative-ai/04.2-aigc-tools.md new file mode 100644 index 0000000..ab7965c --- /dev/null +++ b/05-generative-ai/04.2-aigc-tools.md @@ -0,0 +1,180 @@ + +## 学习目标 + +3. 掌握ControlNet的条件控制机制 + + 理解LoRA高效微调原理 + + 了解ComfyUI工作流搭建 + +## ControlNet:精确控制 + +核心问题 + +纯文生图:难以精确控制空间结构 + +### ControlNet解决 + +`输入图像`` → ``提取条件`` (``边缘``/``深度``/``姿态``)`\ +` ↓`\ +`条件`` → ControlNet → ``主模型`` → ``输出图像` + +### 条件类型 + + ------------------------------------ + 条件 说明 应用 + -------------- ---------- ---------- + Canny 边缘检测 轮廓控制 + + Depth 深度图 空间关系 + + Pose 人体姿态 人物生成 + + Normal 法线图 表面细节 + + Segmentation 分割图 区域控制 + ------------------------------------ + +### 应用场景 + +`草图`` → ControlNet → ``精细效果图`\ +`平面图`` → ControlNet → ``三维渲染`\ +`结构图`` → ControlNet → ``风格化设计` + +LoRA:高效微调 + +问题 + +全量微调大模型:计算资源需求巨大 + +LoRA原理 + +`原始权重`` W ``固定`\ +` ↓`\ +`添加低秩分解:`\ +` ΔW = A × B`\ +` (``d×r``) × (``r×d``)`\ +` ↓`\ +`新输出`` = ``Wx`` + ``ABx` + +优势: - 参数量减少100-1000倍 - 训练速度快 - 易于切换风格 + +### 应用方式 + +`基础模型`` + ``LoRA`` A = ``风格``A`\ +`基础模型`` + ``LoRA`` B = ``风格``B`\ +`基础模型`` + ``LoRA`` A + B = ``混合风格` + +## ComfyUI:模块化工作流 + +### 核心特点 + +`节点化连接`\ +` ↓`\ +`可视化流程`\ +` ↓`\ +`灵活定制` + +### 典型节点 + + --------------------------------- + 节点类型 功能 + ------------------ -------------- + Load Checkpoint 加载模型 + + CLIP Text Encode 文本编码 + + KSampler 采样生成 + + VAE Decode 潜在空间解码 + + Save Image 保存图像 + + ControlNet 条件控制 + + LoRA Loader 加载LoRA + --------------------------------- + +### 工作流示例 + +`文本提示`` → CLIP``编码`` →`\ +` ↓`\ +`正负提示`` ────→ ``KSampler`` ← ControlNet`\ +` ↓`\ +` VAE``解码`\ +` ↓`\ +` ``保存图像` + +## 设计领域应用案例 + +### 建筑设计 + +`草图生成`` → ControlNet (Canny) → ``效果图`\ +`方案变体`` → ``LoRA``风格微调`` → ``多方案对比` + +### 室内设计 + +`户型图`` → ControlNet → ``三维效果图`\ +`风格迁移`` → ``LoRA`` → ``不同材质方案` + + --------------------------------------- + 工具 核心价值 + ------------------ -------------------- + Midjourney 快速创意探索 + + Stable Diffusion 本地部署,可控生成 + + ControlNet 精确结构控制 + + ComfyUI 定制化工作流 + --------------------------------------- + +## 版权与伦理 + +### 版权问题 + +6. AI训练数据的版权归属 + + AI生成作品的版权保护 + + 风格模仿的法律边界 + +### 伦理考量 + +9. 深度伪造 (Deepfake) + + 虚假信息传播 + + 创作者职业影响 + +## 思考与练习 + +1. ControlNet如何平衡条件控制与创造性? + +2. LoRA和全量微调各适用于什么场景? + +3. AIGC工具如何融入设计工作流? + +## 关键术语 + + ------------------------------------------------------ + 中文 英文 说明 + ---------- --------------------- --------------------- + 条件控制 Conditional Control 引导生成过程 + + 低秩适应 LoRA Low-Rank Adaptation + + 工作流 Workflow 节点化的处理流程 + + 采样器 Sampler 去噪采样算法 + + 潜在空间 Latent Space 压缩的特征空间 + ------------------------------------------------------ + +## 延伸阅读 + +1. [ControlNet官方论文](https://arxiv.org/abs/2302.05543) + + [LoRA官方论文](https://arxiv.org/abs/2106.09685) + + [ComfyUI文档](https://docs.comfy.org/) diff --git a/05-generative-ai/05-generative-ai.md b/05-generative-ai/05-generative-ai.md new file mode 100644 index 0000000..8a497a0 --- /dev/null +++ b/05-generative-ai/05-generative-ai.md @@ -0,0 +1,31 @@ +# 第五篇:生成式AI + +本篇讲解生成模型的发展脉络和AIGC工具链,探索AI在设计创造领域的应用。 + +## 篇章导读 + +生成式AI正在重新定义创造的边界。从图像生成到音乐创作,从文本写作到代码生成,AI正在成为人类的"创意伙伴"。 + +本篇将系统介绍生成模型的演进和AIGC工具链。 + +## 章节目录 + +1. [04.1 生成模型演进](04.1-diffusion.md) - 从VAE/GAN到Diffusion + + [04.2 AIGC设计工具链](04.2-aigc-tools.md) - ControlNet、LoRA与ComfyUI + +## 核心概念 + + ----------------------------------------------------------- + 概念 英文 说明 + -------------- ----------- -------------------------------- + 自编码器 AE Autoencoder + + 变分自编码器 VAE Variational Autoencoder + + 生成对抗网络 GAN Generative Adversarial Network + + 扩散模型 Diffusion Denoising Diffusion Model + ----------------------------------------------------------- + +## 04.1 生成模型演进 diff --git a/06-agent/05.1-agent-architecture.md b/06-agent/05.1-agent-architecture.md new file mode 100644 index 0000000..9da32f5 --- /dev/null +++ b/06-agent/05.1-agent-architecture.md @@ -0,0 +1,148 @@ + +## 学习目标 + +1. 理解从规则到LLM-based Agent的演进 + + 掌握Agent的核心组件 + + 了解ReAct和CoT推理模式 + +## 从规则到LLM Agent + +### 规则系统时代 + +`if`` ``condition_A``:`\ +` ``action_``B``(``)`\ +`elif`` ``condition_C``:`\ +` ``action_D``()`\ +`else``:`\ +` ``action_E``()` + +局限:规则难以穷举,无法应对新情况 + +### LLM-based Agent + +`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出` + +优势: - 自然语言交互 - 上下文理解 - 泛化能力强 + +## Agent核心组件 + +### 感知 (Perception) + +`输入信息`` → ``理解与解析`\ +` - ``用户指令`\ +` - ``环境状态`\ +` - ``工具反馈` + +### 规划 (Planning) + +`目标`` → ``分解为子任务`\ +` - ``任务分析`\ +` - ``步骤规划`\ +` - ``依赖管理` + +### 记忆 (Memory) + +`┌─────────────────────────────┐`\ +`│ ``短期记忆`` (Short-term) │`\ +`│ ``对话上下文、临时状态`` │`\ +`├─────────────────────────────┤`\ +`│ ``长期记忆`` (Long-term) │`\ +`│ ``知识库、经验积累`` │`\ +`└─────────────────────────────┘` + +### 工具调用 (Tool Use) + +`可用工具集:`\ +` - ``数据库查询`\ +` - API``调用`\ +` - ``文件操作`\ +` - ``代码执行`\ +` ...` + +## 推理模式 + +Chain of Thought (CoT) + +`问题`` → ``思考链`` → ``答案` + +`"``设计一个公园``"` + +` ↓` + +1. `分析场地条件` + +2. `2. ``确定功能分区` + +3. `3. ``布局路径系统` + +`4. ``选择植物配置` + +`↓` + + 完整方案 + +### ReAct (Reasoning + Acting) + +`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\ +\ +`思考:需要查询场地数据`\ +`行动:调用``GIS``工具`\ +`观察:获取到高程信息`\ +`思考:基于高程做排水设计`\ +`行动:生成排水方案`\ +`...` + +## Agent架构示例 + +单Agent架构 + +`┌─────────────────────────────┐`\ +`│ LLM Core │`\ +`│ (``规划、推理、决策``) │`\ +`├─────────────────────────────┤`\ +`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\ +`│ │``感知``││``记忆``││``工具``││``反思``│ │`\ +`│ └───┘ └───┘ └───┘ └───┘ │`\ +`└─────────────────────────────┘`\ +` ↓`\ +` ``执行任务` + +### 多Agent协作 + +`┌─────────┐ ┌─────────┐ ┌─────────┐`\ +`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\ +`└─────────┘ └─────────┘ └─────────┘`\ +` ↓ ↓ ↓`\ +` ``任务分解`` ``数据分析`` ``方案生成` + +## 思考与练习 + +1. 单Agent和多Agent系统各有什么优势? + +2. 如何设计Agent的记忆系统? + +3. CoT和ReAct各适用于什么场景? + +## 关键术语 + + -------------------------------------------- + 中文 英文 说明 + ---------- ------------ -------------------- + 思考链 CoT Chain of Thought + + 推理行动 ReAct Reasoning + Acting + + 记忆 Memory 存储和检索信息 + + 反思 Reflection 自我评估与改进 + + 工具使用 Tool Use 调用外部能力 + -------------------------------------------- + +## 延伸阅读 + +1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/) + + [ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能 diff --git a/06-agent/05.2-embodied-ai.md b/06-agent/05.2-embodied-ai.md new file mode 100644 index 0000000..d41cb2f --- /dev/null +++ b/06-agent/05.2-embodied-ai.md @@ -0,0 +1,157 @@ + +# 学习目标 + +3. 理解具身智能的概念和特点 + + 了解数字孪生与物理世界的交互 + + 掌握强化学习在具身AI中的应用 + +# 什么是具身智能 + +## 定义 + +**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。 + +## 与传统AI的区别 + + ------------------------------------ + 特性 传统AI 具身AI + ---------- ------------ ------------ + 交互方式 数据输入 主动探索 + + 学习方式 从数据学习 从交互学习 + + 输出形式 预测/生成 行动/操作 + ------------------------------------ + +# 数字孪生 + +## 概念 + +`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制` + +## 应用层次 + + -------------------------------- + 层次 内容 应用 + ---------- ---------- ---------- + 几何孪生 三维模型 可视化 + + 物理孪生 物理仿真 性能分析 + + 行为孪生 行为模拟 场景预测 + + 认知孪生 决策支持 智能控制 + -------------------------------- + +# 强化学习基础 + +## 核心要素 + +`┌─────────────────────────────────────┐`\ +`│ │`\ +`│ ``环境`` ← ``状态`` ──────→ Agent │`\ +`│ ↑ │ │`\ +`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\ +`│ │`\ +`└─────────────────────────────────────┘` + +## 训练循环 + +1. `观察环境状态` + +2. `选择行动` + +3. `执行行动` + +4. `获得奖励` + +5. `更新策略` + +6. `重复``...` + +## Gymnasium环境 + +`import gymnasium as gym`\ +\ +`env = ``gym.make``("CartPole-v1")`\ +`state, _ = ``env.reset``()`\ +\ +`for _ in range(1000):`\ +` action = policy(state)`\ +` state, reward, done, _, _ = ``env.step``(action)`\ +` if done:`\ +` break` + +# 具身AI应用场景 + +## 机器人设计 + +`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\ +` ↓`\ +`建筑机器人、施工机器人` + +## 虚拟角色 + +`游戏``NPC``、虚拟助手、元宇宙居民`\ +` ↓`\ +`自然行为、智能对话` + +## 仿真训练 + +`虚拟环境`` → ``训练策略`` → ``迁移到真实`\ +` ↓`\ +`降低试错成本` + +# 虚拟到真实的迁移 + +## 挑战 + + ----------------------------------- + 问题 说明 + -------------- -------------------- + Sim2Real Gap 仿真与现实的差异 + + 感官差异 虚拟与真实感知不同 + + 物理特性 真实物理更复杂 + ----------------------------------- + +## 解决方案 + +1. 域随机化 (Domain Randomization) + + 真实数据混合 + + 在线微调 + +# 思考与练习 + +1. 具身智能在规划设计中有哪些应用前景? + +2. 数字孪生如何辅助设计决策? + +3. Sim2Real迁移的主要挑战是什么? + +# 关键术语 + + -------------------------------------------------- + 中文 英文 说明 + ---------- -------------- ------------------------ + 具身智能 Embodied AI 有身体形式的AI + + 数字孪生 Digital Twin 物理世界的数字映射 + + 强化学习 RL Reinforcement Learning + + 状态 State 环境的当前情况 + + 动作 Action Agent对环境的影响 + -------------------------------------------------- + +# 延伸阅读 + +1. [Gymnasium文档](https://gymnasium.org.cn/) + + [DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP diff --git a/06-agent/05.3-design-application.md b/06-agent/05.3-design-application.md new file mode 100644 index 0000000..a183941 --- /dev/null +++ b/06-agent/05.3-design-application.md @@ -0,0 +1,215 @@ + +# 学习目标 + +3. 理解MCP协议的核心思想 + + 掌握HITL协作模式 + + 了解Agent在规划设计中的落地场景 + +# MCP协议 + +## 什么是MCP + +**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。 + +## 核心价值 + +`传统方式:`\ +` AI``模型`` → ``各自独立`` → ``数据孤岛`\ +\ +`MCP``方式:`\ +` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据` + +MCP架构 + +`┌─────────────────────────────────────┐`\ +`│ AI Application │`\ +`│ (Claude, ``ChatGPT``, ``等``) │`\ +`└─────────────┬───────────────────────┘`\ +` │ MCP`\ +`┌─────────────┴───────────────────────┐`\ +`│ MCP Client │`\ +`├─────────────────────────────────────┤`\ +`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\ +`│ │File │ │DB │ │API │ ... │`\ +`│ │``Server│ │Server│ │Server│ │`\ +`│ └──────┘ └──────┘ └──────┘ │`\ +`└─────────────────────────────────────┘` + +# HITL:人机协作模式 + +## 什么是HITL + +**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。 + +## HITL层次 + + ---------------------------------- + 层次 人类角色 自动化程度 + ---------- ---------- ------------ + 完全自动 无 100% + + 人工审核 监督者 80-90% + + 交互决策 合作伙伴 50-70% + + 人工主导 操作者 \<50% + ---------------------------------- + +## 规划设计中的HITL + +`AI``生成方案`\ +` ↓`\ +`设计师审核`` ← ``修改意见`` → AI``调整`\ +` ↓`\ +`最终确认` + +# 规划设计Agent案例 + +## 场景分析Agent + +`输入:场地数据` + +`↓` + +`分析流程:` + +1. `地形分析`` (``坡度、高程``)` + +2. `气候分析`` (``日照、风向``)` + +3. `交通分析`` (``可达性``)` + +4. `视觉分析`` (``视域、景观``)` + +`↓` + +`输出:场地分析报告` + +## 方案生成Agent + +`输入:设计要求`` + ``场地分析` + +`↓` + +`生成流程:` + +1. `理解需求`` (``CoT``推理``)` + +2. `布局功能`` (``工具调用``)` + +3. `连接路径`` (``图算法``)` + +4. `优化调整`` (``迭代改进``)` + +`↓` + +`输出:初步设计方案` + +## 合规审查Agent + +`输入:设计方案` + +`↓` + +`审查流程:` + +1. `调用规范库` + +2. `逐条核对` + +3. `标记问题` + +4. `生成报告` + +`↓` + +`输出:合规审查意见` + +# Agent落地挑战 + +技术挑战 + + --------------------------- + 挑战 说明 + ---------- ---------------- + 准确性 复杂任务易出错 + + 可解释性 决策过程不透明 + + 鲁棒性 边界情况处理 + --------------------------- + +应用挑战 + + ----------------------------- + 挑战 说明 + ------------ ---------------- + 工作流整合 与现有流程融合 + + 责任界定 AI错误的后果 + + 成本控制 API调用费用 + ----------------------------- + +## 解决方向 + +1. 分级应用:简单任务自动化,复杂任务辅助 + + 渐进式:从局部到整体 + + 人机协同:关键环节人工确认 + +# 未来展望:AI设计师 + +### 短期 (1-2年) + +`AI``作为工具`\ +` - ``数据分析`\ +` - ``方案生成`\ +` - ``合规检查` + +### 中期 (3-5年) + +`AI``作为助手`\ +` - ``创意启发`\ +` - ``方案优化`\ +` - ``文档撰写` + +### 长期 (5-10年) + +`AI``作为合作伙伴`\ +` - ``共同创造`\ +` - ``自主决策`\ +` - ``专业评审` + +## 思考与练习 + +1. MCP如何解决AI应用的"数据孤岛"问题? + +2. 规划设计中哪些环节适合引入HITL? + +3. AI设计师如何与人类设计师协作? + +## 关键术语 + + ---------------------------------------------------------------- + 中文 英文 说明 + ---------------- ---------------------- ------------------------ + 模型上下文协议 MCP Model Context Protocol + + 人在回路 HITL Human-in-the-Loop + + 数据孤岛 Data Silo 独立的数据存储 + + 协议 Protocol 通信标准 + + 工作流整合 Workflow Integration 融入现有流程 + ---------------------------------------------------------------- + +## 延伸阅读 + +1. [MCP官方文档](https://modelcontextprotocol.io/) + + [Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629) diff --git a/06-agent/06-agent.md b/06-agent/06-agent.md new file mode 100644 index 0000000..55746a1 --- /dev/null +++ b/06-agent/06-agent.md @@ -0,0 +1,33 @@ +# 第六篇:AI Agent与自主设计 + +本篇探讨AI Agent的架构和具身智能,展望AI在规划设计中的应用前景。 + +## 篇章导读 + +AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行动",从"单一能力"到"系统协同"。 + +本篇将系统介绍Agent架构和在设计领域的应用。 + +# 章节目录 + +1. [05.1 AI Agent架构](05.1-agent-architecture.md) - LLM-based Agent与核心组件 + + [05.2 具身智能](05.2-embodied-ai.md) - 数字孪生与物理世界交互 + + [05.3 规划设计应用与MCP](05.3-design-application.md) - MCP协议与HITL协作 + +# 核心概念 + + ------------------------------------------------------- + 概念 英文 说明 + ---------------- ------------- ------------------------ + 智能体 Agent 自主决策和行动的系统 + + 具身智能 Embodied AI 有物理实体的智能 + + 人机协作 HITL Human-in-the-Loop + + 模型上下文协议 MCP Model Context Protocol + ------------------------------------------------------- + +# 05.1 AI Agent架构 diff --git a/07-digital-media/07-digital-media.md b/07-digital-media/07-digital-media.md new file mode 100644 index 0000000..26ddf82 --- /dev/null +++ b/07-digital-media/07-digital-media.md @@ -0,0 +1,17 @@ +# 第七部分:数字媒体设计 + +本部分探讨AI在数字媒体创作领域的应用,包括视觉设计、交互设计和内容生成。 + +## 篇章导读 + +数字媒体是AI应用最活跃的领域之一。从图像生成到视频制作,从界面设计到交互体验,AIGC工具正在重塑数字媒体创作的流程和范式。 + +本部分将系统介绍AI在视觉设计和交互设计中的应用。 + +## 章节目录 + +1. [第16章 视觉设计与AIGC](#第16章-视觉设计与aicgc) + + [第17章 交互设计](#第17章-交互设计-1) + +# 第16章 视觉设计与AIGC diff --git a/07-digital-media/ch16-visual-design-aigc.md b/07-digital-media/ch16-visual-design-aigc.md new file mode 100644 index 0000000..117a2e3 --- /dev/null +++ b/07-digital-media/ch16-visual-design-aigc.md @@ -0,0 +1,72 @@ + +## 学习目标 + +1. 了解AIGC在视觉设计中的应用场景 + + 掌握图像生成和风格迁移的基本方法 + + 理解AI辅助品牌视觉设计的流程 + +## 核心应用 + +图像生成与风格迁移 + + --------------------------------------------------------------------------------------- + 应用类型 说明 工具示例 + -------------------------- ---------------------- ------------------------------------- + 文生图 从文本描述生成图像 Midjourney, Stable Diffusion + + 图像编辑 局部修改、扩展、擦除 Photoshop AI, Inpainting + + 风格迁移 将图像转换为目标风格 Neural Style Transfer + + 矢量生成 生成可缩放的矢量图形 Vectorizer.ai, Adobe Illustrator AI + --------------------------------------------------------------------------------------- + +Logo与图标设计 + +### AI辅助流程: + +#### 需求分析 + +`- ``品牌定位` + +`- ``目标受众` + +`- ``设计风格偏好` + +#### + +`2. ``概念生成` + +`- AI``生成多个设计方案` + +#### - 快速迭代探索 + +`3. ``细化优化` + +`- ``设计师精修` + +`- ``矢量化处理` + + - 品牌规范整理 + +**工具推荐**: - LogoAI:自动Logo生成 - Looka:品牌设计套件 - Brandmark:Logo和品牌身份 + +品牌视觉系统生成 + +**应用场景**: - 色彩方案生成 - 字体搭配推荐 - 视觉元素扩展 - 品牌指南生成 + +## 案例分析 + +**案例1:餐饮品牌Logo设计** - 使用Midjourney生成初始概念 - Illustrator进行矢量化精修 - 生成品牌视觉系统扩展 + +**案例2:产品包装设计** - Stable Diffusion生成包装效果图 - ControlNet控制产品形态 - 多方案快速对比 + +## 思考与练习 + +1. AIGC如何改变设计师的创意流程? + +2. 在品牌设计中,如何平衡AI生成与原创性? + +3. 选择一个AIGC工具,尝试完成一个视觉设计任务 diff --git a/07-digital-media/ch17-interaction-design.md b/07-digital-media/ch17-interaction-design.md new file mode 100644 index 0000000..0c1cd4b --- /dev/null +++ b/07-digital-media/ch17-interaction-design.md @@ -0,0 +1,76 @@ + +### 学习目标 + +1. 了解AI在交互设计中的应用 + + 掌握用户界面自动生成的原理 + + 理解用户体验分析的方法 + +### 核心应用 + +用户界面生成 + + -------------------------------------------------------- + 功能 说明 工具示例 + ---------- -------------------- ------------------------ + 布局生成 自动生成页面布局 Uizard, Galileo AI + + 组件推荐 基于上下文推荐组件 Figma AI, Motiff + + 设计系统 自动生成设计规范 Designer, Figma Tokens + + 原型生成 从描述生成交互原型 TLDraw, Diagram + -------------------------------------------------------- + +交互原型自动化 + +**流程**: + +`用户需求`` → AI``理解`` → ``生成原型`\ +` ↓`\ +` ``设计师调整优化`\ +` ↓`\ +` ``可交互原型` + +**应用场景**: - 快速原型验证 - 用户测试准备 - 开发对接文档 + +用户体验分析 + +**AI分析方法**: - 用户行为预测 - 界面可用性评估 - A/B测试优化 - 情感分析 + +### 案例分析 + +**案例1:电商APP界面设计** - Galileo AI生成界面布局 - Figma AI自动填充内容 - 快速原型用户测试 + +**案例2:仪表板设计** - 用户需求描述 - AI生成多种布局方案 - 基于数据可视化优化 + +### 思考与练习 + +1. AI生成的界面如何保证可用性? + +2. 在交互设计中,人类设计师的核心价值是什么? + +3. 尝试用AI工具生成一个简单的交互原型 + +### 关键术语 + + -------------------------------------------------- + 中文 英文 说明 + ---------- ---------------- ---------------------- + 风格迁移 Style Transfer 将图像转换为目标风格 + + 矢量化 Vectorization 转换为可缩放矢量格式 + + 原型 Prototype 可交互的设计模型 + + 设计系统 Design System 组件化设计规范 + -------------------------------------------------- + +### 延伸阅读 + +1. [Midjourney官方文档](https://docs.midjourney.com/) + + [Stable Diffusion提示词指南](https://stable-diffusion-art.com/) + + [Figma AI功能](https://help.figma.com/hc/en-us/articles/15023124649943-Guide-to-Figma-AI) diff --git a/08-environmental-design/08-environmental-design.md b/08-environmental-design/08-environmental-design.md new file mode 100644 index 0000000..45a8df7 --- /dev/null +++ b/08-environmental-design/08-environmental-design.md @@ -0,0 +1,17 @@ +# 第八部分:环境设计 + +本部分探讨AI在室内设计、景观设计等环境设计领域的应用。 + +## 篇章导读 + +环境设计关注人类与物理空间的关系。AI技术正在改变环境设计的各个环节,从场地分析到方案生成,从效果预览到可持续评估。 + +本部分将介绍AI在室内设计和景观设计中的应用。 + +## 章节目录 + +1. [第18章 室内设计](#第18章-室内设计-1) + + [第19章 景观设计](#第19章-景观设计-1) + +# 第18章 室内设计 diff --git a/08-environmental-design/ch18-interior-design.md b/08-environmental-design/ch18-interior-design.md new file mode 100644 index 0000000..a3ec7f0 --- /dev/null +++ b/08-environmental-design/ch18-interior-design.md @@ -0,0 +1,62 @@ + +## 学习目标 + +1. 了解AI在室内设计中的应用流程 + + 掌握平面图智能生成的方法 + + 理解VR/AR在室内设计预览中的作用 + +## 核心应用 + +平面图智能生成 + +**传统流程 vs AI辅助**: + + ---------------------------------------- + 环节 传统方式 AI辅助 + ---------- -------------- -------------- + 需求分析 人工沟通 自然语言理解 + + 方案生成 手绘/CAD绘制 自动生成布局 + + 家具选择 手动搜索 智能推荐 + + 效果预览 3D建模渲染 实时生成 + ---------------------------------------- + +**AI工具**: - **Planner 5D**:房间设计自动生成 - **Homestyler**:室内设计AI助手 - **RoomsGPT**:从图像生成3D模型 + +家具布局优化 + +**优化目标**: - 空间利用率最大化 - 功能分区合理化 - 动线流畅性 - 美学平衡 + +**技术方法**: - 约束求解:满足设计规范 - 遗传算法:多方案优化 - 强化学习:用户偏好学习 + +材质与风格推荐 + +**推荐流程**: + +`用户偏好图像`` → AI``分析风格`` → ``推荐材质组合`\ +` ↓`\ +` ``生成效果预览`\ +` ↓`\ +` ``用户反馈迭代` + +VR/AR预览 + +**技术实现**: - **VR**:沉浸式空间体验 - **AR**:现实空间叠加设计 - **实时渲染**:快速查看效果 + +**工具**: - Enscape:实时渲染插件 - Twinmotion:快速可视化 - Arkio:VR协作设计 + +## 案例分析 + +**案例:住宅客厅设计** 1. 输入户型图和需求 2. AI生成3种布局方案 3. 用户选择方案并调整 4. 实时VR预览效果 5. 导出施工图和材料清单 + +## 思考与练习 + +1. AI如何平衡功能性和美学? + +2. VR/AR如何改变室内设计工作流? + +3. 尝试使用AI室内设计工具完成一个小空间设计 diff --git a/08-environmental-design/ch19-landscape-design.md b/08-environmental-design/ch19-landscape-design.md new file mode 100644 index 0000000..d63dab7 --- /dev/null +++ b/08-environmental-design/ch19-landscape-design.md @@ -0,0 +1,78 @@ + +### 学习目标 + +1. 了解AI在景观设计中的应用 + + 掌握场地分析与评估的方法 + + 理解生态效益模拟的技术 + +### 核心应用 + +场地分析与评估 + +**分析维度**: + + ------------------------------------------------ + 维度 内容 AI方法 + ------------ -------------------- -------------- + 地形地貌 高程、坡度、坡向 DEM分析 + + 植被覆盖 类型、密度、健康度 遥感图像分类 + + 水文系统 水系、排水、汇水 水文模拟 + + 视觉景观 视域、视线廊道 视域分析 + + 气候舒适度 风环境、日照、温度 环境模拟 + ------------------------------------------------ + +**工具集成**: - GIS空间分析 - 遥感图像处理 - 环境模拟建模 + +植被配置优化 + +**优化目标**: - 生态功能最大化 - 景观效果协调 - 养护成本可控 - 适应本地气候 + +**AI方法**: - **物种选择**:基于环境因子推荐 - **布局优化**:空间配置算法 - **生长模拟**:预测长期效果 + +景观元素生成 + +**可生成元素**: - 道路系统 - 广场节点 - 水景设施 - 景观小品 - 种植设计 + +生态效益模拟 + +**评估指标**: - 碳汇能力 - 生物多样性支持 - 雨洪管理 - 热岛缓解 + +### 案例分析 + +**案例:城市公园设计** 1. 场地数据收集与分析 2. AI生成多种方案对比 3. 生态效益模拟评估 4. 多目标优化选择 5. 施工图与种植设计 + +### 思考与练习 + +1. AI如何处理景观设计中的复杂约束? + +2. 生态效益模拟的数据从哪里来? + +3. 选择一个景观设计场景,分析AI可应用的环节 + +### 关键术语 + + ----------------------------------------------- + 中文 英文 说明 + ---------- --------------------- -------------- + 平面图 Floor Plan 水平剖切图 + + 布局优化 Layout Optimization 空间排列优化 + + 动线 Circulation 人员流动路径 + + 视域分析 Viewshed Analysis 可见范围分析 + + 生态效益 Ecological Benefit 生态服务价值 + ----------------------------------------------- + +### 延伸阅读 + +1. [Landscape Architecture + AI](https://landscapeperformance.org/) + + [GIS在景观设计中的应用](https://www.esri.com/en-us/industries/landscape-architecture) diff --git a/09-industrial-design/09-industrial-design.md b/09-industrial-design/09-industrial-design.md new file mode 100644 index 0000000..721a3b1 --- /dev/null +++ b/09-industrial-design/09-industrial-design.md @@ -0,0 +1,17 @@ +# 第九部分:工业设计 + +本部分探讨AI在产品设计、造型优化和制造准备中的应用。 + +## 篇章导读 + +工业设计融合美学、工程和商业考量。AI技术正在改变产品开发流程,从概念生成到制造准备,从结构优化到材料选择。 + +本部分将介绍AI在工业设计中的关键应用。 + +## 章节目录 + +1. [第20章 产品造型设计](#第20章-产品造型设计-1) + + [第21章 设计优化与制造](#第21章-设计优化与制造-1) + +# 第20章 产品造型设计 diff --git a/09-industrial-design/ch20-product-design.md b/09-industrial-design/ch20-product-design.md new file mode 100644 index 0000000..4b3e920 --- /dev/null +++ b/09-industrial-design/ch20-product-design.md @@ -0,0 +1,54 @@ + +## 学习目标 + +1. 了解AI辅助产品概念设计的方法 + + 掌握草图生成和三维建模的AI工具 + + 理解形态优化的基本原理 + +## 核心应用 + +概念草图生成 + +**流程**: + +`文字描述``/``参考图`` → AI``理解`` → ``生成草图方案`\ +` ↓`\ +` ``设计师选择与迭代` + +**工具**: - **Midjourney**:产品概念图生成 - **Stable Diffusion + ControlNet**:草图精细控制 - **Krea AI**:实时草图优化 + +三维建模辅助 + +**AI辅助功能**: + + ---------------------------------------------------- + 功能 说明 工具 + ---------- ------------------- --------------------- + 草图转3D 2D草图生成3D模型 Shapr3D, Point-E + + 模型优化 自动布线、倒角 ZBrush, Blender插件 + + 纹理生成 自动生成材质贴图 Adobe Substance 3D + + 渲染加速 快速生成产品渲染 NVIDIA Canvas + ---------------------------------------------------- + +形态优化 + +**优化目标**: - 美学协调性 - 人机工程学 - 制造可行性 - 成本控制 + +**AI方法**: - **形状语法**:形式规则生成 - **GAN生成**:学习设计风格 - **强化学习**:用户偏好优化 + +案例分析 + +**案例:消费电子产品设计** 1. 市场分析与用户画像 2. AI生成概念草图 3. 选择方向建立3D模型 4. AI辅助形态优化 5. 快速渲染评审 + +思考与练习 + +1. AI生成的概念如何保持原创性? + +2. 形态优化中如何平衡美学和功能? + +3. 尝试用AI工具生成一个产品概念 diff --git a/09-industrial-design/ch21-design-optimization.md b/09-industrial-design/ch21-design-optimization.md new file mode 100644 index 0000000..a628975 --- /dev/null +++ b/09-industrial-design/ch21-design-optimization.md @@ -0,0 +1,78 @@ + +学习目标 + +1. 了解AI在结构优化中的应用 + + 掌握材料选择和可制造性分析方法 + + 理解AI辅助制造准备的技术 + +### 核心应用 + +结构优化 + +**拓扑优化**: + +`设计空间`` → ``约束条件`` → ``优化算法`` → ``最优结构`\ +` ↓`\ +` ``轻量化与强度平衡` + +**AI方法**: - **生成式设计**:自动探索设计方案 - **拓扑优化**:材料分布优化 - **网格优化**:轻量化结构 + +**工具**: - **Autodesk Fusion 360**:生成式设计 - **nTopology**:隐式建模 - **Altair Inspire**:拓扑优化 + +材料选择 + +**AI辅助决策**: + + --------------------------- + 考虑因素 AI方法 + ---------- ---------------- + 力学性能 材料数据库检索 + + 成本 价格预测模型 + + 可持续性 环境影响评估 + + 可加工性 工艺兼容性分析 + --------------------------- + +可制造性分析 + +**分析内容**: - **DFM (Design for Manufacturing)**:制造可行性 - **DFA (Design for Assembly)**:装配可行性 - **DFT (Design for Test)**:测试可行性 + +**AI应用**: - 自动检测设计缺陷 - 工艺参数推荐 - 成本估算 + +### 案例分析 {#案例分析-5} + +**案例:汽车零部件轻量化** 1. 初始设计分析 2. 定义设计空间和约束 3. AI生成多种拓扑方案 4. 仿真验证性能 5. 优化后投入制造 + +### 思考与练习 {#思考与练习-21} + +1. 拓扑优化的结果如何满足生产工艺要求? + +2. AI如何帮助选择可持续材料? + +3. 选择一个简单产品,分析AI可优化的环节 + +### 关键术语 + + ----------------------------------------------------- + 中文 英文 说明 + ------------ ----------------------- ---------------- + 概念设计 Concept Design 初步设计阶段 + + 拓扑优化 Topology Optimization 结构布局优化 + + 生成式设计 Generative Design AI驱动设计生成 + + 可制造性 Manufacturability 生产可行性 + + 轻量化 Lightweight 减少重量 + ----------------------------------------------------- + +### 延伸阅读 + +1. [Autodesk Generative Design](https://www.autodesk.com/products/generative-design) + + [nTopology技术文档](https://ntopology.com/resources/) diff --git a/10-urban-design/10-urban-design.md b/10-urban-design/10-urban-design.md new file mode 100644 index 0000000..c951acc --- /dev/null +++ b/10-urban-design/10-urban-design.md @@ -0,0 +1,17 @@ +# 第十部分:城市设计 + +本部分探讨AI在城市规划、空间分析和城市管理中的应用。 + +## 篇章导读 + +城市是复杂的系统。AI技术正在为城市设计提供新的视角和工具,从宏观规划到微观设计,从现状分析到未来预测。 + +本部分将介绍AI在城市设计中的关键应用。 + +## 章节目录 + +1. [第22章 城市空间分析](#第22章-城市空间分析-1) + + [第23章 规划设计与评估](#第23章-规划设计与其评估) + +# 第22章 城市空间分析 diff --git a/10-urban-design/ch22-urban-spatial-analysis.md b/10-urban-design/ch22-urban-spatial-analysis.md new file mode 100644 index 0000000..c349041 --- /dev/null +++ b/10-urban-design/ch22-urban-spatial-analysis.md @@ -0,0 +1,58 @@ + +## 学习目标 {#学习目标-24} + +1. 了解AI在城市空间分析中的应用 + + 掌握遥感影像和城市形态识别的方法 + + 理解人口与活动分析的技术 + +## 核心应用 + +遥感影像分析 + +### 分析内容: + + ------------------------------------ + 内容 方法 应用 + ---------- ---------- -------------- + 土地利用 图像分类 规划现状调查 + + 建筑识别 目标检测 建筑普查 + + 变化检测 时序分析 城市扩张监测 + + 环境质量 指数反演 生态评估 + ------------------------------------ + +### 技术流程: + +`卫星``/``无人机影像`` → ``预处理`` → AI``模型分析`` → ``结果输出`\ +` ↓`\ +` ``规划决策支持` + +城市形态识别 + +**识别要素**: - 街区格局 - 建筑高度与密度 - 道路网络 - 开放空间 + +**AI方法**: - **图像分割**:识别城市要素 - **图神经网络**:分析空间关系 - **聚类分析**:识别城市类型 + +人口与活动分析 + +**数据来源**: - 手机信令数据 - 交通卡数据 - 社交媒体数据 - POI数据 + +**分析内容**: - 人口分布 - 职住关系 - 出行模式 - 活动热点 + +**AI技术**: - 时空预测模型 - 聚类与分类 - 异常检测 + +## 案例分析 {#案例分析-6} + +**案例:城市中心区活力评估** 1. 多源数据整合 2. AI分析活动模式 3. 识别活力影响因素 4. 生成优化建议 + +## 思考与练习 {#思考与练习-22} + +1. 多源数据如何保护隐私? + +2. AI分析如何考虑城市的独特性? + +3. 选择一个城市问题,分析AI可提供的帮助 diff --git a/10-urban-design/ch23-planning-evaluation.md b/10-urban-design/ch23-planning-evaluation.md new file mode 100644 index 0000000..ad77dbe --- /dev/null +++ b/10-urban-design/ch23-planning-evaluation.md @@ -0,0 +1,90 @@ + +### 学习目标 {#学习目标-25} + +1. 了解AI辅助规划设计的方法 + + 掌握交通网络和设施布局优化的技术 + + 理解规划方案评估的AI应用 + +### 核心应用 + +用地规划生成 + +**传统流程 vs AI辅助**: + + -------------------------------- + 环节 传统方式 AI辅助 + ---------- ---------- ---------- + 现状分析 人工统计 自动识别 + + 方案生成 手绘/CAD 规则生成 + + 规范检查 人工核对 自动验证 + + 方案评估 定性分析 量化评估 + -------------------------------- + +**生成方法**: - **规则生成**:基于规划规范 - **学习生成**:从优秀案例学习 - **交互生成**:人机协作设计 + +交通网络优化 + +**优化目标**: - 通达性最大化 - 拥堵最小化 - 成本可控 - 环境影响最小 + +**AI技术**: - 图算法:路网分析 - 强化学习:信号控制 - 预测模型:交通预测 + +公共设施布局 + +**布局问题**: - 学校:学区覆盖优化 - 医院:服务可达性 - 公园:绿地服务半径 - 商业:需求匹配 + +**AI方法**: - 位置-分配模型 - 覆盖模型 - p-中值问题 + +规划方案评估 + +**评估维度**: + + -------------------------------------- + 维度 指标 AI方法 + ---------- ---------------- ---------- + 空间效率 容积率、密度 空间分析 + + 交通影响 出行距离、拥堵 交通模拟 + + 环境影响 碳排放、绿地 环境模型 + + 社会效益 公平性、满意度 社会模型 + -------------------------------------- + +### 案例分析 {#案例分析-7} + +**案例:新区规划设计** 1. 场地条件分析 2. AI生成多方案 3. 多维评估对比 4. 交互优化调整 5. 最终方案确定 + +### 思考与练习 {#思考与练习-23} + +1. AI生成的规划方案如何体现人文关怀? + +2. 如何平衡不同评估维度的冲突? + +3. 选择一个规划问题,分析AI的潜在作用 + +### 关键术语 + + ---------------------------------------------------- + 中文 英文 说明 + ------------ ---------------- ---------------------- + 土地利用 Land Use 土地功能分布 + + 遥感 Remote Sensing 远距离探测技术 + + 图神经网络 GNN Graph Neural Network + + 通达性 Accessibility 到达便利程度 + + 服务半径 Service Radius 设施服务范围 + ---------------------------------------------------- + +### 延伸阅读 + +1. [Urban AI](https://urbanai.io/) + + [Google Environmental Insights Explorer](https://insights.sustainability.google/) diff --git a/11-ecological-design/11-ecological-design.md b/11-ecological-design/11-ecological-design.md new file mode 100644 index 0000000..a18cf7d --- /dev/null +++ b/11-ecological-design/11-ecological-design.md @@ -0,0 +1,17 @@ +# 第十一部分:生态设计 + +本部分探讨AI在生态保护、环境治理和可持续发展中的应用。 + +## 篇章导读 + +生态设计关注人类活动与自然环境的和谐。AI技术为生态分析、规划和修复提供了新的工具和方法。 + +本部分将介绍AI在生态设计中的应用。 + +## 章节目录 + +1. [第24章 生态分析与评估](#第24章-生态分析与评估-1) + + [第25章 生态规划与修复](#第25章-生态规划与修复-1) + +# 第24章 生态分析与评估 diff --git a/11-ecological-design/ch24-ecological-analysis.md b/11-ecological-design/ch24-ecological-analysis.md new file mode 100644 index 0000000..0f41e2f --- /dev/null +++ b/11-ecological-design/ch24-ecological-analysis.md @@ -0,0 +1,62 @@ + +## 学习目标 {#学习目标-26} + +1. 了解AI在生态系统服务评估中的应用 + + 掌握生物多样性分析的方法 + + 理解环境质量监测的技术 + +## 核心应用 + +生态系统服务评估 + +**服务类型**: + + -------------------------------------------- + 类型 内容 AI应用 + ---------- ------------------ -------------- + 供给服务 食物、水、纤维 产量预测 + + 调节服务 气候、洪水、疾病 风险评估 + + 文化服务 娱乐、旅游 游客行为分析 + + 支持服务 营养循环、生境 过程模拟 + -------------------------------------------- + +**评估方法**: - **遥感反演**:植被覆盖、生物量 - **模型模拟**:碳循环、水文过程 - **机器学习**:服务价值预测 + +生物多样性分析 + +**分析层次**: + + -------------------------------------------- + 层次 内容 AI方法 + ---------------- ------------ -------------- + 遗传多样性 基因变异 基因序列分析 + + 物种多样性 物种丰富度 图像识别 + + 生态系统多样性 生境类型 景观分类 + -------------------------------------------- + +**技术应用**: - **图像识别**:物种自动识别 - **声音识别**:鸟类监测 - **环境DNA**:物种检测 + +环境质量监测 + +**监测内容**: - 空气质量 - 水质 - 土壤健康 - 噪声污染 + +**AI技术**: - 传感器网络 - 异常检测 - 预测模型 - 源解析 + +## 案例分析 {#案例分析-8} + +**案例:流域生态健康评估** 1. 多源数据收集 2. AI构建评估模型 3. 空间分布分析 4. 风险区域识别 5. 管理建议生成 + +## 思考与练习 {#思考与练习-24} + +1. AI如何处理生态数据的复杂性和不确定性? + +2. 生物多样性自动识别的准确率如何保证? + +3. 选择一个生态问题,分析AI可提供的帮助 diff --git a/11-ecological-design/ch25-ecological-planning.md b/11-ecological-design/ch25-ecological-planning.md new file mode 100644 index 0000000..4d60a55 --- /dev/null +++ b/11-ecological-design/ch25-ecological-planning.md @@ -0,0 +1,68 @@ + +## 学习目标 {#学习目标-27} + +1. 了解AI在生态源地识别中的应用 + + 掌握生态网络构建的方法 + + 理解生态修复方案的优化技术 + +## 核心应用 + +生态源地识别 + +**识别目标**: - 生物多样性热点 - 生态系统服务关键区 - 生态脆弱区 + +**AI方法**: - **机器学习**:源地识别模型 - **遥感分析**:空间格局识别 - **多准则决策**:优先级排序 + +生态网络构建 + +**网络要素**: - 源地:生态节点 - 廊道:连接通道 - 基质:背景环境 + +**构建流程**: + +`源地识别`` → ``连接性分析`` → ``网络优化`` → ``方案评估` + +**AI技术**: - **图算法**:最小路径分析 - **电路理论**:连接度评估 - **优化算法**:网络设计 + +修复方案优化 + +**修复类型**: - 生境修复 - 水系修复 - 植被恢复 - 污染治理 + +**优化目标**: - 生态效益最大化 - 成本可控 - 实施可行性 - 长期可持续性 + +**AI应用**: - **仿真模拟**:修复效果预测 - **优化算法**:方案搜索 - **适应性管理**:动态调整 + +## 案例分析 {#案例分析-9} + +**案例:区域生态安全格局构建** 1. 识别生态源地 2. 构建阻力面 3. 计算生态廊道 4. 划定生态红线 5. 制定管控策略 + +## 思考与练习 {#思考与练习-25} + +1. 生态网络如何应对气候变化? + +2. AI优化的修复方案如何考虑长期效应? + +3. 选择一个生态修复场景,分析AI的应用点 + +## 关键术语 + + --------------------------------------------------------------- + 中文 英文 说明 + -------------- ----------------------------- ------------------ + 生态系统服务 Ecosystem Services 自然对人类的益处 + + 生物多样性 Biodiversity 生物种类丰富度 + + 生态源地 Ecological Source 生态核心区 + + 生态廊道 Ecological Corridor 生态连接通道 + + 生态安全格局 Ecological Security Pattern 生态空间布局 + --------------------------------------------------------------- + +## 延伸阅读 + +1. [Circuitscape](https://circuitscape.org/) + + [InVEST模型](https://naturalcapitalproject.stanford.edu/software/invest) diff --git a/README.md b/README.md new file mode 100644 index 0000000..ee13f59 --- /dev/null +++ b/README.md @@ -0,0 +1,415 @@ +**作者**:CC4SI项目组 **版本**:v1.0.0 **更新日期**:2026年4月 + +全书目录 + +### [上篇:原理与技术](part1-principles/) + +# [第一部分:导论](01-introduction/01-introduction.md) + +建立读者对人工智能的宏观认知,介绍AI的发展历程和技术范式演进。 + +> •[第1章 AI发展历程](01-introduction/01-introduction.md#第1章-ai发展历程) + +oAmazon Go案例:技术融合 + +oAI赋能的时间线:2016-2024 + +oAI四大赛道:AIGC、Agent、AI4S、AIED + +o设计领域AI应用趋势 + +## [第2章 AI范式演进](01-introduction/01-introduction.md#第2章-ai范式演进) + +o从规则系统到大模型的三次范式演进 + +o万能逼近定理与神经网络基础 + +o神经网络技术栈全景 + +oScaling Law与模型规模效应 + +# [第二部分:数学与编程基础](02-foundations/02-foundations.md) + +从函数式视角理解AI,介绍神经网络的基本原理和Python编程工具。 + +> •[第3章 函数式AI视角](02-foundations/02-foundations.md#第3章-函数式ai视角) + +o"Functions Describe the World"核心理念 + +o从Excel到神经网络的演进逻辑 + +o函数组合与层级抽象 + +o数据驱动 vs 规则驱动 + +> •[第4章 多层感知机](02-foundations/02-foundations.md#第4章-多层感知机) + +oMLP结构与前向传播 + +o激活函数:Sigmoid、ReLU、Softmax + +o损失函数与优化 + +o反向传播原理 + +# [第三部分:计算机视觉原理](03-computer-vision/03-computer-vision.md) + +深入讲解计算机视觉的核心技术CNN,以及目标检测和语义分割的基本原理。 + +[第5章 CNN基础原理](03-computer-vision/03-computer-vision.md#第5章-cnn基础原理) + +o为什么需要CNN:局部连接与权重共享 + +o卷积、激活、池化三大组件 + +oCNN vs MLP的区别与联系 + +o经典网络架构:LeNet、AlexNet、VGG、ResNet + +[第6章 目标检测](03-computer-vision/03-computer-vision.md#第6章-目标检测) + +o从分类到检测的跃迁 + +oTwo-Stage vs One-Stage检测器 + +oYOLO系列演进与技术原理 + +o评估指标:IoU、mAP、COCO数据集 + +## [第7章 语义分割与空间分析](03-computer-vision/03-computer-vision.md#第7章-语义分割与空间分析) + +o图像分析层级:Pixel/patch/Object-Level + +o语义分割 vs 实例分割 + +o分割网络架构:FCN、U-Net、DeepLab + +o空间分析应用场景 + +# [第四部分:Transformer与大模型](04-transformer/04-transformer.md) + +介绍革命性的Transformer架构和大语言模型的核心技术。 + +## [第8章 注意力机制](04-transformer/04-transformer.md#第8章-注意力机制) + +oSelf-Attention的动机与原理 + +oQ、K、V计算过程 + +oMulti-Head Attention多头注意力 + +oPositional Encoding位置编码 + +oSelf-Attention vs CNN对比 + +## [第9章 Transformer架构](04-transformer/04-transformer.md#第9章-transformer架构) + +oEncoder-Decoder结构详解 + +oEncoder层:Self-Attention + FFN + +oDecoder层:Masked + Cross-Attention + +o残差连接与层归一化 + +oToken处理流程 + +## [第10章 大语言模型技术](04-transformer/04-transformer.md#第10章-大语言模型技术) + +o从Transformer到ChatGPT的演进 + +o预训练与微调范式 + +oRAG检索增强生成原理 + +oRLHF人类反馈强化学习 + +oPrompt工程基础 + +# [第五部分:生成式AI](05-generative-ai/05-generative-ai.md) + +讲解生成模型的发展脉络和Diffusion模型的核心技术。 + +## [第11章 生成模型演进](05-generative-ai/05-generative-ai.md#第11章-生成模型演进) + +o自编码器AE与变分自编码器VAE + +o生成对抗网络GAN原理 + +oDiffusion扩散模型:前向与反向过程 + +oStable Diffusion架构解析 + +## [第12章 AIGC工具与技术](05-generative-ai/05-generative-ai.md#第12章-aigc工具与技术) + +oControlNet:精确条件控制 + +oLoRA高效微调技术 + +oComfyUI模块化工作流 + +o版权与伦理问题 + +# [第六部分:AI Agent](06-agent/06-agent.md) + +探讨AI Agent的架构、具身智能和自主决策技术。 + +## [第13章 AI Agent架构](06-agent/06-agent.md#第13章-ai-agent架构) + +o从规则系统到LLM-based Agent + +oAgent核心组件:感知、规划、记忆、工具 + +oChain of Thought推理链 + +oReAct推理行动模式 + +o单Agent vs 多Agent协作 + +## [第14章 具身智能](06-agent/06-agent.md#第14章-具身智能) + +o具身智能的概念与特点 + +o数字孪生与物理世界交互 + +o强化学习基础与Gymnasium环境 + +o虚拟到真实的迁移挑战 + +## [第15章 协作与协议](06-agent/06-agent.md#第15章-协作与协议) + +oMCP模型上下文协议 + +oHITL人机协作模式 + +oAgent落地挑战与解决方向 + +# [下篇:设计领域应用](part2-applications/) + +## [第七部分:数字媒体设计](07-digital-media/07-digital-media.md) + +AI在数字媒体创作中的应用,包括视觉设计、交互设计和内容生成。 + +### [第16章 视觉设计与AIGC](07-digital-media/07-digital-media.md#第16章-视觉设计与aicgc) + +o图像生成与风格迁移 + +oLogo与图标设计 + +o品牌视觉系统生成 + +o案例分析 + +### [第17章 交互设计](07-digital-media/07-digital-media.md#第17章-交互设计) + +o用户界面生成 + +o交互原型自动化 + +o用户体验分析 + +o案例分析 + +## [第八部分:环境设计](08-environmental-design/08-environmental-design.md) + +AI在室内设计、景观设计等环境设计领域的应用。 + +### [第18章 室内设计](08-environmental-design/08-environmental-design.md#第18章-室内设计) + +o平面图智能生成 + +o家具布局优化 + +o材质与风格推荐 + +oVR/AR预览 + +o案例分析 + +### [第19章 景观设计](08-environmental-design/08-environmental-design.md#第19章-景观设计) + +o场地分析与评估 + +o植被配置优化 + +o景观元素生成 + +o生态效益模拟 + +o案例分析 + +## [第九部分:工业设计](09-industrial-design/09-industrial-design.md) + +AI在产品设计、造型优化和制造准备中的应用。 + +### [第20章 产品造型设计](09-industrial-design/09-industrial-design.md#第20章-产品造型设计) + +o概念草图生成 + +o三维建模辅助 + +o形态优化 + +o案例分析 + +### [第21章 设计优化与制造](09-industrial-design/09-industrial-design.md#第21章-设计优化与制造) + +o结构优化(拓扑优化) + +o材料选择 + +o可制造性分析 + +o案例分析 + +## [第十部分:城市设计](10-urban-design/10-urban-design.md) + +AI在城市规划、空间分析和城市管理中的应用。 + +### [第22章 城市空间分析](10-urban-design/10-urban-design.md#第22章-城市空间分析) + +o遥感影像分析 + +o城市形态识别 + +o人口与活动分析 + +o案例分析 + +### [第23章 规划设计与评估](10-urban-design/10-urban-design.md#第23章-规划设计与其评估) + +o用地规划生成 + +o交通网络优化 + +o公共设施布局 + +o规划方案评估 + +o案例分析 + +## [第十一部分:生态设计](11-ecological-design/11-ecological-design.md) + +AI在生态保护、环境治理和可持续发展中的应用。 + +### [第24章 生态分析与评估](11-ecological-design/11-ecological-design.md#第24章-生态分析与评估) + +o生态系统服务评估 + +o生物多样性分析 + +o环境质量监测 + +o案例分析 + +### [第25章 生态规划与修复](11-ecological-design/11-ecological-design.md#第25章-生态规划与修复) + +o生态源地识别 + +o生态网络构建 + +o修复方案优化 + +o案例分析 + +[附录](appendix/) + +[附录A:编程工具与资源](appendix/tools.md) + +Python环境配置 + +深度学习框架 + +AIGC工具链 + +Agent开发框架 + +在线学习资源 + +[附录B:参考文献](appendix/references.md) + +基础理论论文 + +计算机视觉论文 + +Transformer与大模型论文 + +生成式AI论文 + +AI Agent论文 + +设计AI应用论文 + +推荐书籍与在线资源 + +[附录C:关键术语表](appendix/glossary.md) + +中英文术语对照 + +按章节索引 + +学习路径建议 + +面向设计专业学生 + +上篇选读:01 → 02 → 05 → 06\ +下篇重点:根据专业方向选择\ +附录:工具资源 + +# 面向技术实现者 + +上篇系统学习:全部章节\ +下篇按需学习:了解应用场景\ +附录:工具资源 + 参考文献 + +# 面向研究者 + +上篇重点:02 → 03 → 04\ +下篇选读:关注前沿应用\ +附录:参考文献 + +# 核心概念索引 + + ---------------------------------------------------- + 概念 相关章节 英文术语 + ------------------ ---------------- ---------------- + 生成式AI 01, 11, 12, 16 AIGC + + 智能体 01, 13, 14, 15 AI Agent + + 卷积神经网络 05, 06, 07 CNN + + 注意力机制 08, 09, 10 Self-Attention + + 大语言模型 10, 15 LLM + + 扩散模型 11, 12, 16 Diffusion + + 具身智能 14 Embodied AI + + 检索增强生成 10, 15 RAG + + 人类反馈强化学习 10 RLHF + + 模型上下文协议 15 MCP + + 人机协作 15 HITL + ---------------------------------------------------- + +# 内容特色 + +**原理先行**:上篇系统讲解AI核心技术原理 + +**应用导向**:下篇聚焦五大设计领域的AI应用 + +**案例驱动**:每个应用领域配有真实案例分析 + +**工具支撑**:附录提供完整的工具与资源指南 + +**中英双语**:专业术语保留英文,便于深入阅读 + +# 版本历史 + +**v1.0.0** (2026-04) - 初始版本发布 + +**License**: CC BY-NC-SA 4.0 diff --git a/appendix/glossary.md b/appendix/glossary.md new file mode 100644 index 0000000..d4d909d --- /dev/null +++ b/appendix/glossary.md @@ -0,0 +1,318 @@ +附录C:关键术语表 + +本附录按章节整理书中涉及的关键中英文术语。 + +## A + + ------------------------------------------------------- + 中文 英文 章节 + ------------------ ----------------------------- ------ + 自编码器 Autoencoder, AE 11 + + 注意力机制 Attention 8 + + 人类反馈强化学习 RLHF 10 + + 人工智能 AI, Artificial Intelligence 1 + + AI for Science AI4S 1 + + AI in Education AIED 1 + ------------------------------------------------------- + +## B + + ---------------------------------- + 中文 英文 章节 + ------------ -------------- ------ + 边界框 Bounding Box 6 + + 生物多样性 Biodiversity 24 + ---------------------------------- + +## C + + ------------------------------------------- + 中文 英文 章节 + -------------- ------------------ --------- + 卷积神经网络 CNN 5, 6, 7 + + 卷积核 Kernel/Filter 5 + + 因果推断 Causal Inference \- + + 连通性 Connectivity 25 + + 交叉熵 Cross Entropy 4 + ------------------------------------------- + +## D + + ----------------------------------------- + 中文 英文 章节 + -------------- ------------------- ------ + 扩散模型 Diffusion Model 11 + + 数字孪生 Digital Twin 14 + + 深度学习 Deep Learning 2 + + 设计生成式AI Generative Design 20 + ----------------------------------------- + +## E + + ------------------------------------------ + 中文 英文 章节 + -------------- -------------------- ------ + 生态系统服务 Ecosystem Services 24 + + 具身智能 Embodied AI 14 + + 编码器 Encoder 9 + + 解码器 Decoder 9 + ------------------------------------------ + +## F + + --------------------------------------------- + 中文 英文 章节 + ---------- --------------------------- ------ + 特征图 Feature Map 5 + + 前馈网络 FFN, Feed-Forward Network 2, 9 + + 俯瞰 Foundation Model \- + --------------------------------------------- + +## G + + --------------------------------------------- + 中文 英文 章节 + -------------- ------------------ ----------- + 生成对抗网络 GAN 11 + + 生成式AI AIGC 1, 11, 16 + + 梯度下降 Gradient Descent 4 + + 图神经网络 GNN 2 + --------------------------------------------- + +## H + + ----------------------------------- + 中文 英文 章节 + -------- ------------------- ------ + HITL Human-in-the-Loop 15 + + 隐藏层 Hidden Layer 3 + + 超参数 Hyperparameter \- + ----------------------------------- + +## I + + ----------------------------------------- + 中文 英文 章节 + ---------- ----------------------- ------ + 交并比 IoU 6 + + 图像分类 Image Classification 6 + + 实例分割 Instance Segmentation 7 + ----------------------------------------- + +## K + + --------------------------------- + 中文 英文 章节 + -------- ----------------- ------ + 键 Key 8 + + 核函数 Kernel Function \- + --------------------------------- + +## L + + ----------------------------------------- + 中文 英文 章节 + ------------ --------------------- ------ + 大语言模型 LLM 10 + + 损失函数 Loss Function 4 + + 学习率 Learning Rate 4 + + LoRA Low-Rank Adaptation 12 + + 潜在空间 Latent Space 11 + ----------------------------------------- + +## M + + -------------------------------------------- + 中文 英文 章节 + ------------ ------------------------ ------ + 多头注意力 Multi-Head Attention 8 + + 多层感知机 MLP 3, 4 + + 多模态 Multimodal 10 + + MCP Model Context Protocol 15 + + 平均精度 mAP 6 + -------------------------------------------- + +## N + + -------------------------------------- + 中文 英文 章节 + -------------- ---------------- ------ + 归一化 Normalization 9 + + 神经网络 Neural Network 2 + + 非极大值抑制 NMS 6 + -------------------------------------- + +## O + + --------------------------------------------- + 中文 英文 章节 + ----------------- -------------------- ------ + 目标检测 Object Detection 6 + + 优化器 Optimizer 4 + + One-Stage检测器 One-Stage Detector 6 + --------------------------------------------- + +## P + + --------------------------------------- + 中文 英文 章节 + ---------- --------------------- ------ + 位置编码 Positional Encoding 8 + + 池化 Pooling 5 + + 提示工程 Prompt Engineering 10 + + 预训练 Pre-training 10 + + 像素 Pixel 7 + --------------------------------------- + +## Q + + --------------------------- + 中文 英文 章节 + ------- ------------ ------ + 查询 Query 8 + + Q学习 Q-Learning 14 + --------------------------- + +## R + + ------------------------------------------------------ + 中文 英文 章节 + -------------- -------------------------------- ------ + RAG Retrieval-Augmented Generation 10 + + ReAct Reasoning + Acting 13 + + 强化学习 RL, Reinforcement Learning 14 + + 循环神经网络 RNN 2 + + 残差连接 Residual Connection 9 + + 值 Value 8 + + 感受野 Receptive Field 5 + ------------------------------------------------------ + +## S + + ----------------------------------------------- + 中文 英文 章节 + ---------------- ----------------------- ------ + Self-Attention 自注意力 8 + + 语义分割 Semantic Segmentation 7 + + Scaling Law 缩放定律 2 + + Sigmoid 激活函数 4 + + Softmax 激活函数 4 + + 境况 State 14 + + 潜变量 Latent Variable 11 + + 支持向量机 SVM \- + ----------------------------------------------- + +## T + + -------------------------------------------- + 中文 英文 章节 + ------------- ----------------------- ------ + Transformer Transformer架构 9 + + 拓扑优化 Topology Optimization 21 + + Token 令牌/词元 9 + + 目标检测 Two-Stage Detector 6 + -------------------------------------------- + +## U + + ------------------------------------------------------- + 中文 英文 章节 + -------------- --------------------------------- ------ + 万能逼近定理 Universal Approximation Theorem 2 + + U-Net 分割网络架构 7 + ------------------------------------------------------- + +## V + + -------------------------------------------------- + 中文 英文 章节 + ----------------- ------------------------- ------ + VAE Variational Autoencoder 11 + + 向量数据库 Vector Database 10 + + 视觉Transformer Vision Transformer 5 + -------------------------------------------------- + +## W + + ---------------------------------- + 中文 英文 章节 + ---------- ---------------- ------ + 权重 Weight 3 + + 权重共享 Weight Sharing 5 + + 权重衰减 Weight Decay \- + ---------------------------------- + +## Y + + ----------------------------------- + 中文 英文 章节 + ------- -------------------- ------ + YOLO You Only Look Once 6 + + ----------------------------------- + +**更新日期**:2026年4月 diff --git a/appendix/references.md b/appendix/references.md new file mode 100644 index 0000000..2a6c866 --- /dev/null +++ b/appendix/references.md @@ -0,0 +1,127 @@ +参考文献 + +本部分整理教材中引用的论文、书籍和在线资源。 + +论文 + +# 基础理论 + +4. Universal Approximation Theorem (1989) + + Scaling Laws for Neural Language Models (2020) + +# 计算机视觉 + +6. AlexNet (2012) - ImageNet Classification with Deep Convolutional Neural Networks + + ResNet (2015) - Deep Residual Learning for Image Recognition + + YOLO (2016) - You Only Look Once: Unified, Real-Time Object Detection + + U-Net (2015) - Convolutional Networks for Biomedical Image Segmentation + +# Transformer与大模型 + +10. Attention Is All You Need (2017) + + BERT: Pre-training of Deep Bidirectional Transformers (2018) + + GPT-3: Language Models are Few-Shot Learners (2020) + + Training Language Models to Follow Instructions with Human Feedback (2022) + +# 生成式AI + +14. Denoising Diffusion Probabilistic Models (2020) + + High-Resolution Image Synthesis with Latent Diffusion Models (2022) + + ControlNet (2023) + +# AI Agent + +1. LLM Powered Autonomous Agents (2023) + +2. ReAct: Synergizing Reasoning and Acting in Language Models (2022) + +3. + +# 书籍 + +5. 深度学习 + +6. Deep Learning (Ian Goodfellow et al.) + +7. Neural Networks and Deep Learning (Michael Nielsen) + +8. 强化学习 + +9. Reinforcement Learning: An Introduction (Sutton & Barto) + +10. + +# 在线资源 + +12. 课程 + +13. CS231n: Convolutional Neural Networks for Visual Recognition + +14. Fast.ai Practical Deep Learning for Coders + +## 工具文档 + +16. PyTorch: https://pytorch.org/docs/ + +17. Ultralytics YOLO: https://docs.ultralytics.com/ + +18. LangChain: https://python.langchain.com/ + +## 博客 + +20. Lil'Log (Lilian Weng): https://lilianweng.github.io/ + +21. The Illustrated Transformer: https://jalammar.github.io/illustrated-transformer/ + +22. + +# 设计AI相关 + +## 学术期刊 + +25. Landscape and Urban Planning + +26. Environment and Planning B: Urban Analytics and City Science + +27. Automation in Construction + +## 会议 + +29. CAAD Futures + +30. ACADIA + +31. eCAADe + +32. + +# 数据集 + +## 计算机视觉 + +35. ImageNet + +36. COCO (Common Objects in Context) + +37. MNIST + +## 空间数据 + +39. OpenStreetMap + +40. 路网数据、POI数据等 + +# 许可说明 + +部分内容引用自公开资源,遵循相应许可协议使用。 + +**最后更新**:2026年4月 diff --git a/appendix/tools.md b/appendix/tools.md new file mode 100644 index 0000000..f55ba9b --- /dev/null +++ b/appendix/tools.md @@ -0,0 +1,207 @@ +附录A:编程工具与资源 + +本附录整理AI学习和实践所需的编程工具、框架和资源。 + +# Python环境配置 + +## Anaconda/Miniconda + + ----------------------------------------------------------------------------------------------------------------- + 工具 大小 特点 下载地址 + ------------- ---------------- ---------------- ----------------------------------------------------------------- + Anaconda \~500MB 预装常用库 [anaconda.com](https://www.anaconda.com/download) + + Miniconda \~50MB 精简安装 [docs.conda.io](https://docs.conda.io/en/latest/miniconda.html) + ----------------------------------------------------------------------------------------------------------------- + +## 安装步骤 + +\# 1. 下载并安装Miniconda\ +\# 2. 创建虚拟环境\ +conda create -n ai-env python=3.10\ +\ +\# 3. 激活环境\ +conda activate ai-env\ +\ +\# 4. 安装核心库\ +pip install torch torchvision numpy pandas scipy + +# 深度学习框架 + +## PyTorch + +`pip`` install torch ``torchvision`` ``torchaudio` + +**特点**: - 动态计算图 - 研究友好 - 广泛的社区支持 + +**资源**: - [官方文档](https://pytorch.org/docs/) - [中文教程](https://pytorch.zhangxiann.com/) + +## TensorFlow + +`pip`` install ``tensorflow` + +**特点**: - 生产部署优化 - Keras高级API - 跨平台支持 + +# 计算机视觉工具 + +OpenCV + +`pip`` install ``opencv``-python` + +**功能**:图像处理、视频分析 + +Ultralytics YOLO + +`pip`` install ``ultralytics` + +**功能**:目标检测、实例分割 + +**使用示例**: + +`from`` ``ultralytics`` ``import`` YOLO`\ +\ +`model ``=`` YOLO(``'yolov8n.pt'``)`\ +`results ``=`` model(``'image.jpg'``)` + +# AIGC工具链 + +## Stable Diffusion + +**WebUI**:[Automatic1111](https://github.com/AUTOMATIC1111/stable-diffusion-webui) + +**ComfyUI**:[GitHub](https://github.com/comfyanonymous/ComfyUI) + +**API调用**: + +`from`` diffusers ``import`` ``StableDiffusionPipeline`\ +\ +`pipe ``=`` StableDiffusionPipeline.from_pretrained(``"runwayml/stable-diffusion-v1-5"``)`\ +`image ``=`` ``pipe(``"a photo of an astronaut riding a horse on mars"``).images[``0``]` + +## ControlNet + +`from`` diffusers ``import`` ``StableDiffusionControlNetPipeline`\ +\ +`controlnet`` ``=`` ControlNetModel.from_pretrained(``"lllyasviel/sd-controlnet-canny"``)`\ +`pipe ``=`` StableDiffusionControlNetPipeline.from_``pretrained(``"runwayml/stable-diffusion-v1-5"``, ``controlnet``=``controlnet``)` + +## Midjourney + +**平台**:Discord **文档**:[docs.midjourney.com](https://docs.midjourney.com/) + +# Agent开发框架 + +## LangChain + +`pip`` install ``langchain`` ``langchain-openai` + +**功能**:LLM应用开发框架 + +**核心组件**: - Models:LLM接口 - Prompts:提示管理 - Chains:链式调用 - Agents:智能体 - Memory:记忆管理 + +LangGraph + +`pip`` install ``langgraph` + +**功能**:状态机式Agent开发 + +LlamaIndex + +`pip`` install llama-index` + +**功能**:数据索引与检索(RAG) + +# 开发工具 + +VSCode + +**AI开发常用插件**: - Python - Pylance - Jupyter - Copilot + +## Cursor + +**特点**:AI原生IDE **网址**:[cursor.com](https://cursor.com/) + +## Jupyter Lab + +`pip`` install ``jupyterlab`\ +`jupyter`` lab` + +# 在线学习资源 + +## 课程 + + -------------------------------------------------------------------------------------------------------------------------------------------------- + 名称 平台 链接 + ------------------- ----------------------- ------------------------------------------------------------------------------------------------------ + CS231n Stanford [cs231n.stanford.edu](http://cs231n.stanford.edu/) + + Fast.ai fast.ai [course.fast.ai](https://course.fast.ai/) + + 吴恩达深度学习 Coursera [coursera.org/specializations/deep-learning](https://www.coursera.org/specializations/deep-learning) + -------------------------------------------------------------------------------------------------------------------------------------------------- + +## 博客与文档 + +1. [Lil'Log](https://lilianweng.github.io/) - AI深度文章 + + [The Illustrated Transformer](https://jalammar.github.io/illustrated-transformer/) + + [Distill.pub](https://distill.pub/) - 可视化论文 + +## 数据集 + + ------------------------------------------------------------------------------------------------------- + 数据集 内容 链接 + -------------------------- ---------------------- ----------------------------------------------------- + ImageNet 图像分类 [image-net.org](https://www.image-net.org/) + + COCO 目标检测 [cocodataset.org](https://cocodataset.org/) + + OpenStreetMap 地图数据 [openstreetmap.org](https://www.openstreetmap.org/) + ------------------------------------------------------------------------------------------------------- + +# 模型资源 + +## Hugging Face + +**网址**:[huggingface.co](https://huggingface.co/) + +**功能**: - 模型仓库 - 数据集 - Spaces在线演示 + +## 常用模型 + + ----------------------------------------------------------------------------- + 任务 推荐模型 Hugging Face ID + ------------ --------------------- ------------------------------------------ + 文生图 Stable Diffusion XL stabilityai/stable-diffusion-xl-base-1.0 + + 目标检测 YOLOv8 Ultralytics + + 语义分割 SAM segment-anything + + 大语言模型 Llama 3 meta-llama/Meta-Llama-3-8B + ----------------------------------------------------------------------------- + +# 硬件资源 + +## 云平台 + + ---------------------------------------- + 平台 特点 适合场景 + ------------------ ---------- ---------- + Google Colab 免费GPU 学习实验 + + Kaggle Notebooks 免费GPU 竞赛 + + AutoDL 按时计费 中期项目 + + 阿里云PAI 国内稳定 生产部署 + ---------------------------------------- + +## 本地GPU + +推荐配置: - GPU:RTX 3060 (12GB) 或更高 - 内存:16GB+ - 存储:至少100GB SSD + +# 最后更新 + +2026年4月