refactor(ch06-08): 调整第三篇章节顺序
原:RL(Ch06) → 生成式AI(Ch07) → Agent(Ch08) 新:生成式AI(Ch06) → Agent(Ch07) → RL(Ch08) 感知→创造→行动 的叙事线更贴合设计专业学生。 更新了目录、CLAUDE.md 和所有章节内编号。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
@@ -11,10 +11,10 @@
|
||||
- 第4章 二维数据——图像与视觉 — 从CNN到大视觉模型
|
||||
- 第5章 三维数据——空间与3D — 从PointNet到空间智能
|
||||
|
||||
### 第三篇:决策、生成与行动
|
||||
- 第6章 强化学习——从决策到对齐 — 从Q-Learning到RLHF
|
||||
- 第7章 生成式AI——从创造到智能生成 — 从VAE/GAN到Diffusion
|
||||
- 第8章 AI Agent——从执行到自主 — 从规则系统到LLM Agent
|
||||
### 第三篇:创造与行动
|
||||
- 第6章 生成式AI——从创造到智能生成 — 从VAE/GAN到Diffusion
|
||||
- 第7章 AI Agent——从执行到自主 — 从规则系统到LLM Agent
|
||||
- 第8章 强化学习——从决策到对齐 — 从Q-Learning到RLHF
|
||||
|
||||
## 下篇:设计领域应用
|
||||
|
||||
|
||||
+23
-23
@@ -1,4 +1,4 @@
|
||||
# 第7章:生成式AI——从创造到智能生成
|
||||
# 第6章:生成式AI——从创造到智能生成
|
||||
|
||||
## 篇章导读
|
||||
|
||||
@@ -8,9 +8,9 @@
|
||||
|
||||
---
|
||||
|
||||
## 7.1 早期生成模型
|
||||
## 6.1 早期生成模型
|
||||
|
||||
### 7.1.1 自编码器(Autoencoder, AE)
|
||||
### 6.1.1 自编码器(Autoencoder, AE)
|
||||
|
||||
自编码器是最早的生成模型思想之一,其核心理念是**学习数据的压缩表示**。
|
||||
|
||||
@@ -30,7 +30,7 @@
|
||||
|
||||
> **设计类比**:AE就像一位只会临摹的画师——他能把看到的景象画出来,但画得不够精细,也无法凭空创造出新的画面。
|
||||
|
||||
### 7.1.2 变分自编码器(Variational Autoencoder, VAE)
|
||||
### 6.1.2 变分自编码器(Variational Autoencoder, VAE)
|
||||
|
||||
VAE在AE的基础上引入了**概率思想**,是生成模型的重要进步。
|
||||
|
||||
@@ -64,9 +64,9 @@ VAE的关键在于将潜在空间约束为**标准正态分布**。这意味着
|
||||
|
||||
---
|
||||
|
||||
## 7.2 对抗生成
|
||||
## 6.2 对抗生成
|
||||
|
||||
### 7.2.1 生成对抗网络(GAN)
|
||||
### 6.2.1 生成对抗网络(GAN)
|
||||
|
||||
2014年,Ian Goodfellow提出了生成对抗网络(Generative Adversarial Network, GAN),开创了生成模型的新范式。
|
||||
|
||||
@@ -106,7 +106,7 @@ GAN的训练过程可以类比为**伪造者与鉴定师**的博弈:
|
||||
- **模式崩溃(Mode Collapse)**:生成器可能只学会生成少数几种图像,缺乏多样性
|
||||
- 超参数敏感,调参困难
|
||||
|
||||
### 7.2.2 StyleGAN:高质量人脸生成
|
||||
### 6.2.2 StyleGAN:高质量人脸生成
|
||||
|
||||
StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性成果。
|
||||
|
||||
@@ -125,7 +125,7 @@ StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性
|
||||
|
||||
StyleGAN可以精确控制生成人脸的各个属性——年龄、性别、发型、表情等,并且生成的人脸在视觉上与真人照片几乎无法区分。
|
||||
|
||||
### 7.2.3 CycleGAN:无配对图像转换
|
||||
### 6.2.3 CycleGAN:无配对图像转换
|
||||
|
||||
CycleGAN解决了一个重要的实际问题:**无需成对训练数据**的图像风格转换。
|
||||
|
||||
@@ -144,9 +144,9 @@ CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景
|
||||
|
||||
---
|
||||
|
||||
## 7.3 扩散模型
|
||||
## 6.3 扩散模型
|
||||
|
||||
### 7.3.1 核心原理
|
||||
### 6.3.1 核心原理
|
||||
|
||||
扩散模型(Diffusion Model)是当前生成式AI的主流技术,其核心思想出人意料地简洁:**先学会如何破坏,再学会如何修复**。
|
||||
|
||||
@@ -188,7 +188,7 @@ x₀ ≈ 原始图像
|
||||
|
||||
模型不需要学习"好图像长什么样",而是学习"噪声长什么样"——这是一个更容易学习的目标。
|
||||
|
||||
### 7.3.2 Stable Diffusion架构
|
||||
### 6.3.2 Stable Diffusion架构
|
||||
|
||||
Stable Diffusion是扩散模型最重要的工程实现,其核心创新是**在潜在空间(Latent Space)中进行扩散**,而非直接在像素空间操作,从而大幅提升了效率。
|
||||
|
||||
@@ -225,7 +225,7 @@ VAE Decoder (解码器)
|
||||
- 压缩过程自动去除冗余信息,保留语义关键特征
|
||||
- 使消费级显卡也能运行生成模型
|
||||
|
||||
### 7.3.3 文生图工作流(Text-to-Image Workflow)
|
||||
### 6.3.3 文生图工作流(Text-to-Image Workflow)
|
||||
|
||||
从文字到图像的完整流程:
|
||||
|
||||
@@ -258,9 +258,9 @@ VAE Decoder (解码器)
|
||||
|
||||
---
|
||||
|
||||
## 7.4 AIGC工具链
|
||||
## 6.4 AIGC工具链
|
||||
|
||||
### 7.4.1 ControlNet:精确条件控制
|
||||
### 6.4.1 ControlNet:精确条件控制
|
||||
|
||||
纯文生图虽然强大,但设计师往往需要**精确控制**空间结构——这正是ControlNet解决的问题。
|
||||
|
||||
@@ -294,7 +294,7 @@ ControlNet与主U-Net协同
|
||||
结构线稿 → 分割图提取 → ControlNet条件控制 → 风格化设计方案
|
||||
```
|
||||
|
||||
### 7.4.2 LoRA:高效微调
|
||||
### 6.4.2 LoRA:高效微调
|
||||
|
||||
全量微调一个大模型需要巨大的计算资源,而LoRA(Low-Rank Adaptation,低秩适应)提供了一种**高效微调**方案。
|
||||
|
||||
@@ -327,7 +327,7 @@ ControlNet与主U-Net协同
|
||||
|
||||
设计师可以针对特定设计风格训练专属LoRA,如"新中式风格""日式极简风格"等,实现个性化的AI生成。
|
||||
|
||||
### 7.4.3 ComfyUI:模块化工作流
|
||||
### 6.4.3 ComfyUI:模块化工作流
|
||||
|
||||
ComfyUI是一个基于**节点化(Node-based)** 的AIGC工作流平台,允许用户通过可视化连接来构建复杂的生成流程。
|
||||
|
||||
@@ -361,7 +361,7 @@ ComfyUI是一个基于**节点化(Node-based)** 的AIGC工作流平台,允
|
||||
保存图像
|
||||
```
|
||||
|
||||
### 7.4.4 Midjourney:创意探索平台
|
||||
### 6.4.4 Midjourney:创意探索平台
|
||||
|
||||
Midjourney是一个面向创意的AI图像生成平台,以极高的审美质量和艺术表现力著称。
|
||||
|
||||
@@ -372,7 +372,7 @@ Midjourney是一个面向创意的AI图像生成平台,以极高的审美质
|
||||
- 适合设计前期的**创意发散和灵感探索**
|
||||
- 付费云服务,依赖网络连接
|
||||
|
||||
### 7.4.5 AIGC工具对比
|
||||
### 6.4.5 AIGC工具对比
|
||||
|
||||
| 工具 | 核心优势 | 适用场景 | 使用门槛 | 部署方式 |
|
||||
| --- | --- | --- | --- | --- |
|
||||
@@ -385,9 +385,9 @@ Midjourney是一个面向创意的AI图像生成平台,以极高的审美质
|
||||
|
||||
---
|
||||
|
||||
## 7.5 设计应用
|
||||
## 6.5 设计应用
|
||||
|
||||
### 7.5.1 建筑设计:从草图到渲染
|
||||
### 6.5.1 建筑设计:从草图到渲染
|
||||
|
||||
```
|
||||
手绘概念草图
|
||||
@@ -407,7 +407,7 @@ AI生成效果图
|
||||
- 生成多个设计方案进行比选
|
||||
- 客户沟通效率大幅提升
|
||||
|
||||
### 7.5.2 室内设计:从平面到立体
|
||||
### 6.5.2 室内设计:从平面到立体
|
||||
|
||||
```
|
||||
户型平面图
|
||||
@@ -421,7 +421,7 @@ AI生成效果图
|
||||
风格迁移 → 多风格方案
|
||||
```
|
||||
|
||||
### 7.5.3 平面设计:品牌视觉生成
|
||||
### 6.5.3 平面设计:品牌视觉生成
|
||||
|
||||
```
|
||||
品牌关键词:"科技感、绿色环保、信任感"
|
||||
@@ -433,7 +433,7 @@ AI生成Logo候选方案(多组)
|
||||
品牌视觉系统延展(名片、海报、包装)
|
||||
```
|
||||
|
||||
### 7.5.4 综合案例:住宅客厅设计工作流
|
||||
### 6.5.4 综合案例:住宅客厅设计工作流
|
||||
|
||||
以下是一个完整的AI辅助住宅客厅设计工作流:
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
# 第8章:AI Agent——从执行到自主
|
||||
# 第7章:AI Agent——从执行到自主
|
||||
|
||||
## 篇章导读
|
||||
|
||||
@@ -10,9 +10,9 @@ AI Agent(智能体)代表了人工智能的下一个前沿:从"被动响
|
||||
|
||||
---
|
||||
|
||||
## 8.1 从规则到智能
|
||||
## 7.1 从规则到智能
|
||||
|
||||
### 8.1.1 规则系统时代
|
||||
### 7.1.1 规则系统时代
|
||||
|
||||
最早的"智能系统"基于**规则(Rules)**,即"如果满足条件A,则执行动作B"。
|
||||
|
||||
@@ -36,7 +36,7 @@ else:
|
||||
- 维护困难——规则数量膨胀后,系统变得难以理解和更新
|
||||
- 缺乏理解——系统并不"理解"规则背后的含义,只是机械执行
|
||||
|
||||
### 8.1.2 传统规划方法
|
||||
### 7.1.2 传统规划方法
|
||||
|
||||
在规则系统之外,符号AI(Symbolic AI)还发展出了**规划(Planning)** 方法:
|
||||
|
||||
@@ -46,7 +46,7 @@ else:
|
||||
|
||||
这类方法在限定领域内效果良好(如国际象棋、路径规划),但面对开放、模糊的现实设计任务时,往往难以定义完整的状态空间和操作算子。
|
||||
|
||||
### 8.1.3 LLM带来的范式转变
|
||||
### 7.1.3 LLM带来的范式转变
|
||||
|
||||
大语言模型(LLM, Large Language Model)的出现,为Agent的发展带来了根本性的转变:
|
||||
|
||||
@@ -67,9 +67,9 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了:
|
||||
|
||||
---
|
||||
|
||||
## 8.2 LLM-based Agent
|
||||
## 7.2 LLM-based Agent
|
||||
|
||||
### 8.2.1 核心组件
|
||||
### 7.2.1 核心组件
|
||||
|
||||
一个完整的LLM-based Agent由以下核心模块构成:
|
||||
|
||||
@@ -92,7 +92,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了:
|
||||
└─────────────────────────────────────────────────┘
|
||||
```
|
||||
|
||||
### 8.2.2 感知(Perception)
|
||||
### 7.2.2 感知(Perception)
|
||||
|
||||
感知模块负责**接收和理解外部信息**:
|
||||
|
||||
@@ -105,7 +105,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了:
|
||||
|
||||
感知的关键在于**理解意图**——用户说"设计一个公园",Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。
|
||||
|
||||
### 8.2.3 规划(Planning)
|
||||
### 7.2.3 规划(Planning)
|
||||
|
||||
规划模块负责**将复杂目标分解为可执行的步骤**:
|
||||
|
||||
@@ -121,7 +121,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了:
|
||||
确定执行顺序和依赖关系
|
||||
```
|
||||
|
||||
### 8.2.4 记忆(Memory)
|
||||
### 7.2.4 记忆(Memory)
|
||||
|
||||
记忆模块为Agent提供**信息存储和检索**能力:
|
||||
|
||||
@@ -146,7 +146,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了:
|
||||
| 长期记忆 | 向量数据库(Vector Database) | 嵌入式检索相关知识 |
|
||||
| 程序性记忆 | 工具库(Tool Library) | 已学会的工具使用方法 |
|
||||
|
||||
### 8.2.5 工具调用(Tool Use)
|
||||
### 7.2.5 工具调用(Tool Use)
|
||||
|
||||
工具调用是Agent与外部世界交互的关键能力:
|
||||
|
||||
@@ -164,9 +164,9 @@ Agent的核心能力在于根据任务需要**自主选择和组合工具**,
|
||||
|
||||
---
|
||||
|
||||
## 8.3 推理模式
|
||||
## 7.3 推理模式
|
||||
|
||||
### 8.3.1 思维链(Chain of Thought, CoT)
|
||||
### 7.3.1 思维链(Chain of Thought, CoT)
|
||||
|
||||
CoT是最基础的推理增强技术,核心思想是**将推理过程显式化**。
|
||||
|
||||
@@ -207,7 +207,7 @@ Step 4:选择植物配置
|
||||
|
||||
CoT的价值在于**让思考过程可见**,这不仅提升了推理的准确性,也使结果更具可解释性。
|
||||
|
||||
### 8.3.2 ReAct(Reasoning + Acting)
|
||||
### 7.3.2 ReAct(Reasoning + Acting)
|
||||
|
||||
ReAct模式将**推理与行动交替进行**,形成"思考-行动-观察"的循环。
|
||||
|
||||
@@ -249,7 +249,7 @@ Think:任务完成,向用户展示报告。
|
||||
|
||||
ReAct模式的优势在于**可以根据中间结果动态调整策略**,而非严格按照预设流程执行。
|
||||
|
||||
### 8.3.3 反思(Reflection)
|
||||
### 7.3.3 反思(Reflection)
|
||||
|
||||
反思机制使Agent能够**自我评估和改进**:
|
||||
|
||||
@@ -275,9 +275,9 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而
|
||||
|
||||
---
|
||||
|
||||
## 8.4 多Agent协作
|
||||
## 7.4 多Agent协作
|
||||
|
||||
### 8.4.1 单Agent架构
|
||||
### 7.4.1 单Agent架构
|
||||
|
||||
单Agent适合**相对简单的任务**:
|
||||
|
||||
@@ -291,7 +291,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而
|
||||
- 同时扮演多个角色,专业性不足
|
||||
- 错误容易累积,缺乏交叉验证
|
||||
|
||||
### 8.4.2 多Agent协作
|
||||
### 7.4.2 多Agent协作
|
||||
|
||||
多Agent系统通过**分工协作**解决复杂任务:
|
||||
|
||||
@@ -313,7 +313,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而
|
||||
| 设计Agent (Designer) | 方案生成、空间布局、效果渲染 | CAD工具、生成模型、设计规范库 |
|
||||
| 审查Agent (Reviewer) | 合规检查、质量评估、问题标记 | 规范数据库、检查规则 |
|
||||
|
||||
### 8.4.3 Agent通信模式
|
||||
### 7.4.3 Agent通信模式
|
||||
|
||||
多Agent之间的通信是协作的关键:
|
||||
|
||||
@@ -334,7 +334,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而
|
||||
各自贡献专业能力,共同解决问题
|
||||
```
|
||||
|
||||
### 8.4.4 新兴Agent社会
|
||||
### 7.4.4 新兴Agent社会
|
||||
|
||||
随着Agent技术的发展,正在出现更复杂的协作形态:
|
||||
|
||||
@@ -346,9 +346,9 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而
|
||||
|
||||
---
|
||||
|
||||
## 8.5 协作与协议
|
||||
## 7.5 协作与协议
|
||||
|
||||
### 8.5.1 MCP协议(Model Context Protocol)
|
||||
### 7.5.1 MCP协议(Model Context Protocol)
|
||||
|
||||
**MCP(模型上下文协议)** 是连接AI模型与外部工具和数据的开放标准。
|
||||
|
||||
@@ -395,7 +395,7 @@ MCP方式:
|
||||
- **安全可控**:权限管理、审计日志、访问控制
|
||||
- **生态开放**:社区可贡献各类MCP Server
|
||||
|
||||
### 8.5.2 HITL:人在回路(Human-in-the-Loop)
|
||||
### 7.5.2 HITL:人在回路(Human-in-the-Loop)
|
||||
|
||||
**HITL(Human-in-the-Loop)** 是在AI决策的关键环节引入人类干预的协作模式。
|
||||
|
||||
@@ -431,9 +431,9 @@ MCP方式:
|
||||
|
||||
---
|
||||
|
||||
## 8.6 设计应用与展望
|
||||
## 7.6 设计应用与展望
|
||||
|
||||
### 8.6.1 场景分析Agent
|
||||
### 7.6.1 场景分析Agent
|
||||
|
||||
**输入:** 场地基础数据(位置、面积、周边环境)
|
||||
|
||||
@@ -449,7 +449,7 @@ Step 5:法规分析 → 查询规划数据库 → 获取用地限制、退让
|
||||
输出:场地综合分析报告(数据、图表、建议)
|
||||
```
|
||||
|
||||
### 8.6.2 设计生成Agent
|
||||
### 7.6.2 设计生成Agent
|
||||
|
||||
**输入:** 设计需求 + 场地分析报告
|
||||
|
||||
@@ -468,7 +468,7 @@ Step 4:效果渲染(调用生成模型)
|
||||
输出:初步设计方案(图纸、效果图、说明)
|
||||
```
|
||||
|
||||
### 8.6.3 合规审查Agent
|
||||
### 7.6.3 合规审查Agent
|
||||
|
||||
**输入:** 设计方案
|
||||
|
||||
@@ -483,7 +483,7 @@ Step 4:生成报告 → 输出合规审查意见,含修改建议
|
||||
输出:合规审查报告
|
||||
```
|
||||
|
||||
### 8.6.4 多Agent协同设计流程
|
||||
### 7.6.4 多Agent协同设计流程
|
||||
|
||||
三个Agent协同工作的完整流程:
|
||||
|
||||
@@ -501,7 +501,7 @@ Step 4:生成报告 → 输出合规审查意见,含修改建议
|
||||
最终设计方案(设计师确认)
|
||||
```
|
||||
|
||||
### 8.6.5 未来展望
|
||||
### 7.6.5 未来展望
|
||||
|
||||
AI在设计领域的角色将经历三个阶段的演进:
|
||||
|
||||
+34
-34
@@ -1,4 +1,4 @@
|
||||
# 第6章:强化学习——从决策到对齐
|
||||
# 第8章:强化学习——从决策到对齐
|
||||
|
||||
## 篇章导读
|
||||
|
||||
@@ -21,9 +21,9 @@
|
||||
|
||||
---
|
||||
|
||||
# 6.1 RL基础
|
||||
# 8.1 RL基础
|
||||
|
||||
## 6.1.1 核心框架:智能体与环境的交互
|
||||
## 8.1.1 核心框架:智能体与环境的交互
|
||||
|
||||
强化学习的核心是一个**智能体(Agent)与环境(Environment)的交互循环**:
|
||||
|
||||
@@ -50,7 +50,7 @@
|
||||
|
||||
这个过程就像一个学生做练习题:做题(选择动作),对答案(接收反馈),总结经验(更新策略),最终提高成绩(最大化累积奖励)。
|
||||
|
||||
## 6.1.2 马尔可夫决策过程
|
||||
## 8.1.2 马尔可夫决策过程
|
||||
|
||||
强化学习的数学基础是**马尔可夫决策过程(Markov Decision Process, MDP)**。一个MDP由五元组 (S, A, P, R, γ) 定义:
|
||||
|
||||
@@ -64,7 +64,7 @@
|
||||
|
||||
**马尔可夫性质(Markov Property)** 是MDP的核心假设:未来只取决于当前状态,与过去无关。这就像下棋时,当前的棋盘状态已经包含了所有必要信息,不需要知道之前的每一步走法。
|
||||
|
||||
## 6.1.3 价值函数
|
||||
## 8.1.3 价值函数
|
||||
|
||||
智能体的目标是最大化累积折扣奖励:
|
||||
|
||||
@@ -82,7 +82,7 @@ $$Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]$$
|
||||
|
||||
两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下"哪个动作最好"。
|
||||
|
||||
## 6.1.4 Q-Learning
|
||||
## 8.1.4 Q-Learning
|
||||
|
||||
**Q-Learning** 是一种经典的免策略(Off-policy)时序差分算法,它直接学习最优Q函数,而不需要知道环境的具体模型。
|
||||
|
||||
@@ -100,7 +100,7 @@ $$Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max_{a'} Q(s', a') - Q(s, a)]
|
||||
|
||||
**探索与利用的平衡(Exploration vs. Exploitation)** 是Q-Learning的关键问题。ε-greedy策略是最简单的解决方案:以概率ε随机选择动作(探索),以概率1-ε选择当前最优动作(利用)。
|
||||
|
||||
## 6.1.5 DQN:深度Q网络
|
||||
## 8.1.5 DQN:深度Q网络
|
||||
|
||||
当状态空间很大时(如像素级游戏画面),用表格存储所有Q值不再可行。2015年,DeepMind提出的**DQN(Deep Q-Network)**用神经网络来近似Q函数,实现了从感知到决策的端到端学习。
|
||||
|
||||
@@ -161,7 +161,7 @@ for episode in range(num_episodes):
|
||||
|
||||
**突破性成果**:DQN在49款Atari游戏上达到了人类水平的性能,仅从游戏画面的像素输入和分数反馈就能学会各种不同的游戏策略。这一成果标志着深度强化学习时代的开启。
|
||||
|
||||
## 6.1.6 代码示例:网格世界中的Q-Learning
|
||||
## 8.1.6 代码示例:网格世界中的Q-Learning
|
||||
|
||||
下面是一个简化的Q-Learning完整示例,智能体在4×4网格中学习从起点走到终点:
|
||||
|
||||
@@ -249,11 +249,11 @@ for s in range(n_states):
|
||||
|
||||
---
|
||||
|
||||
# 6.2 策略优化
|
||||
# 8.2 策略优化
|
||||
|
||||
Q-Learning和DQN属于**基于价值(Value-Based)** 的方法:先学习价值函数,再间接推导策略。另一类方法是**基于策略(Policy-Based)** 的方法,直接优化策略本身。
|
||||
|
||||
## 6.2.1 策略梯度(Policy Gradient)
|
||||
## 8.2.1 策略梯度(Policy Gradient)
|
||||
|
||||
策略梯度方法直接参数化策略 π_θ(a|s),通过梯度上升最大化期望累积奖励:
|
||||
|
||||
@@ -310,7 +310,7 @@ for episode in range(num_episodes):
|
||||
|
||||
REINFORCE的问题在于**方差大**:由于每条轨迹的回报波动很大,梯度估计不稳定,训练效率低。
|
||||
|
||||
## 6.2.2 Actor-Critic方法
|
||||
## 8.2.2 Actor-Critic方法
|
||||
|
||||
**Actor-Critic** 方法结合了基于价值和基于策略的优势:
|
||||
|
||||
@@ -340,7 +340,7 @@ $$A(s, a) = Q(s, a) - V(s)$$
|
||||
|
||||
优势函数衡量的是"采取动作a比平均水平好多少"。如果A > 0,说明这个动作比期望的好,应该增加其概率;反之则降低。
|
||||
|
||||
## 6.2.3 PPO:近端策略优化
|
||||
## 8.2.3 PPO:近端策略优化
|
||||
|
||||
**PPO(Proximal Policy Optimization, 2017)** 是由OpenAI提出的一种策略优化算法,它通过限制策略更新的幅度来保证训练稳定性,成为当前最广泛使用的强化学习算法之一。
|
||||
|
||||
@@ -386,7 +386,7 @@ def ppo_update(states, actions, old_log_probs, returns, advantages):
|
||||
|
||||
> **关键连接**:PPO正是ChatGPT等大语言模型在RLHF(人类反馈强化学习)阶段使用的核心算法。我们在6.4节将详细讨论这一过程。
|
||||
|
||||
## 6.2.4 A3C / A2C
|
||||
## 8.2.4 A3C / A2C
|
||||
|
||||
**A3C(Asynchronous Advantage Actor-Critic, 2016)** 是DeepMind提出的并行训练框架:
|
||||
|
||||
@@ -403,11 +403,11 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新
|
||||
|
||||
---
|
||||
|
||||
# 6.3 Alpha系列
|
||||
# 8.3 Alpha系列
|
||||
|
||||
从2016年开始,DeepMind的Alpha系列成果不断刷新人们对AI能力的认知。这些突破展示了一个共同的技术范式:**搜索 + 深度学习 + 海量计算**。
|
||||
|
||||
## 6.3.1 AlphaGo(2016)
|
||||
## 8.3.1 AlphaGo(2016)
|
||||
|
||||
2016年3月,AlphaGo以4:1击败围棋世界冠军李世石,这是AI发展史上的里程碑事件。围棋的状态空间约为10^170,远超国际象棋(10^47),被普遍认为在短期内不可能被机器攻克。
|
||||
|
||||
@@ -437,7 +437,7 @@ AlphaGo的训练流程:
|
||||
|
||||
AlphaGo的意义远超围棋本身。它证明了:**在极其复杂的决策空间中,深度学习与搜索的结合可以超越人类数千年的知识积累**。
|
||||
|
||||
## 6.3.2 AlphaZero(2017)
|
||||
## 8.3.2 AlphaZero(2017)
|
||||
|
||||
如果说AlphaGo还需要人类棋谱作为起点,那么**AlphaZero**则完全抛弃了人类知识,仅通过**自我对弈(Self-Play)** 从零开始学习。
|
||||
|
||||
@@ -456,7 +456,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类:
|
||||
|
||||
AlphaZero的启示:**当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略**。在对弈中,AlphaZero经常下出人类专家认为"错误"的棋,最终却证明是更优的选择。
|
||||
|
||||
## 6.3.3 AlphaFold(2020)
|
||||
## 8.3.3 AlphaFold(2020)
|
||||
|
||||
**AlphaFold** 将强化学习的思想拓展到科学发现领域。它解决了困扰生物学界50年的**蛋白质结构预测**问题——根据氨基酸序列预测蛋白质的三维结构。
|
||||
|
||||
@@ -477,7 +477,7 @@ AlphaFold的意义对设计领域尤其深远:
|
||||
- **从规则到预测**:从传统的物理实验方法转向数据驱动的预测方法,这与设计领域从经验到数据驱动的发展方向一致
|
||||
- **科学发现的范式**:展示了AI如何加速科学发现,为设计领域的创新提供了新思路
|
||||
|
||||
## 6.3.4 Alpha系列的技术范式
|
||||
## 8.3.4 Alpha系列的技术范式
|
||||
|
||||
总结Alpha系列的成功模式:
|
||||
|
||||
@@ -502,9 +502,9 @@ AlphaFold的意义对设计领域尤其深远:
|
||||
|
||||
---
|
||||
|
||||
# 6.4 人类对齐
|
||||
# 8.4 人类对齐
|
||||
|
||||
## 6.4.1 为什么需要对齐?
|
||||
## 8.4.1 为什么需要对齐?
|
||||
|
||||
经过预训练的大语言模型(如第3章所述)虽然拥有强大的文本生成能力,但它本质上是在模仿训练数据中的模式。这导致几个严重问题:
|
||||
|
||||
@@ -517,7 +517,7 @@ AlphaFold的意义对设计领域尤其深远:
|
||||
|
||||
> **回顾第3章**:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型"能力",而RLHF赋予模型"方向"——让能力服务于人类的目标。
|
||||
|
||||
## 6.4.2 RLHF:从人类反馈中学习
|
||||
## 8.4.2 RLHF:从人类反馈中学习
|
||||
|
||||
RLHF分为三个阶段:
|
||||
|
||||
@@ -595,7 +595,7 @@ for step in range(training_steps):
|
||||
ppo_update(prompt, response, adjusted_reward)
|
||||
```
|
||||
|
||||
## 6.4.3 RLAIF与Constitutional AI
|
||||
## 8.4.3 RLAIF与Constitutional AI
|
||||
|
||||
RLHF需要大量人工标注,成本高昂。**RLAIF(Reinforcement Learning from AI Feedback)** 用AI替代人类标注者来提供反馈:
|
||||
|
||||
@@ -624,9 +624,9 @@ Constitutional AI 流程:
|
||||
|
||||
---
|
||||
|
||||
# 6.5 具身智能
|
||||
# 8.5 具身智能
|
||||
|
||||
## 6.5.1 什么是具身智能?
|
||||
## 8.5.1 什么是具身智能?
|
||||
|
||||
**具身智能(Embodied AI)** 是指拥有物理或虚拟"身体"的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。
|
||||
|
||||
@@ -650,7 +650,7 @@ Constitutional AI 流程:
|
||||
|
||||
强化学习是训练具身智能的核心方法:智能体通过在环境中不断尝试、接收奖励反馈来学习最优行为策略。
|
||||
|
||||
## 6.5.2 数字孪生
|
||||
## 8.5.2 数字孪生
|
||||
|
||||
**数字孪生(Digital Twin)** 是连接物理世界和数字世界的桥梁:
|
||||
|
||||
@@ -673,7 +673,7 @@ Constitutional AI 流程:
|
||||
|
||||
数字孪生为强化学习提供了安全、高效的训练环境。设计师可以在虚拟环境中测试各种方案,然后用最优方案指导物理世界的实施。
|
||||
|
||||
## 6.5.3 Gymnasium环境
|
||||
## 8.5.3 Gymnasium环境
|
||||
|
||||
**Gymnasium**(原OpenAI Gym)是强化学习的标准环境库,提供了丰富的测试环境:
|
||||
|
||||
@@ -711,7 +711,7 @@ Gymnasium中与设计相关的环境包括:
|
||||
| Ant/Humanoid | 机器人运动 | 人体工程学 |
|
||||
| MuJoCo系列 | 物理仿真 | 材料与结构 |
|
||||
|
||||
## 6.5.4 Sim2Real:从仿真到现实
|
||||
## 8.5.4 Sim2Real:从仿真到现实
|
||||
|
||||
强化学习在仿真环境中训练智能体,但仿真与真实世界之间存在**Sim2Real差距(Sim2Real Gap)**:
|
||||
|
||||
@@ -732,7 +732,7 @@ Gymnasium中与设计相关的环境包括:
|
||||
- **系统辨识(System Identification)**:从真实世界数据中学习更准确的仿真参数
|
||||
- **渐进迁移(Progressive Transfer)**:先在仿真中训练,再在真实环境中微调
|
||||
|
||||
## 6.5.5 具身智能的挑战与前景
|
||||
## 8.5.5 具身智能的挑战与前景
|
||||
|
||||
当前面临的挑战:
|
||||
|
||||
@@ -750,11 +750,11 @@ Gymnasium中与设计相关的环境包括:
|
||||
|
||||
---
|
||||
|
||||
# 6.6 设计应用
|
||||
# 8.6 设计应用
|
||||
|
||||
强化学习为设计领域提供了从"被动工具"到"主动智能体"的范式转变。以下是一些具有代表性的应用场景。
|
||||
|
||||
## 6.6.1 空间布局优化
|
||||
## 8.6.1 空间布局优化
|
||||
|
||||
将家具/房间布局问题建模为强化学习问题:
|
||||
|
||||
@@ -779,7 +779,7 @@ Gymnasium中与设计相关的环境包括:
|
||||
|
||||
与传统优化算法相比,强化学习方法的优势在于能够学习到布局的"风格"和"策略",而不仅是找到单一最优解。
|
||||
|
||||
## 6.6.2 路径规划与导航
|
||||
## 8.6.2 路径规划与导航
|
||||
|
||||
强化学习在自主导航中已有广泛应用,同样适用于设计空间中的路径规划:
|
||||
|
||||
@@ -809,7 +809,7 @@ class TrafficSignalEnv:
|
||||
return self.get_state(), reward, False, {}
|
||||
```
|
||||
|
||||
## 6.6.3 自主设计智能体
|
||||
## 8.6.3 自主设计智能体
|
||||
|
||||
将强化学习与生成模型结合,构建能够**自我改进的设计系统**:
|
||||
|
||||
@@ -831,7 +831,7 @@ class TrafficSignalEnv:
|
||||
- 在大量设计变体中搜索最优方案
|
||||
- 学习人类设计师的偏好和风格
|
||||
|
||||
## 6.6.4 建筑自动化
|
||||
## 8.6.4 建筑自动化
|
||||
|
||||
强化学习在建筑制造领域的应用:
|
||||
|
||||
@@ -842,7 +842,7 @@ class TrafficSignalEnv:
|
||||
| 无人施工车 | 工地地图 | 行驶路径、操作 | 任务完成度、安全性 |
|
||||
| 塔吊自动化 | 吊载状态 | 运动轨迹 | 就位精度、时间效率 |
|
||||
|
||||
## 6.6.5 城市系统优化
|
||||
## 8.6.5 城市系统优化
|
||||
|
||||
强化学习在城市规划和设计中的应用:
|
||||
|
||||
Reference in New Issue
Block a user