diff --git a/.gitignore b/.gitignore index 20a59ad..441edc7 100644 --- a/.gitignore +++ b/.gitignore @@ -20,3 +20,4 @@ output/ *.docx *.zip ~$* +~WRL*.tmp diff --git a/CLAUDE.md b/CLAUDE.md index ad0536b..ea549a5 100644 --- a/CLAUDE.md +++ b/CLAUDE.md @@ -64,9 +64,9 @@ A supplementary volume, **CC4SI (Claude Code for Spatial Intelligence)**, is pre | 03 | 1D data: Sequence & text (RNN → LLM) | 1595 | Complete | | 04 | 2D data: Images & vision (CNN → ViT) | 867 | Complete | | 05 | 3D data: Spatial & 3D (PointNet → Spatial AI) | 1421 | Complete | -| 06 | Reinforcement learning (Q-Learning → RLHF) | 896 | Complete | -| 07 | Generative AI (VAE/GAN → Diffusion) | 496 | Complete | -| 08 | AI Agent (rules → LLM Agent) | 581 | Complete | +| 06 | Generative AI (VAE/GAN → Diffusion) | 496 | Complete | +| 07 | AI Agent (rules → LLM Agent) | 581 | Complete | +| 08 | Reinforcement learning (Q-Learning → RLHF) | 896 | Complete | ### Lower Volume: Design Applications diff --git a/officefile/00-frontmatter/目录.md b/officefile/00-frontmatter/目录.md index 7afea87..ea8b0e3 100644 --- a/officefile/00-frontmatter/目录.md +++ b/officefile/00-frontmatter/目录.md @@ -11,10 +11,10 @@ - 第4章 二维数据——图像与视觉 — 从CNN到大视觉模型 - 第5章 三维数据——空间与3D — 从PointNet到空间智能 -### 第三篇:决策、生成与行动 -- 第6章 强化学习——从决策到对齐 — 从Q-Learning到RLHF -- 第7章 生成式AI——从创造到智能生成 — 从VAE/GAN到Diffusion -- 第8章 AI Agent——从执行到自主 — 从规则系统到LLM Agent +### 第三篇:创造与行动 +- 第6章 生成式AI——从创造到智能生成 — 从VAE/GAN到Diffusion +- 第7章 AI Agent——从执行到自主 — 从规则系统到LLM Agent +- 第8章 强化学习——从决策到对齐 — 从Q-Learning到RLHF ## 下篇:设计领域应用 diff --git a/officefile/07-generative-ai/07-generative-ai.md b/officefile/06-generative-ai/06-generative-ai.md similarity index 95% rename from officefile/07-generative-ai/07-generative-ai.md rename to officefile/06-generative-ai/06-generative-ai.md index db27142..f42209b 100644 --- a/officefile/07-generative-ai/07-generative-ai.md +++ b/officefile/06-generative-ai/06-generative-ai.md @@ -1,4 +1,4 @@ -# 第7章:生成式AI——从创造到智能生成 +# 第6章:生成式AI——从创造到智能生成 ## 篇章导读 @@ -8,9 +8,9 @@ --- -## 7.1 早期生成模型 +## 6.1 早期生成模型 -### 7.1.1 自编码器(Autoencoder, AE) +### 6.1.1 自编码器(Autoencoder, AE) 自编码器是最早的生成模型思想之一,其核心理念是**学习数据的压缩表示**。 @@ -30,7 +30,7 @@ > **设计类比**:AE就像一位只会临摹的画师——他能把看到的景象画出来,但画得不够精细,也无法凭空创造出新的画面。 -### 7.1.2 变分自编码器(Variational Autoencoder, VAE) +### 6.1.2 变分自编码器(Variational Autoencoder, VAE) VAE在AE的基础上引入了**概率思想**,是生成模型的重要进步。 @@ -64,9 +64,9 @@ VAE的关键在于将潜在空间约束为**标准正态分布**。这意味着 --- -## 7.2 对抗生成 +## 6.2 对抗生成 -### 7.2.1 生成对抗网络(GAN) +### 6.2.1 生成对抗网络(GAN) 2014年,Ian Goodfellow提出了生成对抗网络(Generative Adversarial Network, GAN),开创了生成模型的新范式。 @@ -106,7 +106,7 @@ GAN的训练过程可以类比为**伪造者与鉴定师**的博弈: - **模式崩溃(Mode Collapse)**:生成器可能只学会生成少数几种图像,缺乏多样性 - 超参数敏感,调参困难 -### 7.2.2 StyleGAN:高质量人脸生成 +### 6.2.2 StyleGAN:高质量人脸生成 StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性成果。 @@ -125,7 +125,7 @@ StyleGAN是NVIDIA推出的系列模型,在人脸生成领域取得了突破性 StyleGAN可以精确控制生成人脸的各个属性——年龄、性别、发型、表情等,并且生成的人脸在视觉上与真人照片几乎无法区分。 -### 7.2.3 CycleGAN:无配对图像转换 +### 6.2.3 CycleGAN:无配对图像转换 CycleGAN解决了一个重要的实际问题:**无需成对训练数据**的图像风格转换。 @@ -144,9 +144,9 @@ CycleGAN的设计应用十分广泛:实景照片转水彩风格、白天场景 --- -## 7.3 扩散模型 +## 6.3 扩散模型 -### 7.3.1 核心原理 +### 6.3.1 核心原理 扩散模型(Diffusion Model)是当前生成式AI的主流技术,其核心思想出人意料地简洁:**先学会如何破坏,再学会如何修复**。 @@ -188,7 +188,7 @@ x₀ ≈ 原始图像 模型不需要学习"好图像长什么样",而是学习"噪声长什么样"——这是一个更容易学习的目标。 -### 7.3.2 Stable Diffusion架构 +### 6.3.2 Stable Diffusion架构 Stable Diffusion是扩散模型最重要的工程实现,其核心创新是**在潜在空间(Latent Space)中进行扩散**,而非直接在像素空间操作,从而大幅提升了效率。 @@ -225,7 +225,7 @@ VAE Decoder (解码器) - 压缩过程自动去除冗余信息,保留语义关键特征 - 使消费级显卡也能运行生成模型 -### 7.3.3 文生图工作流(Text-to-Image Workflow) +### 6.3.3 文生图工作流(Text-to-Image Workflow) 从文字到图像的完整流程: @@ -258,9 +258,9 @@ VAE Decoder (解码器) --- -## 7.4 AIGC工具链 +## 6.4 AIGC工具链 -### 7.4.1 ControlNet:精确条件控制 +### 6.4.1 ControlNet:精确条件控制 纯文生图虽然强大,但设计师往往需要**精确控制**空间结构——这正是ControlNet解决的问题。 @@ -294,7 +294,7 @@ ControlNet与主U-Net协同 结构线稿 → 分割图提取 → ControlNet条件控制 → 风格化设计方案 ``` -### 7.4.2 LoRA:高效微调 +### 6.4.2 LoRA:高效微调 全量微调一个大模型需要巨大的计算资源,而LoRA(Low-Rank Adaptation,低秩适应)提供了一种**高效微调**方案。 @@ -327,7 +327,7 @@ ControlNet与主U-Net协同 设计师可以针对特定设计风格训练专属LoRA,如"新中式风格""日式极简风格"等,实现个性化的AI生成。 -### 7.4.3 ComfyUI:模块化工作流 +### 6.4.3 ComfyUI:模块化工作流 ComfyUI是一个基于**节点化(Node-based)** 的AIGC工作流平台,允许用户通过可视化连接来构建复杂的生成流程。 @@ -361,7 +361,7 @@ ComfyUI是一个基于**节点化(Node-based)** 的AIGC工作流平台,允 保存图像 ``` -### 7.4.4 Midjourney:创意探索平台 +### 6.4.4 Midjourney:创意探索平台 Midjourney是一个面向创意的AI图像生成平台,以极高的审美质量和艺术表现力著称。 @@ -372,7 +372,7 @@ Midjourney是一个面向创意的AI图像生成平台,以极高的审美质 - 适合设计前期的**创意发散和灵感探索** - 付费云服务,依赖网络连接 -### 7.4.5 AIGC工具对比 +### 6.4.5 AIGC工具对比 | 工具 | 核心优势 | 适用场景 | 使用门槛 | 部署方式 | | --- | --- | --- | --- | --- | @@ -385,9 +385,9 @@ Midjourney是一个面向创意的AI图像生成平台,以极高的审美质 --- -## 7.5 设计应用 +## 6.5 设计应用 -### 7.5.1 建筑设计:从草图到渲染 +### 6.5.1 建筑设计:从草图到渲染 ``` 手绘概念草图 @@ -407,7 +407,7 @@ AI生成效果图 - 生成多个设计方案进行比选 - 客户沟通效率大幅提升 -### 7.5.2 室内设计:从平面到立体 +### 6.5.2 室内设计:从平面到立体 ``` 户型平面图 @@ -421,7 +421,7 @@ AI生成效果图 风格迁移 → 多风格方案 ``` -### 7.5.3 平面设计:品牌视觉生成 +### 6.5.3 平面设计:品牌视觉生成 ``` 品牌关键词:"科技感、绿色环保、信任感" @@ -433,7 +433,7 @@ AI生成Logo候选方案(多组) 品牌视觉系统延展(名片、海报、包装) ``` -### 7.5.4 综合案例:住宅客厅设计工作流 +### 6.5.4 综合案例:住宅客厅设计工作流 以下是一个完整的AI辅助住宅客厅设计工作流: diff --git a/officefile/08-agent/08-agent.md b/officefile/07-agent/07-agent.md similarity index 96% rename from officefile/08-agent/08-agent.md rename to officefile/07-agent/07-agent.md index ba652a7..9fb0a50 100644 --- a/officefile/08-agent/08-agent.md +++ b/officefile/07-agent/07-agent.md @@ -1,4 +1,4 @@ -# 第8章:AI Agent——从执行到自主 +# 第7章:AI Agent——从执行到自主 ## 篇章导读 @@ -10,9 +10,9 @@ AI Agent(智能体)代表了人工智能的下一个前沿:从"被动响 --- -## 8.1 从规则到智能 +## 7.1 从规则到智能 -### 8.1.1 规则系统时代 +### 7.1.1 规则系统时代 最早的"智能系统"基于**规则(Rules)**,即"如果满足条件A,则执行动作B"。 @@ -36,7 +36,7 @@ else: - 维护困难——规则数量膨胀后,系统变得难以理解和更新 - 缺乏理解——系统并不"理解"规则背后的含义,只是机械执行 -### 8.1.2 传统规划方法 +### 7.1.2 传统规划方法 在规则系统之外,符号AI(Symbolic AI)还发展出了**规划(Planning)** 方法: @@ -46,7 +46,7 @@ else: 这类方法在限定领域内效果良好(如国际象棋、路径规划),但面对开放、模糊的现实设计任务时,往往难以定义完整的状态空间和操作算子。 -### 8.1.3 LLM带来的范式转变 +### 7.1.3 LLM带来的范式转变 大语言模型(LLM, Large Language Model)的出现,为Agent的发展带来了根本性的转变: @@ -67,9 +67,9 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了: --- -## 8.2 LLM-based Agent +## 7.2 LLM-based Agent -### 8.2.1 核心组件 +### 7.2.1 核心组件 一个完整的LLM-based Agent由以下核心模块构成: @@ -92,7 +92,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了: └─────────────────────────────────────────────────┘ ``` -### 8.2.2 感知(Perception) +### 7.2.2 感知(Perception) 感知模块负责**接收和理解外部信息**: @@ -105,7 +105,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了: 感知的关键在于**理解意图**——用户说"设计一个公园",Agent需要理解这涉及场地分析、功能分区、路径规划、植物配置等多个子任务。 -### 8.2.3 规划(Planning) +### 7.2.3 规划(Planning) 规划模块负责**将复杂目标分解为可执行的步骤**: @@ -121,7 +121,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了: 确定执行顺序和依赖关系 ``` -### 8.2.4 记忆(Memory) +### 7.2.4 记忆(Memory) 记忆模块为Agent提供**信息存储和检索**能力: @@ -146,7 +146,7 @@ LLM之所以能成为Agent的"大脑",关键在于它具备了: | 长期记忆 | 向量数据库(Vector Database) | 嵌入式检索相关知识 | | 程序性记忆 | 工具库(Tool Library) | 已学会的工具使用方法 | -### 8.2.5 工具调用(Tool Use) +### 7.2.5 工具调用(Tool Use) 工具调用是Agent与外部世界交互的关键能力: @@ -164,9 +164,9 @@ Agent的核心能力在于根据任务需要**自主选择和组合工具**, --- -## 8.3 推理模式 +## 7.3 推理模式 -### 8.3.1 思维链(Chain of Thought, CoT) +### 7.3.1 思维链(Chain of Thought, CoT) CoT是最基础的推理增强技术,核心思想是**将推理过程显式化**。 @@ -207,7 +207,7 @@ Step 4:选择植物配置 CoT的价值在于**让思考过程可见**,这不仅提升了推理的准确性,也使结果更具可解释性。 -### 8.3.2 ReAct(Reasoning + Acting) +### 7.3.2 ReAct(Reasoning + Acting) ReAct模式将**推理与行动交替进行**,形成"思考-行动-观察"的循环。 @@ -249,7 +249,7 @@ Think:任务完成,向用户展示报告。 ReAct模式的优势在于**可以根据中间结果动态调整策略**,而非严格按照预设流程执行。 -### 8.3.3 反思(Reflection) +### 7.3.3 反思(Reflection) 反思机制使Agent能够**自我评估和改进**: @@ -275,9 +275,9 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而 --- -## 8.4 多Agent协作 +## 7.4 多Agent协作 -### 8.4.1 单Agent架构 +### 7.4.1 单Agent架构 单Agent适合**相对简单的任务**: @@ -291,7 +291,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而 - 同时扮演多个角色,专业性不足 - 错误容易累积,缺乏交叉验证 -### 8.4.2 多Agent协作 +### 7.4.2 多Agent协作 多Agent系统通过**分工协作**解决复杂任务: @@ -313,7 +313,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而 | 设计Agent (Designer) | 方案生成、空间布局、效果渲染 | CAD工具、生成模型、设计规范库 | | 审查Agent (Reviewer) | 合规检查、质量评估、问题标记 | 规范数据库、检查规则 | -### 8.4.3 Agent通信模式 +### 7.4.3 Agent通信模式 多Agent之间的通信是协作的关键: @@ -334,7 +334,7 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而 各自贡献专业能力,共同解决问题 ``` -### 8.4.4 新兴Agent社会 +### 7.4.4 新兴Agent社会 随着Agent技术的发展,正在出现更复杂的协作形态: @@ -346,9 +346,9 @@ ReAct模式的优势在于**可以根据中间结果动态调整策略**,而 --- -## 8.5 协作与协议 +## 7.5 协作与协议 -### 8.5.1 MCP协议(Model Context Protocol) +### 7.5.1 MCP协议(Model Context Protocol) **MCP(模型上下文协议)** 是连接AI模型与外部工具和数据的开放标准。 @@ -395,7 +395,7 @@ MCP方式: - **安全可控**:权限管理、审计日志、访问控制 - **生态开放**:社区可贡献各类MCP Server -### 8.5.2 HITL:人在回路(Human-in-the-Loop) +### 7.5.2 HITL:人在回路(Human-in-the-Loop) **HITL(Human-in-the-Loop)** 是在AI决策的关键环节引入人类干预的协作模式。 @@ -431,9 +431,9 @@ MCP方式: --- -## 8.6 设计应用与展望 +## 7.6 设计应用与展望 -### 8.6.1 场景分析Agent +### 7.6.1 场景分析Agent **输入:** 场地基础数据(位置、面积、周边环境) @@ -449,7 +449,7 @@ Step 5:法规分析 → 查询规划数据库 → 获取用地限制、退让 输出:场地综合分析报告(数据、图表、建议) ``` -### 8.6.2 设计生成Agent +### 7.6.2 设计生成Agent **输入:** 设计需求 + 场地分析报告 @@ -468,7 +468,7 @@ Step 4:效果渲染(调用生成模型) 输出:初步设计方案(图纸、效果图、说明) ``` -### 8.6.3 合规审查Agent +### 7.6.3 合规审查Agent **输入:** 设计方案 @@ -483,7 +483,7 @@ Step 4:生成报告 → 输出合规审查意见,含修改建议 输出:合规审查报告 ``` -### 8.6.4 多Agent协同设计流程 +### 7.6.4 多Agent协同设计流程 三个Agent协同工作的完整流程: @@ -501,7 +501,7 @@ Step 4:生成报告 → 输出合规审查意见,含修改建议 最终设计方案(设计师确认) ``` -### 8.6.5 未来展望 +### 7.6.5 未来展望 AI在设计领域的角色将经历三个阶段的演进: diff --git a/officefile/06-reinforcement/06-reinforcement.md b/officefile/08-reinforcement/08-reinforcement.md similarity index 97% rename from officefile/06-reinforcement/06-reinforcement.md rename to officefile/08-reinforcement/08-reinforcement.md index 820fa7d..4ec285b 100644 --- a/officefile/06-reinforcement/06-reinforcement.md +++ b/officefile/08-reinforcement/08-reinforcement.md @@ -1,4 +1,4 @@ -# 第6章:强化学习——从决策到对齐 +# 第8章:强化学习——从决策到对齐 ## 篇章导读 @@ -21,9 +21,9 @@ --- -# 6.1 RL基础 +# 8.1 RL基础 -## 6.1.1 核心框架:智能体与环境的交互 +## 8.1.1 核心框架:智能体与环境的交互 强化学习的核心是一个**智能体(Agent)与环境(Environment)的交互循环**: @@ -50,7 +50,7 @@ 这个过程就像一个学生做练习题:做题(选择动作),对答案(接收反馈),总结经验(更新策略),最终提高成绩(最大化累积奖励)。 -## 6.1.2 马尔可夫决策过程 +## 8.1.2 马尔可夫决策过程 强化学习的数学基础是**马尔可夫决策过程(Markov Decision Process, MDP)**。一个MDP由五元组 (S, A, P, R, γ) 定义: @@ -64,7 +64,7 @@ **马尔可夫性质(Markov Property)** 是MDP的核心假设:未来只取决于当前状态,与过去无关。这就像下棋时,当前的棋盘状态已经包含了所有必要信息,不需要知道之前的每一步走法。 -## 6.1.3 价值函数 +## 8.1.3 价值函数 智能体的目标是最大化累积折扣奖励: @@ -82,7 +82,7 @@ $$Q^\pi(s, a) = \mathbb{E}_\pi [G_t | S_t = s, A_t = a]$$ 两者的关系是:V(s) 是对所有可能动作的Q值的加权平均。Q函数更为实用,因为它直接告诉我们在某个状态下"哪个动作最好"。 -## 6.1.4 Q-Learning +## 8.1.4 Q-Learning **Q-Learning** 是一种经典的免策略(Off-policy)时序差分算法,它直接学习最优Q函数,而不需要知道环境的具体模型。 @@ -100,7 +100,7 @@ $$Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max_{a'} Q(s', a') - Q(s, a)] **探索与利用的平衡(Exploration vs. Exploitation)** 是Q-Learning的关键问题。ε-greedy策略是最简单的解决方案:以概率ε随机选择动作(探索),以概率1-ε选择当前最优动作(利用)。 -## 6.1.5 DQN:深度Q网络 +## 8.1.5 DQN:深度Q网络 当状态空间很大时(如像素级游戏画面),用表格存储所有Q值不再可行。2015年,DeepMind提出的**DQN(Deep Q-Network)**用神经网络来近似Q函数,实现了从感知到决策的端到端学习。 @@ -161,7 +161,7 @@ for episode in range(num_episodes): **突破性成果**:DQN在49款Atari游戏上达到了人类水平的性能,仅从游戏画面的像素输入和分数反馈就能学会各种不同的游戏策略。这一成果标志着深度强化学习时代的开启。 -## 6.1.6 代码示例:网格世界中的Q-Learning +## 8.1.6 代码示例:网格世界中的Q-Learning 下面是一个简化的Q-Learning完整示例,智能体在4×4网格中学习从起点走到终点: @@ -249,11 +249,11 @@ for s in range(n_states): --- -# 6.2 策略优化 +# 8.2 策略优化 Q-Learning和DQN属于**基于价值(Value-Based)** 的方法:先学习价值函数,再间接推导策略。另一类方法是**基于策略(Policy-Based)** 的方法,直接优化策略本身。 -## 6.2.1 策略梯度(Policy Gradient) +## 8.2.1 策略梯度(Policy Gradient) 策略梯度方法直接参数化策略 π_θ(a|s),通过梯度上升最大化期望累积奖励: @@ -310,7 +310,7 @@ for episode in range(num_episodes): REINFORCE的问题在于**方差大**:由于每条轨迹的回报波动很大,梯度估计不稳定,训练效率低。 -## 6.2.2 Actor-Critic方法 +## 8.2.2 Actor-Critic方法 **Actor-Critic** 方法结合了基于价值和基于策略的优势: @@ -340,7 +340,7 @@ $$A(s, a) = Q(s, a) - V(s)$$ 优势函数衡量的是"采取动作a比平均水平好多少"。如果A > 0,说明这个动作比期望的好,应该增加其概率;反之则降低。 -## 6.2.3 PPO:近端策略优化 +## 8.2.3 PPO:近端策略优化 **PPO(Proximal Policy Optimization, 2017)** 是由OpenAI提出的一种策略优化算法,它通过限制策略更新的幅度来保证训练稳定性,成为当前最广泛使用的强化学习算法之一。 @@ -386,7 +386,7 @@ def ppo_update(states, actions, old_log_probs, returns, advantages): > **关键连接**:PPO正是ChatGPT等大语言模型在RLHF(人类反馈强化学习)阶段使用的核心算法。我们在6.4节将详细讨论这一过程。 -## 6.2.4 A3C / A2C +## 8.2.4 A3C / A2C **A3C(Asynchronous Advantage Actor-Critic, 2016)** 是DeepMind提出的并行训练框架: @@ -403,11 +403,11 @@ A2C: 多个Worker同步更新 → 等待所有Worker完成,再统一更新 --- -# 6.3 Alpha系列 +# 8.3 Alpha系列 从2016年开始,DeepMind的Alpha系列成果不断刷新人们对AI能力的认知。这些突破展示了一个共同的技术范式:**搜索 + 深度学习 + 海量计算**。 -## 6.3.1 AlphaGo(2016) +## 8.3.1 AlphaGo(2016) 2016年3月,AlphaGo以4:1击败围棋世界冠军李世石,这是AI发展史上的里程碑事件。围棋的状态空间约为10^170,远超国际象棋(10^47),被普遍认为在短期内不可能被机器攻克。 @@ -437,7 +437,7 @@ AlphaGo的训练流程: AlphaGo的意义远超围棋本身。它证明了:**在极其复杂的决策空间中,深度学习与搜索的结合可以超越人类数千年的知识积累**。 -## 6.3.2 AlphaZero(2017) +## 8.3.2 AlphaZero(2017) 如果说AlphaGo还需要人类棋谱作为起点,那么**AlphaZero**则完全抛弃了人类知识,仅通过**自我对弈(Self-Play)** 从零开始学习。 @@ -456,7 +456,7 @@ AlphaZero用同一个框架掌握了三种完全不同的棋类: AlphaZero的启示:**当我们摆脱对人类数据的依赖,让AI完全通过自我探索来学习时,它可能发现人类从未想到过的策略**。在对弈中,AlphaZero经常下出人类专家认为"错误"的棋,最终却证明是更优的选择。 -## 6.3.3 AlphaFold(2020) +## 8.3.3 AlphaFold(2020) **AlphaFold** 将强化学习的思想拓展到科学发现领域。它解决了困扰生物学界50年的**蛋白质结构预测**问题——根据氨基酸序列预测蛋白质的三维结构。 @@ -477,7 +477,7 @@ AlphaFold的意义对设计领域尤其深远: - **从规则到预测**:从传统的物理实验方法转向数据驱动的预测方法,这与设计领域从经验到数据驱动的发展方向一致 - **科学发现的范式**:展示了AI如何加速科学发现,为设计领域的创新提供了新思路 -## 6.3.4 Alpha系列的技术范式 +## 8.3.4 Alpha系列的技术范式 总结Alpha系列的成功模式: @@ -502,9 +502,9 @@ AlphaFold的意义对设计领域尤其深远: --- -# 6.4 人类对齐 +# 8.4 人类对齐 -## 6.4.1 为什么需要对齐? +## 8.4.1 为什么需要对齐? 经过预训练的大语言模型(如第3章所述)虽然拥有强大的文本生成能力,但它本质上是在模仿训练数据中的模式。这导致几个严重问题: @@ -517,7 +517,7 @@ AlphaFold的意义对设计领域尤其深远: > **回顾第3章**:在第3章中我们了解了Transformer架构和语言模型的预训练过程。预训练赋予模型"能力",而RLHF赋予模型"方向"——让能力服务于人类的目标。 -## 6.4.2 RLHF:从人类反馈中学习 +## 8.4.2 RLHF:从人类反馈中学习 RLHF分为三个阶段: @@ -595,7 +595,7 @@ for step in range(training_steps): ppo_update(prompt, response, adjusted_reward) ``` -## 6.4.3 RLAIF与Constitutional AI +## 8.4.3 RLAIF与Constitutional AI RLHF需要大量人工标注,成本高昂。**RLAIF(Reinforcement Learning from AI Feedback)** 用AI替代人类标注者来提供反馈: @@ -624,9 +624,9 @@ Constitutional AI 流程: --- -# 6.5 具身智能 +# 8.5 具身智能 -## 6.5.1 什么是具身智能? +## 8.5.1 什么是具身智能? **具身智能(Embodied AI)** 是指拥有物理或虚拟"身体"的AI系统,它通过与真实或模拟环境的物理交互来学习和完成任务。 @@ -650,7 +650,7 @@ Constitutional AI 流程: 强化学习是训练具身智能的核心方法:智能体通过在环境中不断尝试、接收奖励反馈来学习最优行为策略。 -## 6.5.2 数字孪生 +## 8.5.2 数字孪生 **数字孪生(Digital Twin)** 是连接物理世界和数字世界的桥梁: @@ -673,7 +673,7 @@ Constitutional AI 流程: 数字孪生为强化学习提供了安全、高效的训练环境。设计师可以在虚拟环境中测试各种方案,然后用最优方案指导物理世界的实施。 -## 6.5.3 Gymnasium环境 +## 8.5.3 Gymnasium环境 **Gymnasium**(原OpenAI Gym)是强化学习的标准环境库,提供了丰富的测试环境: @@ -711,7 +711,7 @@ Gymnasium中与设计相关的环境包括: | Ant/Humanoid | 机器人运动 | 人体工程学 | | MuJoCo系列 | 物理仿真 | 材料与结构 | -## 6.5.4 Sim2Real:从仿真到现实 +## 8.5.4 Sim2Real:从仿真到现实 强化学习在仿真环境中训练智能体,但仿真与真实世界之间存在**Sim2Real差距(Sim2Real Gap)**: @@ -732,7 +732,7 @@ Gymnasium中与设计相关的环境包括: - **系统辨识(System Identification)**:从真实世界数据中学习更准确的仿真参数 - **渐进迁移(Progressive Transfer)**:先在仿真中训练,再在真实环境中微调 -## 6.5.5 具身智能的挑战与前景 +## 8.5.5 具身智能的挑战与前景 当前面临的挑战: @@ -750,11 +750,11 @@ Gymnasium中与设计相关的环境包括: --- -# 6.6 设计应用 +# 8.6 设计应用 强化学习为设计领域提供了从"被动工具"到"主动智能体"的范式转变。以下是一些具有代表性的应用场景。 -## 6.6.1 空间布局优化 +## 8.6.1 空间布局优化 将家具/房间布局问题建模为强化学习问题: @@ -779,7 +779,7 @@ Gymnasium中与设计相关的环境包括: 与传统优化算法相比,强化学习方法的优势在于能够学习到布局的"风格"和"策略",而不仅是找到单一最优解。 -## 6.6.2 路径规划与导航 +## 8.6.2 路径规划与导航 强化学习在自主导航中已有广泛应用,同样适用于设计空间中的路径规划: @@ -809,7 +809,7 @@ class TrafficSignalEnv: return self.get_state(), reward, False, {} ``` -## 6.6.3 自主设计智能体 +## 8.6.3 自主设计智能体 将强化学习与生成模型结合,构建能够**自我改进的设计系统**: @@ -831,7 +831,7 @@ class TrafficSignalEnv: - 在大量设计变体中搜索最优方案 - 学习人类设计师的偏好和风格 -## 6.6.4 建筑自动化 +## 8.6.4 建筑自动化 强化学习在建筑制造领域的应用: @@ -842,7 +842,7 @@ class TrafficSignalEnv: | 无人施工车 | 工地地图 | 行驶路径、操作 | 任务完成度、安全性 | | 塔吊自动化 | 吊载状态 | 运动轨迹 | 就位精度、时间效率 | -## 6.6.5 城市系统优化 +## 8.6.5 城市系统优化 强化学习在城市规划和设计中的应用: