fac0133db5
将 11 个目录下的 26 个子章节文件合并到对应的父文件中, 用 --- 分隔各子章节,移除冗余的章节目录索引。 每个篇章现在是独立的单文件,结构更简洁。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
536 lines
13 KiB
Markdown
536 lines
13 KiB
Markdown
# 第六篇:AI Agent与自主设计
|
|
|
|
本篇探讨AI Agent的架构和具身智能,展望AI在规划设计中的应用前景。
|
|
|
|
## 篇章导读
|
|
|
|
AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行动",从"单一能力"到"系统协同"。
|
|
|
|
本篇将系统介绍Agent架构和在设计领域的应用。
|
|
|
|
---
|
|
|
|
## 学习目标
|
|
|
|
1. 理解从规则到LLM-based Agent的演进
|
|
|
|
掌握Agent的核心组件
|
|
|
|
了解ReAct和CoT推理模式
|
|
|
|
## 从规则到LLM Agent
|
|
|
|
### 规则系统时代
|
|
|
|
`if`` ``condition_A``:`\
|
|
` ``action_``B``(``)`\
|
|
`elif`` ``condition_C``:`\
|
|
` ``action_D``()`\
|
|
`else``:`\
|
|
` ``action_E``()`
|
|
|
|
局限:规则难以穷举,无法应对新情况
|
|
|
|
### LLM-based Agent
|
|
|
|
`用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出`
|
|
|
|
优势: - 自然语言交互 - 上下文理解 - 泛化能力强
|
|
|
|
## Agent核心组件
|
|
|
|
### 感知 (Perception)
|
|
|
|
`输入信息`` → ``理解与解析`\
|
|
` - ``用户指令`\
|
|
` - ``环境状态`\
|
|
` - ``工具反馈`
|
|
|
|
### 规划 (Planning)
|
|
|
|
`目标`` → ``分解为子任务`\
|
|
` - ``任务分析`\
|
|
` - ``步骤规划`\
|
|
` - ``依赖管理`
|
|
|
|
### 记忆 (Memory)
|
|
|
|
`┌─────────────────────────────┐`\
|
|
`│ ``短期记忆`` (Short-term) │`\
|
|
`│ ``对话上下文、临时状态`` │`\
|
|
`├─────────────────────────────┤`\
|
|
`│ ``长期记忆`` (Long-term) │`\
|
|
`│ ``知识库、经验积累`` │`\
|
|
`└─────────────────────────────┘`
|
|
|
|
### 工具调用 (Tool Use)
|
|
|
|
`可用工具集:`\
|
|
` - ``数据库查询`\
|
|
` - API``调用`\
|
|
` - ``文件操作`\
|
|
` - ``代码执行`\
|
|
` ...`
|
|
|
|
## 推理模式
|
|
|
|
Chain of Thought (CoT)
|
|
|
|
`问题`` → ``思考链`` → ``答案`
|
|
|
|
`"``设计一个公园``"`
|
|
|
|
` ↓`
|
|
|
|
1. `分析场地条件`
|
|
|
|
2. `2. ``确定功能分区`
|
|
|
|
3. `3. ``布局路径系统`
|
|
|
|
`4. ``选择植物配置`
|
|
|
|
`↓`
|
|
|
|
完整方案
|
|
|
|
### ReAct (Reasoning + Acting)
|
|
|
|
`循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...`\
|
|
\
|
|
`思考:需要查询场地数据`\
|
|
`行动:调用``GIS``工具`\
|
|
`观察:获取到高程信息`\
|
|
`思考:基于高程做排水设计`\
|
|
`行动:生成排水方案`\
|
|
`...`
|
|
|
|
## Agent架构示例
|
|
|
|
单Agent架构
|
|
|
|
`┌─────────────────────────────┐`\
|
|
`│ LLM Core │`\
|
|
`│ (``规划、推理、决策``) │`\
|
|
`├─────────────────────────────┤`\
|
|
`│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │`\
|
|
`│ │``感知``││``记忆``││``工具``││``反思``│ │`\
|
|
`│ └───┘ └───┘ └───┘ └───┘ │`\
|
|
`└─────────────────────────────┘`\
|
|
` ↓`\
|
|
` ``执行任务`
|
|
|
|
### 多Agent协作
|
|
|
|
`┌─────────┐ ┌─────────┐ ┌─────────┐`\
|
|
`│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│`\
|
|
`└─────────┘ └─────────┘ └─────────┘`\
|
|
` ↓ ↓ ↓`\
|
|
` ``任务分解`` ``数据分析`` ``方案生成`
|
|
|
|
## 思考与练习
|
|
|
|
1. 单Agent和多Agent系统各有什么优势?
|
|
|
|
2. 如何设计Agent的记忆系统?
|
|
|
|
3. CoT和ReAct各适用于什么场景?
|
|
|
|
## 关键术语
|
|
|
|
--------------------------------------------
|
|
中文 英文 说明
|
|
---------- ------------ --------------------
|
|
思考链 CoT Chain of Thought
|
|
|
|
推理行动 ReAct Reasoning + Acting
|
|
|
|
记忆 Memory 存储和检索信息
|
|
|
|
反思 Reflection 自我评估与改进
|
|
|
|
工具使用 Tool Use 调用外部能力
|
|
--------------------------------------------
|
|
|
|
## 延伸阅读
|
|
|
|
1. [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/)
|
|
|
|
[ReAct: Synergizing Reasoning and Acting](https://arxiv.org/abs/2210.03629) \# 05.2 具身智能
|
|
|
|
---
|
|
|
|
# 学习目标
|
|
|
|
3. 理解具身智能的概念和特点
|
|
|
|
了解数字孪生与物理世界的交互
|
|
|
|
掌握强化学习在具身AI中的应用
|
|
|
|
# 什么是具身智能
|
|
|
|
## 定义
|
|
|
|
**具身智能 (Embodied AI)**:具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。
|
|
|
|
## 与传统AI的区别
|
|
|
|
------------------------------------
|
|
特性 传统AI 具身AI
|
|
---------- ------------ ------------
|
|
交互方式 数据输入 主动探索
|
|
|
|
学习方式 从数据学习 从交互学习
|
|
|
|
输出形式 预测/生成 行动/操作
|
|
------------------------------------
|
|
|
|
# 数字孪生
|
|
|
|
## 概念
|
|
|
|
`物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制`
|
|
|
|
## 应用层次
|
|
|
|
--------------------------------
|
|
层次 内容 应用
|
|
---------- ---------- ----------
|
|
几何孪生 三维模型 可视化
|
|
|
|
物理孪生 物理仿真 性能分析
|
|
|
|
行为孪生 行为模拟 场景预测
|
|
|
|
认知孪生 决策支持 智能控制
|
|
--------------------------------
|
|
|
|
# 强化学习基础
|
|
|
|
## 核心要素
|
|
|
|
`┌─────────────────────────────────────┐`\
|
|
`│ │`\
|
|
`│ ``环境`` ← ``状态`` ──────→ Agent │`\
|
|
`│ ↑ │ │`\
|
|
`│ └──── ``奖励`` ←─── ``动作`` ─┘ │`\
|
|
`│ │`\
|
|
`└─────────────────────────────────────┘`
|
|
|
|
## 训练循环
|
|
|
|
1. `观察环境状态`
|
|
|
|
2. `选择行动`
|
|
|
|
3. `执行行动`
|
|
|
|
4. `获得奖励`
|
|
|
|
5. `更新策略`
|
|
|
|
6. `重复``...`
|
|
|
|
## Gymnasium环境
|
|
|
|
`import gymnasium as gym`\
|
|
\
|
|
`env = ``gym.make``("CartPole-v1")`\
|
|
`state, _ = ``env.reset``()`\
|
|
\
|
|
`for _ in range(1000):`\
|
|
` action = policy(state)`\
|
|
` state, reward, done, _, _ = ``env.step``(action)`\
|
|
` if done:`\
|
|
` break`
|
|
|
|
# 具身AI应用场景
|
|
|
|
## 机器人设计
|
|
|
|
`感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整`\
|
|
` ↓`\
|
|
`建筑机器人、施工机器人`
|
|
|
|
## 虚拟角色
|
|
|
|
`游戏``NPC``、虚拟助手、元宇宙居民`\
|
|
` ↓`\
|
|
`自然行为、智能对话`
|
|
|
|
## 仿真训练
|
|
|
|
`虚拟环境`` → ``训练策略`` → ``迁移到真实`\
|
|
` ↓`\
|
|
`降低试错成本`
|
|
|
|
# 虚拟到真实的迁移
|
|
|
|
## 挑战
|
|
|
|
-----------------------------------
|
|
问题 说明
|
|
-------------- --------------------
|
|
Sim2Real Gap 仿真与现实的差异
|
|
|
|
感官差异 虚拟与真实感知不同
|
|
|
|
物理特性 真实物理更复杂
|
|
-----------------------------------
|
|
|
|
## 解决方案
|
|
|
|
1. 域随机化 (Domain Randomization)
|
|
|
|
真实数据混合
|
|
|
|
在线微调
|
|
|
|
# 思考与练习
|
|
|
|
1. 具身智能在规划设计中有哪些应用前景?
|
|
|
|
2. 数字孪生如何辅助设计决策?
|
|
|
|
3. Sim2Real迁移的主要挑战是什么?
|
|
|
|
# 关键术语
|
|
|
|
--------------------------------------------------
|
|
中文 英文 说明
|
|
---------- -------------- ------------------------
|
|
具身智能 Embodied AI 有身体形式的AI
|
|
|
|
数字孪生 Digital Twin 物理世界的数字映射
|
|
|
|
强化学习 RL Reinforcement Learning
|
|
|
|
状态 State 环境的当前情况
|
|
|
|
动作 Action Agent对环境的影响
|
|
--------------------------------------------------
|
|
|
|
# 延伸阅读
|
|
|
|
1. [Gymnasium文档](https://gymnasium.org.cn/)
|
|
|
|
[DeepMind's Embodied AI Research](https://www.deepmind.com/research/embodied) \# 05.3 规划设计应用与MCP
|
|
|
|
---
|
|
|
|
# 学习目标
|
|
|
|
3. 理解MCP协议的核心思想
|
|
|
|
掌握HITL协作模式
|
|
|
|
了解Agent在规划设计中的落地场景
|
|
|
|
# MCP协议
|
|
|
|
## 什么是MCP
|
|
|
|
**Model Context Protocol (模型上下文协议)**:连接AI模型与外部数据/工具的开放标准。
|
|
|
|
## 核心价值
|
|
|
|
`传统方式:`\
|
|
` AI``模型`` → ``各自独立`` → ``数据孤岛`\
|
|
\
|
|
`MCP``方式:`\
|
|
` AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据`
|
|
|
|
MCP架构
|
|
|
|
`┌─────────────────────────────────────┐`\
|
|
`│ AI Application │`\
|
|
`│ (Claude, ``ChatGPT``, ``等``) │`\
|
|
`└─────────────┬───────────────────────┘`\
|
|
` │ MCP`\
|
|
`┌─────────────┴───────────────────────┐`\
|
|
`│ MCP Client │`\
|
|
`├─────────────────────────────────────┤`\
|
|
`│ ┌──────┐ ┌──────┐ ┌──────┐ │`\
|
|
`│ │File │ │DB │ │API │ ... │`\
|
|
`│ │``Server│ │Server│ │Server│ │`\
|
|
`│ └──────┘ └──────┘ └──────┘ │`\
|
|
`└─────────────────────────────────────┘`
|
|
|
|
# HITL:人机协作模式
|
|
|
|
## 什么是HITL
|
|
|
|
**Human-in-the-Loop (人在回路)**:在AI决策关键环节引入人类干预。
|
|
|
|
## HITL层次
|
|
|
|
----------------------------------
|
|
层次 人类角色 自动化程度
|
|
---------- ---------- ------------
|
|
完全自动 无 100%
|
|
|
|
人工审核 监督者 80-90%
|
|
|
|
交互决策 合作伙伴 50-70%
|
|
|
|
人工主导 操作者 \<50%
|
|
----------------------------------
|
|
|
|
## 规划设计中的HITL
|
|
|
|
`AI``生成方案`\
|
|
` ↓`\
|
|
`设计师审核`` ← ``修改意见`` → AI``调整`\
|
|
` ↓`\
|
|
`最终确认`
|
|
|
|
# 规划设计Agent案例
|
|
|
|
## 场景分析Agent
|
|
|
|
`输入:场地数据`
|
|
|
|
`↓`
|
|
|
|
`分析流程:`
|
|
|
|
1. `地形分析`` (``坡度、高程``)`
|
|
|
|
2. `气候分析`` (``日照、风向``)`
|
|
|
|
3. `交通分析`` (``可达性``)`
|
|
|
|
4. `视觉分析`` (``视域、景观``)`
|
|
|
|
`↓`
|
|
|
|
`输出:场地分析报告`
|
|
|
|
## 方案生成Agent
|
|
|
|
`输入:设计要求`` + ``场地分析`
|
|
|
|
`↓`
|
|
|
|
`生成流程:`
|
|
|
|
1. `理解需求`` (``CoT``推理``)`
|
|
|
|
2. `布局功能`` (``工具调用``)`
|
|
|
|
3. `连接路径`` (``图算法``)`
|
|
|
|
4. `优化调整`` (``迭代改进``)`
|
|
|
|
`↓`
|
|
|
|
`输出:初步设计方案`
|
|
|
|
## 合规审查Agent
|
|
|
|
`输入:设计方案`
|
|
|
|
`↓`
|
|
|
|
`审查流程:`
|
|
|
|
1. `调用规范库`
|
|
|
|
2. `逐条核对`
|
|
|
|
3. `标记问题`
|
|
|
|
4. `生成报告`
|
|
|
|
`↓`
|
|
|
|
`输出:合规审查意见`
|
|
|
|
# Agent落地挑战
|
|
|
|
技术挑战
|
|
|
|
---------------------------
|
|
挑战 说明
|
|
---------- ----------------
|
|
准确性 复杂任务易出错
|
|
|
|
可解释性 决策过程不透明
|
|
|
|
鲁棒性 边界情况处理
|
|
---------------------------
|
|
|
|
应用挑战
|
|
|
|
-----------------------------
|
|
挑战 说明
|
|
------------ ----------------
|
|
工作流整合 与现有流程融合
|
|
|
|
责任界定 AI错误的后果
|
|
|
|
成本控制 API调用费用
|
|
-----------------------------
|
|
|
|
## 解决方向
|
|
|
|
1. 分级应用:简单任务自动化,复杂任务辅助
|
|
|
|
渐进式:从局部到整体
|
|
|
|
人机协同:关键环节人工确认
|
|
|
|
# 未来展望:AI设计师
|
|
|
|
### 短期 (1-2年)
|
|
|
|
`AI``作为工具`\
|
|
` - ``数据分析`\
|
|
` - ``方案生成`\
|
|
` - ``合规检查`
|
|
|
|
### 中期 (3-5年)
|
|
|
|
`AI``作为助手`\
|
|
` - ``创意启发`\
|
|
` - ``方案优化`\
|
|
` - ``文档撰写`
|
|
|
|
### 长期 (5-10年)
|
|
|
|
`AI``作为合作伙伴`\
|
|
` - ``共同创造`\
|
|
` - ``自主决策`\
|
|
` - ``专业评审`
|
|
|
|
## 思考与练习
|
|
|
|
1. MCP如何解决AI应用的"数据孤岛"问题?
|
|
|
|
2. 规划设计中哪些环节适合引入HITL?
|
|
|
|
3. AI设计师如何与人类设计师协作?
|
|
|
|
## 关键术语
|
|
|
|
----------------------------------------------------------------
|
|
中文 英文 说明
|
|
---------------- ---------------------- ------------------------
|
|
模型上下文协议 MCP Model Context Protocol
|
|
|
|
人在回路 HITL Human-in-the-Loop
|
|
|
|
数据孤岛 Data Silo 独立的数据存储
|
|
|
|
协议 Protocol 通信标准
|
|
|
|
工作流整合 Workflow Integration 融入现有流程
|
|
----------------------------------------------------------------
|
|
|
|
## 延伸阅读
|
|
|
|
1. [MCP官方文档](https://modelcontextprotocol.io/)
|
|
|
|
[Human-in-the-Loop AI](https://arxiv.org/abs/2301.02629)
|