将 11 个目录下的 26 个子章节文件合并到对应的父文件中, 用 --- 分隔各子章节,移除冗余的章节目录索引。 每个篇章现在是独立的单文件,结构更简洁。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
13 KiB
第六篇:AI Agent与自主设计
本篇探讨AI Agent的架构和具身智能,展望AI在规划设计中的应用前景。
篇章导读
AI Agent代表了人工智能的下一个前沿:从"被动响应"到"主动行动",从"单一能力"到"系统协同"。
本篇将系统介绍Agent架构和在设计领域的应用。
学习目标
-
理解从规则到LLM-based Agent的演进
掌握Agent的核心组件
了解ReAct和CoT推理模式
从规则到LLM Agent
规则系统时代
if`` ``condition_A``:
``action_``B``(``)
elif`` ``condition_C``:
``action_D``()
else``:
``action_E``()
局限:规则难以穷举,无法应对新情况
LLM-based Agent
用户请求`` → LLM``理解`` → ``规划`` → ``调用工具`` → ``反思`` → ``输出
优势: - 自然语言交互 - 上下文理解 - 泛化能力强
Agent核心组件
感知 (Perception)
输入信息`` → ``理解与解析
- ``用户指令
- ``环境状态
- ``工具反馈
规划 (Planning)
目标`` → ``分解为子任务
- ``任务分析
- ``步骤规划
- ``依赖管理
记忆 (Memory)
┌─────────────────────────────┐
│ ``短期记忆`` (Short-term) │
│ ``对话上下文、临时状态`` │
├─────────────────────────────┤
│ ``长期记忆`` (Long-term) │
│ ``知识库、经验积累`` │
└─────────────────────────────┘
工具调用 (Tool Use)
可用工具集:
- ``数据库查询
- API``调用
- ``文件操作
- ``代码执行
...
推理模式
Chain of Thought (CoT)
问题`` → ``思考链`` → ``答案
"``设计一个公园``"
↓
-
分析场地条件 -
2. ``确定功能分区 -
3. ``布局路径系统
4. ``选择植物配置
↓
完整方案
ReAct (Reasoning + Acting)
循环:思考`` → ``行动`` → ``观察`` → ``思考`` ...
思考:需要查询场地数据
行动:调用``GIS``工具
观察:获取到高程信息
思考:基于高程做排水设计
行动:生成排水方案
...
Agent架构示例
单Agent架构
┌─────────────────────────────┐
│ LLM Core │
│ (``规划、推理、决策``) │
├─────────────────────────────┤
│ ┌───┐ ┌───┐ ┌───┐ ┌───┐ │
│ │``感知``││``记忆``││``工具``││``反思``│ │
│ └───┘ └───┘ └───┘ └───┘ │
└─────────────────────────────┘
↓
``执行任务
多Agent协作
┌─────────┐ ┌─────────┐ ┌─────────┐
│ ``规划``Agent│→│``分析``Agent│→│``设计``Agent│
└─────────┘ └─────────┘ └─────────┘
↓ ↓ ↓
``任务分解`` ``数据分析`` ``方案生成
思考与练习
-
单Agent和多Agent系统各有什么优势?
-
如何设计Agent的记忆系统?
-
CoT和ReAct各适用于什么场景?
关键术语
中文 英文 说明
思考链 CoT Chain of Thought
推理行动 ReAct Reasoning + Acting
记忆 Memory 存储和检索信息
反思 Reflection 自我评估与改进
工具使用 Tool Use 调用外部能力
延伸阅读
学习目标
-
理解具身智能的概念和特点
了解数字孪生与物理世界的交互
掌握强化学习在具身AI中的应用
什么是具身智能
定义
具身智能 (Embodied AI):具有物理实体或虚拟身体的智能系统,能够通过与环境的交互来学习和完成任务。
与传统AI的区别
特性 传统AI 具身AI
交互方式 数据输入 主动探索
学习方式 从数据学习 从交互学习
输出形式 预测/生成 行动/操作
数字孪生
概念
物理世界`` → ``数字映射`` → ``仿真预测`` → ``反向控制
应用层次
层次 内容 应用
几何孪生 三维模型 可视化
物理孪生 物理仿真 性能分析
行为孪生 行为模拟 场景预测
认知孪生 决策支持 智能控制
强化学习基础
核心要素
┌─────────────────────────────────────┐
│ │
│ ``环境`` ← ``状态`` ──────→ Agent │
│ ↑ │ │
│ └──── ``奖励`` ←─── ``动作`` ─┘ │
│ │
└─────────────────────────────────────┘
训练循环
-
观察环境状态 -
选择行动 -
执行行动 -
获得奖励 -
更新策略 -
重复``...
Gymnasium环境
import gymnasium as gym
env = ``gym.make``("CartPole-v1")
state, _ = ``env.reset``()
for _ in range(1000):
action = policy(state)
state, reward, done, _, _ = ``env.step``(action)
if done:
break
具身AI应用场景
机器人设计
感知环境`` → ``规划路径`` → ``执行动作`` → ``反馈调整
↓
建筑机器人、施工机器人
虚拟角色
游戏``NPC``、虚拟助手、元宇宙居民
↓
自然行为、智能对话
仿真训练
虚拟环境`` → ``训练策略`` → ``迁移到真实
↓
降低试错成本
虚拟到真实的迁移
挑战
问题 说明
Sim2Real Gap 仿真与现实的差异
感官差异 虚拟与真实感知不同
物理特性 真实物理更复杂
解决方案
-
域随机化 (Domain Randomization)
真实数据混合
在线微调
思考与练习
-
具身智能在规划设计中有哪些应用前景?
-
数字孪生如何辅助设计决策?
-
Sim2Real迁移的主要挑战是什么?
关键术语
中文 英文 说明
具身智能 Embodied AI 有身体形式的AI
数字孪生 Digital Twin 物理世界的数字映射
强化学习 RL Reinforcement Learning
状态 State 环境的当前情况
动作 Action Agent对环境的影响
延伸阅读
-
DeepMind's Embodied AI Research # 05.3 规划设计应用与MCP
学习目标
-
理解MCP协议的核心思想
掌握HITL协作模式
了解Agent在规划设计中的落地场景
MCP协议
什么是MCP
Model Context Protocol (模型上下文协议):连接AI模型与外部数据/工具的开放标准。
核心价值
传统方式:
AI``模型`` → ``各自独立`` → ``数据孤岛
MCP``方式:
AI``模型`` ← MCP → ``统一接口`` → ``所有工具``/``数据
MCP架构
┌─────────────────────────────────────┐
│ AI Application │
│ (Claude, ``ChatGPT``, ``等``) │
└─────────────┬───────────────────────┘
│ MCP
┌─────────────┴───────────────────────┐
│ MCP Client │
├─────────────────────────────────────┤
│ ┌──────┐ ┌──────┐ ┌──────┐ │
│ │File │ │DB │ │API │ ... │
│ │``Server│ │Server│ │Server│ │
│ └──────┘ └──────┘ └──────┘ │
└─────────────────────────────────────┘
HITL:人机协作模式
什么是HITL
Human-in-the-Loop (人在回路):在AI决策关键环节引入人类干预。
HITL层次
层次 人类角色 自动化程度
完全自动 无 100%
人工审核 监督者 80-90%
交互决策 合作伙伴 50-70%
人工主导 操作者 <50%
规划设计中的HITL
AI``生成方案
↓
设计师审核`` ← ``修改意见`` → AI``调整
↓
最终确认
规划设计Agent案例
场景分析Agent
输入:场地数据
↓
分析流程:
-
地形分析`` (``坡度、高程``) -
气候分析`` (``日照、风向``) -
交通分析`` (``可达性``) -
视觉分析`` (``视域、景观``)
↓
输出:场地分析报告
方案生成Agent
输入:设计要求`` + ``场地分析
↓
生成流程:
-
理解需求`` (``CoT``推理``) -
布局功能`` (``工具调用``) -
连接路径`` (``图算法``) -
优化调整`` (``迭代改进``)
↓
输出:初步设计方案
合规审查Agent
输入:设计方案
↓
审查流程:
-
调用规范库 -
逐条核对 -
标记问题 -
生成报告
↓
输出:合规审查意见
Agent落地挑战
技术挑战
挑战 说明
准确性 复杂任务易出错
可解释性 决策过程不透明
鲁棒性 边界情况处理
应用挑战
挑战 说明
工作流整合 与现有流程融合
责任界定 AI错误的后果
成本控制 API调用费用
解决方向
-
分级应用:简单任务自动化,复杂任务辅助
渐进式:从局部到整体
人机协同:关键环节人工确认
未来展望:AI设计师
短期 (1-2年)
AI``作为工具
- ``数据分析
- ``方案生成
- ``合规检查
中期 (3-5年)
AI``作为助手
- ``创意启发
- ``方案优化
- ``文档撰写
长期 (5-10年)
AI``作为合作伙伴
- ``共同创造
- ``自主决策
- ``专业评审
思考与练习
-
MCP如何解决AI应用的"数据孤岛"问题?
-
规划设计中哪些环节适合引入HITL?
-
AI设计师如何与人类设计师协作?
关键术语
中文 英文 说明
模型上下文协议 MCP Model Context Protocol
人在回路 HITL Human-in-the-Loop
数据孤岛 Data Silo 独立的数据存储
协议 Protocol 通信标准