e58b95d227
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件, 按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
167 lines
4.1 KiB
Markdown
167 lines
4.1 KiB
Markdown
|
||
## 学习目标
|
||
|
||
3. 理解从Transformer到ChatGPT的演进
|
||
|
||
掌握RAG、RLHF等关键技术
|
||
|
||
了解Prompt工程在设计中的应用
|
||
|
||
## 从Transformer到ChatGPT
|
||
|
||
### GPT系列演进
|
||
|
||
------------------------------------------------------
|
||
模型 发布时间 参数量 特点
|
||
--------- ---------- -------- ------------------------
|
||
GPT-1 2018 117M 验证Decoder-only可行性
|
||
|
||
GPT-2 2019 1.5B 展示零样本能力
|
||
|
||
GPT-3 2020 175B 少样本学习震撼业界
|
||
|
||
ChatGPT 2022 \~ 对话能力达到新高度
|
||
|
||
GPT-4 2023 \~ 多模态能力
|
||
------------------------------------------------------
|
||
|
||
### 训练范式
|
||
|
||
`预训练`` (Pre-training)``:`\
|
||
` ``大规模文本`` → ``无监督学习`` → ``语言模型`\
|
||
\
|
||
`微调`` (Fine-tuning)``:`\
|
||
` ``特定任务`` → ``有监督学习`` → ``任务模型`
|
||
|
||
## RAG:检索增强生成
|
||
|
||
### 核心思想 {#核心思想-2}
|
||
|
||
用户提问 → 检索相关文档 → LLM生成答案
|
||
↑
|
||
外部知识库
|
||
|
||
### RAG架构
|
||
|
||
#### 文档索引
|
||
|
||
`文档`` → ``切分`` → Embedding → ``向量数据库`
|
||
|
||
####
|
||
|
||
`2. ``检索阶段`
|
||
|
||
#### 问题 → Embedding → 相似度搜索 → 相关文档
|
||
|
||
`3. ``生成阶段`
|
||
|
||
问题 + 相关文档 → LLM → 答案
|
||
|
||
### RAG优势
|
||
|
||
---------------------------
|
||
特点 说明
|
||
---------- ----------------
|
||
减少幻觉 基于检索的事实
|
||
|
||
可更新 更新知识库即可
|
||
|
||
可解释 显示参考来源
|
||
---------------------------
|
||
|
||
## RLHF:人类反馈强化学习
|
||
|
||
### 为什么需要RLHF
|
||
|
||
预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出
|
||
|
||
### RLHF三阶段
|
||
|
||
#### 有监督微调 (SFT)
|
||
|
||
`人工标注对话`` → ``微调模型`
|
||
|
||
`2. ``奖励模型`` (RM)`
|
||
|
||
#### 多个输出 → 人类排序 → 训练奖励模型
|
||
|
||
`3. ``强化学习`` (RL)`
|
||
|
||
PPO算法 → 优化策略
|
||
|
||
### 效果
|
||
|
||
1. 输出更符合人类偏好
|
||
|
||
减少有害内容
|
||
|
||
提高回答质量
|
||
|
||
## Prompt工程
|
||
|
||
### Prompt设计原则
|
||
|
||
#### 明确任务
|
||
|
||
`好:请总结以下文本的主要观点`\
|
||
`差:看看这段文字`
|
||
|
||
#### 提供示例
|
||
|
||
`任务:情感分类`\
|
||
`示例:`\
|
||
`"``这部电影太棒了!``" → ``正面`\
|
||
`"``服务态度很差。``" → ``负面`\
|
||
`现在分类:``"..."`
|
||
|
||
### 指定格式
|
||
|
||
`请按以下格式输出:`\
|
||
`- ``观点``1``:``...`\
|
||
`- ``观点``2``:``...`\
|
||
`- ``结论:``...`
|
||
|
||
## 设计领域应用
|
||
|
||
-------------------------------------------------------
|
||
任务 Prompt示例
|
||
---------- --------------------------------------------
|
||
方案生成 "设计一个50人的办公空间,要求开放式布局"
|
||
|
||
代码生成 "写一个Python脚本计算建筑容积率"
|
||
|
||
文档撰写 "帮我写一份景观设计说明书的框架"
|
||
-------------------------------------------------------
|
||
|
||
## 思考与练习
|
||
|
||
1. RAG和微调(Fine-tuning)各适用于什么场景?
|
||
|
||
2. 如何评估LLM输出的质量?
|
||
|
||
3. Prompt工程在设计工作流中能解决什么问题?
|
||
|
||
## 关键术语
|
||
|
||
------------------------------------------------------------------------------------
|
||
中文 英文 说明
|
||
------------------ -------------------- --------------------------------------------
|
||
检索增强生成 RAG Retrieval-Augmented Generation
|
||
|
||
人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback
|
||
|
||
提示工程 Prompt Engineering 设计输入以引导模型输出
|
||
|
||
向量数据库 Vector Database 存储和检索向量表示
|
||
|
||
幻觉 Hallucination 模型编造错误信息
|
||
------------------------------------------------------------------------------------
|
||
|
||
## 延伸阅读
|
||
|
||
1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165)
|
||
|
||
[Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155)
|
||
|
||
[LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/)
|