## 学习目标 3. 理解从Transformer到ChatGPT的演进 掌握RAG、RLHF等关键技术 了解Prompt工程在设计中的应用 ## 从Transformer到ChatGPT ### GPT系列演进 ------------------------------------------------------ 模型 发布时间 参数量 特点 --------- ---------- -------- ------------------------ GPT-1 2018 117M 验证Decoder-only可行性 GPT-2 2019 1.5B 展示零样本能力 GPT-3 2020 175B 少样本学习震撼业界 ChatGPT 2022 \~ 对话能力达到新高度 GPT-4 2023 \~ 多模态能力 ------------------------------------------------------ ### 训练范式 `预训练`` (Pre-training)``:`\ ` ``大规模文本`` → ``无监督学习`` → ``语言模型`\ \ `微调`` (Fine-tuning)``:`\ ` ``特定任务`` → ``有监督学习`` → ``任务模型` ## RAG:检索增强生成 ### 核心思想 {#核心思想-2} 用户提问 → 检索相关文档 → LLM生成答案 ↑ 外部知识库 ### RAG架构 #### 文档索引 `文档`` → ``切分`` → Embedding → ``向量数据库` #### `2. ``检索阶段` #### 问题 → Embedding → 相似度搜索 → 相关文档 `3. ``生成阶段` 问题 + 相关文档 → LLM → 答案 ### RAG优势 --------------------------- 特点 说明 ---------- ---------------- 减少幻觉 基于检索的事实 可更新 更新知识库即可 可解释 显示参考来源 --------------------------- ## RLHF:人类反馈强化学习 ### 为什么需要RLHF 预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出 ### RLHF三阶段 #### 有监督微调 (SFT) `人工标注对话`` → ``微调模型` `2. ``奖励模型`` (RM)` #### 多个输出 → 人类排序 → 训练奖励模型 `3. ``强化学习`` (RL)` PPO算法 → 优化策略 ### 效果 1. 输出更符合人类偏好 减少有害内容 提高回答质量 ## Prompt工程 ### Prompt设计原则 #### 明确任务 `好:请总结以下文本的主要观点`\ `差:看看这段文字` #### 提供示例 `任务:情感分类`\ `示例:`\ `"``这部电影太棒了!``" → ``正面`\ `"``服务态度很差。``" → ``负面`\ `现在分类:``"..."` ### 指定格式 `请按以下格式输出:`\ `- ``观点``1``:``...`\ `- ``观点``2``:``...`\ `- ``结论:``...` ## 设计领域应用 ------------------------------------------------------- 任务 Prompt示例 ---------- -------------------------------------------- 方案生成 "设计一个50人的办公空间,要求开放式布局" 代码生成 "写一个Python脚本计算建筑容积率" 文档撰写 "帮我写一份景观设计说明书的框架" ------------------------------------------------------- ## 思考与练习 1. RAG和微调(Fine-tuning)各适用于什么场景? 2. 如何评估LLM输出的质量? 3. Prompt工程在设计工作流中能解决什么问题? ## 关键术语 ------------------------------------------------------------------------------------ 中文 英文 说明 ------------------ -------------------- -------------------------------------------- 检索增强生成 RAG Retrieval-Augmented Generation 人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback 提示工程 Prompt Engineering 设计输入以引导模型输出 向量数据库 Vector Database 存储和检索向量表示 幻觉 Hallucination 模型编造错误信息 ------------------------------------------------------------------------------------ ## 延伸阅读 1. [Language Models are Few-Shot Learners (GPT-3)](https://arxiv.org/abs/2005.14165) [Training Language Models to Follow Instructions with Human Feedback](https://arxiv.org/abs/2203.02155) [LangChain RAG教程](https://python.langchain.com/docs/tutorials/rag/)