Files
2026_DesignAI/04-transformer/03.3-llm-application.md
T
pengxiao e58b95d227 初始化:从 docx 拆分为独立 Markdown 章节
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件,
按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-04-25 10:32:58 +08:00

4.1 KiB
Raw Blame History

学习目标

  1. 理解从Transformer到ChatGPT的演进

    掌握RAG、RLHF等关键技术

    了解Prompt工程在设计中的应用

从Transformer到ChatGPT

GPT系列演进


模型 发布时间 参数量 特点


GPT-1 2018 117M 验证Decoder-only可行性

GPT-2 2019 1.5B 展示零样本能力

GPT-3 2020 175B 少样本学习震撼业界

ChatGPT 2022 ~ 对话能力达到新高度

GPT-4 2023 ~ 多模态能力

训练范式

预训练`` (Pre-training)``
``大规模文本`` → ``无监督学习`` → ``语言模型

微调`` (Fine-tuning)``
``特定任务`` → ``有监督学习`` → ``任务模型

RAG:检索增强生成

核心思想

用户提问 → 检索相关文档 → LLM生成答案
                ↑
           外部知识库

RAG架构

文档索引

文档`` → ``切分`` → Embedding → ``向量数据库

2. ``检索阶段

问题 → Embedding → 相似度搜索 → 相关文档

3. ``生成阶段

    问题 + 相关文档 → LLM → 答案

RAG优势


特点 说明


减少幻觉 基于检索的事实

可更新 更新知识库即可

可解释 显示参考来源

RLHF:人类反馈强化学习

为什么需要RLHF

预训练模型可能: - 生成有害内容 - 不符合人类偏好 - 产生无意义输出

RLHF三阶段

有监督微调 (SFT)

人工标注对话`` → ``微调模型

2. ``奖励模型`` (RM)

多个输出 → 人类排序 → 训练奖励模型

3. ``强化学习`` (RL)

    PPO算法 → 优化策略

效果

  1. 输出更符合人类偏好

    减少有害内容

    提高回答质量

Prompt工程

Prompt设计原则

明确任务

好:请总结以下文本的主要观点
差:看看这段文字

提供示例

任务:情感分类
示例:
"``这部电影太棒了!``" → ``正面
"``服务态度很差。``" → ``负面
现在分类:``"..."

指定格式

请按以下格式输出:
- ``观点``1````...
- ``观点``2````...
- ``结论:``...

设计领域应用


任务 Prompt示例


方案生成 "设计一个50人的办公空间,要求开放式布局"

代码生成 "写一个Python脚本计算建筑容积率"

文档撰写 "帮我写一份景观设计说明书的框架"

思考与练习

  1. RAG和微调(Fine-tuning)各适用于什么场景?

  2. 如何评估LLM输出的质量?

  3. Prompt工程在设计工作流中能解决什么问题?

关键术语


中文 英文 说明


检索增强生成 RAG Retrieval-Augmented Generation

人类反馈强化学习 RLHF Reinforcement Learning from Human Feedback

提示工程 Prompt Engineering 设计输入以引导模型输出

向量数据库 Vector Database 存储和检索向量表示

幻觉 Hallucination 模型编造错误信息

延伸阅读

  1. Language Models are Few-Shot Learners (GPT-3)

    Training Language Models to Follow Instructions with Human Feedback

    LangChain RAG教程