e58b95d227
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件, 按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。 Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
227 lines
7.7 KiB
Markdown
227 lines
7.7 KiB
Markdown
|
||
# 学习目标
|
||
|
||
理解AI范式的三次演进
|
||
|
||
掌握万能逼近定理的直观意义
|
||
|
||
建立神经网络技术栈的完整认知
|
||
|
||
理解Scaling Law与模型规模效应
|
||
|
||
# AI范式的三次演进
|
||
|
||
## 第一范式:规则系统 (Symbolic AI)
|
||
|
||
**时期**:1950s - 1980s
|
||
|
||
**核心思想**:人类专家编写规则
|
||
|
||
**特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱
|
||
|
||
**典型应用**:专家系统、棋类游戏
|
||
|
||
## 第二范式:机器学习 (Machine Learning)
|
||
|
||
**时期**:1990s - 2010s
|
||
|
||
**核心思想**:从数据中学习规律
|
||
|
||
**特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定
|
||
|
||
**典型应用**:推荐系统、图像分类、语音识别
|
||
|
||
## 第三范式:深度学习 (Deep Learning)
|
||
|
||
**时期**:2012 - 至今
|
||
|
||
**核心思想**:端到端学习,自动提取特征
|
||
|
||
**特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强
|
||
|
||
**典型应用**:大语言模型、生成式AI、自动驾驶
|
||
|
||
# 万能逼近定理
|
||
|
||
## 定理表述
|
||
|
||
**Universal Approximation Theorem (1989)**:
|
||
|
||
一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。
|
||
|
||
## 直观理解
|
||
|
||
想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面
|
||
|
||
## 启示
|
||
|
||
这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。
|
||
|
||
这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。
|
||
|
||
# 神经网络技术栈全景
|
||
|
||
`┌─────────────────────────────────────────────────────────────┐`\
|
||
`│ ``应用层`` │`\
|
||
`│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\
|
||
`├─────────────────────────────────────────────────────────────┤`\
|
||
`│ ``模型层`` │`\
|
||
`│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\
|
||
`├─────────────────────────────────────────────────────────────┤`\
|
||
`│ ``算法层`` │`\
|
||
`│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\
|
||
`├─────────────────────────────────────────────────────────────┤`\
|
||
`│ ``数学层`` │`\
|
||
`│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\
|
||
`└─────────────────────────────────────────────────────────────┘`
|
||
|
||
## 技术演进路径
|
||
|
||
------------------------------------------
|
||
时代 代表技术 突破点
|
||
------- ------------- --------------------
|
||
1980s MLP 万能逼近定理
|
||
|
||
1990s CNN 局部连接、权重共享
|
||
|
||
2000s RNN/LSTM 序列建模
|
||
|
||
2010s GNN 图结构数据
|
||
|
||
2017 Transformer Self-Attention
|
||
|
||
2020s Diffusion 生成质量突破
|
||
------------------------------------------
|
||
|
||
## 模型家族关系
|
||
|
||
`MLP (``多层感知机``)`\
|
||
` │`\
|
||
` ┌──────────────┼──────────────┐`\
|
||
` │ │ │`\
|
||
` CNN GNN RNN`\
|
||
` (``空间数据``) (``图数据``) (``序列数据``)`\
|
||
` │ │ │`\
|
||
` └──────────────┼──────────────┘`\
|
||
` │`\
|
||
` Transformer`\
|
||
` │`\
|
||
` ┌──────────────┼──────────────┐`\
|
||
` │ │ │`\
|
||
` GPT``系列`` BERT Diffusion`\
|
||
` (``生成式``) (``理解式``) (``图像生成``)`
|
||
|
||
# Scaling Law:规模即智能
|
||
|
||
## 什么是Scaling Law
|
||
|
||
Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系:
|
||
|
||
**模型性能 ≈ f(计算量, 数据量, 参数量)**
|
||
|
||
## 核心发现
|
||
|
||
### 1.性能随规模对数增长
|
||
|
||
o模型越大,性能越好
|
||
|
||
o增长是可预测的
|
||
|
||
#### 2.计算效率最关键
|
||
|
||
o计算量增加10倍 → 性能提升约1.5倍
|
||
|
||
o数据量和参数量也有类似规律
|
||
|
||
#### 3.没有看到天花板
|
||
|
||
o在现有规模下,性能提升仍在继续
|
||
|
||
### 启示
|
||
|
||
**大模型时代**:规模成为竞争壁垒
|
||
|
||
**数据为王**:高质量数据比模型架构更重要
|
||
|
||
**算力需求**:AI发展依赖硬件进步
|
||
|
||
从函数式视角看AI演进
|
||
|
||
### 核心理念
|
||
|
||
**"Functions Describe the World"(函数描述世界)**
|
||
|
||
物理定律:F = ma
|
||
|
||
经济规律:Supply = Demand(Price)
|
||
|
||
神经网络:y = f(x; θ)
|
||
|
||
### AI即函数组合
|
||
|
||
`输入数据`` x`\
|
||
` │`\
|
||
` ▼`\
|
||
`┌─────────┐`\
|
||
`│ f₁(x) │ ``第一层函数:特征提取`\
|
||
`└─────────┘`\
|
||
` │`\
|
||
` ▼`\
|
||
`┌─────────┐`\
|
||
`│ f₂(h) │ ``第二层函数:模式识别`\
|
||
`└─────────┘`\
|
||
` │`\
|
||
` ▼`\
|
||
`┌─────────┐`\
|
||
`│ f₃(z) │ ``第三层函数:决策输出`\
|
||
`└─────────┘`\
|
||
` │`\
|
||
` ▼`\
|
||
`输出`` y`
|
||
|
||
从Excel到神经网络
|
||
|
||
------------------------------------
|
||
Excel 神经网络
|
||
--------------------- --------------
|
||
y = ax + b 单层感知机
|
||
|
||
y = a₁x₁ + a₂x₂ + b 多输入神经元
|
||
|
||
嵌套IF函数 多层网络
|
||
|
||
宏函数 自动微分
|
||
------------------------------------
|
||
|
||
## 思考与练习
|
||
|
||
1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么?
|
||
|
||
2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡?
|
||
|
||
3.从函数式视角理解AI,对你理解设计问题有何启发?
|
||
|
||
## 关键术语
|
||
|
||
-------------------------------------------------------------------------------------
|
||
中文 英文 说明
|
||
---------------------- --------------------------------- ----------------------------
|
||
万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证
|
||
|
||
缩放定律 Scaling Law 模型性能与规模的关系
|
||
|
||
前馈网络 Feed-Forward Network 信息单向传播的神经网络
|
||
|
||
多层感知机 MLP Multi-Layer Perceptron
|
||
|
||
端到端学习 End-to-End Learning 从输入直接学习到输出
|
||
-------------------------------------------------------------------------------------
|
||
|
||
## 延伸阅读
|
||
|
||
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)
|
||
|
||
[Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem)
|
||
|
||
[The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x)
|