# 学习目标 理解AI范式的三次演进 掌握万能逼近定理的直观意义 建立神经网络技术栈的完整认知 理解Scaling Law与模型规模效应 # AI范式的三次演进 ## 第一范式:规则系统 (Symbolic AI) **时期**:1950s - 1980s **核心思想**:人类专家编写规则 **特点**: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱 **典型应用**:专家系统、棋类游戏 ## 第二范式:机器学习 (Machine Learning) **时期**:1990s - 2010s **核心思想**:从数据中学习规律 **特点**: - 数据驱动 - 特征工程依赖专家经验 - 任务特定 **典型应用**:推荐系统、图像分类、语音识别 ## 第三范式:深度学习 (Deep Learning) **时期**:2012 - 至今 **核心思想**:端到端学习,自动提取特征 **特点**: - 大数据驱动 - 自动特征学习 - 迁移学习能力强 **典型应用**:大语言模型、生成式AI、自动驾驶 # 万能逼近定理 ## 定理表述 **Universal Approximation Theorem (1989)**: 一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。 ## 直观理解 想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面 ## 启示 这个定理告诉我们:**神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系**。 这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。 # 神经网络技术栈全景 `┌─────────────────────────────────────────────────────────────┐`\ `│ ``应用层`` │`\ `│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │`\ `├─────────────────────────────────────────────────────────────┤`\ `│ ``模型层`` │`\ `│ Diffusion │ Transformer │ GNN │ CNN │ MLP │`\ `├─────────────────────────────────────────────────────────────┤`\ `│ ``算法层`` │`\ `│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │`\ `├─────────────────────────────────────────────────────────────┤`\ `│ ``数学层`` │`\ `│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │`\ `└─────────────────────────────────────────────────────────────┘` ## 技术演进路径 ------------------------------------------ 时代 代表技术 突破点 ------- ------------- -------------------- 1980s MLP 万能逼近定理 1990s CNN 局部连接、权重共享 2000s RNN/LSTM 序列建模 2010s GNN 图结构数据 2017 Transformer Self-Attention 2020s Diffusion 生成质量突破 ------------------------------------------ ## 模型家族关系 `MLP (``多层感知机``)`\ ` │`\ ` ┌──────────────┼──────────────┐`\ ` │ │ │`\ ` CNN GNN RNN`\ ` (``空间数据``) (``图数据``) (``序列数据``)`\ ` │ │ │`\ ` └──────────────┼──────────────┘`\ ` │`\ ` Transformer`\ ` │`\ ` ┌──────────────┼──────────────┐`\ ` │ │ │`\ ` GPT``系列`` BERT Diffusion`\ ` (``生成式``) (``理解式``) (``图像生成``)` # Scaling Law:规模即智能 ## 什么是Scaling Law Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系: **模型性能 ≈ f(计算量, 数据量, 参数量)** ## 核心发现 ### 1.性能随规模对数增长 o模型越大,性能越好 o增长是可预测的 #### 2.计算效率最关键 o计算量增加10倍 → 性能提升约1.5倍 o数据量和参数量也有类似规律 #### 3.没有看到天花板 o在现有规模下,性能提升仍在继续 ### 启示 **大模型时代**:规模成为竞争壁垒 **数据为王**:高质量数据比模型架构更重要 **算力需求**:AI发展依赖硬件进步 从函数式视角看AI演进 ### 核心理念 **"Functions Describe the World"(函数描述世界)** 物理定律:F = ma 经济规律:Supply = Demand(Price) 神经网络:y = f(x; θ) ### AI即函数组合 `输入数据`` x`\ ` │`\ ` ▼`\ `┌─────────┐`\ `│ f₁(x) │ ``第一层函数:特征提取`\ `└─────────┘`\ ` │`\ ` ▼`\ `┌─────────┐`\ `│ f₂(h) │ ``第二层函数:模式识别`\ `└─────────┘`\ ` │`\ ` ▼`\ `┌─────────┐`\ `│ f₃(z) │ ``第三层函数:决策输出`\ `└─────────┘`\ ` │`\ ` ▼`\ `输出`` y` 从Excel到神经网络 ------------------------------------ Excel 神经网络 --------------------- -------------- y = ax + b 单层感知机 y = a₁x₁ + a₂x₂ + b 多输入神经元 嵌套IF函数 多层网络 宏函数 自动微分 ------------------------------------ ## 思考与练习 1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么? 2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡? 3.从函数式视角理解AI,对你理解设计问题有何启发? ## 关键术语 ------------------------------------------------------------------------------------- 中文 英文 说明 ---------------------- --------------------------------- ---------------------------- 万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证 缩放定律 Scaling Law 模型性能与规模的关系 前馈网络 Feed-Forward Network 信息单向传播的神经网络 多层感知机 MLP Multi-Layer Perceptron 端到端学习 End-to-End Learning 从输入直接学习到输出 ------------------------------------------------------------------------------------- ## 延伸阅读 [Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) [Universal Approximation Theorem](https://en.wikipedia.org/wiki/Universal_approximation_theorem) [The Evolution of AI: A Historical Perspective](https://www.nature.com/articles/s41586-023-06221-x)