Files
2026_DesignAI/01-introduction/00.2-ai-paradigm.md
T
pengxiao e58b95d227 初始化:从 docx 拆分为独立 Markdown 章节
将《设计人工智能:基础与应用》拆分为 38 个 Markdown 文件,
按 11 个部分(上篇6部分+下篇5部分)+ 3 个附录组织。

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-04-25 10:32:58 +08:00

7.7 KiB
Raw Blame History

学习目标

理解AI范式的三次演进

掌握万能逼近定理的直观意义

建立神经网络技术栈的完整认知

理解Scaling Law与模型规模效应

AI范式的三次演进

第一范式:规则系统 (Symbolic AI)

时期1950s - 1980s

核心思想:人类专家编写规则

特点: - 逻辑推理清晰 - 知识表达明确 - 泛化能力弱

典型应用:专家系统、棋类游戏

第二范式:机器学习 (Machine Learning)

时期1990s - 2010s

核心思想:从数据中学习规律

特点: - 数据驱动 - 特征工程依赖专家经验 - 任务特定

典型应用:推荐系统、图像分类、语音识别

第三范式:深度学习 (Deep Learning)

时期2012 - 至今

核心思想:端到端学习,自动提取特征

特点: - 大数据驱动 - 自动特征学习 - 迁移学习能力强

典型应用:大语言模型、生成式AI、自动驾驶

万能逼近定理

定理表述

Universal Approximation Theorem (1989)

一个具有足够多神经元的单隐藏层前馈神经网络,可以以任意精度逼近任何连续函数。

直观理解

想象一张橡皮膜: - 输入空间是平面上的点 - 神经网络调整膜的形状 - 神经元越多,膜的形变能力越强 - 最终可以拟合任意复杂的曲面

启示

这个定理告诉我们:神经网络具有强大的表达能力,理论上可以学习任何复杂的映射关系

这也是深度学习能够处理图像、语言、语音等复杂任务的数学基础。

神经网络技术栈全景

┌─────────────────────────────────────────────────────────────┐
│ ``应用层`` │
│ AIGC │ Agent │ AI4S │ AIED │ ``空间智能`` │
├─────────────────────────────────────────────────────────────┤
│ ``模型层`` │
│ Diffusion │ Transformer │ GNN │ CNN │ MLP │
├─────────────────────────────────────────────────────────────┤
│ ``算法层`` │
│ ``反向传播`` │ ``注意力机制`` │ ``卷积`` │ ``池化`` │ ``激活函数`` │
├─────────────────────────────────────────────────────────────┤
│ ``数学层`` │
│ ``微积分`` │ ``线性代数`` │ ``概率论`` │ ``优化理论`` │
└─────────────────────────────────────────────────────────────┘

技术演进路径


时代 代表技术 突破点


1980s MLP 万能逼近定理

1990s CNN 局部连接、权重共享

2000s RNN/LSTM 序列建模

2010s GNN 图结构数据

2017 Transformer Self-Attention

2020s Diffusion 生成质量突破

模型家族关系

MLP (``多层感知机``)

┌──────────────┼──────────────┐
│ │ │
CNN GNN RNN
(``空间数据``) (``图数据``) (``序列数据``)
│ │ │
└──────────────┼──────────────┘

Transformer

┌──────────────┼──────────────┐
│ │ │
GPT``系列`` BERT Diffusion
(``生成式``) (``理解式``) (``图像生成``)

Scaling Law:规模即智能

什么是Scaling Law

Scaling Law(缩放定律)描述了模型性能与计算量、数据量、参数量之间的关系:

模型性能 ≈ f(计算量, 数据量, 参数量)

核心发现

1.性能随规模对数增长

o模型越大,性能越好

o增长是可预测的

2.计算效率最关键

o计算量增加10倍 → 性能提升约1.5倍

o数据量和参数量也有类似规律

3.没有看到天花板

o在现有规模下,性能提升仍在继续

启示

大模型时代:规模成为竞争壁垒

数据为王:高质量数据比模型架构更重要

算力需求AI发展依赖硬件进步

从函数式视角看AI演进

核心理念

"Functions Describe the World"(函数描述世界)

物理定律:F = ma

经济规律:Supply = Demand(Price)

神经网络:y = f(x; θ)

AI即函数组合

输入数据`` x


┌─────────┐
│ f₁(x) │ ``第一层函数:特征提取
└─────────┘


┌─────────┐
│ f₂(h) │ ``第二层函数:模式识别
└─────────┘


┌─────────┐
│ f₃(z) │ ``第三层函数:决策输出
└─────────┘


输出`` y

从Excel到神经网络


Excel 神经网络


y = ax + b 单层感知机

y = a₁x₁ + a₂x₂ + b 多输入神经元

嵌套IF函数 多层网络

宏函数 自动微分

思考与练习

1.万能逼近定理告诉我们神经网络"能"做任何事,但没有说"如何"高效学习。这个区别意味着什么?

2.Scaling Law是否意味着"越大越好"?在资源有限的情况下,应该如何权衡?

3.从函数式视角理解AI,对你理解设计问题有何启发?

关键术语


中文 英文 说明


万能逼近定理 Universal Approximation Theorem 神经网络表达能力的理论保证

缩放定律 Scaling Law 模型性能与规模的关系

前馈网络 Feed-Forward Network 信息单向传播的神经网络

多层感知机 MLP Multi-Layer Perceptron

端到端学习 End-to-End Learning 从输入直接学习到输出

延伸阅读

Scaling Laws for Neural Language Models

Universal Approximation Theorem

The Evolution of AI: A Historical Perspective