深度学习
机器学习的分支,通过多层神经网络自动从数据中学习特征表示。"深度"指网络层数多,使模型能逐层提取从简单到复杂的特征,是当前 AI 技术的核心驱动力。
一句话理解
深度学习 = 很多层的神经网络 + 海量数据 + 强大算力。它让机器自己学会"看懂图片""听懂语音""理解文字"。
与传统机器学习的区别
传统机器学习需要人工设计特征(Feature Engineering):比如识别猫,你得告诉机器"先检测边缘、再检测纹理、再检测轮廓"。
深度学习跳过了这一步——直接把原始像素丢进多层网络,让它自己学出有用的特征。层数越多,提取的特征越抽象:
| 层级 | 学到的特征 | 类比 |
|---|---|---|
| 浅层 | 边缘、颜色 | 笔画 |
| 中层 | 纹理、局部形状 | 部首 |
| 深层 | 物体部件 | 偏旁组合 |
| 输出层 | 完整语义 | 整个字 |
"深度"的含义
"深度"指的是网络的层数。早期神经网络通常只有 1-2 个隐藏层(浅层网络),而现代深度学习模型可以有数十到数百层(如 ResNet-152 有 152 层),GPT 系列则有近百层 Transformer 块。
NOTE
为什么以前不能"深"? 深层网络面临梯度消失/爆炸、过拟合、算力不足三大障碍。突破来自:
- ReLU 激活函数(2010s)——缓解梯度消失
- BatchNorm / ResNet 残差连接(2015)——让梯度畅通流动
- GPU 并行计算 + 大规模数据集——提供充足的算力和数据
深度学习的主要架构
| 架构 | 代表模型 | 擅长领域 |
|---|---|---|
| CNN(卷积神经网络) | ResNet, EfficientNet | 图像识别、视觉任务 |
| RNN/LSTM | Seq2Seq | 序列数据(已逐步被取代) |
| Transformer | GPT, BERT, ViT | NLP、多模态、几乎所有领域 |
| GAN | StyleGAN | 图像生成 |
| Diffusion | Stable Diffusion, DALL·E | 图像/视频生成 |
深度学习与 AI 的关系
人工智能⊃机器学习⊃深度学习深度学习是机器学习的子集,而机器学习是人工智能的子集。当前 AI 的绝大多数突破(大语言模型、图像生成、语音识别)都建立在深度学习之上。
引用本术语的文章
- 编译器的三重身份:五大前端框架编译管线深度拆解
- Vercel AI SDK 深度解析:ToolLoopAgent 是 Facade,真正的循环在 generateText 里
- 响应式系统的四条路:从 Proxy 到 Signal 的追踪粒度全景
- 一个设计决策如何决定一切:五大前端框架源码级横向解剖
- Markdown 渲染模块验收:14 类高级语法全量测试
- 【pi-mono 源码解析 1/4】深入 pi-mono Agent Loop:一个 TypeScript AI 代理的上下文管理哲学
- 【pi-mono 源码解析 3/4】幽灵边:pi-mono forkFrom() 揭示的 Lying Sentinel 与 TypeScript 的表达空白
- 【pi-mono 源码解析 2/4】展平的代价:LLM Agent 框架里被忽视的工具调用原子性问题
- 多Agent编排:从单兵到团队
- Coding Agent实战:从零构建一个能写代码的AI助手