Oasis's Cloud

一个人的首要责任,就是要有雄心。雄心是一种高尚的激情,它可以采取多种合理的形式。
—— 《一个数学家的辩白》

深度学习

《人工智能现代方法》读书笔记

作者:oasis


第 21 章介绍深度学习的基本原理和主要架构,核心是通过多层神经网络自动学习层次化特征表示。重点包括:

神经网络基础

  • 前向传播:净输入 z = w·x + b,激活函数(Sigmoid、ReLU、tanh)
  • 损失函数:均方误差(回归)、二元交叉熵(分类)
  • 反向传播:链式法则计算梯度,逐层更新权重和偏置

训练技巧

  • 梯度消失与梯度爆炸:深层网络训练困难的原因
  • 缓解方法:ReLU 激活、批归一化、残差连接、梯度裁剪
  • 学习率、优化器(SGD、Adam)的选择

卷积神经网络(CNN)

  • 卷积层、池化层、全连接层的参数计算
  • 感受野、参数共享、平移不变性
  • 应用于图像分类、目标检测等

循环神经网络(RNN)

  • 处理序列数据的循环结构
  • LSTM / GRU:门控机制缓解长期依赖问题
  • 应用于时间序列预测、文本生成

生成模型

  • 生成对抗网络(GAN):生成器与判别器的极小极大博弈
  • 变分自编码器(VAE):概率生成模型
  • 模式崩溃、训练不稳定等常见问题

实践要点

  • 数据预处理(归一化、数据增强)
  • 过拟合判断与正则化(Dropout、早停)
  • 预训练 + 微调、半监督学习应对标注数据不足