深度学习
《人工智能现代方法》读书笔记
第 21 章介绍深度学习的基本原理和主要架构,核心是通过多层神经网络自动学习层次化特征表示。重点包括:
神经网络基础
- 前向传播:净输入 z = w·x + b,激活函数(Sigmoid、ReLU、tanh)
- 损失函数:均方误差(回归)、二元交叉熵(分类)
- 反向传播:链式法则计算梯度,逐层更新权重和偏置
训练技巧
- 梯度消失与梯度爆炸:深层网络训练困难的原因
- 缓解方法:ReLU 激活、批归一化、残差连接、梯度裁剪
- 学习率、优化器(SGD、Adam)的选择
卷积神经网络(CNN)
- 卷积层、池化层、全连接层的参数计算
- 感受野、参数共享、平移不变性
- 应用于图像分类、目标检测等
循环神经网络(RNN)
- 处理序列数据的循环结构
- LSTM / GRU:门控机制缓解长期依赖问题
- 应用于时间序列预测、文本生成
生成模型
- 生成对抗网络(GAN):生成器与判别器的极小极大博弈
- 变分自编码器(VAE):概率生成模型
- 模式崩溃、训练不稳定等常见问题
实践要点
- 数据预处理(归一化、数据增强)
- 过拟合判断与正则化(Dropout、早停)
- 预训练 + 微调、半监督学习应对标注数据不足