计算机视觉
《人工智能现代方法》读书笔记
第 25 章介绍计算机视觉的核心方法,从传统图像处理到深度学习视觉系统。重点包括:
图像处理基础
- 卷积操作:平均核、Sobel 边缘检测(Gₓ、Gᵧ 梯度幅值和方向)
- 特征检测:Harris 角点检测(自相关矩阵 M 的特征值分析)
- 卷积层参数计算、输出特征图尺寸、感受野
卷积神经网络(CNN)
- 卷积层、池化层、全连接层的堆叠
- ReLU 激活函数优于 Sigmoid 的原因
- 批归一化(Batch Normalization):加速训练、缓解内部协变量偏移
- 迁移学习与数据增强应对标注数据不足
目标检测
- 两阶段检测器(Faster R-CNN):区域提议 + 分类
- 单阶段检测器(YOLO):网格预测边界框和类别概率
- 非极大值抑制(NMS):去除重叠检测框
- 特征金字塔(FPN):处理多尺度目标
分割任务
- 语义分割:像素级分类(所有同类物体同一标签)
- 实例分割(Mask R-CNN):区分同类不同实例
- 评价指标:IoU(交并比)、mAP(mean Average Precision)
实践应用
- 图像分类(ImageNet)、行人检测(自动驾驶)
- 尺度不变性、恶劣天气下的领域自适应
- 离线测试集与真实道路部署的性能评估