概率模型学习
《人工智能现代方法》读书笔记
第 20 章关注如何从数据中学习概率模型,包括参数估计、隐变量模型和结构学习。核心内容包括:
参数学习
- 最大似然估计(MLE):选择使观测数据概率最大的参数
- 最大后验估计(MAP):结合先验分布,在数据量小时更稳健
- Dirichlet 先验:用于离散概率参数的共轭先验
- Beta 分布:二值变量的共轭先验
贝叶斯网络参数学习
- 给定网络结构,从完整数据估计 CPT 参数
- 处理缺失数据时需要 EM 算法
期望最大化(EM)算法
- E 步:计算隐变量的后验概率(期望)
- M 步:用期望计数更新参数
- 保证收敛到局部最优,但不保证全局最优
高斯混合模型(GMM)
- 用多个高斯分布的加权和建模数据
- EM 算法估计混合系数、均值和方差
- 每个数据点属于各分量的后验概率在 E 步计算
结构学习
- 评分函数:BIC = ln P(D|G,θ̂) - d/2 ln N,平衡拟合度与模型复杂度
- 搜索方法:K2 算法等贪心搜索
- 先验知识约束(如因果方向)可嵌入结构学习
- 学习得到的网络不一定代表因果结构
模型选择
- 避免过拟合:BIC、交叉验证、信息准则
- 隐类数量选择:比较不同复杂度模型的 BIC 分数