自然语言处理
《人工智能现代方法》读书笔记
第 23 章介绍自然语言处理的基础方法,涵盖语言模型、句法分析和机器翻译等经典任务。重点包括:
语言模型
- N-gram 模型:基于前 n-1 个词预测下一个词
- 拉普拉斯平滑(加 1 平滑):处理未见 n-gram 的数据稀疏问题
- 困惑度(Perplexity)作为语言模型评价指标
词性标注
- 隐马尔可夫模型(HMM):状态为词性,观测为单词
- 维特比算法:求最可能的词性序列
- 数据稀疏问题及平滑技术
- 半监督学习、自训练利用未标注文本
句法分析
- 上下文无关文法(CFG):S → NP VP 等产生式规则
- CYK 算法:动态规划判断句子是否被文法接受
- 概率 CFG(PCFG):为规则赋予概率,求最可能的句法树
- 评价指标:标记精确率、召回率、F1、交叉括号
机器翻译
- 词对齐:IBM 模型 1(仅词汇翻译概率)、模型 2(增加位置信息)
- 基于短语的翻译:克服词序差异
- 平行语料与单语语料的使用
信息抽取
- 基于模式匹配的方法(如「公司发布了产品」)
- 监督学习方法:标注实体和关系,设计特征(词性、依赖路径)
- 评价:准确率、召回率、F1