Oasis's Cloud

一个人的首要责任,就是要有雄心。雄心是一种高尚的激情,它可以采取多种合理的形式。
—— 《一个数学家的辩白》

自然语言处理中的深度学习

《人工智能现代方法》读书笔记

作者:oasis


第 24 章介绍深度学习在自然语言处理中的应用,核心是通过分布式表示和神经网络架构处理文本数据。重点包括:

词向量

  • Word2Vec、GloVe:将词映射为稠密向量
  • 词向量算术性质(如 king - man + woman ≈ queen)
  • 余弦相似度衡量语义相近性

序列模型

  • RNN:处理变长序列,隐藏状态递推更新
  • 双向 RNN(BiRNN):同时利用前后文信息,适用于分类任务但不适用于语言模型
  • LSTM / GRU:缓解梯度消失,捕获长距离依赖

注意力机制

  • 核心公式:αᵢ = exp(q·kᵢ) / Σⱼ exp(q·kⱼ),输出 = Σᵢ αᵢ vᵢ
  • 在机器翻译中:查询来自解码器,键和值来自编码器
  • 解决 Seq2Seq 长句信息瓶颈问题

Transformer

  • 自注意力(Self-Attention):序列内各位置相互关注
  • 多头注意力、位置编码、前馈网络
  • 并行计算优势,对长距离依赖建模能力强

预训练语言模型

  • BERT:双向上下文,掩码语言模型(MLM)、下一句预测(NSP)
  • GPT:单向自回归语言模型,适合生成任务
  • 预训练 + 微调范式,RoBERTa 等改进

应用任务

  • 文本分类:词嵌入 + LSTM + 全连接层
  • 机器翻译:编码器-解码器 + 注意力 / Transformer
  • 命名实体识别(NER):BiLSTM-CRF,span-based F1 评价
  • 问答系统:检索式 vs 生成式,BERT 微调预测答案起止位置