自然语言处理中的深度学习
《人工智能现代方法》读书笔记
第 24 章介绍深度学习在自然语言处理中的应用,核心是通过分布式表示和神经网络架构处理文本数据。重点包括:
词向量
- Word2Vec、GloVe:将词映射为稠密向量
- 词向量算术性质(如 king - man + woman ≈ queen)
- 余弦相似度衡量语义相近性
序列模型
- RNN:处理变长序列,隐藏状态递推更新
- 双向 RNN(BiRNN):同时利用前后文信息,适用于分类任务但不适用于语言模型
- LSTM / GRU:缓解梯度消失,捕获长距离依赖
注意力机制
- 核心公式:αᵢ = exp(q·kᵢ) / Σⱼ exp(q·kⱼ),输出 = Σᵢ αᵢ vᵢ
- 在机器翻译中:查询来自解码器,键和值来自编码器
- 解决 Seq2Seq 长句信息瓶颈问题
Transformer
- 自注意力(Self-Attention):序列内各位置相互关注
- 多头注意力、位置编码、前馈网络
- 并行计算优势,对长距离依赖建模能力强
预训练语言模型
- BERT:双向上下文,掩码语言模型(MLM)、下一句预测(NSP)
- GPT:单向自回归语言模型,适合生成任务
- 预训练 + 微调范式,RoBERTa 等改进
应用任务
- 文本分类:词嵌入 + LSTM + 全连接层
- 机器翻译:编码器-解码器 + 注意力 / Transformer
- 命名实体识别(NER):BiLSTM-CRF,span-based F1 评价
- 问答系统:检索式 vs 生成式,BERT 微调预测答案起止位置