Oasis's Cloud

一个人的首要责任,就是要有雄心。雄心是一种高尚的激情,它可以采取多种合理的形式。
—— 《一个数学家的辩白》

强化学习

《人工智能现代方法》读书笔记

作者:oasis


第 22 章介绍强化学习,核心是让智能体通过与环境交互、获得奖励信号来学习最优策略。重点包括:

基本概念

  • 智能体、环境、状态、动作、奖励
  • 策略 π(a|s):状态到动作的映射
  • 价值函数 V(s)动作价值函数 Q(s,a)
  • 折扣因子 γ:平衡即时奖励与未来奖励

动态规划方法

  • 策略评估:给定策略计算价值函数
  • 策略迭代值迭代:交替评估和改进策略
  • 需要已知环境模型(转移概率和奖励)

无模型方法

  • 蒙特卡洛(MC):基于完整回合的回报估计价值
  • 时序差分(TD):单步自举更新,TD(0) 更新公式
  • SARSA(on-policy)vs Q-learning(off-policy)

探索与利用

  • ε-greedy 策略:以 ε 概率随机探索,1-ε 概率选择最优动作
  • 多臂赌博机:探索-利用权衡的经典问题
  • 在风险敏感场景(如医疗)中需要更保守的探索策略

函数逼近与深度强化学习

  • 深度 Q 网络(DQN):经验回放、目标网络两个关键技巧
  • 策略梯度:REINFORCE 算法、基线(baseline)减少方差
  • 连续动作空间适合策略梯度方法(如 PPO)

应用场景

  • 游戏(Atari)、机器人控制、自动驾驶决策
  • 离线策略评估利用历史数据减少在线探索代价