强化学习
《人工智能现代方法》读书笔记
第 22 章介绍强化学习,核心是让智能体通过与环境交互、获得奖励信号来学习最优策略。重点包括:
基本概念
- 智能体、环境、状态、动作、奖励
- 策略 π(a|s):状态到动作的映射
- 价值函数 V(s) 和 动作价值函数 Q(s,a)
- 折扣因子 γ:平衡即时奖励与未来奖励
动态规划方法
- 策略评估:给定策略计算价值函数
- 策略迭代与值迭代:交替评估和改进策略
- 需要已知环境模型(转移概率和奖励)
无模型方法
- 蒙特卡洛(MC):基于完整回合的回报估计价值
- 时序差分(TD):单步自举更新,TD(0) 更新公式
- SARSA(on-policy)vs Q-learning(off-policy)
探索与利用
- ε-greedy 策略:以 ε 概率随机探索,1-ε 概率选择最优动作
- 多臂赌博机:探索-利用权衡的经典问题
- 在风险敏感场景(如医疗)中需要更保守的探索策略
函数逼近与深度强化学习
- 深度 Q 网络(DQN):经验回放、目标网络两个关键技巧
- 策略梯度:REINFORCE 算法、基线(baseline)减少方差
- 连续动作空间适合策略梯度方法(如 PPO)
应用场景
- 游戏(Atari)、机器人控制、自动驾驶决策
- 离线策略评估利用历史数据减少在线探索代价