一、引言

上一章的内容大家都不觉得有什么黑科技,那这一章我们就来了解强化学习的第一座高峰:PPO 算法。不过从上一章的深度强化学习算法到 PPO 算法可是经过了四年的发展,这中间到底发生了什么?为什么如此善良温顺的深度强化学习算法会变成如此复杂而有效的 PPO 算法,进而极大推动 LLM 的发展?关注 404,带你了解强化学习背后的真实!(小猴猫原创梗)

PPO 算法

PPO(Proximal Policy Optimization)于 2017 年被 OpenAI 提出,原论文请见 Proximal Policy Optimization Algorithms

二、为什么策略梯度方法屡屡吃瘪?

为了介绍 PPO 算法,我们得找到它的祖宗。很不幸,它的祖宗居然是上一章中被我寥寥几笔带过的基于策略的深度强化学习方法。我们简单回顾一下,这种方法把策略视作一个带参数的函数 $\pi_\theta(a\vert s)$,算法的目的是让

Leave a comment