




资源介绍
视频数量:86个
总时长:7小时34分
课程介绍:
深度强化学习进阶:策略梯度算法实战
你有没有想过,智能体是怎么学会在复杂环境中做出正确决策的?不管是让机械手臂精准抓取物体,还是让虚拟机器人学会奔跑,这些看似神奇的能力背后,都离不开强化学习的核心技术——策略梯度方法。
这门高级课程就是专门为你准备的。课程从基础的马尔可夫决策过程讲起,系统回顾了蒙特卡洛方法、时序差分方法、N步引导法这些核心概念。你会弄清楚轨迹和回合有什么区别,理解奖励和返回值之间的关系,搞懂折扣因子为什么重要,以及贝尔曼方程是如何支撑整个强化学习理论大厦的。
神经网络的部分会带你了解函数逼近器的原理,人工神经元是如何工作的,神经网络怎样表示复杂函数,还有随机梯度下降和神经网络优化的细节。这些内容为你后续学习策略梯度方法打下坚实的数学和编程基础。
策略梯度是这门课的核心。你会深入理解策略梯度定理——为什么可以通过梯度上升来直接优化策略的参数。课程从REINFORCE算法开始,教你如何在离散和连续动作空间中用神经网络来表示策略,怎样进行并行学习,以及如何通过熵正则化来保证策略的探索性。
为了让学习更高效,课程专门安排了PyTorch Lightning框架的教学。你会学到如何用这个强大的工具来组织代码结构,分别构建策略网络、环境接口和数据集处理模块,然后一步步实现REINFORCE算法的完整训练流程。通过倒立摆环境来验证你写出来的智能体是否真的学会了平衡控制。
演员评论家架构(A2C)是另一个重头戏。这种方法同时学习策略函数和价值函数,用价值函数来减小方差、加速收敛。你会亲手实现一个完整的A2C智能体,让它学会在复杂环境中做出最优决策。
信任域方法是现代强化学习的前沿技术。课程详细讲解了线搜索和信任域方法的区别,KL散度在策略更新中的作用,以及如何通过约束来保证策略更新的稳定性。理解了这些理论基础后,学习TRPO和PPO就会顺畅很多。
PPO(近端策略优化)是你必须掌握的主流算法。课程会教你理解PPO的核心思想——通过裁剪机制来限制策略更新的幅度,避免训练过程崩溃。你会学到如何在代码中实现PPO的环境创建、数据集构建和算法核心部分,然后用Half Cheetah这种更复杂的环境来测试效果。
GAE(广义优势估计)解决的是优势函数估计的问题。通过调整GAE参数,你可以权衡估计的偏差和方差,找到最适合你任务的设置。课程会带你把GAE和PPO结合起来,实现一个更稳定的强化学习智能体。
TRPO(信任域策略优化)是PPO的前身,它通过KL散度约束来控制策略更新。虽然实现起来比PPO复杂,但它对理解策略优化理论非常重要。课程用六个部分详细讲解TRPO的理论推导和代码实现,从信任域方法的数学基础到完整的训练流程,一个细节都不落下。
整个课程配有完整的Jupyter Notebook代码,所有实验都可以在Google Colab上直接运行。你不需要配置复杂的本地环境,打开浏览器就能开始学习和实验。
学完这门课,你就能独立实现各种主流的策略梯度算法,理解它们各自的特点和适用场景。机器人控制、游戏AI开发、自动驾驶决策系统,这些需要智能体自主学习的环境都是你未来的用武之地。