




资源介绍
视频数量:56个
总时长:9小时35分
课程介绍:
人工智能2.0:深度强化学习与连续控制实战
你有没有见过一个虚拟的蚂蚁机器人真正学会自己走路?不是那种提前编好动作的程序,而是从完全不会到慢慢摸索出正确姿势,最后跑得稳稳当当的。这个场景曾经是深度强化学习领域公认的难题,很多算法都栽在这上面。但现在,一套叫TD3的算法把这事办成了,它不仅能让蚂蚁走路,还能控制半人形机器人完成各种复杂任务。这门课要教你的,就是这套算法的原理和实现。
课程首先从强化学习的基础知识讲起。很多人可能听说过Q学习,但不一定清楚它背后的数学原理和直观含义。Q学习本质上是在问:当智能体处于某个状态时,采取某个动作最终能获得多少回报?贝尔曼方程给出了这个问题的递归表达,让我们可以从终点的奖励反推中间每一步的价值。马尔可夫决策过程则是描述强化学习问题的标准框架,它把环境、状态、动作和奖励的关系讲得清清楚楚。有了这些基础,你就能理解为什么智能体可以通过不断试错来学会最优策略。
深度Q学习在Q学习的基础上引入了神经网络,用来逼近复杂的Q值函数。直接用神经网络替代Q表格带来了一个问题:神经网络需要大量独立同分布的样本,而智能体与环境交互产生的样本是连续的、相关的。经验回放机制解决了这个矛盾,它把交互产生的样本存到缓冲区里,训练时随机抽取,打破了样本之间的相关性。另外,智能体在探索环境时需要在已经学到的最好策略和尝试新动作之间做权衡,epsilon-greedy等动作选择策略就是来处理这个问题的。
策略梯度方法提供了一条完全不同的思路。传统Q学习输出的是每个动作的价值,而策略梯度直接输出应该采取什么动作。这意味着它天然适合处理连续动作空间,因为输出可以是任意的实数值而不是离散的选项。Actor-Critic架构把两种方法结合起来,用Critic评估当前策略的好坏,用Actor根据Critic的反馈调整策略。这种双保险的设计让训练更加稳定,效果也更好。
课程的核心是Twin Delayed DDPG算法,简称TD3。这个名字听起来复杂,拆开来看其实很清晰。DDPG代表深度确定性策略梯度,它专门解决连续动作空间的问题。为什么要强调确定性?因为在连续空间里,如果每次都从概率分布里采样,输出的动作是随机的,确定性策略则直接输出具体的数值,这让控制更加精确。TD3在DDPG基础上加了三个改进:Twin指用两个Q网络取较小值来防止过估计,Delayed指更新策略网络的频率低于Q网络,Gradients则对梯度做了裁剪。这三个技巧加在一起,让算法在连续控制任务上表现出色。
理论部分会详细解释为什么深度Q学习不能直接用于连续动作空间。问题的关键在于取最大值的操作:离散情况下遍历所有动作取最大很简单,但连续空间里有无穷多个可能,动作取值是连续的,这变成了一道复杂的优化题。TD3通过Actor-Critic架构巧妙地绕过了这个麻烦,让连续动作控制成为可能。
学完理论就该动手实现了。课程从零开始,用20个步骤带你写完整个TD3算法。从环境初始化开始,到经验回放缓冲区的设计,再到两个Q网络和策略网络的搭建,每一个细节都有对应的代码讲解。训练循环怎么写、参数怎么更新、探索噪声怎么添加、目标网络怎么同步,这些在实际项目中必须掌握的东西,课程都会一一演示。更重要的是,每一步都配有详细的讲解,不是让你照着抄,而是让你真正理解为什么要这样写。
最后的演示环节会展示算法的实际效果。用训练好的模型控制虚拟机器人行走,看看它是怎么从踉踉跄跄到稳步前进的。训练过程和推理过程都会演示,让你对整个流程有完整的认识。
除了主线内容,课程还配了三个附录,专门讲解前置知识。人工神经网络部分讲神经元、激活函数、梯度下降和反向传播,这些是理解深度学习的基础。Q学习附录从强化学习的定义开始,系统地梳理了Q学习的各个知识点。深度Q学习附录则补充了经验回放和动作选择策略的内容。即使你的基础稍弱,跟着附录走一遍也能顺利过渡到主课内容。
学完这门课,你会有能力处理连续动作空间的强化学习问题,能够独立实现TD3这类复杂算法,对深度强化学习的整个知识体系有清晰的认识。课程配套的代码可以直接拿来做自己的项目,不管是机械臂控制、机器人行走还是其他连续控制任务,都能派上用场。整个课程将近十个小时,内容充实,节奏合理,适合有一定Python基础、想深入学习强化学习的同学。