视频课程 人工智能

面向商业决策的强化学习核心课 (英文课程中文字幕)

¥5.00 已售 0
✓ 自动发货 ✓ 永久有效 ✓ 售后保障

资源介绍

视频数量:20个 总时长:3小时0分 课程介绍: 面向商业决策的强化学习核心课 你是一家物流公司的运营负责人,每天有几万个包裹在仓库里流转,机器人怎么调度、库存怎么摆、路线怎么规划才能又快又稳?你可能试过规则引擎,试过传统优化算法,但面对环境每天都在变的情况,这些方法总是力不从心。强化学习正是为这类"在动态环境中做连续决策"的问题而生的。这门课会带你从零起步,用三小时把强化学习的核心逻辑、商业适用场景和落地方法讲清楚。 一、为什么是强化学习,它和普通机器学习有什么不同 课程一开头没有急着抛公式,而是先把强化学习的定位讲清楚。它不同于监督学习那种"给定数据找规律"的范式,而是让一个智能体在环境里不断试错,通过奖励信号学会做最优决策。课程用一个仓库运营的案例贯穿始终:包裹分拣、搬运机器人调度、库存布局优化,所有抽象概念都会落到这个具体场景上,让你一看就知道这东西到底能干嘛。 二、核心框架:智能体与环境的交互循环 第二部分建立强化学习的基础认知。你会学到智能体和环境之间的交互逻辑——观察状态、采取动作、获得奖励、进入新状态,这个循环就是一切RL算法的起点。接着深入奖励机制的设计,以及一个绕不开的矛盾:探索与利用的权衡。你是该继续尝试新策略以发现更好的方案,还是直接用目前已知最好的方案?这一节会把这个问题的本质讲透。 三、马尔可夫决策过程与价值函数 有了基础概念之后,课程进入数学建模层面。马尔可夫决策过程(MDP)是描述强化学习问题的标准框架,状态、动作、转移概率、奖励函数这四个要素必须搞清楚。课程用通俗的方式讲清MDP的结构,再过渡到价值函数和贝尔曼最优方程。你不需要有深厚的数学背景也能跟上,因为重点始终是直觉和几何理解,而不是公式推导。搞懂了这一节,你就具备了分析任何RL问题的基本工具。 四、多臂老虎机与探索策略 课程专门拿出一节讲多臂老虎机问题,因为它把探索与利用的矛盾剥离到了最纯粹的形式。你会学到几种主流的探索策略:ε-贪心、UCB上置信界、汤普森采样等,以及它们各自的适用场景。这部分内容看似简单,但对后续理解更复杂的算法至关重要,也能直接用在广告投放、A/B测试、推荐系统冷启动等商业场景里。 五、时序差分学习:SARSA与Q-Learning 从这一节开始进入算法实战。课程先讲时序差分预测的思路,再延伸到控制问题中的两个经典算法:SARSA和Q-Learning。SARSA是在策略学习,会把探索带来的风险考虑进去;Q-Learning是离策略学习,直接逼近最优动作价值。课程通过工厂机械臂分拣包裹的例子,把两者的区别讲得相当生动。然后是调参与实战训练部分,学习率、折扣因子、探索衰减这些超参数怎么设置,多步TD目标怎么用,都会讲到。 六、函数逼近与深度Q网络 当状态空间大到无法用表格存储时,就必须引入函数逼近。课程讲清楚从表格方法过渡到特征表示的必要性,再引入深度Q网络(DQN)的核心思想:用神经网络拟合Q函数,配合经验回放和目标网络来稳定训练。这一节是把RL带入深度学习领域的关键一步,也是理解AlphaGo、DQN玩雅达利游戏等里程碑成果的基础。 七、策略梯度与REINFORCE 前面的方法都是基于价值的学习,这一节转向直接优化策略。课程讲策略梯度定理的直觉,以及REINFORCE算法的实现逻辑。更重要的是方差问题和基线的引入——这是策略梯度方法能否实用的关键。你会明白为什么直接用蒙特卡洛回报来估计梯度噪声很大,以及减去一个合适的基线为什么能大幅提升学习效率。 八、Actor-Critic与PPO 策略梯度虽然直接,但方差高、收敛慢。课程接着