RL-03.算法分类与选型-12.DDPG-TD3-SAC 发表于 2026-05-26 | 分类于 开发 , 强化学习 连续控制 Off-Policy 算法:DDPG、TD3、SAC 的原理、双 Q、目标策略平滑与最大熵 RL。 阅读全文 »
RL-03.算法分类与选型-09.Actor-Critic 发表于 2026-05-26 | 分类于 开发 , 强化学习 Actor-Critic 架构:A2C/A3C、优势函数、Critic 估 V 或 Q、与纯 PG 和 DQN 的关系。 阅读全文 »
RL-03.算法分类与选型-11.PPO 发表于 2026-05-26 | 分类于 开发 , 强化学习 近端策略优化 PPO:裁剪 surrogate 目标、GAE 优势估计、Rollout 训练流程与超参数;离散/连续通用基线。 阅读全文 »
RL-03.算法分类与选型-08.Policy-Gradient 发表于 2026-05-26 | 分类于 开发 , 强化学习 策略梯度定理、REINFORCE 算法、基线 Baseline 减方差、与价值方法的对比及连续动作优势。 阅读全文 »
RL-03.算法分类与选型-07.DQN变体 发表于 2026-05-26 | 分类于 开发 , 强化学习 DQN 改进:Double DQN、Dueling、Prioritized Replay、Multi-step、Rainbow 组合与选型。 阅读全文 »
RL-03.算法分类与选型-06.DQN 发表于 2026-05-26 | 分类于 开发 , 强化学习 Deep Q-Network(DQN):函数逼近、经验回放、目标网络、损失函数与训练流程;Atari 离散控制入门。 阅读全文 »
RL-03.算法分类与选型-04.蒙特卡洛 发表于 2026-05-26 | 分类于 开发 , 强化学习 蒙特卡洛 MC 方法:首次/每次访问、MC 控制、与 TD 的偏差–方差对比;时序差分详见专篇。 阅读全文 »
RL-03.算法分类与选型-03.SARSA 发表于 2026-05-26 | 分类于 开发 , 强化学习 SARSA 算法:On-Policy 时序差分、State-Action-Reward-State-Action 更新、与 Q-Learning 对比及悬崖行走经典例。 阅读全文 »
RL-03.算法分类与选型-02.Q-Learning 发表于 2026-05-26 | 分类于 开发 , 强化学习 Q-Learning 算法:Off-Policy 时序差分、Q 表更新公式、ε-greedy 探索、收敛条件与 NumPy 伪代码。 阅读全文 »