Dyna-Q 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Dyna-Q 架构:表格 Q-Learning + 环境模型 + 模拟规划;Dyna-Q+、与 Model-Free / 深度 Model-Based 的关系。 阅读全文 »
实验记录与复现 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 随机种子、依赖版本锁定、config/checkpoint、W&B 与复现 checklist。 阅读全文 »
Stable-Baselines3与生态 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 SB3 快速上手、算法-环境对照、CleanRL/RLlib 对比与 baseline 用法。 阅读全文 »
时序差分 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 时序差分 TD:TD(0)、n-step TD、TD(λ)、Sarsa/Q-Learning 统一视角与 Bootstrap 偏差–方差权衡。 阅读全文 »
评估指标 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Episode return、成功率、样本效率、学习曲线绘制与多 seed 统计报告规范。 阅读全文 »
经典基准环境 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 CartPole、MountainCar、LunarLander、Atari、MuJoCo 环境特点与算法选型对照。 阅读全文 »
动态规划 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 动态规划 DP:策略评估、策略迭代、价值迭代;已知模型 P/R 下的表格求解与收敛性。 阅读全文 »
Gymnasium与环境接口 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Gymnasium 安装、Space、Wrapper、RecordVideo、自定义环境与 RL-04 训练循环对接。 阅读全文 »
策略输出 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 离散 logits 与连续高斯策略的网络输出、log_prob、tanh squash 与 PPO/SAC 存储字段。 阅读全文 »