Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

Dyna-Q

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Dyna-Q 架构:表格 Q-Learning + 环境模型 + 模拟规划;Dyna-Q+、与 Model-Free / 深度 Model-Based 的关系。
阅读全文 »

实验记录与复现

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
随机种子、依赖版本锁定、config/checkpoint、W&B 与复现 checklist。
阅读全文 »

Stable-Baselines3与生态

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
SB3 快速上手、算法-环境对照、CleanRL/RLlib 对比与 baseline 用法。
阅读全文 »

时序差分

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
时序差分 TD:TD(0)、n-step TD、TD(λ)、Sarsa/Q-Learning 统一视角与 Bootstrap 偏差–方差权衡。
阅读全文 »

评估指标

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Episode return、成功率、样本效率、学习曲线绘制与多 seed 统计报告规范。
阅读全文 »

经典基准环境

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
CartPole、MountainCar、LunarLander、Atari、MuJoCo 环境特点与算法选型对照。
阅读全文 »

动态规划

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
动态规划 DP:策略评估、策略迭代、价值迭代;已知模型 P/R 下的表格求解与收敛性。
阅读全文 »

Gymnasium与环境接口

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Gymnasium 安装、Space、Wrapper、RecordVideo、自定义环境与 RL-04 训练循环对接。
阅读全文 »

策略输出

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
离散 logits 与连续高斯策略的网络输出、log_prob、tanh squash 与 PPO/SAC 存储字段。
阅读全文 »

资格迹

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
TD(λ) 资格迹存储与更新、与 GAE 的关系、表格型实现要点。
阅读全文 »
‹1…424344…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次