Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

Rollout-Buffer

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
PPO/A2C Rollout 缓冲:轨迹字段、GAE 扫描、On-Policy 清空策略与向量化收集。
阅读全文 »

Prioritized-Replay

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
优先经验回放 PER:TD 误差优先级、SumTree 采样、重要性权重修正。
阅读全文 »

Replay-Buffer

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
经验回放环形队列:FIFO、预分配 numpy、随机采样与 DQN 对接。
阅读全文 »

Q-Table

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Q 表内存布局、稀疏存储、乐观初始化与可视化;对应 Q-Learning/SARSA 实现。
阅读全文 »

免疫刺激性基序与敲低干扰

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 生物信息 , siRNA
从 TLR7/8、TLR3、PKR 等识别原理出发,梳理 siRNA 中常见免疫刺激性基序、代表性文献与体内外表征方案,并说明炎症应答如何干扰敲低效率与表型解释。
阅读全文 »

TRPO

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
信任域策略优化 TRPO:KL 约束、替代目标、自然策略梯度与共轭梯度求解;与 PPO 的关系及工程取舍。
阅读全文 »

Transition元组

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
RL transition 字段标准 (s,a,r,s',done)、扩展字段、namedtuple 与 numpy 批量存储约定。
阅读全文 »

超参与调优

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
RL 超参数分类、DQN/PPO/SAC 起步表、调参顺序、学习率与奖励尺度、实验对照原则。
阅读全文 »

PPO实现

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
CartPole 上 PPO 实现:Actor-Critic 网络、Rollout 收集、GAE 优势与 Clip 损失。
阅读全文 »

DQN实现

发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
CartPole 上完整 DQN:ReplayBuffer、Q 网络、目标网络、ε 衰减与训练脚本结构。
阅读全文 »
‹1…434445…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次