Rollout-Buffer 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 PPO/A2C Rollout 缓冲:轨迹字段、GAE 扫描、On-Policy 清空策略与向量化收集。 阅读全文 »
Prioritized-Replay 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 优先经验回放 PER:TD 误差优先级、SumTree 采样、重要性权重修正。 阅读全文 »
Replay-Buffer 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 经验回放环形队列:FIFO、预分配 numpy、随机采样与 DQN 对接。 阅读全文 »
Q-Table 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Q 表内存布局、稀疏存储、乐观初始化与可视化;对应 Q-Learning/SARSA 实现。 阅读全文 »
免疫刺激性基序与敲低干扰 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 生物信息 , siRNA 从 TLR7/8、TLR3、PKR 等识别原理出发,梳理 siRNA 中常见免疫刺激性基序、代表性文献与体内外表征方案,并说明炎症应答如何干扰敲低效率与表型解释。 阅读全文 »
TRPO 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 信任域策略优化 TRPO:KL 约束、替代目标、自然策略梯度与共轭梯度求解;与 PPO 的关系及工程取舍。 阅读全文 »
Transition元组 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 RL transition 字段标准 (s,a,r,s',done)、扩展字段、namedtuple 与 numpy 批量存储约定。 阅读全文 »
超参与调优 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 RL 超参数分类、DQN/PPO/SAC 起步表、调参顺序、学习率与奖励尺度、实验对照原则。 阅读全文 »
PPO实现 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 CartPole 上 PPO 实现:Actor-Critic 网络、Rollout 收集、GAE 优势与 Clip 损失。 阅读全文 »
DQN实现 发表于 2026-05-28 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 CartPole 上完整 DQN:ReplayBuffer、Q 网络、目标网络、ε 衰减与训练脚本结构。 阅读全文 »