DNABERT:DNA-RNA预训练模型选型指南 发表于 2026-05-27 | 更新于 2026-08-28 | 分类于 大模型 , 架构 系统梳理 DNABERT 系列及主流 DNA/RNA 预训练基础模型的训练数据(含 ncRNA 类型组成、miRNA/siRNA 说明)、分词策略与架构差异,并提供嵌入模型选型建议。 阅读全文 »
Model-Based简介 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 基于模型的强化学习:环境模型学习、Dyna-Q、MCTS、世界模型与 Model-Based vs Model-Free 选型(选读)。 阅读全文 »
DDPG-TD3-SAC 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 连续控制 Off-Policy 算法:DDPG、TD3、SAC 的原理、双 Q、目标策略平滑与最大熵 RL。 阅读全文 »
Actor-Critic 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Actor-Critic 架构:A2C/A3C、优势函数、Critic 估 V 或 Q、与纯 PG 和 DQN 的关系。 阅读全文 »
PPO 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 近端策略优化 PPO:裁剪 surrogate 目标、GAE 优势估计、Rollout 训练流程与超参数;离散/连续通用基线。 阅读全文 »
Policy-Gradient 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 策略梯度定理、REINFORCE 算法、基线 Baseline 减方差、与价值方法的对比及连续动作优势。 阅读全文 »
DQN变体 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 DQN 改进:Double DQN、Dueling、Prioritized Replay、Multi-step、Rainbow 组合与选型。 阅读全文 »
DQN 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 Deep Q-Network(DQN):函数逼近、经验回放、目标网络、损失函数与训练流程;Atari 离散控制入门。 阅读全文 »
蒙特卡洛 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 蒙特卡洛 MC 方法:首次/每次访问、MC 控制、与 TD 的偏差–方差对比;时序差分详见专篇。 阅读全文 »
SARSA 发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习 SARSA 算法:On-Policy 时序差分、State-Action-Reward-State-Action 更新、与 Q-Learning 对比及悬崖行走经典例。 阅读全文 »