Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

DNABERT:DNA-RNA预训练模型选型指南

发表于 2026-05-27 | 更新于 2026-08-28 | 分类于 大模型 , 架构
系统梳理 DNABERT 系列及主流 DNA/RNA 预训练基础模型的训练数据(含 ncRNA 类型组成、miRNA/siRNA 说明)、分词策略与架构差异,并提供嵌入模型选型建议。
阅读全文 »

Model-Based简介

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
基于模型的强化学习:环境模型学习、Dyna-Q、MCTS、世界模型与 Model-Based vs Model-Free 选型(选读)。
阅读全文 »

DDPG-TD3-SAC

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
连续控制 Off-Policy 算法:DDPG、TD3、SAC 的原理、双 Q、目标策略平滑与最大熵 RL。
阅读全文 »

Actor-Critic

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Actor-Critic 架构:A2C/A3C、优势函数、Critic 估 V 或 Q、与纯 PG 和 DQN 的关系。
阅读全文 »

PPO

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
近端策略优化 PPO:裁剪 surrogate 目标、GAE 优势估计、Rollout 训练流程与超参数;离散/连续通用基线。
阅读全文 »

Policy-Gradient

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
策略梯度定理、REINFORCE 算法、基线 Baseline 减方差、与价值方法的对比及连续动作优势。
阅读全文 »

DQN变体

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
DQN 改进:Double DQN、Dueling、Prioritized Replay、Multi-step、Rainbow 组合与选型。
阅读全文 »

DQN

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Deep Q-Network(DQN):函数逼近、经验回放、目标网络、损失函数与训练流程;Atari 离散控制入门。
阅读全文 »

蒙特卡洛

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
蒙特卡洛 MC 方法:首次/每次访问、MC 控制、与 TD 的偏差–方差对比;时序差分详见专篇。
阅读全文 »

SARSA

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
SARSA 算法:On-Policy 时序差分、State-Action-Reward-State-Action 更新、与 Q-Learning 对比及悬崖行走经典例。
阅读全文 »
‹1…454647…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次