Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

Q-Learning

发表于 2026-05-26 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
Q-Learning 算法:Off-Policy 时序差分、Q 表更新公式、ε-greedy 探索、收敛条件与 NumPy 伪代码。
阅读全文 »

应用实战

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
强化学习应用实战:博弈、机器人、推荐、调度、自动驾驶等场景的问题建模、算法选型、工程链路与落地挑战。
阅读全文 »

评估环境与工具链

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
RL 评估与环境:Gymnasium 接口、经典基准、指标与学习曲线、Stable-Baselines3/CleanRL 生态及实验复现要点。
阅读全文 »

专属数据结构

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
RL 专属数据结构:Q-Table、Transition 元组、Replay Buffer、Prioritized Replay、Rollout Buffer、资格迹与策略输出参数化。
阅读全文 »

实现框架与实践

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
RL 实现框架:Gymnasium 训练循环、PyTorch 要点、表格型与深度算法工程结构、常见坑与超参直觉。
阅读全文 »

算法分类与选型

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
强化学习算法分类:Model-Free/Model-Based、On/Off-Policy、Value/Policy/Actor-Critic;表格型到深度 RL 谱系与选型速查。
阅读全文 »

原理与数学基础

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
MDP、折扣回报、Bellman 方程、状态/动作价值函数与最优策略;探索–利用权衡的数学表述。
阅读全文 »

强化学习:概述与问题建模

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
强化学习概述:Agent–Environment 交互、状态/动作/奖励、试错与延迟回报;与监督学习的对比及问题建模入口。
阅读全文 »

强化学习:系列概述

发表于 2026-05-25 | 更新于 2026-08-28 | 分类于 机器学习 , 强化学习
强化学习(Reinforcement Learning,RL)系列入口:概述、原理算法、实现、数据结构、评估工具、应用实战及阅读路线。
阅读全文 »

图神经网络处理蛋白结构:Python 数据流与编码实践

发表于 2026-05-19 | 更新于 2026-08-28 | 分类于 大模型
从 PDB/mmCIF 解析、BioPython 层次对象与 NumPy 张量,到残基图构图与 PyG Data 批训练,用 Python 串起「蛋白结构 → GNN 输入」全流程;含五幅数据流示意图与可复用代码骨架。
阅读全文 »
‹1…464748…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次