跳到主要内容

#强化学习

标签

与该标签相关的文章、问题和作品。

1 篇文章0 个问题0 个作品
AI 底层工程··阿新聊ai

强化学习:MDP、Q-Learning、Policy Gradient 与 RLHF——RL 的核心框架

本文迁移自 mindcarver/91ai · 原始位置 docs/machine learning/stage8 advanced/01 reinforcement learning.md · 由 @阿新聊ai 整理。 强化学习:MDP、Q Learning、Policy Gradient 与 RLHF——RL 的...