跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分36

无需 TD 学习:用分治法实现可扩展的 off-policy 强化学习

RL without TD learning

AI 导读

伯克利 AI 研究提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。该方法针对 off-policy RL 场景,在目标条件 RL 中利用三角不等式构造传递性 Bellman 更新,用两个较短的子轨迹价值更新完整轨迹价值。目前仍存在如何选取最优子目标 w 的问题。

来源:Berkeley AI Research · bair.berkeley.edu