Berkeley AI Research·· 2025-11-01AI 评分36
无需 TD 学习:用分治法实现可扩展的 off-policy 强化学习
RL without TD learning
AI 导读
伯克利 AI 研究提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。该方法针对 off-policy RL 场景,在目标条件 RL 中利用三角不等式构造传递性 Bellman 更新,用两个较短的子轨迹价值更新完整轨迹价值。目前仍存在如何选取最优子目标 w 的问题。
来源:Berkeley AI Research · bair.berkeley.edu