Berkeley AI Research·· 2025-11-01AI 评分38
无需TD学习的强化学习:分治范式如何扩展至长时程任务
RL without TD learning
AI 导读
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
来源:Berkeley AI Research · bair.berkeley.edu