Reinforcement learning based on divide and conquer instead of temporal difference learning for off-policy tasks
Read the original at bair.berkeley.edu→In this post, I’ll introduce a reinforcement learning (RL) algorithm based on an “alternative” paradigm: divide and conquer. Unlike traditional methods, this algorithm is not based on temporal difference (TD)...
Original headline: "RL without TD learning"