Gradient-based planner GRASP enables long-horizon planning for learned world models by parallelizing optimization, adding stochasticity to state iterates, and reshaping gradients for clearer action signals.
Read the original at bair.berkeley.edu→GRASP is a new gradient-based planner for learned dynamics (a “world model”) that makes long-horizon planning practical by (1) lifting the trajectory into virtual states so optimization is parallel across time, (2)...
Original headline: "Gradient-based Planning for World Models at Longer Horizons"