Gradient-based Planning for World Models at Longer Horizons
Di cosa parla
GRASP è un nuovo metodo per usare modelli predittivi — chiamati “modelli del mondo” — che simulano cosa succede se si eseguono certe azioni, per pianificare su orizzonti più lunghi. L’approccio ottimizza insieme azioni e stati virtuali in parallelo, introduce rumore controllato per esplorare soluzioni diverse e limita l’uso di segnali fragili derivati dagli stati, privilegiando invece i segnali legati alle azioni.
Cosa permette di osservare
Consente di esplorare se e come si può rendere robusta la pianificazione a lungo termine con modelli predittivi complessi, e quali scelte (stati virtuali, rumore, blocco di certi segnali) aiutano a evitare trappole pratiche nell’ottimizzazione.
Dalla fonte
GRASP is a new gradient-based planner for learned dynamics (a “world model”) that makes long-horizon planning practical by (1) lifting the trajectory into virtual states so optimization is parallel across time, (2) adding stochasticity directly to the state iterates for exploration, and (3) reshaping gradients so actions get clean signals while we avoid brittle “state-input” gradients through high-dimensional vision models. Large, learned world models are becoming increasingly capable. They can predict long sequences of future observations in high-dimensional visual spaces and generalize across tasks in ways that were difficult to imagine a few years ago. As these models scale, they start to look less like task-specific predictors and more like general-purpose simulators. But having a powerful predictive model is not the same as being able to use it effectively for control/learning/plan…