AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Foresight Without Seeing: Latent Futures for World Action Models

Di cosa parla

Un metodo consente ai modelli di controllo per robot di tenere conto di come il mondo potrebbe cambiare durante un'azione, senza dover generare video del futuro. Il sistema costruisce e riutilizza una rappresentazione interna delle possibili evoluzioni di oggetti e contatti, imparata durante l'addestramento, così da produrre azioni in modo efficiente pur disponendo di un contesto predittivo.

Cosa permette di osservare

Serve a esplorare come dare ai robot una 'visione del futuro' utile per decidere azioni senza i costi di calcoli complessi, e quali scelte progettuali bilanciano efficienza, trasparenza e qualità delle previsioni.

regolamentazionericercaroboticavideo

Dalla fonte

World Action Models (WAMs) couple future visual prediction with robot action generation, enabling policies to model how the physical world evolves during interaction. Existing WAMs differ in how predictive dynamics are exposed to the action pathway. Explicit-future WAMs provide direct access to predicted scene evolution, but incur substantial inference costs from iterative video denoising. In contrast, direct-policy WAMs efficiently predict actions from the current observation but lack an explicit inference-time interface for exposing predictive dynamics to the Action DiT. To bridge this gap, we propose ForeWAM, a dynamics-conditioned direct-policy WAM that provides predictive context for action generation without decoding future videos. At its core, Future-KV performs a single Video DiT prefill over the current visual latent and stochastic future slots, and reuses the resulting layer-w…