G0.5: One Autoregressive Stream for Robot Reasoning and Action
Di cosa parla
G0.5 è un modello pre-addestrato che genera insieme il ragionamento e le istruzioni di azione per robot, invece di trattare il modello visivo solo come un codificatore di contesto. Per ottenerlo unifica azioni diverse in un vocabolario condiviso, intreccia una "linea di pensiero" con i comandi e conserva una memoria visiva di pochi secondi: così le abilità apprese sul linguaggio visivo si trasferiscono al comportamento fisico e le istruzioni possono guidare direttamente la granularità e la durata dei compiti senza ulteriore addestramento.
Cosa permette di osservare
Permette di esplorare se avere un unico modello che pensa e agisce rende i robot più adattabili e controllabili, e se una memoria visiva breve e un linguaggio condiviso per le azioni facilitano il trasferimento a nuovi ambienti e compiti.
Dalla fonte
The prevailing recipe for Vision-Language-Action (VLA) models couples a pretrained VLM with a separately trained flow-matching action expert. This makes the VLM a context encoder rather than a decision-maker. We introduce G0.5, a pretrained autoregressive VLA in which a single transformer decoder emits reasoning and action tokens under a single objective. Three components make this tractable at foundation-model scale: a learnable cross-embodiment action tokenizer that maps heterogeneous robot actions into a shared vocabulary; a native chain-of-thought stream interleaving task decomposition, object grounding, and action hints with action tokens; and a visual memory module that injects multi-second history through the vision encoder. Because reasoning and action share a single set of weights, the pretrained VLM's capabilities carry over to physical behavior: the model follows instructions…