SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward
Di cosa parla
SCOUT vuole rendere i modelli che combinano immagini e testo più abili a capire lo spazio e la profondità. Lo fa facendo ragionare i modelli passo dopo passo su una scena tridimensionale e usando un nuovo modo di addestramento che premia non solo il risultato finale ma anche i singoli passaggi; per supportare questo è stato creato un dataset strutturato chiamato SCOUT-24k. I test riportano miglioramenti e la versione più grande generalizza anche a scenari con più immagini e video, pur essendo addestrata su singole immagini.
Cosa permette di osservare
Permette di esplorare se dare feedback e ricompense ai singoli passi del ragionamento migliora davvero la comprensione dello spazio, e se lo stesso approccio funziona passando da immagini singole a più immagini o video.
Dalla fonte
Existing Vision-Language Models (VLMs) exhibits a critical bottleneck in robust spatial reasoning. Recent reinforcement learning (RL) methods aim to close this gap with verifiable outcomes, yet they suffer from poor credit assignment across intermediate reasoning steps. Concurrently, structured reasoning approaches overlook the critical depth perception necessary for comprehensive 3D understanding. To address these challenges, we propose SCOUT (Structured Chain-Of-Thought Utilizing Process-Supervised RL Training). Specifically, we design a structured Chain-of-Thought (CoT) framework that explicitly models 3D environmental perception to ensure robust spatial understanding and reasoning. Furthermore, we introduce a novel RL algorithm featuring multi-objective process rewards and a tailored advantage estimation method, facilitating fine-grained credit assignment across distinct segments of…