Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models
Di cosa parla
Si chiede ai grandi modelli multimodali unificati di compiere un giro completo: guardare un’immagine e descriverla, ricostruire una scena a partire da quella descrizione e poi ragionare sulla propria ricostruzione. La procedura, chiamata SGU, non richiede nuovi dati etichettati e offre un test a costo zero per valutare insieme capacità di generare, comprendere e usare il proprio output. Esperimenti mostrano che modelli promettenti nelle singole prove spesso faticano a riflettere correttamente sulle proprie ricostruzioni.
Cosa permette di osservare
Permette di esplorare se valutare separatamente generazione e comprensione nasconde errori che emergono solo quando un modello deve usare il proprio lavoro, e quale tipo di limiti affiorano in questo ciclo chiuso.
Dalla fonte
As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohesive manner remains a critical challenge. Current evaluation protocols predominantly treat generative and discriminative capabilities as separate tasks, leaving a gap in system-level evaluation for unified multimodal models (UMMs). In this work, we propose Self-Generative-Understanding (SGU), a novel, annotation-free evaluation framework that probes the integrated capabilities of unified models through a semantic closed-loop challenge. Without requiring new annotations, SGU leverages the dual understanding-and-generation abilities of UMMs by asking them to first perceive an image and produce a textual description, subsequently reconstruct a visual context based on that description, and finally perform reasoning…