AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

Di cosa parla

Si sovrappongono ai fotogrammi dei video delle tracce che mostrano come gli oggetti si spostano tra un'immagine e la successiva, in modo che modelli linguistici multimodali già pronti possano osservare movimenti che altrimenti verrebbero persi. L'idea è di ricostruire traiettorie dense, scegliere i fotogrammi più informativi e segnare i percorsi fra di essi: i test mostrano miglioramenti nel ragionamento sul movimento senza dover riaddestrare o modificare i modelli.

Cosa permette di osservare

Permette di esplorare se annotare visivamente il movimento è una via pratica per migliorare la comprensione video in applicazioni come robotica o guida autonoma, e quali tipi di segnali di movimento funzionano meglio per i modelli già pronti.

modelli linguisticiopen sourceregolamentazionericercarobotica

Dalla fonte

Motion-centric video reasoning is fundamental to interactive applications such as robotic manipulation and autonomous navigation. However, multimodal large language models (MLLMs) typically process videos through sparse uniform sampling to control visual-token and attention costs. This strategy may discard critical transitions between sampled frames, limiting reasoning about object movement, collisions, and causal interactions. To mitigate this issue, we propose Motion-as-Prompt (MaP), a track-guided cross-frame visual prompting framework. MaP recovers dense point trajectories, selects motion-informative frames, and marks the trajectories accumulated between consecutive sampled frames directly onto the visual inputs, making otherwise hidden displacement, direction changes, and interactions observable to frozen MLLMs. Experiments on CLEVRER and Something-Something-v2 show that MaP consis…