AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

SportD: How do VLMs physically strategize?

Di cosa parla

Si mette alla prova se modelli che osservano immagini e testo possono scegliere azioni sensate in una situazione fisica: gli autori creano SportD, un insieme di 1415 situazioni di gioco del calcio in cui il modello vede i secondi prima della scelta e deve indicare l’azione successiva. I modelli selezionano l’azione ottimale solo in una parte limitata dei casi e preferiscono scelte più sicure che fanno meno progresso verso la porta, perché confondono la probabilità di riuscita con il valore reale dell’azione.

Cosa permette di osservare

Consente di esplorare come e perché questi modelli prendono decisioni strategiche concrete, mostrando che il loro comportamento conservativo deriva da una valutazione errata tra probabilità di successo e utilità effettiva, e suggerisce di scomporre le scelte per individuare bias come la tendenza a evitare rischi.

modelli linguisticiregolamentazionericerca

Dalla fonte

Vision-language models (VLMs) can describe a scene, but can they act well within one? We study whether VLMs can make sound strategic decisions, using soccer as an objective testbed with quantifiably-valued actions. We introduce SportD, a dataset and evaluation consisting of 1415 decision scenarios across professional men's and women's soccer games, where a VLM observes the seconds before a decision and chooses the next action. Models only select the optimal action around 30% of the time, even less frequently than humans do. Furthermore, they exhibit a clear preference for safer actions, favoring lower-variance, lower-value choices that also make less physical progress toward goal. Frontier VLMs are better at estimating whether an action will succeed, placing the highest-success-probability action among their top choices in 83-92% of cases. Yet VLMs systematically conflate likelihood wit…