AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

Di cosa parla

Molti sistemi conversazionali vengono addestrati facendosi simulare gli utenti da un unico modello; gli autori mostrano che questo approccio fallisce perché il simulatore tende a ripetere sempre gli stessi comportamenti (collasso del simulatore): l’agente impara a sfruttare quel comportamento ristretto e poi non funziona con altri simulatori o con persone reali. Propongono due rimedi complementari: uno che, al momento dell’uso, induce il simulatore a fornire risposte più varie e uno che, durante l’addestramento, mette in gioco una popolazione di simulatori per evitare che l’agente si adatti a un solo stile. Confermano i miglioramenti con esperimenti e rilasciano SCOPE, un framework open source.

Cosa permette di osservare

Questo lavoro invita a esplorare se la chiave per far funzionare meglio agenti conversazionali con persone reali sia aumentare la varietà delle simulazioni o cambiare il modo in cui si addestra l’agente, e quali pratiche rendono le simulazioni più rappresentative.

agentimodelli linguisticiopen sourceregolamentazionericerca

Dalla fonte

Multi-agent reinforcement learning for human-AI interaction typically relies on a single large language model to simulate user behavior. We show that this approach systematically fails to generalize, and trace the failure to simulator collapse: because the simulator LLM is mode-collapsed, an LLM policy trained against it overfits to narrow strategies that exploit the simulator's dominant mode, and such a policy transfers poorly to unseen simulators and real users. We formalize this collapse theoretically and propose two complementary solutions, one at inference time and one at training time. The inference-time solution, Verbalized Sampling, broadens the simulator's behavior by sampling from a verbalized response distribution, reducing mode collapse. The training-time solution, Co-Training, jointly optimizes the policy against a population of trainable simulators, preventing it from over…