Harness-G: A Graph-Structured Harness for Search Agents
Di cosa parla
Durante l'addestramento, agenti che cercano informazioni formulando domande in linguaggio naturale spesso generano richieste diverse che però recuperano gli stessi pezzi di prova, rendendo le scelte di ricerca praticamente indistinguibili. Harness-G affronta il problema trasformando la generazione libera di richieste in scelte tra opzioni concrete — scegliere una frase, un'entità o rispondere — mentre l'ambiente costruisce il menu, tiene lo stato e un metodo confronta l'azione scelta con le alternative attribuendo i benefici alle azioni precedenti.
Cosa permette di osservare
Permette di esplorare se passare da richieste libere a scelte discrete rende più chiaro quali decisioni portano a buone risposte e come misurare il merito delle scelte intermedie nelle ricerche a più passaggi.
Dalla fonte
Reinforcement learning (RL) search agents commonly model retrieval as free-form natural-language query generation and optimize multi-turn interactions using final-answer rewards. Current studies mainly improve training with denser or more structured credit signals, but rarely examine whether retrieval is properly formulated at the policy-environment interface. We observe pronounced retrieval aliasing during Search-R1 training: rollouts for the same question continue to generate distinct query strings, yet their accumulated evidence sets increasingly overlap. We call this phenomenon retrieval-equivalence collapse; in this regime, trajectories approach utility equivalence with respect to retrieval decisions, leaving within-group returns with little effective retrieval contrast. To address this problem, we propose Harness-G, a graph-structured retrieval framework that redesigns this interf…