DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution
Di cosa parla
Si lavora per migliorare automaticamente il "harness", cioè l'insieme di regole e strategie che guida agenti basati su grandi modelli linguistici. La proposta, chiamata DREvo, cerca di capire quali esperienze passate restano utili e di trasformarle in suggerimenti concreti per modificare il harness, in modo da ottenere evoluzioni più stabili e prestazioni migliori rispetto ai metodi precedenti.
Cosa permette di osservare
Permette di esplorare se e come i sistemi possono far evolvere da soli le regole che li guidano, decidendo dinamicamente quali prove storiche sono ancora valide e come tradurle in direzioni di miglioramento quando le risorse per sperimentare sono limitate.
Dalla fonte
Harness plays a critical role in large language model agent performance, and building a high-performing harness requires substantial expert effort. Therefore, recent research has increasingly explored harness self-evolution, which iteratively proposes, evaluates, and improves harnesses using historical trial experience. However, accumulated historical experience does not always translate into stable search guidance, and performance often fluctuates substantially across evolution iterations, making it difficult to reliably discover high-performing harnesses under a limited evolution budget. We identify two limitations in how existing harness self-evolution methods leverage historical experience: (1) Lack of dynamic reassessment of whether historical experience remains valid for the current harness, and (2) Lack of explicit mechanisms for translating valid historical experience into actio…