AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

Di cosa parla

Si lavora per migliorare automaticamente il "harness", cioè l'insieme di regole e strategie che guida agenti basati su grandi modelli linguistici. La proposta, chiamata DREvo, cerca di capire quali esperienze passate restano utili e di trasformarle in suggerimenti concreti per modificare il harness, in modo da ottenere evoluzioni più stabili e prestazioni migliori rispetto ai metodi precedenti.

Cosa permette di osservare

Permette di esplorare se e come i sistemi possono far evolvere da soli le regole che li guidano, decidendo dinamicamente quali prove storiche sono ancora valide e come tradurle in direzioni di miglioramento quando le risorse per sperimentare sono limitate.

agentimodelli linguisticiregolamentazionericerca

Dalla fonte

Harness plays a critical role in large language model agent performance, and building a high-performing harness requires substantial expert effort. Therefore, recent research has increasingly explored harness self-evolution, which iteratively proposes, evaluates, and improves harnesses using historical trial experience. However, accumulated historical experience does not always translate into stable search guidance, and performance often fluctuates substantially across evolution iterations, making it difficult to reliably discover high-performing harnesses under a limited evolution budget. We identify two limitations in how existing harness self-evolution methods leverage historical experience: (1) Lack of dynamic reassessment of whether historical experience remains valid for the current harness, and (2) Lack of explicit mechanisms for translating valid historical experience into actio…