AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

FinEvolveBench: A Benchmark for Self-Evolving Agents on Low-Repetition Tasks with Implicit Rewards

Di cosa parla

Riproduce un flusso quotidiano di notizie e osservazioni di mercato per verificare se agenti linguistici possono migliorare il proprio comportamento accumulando e aggiornando esperienza durante l'uso, quando i segnali di successo sono impliciti, ritardati e rumorosi. Il test alterna nuove decisioni con esiti arrivati in ritardo, confronta previsioni di sentiment di mercato con i ritorni successivi e mostra che i sistemi di memoria provati non superano sempre un approccio senza esperienza: aggiornamenti guidati dal feedback aiutano in alcuni casi ma danneggiano in altri.

Cosa permette di osservare

Permette di esplorare se agenti che operano in contesti reali, con feedback deboli e ritardati, riescono a trasformare informazioni rumorose in esperienza riutilizzabile, e quali meccanismi di memoria o regole di aggiornamento funzionano meglio o peggiorano il comportamento.

agentiregolamentazionericerca

Dalla fonte

Experience-based self-evolution enables language-model agents to improve their behavior by accumulating and updating experience at test time, yet existing evaluations often assume recurring task patterns and explicit success signals. We introduce \textsc{FinEvolveBench}, a benchmark for self-evolving agents on low-repetition tasks with implicit rewards. The benchmark reconstructs a daily financial information stream over 31 Chinese A-share industry indices and aligns 177,324 public news articles with market observations. Researchers can define prediction horizons over this stream; we evaluate predictive market-sentiment factors against delayed market-adjusted returns after 10, 20, and 40 trading days. Unlike static benchmarks that score each prediction independently, \textsc{FinEvolveBench} interleaves new decisions with delayed outcomes from earlier ones, testing whether agents can con…