Why we no longer evaluate SWE-bench Verified
Di cosa parla
OpenAI dice di aver smesso di valutare i modelli di programmazione con SWE-bench Verified perché il test è diventato contaminato e dà una misura fuorviante del progresso. Secondo la loro analisi, alcune domande del test compaiono nei dati usati per addestrare i modelli, cioè i modelli potrebbero aver già visto quelle risposte. Per questo propongono di passare a SWE-bench Pro.
Cosa permette di osservare
Questo permette di esplorare come capire se un test misura davvero il miglioramento dei modelli di codice, come riconoscere quando un test è “contaminato” e quali alternative scegliere per ottenere valutazioni più affidabili.
Dalla fonte
SWE-bench Verified is increasingly contaminated and mismeasures frontier coding progress. Our analysis shows flawed tests and training leakage. We recommend SWE-bench Pro.