AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
opinione · OpenAI

Why we no longer evaluate SWE-bench Verified

Di cosa parla

OpenAI dice di aver smesso di valutare i modelli di programmazione con SWE-bench Verified perché il test è diventato contaminato e dà una misura fuorviante del progresso. Secondo la loro analisi, alcune domande del test compaiono nei dati usati per addestrare i modelli, cioè i modelli potrebbero aver già visto quelle risposte. Per questo propongono di passare a SWE-bench Pro.

Cosa permette di osservare

Questo permette di esplorare come capire se un test misura davvero il miglioramento dei modelli di codice, come riconoscere quando un test è “contaminato” e quali alternative scegliere per ottenere valutazioni più affidabili.

regolamentazione

Dalla fonte

SWE-bench Verified is increasingly contaminated and mismeasures frontier coding progress. Our analysis shows flawed tests and training leakage. We recommend SWE-bench Pro.