Un benchmark serio sul coding agentico (DeepSWE: contamination-free, verificato sul comportamento, task lunghi) ha mostrato una cosa che le leaderboard pubbliche nascondono: agenti frontier che su SWE-Bench Pro stanno in una banda di 30 punti si aprono su una forbice di ~70. Le classifiche comprimono differenze reali.
La variabile nascosta è il verificatore. Test suite ereditate producono 8.5% di falsi positivi e 24% di falsi negativi. E gli score sono relativi all'harness: lo stesso modello dentro harness diversi è di fatto un sistema diverso.
Cosa ne faccio, in pratica
- Valuto i modelli sul mio lavoro, con i miei scenari. Le leaderboard le leggo per curiosità.
- Possiedo harness, tool e verifica. È lì che vive la qualità.
- Il modello lo tratto come un componente sostituibile. Quando esce di meglio, lo cambio in un pomeriggio.
Se sei un decision-maker: chiedi al tuo team dove vivono le eval. Se sei un engineer: se la risposta è "nel prompt", hai trovato il problema.
// happy shipping. o happy debugging, dipende dall'harness.