10 GIU 2026Frontiera3 min

Possiedi l'harness, cambia il modello

Le leaderboard pubbliche comprimono differenze reali. Il verificatore è la variabile nascosta. La conclusione operativa: valuta sul tuo lavoro, possiedi harness e verifica, tratta il modello come commodity.

Un benchmark serio sul coding agentico (DeepSWE: contamination-free, verificato sul comportamento, task lunghi) ha mostrato una cosa che le leaderboard pubbliche nascondono: agenti frontier che su SWE-Bench Pro stanno in una banda di 30 punti si aprono su una forbice di ~70. Le classifiche comprimono differenze reali.

La variabile nascosta è il verificatore. Test suite ereditate producono 8.5% di falsi positivi e 24% di falsi negativi. E gli score sono relativi all'harness: lo stesso modello dentro harness diversi è di fatto un sistema diverso.

Cosa ne faccio, in pratica

  • Valuto i modelli sul mio lavoro, con i miei scenari. Le leaderboard le leggo per curiosità.
  • Possiedo harness, tool e verifica. È lì che vive la qualità.
  • Il modello lo tratto come un componente sostituibile. Quando esce di meglio, lo cambio in un pomeriggio.
Se sei un decision-maker: chiedi al tuo team dove vivono le eval. Se sei un engineer: se la risposta è "nel prompt", hai trovato il problema.

// happy shipping. o happy debugging, dipende dall'harness.