Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Spiegazione dei benchmark per l’IA (2026): cosa misura ciascuno e chi è in testa

Un benchmark per l’IA è un insieme fisso di compiti utilizzato per valutare le capacità di un modello, in modo che
modelli diversi possano essere confrontati sullo stesso test.
Non esiste un singolo benchmark che
stabilisca quale modello sia il migliore: ciascuno misura un aspetto specifico e molti dei benchmark più noti
sono ormai quasi saturi. L’approccio pratico consiste nel consultare i due o tre benchmark più adatti al proprio
carico di lavoro effettivo e nel considerare con cautela qualsiasi valore riportato come risultato principale.

Chi è attualmente in testa

Ordinato in base all’Indice di Intelligenza Artificial Analysis, una combinazione di diverse valutazioni indipendenti anziché un singolo test. L’ultima colonna è quella che la maggior parte dei confronti trascura: il punteggio
diviso per il costo combinato, ovvero ciò che si acquista effettivamente.
Punteggio di intelligenza

#ModelloSviluppatorePunteggio per dollaroCosto combinato ($/1 milione)I punteggi sono espressi sulla scala dell’Indice di Intelligenza Artificial Analysis, una combinazione di diverse valutazioni indipendenti anziché un singolo test — ed è proprio questo il modo corretto di interpretare un'affermazione generica del tipo "miglior modello". La migliore soluzione open-weight è
1Claude Opus 5Anthropic61$9.006.8
2Claude Fable 5Anthropic60$18.003.3
3GPT-5.6 SolOpenAI59$10.005.9
4Kimi K3 pesi apertiMoonshot AI57$5.4010.6
5Claude Opus 4.8Anthropic55.7$9.006.2
6GPT-5.5OpenAI54.8$10.005.5
7GLM 5.2 pesi apertiZhipu AI51.1$2.0025.6
8Gemini 3.5 FlashGoogle50.2$3.0016.7
9Claude Sonnet 4.6Anthropic47$5.408.7
10Gemini 3.1 ProGoogle46.5$4.0011.6
11DeepSeek V4-Pro pesi apertiDeepSeek44.3$0.52284.9
12Kimi K2.7 Code pesi apertiMoonshot AI42$0.98042.9

al punteggio di 57. Ordina l’intera lista personalmente sulla Kimi K3 I benchmark rilevanti nel 2026 Classifica LLM.

MMLU (Massive Multitask Language Understanding)

Domande a scelta multipla su 57 materie, dall’aritmetica elementare al diritto professionale. Per anni è stato il valore di riferimento principale, ma ora rappresenta un problema: i modelli di ultima generazione

si raggruppano così strettamente ai vertici che le differenze tra loro rientrano nella semplice variabilità statistica. Il MMLU rimane comunque utile per confrontare un piccolo modello open-weight con uno di grandi dimensioni, ma è quasi inutile per distinguere
due modelli di ultima generazione. Considera un punteggio MMLU del 2026 come un semplice controllo del livello minimo, non come un criterio di classificazione.
GPQA (Graduate-Level Google-Proof Q&A)
Redatto da dottorandi specializzati in biologia, fisica e chimica, appositamente progettato perché la ricerca su web non fornisca alcun vantaggio. Risponde a una domanda diversa rispetto al MMLU: non "il modello ha letto molto?", ma "è in grado di ragionare su un problema veramente complesso in un campo tecnico?". Poiché
resiste sia alla memorizzazione che al recupero di informazioni, il GPQA ha mantenuto meglio del MMLU la sua efficacia discriminante.

Segnalazioni reali di bug provenienti da repository GitHub reali, valutate in base alla capacità della patch generata dal modello di risolvere effettivamente il

Scritto da dottorati di ricerca specializzati in biologia, fisica e chimica, e deliberatamente progettato in modo tale che
la ricerca su web non sia d’aiuto. Risponde a una domanda diversa rispetto a MMLU: non «il modello ha letto molto», ma «è in grado di ragionare su un problema effettivamente complesso in un campo tecnico?». Poiché
resiste sia alla memorizzazione sia al recupero, si è mantenuto meglio di MMLU come discriminatore.
Segnalazioni reali di bug provenienti da repository GitHub reali, valutate in base al fatto che la correzione proposta dal modello renda effettivamente

SWE-bench Verificato

Segnalazioni di bug reali provenienti da repository GitHub reali, valutate in base al fatto che la patch del modello renda effettivamente funzionante il
i test del progetto stesso superati. Il sottoinsieme Verified è la porzione convalidata manualmente, filtrata per escludere
task che erano difettosi o impossibili — motivo per cui è consigliabile verificare quale SWE-bench una
vendor sta citando. Questo è il benchmark più rilevante per la decisione se si sta scegliendo un
modello per un agente di programmazione, poiché sia il compito sia la valutazione sono autentici. Claude Sonnet 5
riporta l’85,2% su SWE-bench Verified e il 63,2% sulla versione più difficile, SWE-bench Pro.

Terminal-Bench

Task agenziali eseguiti in un terminale reale: installare qualcosa, diagnosticare un guasto, scrivere uno script per
risolverlo. Misura una competenza diversa dallo scrivere una patch — ovvero la tolleranza a lavori multi-step in cui
il modello deve leggere il proprio output di errore e riprendersi. Claude Sonnet 5 riporta l’80,4% su
Terminal-Bench 2.1. Se il tuo caso d’uso prevede un agente autonomo anziché un assistente per codice inline,
questo benchmark e OSWorld forniscono informazioni più utili rispetto a SWE-bench.

OSWorld

Utilizzo del computer in un vero ambiente desktop — aprire applicazioni, interagire con le interfacce tramite clic,
completare un compito che una persona svolgerebbe con il mouse. I punteggi ottenuti qui sono molto inferiori rispetto a quelli dei
benchmark testuali in generale, segnale onesto dello stato ancora immaturo degli agenti per l’uso del computer.
Claude Sonnet 5 riporta l’81,2% su OSWorld-Verified; Nemotron 3 Nano Omni di NVIDIA,
un modello open da 30 miliardi di parametri, ottiene il 47,4% su OSWorld, risultato ragionevole per le sue dimensioni.

ARC-AGI

Puzzle astratti di ragionamento visivo costruiti in modo tale che il pattern-matching sui dati di addestramento non possa
essere trasferito. Ogni task consiste in poche trasformazioni su griglie che il modello deve inferire da un paio di
esempi. ARC-AGI è il test più vicino disponibile nel settore a una vera verifica della capacità di generalizzazione,
anziché di semplice richiamo, motivo per cui i progressi su di esso sono lenti e ogni miglioramento significativo viene considerato un salto importante.
Claude Opus 5 ottiene un punteggio approssimativamente triplo rispetto al secondo miglior modello su ARC-AGI 3.

L’ultimo esame dell’umanità

Domande redatte da esperti in molteplici discipline, appositamente concepite per resistere alla
saturazione che ha colpito MMLU. L’obiettivo progettuale è un benchmark che rimanga impegnativo anche all’aumentare delle capacità dei modelli,
per cui i punteggi sono intenzionalmente bassi e piccoli miglioramenti assumono un significato rilevante. Va interpretato come discriminatore di frontiera,
non come misura dell’utilità pratica per attività ordinarie.

Indice di Intelligenza Artificial Analysis

Non è un test, ma una combinazione (composite) che integra diverse valutazioni indipendenti in un unico punteggio. Questo è
il suo valore: un singolo benchmark può essere oggetto di ottimizzazione mirata, mentre una combinazione è molto più difficile da manipolare. È la
scala utilizzata nella tabella sopra. Claude Opus 5 è attualmente il leader con 61 punti, seguito da Claude Fable 5 con 60 e GPT-5.6 Sol con 59 — e Kimi K3 con 57, il risultato migliore finora registrato tra i modelli open-weight, distante soltanto quattro punti dal miglior modello closed.
60 e GPT-5.6 Sol a 59 — mentre Kimi K3 ottiene 57, il risultato migliore mai registrato per un modello open-weight, posizionandosi
a soli quattro punti dal miglior modello closed.

Come interpretare un claim basato su un benchmark

Chiediti chi lo ha condotto. Un punteggio dichiarato direttamente dal vendor sulla sua pagina di lancio e una
valutazione indipendente rappresentano tipi di evidenza differenti. Le classifiche indipendenti applicano lo stesso
framework di valutazione (harness) a tutti i modelli; il vendor invece sceglie liberamente le proprie condizioni.

Verifica la possibile contaminazione. Se le domande di un benchmark risalgono a prima del cutoff temporale dei dati di addestramento di un modello
e sono pubblicamente accessibili, è probabile che alcune di esse siano presenti nei dati di addestramento. Questa è la
principale ragione per cui i benchmark più vecchi tendono a sovrastimare le prestazioni nel tempo e perché i nuovi vengono progettati per essere
«resistenti a Google» oppure mantenuti completamente riservati.

Attenzione agli spostamenti dell’obiettivo. «SWE-bench» senza specificare «Verified», un sottoinsieme non nominato,
un numero diverso di tentativi consentiti o un punteggio ottenuto con l’ausilio di strumenti confrontato con uno ottenuto senza — questi
sono i modi più comuni in cui un confronto smette di essere equo e omogeneo.

Diffida dalla saturazione. Quando ogni modello serio ottiene un punteggio superiore al 90% su un test, quel
test ha perso la capacità di discriminare. Differenze di uno o due punti nella fascia alta di un benchmark saturo sono rumore, non segnale.
il benchmark contiene rumore, non segnale.

Il prezzo fa parte del punteggio. Un modello con due punti in più ma sei volte più costoso non è migliore per la maggior parte dei carichi di lavoro. È per questo che la tabella sopra include una colonna «punteggio per dollaro»
e perché esiste l’indice
prestazioni-per-costi price-performance
index
.

Quale benchmark dovresti davvero considerare?

Costruire un agente di programmazione: SWE-bench Verified in primo luogo, Terminal-Bench in secondo luogo.
Ignora completamente MMLU.

Creare un agente per l’uso del computer o del desktop: OSWorld, quindi Terminal-Bench.
Ci si aspetta che i valori assoluti siano bassi.

Risposta a domande tecniche o scientifiche: GPQA e Humanity’s Last Exam, se
le tue domande sono effettivamente di livello esperto.

Assistente generico o chat: un indice composito è più informativo di qualsiasi
singolo test, poiché nessun benchmark rispecchia la varietà delle richieste formulate dagli utenti reali.

Scelta di un modello piccolo da auto-ospitare: i benchmark contano meno dell’adeguatezza. Verifica
cosa può effettivamente girare sul tuo hardware in primo luogo, quindi confronta
Calcolatore VRAM i punteggi dei benchmark soltanto tra i modelli compatibili.
Risultati di benchmark pubblicati nel nostro database

Risultati pubblicati

ModelloArtificial Analysis Intelligence Index: 59.
GPT-5.6 SolSWE-Bench Verified 85,2%; SWE-Bench Pro 63,2%; Terminal-Bench 2.1 80,4%; OSWorld-Verified 81,2%.
Claude Sonnet 5Artificial Analysis Intelligence Index: 61 (classificato al primo posto su 170 modelli). Più che raddoppia Opus 4.8 su Frontier-Bench v0.1; circa tre volte il punteggio del modello successivo su ARC-AGI 3.
Claude Opus 5OCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39
NVIDIA Nemotron 3 Nano OmniSono elencati esclusivamente i modelli i cui sviluppatori pubblicano cifre specifiche. La mancanza di un dato qui non significa che il modello presti male — bensì che non abbiamo verificato un numero pubblicato; informazione questa che, di per sé, è utile conoscere quando un fornitore fa leva su una dichiarazione basata su un benchmark.

Che cos’è un benchmark per l’IA?

Domande frequenti

Un insieme fisso di compiti con un metodo di valutazione definito, utilizzato affinché diversi modelli possano essere

confrontati sugli stessi input. I benchmark spaziano da test a scelta multipla sulla conoscenza, come MMLU,
a compiti di tipo agente, come la risoluzione di problemi reali su GitHub tramite SWE-bench; ciascuno misura una porzione ristretta di capacità, piuttosto che la qualità complessiva.
Quale benchmark per l’IA è il più affidabile?
Nessuno in particolare. Gli indici compositi rappresentano la cifra riassuntiva più affidabile, perché combinare

diverse valutazioni è molto più difficile da manipolare rispetto all’ottimizzazione per un singolo test. Per una decisione specifica, il benchmark più affidabile è quello che più si avvicina al tuo carico di lavoro effettivo —

SWE-bench Verified per agenti di programmazione, OSWorld per l’uso del computer, GPQA per il ragionamento tecnico.
Qual è un buon punteggio MMLU nel 2026?
MMLU è ormai quasi saturato tra i modelli di ultima generazione, quindi un punteggio elevato non li distingue più.
Resta tuttavia utile per posizionare modelli aperti più piccoli, nei quali lo scarto di punteggi rimane ampio. Se stai confrontando due modelli di ultima generazione, MMLU non sarà in grado di differenziarli, mentre GPQA o un indice composito sì.

È possibile manipolare i benchmark per l’IA?

Sì, in due modi. I dati di addestramento possono includere le domande di un benchmark, gonfiandone artificialmente il punteggio senza alcun reale miglioramento delle capacità — motivo per cui i benchmark più recenti sono progettati per resistere alla ricerca e alla memorizzazione. Inoltre, le condizioni di valutazione possono essere scelte in modo favorevole: un sottoinsieme diverso, un numero maggiore di tentativi o l’utilizzo di strumenti non confrontato con un modello privo di tali strumenti. Le classifiche indipendenti e gli indici compositi attenuano entrambi questi rischi.
I punteggi dei benchmark predicono le prestazioni nel mondo reale?
In parte. Benchmark con compiti autentici, come SWE-bench Verified e OSWorld, predicono in modo ragionevole poiché il compito è identico a quello reale. I benchmark accademici a scelta multipla predicono invece male, perché rispondere a domande d’esame non corrisponde a ciò che fanno la maggior parte delle applicazioni. Il predittore più affidabile rimane comunque una valutazione che costruisci tu stesso sui tuoi dati.
Quale modello open-weight ottiene il punteggio più alto?

Kimi K3 con 57 sull’Artificial Analysis Intelligence Index, il risultato più alto mai registrato per un modello open-weight, a soli quattro punti dal miglior modello closed. La tabella dei leader sopra indica esplicitamente ogni modello open-weight, e l’intero insieme è ordinabile nella

Sì, in due modi. I dati di addestramento possono includere le domande di un benchmark, gonfiando artificialmente i punteggi senza alcun reale miglioramento delle capacità — motivo per cui i benchmark più recenti sono progettati per resistere alla ricerca online e
alla memorizzazione. Inoltre, le condizioni di valutazione possono essere scelte in modo favorevole: un sottoinsieme diverso, un numero maggiore di tentativi o l’uso di strumenti confrontato con un modello che non li utilizza. Classifiche indipendenti e
un numero maggiore di tentativi o l’uso di strumenti confrontato con un modello che non li utilizza. Classifiche indipendenti e
leaderboard eseguiti in modo indipendente e
gli indici compositi attenuano entrambi i problemi.

I punteggi dei benchmark predicono effettivamente le prestazioni nel mondo reale?

In parte. I benchmark basati su compiti reali, come SWE-bench Verified e OSWorld, offrono previsioni ragionevolmente accurate
perché il compito in questione corrisponde effettivamente a un compito reale. I benchmark accademici a scelta multipla, invece, predicono male le prestazioni
poiché rispondere a domande d’esame non è ciò che fanno la maggior parte delle applicazioni. Il predittore più affidabile rimane comunque
una valutazione personalizzata costruita sui propri dati.

Quale modello open-weight ottiene il punteggio più alto?

Kimi K3 con 57 punti sull’Artificial Analysis Intelligence Index, il risultato migliore mai registrato per un modello open-weight, a soli quattro punti dal miglior modello closed.
La classifica riportata sopra evidenzia tutti i modelli open-weight, mentre l’elenco completo è ordinabile sulla
modello open-weight e l’intero insieme è ordinabile in base a
Classifica LLM.

Scroll to Top
Featured on There's An AI For That