{"id":2102,"date":"2026-08-03T19:59:47","date_gmt":"2026-08-03T19:59:47","guid":{"rendered":"https:\/\/convly.ai\/ai-benchmarks\/"},"modified":"2026-08-03T19:59:47","modified_gmt":"2026-08-03T19:59:47","slug":"ai-benchmarks","status":"publish","type":"page","link":"https:\/\/convly.ai\/it\/ai-benchmarks\/","title":{"rendered":"Spiegazione dei benchmark per l\u2019IA (2026): cosa misura ciascuno e chi \u00e8 in testa"},"content":{"rendered":"<p><strong>Un benchmark per l\u2019IA \u00e8 un insieme fisso di compiti utilizzato per valutare le capacit\u00e0 di un modello, in modo che<br \/>\nmodelli diversi possano essere confrontati sullo stesso test.<\/strong> Non esiste un singolo benchmark che<br \/>\nstabilisca quale modello sia il migliore: ciascuno misura un aspetto specifico e molti dei benchmark pi\u00f9 noti<br \/>\nsono ormai quasi saturi. L\u2019approccio pratico consiste nel consultare i due o tre benchmark pi\u00f9 adatti al proprio<br \/>\ncarico di lavoro effettivo e nel considerare con cautela qualsiasi valore riportato come risultato principale.<\/p>\n<h2>Chi \u00e8 attualmente in testa<\/h2>\n<p>Ordinato in base all\u2019Indice di Intelligenza Artificial Analysis, una combinazione di diverse valutazioni indipendenti anzich\u00e9 un singolo test. L\u2019ultima colonna \u00e8 quella che la maggior parte dei confronti trascura: il punteggio<br \/>\ndiviso per il costo combinato, ovvero ci\u00f2 che si acquista effettivamente.<br \/>\nPunteggio di intelligenza<\/p>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-lead\">\n    <thead><tr><th>#<\/th><th>Modello<\/th><th>Sviluppatore<\/th><th>Punteggio per dollaro<\/th>\n      <th>Costo combinato ($\/1 milione)<\/th><th>I punteggi sono espressi sulla scala dell\u2019Indice di Intelligenza Artificial Analysis, una combinazione di diverse valutazioni indipendenti anzich\u00e9 un singolo test \u2014 ed \u00e8 proprio questo il modo corretto di interpretare un'affermazione generica del tipo \"miglior modello\". La migliore soluzione open-weight \u00e8<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"#\">1<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>61<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.8<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">2<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-fable-5\/\">Claude Fable 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>60<\/strong><\/td>\n        <td data-label=\"Blended\">$18.00<\/td>\n        <td data-label=\"Score per $\">3.3<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">3<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>59<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">4<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/kimi-k3\/\">Kimi K3<\/a> <span class=\"cbm-tag\">pesi aperti<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>57<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">10.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">5<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-opus-4-8\/\">Claude Opus 4.8<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>55.7<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.2<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">6<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/gpt-5-5\/\">GPT-5.5<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>54.8<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.5<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">7<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/glm-5-2\/\">GLM 5.2<\/a> <span class=\"cbm-tag\">pesi aperti<\/span><\/td>\n        <td data-label=\"Developer\">Zhipu AI<\/td>\n        <td data-label=\"Score\"><strong>51.1<\/strong><\/td>\n        <td data-label=\"Blended\">$2.00<\/td>\n        <td data-label=\"Score per $\">25.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">8<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/gemini-3-5-flash\/\">Gemini 3.5 Flash<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>50.2<\/strong><\/td>\n        <td data-label=\"Blended\">$3.00<\/td>\n        <td data-label=\"Score per $\">16.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">9<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-sonnet-4-6\/\">Claude Sonnet 4.6<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>47<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">8.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">10<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/gemini-3-1-pro\/\">Gemini 3.1 Pro<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>46.5<\/strong><\/td>\n        <td data-label=\"Blended\">$4.00<\/td>\n        <td data-label=\"Score per $\">11.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">11<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/deepseek-v4-pro\/\">DeepSeek V4-Pro<\/a> <span class=\"cbm-tag\">pesi aperti<\/span><\/td>\n        <td data-label=\"Developer\">DeepSeek<\/td>\n        <td data-label=\"Score\"><strong>44.3<\/strong><\/td>\n        <td data-label=\"Blended\">$0.522<\/td>\n        <td data-label=\"Score per $\">84.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">12<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/kimi-k2-7-code\/\">Kimi K2.7 Code<\/a> <span class=\"cbm-tag\">pesi aperti<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>42<\/strong><\/td>\n        <td data-label=\"Blended\">$0.980<\/td>\n        <td data-label=\"Score per $\">42.9<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">al punteggio di 57. Ordina l\u2019intera lista personalmente sulla\n     <a href=\"https:\/\/convly.ai\/it\/model\/kimi-k3\/\">Kimi K3<\/a>\n     I benchmark rilevanti nel 2026\n     <a href=\"https:\/\/convly.ai\/it\/llm-leaderboard\/\">Classifica LLM<\/a>.<\/p>\n<\/div>\n\n<h2>MMLU (Massive Multitask Language Understanding)<\/h2>\n<h3>Domande a scelta multipla su 57 materie, dall\u2019aritmetica elementare al diritto professionale. Per anni \u00e8 stato il valore di riferimento principale, ma ora rappresenta un problema: i modelli di ultima generazione<\/h3>\n<p>si raggruppano cos\u00ec strettamente ai vertici che le differenze tra loro rientrano nella semplice variabilit\u00e0 statistica. Il MMLU rimane comunque utile per confrontare un piccolo modello open-weight con uno di grandi dimensioni, ma \u00e8 quasi inutile per distinguere<br \/>\ndue modelli di ultima generazione. Considera un punteggio MMLU del 2026 come un semplice controllo del livello minimo, non come un criterio di classificazione.<br \/>\nGPQA (Graduate-Level Google-Proof Q&amp;A)<br \/>\nRedatto da dottorandi specializzati in biologia, fisica e chimica, appositamente progettato perch\u00e9 la ricerca su web non fornisca alcun vantaggio. Risponde a una domanda diversa rispetto al MMLU: non \"il modello ha letto molto?\", ma \"\u00e8 in grado di ragionare su un problema veramente complesso in un campo tecnico?\". Poich\u00e9<br \/>\nresiste sia alla memorizzazione che al recupero di informazioni, il GPQA ha mantenuto meglio del MMLU la sua efficacia discriminante.<\/p>\n<h3>Segnalazioni reali di bug provenienti da repository GitHub reali, valutate in base alla capacit\u00e0 della patch generata dal modello di risolvere effettivamente il<\/h3>\n<p>Scritto da dottorati di ricerca specializzati in biologia, fisica e chimica, e deliberatamente progettato in modo tale che<br \/>\nla ricerca su web non sia d\u2019aiuto. Risponde a una domanda diversa rispetto a MMLU: non \u00abil modello ha letto molto\u00bb, ma \u00ab\u00e8 in grado di ragionare su un problema effettivamente complesso in un campo tecnico?\u00bb. Poich\u00e9<br \/>\nresiste sia alla memorizzazione sia al recupero, si \u00e8 mantenuto meglio di MMLU come discriminatore.<br \/>\nSegnalazioni reali di bug provenienti da repository GitHub reali, valutate in base al fatto che la correzione proposta dal modello renda effettivamente<\/p>\n<h3>SWE-bench Verificato<\/h3>\n<p>Segnalazioni di bug reali provenienti da repository GitHub reali, valutate in base al fatto che la patch del modello renda effettivamente funzionante il<br \/>\ni test del progetto stesso superati. Il sottoinsieme Verified \u00e8 la porzione convalidata manualmente, filtrata per escludere<br \/>\ntask che erano difettosi o impossibili \u2014 motivo per cui \u00e8 consigliabile verificare <em>quale<\/em> SWE-bench una<br \/>\nvendor sta citando. Questo \u00e8 il benchmark pi\u00f9 rilevante per la decisione se si sta scegliendo un<br \/>\nmodello per un agente di programmazione, poich\u00e9 sia il compito sia la valutazione sono autentici. Claude Sonnet 5<br \/>\nriporta l\u201985,2% su SWE-bench Verified e il 63,2% sulla versione pi\u00f9 difficile, SWE-bench Pro.<\/p>\n<h3>Terminal-Bench<\/h3>\n<p>Task agenziali eseguiti in un terminale reale: installare qualcosa, diagnosticare un guasto, scrivere uno script per<br \/>\nrisolverlo. Misura una competenza diversa dallo scrivere una patch \u2014 ovvero la tolleranza a lavori multi-step in cui<br \/>\nil modello deve leggere il proprio output di errore e riprendersi. Claude Sonnet 5 riporta l\u201980,4% su<br \/>\nTerminal-Bench 2.1. Se il tuo caso d\u2019uso prevede un agente autonomo anzich\u00e9 un assistente per codice inline,<br \/>\nquesto benchmark e OSWorld forniscono informazioni pi\u00f9 utili rispetto a SWE-bench.<\/p>\n<h3>OSWorld<\/h3>\n<p>Utilizzo del computer in un vero ambiente desktop \u2014 aprire applicazioni, interagire con le interfacce tramite clic,<br \/>\ncompletare un compito che una persona svolgerebbe con il mouse. I punteggi ottenuti qui sono molto inferiori rispetto a quelli dei<br \/>\nbenchmark testuali in generale, segnale onesto dello stato ancora immaturo degli agenti per l\u2019uso del computer.<br \/>\nClaude Sonnet 5 riporta l\u201981,2% su OSWorld-Verified; Nemotron 3 Nano Omni di NVIDIA,<br \/>\nun modello open da 30 miliardi di parametri, ottiene il 47,4% su OSWorld, risultato ragionevole per le sue dimensioni.<\/p>\n<h3>ARC-AGI<\/h3>\n<p>Puzzle astratti di ragionamento visivo costruiti in modo tale che il pattern-matching sui dati di addestramento non possa<br \/>\nessere trasferito. Ogni task consiste in poche trasformazioni su griglie che il modello deve inferire da un paio di<br \/>\nesempi. ARC-AGI \u00e8 il test pi\u00f9 vicino disponibile nel settore a una vera verifica della capacit\u00e0 di generalizzazione,<br \/>\nanzich\u00e9 di semplice richiamo, motivo per cui i progressi su di esso sono lenti e ogni miglioramento significativo viene considerato un salto importante.<br \/>\nClaude Opus 5 ottiene un punteggio approssimativamente triplo rispetto al secondo miglior modello su ARC-AGI 3.<\/p>\n<h3>L\u2019ultimo esame dell\u2019umanit\u00e0<\/h3>\n<p>Domande redatte da esperti in molteplici discipline, appositamente concepite per resistere alla<br \/>\nsaturazione che ha colpito MMLU. L\u2019obiettivo progettuale \u00e8 un benchmark che rimanga impegnativo anche all\u2019aumentare delle capacit\u00e0 dei modelli,<br \/>\nper cui i punteggi sono intenzionalmente bassi e piccoli miglioramenti assumono un significato rilevante. Va interpretato come discriminatore di frontiera,<br \/>\nnon come misura dell\u2019utilit\u00e0 pratica per attivit\u00e0 ordinarie.<\/p>\n<h3>Indice di Intelligenza Artificial Analysis<\/h3>\n<p>Non \u00e8 un test, ma una combinazione (composite) che integra diverse valutazioni indipendenti in un unico punteggio. Questo \u00e8<br \/>\nil suo valore: un singolo benchmark pu\u00f2 essere oggetto di ottimizzazione mirata, mentre una combinazione \u00e8 molto pi\u00f9 difficile da manipolare. \u00c8 la<br \/>\nscala utilizzata nella tabella sopra. Claude Opus 5 \u00e8 attualmente il leader con 61 punti, seguito da Claude Fable 5 con 60 e GPT-5.6 Sol con 59 \u2014 e Kimi K3 con 57, il risultato migliore finora registrato tra i modelli open-weight, distante soltanto quattro punti dal miglior modello closed.<br \/>\n60 e GPT-5.6 Sol a 59 \u2014 mentre Kimi K3 ottiene 57, il risultato migliore mai registrato per un modello open-weight, posizionandosi<br \/>\na soli quattro punti dal miglior modello closed.<\/p>\n<h2>Come interpretare un claim basato su un benchmark<\/h2>\n<p><strong>Chiediti chi lo ha condotto.<\/strong> Un punteggio dichiarato direttamente dal vendor sulla sua pagina di lancio e una<br \/>\nvalutazione indipendente rappresentano tipi di evidenza differenti. Le classifiche indipendenti applicano lo stesso<br \/>\nframework di valutazione (harness) a tutti i modelli; il vendor invece sceglie liberamente le proprie condizioni.<\/p>\n<p><strong>Verifica la possibile contaminazione.<\/strong> Se le domande di un benchmark risalgono a prima del cutoff temporale dei dati di addestramento di un modello<br \/>\ne sono pubblicamente accessibili, \u00e8 probabile che alcune di esse siano presenti nei dati di addestramento. Questa \u00e8 la<br \/>\nprincipale ragione per cui i benchmark pi\u00f9 vecchi tendono a sovrastimare le prestazioni nel tempo e perch\u00e9 i nuovi vengono progettati per essere<br \/>\n\u00abresistenti a Google\u00bb oppure mantenuti completamente riservati.<\/p>\n<p><strong>Attenzione agli spostamenti dell\u2019obiettivo.<\/strong> \u00abSWE-bench\u00bb senza specificare \u00abVerified\u00bb, un sottoinsieme non nominato,<br \/>\nun numero diverso di tentativi consentiti o un punteggio ottenuto con l\u2019ausilio di strumenti confrontato con uno ottenuto senza \u2014 questi<br \/>\nsono i modi pi\u00f9 comuni in cui un confronto smette di essere equo e omogeneo.<\/p>\n<p><strong>Diffida dalla saturazione.<\/strong> Quando ogni modello serio ottiene un punteggio superiore al 90% su un test, quel<br \/>\ntest ha perso la capacit\u00e0 di discriminare. Differenze di uno o due punti nella fascia alta di un benchmark saturo sono rumore, non segnale.<br \/>\nil benchmark contiene rumore, non segnale.<\/p>\n<p><strong>Il prezzo fa parte del punteggio.<\/strong> Un modello con due punti in pi\u00f9 ma sei volte pi\u00f9 costoso non \u00e8 migliore per la maggior parte dei carichi di lavoro. \u00c8 per questo che la tabella sopra include una colonna \u00abpunteggio per dollaro\u00bb<br \/>\ne perch\u00e9 esiste l\u2019indice<br \/>\nprestazioni-per-costi <a href=\"https:\/\/convly.ai\/it\/ai-price-performance-index-2026\/\">price-performance<br \/>\nindex<\/a> .<\/p>\n<h2>Quale benchmark dovresti davvero considerare?<\/h2>\n<p><strong>Costruire un agente di programmazione:<\/strong> SWE-bench Verified in primo luogo, Terminal-Bench in secondo luogo.<br \/>\nIgnora completamente MMLU.<\/p>\n<p><strong>Creare un agente per l\u2019uso del computer o del desktop:<\/strong> OSWorld, quindi Terminal-Bench.<br \/>\nCi si aspetta che i valori assoluti siano bassi.<\/p>\n<p><strong>Risposta a domande tecniche o scientifiche:<\/strong> GPQA e Humanity\u2019s Last Exam, se<br \/>\nle tue domande sono effettivamente di livello esperto.<\/p>\n<p><strong>Assistente generico o chat:<\/strong> un indice composito \u00e8 pi\u00f9 informativo di qualsiasi<br \/>\nsingolo test, poich\u00e9 nessun benchmark rispecchia la variet\u00e0 delle richieste formulate dagli utenti reali.<\/p>\n<p><strong>Scelta di un modello piccolo da auto-ospitare:<\/strong> i benchmark contano meno dell\u2019adeguatezza. Verifica<br \/>\ncosa pu\u00f2 effettivamente girare sul tuo hardware in primo luogo, quindi confronta<br \/>\n<a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> i punteggi dei benchmark soltanto tra i modelli compatibili.<br \/>\nRisultati di benchmark pubblicati nel nostro database<\/p>\n<h2>Risultati pubblicati<\/h2>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-scores\">\n    <thead><tr><th>Modello<\/th><th>Artificial Analysis Intelligence Index: 59.<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Results\">SWE-Bench Verified 85,2%; SWE-Bench Pro 63,2%; Terminal-Bench 2.1 80,4%; OSWorld-Verified 81,2%.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-sonnet-5\/\">Claude Sonnet 5<\/a><\/td>\n        <td data-label=\"Results\">Artificial Analysis Intelligence Index: 61 (classificato al primo posto su 170 modelli). Pi\u00f9 che raddoppia Opus 4.8 su Frontier-Bench v0.1; circa tre volte il punteggio del modello successivo su ARC-AGI 3.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Results\">OCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/it\/model\/nvidia-nemotron-3-nano-omni\/\">NVIDIA Nemotron 3 Nano Omni<\/a><\/td>\n        <td data-label=\"Results\">Sono elencati esclusivamente i modelli i cui sviluppatori pubblicano cifre specifiche. La mancanza di un dato qui non significa che il modello presti male \u2014 bens\u00ec che non abbiamo verificato un numero pubblicato; informazione questa che, di per s\u00e9, \u00e8 utile conoscere quando un fornitore fa leva su una dichiarazione basata su un benchmark.<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">Che cos\u2019\u00e8 un benchmark per l\u2019IA?<\/p>\n<\/div>\n\n<h2>Domande frequenti<\/h2>\n<div class=\"cbm-faq\">\n<details class=\"cmp-q\">\n<summary>Un insieme fisso di compiti con un metodo di valutazione definito, utilizzato affinch\u00e9 diversi modelli possano essere<\/summary>\n<p>confrontati sugli stessi input. I benchmark spaziano da test a scelta multipla sulla conoscenza, come MMLU,<br \/>\na compiti di tipo agente, come la risoluzione di problemi reali su GitHub tramite SWE-bench; ciascuno misura una porzione ristretta di capacit\u00e0, piuttosto che la qualit\u00e0 complessiva.<br \/>\nQuale benchmark per l\u2019IA \u00e8 il pi\u00f9 affidabile?<br \/>\nNessuno in particolare. Gli indici compositi rappresentano la cifra riassuntiva pi\u00f9 affidabile, perch\u00e9 combinare<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>diverse valutazioni \u00e8 molto pi\u00f9 difficile da manipolare rispetto all\u2019ottimizzazione per un singolo test. Per una decisione specifica, il benchmark pi\u00f9 affidabile \u00e8 quello che pi\u00f9 si avvicina al tuo carico di lavoro effettivo \u2014<\/summary>\n<p>SWE-bench Verified per agenti di programmazione, OSWorld per l\u2019uso del computer, GPQA per il ragionamento tecnico.<br \/>\nQual \u00e8 un buon punteggio MMLU nel 2026?<br \/>\nMMLU \u00e8 ormai quasi saturato tra i modelli di ultima generazione, quindi un punteggio elevato non li distingue pi\u00f9.<br \/>\nResta tuttavia utile per posizionare modelli aperti pi\u00f9 piccoli, nei quali lo scarto di punteggi rimane ampio. Se stai confrontando due modelli di ultima generazione, MMLU non sar\u00e0 in grado di differenziarli, mentre GPQA o un indice composito s\u00ec.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00c8 possibile manipolare i benchmark per l\u2019IA?<\/summary>\n<p>S\u00ec, in due modi. I dati di addestramento possono includere le domande di un benchmark, gonfiandone artificialmente il punteggio senza alcun reale miglioramento delle capacit\u00e0 \u2014 motivo per cui i benchmark pi\u00f9 recenti sono progettati per resistere alla ricerca e alla memorizzazione. Inoltre, le condizioni di valutazione possono essere scelte in modo favorevole: un sottoinsieme diverso, un numero maggiore di tentativi o l\u2019utilizzo di strumenti non confrontato con un modello privo di tali strumenti. Le classifiche indipendenti e gli indici compositi attenuano entrambi questi rischi.<br \/>\nI punteggi dei benchmark predicono le prestazioni nel mondo reale?<br \/>\nIn parte. Benchmark con compiti autentici, come SWE-bench Verified e OSWorld, predicono in modo ragionevole poich\u00e9 il compito \u00e8 identico a quello reale. I benchmark accademici a scelta multipla predicono invece male, perch\u00e9 rispondere a domande d\u2019esame non corrisponde a ci\u00f2 che fanno la maggior parte delle applicazioni. Il predittore pi\u00f9 affidabile rimane comunque una valutazione che costruisci tu stesso sui tuoi dati.<br \/>\nQuale modello open-weight ottiene il punteggio pi\u00f9 alto?<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Kimi K3 con 57 sull\u2019Artificial Analysis Intelligence Index, il risultato pi\u00f9 alto mai registrato per un modello open-weight, a soli quattro punti dal miglior modello closed. La tabella dei leader sopra indica esplicitamente ogni modello open-weight, e l\u2019intero insieme \u00e8 ordinabile nella<\/summary>\n<p>S\u00ec, in due modi. I dati di addestramento possono includere le domande di un benchmark, gonfiando artificialmente i punteggi senza alcun reale miglioramento delle capacit\u00e0 \u2014 motivo per cui i benchmark pi\u00f9 recenti sono progettati per resistere alla ricerca online e<br \/>\nalla memorizzazione. Inoltre, le condizioni di valutazione possono essere scelte in modo favorevole: un sottoinsieme diverso, un numero maggiore di tentativi o l\u2019uso di strumenti confrontato con un modello che non li utilizza. Classifiche indipendenti e<br \/>\nun numero maggiore di tentativi o l\u2019uso di strumenti confrontato con un modello che non li utilizza. Classifiche indipendenti e<br \/>\nleaderboard eseguiti in modo indipendente e<br \/>\ngli indici compositi attenuano entrambi i problemi.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>I punteggi dei benchmark predicono effettivamente le prestazioni nel mondo reale?<\/summary>\n<p>In parte. I benchmark basati su compiti reali, come SWE-bench Verified e OSWorld, offrono previsioni ragionevolmente accurate<br \/>\nperch\u00e9 il compito in questione corrisponde effettivamente a un compito reale. I benchmark accademici a scelta multipla, invece, predicono male le prestazioni<br \/>\npoich\u00e9 rispondere a domande d\u2019esame non \u00e8 ci\u00f2 che fanno la maggior parte delle applicazioni. Il predittore pi\u00f9 affidabile rimane comunque<br \/>\nuna valutazione personalizzata costruita sui propri dati.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Quale modello open-weight ottiene il punteggio pi\u00f9 alto?<\/summary>\n<p>Kimi K3 con 57 punti sull\u2019Artificial Analysis Intelligence Index, il risultato migliore mai registrato per un modello open-weight, a soli quattro punti dal miglior modello closed.<br \/>\nLa classifica riportata sopra evidenzia tutti i modelli open-weight, mentre l\u2019elenco completo \u00e8 ordinabile sulla<br \/>\nmodello open-weight e l\u2019intero insieme \u00e8 ordinabile in base a<br \/>\n<a href=\"https:\/\/convly.ai\/it\/llm-leaderboard\/\">Classifica LLM<\/a>.<\/p>\n<\/details>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>An AI benchmark is a fixed set of tasks used to score a model&#8217;s ability, so that different models can [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"class_list":["post-2102","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/pages\/2102","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2102"}],"version-history":[{"count":0,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/pages\/2102\/revisions"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2102"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}