Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

Classifica dei LLM 2026 — Indice di Intelligenza dei Modelli AI

Nel 2026, Claude Opus 4.8 guida il nostro indice di intelligenza con un punteggio di 55,7, appena davanti a GPT-5.5 di OpenAI (54,8). Gemini 3.5 Flash di Google (50,2) e GLM-5.2, modello open-weight (51,1), seguono a breve distanza, mentre Gemini 3.1 Pro (46,5) e DeepSeek V4 Pro (44,3) completano la frontiera. Se la scelta ricade effettivamente tra i due assistenti piuttosto che tra i modelli grezzi, il confronto Claude vs ChatGPT analizza tale confronto testa a testa. Il singolo modello «migliore» dipende da come si bilanciano intelligenza, prezzo e velocità.

La colonna Intelligenza riporta un punteggio composito da 0 a 100, calcolato secondo l'Artificial Analysis Intelligence Index v4.1, che integra nove valutazioni rigorose che coprono ragionamento, programmazione, utilizzo strumentale da parte di agenti e conoscenze scientifiche. Un punteggio più alto indica maggiore intelligenza, ma uno scarto di due punti nella fascia più alta raramente incide sulla qualità dell’output reale; pertanto, è preferibile considerare gruppi di modelli come sostanzialmente equivalenti, anziché interpretare piccole differenze come decisivi.

Valutare l’intelligenza insieme a prezzo e velocità. Un modello di frontiera come Opus 4.8 costa molto di più per token rispetto a DeepSeek V4 Flash (40,3) o GLM-5.2, i quali offrono il 70–90% dell’intelligenza a una frazione del costo. Per carichi di lavoro ad alto volume o sensibili alla latenza, un modello più economico e veloce risulta generalmente preferibile; per i compiti più impegnativi di ragionamento e di tipo agente, invece, la vetta della classifica giustifica il suo sovrapprezzo. Ordinare i risultati in base alla metrica più adatta al proprio caso d’uso.

# Modello ↕ Sviluppatore Intelligenza ↕ Contesto ↕ Input $/1 milione ↕ Output $/1 milione ↕ Open weights
1 Claude Opus 5 Anthropic 61 1 milione $5.00 $25.00 No
2 GPT-6 Astra OpenAI 61 1,05 milioni $10.00 $50.00 No
3 Claude Fable 5 Anthropic 60 1 milione $10.00 $50.00 No
4 GPT-5.6 Sol OpenAI 59 1,05 milioni $5.00 $30.00 No
5 Kimi K3 Moonshot AI 57 1 milione $3.00 $15.00 Sì
6 Claude Opus 4.8 Anthropic 55.7 1 milione $5.00 $25.00 No
7 GPT-5.5 OpenAI 54.8 1,05 milioni $5.00 $30.00 No
8 GLM 5.2 Zhipu AI 51.1 1 milione $1.40 $4.40 Sì
9 Gemini 3.5 Flash Google 50.2 1 milione $1.50 $9.00 No
10 Claude Sonnet 4.6 Anthropic 47 1 milione $3.00 $15.00 No
11 Gemini 3.1 Pro Google 46.5 1,05 milioni $2.00 $12.00 No
12 DeepSeek V4-Pro DeepSeek 44.3 1 milione $0.44 $0.87 Sì
13 Kimi K2.7 Code Moonshot AI 42 256K $0.60 $2.50 Sì
14 DeepSeek V4-Flash DeepSeek 40.3 1 milione $0.14 $0.28 Sì
15 Claude Haiku 4.5 Anthropic 37 200.000 $1.00 $5.00 No
16 DeepSeek R1 DeepSeek 20.1 128K $0.50 $2.15 Sì
17 Mistral Large 3 Mistral AI 15.9 256K $2.00 $6.00 Sì
18 Llama 4 Maverick Meta 14.3 1 milione $0.20 $0.80 Sì
19 Qwen3 235B-A22B Alibaba 13 128K $0.45 $1.80 Sì
20 Qwen3 32B Alibaba 12 128K $0.08 $0.28 Sì
21 Llama 4 Scout Meta 10.0 10 milioni $0.10 $0.30 Sì
22 Gemma 3 27B Google 7.4 128K $0.08 $0.16 Sì
23 Phi-4 Microsoft 4.9 16K $0.07 $0.14 Sì
24 Claude Opus 5.5 Anthropic — — $4.00 $20.00 No
25 Claude Sonnet 5 Anthropic — 1 milione $2.00 $10.00 No
26 Claude Sonnet 5.5 Anthropic — — $2.00 $10.00 No
27 DeepSeek R1 Distill Llama 70B DeepSeek — 128K $0.80 $0.80 Sì
28 Gemini 2.5 Pro Google — 1 milione (1.048.576 token) $1.25 $10.00 No
29 Gemini 3.6 Flash Google — 1 milione $1.50 $7.50 No
30 Gemini 3.8 Flash Google — 1 milione $0.75 $3.75 No
31 Gemini 4 Argon Google DeepMind — — $2.00 $10.00 No
32 Gemma 3 12B Google — 128K $0.05 $0.15 Sì
33 Gemma 3 4B Google — 128K $0.05 $0.10 Sì
34 GPT-6 Luna OpenAI — 1,05 milioni $0.10 $0.50 No
35 GPT-6 Sol OpenAI — 1,05 milioni $2.00 $10.00 No
36 GPT-6.1 Sol OpenAI — — $2.00 $10.00 No
37 Grok 4 xAI — 256.000 token $3.00 $15.00 No
38 Kling 2.5 Turbo Pro Kuaishou — — — — No
39 Llama 3.1 8B Meta — 128K $0.02 $0.03 Sì
40 Llama 3.3 70B Meta — 128K $0.10 $0.32 Sì
41 MiniMax H3 (Hailuo 3.0) MiniMax — — — — Sì
42 Mistral 7B Mistral AI — 32K $0.02 $0.03 Sì
43 Mistral NeMo 12B Mistral AI — 128K $0.02 $0.04 Sì
44 NVIDIA Nemotron 3 Nano Omni NVIDIA — 256K — — Sì
45 Qwen3 14B Alibaba — 128K $0.12 $0.24 Sì
46 Qwen3 30B-A3B Alibaba — 128K $0.12 $0.50 Sì
47 Qwen3 8B Alibaba — 128K $0.04 $0.14 Sì
48 Seedance 2.5 ByteDance — — — — No
49 Sora 2 OpenAI — — — — No
50 Sora 2 Pro OpenAI — — — — No
51 Veo 3.1 Google — — — — No
52 Wan 2.5 Alibaba — — — — No

Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.

Domande frequenti

Qual è attualmente il miglior LLM?

A metà 2026, Claude Opus 4.8 è il modello con il punteggio più alto sull’Artificial Analysis Intelligence Index (55,7), leggermente davanti a GPT-5.5 (54,8). Entrambi eccellono in ragionamento, programmazione e compiti agenziali, quindi la scelta pratica tra loro dipende solitamente da fattori come prezzo, velocità ed ecosistema, piuttosto che da una differenza significativa di intelligenza.

Qual è il modello open-source più intelligente?

GLM-5.2 è attualmente il modello open-weight più intelligente, ottenendo un punteggio di 51,1 sull’indice di intelligenza — superando DeepSeek V4 Pro (44,3) e DeepSeek V4 Flash (40,3). Ciò colloca i migliori modelli open-source a circa quattro punti dai modelli proprietari di frontiera come GPT-5.5, pur rimanendo gratuiti per l’auto-hosting o per l’esecuzione tramite API a basso costo.

Quale modello AI offre il miglior rapporto qualità-prezzo?

DeepSeek V4 Flash e GLM-5.2 offrono il miglior rapporto intelligenza/costo. DeepSeek V4 Flash ottiene un punteggio di 40,3 a una frazione minima del prezzo di Opus 4.8, garantendo circa il 70% del punteggio massimo a una percentuale molto ridotta del costo. Per carichi di lavoro ad alto volume e sensibili al budget, questi modelli open sono inequivocabilmente i leader in termini di valore.

Come viene calcolato il punteggio di intelligenza?

I nostri punteggi riflettono l’Artificial Analysis Intelligence Index v4.1, un indice composito da 0 a 100 derivato da nove valutazioni rigorose — tra cui Humanity’s Last Exam, GPQA Diamond, Terminal-Bench, SciCode e compiti di utilizzo strumentale da parte di agenti. Misura in un unico numero il ragionamento, le conoscenze, la capacità di programmazione e le abilità agenziali, quindi un punteggio più alto indica una maggiore competenza complessiva su compiti difficili e reali.

Scroll to Top