Nel 2026, Claude Opus 4.8 guida il nostro indice di intelligenza con un punteggio di 55,7, appena davanti a GPT-5.5 di OpenAI (54,8). Gemini 3.5 Flash di Google (50,2) e GLM-5.2, modello open-weight (51,1), seguono a breve distanza, mentre Gemini 3.1 Pro (46,5) e DeepSeek V4 Pro (44,3) completano la frontiera. Se la scelta ricade effettivamente tra i due assistenti piuttosto che tra i modelli grezzi, il confronto Claude vs ChatGPT analizza tale confronto testa a testa. Il singolo modello «migliore» dipende da come si bilanciano intelligenza, prezzo e velocità.
La colonna Intelligenza riporta un punteggio composito da 0 a 100, calcolato secondo l'Artificial Analysis Intelligence Index v4.1, che integra nove valutazioni rigorose che coprono ragionamento, programmazione, utilizzo strumentale da parte di agenti e conoscenze scientifiche. Un punteggio più alto indica maggiore intelligenza, ma uno scarto di due punti nella fascia più alta raramente incide sulla qualità dell’output reale; pertanto, è preferibile considerare gruppi di modelli come sostanzialmente equivalenti, anziché interpretare piccole differenze come decisivi.
Valutare l’intelligenza insieme a prezzo e velocità. Un modello di frontiera come Opus 4.8 costa molto di più per token rispetto a DeepSeek V4 Flash (40,3) o GLM-5.2, i quali offrono il 70–90% dell’intelligenza a una frazione del costo. Per carichi di lavoro ad alto volume o sensibili alla latenza, un modello più economico e veloce risulta generalmente preferibile; per i compiti più impegnativi di ragionamento e di tipo agente, invece, la vetta della classifica giustifica il suo sovrapprezzo. Ordinare i risultati in base alla metrica più adatta al proprio caso d’uso.
| # | Modello ↕ | Sviluppatore | Intelligenza ↕ | Contesto ↕ | Input $/1 milione ↕ | Output $/1 milione ↕ | Open weights |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 61 | 1 milione | $5.00 | $25.00 | No |
| 2 | GPT-6 Astra | OpenAI | 61 | 1,05 milioni | $10.00 | $50.00 | No |
| 3 | Claude Fable 5 | Anthropic | 60 | 1 milione | $10.00 | $50.00 | No |
| 4 | GPT-5.6 Sol | OpenAI | 59 | 1,05 milioni | $5.00 | $30.00 | No |
| 5 | Kimi K3 | Moonshot AI | 57 | 1 milione | $3.00 | $15.00 | Sì |
| 6 | Claude Opus 4.8 | Anthropic | 55.7 | 1 milione | $5.00 | $25.00 | No |
| 7 | GPT-5.5 | OpenAI | 54.8 | 1,05 milioni | $5.00 | $30.00 | No |
| 8 | GLM 5.2 | Zhipu AI | 51.1 | 1 milione | $1.40 | $4.40 | Sì |
| 9 | Gemini 3.5 Flash | 50.2 | 1 milione | $1.50 | $9.00 | No | |
| 10 | Claude Sonnet 4.6 | Anthropic | 47 | 1 milione | $3.00 | $15.00 | No |
| 11 | Gemini 3.1 Pro | 46.5 | 1,05 milioni | $2.00 | $12.00 | No | |
| 12 | DeepSeek V4-Pro | DeepSeek | 44.3 | 1 milione | $0.44 | $0.87 | Sì |
| 13 | Kimi K2.7 Code | Moonshot AI | 42 | 256K | $0.60 | $2.50 | Sì |
| 14 | DeepSeek V4-Flash | DeepSeek | 40.3 | 1 milione | $0.14 | $0.28 | Sì |
| 15 | Claude Haiku 4.5 | Anthropic | 37 | 200.000 | $1.00 | $5.00 | No |
| 16 | DeepSeek R1 | DeepSeek | 20.1 | 128K | $0.50 | $2.15 | Sì |
| 17 | Mistral Large 3 | Mistral AI | 15.9 | 256K | $2.00 | $6.00 | Sì |
| 18 | Llama 4 Maverick | Meta | 14.3 | 1 milione | $0.20 | $0.80 | Sì |
| 19 | Qwen3 235B-A22B | Alibaba | 13 | 128K | $0.45 | $1.80 | Sì |
| 20 | Qwen3 32B | Alibaba | 12 | 128K | $0.08 | $0.28 | Sì |
| 21 | Llama 4 Scout | Meta | 10.0 | 10 milioni | $0.10 | $0.30 | Sì |
| 22 | Gemma 3 27B | 7.4 | 128K | $0.08 | $0.16 | Sì | |
| 23 | Phi-4 | Microsoft | 4.9 | 16K | $0.07 | $0.14 | Sì |
| 24 | Claude Opus 5.5 | Anthropic | — | — | $4.00 | $20.00 | No |
| 25 | Claude Sonnet 5 | Anthropic | — | 1 milione | $2.00 | $10.00 | No |
| 26 | Claude Sonnet 5.5 | Anthropic | — | — | $2.00 | $10.00 | No |
| 27 | DeepSeek R1 Distill Llama 70B | DeepSeek | — | 128K | $0.80 | $0.80 | Sì |
| 28 | Gemini 2.5 Pro | — | 1 milione (1.048.576 token) | $1.25 | $10.00 | No | |
| 29 | Gemini 3.6 Flash | — | 1 milione | $1.50 | $7.50 | No | |
| 30 | Gemini 3.8 Flash | — | 1 milione | $0.75 | $3.75 | No | |
| 31 | Gemini 4 Argon | Google DeepMind | — | — | $2.00 | $10.00 | No |
| 32 | Gemma 3 12B | — | 128K | $0.05 | $0.15 | Sì | |
| 33 | Gemma 3 4B | — | 128K | $0.05 | $0.10 | Sì | |
| 34 | GPT-6 Luna | OpenAI | — | 1,05 milioni | $0.10 | $0.50 | No |
| 35 | GPT-6 Sol | OpenAI | — | 1,05 milioni | $2.00 | $10.00 | No |
| 36 | GPT-6.1 Sol | OpenAI | — | — | $2.00 | $10.00 | No |
| 37 | Grok 4 | xAI | — | 256.000 token | $3.00 | $15.00 | No |
| 38 | Kling 2.5 Turbo Pro | Kuaishou | — | — | — | — | No |
| 39 | Llama 3.1 8B | Meta | — | 128K | $0.02 | $0.03 | Sì |
| 40 | Llama 3.3 70B | Meta | — | 128K | $0.10 | $0.32 | Sì |
| 41 | MiniMax H3 (Hailuo 3.0) | MiniMax | — | — | — | — | Sì |
| 42 | Mistral 7B | Mistral AI | — | 32K | $0.02 | $0.03 | Sì |
| 43 | Mistral NeMo 12B | Mistral AI | — | 128K | $0.02 | $0.04 | Sì |
| 44 | NVIDIA Nemotron 3 Nano Omni | NVIDIA | — | 256K | — | — | Sì |
| 45 | Qwen3 14B | Alibaba | — | 128K | $0.12 | $0.24 | Sì |
| 46 | Qwen3 30B-A3B | Alibaba | — | 128K | $0.12 | $0.50 | Sì |
| 47 | Qwen3 8B | Alibaba | — | 128K | $0.04 | $0.14 | Sì |
| 48 | Seedance 2.5 | ByteDance | — | — | — | — | No |
| 49 | Sora 2 | OpenAI | — | — | — | — | No |
| 50 | Sora 2 Pro | OpenAI | — | — | — | — | No |
| 51 | Veo 3.1 | — | — | — | — | No | |
| 52 | Wan 2.5 | Alibaba | — | — | — | — | No |
Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.
Domande frequenti
Qual è attualmente il miglior LLM?
A metà 2026, Claude Opus 4.8 è il modello con il punteggio più alto sull’Artificial Analysis Intelligence Index (55,7), leggermente davanti a GPT-5.5 (54,8). Entrambi eccellono in ragionamento, programmazione e compiti agenziali, quindi la scelta pratica tra loro dipende solitamente da fattori come prezzo, velocità ed ecosistema, piuttosto che da una differenza significativa di intelligenza.
Qual è il modello open-source più intelligente?
GLM-5.2 è attualmente il modello open-weight più intelligente, ottenendo un punteggio di 51,1 sull’indice di intelligenza — superando DeepSeek V4 Pro (44,3) e DeepSeek V4 Flash (40,3). Ciò colloca i migliori modelli open-source a circa quattro punti dai modelli proprietari di frontiera come GPT-5.5, pur rimanendo gratuiti per l’auto-hosting o per l’esecuzione tramite API a basso costo.
Quale modello AI offre il miglior rapporto qualità-prezzo?
DeepSeek V4 Flash e GLM-5.2 offrono il miglior rapporto intelligenza/costo. DeepSeek V4 Flash ottiene un punteggio di 40,3 a una frazione minima del prezzo di Opus 4.8, garantendo circa il 70% del punteggio massimo a una percentuale molto ridotta del costo. Per carichi di lavoro ad alto volume e sensibili al budget, questi modelli open sono inequivocabilmente i leader in termini di valore.
Come viene calcolato il punteggio di intelligenza?
I nostri punteggi riflettono l’Artificial Analysis Intelligence Index v4.1, un indice composito da 0 a 100 derivato da nove valutazioni rigorose — tra cui Humanity’s Last Exam, GPQA Diamond, Terminal-Bench, SciCode e compiti di utilizzo strumentale da parte di agenti. Misura in un unico numero il ragionamento, le conoscenze, la capacità di programmazione e le abilità agenziali, quindi un punteggio più alto indica una maggiore competenza complessiva su compiti difficili e reali.
