Thursday, 24 September 2026 | Updating Daily AI insight, written for builders

Llama 4 Scout contro Llama 4 Maverick: specifiche, prezzi e quale scegliere (2026)

Aggiornato · Pubblicato originariamente il 23 giugno 2026

Meta ha rilasciato Llama 4 Scout e Llama 4 Maverick nello stesso giorno — 5 aprile 2025 — ed è facile interpretarli come «il piccolo» e «il grande». Questa lettura è errata nel modo che conta di più per la tua fattura. Entrambi i modelli attivano esattamente 17 miliardi di parametri per token. Ciò che differisce è la dimensione del pool di esperti da cui vengono estratti quei 17 miliardi: 16 esperti in Scout, 128 in Maverick. Tutto il resto — il divario di prezzo, il divario hardware, il divario nei benchmark — discende direttamente da questa scelta architetturale.

Ciò significa anche che l’intuizione abituale «modello più grande, risposte migliori» non funziona qui. Maverick ha un numero totale di parametri 3,7 volte superiore, ma non offre prestazioni 3,7 volte migliori; anzi, su alcuni benchmark non offre nemmeno prestazioni superiori. Di seguito trovi il confronto completo, basato sulla scheda tecnica ufficiale di Meta e sui prezzi effettivi applicati dai provider — incluso il parametro più citato e, di fatto, irraggiungibile nella pratica.

Punti chiave

  • Stesso numero di parametri attivi, diversi pool di esperti. Scout ha 109 miliardi di parametri totali / 17 miliardi attivi distribuiti su 16 esperti. Maverick ha 400 miliardi di parametri totali / 17 miliardi attivi distribuiti su 128 esperti. Il calcolo necessario per token è quasi identico; l’impronta di memoria no.
  • I 10 milioni di token di contesto di Scout sono reali, ma quasi certamente non potrai noleggiarli. Meta ha addestrato Scout per 10 milioni di token. I provider ospitati offrono tra i 128K e circa 1,3 milioni di token. I 10 milioni completi richiedono l’auto-hosting e una cache KV enorme.
  • Il vantaggio di Maverick è concentrato sul ragionamento e sulla programmazione. +12,6 punti su GPQA Diamond, +10,6 su LiveCodeBench. Nella comprensione di documenti i due modelli sono alla pari — DocVQA è 94,4 per entrambi.
  • Scout costa circa 2,3 volte meno su base mista (0,15 USD contro 0,35 USD per 1 milione di token misti, con rapporto input:output 3:1).
  • L’hardware locale è dove si manifesta realmente la loro differenza. Scout entra in una singola H100 da 80 GB in quantizzazione a 4 bit; Maverick richiede circa 240 GB in quantizzazione a 4 bit e un host completo a 8 GPU in FP8.
  • Considera il famoso punteggio di 1417 su LMArena di Maverick come nullo. Tale valore proviene da una variante sperimentale non rilasciata per chat, non dai pesi scaricabili.

Versione in 30 secondi

Scegli Scout se lavori su documenti lunghi, recupero informazioni, sintesi, OCR e estrazione di tabelle o moduli, o qualsiasi attività ad alto volume in cui il costo per token si accumula — e soprattutto se desideri auto-hostare su una singola GPU. Scegli Maverick se il tuo carico di lavoro è effettivamente vincolato dal ragionamento o dalla programmazione, dove il suo vantaggio a due cifre su GPQA Diamond e LiveCodeBench giustifica l’hardware aggiuntivo e la spesa maggiore. Per la maggior parte delle pipeline di elaborazione documentale ed estrazione, pagare 2,3 volte di più per Maverick non ti garantisce quasi alcun miglioramento misurabile.

Architettura: un solo parametro regolabile, due modelli molto diversi

Entrambi i modelli sono trasformatori misti di esperti che utilizzano ciò che Meta definisce fusione precoce per la multimodalità nativa — i token immagine e testuali entrano nello stesso backbone invece di essere uniti tramite un adattatore visivo separato. Entrambi accettano testo e immagini ed emettono testo. Entrambi hanno un cutoff conoscitivo ad agosto 2024.

La differenza sta nel router. Scout sceglie tra 16 esperti, Maverick tra 128. Poiché in ogni caso vengono attivati solo 17 miliardi di parametri per token, i due modelli hanno costi di calcolo pressoché identici per token — ma ogni esperto deve risiedere nella memoria, indipendentemente dal fatto che venga attivato su un determinato token. È per questo che Maverick occupa 3,7 volte più memoria di Scout pur essendo solo marginalmente più lento per token, ed è anche la ragione per cui un modello sparso da 400 miliardi può essere servito a prezzi impossibili per un modello denso da 400 miliardi.

Una differenza degna di nota: Scout è stato addestrato su circa 40 trilioni di token, Maverick su circa 22 trilioni. Scout ha visto più dati distribuiti su meno esperti; Maverick ne ha visti di meno, ma distribuiti su molti più esperti. Ciò aiuta a spiegare perché Scout tiene il passo sulla vastità della conoscenza e sui compiti documentali, mentre resta indietro nei compiti di ragionamento avanzato.

Finestra di contesto: 10 milioni sulla carta, molto meno nella pratica

Questo è il numero più citato e più fuorviante del lancio di Llama 4. Meta pubblicizza una finestra di contesto «leader di settore da 10 milioni di token» per Scout, ottenuta grazie a una progettazione di attenzione interleaved senza embedding posizionali. Maverick ne offre 1 milione.

L’aspetto critico: essenzialmente nessun provider ospitato offre 10 milioni di token. Nella pratica i limiti sono questi: Groq intorno ai 128K–131K, DeepInfra intorno ai 320K, Together intorno ai 328K, Fireworks vicino al milione, e OpenRouter che elenca Scout con 1.310.720 token e un limite di completamento di 16.384 token. Per utilizzare effettivamente 10 milioni di token devi auto-hostare, e a quel punto incontri il vero vincolo: la cache KV. A profondità multi-milionario-token la cache supera di gran lunga i pesi del modello stesso, ed è proprio per questo che i provider la limitano.

La comparazione onesta quindi non è «10 milioni contro 1 milione». È piuttosto ~1,3 milioni contro ~1 milione sulle piattaforme che la maggior parte degli utenti utilizzerà effettivamente — un vantaggio reale per Scout, ma modesto rispetto al rapporto dieci a uno suggerito dalla scheda tecnica. Se hai un effettivo requisito multi-milionario di token, prevedi un budget per l’auto-hosting e verifica il throughput a profondità elevate prima di impegnarti.

Benchmark: dove emergono i 291 miliardi di parametri aggiuntivi

Tutti i dati riportati di seguito sono risultati ufficiali pubblicati da Meta per le varianti Instruct. Si tratta di numeri di prima mano, quindi vanno considerati indicativi piuttosto che definitivi.

Benchmark Llama 4 Scout Llama 4 Maverick Differenza
MMLU Pro (ragionamento) 74.3 80.5 +6.2
GPQA Diamond (scienze graduate) 57.2 69.8 +12.6
LiveCodeBench (programmazione) 32.8 43.4 +10.6
MMMU (ragionamento su immagini) 69.4 73.4 +4.0
MMMU Pro 52.2 59.6 +7.4
MathVista 70.7 73.7 +3.0
ChartQA 88.8 90.0 +1.2
DocVQA (test) 94.4 94.4 0.0
MGSM (matematica multilingue) 90.6 92.3 +1.7
MTOB, metà libro (inglese → kgv) 42.2 54.0 +11.8

La forma di questa tabella è l’intero argomento. Il vantaggio di Maverick è ampio e coerente su ragionamento, scienze e codice — un guadagno relativo del 22% su GPQA Diamond e del 32% su LiveCodeBench. Per la comprensione di documenti e grafici, invece, crolla a zero: 1,2 punti su ChartQA e un pareggio su DocVQA.: 1,2 punti su ChartQA e un pareggio su DocVQA.

Se il vostro flusso di lavoro riguarda l’estrazione da fatture, l’analisi di moduli, l’OCR di scontrini o la lettura di grafici, i dati stessi di Meta indicano che Maverick non leggerà i vostri documenti meglio di Scout — e paghereste circa 2,3 volte di più per token per ottenere tale parità. Questo è il risultato più concretamente utilizzabile dell’intero confronto.

Un benchmark da ignorare completamente: il punteggio 1417 ELO su LMArena. Meta ha sottoposto una «versione chat sperimentale» mai rilasciata per il download né resa disponibile tramite API generale; inoltre, i ricercatori hanno scoperto che i suoi output non corrispondevano ai pesi pubblicati su Hugging Face. Il 8 aprile 2025 LMArena ha rivisto la propria policy, richiedendo espressamente che i modelli open-weight sottoposti corrispondano esattamente ai pesi pubblicati, precisando che l’interpretazione delle regole data da Meta non coincideva con quanto ci si aspetta dai fornitori di modelli. I pesi pubblici non modificati hanno ottenuto un punteggio molto inferiore. Qualunque sia la reale qualità conversazionale di Maverick, il valore 1417 non ne costituisce alcuna prova.

Hardware locale: VRAM in FP16, FP8 e 4 bit

La memoria necessaria per i pesi equivale semplicemente al numero di parametri moltiplicato per i byte per parametro, cui va aggiunto un sovraccarico stimato del 15–25% per la cache KV e le attivazioni, a lunghezze di contesto modeste. Contesti lunghi fanno lievitare notevolmente tale sovraccarico.

Precisione Scout (109 miliardi) Maverick (400 miliardi)
Pesi BF16/FP16 ~218 GB ~800 GB
Pesi FP8 ~109 GB ~400 GB
Pesi INT4 ~55 GB ~200 GB
INT4 pratico (con sovraccarico) ~65 GB ~240 GB
Hardware minimo realistico 1× H100 da 80 GB oppure un Mac da 128 GB Server multi-GPU (4× H100 in quantizzazione 4-bit)

Meta afferma esplicitamente che Scout «si adatta su una singola GPU NVIDIA H100» con quantizzazione Int4, mentre Maverick «si adatta su un singolo host H100» — notate bene la parola host, che indica un nodo da 8 GPU, non una singola scheda. Un nodo da 8×H100 fornisce 640 GB di memoria, sufficienti a contenere comodamente Maverick in FP8, ma non in BF16, dove i soli pesi occupano 800 GB, superando ampiamente la capacità del nodo. Maverick in precisione piena richiede quindi una memoria alla pari degli H200 oppure due nodi.

In pratica: Scout è un modello per singola GPU o workstation, ed è uno dei più performanti tra quelli eseguibili su un Mac Studio da 128 GB. Maverick è riservato esclusivamente ai data center. Usate il Calcolatore VRAM per verificare la vostra configurazione e la profondità del contesto.

SpecificheLlama 4 ScoutLlama 4 Maverick
SviluppatoreMetaMeta
TipoMultimodale (MoE)Multimodale (MoE)
Parametri109 miliardi totali / 17 miliardi attivi (MoE)400 miliardi totali / 17 miliardi attivi (MoE)
Finestra contestuale10 milioni1 milione
ModalitàTesto, immagine → testoTesto, immagine → testo
LicenzaLlama 4 Community (limitata all’UE)Llama 4 Community (limitata all’UE)
Pesi aperti✅ Sì✅ Sì
Costo input ($/1M)$0.1$0.2
Costo output ($/1M)$0.3$0.8
VRAM (4-bit)~65 GB~240 GB
GPU minima (locale)H100 80 GB / Mac 128 GBServer multi-GPU
Pubblicato20252025

Differenze principali

  • Costo: Llama 4 Scout è Il 133% più economico di Llama 4 Maverick in termini di costo medio per token.
  • Contesto: Llama 4 Scout offre una finestra contestuale superiore (10 milioni contro 1 milione), risultando quindi più adatta per documenti lunghi, grandi codebase e input RAG estesi.
  • Apertura: entrambi hanno pesi aperti, quindi entrambi possono essere ospitati autonomamente o sottoposti a fine-tuning. Confronta le esigenze di VRAM indicate sopra per verificare quali modelli la tua GPU è in grado di eseguire.
  • Esegui Llama 4 Scout in locale: ~65 GB in quantizzazione 4-bit (GPU minima richiesta: H100 80 GB / Mac 128 GB).
  • Esegui Llama 4 Maverick in locale: ~~240 GB a 4 bit (server multi-GPU minimo).

Quale scegliere?

Seleziona Llama 4 Scout se desideri un costo inferiore per token in carichi di lavoro ad alto volume oppure hai bisogno di una finestra di contesto più ampia.

Scegli Llama 4 Maverick se si integra bene nel tuo stack esistente o se preferisci Meta.

→ Stima i costi reali con il Calcolatore dei costi API · verifica l'hardware locale con il Calcolatore VRAM · esplora tutti i 30+ modelli.

Prezzi API attraverso i provider

Nessuno dei due modelli è costoso secondo gli standard di frontiera; entrambi sono prezzati come inferenza open-weight di tipo commodity. I prezzi indicati di seguito sono per 1 milione di token e variano frequentemente.

Fornitore Scout in / out Maverick in / out
DeepInfra $0.10 / $0.30 $0.20 / $0.80
Groq $0.11 / $0.34 —
DigitalOcean — $0.20 / $0.696
NovitaAI $0.18 / $0.59 $0.27 / $0.85
Parasail — $0.35 / $1.00
Google Vertex $0.25 / $0.70 $0.35 / $1.15

Groq merita particolare attenzione per Scout: è marginalmente più costoso di DeepInfra, ma offre l’input memorizzato nella cache a 0,055 USD per 1 milione di token, un dettaglio cruciale per i cicli di agenti che inviano migliaia di volte lo stesso prompt di sistema. Parasail offre un servizio equivalente per Maverick a 0,17 USD.

Quanto costa realmente

Supponiamo un carico di produzione moderato di 100 milioni di token in input e 20 milioni di token in output al mese, al prezzo più basso disponibile sul mercato principale:

  • Scout: (100 × 0,10 USD) + (20 × 0,30 USD) = 16 USD/mese
  • Maverick: (100 × 0,20 USD) + (20 × 0,80 USD) = 36 USD/mese

A dieci volte questo volume, il divario sale a 160 USD contro 360 USD al mese. Il rapporto rimane pressoché costante intorno a 2,25–2,3× indipendentemente dalla scala, quindi la decisione non dipende tanto dall’importo assoluto per volumi ridotti, quanto dal fatto che il vantaggio di Maverick in termini di ragionamento e programmazione valga un raddoppio permanente del costo unitario. Fate i vostri calcoli personalizzati nel Calcolatore dei costi API.

Licenza: leggi attentamente la clausola relativa all’UE prima di sviluppare qualcosa

Entrambi i modelli sono rilasciati sotto la Llama 4 Community License Agreement, una licenza open-weight utilizzabile commercialmente, ma non approvata dall’OSI come software open source. Due restrizioni hanno rilevanza pratica. Primo: i prodotti con oltre 700 milioni di utenti attivi mensili richiedono una licenza separata, da negoziare direttamente con Meta. Secondo — e molto più probabile che vi riguardi — la licenza limita l’uso multimodale per entità e individui con sede legale nell’ Unione Europea.

Se siete un’azienda con sede nell’UE e intendete utilizzare le funzionalità visive, questa è una questione legale da risolvere prima di scrivere codice, non dopo. Molte squadre in questa situazione optano invece per un modello open-weight alternativo con una licenza più chiara, come una versione Qwen o GLM rilasciata con licenza Apache-2.0 o MIT.

Quale scegliere?

Scegliete Llama 4 Scout se

  • Il vostro carico di lavoro riguarda documenti, OCR, moduli, grafici o recupero informazioni — ambiti in cui i benchmark mostrano una quasi parità
  • Desiderate eseguirlo autonomamente su una singola H100, su un Mac da 128 GB o su un sistema GPU di fascia media
  • Il costo per token si accumula con il volume e desideri un risparmio di circa 2,3×
  • Hai bisogno della finestra di contesto più lunga disponibile e puoi operare entro i limiti imposti dal fornitore
  • Stai effettuando prototipazione e cerchi il modello multimodale open-weight più economico ma comunque performante

Scegli Llama 4 Maverick se

  • Il tuo carico di lavoro è effettivamente vincolato dal ragionamento — domande e risposte scientifiche, analisi, logica a più passi
  • Generi o revisioni codice, dove il divario su LiveCodeBench è del 32% in termini relativi
  • Disponi già di un’infrastruttura multi-GPU oppure la utilizzi comunque tramite API
  • Hai bisogno di prestazioni migliori nel multilinguismo e nella traduzione, come dimostrato sui benchmark MGSM e MTOB
  • L’accuratezza su problemi complessi conta di più rispetto al raddoppio del costo per token

Il percorso pragmatico per la maggior parte dei team: inizia con Scout, misura le prestazioni e scala solo alle query che falliscono. Poiché entrambi i modelli accettano lo stesso formato di prompt e gli stessi input multimodali, instradare le query complesse verso Maverick mentre si servono la maggior parte delle richieste con Scout richiede uno sforzo ingegneristico minimo ed è generalmente più vantaggioso rispetto all’adozione standardizzata di uno solo dei due modelli.

Domande frequenti

Llama 4 Maverick è migliore di Llama 4 Scout?

Nel ragionamento e nella generazione di codice, chiaramente sì: Maverick guadagna 12,6 punti su GPQA Diamond e 10,6 su LiveCodeBench. Nella comprensione di documenti e grafici i due modelli sono sostanzialmente pari, ottenendo entrambi un punteggio identico di 94,4 su DocVQA. Se un modello sia «migliore» dipende interamente dal fatto che il tuo carico di lavoro sia orientato al ragionamento o all’estrazione.

Posso davvero utilizzare la finestra di contesto da 10 milioni di token di Llama 4 Scout?

No, non tramite un’API ospitata. Meta ha addestrato Scout per supportare 10 milioni di token, ma i provider offrono tra i 128K e circa 1,3 milioni di token — Groq prevede un limite di circa 131K, DeepInfra di circa 320K e Together di circa 328K. Raggiungere i 10 milioni richiede l’auto-hosting, e la cache KV a quella profondità diventa più grande dei pesi del modello.

Quanta VRAM mi serve per eseguire Llama 4 Scout in locale?

Circa 65 GB in quantizzazione a 4 bit, compresi gli overhead, il che permette di farlo girare su una singola H100 da 80 GB — Meta conferma questa configurazione. In FP8 servono circa 109 GB, mentre in BF16 circa 218 GB. Uno Studio Mac con memoria unificata da 128 GB può eseguirlo in versione quantizzata.

Llama 4 Maverick può girare su una singola GPU?

No. In precisione a 4 bit richiede circa 240 GB di memoria, ovvero l’equivalente di circa quattro H100. L’affermazione di Meta secondo cui il modello «si adatta a un singolo host H100» si riferisce a un nodo con 8 GPU in precisione FP8, non a una singola scheda. In BF16, i suoi pesi da 800 GB superano addirittura la capacità di un nodo da 640 GB composto da otto H100.

Quanto è più economico Scout rispetto a Maverick?

Circa 2,3 volte in meno su una base mista input-output 3:1 — circa 0,15 USD per 1 milione di token misti contro 0,35 USD. Su un carico di lavoro mensile di 100 milioni di token in input e 20 milioni di token in output, il costo ammonta a 16 USD contro 36 USD.

I modelli Llama 4 possono essere utilizzati gratuitamente a fini commerciali?

In gran parte sì. La licenza comunitaria Llama 4 consente l’uso commerciale, ma i prodotti con oltre 700 milioni di utenti attivi mensili richiedono un accordo separato con Meta, e l’uso multimodale è limitato per le entità con sede nell’UE. Il modello è open-weight, ma non è open source secondo la definizione dell’OSI.

Perché il punteggio di Llama 4 Maverick su LMArena è stato oggetto di controversie?

Meta ha inviato una versione «sperimentale per chat», ancora non rilasciata, che ha ottenuto un punteggio ELO di 1417; tuttavia, i suoi output non corrispondevano ai pesi pubblicamente scaricabili. Il 8 aprile 2025 LMArena ha modificato la propria policy richiedendo che i modelli open-weight inviati corrispondano esattamente ai pesi resi pubblici; il modello invariato ha ottenuto un punteggio significativamente inferiore.

Conclusione

Scout e Maverick sono lo stesso motore, con pool di esperti di dimensioni diverse, e la scelta tra loro è insolitamente chiara perché i benchmark ufficiali di Meta tracciano per te la linea di demarcazione. Maverick giustifica il suo prezzo premium nel ragionamento di livello universitario e nella generazione di codice, dove i divari a due cifre sono troppo ampi per essere messi in discussione. Non offre invece alcun vantaggio nella comprensione di documenti, dove pareggia con Scout pur costando 2,3 volte di più per token e richiedendo un intero rack data center anziché una singola GPU.

Due avvertenze da tenere presenti. La finestra di contesto da 10 milioni di token di Scout riportata in evidenza non è attualmente disponibile in affitto: pianifica piuttosto un limite di circa 1,3 milioni di token, a meno che tu non stia eseguendo il modello in auto-hosting. Inoltre, il valore di 1417 su LMArena relativo a Maverick deve essere completamente escluso dalla tua valutazione: esso misurava un modello che nessuno può scaricare. Valuta entrambi i modelli sulla base dei benchmark indicati nelle relative schede tecniche e, ancor meglio, sul tuo set di valutazione personale — la discrepanza tra marketing del fornitore e pesi effettivamente distribuiti è stata la lezione fondamentale di questo lancio.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top