{"id":1277,"date":"2026-06-23T14:45:04","date_gmt":"2026-06-23T14:45:04","guid":{"rendered":"https:\/\/convly.ai\/?p=1277"},"modified":"2026-08-26T12:38:32","modified_gmt":"2026-08-26T12:38:32","slug":"llama-4-scout-vs-llama-4-maverick","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/","title":{"rendered":"Llama 4 Scout contro Llama 4 Maverick: specifiche, prezzi e quale scegliere (2026)"},"content":{"rendered":"<p>Meta ha rilasciato <strong>Llama 4 Scout<\/strong> e <strong>Llama 4 Maverick<\/strong> nello stesso giorno \u2014 5 aprile 2025 \u2014 ed \u00e8 facile interpretarli come \u00abil piccolo\u00bb e \u00abil grande\u00bb. Questa lettura \u00e8 errata nel modo che conta di pi\u00f9 per la tua fattura. Entrambi i modelli attivano <strong>esattamente 17 miliardi di parametri per token<\/strong>. Ci\u00f2 che differisce \u00e8 la dimensione del pool di esperti da cui vengono estratti quei 17 miliardi: 16 esperti in Scout, 128 in Maverick. Tutto il resto \u2014 il divario di prezzo, il divario hardware, il divario nei benchmark \u2014 discende direttamente da questa scelta architetturale.<\/p>\n<p>Ci\u00f2 significa anche che l\u2019intuizione abituale \u00abmodello pi\u00f9 grande, risposte migliori\u00bb non funziona qui. Maverick ha un numero totale di parametri 3,7 volte superiore, ma non offre prestazioni 3,7 volte migliori; anzi, su alcuni benchmark non offre nemmeno prestazioni superiori. Di seguito trovi il confronto completo, basato sulla scheda tecnica ufficiale di Meta e sui prezzi effettivi applicati dai provider \u2014 incluso il parametro pi\u00f9 citato e, di fatto, irraggiungibile nella pratica.<\/p>\n<div class=\"convly-tldr\">\n<h3>Punti chiave<\/h3>\n<ul>\n<li><strong>Stesso numero di parametri attivi, diversi pool di esperti.<\/strong> Scout ha 109 miliardi di parametri totali \/ 17 miliardi attivi distribuiti su 16 esperti. Maverick ha 400 miliardi di parametri totali \/ 17 miliardi attivi distribuiti su 128 esperti. Il calcolo necessario per token \u00e8 quasi identico; l\u2019impronta di memoria no.<\/li>\n<li><strong>I 10 milioni di token di contesto di Scout sono reali, ma quasi certamente non potrai noleggiarli.<\/strong> Meta ha addestrato Scout per 10 milioni di token. I provider ospitati offrono tra i 128K e circa 1,3 milioni di token. I 10 milioni completi richiedono l\u2019auto-hosting e una cache KV enorme.<\/li>\n<li><strong>Il vantaggio di Maverick \u00e8 concentrato sul ragionamento e sulla programmazione.<\/strong> +12,6 punti su GPQA Diamond, +10,6 su LiveCodeBench. Nella comprensione di documenti i due modelli sono alla pari \u2014 DocVQA \u00e8 94,4 per entrambi.<\/li>\n<li><strong>Scout costa circa 2,3 volte meno su base mista<\/strong> (0,15 USD contro 0,35 USD per 1 milione di token misti, con rapporto input:output 3:1).<\/li>\n<li><strong>L\u2019hardware locale \u00e8 dove si manifesta realmente la loro differenza.<\/strong> Scout entra in una singola H100 da 80 GB in quantizzazione a 4 bit; Maverick richiede circa 240 GB in quantizzazione a 4 bit e un host completo a 8 GPU in FP8.<\/li>\n<li><strong>Considera il famoso punteggio di 1417 su LMArena di Maverick come nullo.<\/strong> Tale valore proviene da una variante sperimentale non rilasciata per chat, non dai pesi scaricabili.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6ab597396484c\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6ab597396484c\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#The_30-second_version\" >Versione in 30 secondi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Architecture_one_knob_two_very_different_models\" >Architettura: un solo parametro regolabile, due modelli molto diversi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Context_window_10M_on_paper_far_less_in_practice\" >Finestra di contesto: 10 milioni sulla carta, molto meno nella pratica<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Benchmarks_where_the_extra_291B_parameters_show_up\" >Benchmark: dove emergono i 291 miliardi di parametri aggiuntivi<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Local_hardware_VRAM_at_FP16_FP8_and_4-bit\" >Hardware locale: VRAM in FP16, FP8 e 4 bit<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#API_pricing_across_providers\" >Prezzi API attraverso i provider<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#What_this_actually_costs\" >Quanto costa realmente<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Licensing_read_the_EU_clause_before_you_build\" >Licenza: leggi attentamente la clausola relativa all\u2019UE prima di sviluppare qualcosa<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Which_should_you_pick\" >Quale scegliere?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Frequently_asked_questions\" >Domande frequenti<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Bottom_line\" >Conclusione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/convly.ai\/it\/llama-4-scout-vs-llama-4-maverick\/#Related_articles\" >Articoli correlati<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_30-second_version\"><\/span>Versione in 30 secondi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Scegli <strong>Scout<\/strong> se lavori su documenti lunghi, recupero informazioni, sintesi, OCR e estrazione di tabelle o moduli, o qualsiasi attivit\u00e0 ad alto volume in cui il costo per token si accumula \u2014 e soprattutto se desideri auto-hostare su una singola GPU. Scegli <strong>Maverick<\/strong> se il tuo carico di lavoro \u00e8 effettivamente vincolato dal ragionamento o dalla programmazione, dove il suo vantaggio a due cifre su GPQA Diamond e LiveCodeBench giustifica l\u2019hardware aggiuntivo e la spesa maggiore. Per la maggior parte delle pipeline di elaborazione documentale ed estrazione, pagare 2,3 volte di pi\u00f9 per Maverick non ti garantisce quasi alcun miglioramento misurabile.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Architecture_one_knob_two_very_different_models\"><\/span>Architettura: un solo parametro regolabile, due modelli molto diversi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Entrambi i modelli sono trasformatori misti di esperti che utilizzano ci\u00f2 che Meta definisce <em>fusione precoce<\/em> per la multimodalit\u00e0 nativa \u2014 i token immagine e testuali entrano nello stesso backbone invece di essere uniti tramite un adattatore visivo separato. Entrambi accettano testo e immagini ed emettono testo. Entrambi hanno un cutoff conoscitivo ad agosto 2024.<\/p>\n<p>La differenza sta nel router. Scout sceglie tra 16 esperti, Maverick tra 128. Poich\u00e9 in ogni caso vengono attivati solo 17 miliardi di parametri per token, i due modelli hanno costi di calcolo pressoch\u00e9 identici <em>per token<\/em> \u2014 ma ogni esperto deve risiedere nella memoria, indipendentemente dal fatto che venga attivato su un determinato token. \u00c8 per questo che Maverick occupa 3,7 volte pi\u00f9 memoria di Scout pur essendo solo marginalmente pi\u00f9 lento per token, ed \u00e8 anche la ragione per cui un modello sparso da 400 miliardi pu\u00f2 essere servito a prezzi impossibili per un modello denso da 400 miliardi.<\/p>\n<p>Una differenza degna di nota: Scout \u00e8 stato addestrato su circa 40 trilioni di token, Maverick su circa 22 trilioni. Scout ha visto pi\u00f9 dati distribuiti su meno esperti; Maverick ne ha visti di meno, ma distribuiti su molti pi\u00f9 esperti. Ci\u00f2 aiuta a spiegare perch\u00e9 Scout tiene il passo sulla vastit\u00e0 della conoscenza e sui compiti documentali, mentre resta indietro nei compiti di ragionamento avanzato.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_window_10M_on_paper_far_less_in_practice\"><\/span>Finestra di contesto: 10 milioni sulla carta, molto meno nella pratica<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Questo \u00e8 il numero pi\u00f9 citato e pi\u00f9 fuorviante del lancio di Llama 4. Meta pubblicizza una finestra di contesto \u00ableader di settore da 10 milioni di token\u00bb per Scout, ottenuta grazie a una progettazione di attenzione interleaved senza embedding posizionali. Maverick ne offre 1 milione.<\/p>\n<p>L\u2019aspetto critico: <strong>essenzialmente nessun provider ospitato offre 10 milioni di token.<\/strong> Nella pratica i limiti sono questi: Groq intorno ai 128K\u2013131K, DeepInfra intorno ai 320K, Together intorno ai 328K, Fireworks vicino al milione, e OpenRouter che elenca Scout con 1.310.720 token e un limite di completamento di 16.384 token. Per utilizzare effettivamente 10 milioni di token devi auto-hostare, e a quel punto incontri il vero vincolo: la cache KV. A profondit\u00e0 multi-milionario-token la cache supera di gran lunga i pesi del modello stesso, ed \u00e8 proprio per questo che i provider la limitano.<\/p>\n<p>La comparazione onesta quindi non \u00e8 \u00ab10 milioni contro 1 milione\u00bb. \u00c8 piuttosto <strong>~1,3 milioni contro ~1 milione<\/strong> sulle piattaforme che la maggior parte degli utenti utilizzer\u00e0 effettivamente \u2014 un vantaggio reale per Scout, ma modesto rispetto al rapporto dieci a uno suggerito dalla scheda tecnica. Se hai un effettivo requisito multi-milionario di token, prevedi un budget per l\u2019auto-hosting e verifica il throughput a profondit\u00e0 elevate prima di impegnarti.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Benchmarks_where_the_extra_291B_parameters_show_up\"><\/span>Benchmark: dove emergono i 291 miliardi di parametri aggiuntivi<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tutti i dati riportati di seguito sono risultati ufficiali pubblicati da Meta per le varianti Instruct. Si tratta di numeri di prima mano, quindi vanno considerati indicativi piuttosto che definitivi.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Benchmark<\/th>\n<th>Llama 4 Scout<\/th>\n<th>Llama 4 Maverick<\/th>\n<th>Differenza<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>MMLU Pro (ragionamento)<\/td>\n<td>74.3<\/td>\n<td class=\"convly-vs-winner\">80.5<\/td>\n<td>+6.2<\/td>\n<\/tr>\n<tr>\n<td>GPQA Diamond (scienze graduate)<\/td>\n<td>57.2<\/td>\n<td class=\"convly-vs-winner\">69.8<\/td>\n<td>+12.6<\/td>\n<\/tr>\n<tr>\n<td>LiveCodeBench (programmazione)<\/td>\n<td>32.8<\/td>\n<td class=\"convly-vs-winner\">43.4<\/td>\n<td>+10.6<\/td>\n<\/tr>\n<tr>\n<td>MMMU (ragionamento su immagini)<\/td>\n<td>69.4<\/td>\n<td class=\"convly-vs-winner\">73.4<\/td>\n<td>+4.0<\/td>\n<\/tr>\n<tr>\n<td>MMMU Pro<\/td>\n<td>52.2<\/td>\n<td class=\"convly-vs-winner\">59.6<\/td>\n<td>+7.4<\/td>\n<\/tr>\n<tr>\n<td>MathVista<\/td>\n<td>70.7<\/td>\n<td class=\"convly-vs-winner\">73.7<\/td>\n<td>+3.0<\/td>\n<\/tr>\n<tr>\n<td>ChartQA<\/td>\n<td>88.8<\/td>\n<td class=\"convly-vs-winner\">90.0<\/td>\n<td>+1.2<\/td>\n<\/tr>\n<tr>\n<td>DocVQA (test)<\/td>\n<td>94.4<\/td>\n<td>94.4<\/td>\n<td>0.0<\/td>\n<\/tr>\n<tr>\n<td>MGSM (matematica multilingue)<\/td>\n<td>90.6<\/td>\n<td class=\"convly-vs-winner\">92.3<\/td>\n<td>+1.7<\/td>\n<\/tr>\n<tr>\n<td>MTOB, met\u00e0 libro (inglese \u2192 kgv)<\/td>\n<td>42.2<\/td>\n<td class=\"convly-vs-winner\">54.0<\/td>\n<td>+11.8<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La forma di questa tabella \u00e8 l\u2019intero argomento. Il vantaggio di Maverick \u00e8 <strong>ampio e coerente su ragionamento, scienze e codice<\/strong> \u2014 un guadagno relativo del 22% su GPQA Diamond e del 32% su LiveCodeBench. Per la comprensione di documenti e grafici, invece, crolla a zero: <strong>1,2 punti su ChartQA e un pareggio su DocVQA.<\/strong>: 1,2 punti su ChartQA e un pareggio su DocVQA.<\/p>\n<p>Se il vostro flusso di lavoro riguarda l\u2019estrazione da fatture, l\u2019analisi di moduli, l\u2019OCR di scontrini o la lettura di grafici, i dati stessi di Meta indicano che Maverick non legger\u00e0 i vostri documenti meglio di Scout \u2014 e paghereste circa 2,3 volte di pi\u00f9 per token per ottenere tale parit\u00e0. Questo \u00e8 il risultato pi\u00f9 concretamente utilizzabile dell\u2019intero confronto.<\/p>\n<p>Un benchmark da ignorare completamente: il punteggio <strong>1417 ELO su LMArena<\/strong>. Meta ha sottoposto una \u00abversione chat sperimentale\u00bb mai rilasciata per il download n\u00e9 resa disponibile tramite API generale; inoltre, i ricercatori hanno scoperto che i suoi output non corrispondevano ai pesi pubblicati su Hugging Face. Il 8 aprile 2025 LMArena ha rivisto la propria policy, richiedendo espressamente che i modelli open-weight sottoposti corrispondano esattamente ai pesi pubblicati, precisando che l\u2019interpretazione delle regole data da Meta non coincideva con quanto ci si aspetta dai fornitori di modelli. I pesi pubblici non modificati hanno ottenuto un punteggio molto inferiore. Qualunque sia la reale qualit\u00e0 conversazionale di Maverick, il valore 1417 non ne costituisce alcuna prova.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Local_hardware_VRAM_at_FP16_FP8_and_4-bit\"><\/span>Hardware locale: VRAM in FP16, FP8 e 4 bit<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La memoria necessaria per i pesi equivale semplicemente al numero di parametri moltiplicato per i byte per parametro, cui va aggiunto un sovraccarico stimato del 15\u201325% per la cache KV e le attivazioni, a lunghezze di contesto modeste. Contesti lunghi fanno lievitare notevolmente tale sovraccarico.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Precisione<\/th>\n<th>Scout (109 miliardi)<\/th>\n<th>Maverick (400 miliardi)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Pesi BF16\/FP16<\/td>\n<td class=\"convly-vs-winner\">~218 GB<\/td>\n<td>~800 GB<\/td>\n<\/tr>\n<tr>\n<td>Pesi FP8<\/td>\n<td class=\"convly-vs-winner\">~109 GB<\/td>\n<td>~400 GB<\/td>\n<\/tr>\n<tr>\n<td>Pesi INT4<\/td>\n<td class=\"convly-vs-winner\">~55 GB<\/td>\n<td>~200 GB<\/td>\n<\/tr>\n<tr>\n<td>INT4 pratico (con sovraccarico)<\/td>\n<td class=\"convly-vs-winner\">~65 GB<\/td>\n<td>~240 GB<\/td>\n<\/tr>\n<tr>\n<td>Hardware minimo realistico<\/td>\n<td class=\"convly-vs-winner\">1\u00d7 H100 da 80 GB oppure un Mac da 128 GB<\/td>\n<td>Server multi-GPU (4\u00d7 H100 in quantizzazione 4-bit)<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Meta afferma esplicitamente che Scout \u00absi adatta su una singola GPU NVIDIA H100\u00bb con quantizzazione Int4, mentre Maverick \u00absi adatta su un singolo host H100\u00bb \u2014 notate bene la parola <em>host<\/em>, che indica un nodo da 8 GPU, non una singola scheda. Un nodo da 8\u00d7H100 fornisce 640 GB di memoria, sufficienti a contenere comodamente Maverick in FP8, ma <em>non<\/em> in BF16, dove i soli pesi occupano 800 GB, superando ampiamente la capacit\u00e0 del nodo. Maverick in precisione piena richiede quindi una memoria alla pari degli H200 oppure due nodi.<\/p>\n<p>In pratica: Scout \u00e8 un modello per singola GPU o workstation, ed \u00e8 uno dei pi\u00f9 performanti tra quelli eseguibili su un Mac Studio da 128 GB. Maverick \u00e8 riservato esclusivamente ai data center. Usate il <a href=\"\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per verificare la vostra configurazione e la profondit\u00e0 del contesto.<\/p>\n<div class=\"cmp\">\n  <table class=\"cmp-table\">\n    <thead><tr><th>Specifiche<\/th><th><a href=\"https:\/\/convly.ai\/it\/model\/llama-4-scout\/\">Llama 4 Scout<\/a><\/th><th><a href=\"https:\/\/convly.ai\/it\/model\/llama-4-maverick\/\">Llama 4 Maverick<\/a><\/th><\/tr><\/thead>\n    <tbody>\n          <tr><td class=\"cmp-spec\">Sviluppatore<\/td><td class=\"\">Meta<\/td><td class=\"\">Meta<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Tipo<\/td><td class=\"\">Multimodale (MoE)<\/td><td class=\"\">Multimodale (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Parametri<\/td><td class=\"\">109 miliardi totali \/ 17 miliardi attivi (MoE)<\/td><td class=\"\">400 miliardi totali \/ 17 miliardi attivi (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Finestra contestuale<\/td><td class=\"cmp-win\">10 milioni<\/td><td class=\"\">1 milione<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Modalit\u00e0<\/td><td class=\"\">Testo, immagine \u2192 testo<\/td><td class=\"\">Testo, immagine \u2192 testo<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Licenza<\/td><td class=\"\">Llama 4 Community (limitata all\u2019UE)<\/td><td class=\"\">Llama 4 Community (limitata all\u2019UE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Pesi aperti<\/td><td class=\"\">\u2705 S\u00ec<\/td><td class=\"\">\u2705 S\u00ec<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Costo input ($\/1M)<\/td><td class=\"cmp-win\">$0.1<\/td><td class=\"\">$0.2<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Costo output ($\/1M)<\/td><td class=\"\">$0.3<\/td><td class=\"\">$0.8<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">VRAM (4-bit)<\/td><td class=\"\">~65 GB<\/td><td class=\"\">~240 GB<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">GPU minima (locale)<\/td><td class=\"\">H100 80 GB \/ Mac 128 GB<\/td><td class=\"\">Server multi-GPU<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Pubblicato<\/td><td class=\"\">2025<\/td><td class=\"\">2025<\/td><\/tr>\n        <\/tbody>\n  <\/table>\n\n    <div class=\"cmp-verdict\">\n    <h3>Differenze principali<\/h3>\n    <ul><li><strong>Costo:<\/strong> Llama 4 Scout \u00e8 <strong>Il 133% pi\u00f9 economico<\/strong> di Llama 4 Maverick in termini di costo medio per token.<\/li><li><strong>Contesto:<\/strong> Llama 4 Scout offre una finestra contestuale superiore (10 milioni contro 1 milione), risultando quindi pi\u00f9 adatta per documenti lunghi, grandi codebase e input RAG estesi.<\/li><li><strong>Apertura:<\/strong> entrambi hanno pesi aperti, quindi entrambi possono essere ospitati autonomamente o sottoposti a fine-tuning. Confronta le esigenze di VRAM indicate sopra per verificare quali modelli la tua GPU \u00e8 in grado di eseguire.<\/li><li><strong>Esegui Llama 4 Scout in locale:<\/strong> ~65 GB in quantizzazione 4-bit (GPU minima richiesta: H100 80 GB \/ Mac 128 GB).<\/li><li><strong>Esegui Llama 4 Maverick in locale:<\/strong> ~~240 GB a 4 bit (server multi-GPU minimo).<\/li><\/ul>\n  <\/div>\n\n    <div class=\"cmp-rec\">\n    <h3>Quale scegliere?<\/h3>\n    <p><strong>Seleziona Llama 4 Scout<\/strong> se desideri un costo inferiore per token in carichi di lavoro ad alto volume oppure hai bisogno di una finestra di contesto pi\u00f9 ampia.<\/p>\n    <p><strong>Scegli Llama 4 Maverick<\/strong> se si integra bene nel tuo stack esistente o se preferisci Meta.<\/p>\n    <p class=\"cmp-tools\">\u2192 Stima i costi reali con il <a href=\"\/it\/ai-api-cost-calculator\/\">Calcolatore dei costi API<\/a> \u00b7 verifica l'hardware locale con il <a href=\"\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> \u00b7 esplora tutti i <a href=\"\/it\/models\/\">30+ modelli<\/a>.<\/p>\n  <\/div>\n<\/div>\n\n<h2><span class=\"ez-toc-section\" id=\"API_pricing_across_providers\"><\/span>Prezzi API attraverso i provider<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nessuno dei due modelli \u00e8 costoso secondo gli standard di frontiera; entrambi sono prezzati come inferenza open-weight di tipo commodity. I prezzi indicati di seguito sono per 1 milione di token e variano frequentemente.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Fornitore<\/th>\n<th>Scout in \/ out<\/th>\n<th>Maverick in \/ out<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>DeepInfra<\/td>\n<td class=\"convly-vs-winner\">$0.10 \/ $0.30<\/td>\n<td>$0.20 \/ $0.80<\/td>\n<\/tr>\n<tr>\n<td>Groq<\/td>\n<td>$0.11 \/ $0.34<\/td>\n<td>\u2014<\/td>\n<\/tr>\n<tr>\n<td>DigitalOcean<\/td>\n<td>\u2014<\/td>\n<td>$0.20 \/ $0.696<\/td>\n<\/tr>\n<tr>\n<td>NovitaAI<\/td>\n<td>$0.18 \/ $0.59<\/td>\n<td>$0.27 \/ $0.85<\/td>\n<\/tr>\n<tr>\n<td>Parasail<\/td>\n<td>\u2014<\/td>\n<td>$0.35 \/ $1.00<\/td>\n<\/tr>\n<tr>\n<td>Google Vertex<\/td>\n<td>$0.25 \/ $0.70<\/td>\n<td>$0.35 \/ $1.15<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Groq merita particolare attenzione per Scout: \u00e8 marginalmente pi\u00f9 costoso di DeepInfra, ma offre l\u2019input memorizzato nella cache a 0,055 USD per 1 milione di token, un dettaglio cruciale per i cicli di agenti che inviano migliaia di volte lo stesso prompt di sistema. Parasail offre un servizio equivalente per Maverick a 0,17 USD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"What_this_actually_costs\"><\/span>Quanto costa realmente<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Supponiamo un carico di produzione moderato di 100 milioni di token in input e 20 milioni di token in output al mese, al prezzo pi\u00f9 basso disponibile sul mercato principale:<\/p>\n<ul>\n<li><strong>Scout:<\/strong> (100 \u00d7 0,10 USD) + (20 \u00d7 0,30 USD) = <strong>16 USD\/mese<\/strong><\/li>\n<li><strong>Maverick:<\/strong> (100 \u00d7 0,20 USD) + (20 \u00d7 0,80 USD) = <strong>36 USD\/mese<\/strong><\/li>\n<\/ul>\n<p>A dieci volte questo volume, il divario sale a 160 USD contro 360 USD al mese. Il rapporto rimane pressoch\u00e9 costante intorno a 2,25\u20132,3\u00d7 indipendentemente dalla scala, quindi la decisione non dipende tanto dall\u2019importo assoluto per volumi ridotti, quanto dal fatto che il vantaggio di Maverick in termini di ragionamento e programmazione valga un raddoppio permanente del costo unitario. Fate i vostri calcoli personalizzati nel <a href=\"\/it\/ai-api-cost-calculator\/\">Calcolatore dei costi API<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Licensing_read_the_EU_clause_before_you_build\"><\/span>Licenza: leggi attentamente la clausola relativa all\u2019UE prima di sviluppare qualcosa<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Entrambi i modelli sono rilasciati sotto la <strong>Llama 4 Community License Agreement<\/strong>, una licenza open-weight utilizzabile commercialmente, ma non approvata dall\u2019OSI come software open source. Due restrizioni hanno rilevanza pratica. Primo: i prodotti con oltre 700 milioni di utenti attivi mensili richiedono una licenza separata, da negoziare direttamente con Meta. Secondo \u2014 e molto pi\u00f9 probabile che vi riguardi \u2014 la licenza limita l\u2019uso multimodale per entit\u00e0 e individui con sede legale nell\u2019 <strong>Unione Europea<\/strong>.<\/p>\n<p>Se siete un\u2019azienda con sede nell\u2019UE e intendete utilizzare le funzionalit\u00e0 visive, questa \u00e8 una questione legale da risolvere prima di scrivere codice, non dopo. Molte squadre in questa situazione optano invece per <a href=\"\/it\/models\/\">un modello open-weight alternativo<\/a> con una licenza pi\u00f9 chiara, come una versione Qwen o GLM rilasciata con licenza Apache-2.0 o MIT.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_should_you_pick\"><\/span>Quale scegliere?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<div class=\"convly-procons\">\n<div class=\"pros\">\n<h4>Scegliete Llama 4 Scout se<\/h4>\n<ul>\n<li>Il vostro carico di lavoro riguarda documenti, OCR, moduli, grafici o recupero informazioni \u2014 ambiti in cui i benchmark mostrano una quasi parit\u00e0<\/li>\n<li>Desiderate eseguirlo autonomamente su una singola H100, su un Mac da 128 GB o su un sistema GPU di fascia media<\/li>\n<li>Il costo per token si accumula con il volume e desideri un risparmio di circa 2,3\u00d7<\/li>\n<li>Hai bisogno della finestra di contesto pi\u00f9 lunga disponibile e puoi operare entro i limiti imposti dal fornitore<\/li>\n<li>Stai effettuando prototipazione e cerchi il modello multimodale open-weight pi\u00f9 economico ma comunque performante<\/li>\n<\/ul>\n<\/div>\n<div class=\"cons\">\n<h4>Scegli Llama 4 Maverick se<\/h4>\n<ul>\n<li>Il tuo carico di lavoro \u00e8 effettivamente vincolato dal ragionamento \u2014 domande e risposte scientifiche, analisi, logica a pi\u00f9 passi<\/li>\n<li>Generi o revisioni codice, dove il divario su LiveCodeBench \u00e8 del 32% in termini relativi<\/li>\n<li>Disponi gi\u00e0 di un\u2019infrastruttura multi-GPU oppure la utilizzi comunque tramite API<\/li>\n<li>Hai bisogno di prestazioni migliori nel multilinguismo e nella traduzione, come dimostrato sui benchmark MGSM e MTOB<\/li>\n<li>L\u2019accuratezza su problemi complessi conta di pi\u00f9 rispetto al raddoppio del costo per token<\/li>\n<\/ul>\n<\/div>\n<\/div>\n<p>Il percorso pragmatico per la maggior parte dei team: <strong>inizia con Scout, misura le prestazioni e scala solo alle query che falliscono.<\/strong> Poich\u00e9 entrambi i modelli accettano lo stesso formato di prompt e gli stessi input multimodali, instradare le query complesse verso Maverick mentre si servono la maggior parte delle richieste con Scout richiede uno sforzo ingegneristico minimo ed \u00e8 generalmente pi\u00f9 vantaggioso rispetto all\u2019adozione standardizzata di uno solo dei due modelli.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Llama 4 Maverick \u00e8 migliore di Llama 4 Scout?<\/h3>\n<p>Nel ragionamento e nella generazione di codice, chiaramente s\u00ec: Maverick guadagna 12,6 punti su GPQA Diamond e 10,6 su LiveCodeBench. Nella comprensione di documenti e grafici i due modelli sono sostanzialmente pari, ottenendo entrambi un punteggio identico di 94,4 su DocVQA. Se un modello sia \u00abmigliore\u00bb dipende interamente dal fatto che il tuo carico di lavoro sia orientato al ragionamento o all\u2019estrazione.<\/p>\n<h3>Posso davvero utilizzare la finestra di contesto da 10 milioni di token di Llama 4 Scout?<\/h3>\n<p>No, non tramite un\u2019API ospitata. Meta ha addestrato Scout per supportare 10 milioni di token, ma i provider offrono tra i 128K e circa 1,3 milioni di token \u2014 Groq prevede un limite di circa 131K, DeepInfra di circa 320K e Together di circa 328K. Raggiungere i 10 milioni richiede l\u2019auto-hosting, e la cache KV a quella profondit\u00e0 diventa pi\u00f9 grande dei pesi del modello.<\/p>\n<h3>Quanta VRAM mi serve per eseguire Llama 4 Scout in locale?<\/h3>\n<p>Circa 65 GB in quantizzazione a 4 bit, compresi gli overhead, il che permette di farlo girare su una singola H100 da 80 GB \u2014 Meta conferma questa configurazione. In FP8 servono circa 109 GB, mentre in BF16 circa 218 GB. Uno Studio Mac con memoria unificata da 128 GB pu\u00f2 eseguirlo in versione quantizzata.<\/p>\n<h3>Llama 4 Maverick pu\u00f2 girare su una singola GPU?<\/h3>\n<p>No. In precisione a 4 bit richiede circa 240 GB di memoria, ovvero l\u2019equivalente di circa quattro H100. L\u2019affermazione di Meta secondo cui il modello \u00absi adatta a un singolo host H100\u00bb si riferisce a un nodo con 8 GPU in precisione FP8, non a una singola scheda. In BF16, i suoi pesi da 800 GB superano addirittura la capacit\u00e0 di un nodo da 640 GB composto da otto H100.<\/p>\n<h3>Quanto \u00e8 pi\u00f9 economico Scout rispetto a Maverick?<\/h3>\n<p>Circa 2,3 volte in meno su una base mista input-output 3:1 \u2014 circa 0,15 USD per 1 milione di token misti contro 0,35 USD. Su un carico di lavoro mensile di 100 milioni di token in input e 20 milioni di token in output, il costo ammonta a 16 USD contro 36 USD.<\/p>\n<h3>I modelli Llama 4 possono essere utilizzati gratuitamente a fini commerciali?<\/h3>\n<p>In gran parte s\u00ec. La licenza comunitaria Llama 4 consente l\u2019uso commerciale, ma i prodotti con oltre 700 milioni di utenti attivi mensili richiedono un accordo separato con Meta, e l\u2019uso multimodale \u00e8 limitato per le entit\u00e0 con sede nell\u2019UE. Il modello \u00e8 open-weight, ma non \u00e8 open source secondo la definizione dell\u2019OSI.<\/p>\n<h3>Perch\u00e9 il punteggio di Llama 4 Maverick su LMArena \u00e8 stato oggetto di controversie?<\/h3>\n<p>Meta ha inviato una versione \u00absperimentale per chat\u00bb, ancora non rilasciata, che ha ottenuto un punteggio ELO di 1417; tuttavia, i suoi output non corrispondevano ai pesi pubblicamente scaricabili. Il 8 aprile 2025 LMArena ha modificato la propria policy richiedendo che i modelli open-weight inviati corrispondano esattamente ai pesi resi pubblici; il modello invariato ha ottenuto un punteggio significativamente inferiore.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Scout e Maverick sono lo stesso motore, con pool di esperti di dimensioni diverse, e la scelta tra loro \u00e8 insolitamente chiara perch\u00e9 i benchmark ufficiali di Meta tracciano per te la linea di demarcazione. Maverick giustifica il suo prezzo premium nel ragionamento di livello universitario e nella generazione di codice, dove i divari a due cifre sono troppo ampi per essere messi in discussione. Non offre invece alcun vantaggio nella comprensione di documenti, dove pareggia con Scout pur costando 2,3 volte di pi\u00f9 per token e richiedendo un intero rack data center anzich\u00e9 una singola GPU.<\/p>\n<p>Due avvertenze da tenere presenti. La finestra di contesto da 10 milioni di token di Scout riportata in evidenza non \u00e8 attualmente disponibile in affitto: pianifica piuttosto un limite di circa 1,3 milioni di token, a meno che tu non stia eseguendo il modello in auto-hosting. Inoltre, il valore di 1417 su LMArena relativo a Maverick deve essere completamente escluso dalla tua valutazione: esso misurava un modello che nessuno pu\u00f2 scaricare. Valuta entrambi i modelli sulla base dei benchmark indicati nelle relative schede tecniche e, ancor meglio, sul tuo set di valutazione personale \u2014 la discrepanza tra marketing del fornitore e pesi effettivamente distribuiti \u00e8 stata la lezione fondamentale di questo lancio.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Articoli correlati<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/it\/models\/\">Database modelli AI: specifiche, prezzi e VRAM per oltre 40 modelli<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM per LLM: quale modello entra effettivamente nella tua GPU<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/ai-api-cost-calculator\/\">Calcolatore costi API AI: stima la tua spesa mensile<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/ai-price-performance-index-2026\/\">Indice AI di rapporto costo-prestazioni 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">Calcolatore Auto-hosting vs API<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Llama 4 Scout vs Llama 4 Maverick compared: specs, API pricing, context window, VRAM and a clear verdict on which model to choose in 2026.<\/p>","protected":false},"author":1,"featured_media":1906,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[246],"tags":[395,795],"class_list":["post-1277","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-comparisons","tag-ai-model-comparison","tag-llama-4-maverick"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/1277","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=1277"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/1277\/revisions"}],"predecessor-version":[{"id":2404,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/1277\/revisions\/2404"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/1906"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=1277"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=1277"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=1277"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}