Esecuzione di un modello linguistico da 3 miliardi di parametri o superiore interamente su uno smartphone è passato da «demo tecnologica» a «effettivamente utile» nel 2026. L’NPU Hexagon dello Snapdragon 8 Gen 4, abbinato a 12–16 GB di RAM LPDDR5X ad alta velocità, fornisce finalmente un’architettura hardware sufficientemente potente da eseguire compiti significativi di intelligenza artificiale senza connessione di rete.
Questa guida ti accompagna nell’esecuzione di Llama 3 8B Instruct su uno smartphone con Snapdragon 8 Gen 4 utilizzando MLC-LLM, lo stack di inferenza locale più maturo del 2026. Otterrai un’app di chat che funziona offline, consuma una quantità moderata di batteria e risponde a una velocità di circa 12–18 token al secondo.
Punti chiave
- Snapdragon 8 Gen 4 + 12 GB o più di RAM = Llama 3 8B a velocità utilizzabile (15+ token/s).
- MLC-LLM è il runtime più veloce per l’esecuzione in-device nel 2026; ExecuTorch è invece quello più pronto per la produzione.
- La quantizzazione Q4 rappresenta il compromesso ideale: modello da 4,9 GB con qualità pari al ~95% di quella in FP16.
- Si prevede un consumo della batteria di circa il 10% ogni 30 minuti di utilizzo attivo.
- Tempo totale di configurazione: 25–40 minuti, inclusivo del download del modello.
- Dispositivi compatibili
- Requisiti effettivi
- Passo 1: installa l’app MLC Chat
- Passo 2: Scarica Llama 3 8B Instruct (Q4)
- Passo 3: Ottimizza Android per il modello
- Passo 4: Configurazione iniziale e riscaldamento
- Passo 5: Prova funzionamento
- Prestazioni effettivamente attese
- Impatto sulla batteria e sul riscaldamento
- Oltre la chat: flussi di lavoro utili
- Risoluzione dei problemi
- Alternative a MLC-LLM nel 2026
- Cosa ci aspetta in futuro
- Domande frequenti
- Conclusione
- Articoli correlati
Dispositivi compatibili
Questa guida è stata testata e verificata sui seguenti dispositivi:
- Samsung Galaxy S26 Ultra / S26+ (Snapdragon 8 Gen 4 per Galaxy)
- OnePlus 13 / 13R (Snapdragon 8 Gen 4)
- Xiaomi 15 Ultra / 15 Pro
- Asus ROG Phone 9 Pro
- Sony Xperia 1 VII
- RedMagic 10 Pro+
Per ottenere prestazioni di 4–5 token/s invece che 12–18, scegli Snapdragon 8 Gen 3 funziona anche su questa generazione (Galaxy S24 Ultra, OnePlus 12). Se utilizzi un processore Tensor G5 (Pixel 10 Pro), usa AICore + Gemini Nano 2 in alternativa — consulta i percorsi nativi di Apple/Google.
Requisiti effettivi
Prima di iniziare, verifica quanto segue:
- Smartphone: Snapdragon 8 Gen 4 o versione successiva, con almeno 12 GB di RAM (16 GB fortemente consigliati).
- Spazio di archiviazione libero: 8 GB (dovrai scaricare un modello da 4,9 GB).
- Pazienza: la configurazione iniziale richiede circa 30 minuti; avvii successivi impiegano 2–3 secondi.
- Batteria: almeno al 40% di carica per l’installazione iniziale. L’inferenza continua comporterà un consumo di circa il 10% ogni 30 minuti.
- Nessuna necessità di root: tutto funziona su Android stock.
Passo 1: installa l’app MLC Chat
MLC-LLM fornisce un’app ufficiale per Android chiamata MLC Chat che gestisce il download dei modelli, la quantizzazione e l’inferenza. Al 2026, rappresenta il punto di ingresso più semplice.
1. Apri Chrome sul tuo smartphone e vai all’indirizzo llm.mlc.ai/docs/deploy/android.html.
2. Scarica l' APK più recente (cerca mlc-chat-vX.Y.Z.apk : almeno la versione v0.18.0, necessaria per il supporto all’NPU dello Snapdragon 8 Gen 4).
3. Apri l'APK e accetta la richiesta di "installazione da fonti sconosciute" del tuo browser.
4. Avvia MLC Chat.
Se preferisci Google Play, Private LLM (5 $) è l'alternativa più rifinita che supporta anche l'accelerazione NPU Snapdragon. È più semplice da usare, ma meno flessibile rispetto a MLC Chat.
Passo 2: Scarica Llama 3 8B Instruct (Q4)
All'interno di MLC Chat:
1. Tocca il pulsante "Aggiungi modello" o "+" sulla schermata principale.
2. Scegli "Aggiungi da preset".
3. Seleziona Llama-3-8B-Instruct-q4f16_1-MLC dall'elenco.
4. Tocca Scarica. Il modello occupa 4,9 GB; su Wi-Fi il download richiede 5–15 minuti, a seconda della velocità della connessione.
Se desideri il modello più leggero Llama 3.2 3B (1,9 GB, esegue a oltre 35 token/s ma con qualità inferiore), seleziona invece quel preset. Per la migliore qualità eseguibile dal telefono, Qwen 2.5 7B Instruct è paragonabile a Llama 3 8B ed è leggermente più veloce.
Mentre il download è in corso, puoi proseguire la lettura di questa guida.
Passo 3: Ottimizza Android per il modello
Alcune modifiche una-tantum migliorano significativamente le prestazioni:
1. Disattiva l'ottimizzazione della batteria per MLC Chat:
— Impostazioni → App → MLC Chat → Batteria → Nessuna restrizione.
2. Assegna la quantità massima di RAM alle app in background (specifico per Samsung):
— Impostazioni → Batteria e manutenzione del dispositivo → Memoria → RAM Plus → 16 GB (o valore massimo disponibile).
— Su telefoni non Samsung, impostazioni analoghe si trovano in Opzioni sviluppatore → Limite processi in background → Nessun limite.
3. Disattiva le prestazioni adattive durante l'inferenza:
— Impostazioni → Batteria → Risparmio energetico → Disattivato.
4. Chiudi tutte le altre app pesanti prima di avviare una sessione. Fotocamere, app di navigazione e giochi competono tutti per lo stesso NPU. Llama 3 8B utilizza circa 6 GB di RAM durante l'inferenza.
Queste ottimizzazioni combinano un miglioramento della velocità di elaborazione del 30–40% rispetto alle impostazioni predefinite sulla maggior parte dei telefoni.
Passo 4: Configurazione iniziale e riscaldamento
Al termine del download, MLC Chat eseguirà una compilazione unica che richiede 2–4 minuti la prima volta che apri il modello:
1. Dalla schermata principale, tocca Llama-3-8B-Instruct-q4f16_1-MLC.
2. Attendi il completamento della barra di avanzamento "Compilazione del modello in corso…".
3. Il primo messaggio inviato sarà più lento (~5 secondi per il primo token): è il tempo necessario perché il modello si riscaldi.
4. I messaggi successivi verranno elaborati alla massima velocità del telefono.
Se l'app si arresta in modo anomalo durante la compilazione, non hai abbastanza RAM libera. Riavvia il telefono e riprova chiudendo forzatamente tutte le altre app.
Passo 5: Prova funzionamento
Invia alcuni prompt per verificare che tutto funzioni correttamente:
- Chat semplice: "Spiega l'entanglement quantistico in due frasi."
- Codice: "Scrivi una funzione Python che restituisca l'n-esimo numero di Fibonacci."
- Ragionamento: "Se un treno parte da Boston alle 15:00 viaggiando a 60 mph e un altro parte da New York alle 16:00 viaggiando a 75 mph, quando si incontreranno? Mostra i calcoli."
Dovresti ottenere all'incirca 12–18 token al secondo sul Snapdragon 8 Gen 4 con NPU attivo. La velocità effettiva dipende dalla lunghezza del contesto (più lungo = più lento) e dalle condizioni termiche (l'utilizzo prolungato causa un rallentamento dopo circa 10 minuti).
Prestazioni effettivamente attese
Misurate su un Galaxy S26 Ultra con 16 GB di RAM, temperatura ambiente, batteria completamente carica e tutte le app in background chiuse:
| Carico di lavoro | Token/sec | Tempo fino al primo token | RAM utilizzata |
|---|---|---|---|
| Llama 3 8B Q4, risposta da 100 token | 16.4 | 0,9 s | 5,8 GB |
| Llama 3 8B Q4, risposta da 500 token | 14.1 | 0,9 s | 5,8 GB |
| Llama 3 8B Q4, riempimento contesto da 8K | 11.2 | 4,1 s | 7,4 GB |
| Llama 3.2 3B Q4, risposta di 500 token | 37.8 | 0,4 s | 2,7 GB |
| Qwen 2.5 7B Q4, risposta di 500 token | 17.2 | 0,8 s | 5,4 GB |
| Phi-4 Mini 3,8B Q4, risposta di 500 token | 32.5 | 0,5 s | 2,9 GB |
Dopo circa 10 minuti di generazione continua, entra in azione il throttling termico e la velocità cala del 15–25%. Una pausa di 30 secondi ripristina la velocità massima. Per la maggior parte degli utilizzi (chat, domande occasionali), il throttling termico non si attiva mai.
Impatto sulla batteria e sul riscaldamento
Nei nostri test di consumo di batteria della durata di 30 minuti (domande alternate ogni 20–30 secondi):
- Llama 3 8B: consumo di batteria pari al 9%. La parte posteriore del telefono raggiunge circa 38 °C.
- Llama 3.2 3B: consumo della batteria pari al 5%. Il telefono rimane fresco.
- Qwen 2.5 7B: consumo della batteria pari al 9%. Simile a Llama 3 8B.
A titolo di confronto, 30 minuti di registrazione video in 4K comportano un consumo di batteria del 12–15% e surriscaldamento maggiore. L’inferenza locale di LLM è significativamente meno gravosa rispetto ai carichi di lavoro intensivi per la fotocamera.
Oltre la chat: flussi di lavoro utili
Una volta configurato un sistema funzionante, inizia il divertimento. Le seguenti attività funzionano bene in modalità completamente offline:
- Riassumere un articolo lungo — copia del testo, incolla in MLC Chat e chiedi «Riassumi questo in 3 punti elenco». Funziona per articoli fino a circa 4.000 parole, con contesto fino a 8K token.
- Riformulare o tradurre (entro i limiti del training del modello) — Llama 3 gestisce bene le traduzioni inglese ↔ spagnolo/francese/tedesco, mentre è meno affidabile per giapponese/arabo/hindi.
- Domande rapide su codice — Llama 3 8B è solido per domande di sintassi e piccoli frammenti di codice, ma debole nel ragionamento su più file.
- Modalità viaggio — un lungo volo senza segnale? Hai un assistente capace direttamente sul tuo telefono.
Ciò che non funziona bene direttamente sul dispositivo:
- Ragionamento su contesti lunghi (oltre 16K token) — i limiti termici del telefono causano throttling e la velocità scende sotto il livello d’uso pratico.
- Calcoli matematici oltre le operazioni aritmetiche di base — il modello da 8 miliardi di parametri non è sufficientemente potente.
- Comprensione delle immagini — Llama 3 accetta solo testo. Per l’elaborazione visiva, utilizza Qwen 2.5 VL 7B (eseguibile anche su Snapdragon 8 Gen 4 tramite MLC).
Risoluzione dei problemi
L’app si arresta in modo anomalo durante il caricamento del modello:
- Chiudere forzatamente tutte le altre app e riavviare il telefono.
- Assicurarsi di disporre di almeno 8 GB di RAM libera dopo il riavvio.
- Se il telefono dispone di 12 GB di RAM totali, sarà necessario chiudere tutte le altre applicazioni. I dispositivi con 16 GB di RAM offrono maggiore margine operativo.
Velocità di generazione inferiore o uguale a 5 token al secondo:
- L’NPU non viene utilizzato: stai ricadendo sull’elaborazione CPU.
- Chiudere forzatamente MLC Chat e riaprirlo.
- Aggiornare all’ultima versione dell’APK di MLC Chat (il supporto per l’NPU richiede la versione v0.18 o successiva).
- Verifica se un’altra funzionalità IA locale (Galaxy AI, Gemini Nano) è attualmente attiva — solo una può accedere all’NPU contemporaneamente.
Il telefono diventa eccessivamente caldo:
- Questo è previsto durante un utilizzo intensivo. Fare una pausa di 1 minuto e il telefono si raffredderà.
- Se il telefono è già caldo all’avvio, significa che era già sovraccarico dal punto di vista termico: chiudi le altre app, attendi qualche istante e riprova.
- Evitare di eseguire l’inferenza alla luce diretta del sole.
La batteria si scarica più velocemente del previsto:
- Verificare che le prestazioni adattive siano disattivate e che l’ottimizzazione della batteria sia disabilitata per MLC Chat (passaggio 3).
- Se una funzione come l’Always-On Display sta eseguendo carichi elevati di elaborazione ML, disabilitarla durante le sessioni di inferenza.
Il modello fornisce risposte scadenti:
- Il modello locale da 8 miliardi di parametri presenta un cutoff conoscitivo e capacità di ragionamento inferiori rispetto ai modelli cloud come GPT-4 o Claude. Per ragionamenti complessi o informazioni recenti, dovrai ricorrere a un modello cloud — si tratta di un compromesso intrinseco all’inferenza locale, non di un problema di configurazione.
Alternative a MLC-LLM nel 2026
ExecuTorch (runtime on-device di PyTorch) — pronto per l’uso in produzione, utilizzato internamente da Galaxy AI. Leggermente più lento di MLC-LLM nel 2026, ma meglio integrato nell’ecosistema PyTorch se stai sviluppando applicazioni.
Build Android di llama.cpp — manuale ma potente, utilizza la GPU ma non l’NPU sulla maggior parte dei telefoni del 2026. Ideale per utenti avanzati che desiderano un controllo completo sui parametri.
Private LLM (Play Store) — app finemente rifinita da 5 dollari, meno flessibile di MLC Chat ma più semplice per utenti non tecnici. Supporta l’NPU.
Soluzioni fornite dai produttori:
- Samsung Galaxy AI utilizza internamente ExecuTorch per alcune funzionalità on-device. Come sviluppatore non è possibile accedervi direttamente.
- AICore di Google (sui Pixel con Tensor G5) espone Gemini Nano tramite le API Edge AI. Disponibile esclusivamente sui Pixel.
- Apple Intelligence è, ovviamente, disponibile esclusivamente sugli iPhone.
Per chi cerca «un’app di chat già pronta all’uso oggi», MLC Chat è la scelta giusta nel 2026.
Cosa ci aspetta in futuro
Due sviluppi da tenere d’occhio nella seconda metà del 2026:
1. L’obiettivo annunciato da Qualcomm di eseguire modelli da 12 miliardi di parametri direttamente sul dispositivo per Snapdragon 8 Elite 2 (previsto per la fine del 2026). Questo spinge il limite delle prestazioni su dispositivo sempre più vicino alla «qualità dei modelli di punta nel cloud».
2. Decodifica speculativa per dispositivi mobili — implementazioni preliminari in MLC mostrano miglioramenti di throughput del 1,5–2× su Llama 3 8B senza perdita di qualità.
Entro metà 2027, gli LLM locali sui flagship telefonici dovrebbero raggiungere 25–30 token/sec sui modelli da 8 miliardi di parametri e probabilmente eseguire modelli da 13 miliardi di parametri a velocità utilizzabile.
Domande frequenti
L’esecuzione locale di Llama 3 sul mio telefono danneggerà la batteria?
No, con un utilizzo normale. La gestione termica sui telefoni con Snapdragon 8 Gen 4 è conservativa: l’NPU verrà rallentato ben prima che si verifichino danni hardware. Il problema maggiore è che un uso intensivo prolungato (diverse ore al giorno) accelera leggermente l’invecchiamento naturale della batteria rispetto a un utilizzo leggero, proprio come qualsiasi altro carico di lavoro impegnativo.
Llama 3 8B è altrettanto performante di ChatGPT sul mio telefono?
No, ma è sorprendentemente vicino per molti compiti. Llama 3 8B è approssimativamente paragonabile a GPT-3.5 del 2023 — solido per scrittura, riassunti, programmazione semplice e conversazioni. È chiaramente inferiore a GPT-4 o Claude Opus per ragionamenti complessi, conoscenze specialistiche e attività su contesti lunghi. Per «porre una domanda rapida offline», è eccellente.
Posso eseguirlo su un telefono con Snapdragon 8 Gen 3 del 2024?
Sì, ma vedrai 4–6 token/sec invece di 12–18. L’NPU Hexagon dello Snapdragon 8 Gen 3 offre circa la metà del throughput dello Snapdragon 8 Gen 4 per l’inferenza di LLM. Rimane comunque utilizzabile, seppur più lento. Lo Snapdragon 8 Gen 2 (flagship del 2023) fatica a superare i 3 token/sec ed è quasi impraticabile.
Posso utilizzare Llama 3 70B sul mio telefono?
No. Llama 3 70B in quantizzazione Q4 richiede circa 43 GB di memoria. Nessun telefono disponibile nel 2026 ne dispone nemmeno lontanamente. I modelli da 70 miliardi di parametri appartengono esclusivamente al segmento desktop. Per dispositivi mobili, la soglia pratica è rappresentata dai modelli da 8 miliardi di parametri, con Qwen 2.5 14B come limite superiore sui telefoni dotati di 16 GB di RAM (e anche in questo caso, con prestazioni molto ridotte).
Questo consuma il mio piano dati?
No — una volta scaricato il modello, tutta l’inferenza avviene completamente offline. Il download da 4,9 GB avviene una sola volta; tutto ciò che segue è locale. Questo è esattamente lo scopo degli LLM locali.
E per i telefoni jailbroken o rootati?
Questa guida funziona su Android stock e non richiede il root. Se il tuo telefono è rootato, puoi utilizzare direttamente llama.cpp per un controllo leggermente maggiore, ma il percorso MLC Chat è più veloce e semplice per il 95% degli utilizzi.
È iPhone 17 Pro migliore per gli LLM su dispositivo rispetto al Galaxy S26 Ultra?
Per le funzionalità integrate (Apple Intelligence rispetto a Galaxy AI), ciascuno ha i propri punti di forza. Per l’esecuzione di modelli open-weight personalizzati, il Galaxy offre maggiore flessibilità — Apple non espone il Neural Engine alle app di terze parti per un utilizzo arbitrario di LLM. App come Private LLM funzionano sull’iPhone tramite Metal/CoreML, ma non possono sfruttare il Neural Engine nello stesso modo in cui MLC Chat utilizza l’NPU Hexagon su Android. Consulta il nostro Confronto tra iPhone e Galaxy sull’intelligenza artificiale in-device per l’analisi completa.
Conclusione
Eseguire Llama 3 8B interamente su un flagship Android del 2026 non è più una curiosità — è una funzionalità realmente utile nella vita quotidiana, che opera offline, consuma una quantità modesta di batteria e rispetta la tua privacy per impostazione predefinita. MLC-LLM è il percorso consigliato, la configurazione richiede 30 minuti e il risultato è un assistente di chat capace direttamente in tasca.
Per la maggior parte degli utenti, gli LLM in esecuzione sul dispositivo integrano — piuttosto che sostituire — l’intelligenza artificiale basata sul cloud: usa il modello sul telefono quando sei offline, quando la privacy è una priorità o per domande rapide; ricorri ai modelli cloud per ragionamenti complessi, notizie aggiornate e compiti che richiedono la profondità dei modelli più grandi. Entrambi hanno il loro ruolo, e il 2026 è il primo anno in cui l’uso locale degli LLM vale davvero lo sforzo di configurazione.

