- I modelli LLM locali vengono eseguiti sul vostro hardware senza chiamate API. Tra le opzioni più diffuse figurano Llama 3.1 (8B-405B), Mistral 7B, Phi-3 e Gemma 2.
- Usate Ollama per la configurazione più semplice (
ollama run llama3.1), LM Studio per un'interfaccia grafica, oppure llama.cpp per il massimo controllo. - Un modello da 8 miliardi di parametri richiede 6-8 GB di VRAM con quantizzazione a 4 bit, mentre per la precisione completa servono 16 GB. I modelli da 70 miliardi di parametri necessitano di almeno 40 GB di VRAM oppure di offloading sulla RAM di sistema.
- La quantizzazione (GGUF, GPTQ, AWQ) riduce le dimensioni del modello del 50-75% con una perdita minima di qualità, rendendo così pratico il deployment locale su hardware consumer.
I modelli LLM locali sono modelli linguistici di intelligenza artificiale che vengono eseguiti interamente sul vostro hardware — desktop, laptop o server — senza inviare dati a API esterne. Scaricate i pesi del modello, li caricate in memoria ed eseguite l'inferenza in locale. Questo garantisce totale privacy, assenza di costi per ogni token generato, funzionamento offline e pieno controllo sul comportamento del modello. Il compromesso consiste nell'investimento iniziale sull'hardware e in un'inferenza più lenta rispetto ai provider cloud, che operano su infrastrutture altamente ottimizzate.
Popolari LLM locale Modelli
Al 2026, questi modelli offrono il miglior equilibrio tra qualità e accessibilità hardware per il deployment locale:
| Modello | Parametri | VRAM (4-bit) | VRAM (16 bit) | Ideale per |
|---|---|---|---|---|
| Llama 3.1 | 8B / 70B / 405B | 6 GB / 40 GB / 240 GB | 16 GB / 140 GB / 810 GB | Uso generico, programmazione, ragionamento |
| Mistral 7B v0.3 | 7B | 5 GB | 14 GB | Inferenza rapida, ottimo rapporto qualità/dimensioni |
| Phi-3-medium | 14B | 9 GB | 28 GB | Ragionamento efficiente, adatto alle GPU consumer |
| Gemma 2 | 9B / 27B | 6 GB / 18 GB | 18 GB / 54 GB | Seguimento di istruzioni, ottimizzato per la sicurezza |
| Qwen 2.5 | 7B / 72B | 5 GB / 42 GB | 14 GB / 144 GB | Multilingue, eccellente in matematica e programmazione |
| DeepSeek-Coder-V2 | 16B / 236B | 10 GB / 140 GB | 32 GB / 472 GB | Generazione e comprensione del codice |
Le stime della VRAM sono approssimative e variano in base alla lunghezza del contesto e alla dimensione del batch. Usate il Calcolatore VRAM per requisiti precisi in base alla vostra configurazione, oppure consultate Requisiti VRAM per modello per specifiche dettagliate su oltre 37 modelli.
Requisiti hardware
I modelli LLM locali vengono caricati interamente in memoria durante l'inferenza. È possibile eseguirli sulla VRAM della GPU, sulla RAM di sistema o su una combinazione di entrambe:
GPU (più veloce)
Le GPU NVIDIA con supporto CUDA offrono le migliori prestazioni. Le GPU AMD funzionano tramite ROCm, ma con un supporto strumentale inferiore. Apple Silicon (M1/M2/M3) utilizza memoria unificata ed esegue i modelli in modo efficiente tramite Metal.
- Entry level: RTX 3060 da 12 GB o RTX 4060 Ti 16 GB esegue modelli da 7 a 8 miliardi di parametri con quantizzazione a 4 bit
- Fascia media: La RTX 4090 da 24 GB gestisce modelli da 30 miliardi di parametri quantizzati oppure modelli da 13 miliardi di parametri in precisione completa
- Alta gamma: L'A6000 da 48 GB o due GPU consumer in configurazione multi-GPU permettono di eseguire modelli da 70 miliardi di parametri con quantizzazione a 4 bit
Consultate il le migliori GPU per LLM locali guida per i benchmark di prestazioni e i rapporti prezzo/prestazioni.
CPU (più lenta ma accessibile)
Qualsiasi CPU moderna può eseguire modelli LLM locali utilizzando la RAM di sistema, sebbene con una velocità di inferenza 10-50 volte inferiore rispetto a quella su GPU. Questa soluzione è praticabile per modelli piccoli (7-8 miliardi di parametri) o quando la privacy ha priorità sulla velocità.
- Minimo: 16 GB di RAM per modelli da 7B con quantizzazione a 4 bit
- Consigliato: 32 GB o più di RAM per un funzionamento agevole con finestre di contesto più ampie
- Server: 128 GB o più di RAM consentono l’esecuzione di modelli da 70B su sistemi basati esclusivamente su CPU
Ibrido (GPU + CPU)
La maggior parte dei framework supporta il caricamento parziale (offloading): alcuni strati vengono caricati sulla GPU, mentre gli altri vengono gestiti dalla RAM. Un modello da 70B potrebbe ad esempio utilizzare 24 GB di VRAM + 32 GB di RAM, ottenendo un’accelerazione dell’inferenza pari a 3-5 volte rispetto all’esecuzione su CPU esclusivamente.
Esecuzione di modelli LLM locali
Ollama (la soluzione più semplice)
Ollama incapsula llama.cpp fornendo un’interfaccia a riga di comando intuitiva e un registro di modelli. È il modo più rapido per iniziare:
# Installazione su macOS/Linux
curl -fsSL https://ollama.ai/install.sh | sh
# Windows: scarica l'installer da ollama.ai
# Esegui un modello (viene scaricato automaticamente)
ollama run llama3.1
# Elenca i modelli disponibili
ollama list
# Scarica un modello specifico
ollama pull mistral:7b-instruct-q4_0
Ollama seleziona automaticamente GPU o CPU, gestisce la quantizzazione e si occupa del download dei modelli. Per informazioni dettagliate su installazione e configurazione, consulta la Guida completa a Ollama documentazione ufficiale come installare Ollama oppure passa direttamente alla sezione
Esplora i 100+ modelli disponibili nel Elenco modelli Ollamacatalogo ufficiale di Ollama I migliori modelli locali per Ollama.
LM Studio (interfaccia grafica)
LM Studio fornisce un’applicazione desktop per Windows, macOS e Linux dotata di un’interfaccia chat e di un browser per modelli. Scaricala da lmstudio.ai, avviala, cerca i modelli nella scheda "Scopri" e clicca su "Scarica". I modelli utilizzano il formato GGUF e vengono caricati con livelli di quantizzazione regolabili.
LM Studio mostra in tempo reale l’utilizzo della VRAM e la velocità di inferenza, semplificando l’ottimizzazione delle impostazioni. Inoltre, avvia un server API locale compatibile con OpenAI all’indirizzo http://localhost:1234/v1 http://localhost:1234 Guida completa a LM Studio per le funzionalità avanzate.
llama.cpp (soluzione avanzata)
llama.cpp è il motore sottostante di Ollama e LM Studio, che offre il massimo controllo agli sviluppatori:
# Clona e compila
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make
# Con supporto CUDA
make LLAMA_CUDA=1
# Esegui l'inferenza
./main -m models/llama-3.1-8b-instruct-q4_0.gguf -p "Spiega la computazione quantistica" -n 512 --gpu-layers 35
Il --gpu-layers controlla quanti strati del transformer vengono caricati sulla GPU anziché sulla RAM. Valori più alti richiedono più VRAM ma garantiscono prestazioni migliori. Inizia impostando questo valore a metà del numero totale di strati del modello e regolalo in base ai risultati.
Altri strumenti
- text-generation-webui: Interfaccia web con estensioni e supporto per più backend
- vLLM: Server di inferenza ottimizzato per distribuzioni produttive ad alto throughput
- LocalAI: Sostituto plug-and-play dell’API OpenAI che supporta diversi formati di modelli
- Jan: Applicazione desktop simile a LM Studio, con particolare attenzione alla privacy
Formati dei modelli e quantizzazione
La quantizzazione riduce la precisione del modello da numeri in virgola mobile a 16 o 32 bit a 8 bit, 4 bit o precisione mista, riducendo i requisiti di memoria del 50-75% con una perdita di qualità del 2-5%. Differenti formati sono ottimizzati per hardware specifico:
GGUF (Ollama, LM Studio, llama.cpp)
GGUF è il formato standard per il deployment locale. Livelli comuni di quantizzazione:
- Q4_0: 4 bit, dimensione minima, perdita di qualità del 5-10%
- Q4_K_M: 4 bit con precisione mista, ottimo compromesso tra qualità e dimensione
- Q5_K_M: 5 bit, qualità migliore rispetto a Q4, pur mantenendo dimensioni contenute
- Q8_0: 8 bit, perdita di qualità minima, file più grandi
- F16: Precisione completa a 16 bit, nessuna quantizzazione
Per la maggior parte degli utilizzi, Q4_K_M o Q5_K_M offrono il miglior rapporto qualità/dimensione. Usa Q8_0 o F16 solo se disponi di VRAM in abbondanza e hai bisogno della massima accuratezza.
GPTQ (inferenza in Python)
GPTQ effettua la quantizzazione a 4 bit o 3 bit e ottimizza l’inferenza su GPU tramite librerie come AutoGPTQ o ExLlama. È molto diffuso nei flussi di lavoro basati su Hugging Face Transformers. I modelli GPTQ vengono caricati più rapidamente rispetto a quelli GGUF, ma richiedono ambienti Python.
AWQ (inferenza GPU veloce)
AWQ (Activation-aware Weight Quantization) preserva maggiore accuratezza rispetto a GPTQ a 4 bit proteggendo i pesi più importanti. Richiede motori di inferenza compatibili con AWQ, come vLLM o TGI.
Scelta di un modello LLM locale
Scegli la dimensione del modello in base al tuo hardware e al caso d’uso:
- Modelli da 7-8B: Si adattano alle GPU consumer (12-16 GB di VRAM), offrono risposte rapide ed è ideale per chat e compiti semplici
- Modelli da 13-14B: Richiedono 20-24 GB di VRAM e offrono un miglioramento evidente nelle capacità di ragionamento e nell’esecuzione di istruzioni
- Modelli da 30-34B: Necessitano di almeno 40 GB di VRAM o di una configurazione ibrida GPU+RAM, avvicinandosi alla qualità di GPT-3.5
- Modelli da 70 miliardi in su: Richiedono hardware server o una quantizzazione aggressiva, competono con GPT-4 su molti compiti
Esplora le specifiche e i punteggi dei benchmark per 37 modelli nella Database di modelli IA, oppure confronta le classifiche nella Classifica LLM ordinata in base all’intelligenza, al prezzo e alla lunghezza del contesto.
Per l’analisi dei costi, utilizza il calcolatore self-hosting vs API per calcolare il punto di pareggio tra i costi dell’hardware locale e quelli delle API cloud. I modelli locali comportano un costo iniziale maggiore, ma hanno un costo marginale nullo per token, risultando più economici ad alto volume.
Domande frequenti
Posso eseguire modelli LLM locali su un laptop?
Sì, purché disponiate di almeno 16 GB di memoria unificata (Apple Silicon) oppure di almeno 16 GB di RAM più una GPU dedicata con almeno 8 GB di VRAM. I MacBook Pro dotati di chip M1 Max/Ultra, M2 Pro/Max o M3 Max eseguono in modo efficiente modelli da 7 a 13 miliardi di parametri. I laptop Windows/Linux equipaggiati con GPU mobili RTX 4060-4090 gestiscono modelli da 7 a 30 miliardi di parametri, a seconda della quantità di VRAM disponibile. L'inferenza basata esclusivamente sulla CPU funziona su qualsiasi laptop con almeno 16 GB di RAM, ma risulta 10-50 volte più lenta.
Quanto sono più lenti i modelli LLM locali rispetto ai provider API?
Dipende dall'hardware. Un modello da 7 miliardi di parametri su una RTX 4090 genera 80-120 token al secondo, prestazioni paragonabili alla latenza offerta dalle API. Lo stesso modello su CPU genera invece 5-15 token al secondo. Modelli più grandi (70 miliardi di parametri e oltre) su hardware consumer generano soltanto 2-10 token al secondo, anche con accelerazione GPU. I provider cloud utilizzano cluster H100 ottimizzati per il throughput, ma i modelli locali eliminano completamente la latenza di rete: la risposta al primo token è istantanea.
I modelli LLM locali richiedono accesso a Internet?
No, una volta scaricati. I pesi del modello vengono scaricati una sola volta (da 1 a 150 GB, a seconda delle dimensioni del modello), dopodiché l'inferenza avviene interamente in modalità offline. Ollama, LM Studio e llama.cpp memorizzano i modelli nella cache locale. Ciò rende i modelli LLM locali adatti a ambienti isolati (air-gapped), viaggi o attività sensibili dal punto di vista della privacy, dove nessun dato può lasciare la propria rete.
Qual è la differenza di qualità tra modelli quantizzati e modelli a precisione piena?
La quantizzazione a 4 bit (Q4_K_M) comporta una perdita di qualità del 2–5% sulla maggior parte dei benchmark rispetto alla precisione a 16 bit, con impatti principalmente sul ragionamento complesso e sul richiamo fattuale. La quantizzazione a 8 bit comporta una perdita inferiore all’1%. Per chat, assistenza nella programmazione ed elaborazione di documenti, la maggior parte degli utenti non riesce a distinguere Q4_K_M da F16. Per applicazioni critiche che richiedono la massima accuratezza (medica, legale, scientifica), utilizza Q8_0 o F16, se disponi della VRAM necessaria.
Posso effettuare il fine-tuning di modelli LLM locali?
Sì, utilizzando librerie come Axolotl, Ludwig o Hugging Face TRL. Il fine-tuning richiede più VRAM rispetto all'inferenza: prevedete almeno 24 GB per il fine-tuning completo di un modello da 7 miliardi di parametri, oppure 12-16 GB con metodi efficienti dal punto di vista dei parametri, come LoRA. I pesi ottenuti dal fine-tuning sostituiscono o integrano quelli del modello base, quindi potrete distribuire il modello affinato utilizzando gli stessi strumenti (Ollama, LM Studio, llama.cpp) dopo averlo convertito nel formato GGUF o in un altro formato compatibile con l'inferenza.
Quale modello LLM locale si avvicina di più alla qualità di ChatGPT?
Llama 3.1 70B si avvicina alla qualità di GPT-4 nel ragionamento e nel seguire istruzioni, mentre Llama 3.1 405B eguaglia o supera GPT-4 su molti benchmark. Per una qualità equivalente a quella di GPT-3.5, Llama 3.1 8BPhi-3.5 14B, Mistral 7B o Qwen 2.5 14B sono sufficienti. Nessun modello locale replica completamente il comportamento di ChatGPT, poiché quest’ultimo utilizza l’augmentation tramite retrieval, più modelli e post-processing, ma le capacità raw dei modelli sono ormai comparabili alla scala 70B+.

