- LM Studio è un'applicazione desktop gratuita per scoprire, scaricare ed eseguire localmente modelli linguistici di grandi dimensioni su Windows, macOS e Linux.
- Include una interfaccia grafica per la chat, un browser di modelli (ricerca su Hugging Face) e un server HTTP locale compatibile con l'API OpenAI così che gli SDK esistenti possano puntare a
http://localhost:1234/v1senza modifiche al codice. - Esegue modelli quantizzati modelli GGUF tramite llama.cpp su tutte le piattaforme e MLX modelli su Apple Silicon; uno strumento da riga di comando chiamato
lmsviene fornito insieme all'interfaccia grafica. - L'adattamento pratico dipende dalla VRAM: un modello da 8B a 4-bit richiede circa 5 GB, mentre un modello da 70B ne richiede circa 40 GB. Usare la Calcolatore VRAM funzionalità di stima della memoria prima di scaricare.
LM Studio è un'applicazione desktop gratuita e closed-source che consente di scaricare ed eseguire localmente modelli linguistici di grandi dimensioni open-weight interamente sulla propria macchina. È disponibile per Windows, macOS e Linux, include motori di inferenza (llama.cpp su tutte le piattaforme, MLX su Apple Silicon), fornisce un'interfaccia grafica simile a ChatGPT ed espone un server REST compatibile con l'API OpenAI su localhost:1234 così che le applicazioni sviluppate per l'SDK OpenAI possano comunicare con un modello locale senza alcuna modifica.
L'app è sviluppata dal team dietro lmstudio.ai. È gratuita per uso personale e, secondo la pagina dedicata all' uso professionaledel fornitore, è gratuita anche per l'uso lavorativo; la redistribuzione commerciale è soggetta a termini specifici.
Che cos'è LM Studio fa effettivamente
LM Studio integra quattro componenti che normalmente sarebbero strumenti separati:
- Individuazione dei modelli. Un'interfaccia di ricerca integrata esegue query su Hugging Face per file GGUF e MLX. Si sceglie una quantizzazione (Q4_K_M, Q5_K_M, Q6_K, Q8_0, ecc.) e il download avviene direttamente nella cartella locale dei modelli.
- Interfaccia grafica per la chat. Una finestra di chat multiplo con prompt di sistema personalizzabili per ogni conversazione, cursori per temperatura/top-p, output strutturati (schema JSON) e supporto per allegare PDF o immagini (quest'ultima funzionalità solo con modelli dotati di capacità visive).
- Server di inferenza locale. Un endpoint HTTP su
http://localhost:1234/v1che implementa le API OpenAI per Chat Completions, Completions ed Embeddings. Per maggiori dettagli, consultare la documentazione del fornitore sulla compatibilità con l'API OpenAI. - CLI (
lms). Uno strumento da riga di comando per automatizzare il caricamento, lo scaricamento e il controllo del server. Installazione e comandi sono documentati all'indirizzo lmstudio.ai/docs/cli.
Sotto il cofano, l'inferenza viene eseguita con llama.cpp per i modelli GGUF e con Apple MLX per i modelli in formato MLX su Apple Silicon. LM Studio fornisce binari precompilati dei motori e permette di cambiarli o aggiornarli dalle impostazioni di runtime dell'app.
Piattaforme supportate
| Piattaforma | Requisiti (secondo il fornitore) | Accelerazione |
|---|---|---|
| Windows | x64 o ARM64; CPU x64 con supporto AVX2 | CPU, NVIDIA CUDA, Vulkan (GPU AMD/Intel) |
| macOS | Apple Silicon (M1 o successivi), macOS 13.4+ | Metal (llama.cpp) e MLX |
| Linux | x64, glibc 2.35+, distribuito come AppImage | CPU, NVIDIA CUDA, Vulkan |
I requisiti ufficiali attualmente pubblicati sono disponibili sulla pagina ufficiale di download; controllala prima dell'installazione, poiché i requisiti minimi esatti variano tra le versioni.
Windows
L'installer è un classico .exe. I modelli predefiniti sono in formato %USERPROFILE%\.lmstudiomodels. Le GPU NVIDIA utilizzano CUDA quando viene selezionato un runtime supportato; le altre GPU ricorrono a Vulkan. È richiesto AVX2 sui processori x64, quindi i processori molto vecchi non sono supportati.
macOS
Distribuito come .dmg. Su Apple Silicon sono disponibili anche modelli in formato MLX, oltre a quelli GGUF, e sfruttano generalmente in modo efficiente la memoria unificata. I modelli predefiniti sono in formato ~/.lmstudio/models. I Mac con processore Intel non sono supportati dalle versioni attuali.
Linux
Fornito come .AppImage. Rendilo eseguibile (chmod +x LM-Studio-*.AppImage) ed eseguilo direttamente. Le GPU NVIDIA usano CUDA; le GPU AMD e Intel usano Vulkan. Al momento della stesura di questo testo non esiste un pacchetto ufficiale .deb o .rpm — verifica la pagina di download per l’attuale formato di distribuzione.
Cosa si può eseguire con LM Studio
LM Studio può caricare qualsiasi modello GGUF supportato da llama.cpp, oltre ai modelli MLX su Apple Silicon. Il vero limite è rappresentato da ciò che effettivamente entra nella tua dotazione hardware. Stime approssimative dell’occupazione di VRAM in 4-bit, tratte dal database dei modelli Convly:
| Modello | Contesto | ~VRAM a 4 bit |
|---|---|---|
| Gemma 3 4B | 128K | ~3 GB |
| Mistral 7B | 32K | ~4,5 GB |
| Llama 3.1 8B | 128K | ~5 GB |
| Qwen3 8B | 128K | ~5 GB |
| Phi-4 | 16K | ~9 GB |
| Gemma 3 12B | 128K | ~8 GB |
| Qwen3 14B | 128K | ~9 GB |
| Gemma 3 27B | 128K | ~16 GB |
| Qwen3 32B | 128K | ~20 GB |
| Llama 3.3 70B | 128K | ~40 GB |
Qualsiasi modello superiore ai circa 40 GB richiede più GPU o schede grafiche con molta VRAM. Modelli molto grandi, come DeepSeek R1 (~400 GB in 4-bit), non sono praticabili su una singola GPU desktop. Per ulteriori dettagli, consulta la completa tabella dei requisiti di VRAM e il guida alle GPU per LLM locali prima di acquistare l'hardware.
Il server compatibile con l'API OpenAI
La funzionalità più utile per gli sviluppatori è il server locale. Avvialo dalla scheda Sviluppatore nell’interfaccia grafica oppure tramite CLI. Una volta avviato, accetta richieste standard nello stile OpenAI:
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "loaded-model-identifier",
"messages": [{"role": "user", "content": "Hello"}]
}'
L’SDK Python funziona puntando base_url al server locale:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
Il api_key Il valore del campo è ignorato per impostazione predefinita, ma il campo deve comunque essere presente perché richiesto dall’SDK OpenAI. Gli endpoint supportati e ogni eventuale deviazione dallo schema OpenAI sono elencati nel riferimento API.
LM Studio vs Ollama
Questi due approcci rappresentano i modi più comuni per eseguire LLM locali su una workstation. Ecco una panoramica generale delle differenze:
| LM Studio | Ollama | |
|---|---|---|
| Interfaccia principale | Interfaccia grafica desktop (chat, browser dei modelli) | CLI e API HTTP |
| Licenza | Applicazione closed-source; gratuita per uso personale e professionale | Open source (licenza MIT) |
| Origine dei modelli | Hugging Face (modelli GGUF, MLX) tramite ricerca integrata nell’app | Registro modelli Ollama (con possibilità di importare modelli GGUF) |
| Server | Compatibile con OpenAI a livello di :1234 |
API nativa a livello di :11434, strato compatibile con OpenAI |
| MLX per Apple Silicon | Sì | No (solo llama.cpp) |
Se desideri un’interfaccia grafica intuitiva e il supporto MLX su Mac, LM Studio è il punto di partenza più semplice. Se invece preferisci uno stack open source scriptabile e un server headless, consulta la Guida a Ollama e guida all’installazione.
Quando utilizzare LM Studio invece di un'API ospitata
L’inferenza locale comporta un reale compromesso. I vantaggi sono la privacy (nessun dato lascia il dispositivo), un costo prevedibile dopo l’ammortamento dell’hardware e la disponibilità offline. Gli svantaggi includono il costo iniziale dell’hardware, una velocità inferiore in termini di token al secondo rispetto a un cluster GPU ospitato e l’impossibilità di accedere ai modelli proprietari più avanzati.
Per avere un’idea approssimativa del punto di pareggio economico: i modelli ospitati presenti nella classifica Convly LLM costano da circa 0,02 USD per milione di token in input per piccoli modelli open source su provider serverless fino a 10 USD in ingresso / 50 USD in uscita per milione di token per i modelli proprietari più avanzati. Se il tuo carico di lavoro rientra nella fascia dei modelli più piccoli e puoi accettare una qualità compresa tra 8B e 30B, l’auto-hosting su una singola GPU consumer risulta spesso più conveniente in termini di costo totale. Calcola tu stesso i costi con il calcolatore self-hosting vs API e il Calcolatore dei costi API.
Checklist pratica per la configurazione
- Controlla la VRAM disponibile. Qualsiasi modello più grande della memoria della tua GPU verrà spostato nella RAM di sistema, causando un rallentamento significativo. Usa la Calcolatore VRAM.
- Scarica LM Studio da lmstudio.ai/download. Non installarlo da mirror di terze parti.
- Nella scheda Scopri dell’app, scegli un modello adatto alle tue capacità hardware. Inizia con una quantizzazione Q4_K_M, che offre il miglior compromesso tra dimensioni e qualità.
- Carica il modello. Osserva l’indicatore di utilizzo della VRAM; se non riesce a scaricare completamente il modello sulla GPU, scegli una quantizzazione più leggera o un modello più piccolo.
- Abilita il server dalla scheda Sviluppatore se prevedi di inviargli richieste da codice. Verifica il corretto funzionamento con
curl http://localhost:1234/v1/models.
Per una guida passo-passo con screenshot, consulta la Guida completa a LM Studio. Per liste di modelli ottimizzati specificatamente per hardware locale, vedi migliori modelli locali (le raccomandazioni valgono anche per LM Studio, poiché entrambi gli engine si basano su llama.cpp).
Domande frequenti
LM Studio è gratuito?
Sì. LM Studio è gratuito da scaricare e utilizzare per uso personale e, secondo la politica dell'editore per l'uso professionale, anche per scopi lavorativi. L'applicazione stessa è closed-source, ma i modelli che vi esegui sono modelli open-weight, rilasciati con licenza dai rispettivi editori (Meta, Google, Alibaba, Mistral, ecc.).
LM Studio invia dati al cloud?
L'inferenza viene eseguita interamente sul tuo dispositivo: i prompt e le risposte non lasciano mai il dispositivo. L'app si connette effettivamente a Hugging Face quando cerchi o scarichi modelli e verifica la disponibilità di aggiornamenti. Non viene raccolta alcuna telemetria relativa ai contenuti delle conversazioni, secondo quanto dichiarato nella pagina sulla privacy dell'editore; consulta direttamente tale pagina per conoscere l'attuale politica.
Quali formati di modello supporta LM Studio?
GGUF su tutte le piattaforme (tramite llama.cpp) e MLX su Apple Silicon. I checkpoint grezzi di Hugging Face safetensors e PyTorch non sono supportati direttamente: convertili prima in GGUF oppure scarica un file GGUF già quantizzato pubblicato dalla comunità.
Posso usare LM Studio come sostituto diretto dell'API OpenAI?
Per le chat completion, le completion e gli embedding, in larga misura sì: basta puntare l'SDK OpenAI verso base_url l’indirizzo http://localhost:1234/v1 e il codice esistente funzionerà. Le funzionalità che dipendono da comportamenti specifici del server OpenAI (assistants, API per file, generazione di immagini, moderazione) non sono implementate. Consulta l'elenco attuale degli endpoint supportati.
Quanta RAM o VRAM mi serve?
Regola empirica per la quantizzazione a 4 bit: la dimensione del modello in miliardi di parametri moltiplicata per circa 0,6 fornisce il numero di GB di VRAM necessari per i pesi, più alcuni GB aggiuntivi per la cache KV in contesti lunghi. Un modello da 7–8 miliardi di parametri gira agevolmente su una GPU da 8 GB; un modello da 70 miliardi richiede circa 40 GB (vedi le cifre riportate sopra nella sezione Convly). Per una panoramica dettagliata suddivisa per modello, consulta Database di modelli i requisiti di VRAM Requisiti di VRAM.
LM Studio supporta le chiamate a strumenti (tool calling) e gli output strutturati?
Sì, per gli output strutturati tramite schema JSON; le chiamate a strumenti/funzioni sono supportate per i modelli la cui chat template lo dichiara esplicitamente (in particolare le versioni più recenti di Llama, Qwen, Mistral e Gemma). La qualità delle chiamate a strumenti dipende dal modello sottostante, non da LM Studio stesso. Eseguire test con il modello target prima di adottarlo in produzione.
