- LM Studio è un'applicazione desktop gratuita per eseguire modelli linguistici di grandi dimensioni in locale sul proprio computer, senza necessità di programmazione né di utilizzo della riga di comando
- Consente di scaricare direttamente modelli da Hugging Face tramite il browser integrato e supporta il formato GGUF con selezione automatica della quantizzazione
- Include un'interfaccia chat, un server API locale (compatibile con OpenAI) e accelerazione hardware automatica (CUDA, Metal, CPU)
- Richiede una quantità sufficiente di VRAM/RAM in base alle dimensioni del modello: tipicamente almeno 8 GB per modelli da 7B, 24 GB o più per modelli da 13B
LM Studio è un'applicazione desktop che consente di scaricare, eseguire e interagire con modelli linguistici di grandi dimensioni direttamente sul proprio computer. Offre un'interfaccia grafica per operazioni che normalmente richiederebbero strumenti da riga di comando, rendendo l'intelligenza artificiale locale accessibile a sviluppatori e utenti tecnici che desiderano un pieno controllo sui propri modelli, senza inviare dati ad API esterne. L'applicazione gestisce automaticamente la ricerca, il download, la selezione della quantizzazione e l'accelerazione hardware.
A differenza dei servizi di intelligenza artificiale basati sul cloud, LM Studio funziona interamente in modalità offline una volta scaricato un modello. Le tue conversazioni, i documenti e i prompt non lasciano mai il tuo dispositivo. Ciò lo rende adatto a lavori sensibili, sperimentazioni senza costi legati alle API e ambienti con connettività Internet limitata o assente.
Installazione
Windows
Scarica l’installer da lmstudio.ai. Il blocco .exe L'installer ha generalmente dimensioni comprese tra 200 e 400 MB. Eseguilo e segui la procedura guidata di installazione. LM Studio verrà installato nella cartella C:\Users\[IlTuoNomeUtente]\AppData\Local\LM-Studio per impostazione predefinita. I modelli vengono scaricati nella cartella C:\Users\[IlTuoNomeUtente]\.cache\lm-studio\models a meno che tu non modifichi il percorso nelle impostazioni.
Per l'accelerazione GPU su Windows, sono necessari driver NVIDIA versione 522.06 o successiva per il supporto CUDA. LM Studio rileverà e utilizzerà automaticamente la tua GPU, se disponibile.
macOS
Scarica l’ .dmg file da lmstudio.ai. Apri il file e trascina LM Studio nella cartella Applicazioni. I modelli vengono scaricati nella cartella ~\/Library\/Application Support\/LMStudio\/models per impostazione predefinita.
I Mac con chip Apple Silicon (M1, M2, M3, M4) beneficiano automaticamente dell'accelerazione Metal. I Mac Intel utilizzeranno l'inferenza sulla CPU, che è significativamente più lenta ma funzionale per modelli più piccoli.
Linux
Scarica l’ .AppImage file. Rendilo eseguibile con il comando chmod +x LM-Studio-*.AppImage, quindi avvialo con .\/LM-Studio-*.AppImage. I modelli vengono scaricati nella cartella ~\/\.cache\/lm-studio\/models.
Per l'accelerazione GPU NVIDIA, installa il toolkit CUDA 11.8 o versione successiva ed assicurati che il comando nvidia-smi mostri la tua GPU. LM Studio rileverà automaticamente CUDA.
Download e caricamento dei modelli
LM Studio utilizza il formato GGUF, un formato di modelli quantizzati che riduce i requisiti di memoria mantenendo comunque un'elevata qualità. Quando apri LM Studio, fai clic sull'icona di ricerca nella barra laterale sinistra per sfogliare i modelli. La ricerca integrata attinge direttamente da Hugging Face e filtra i file GGUF compatibili.
Cerca un modello per nome (ad esempio "llama 3.1", "mistral", "phi"). Ogni risultato mostra diversi livelli di quantizzazione, etichettati come Q4_K_M, Q5_K_S, oppure Q8_0. Il numero indica la profondità in bit: Q4 utilizza 4 bit per peso, Q8 ne utilizza 8. Valori più bassi corrispondono a dimensioni del file minori e inferenze più veloci, ma con una leggera riduzione della qualità.
Per la maggior parte degli utilizzi, Q4_K_M o Q5_K_M offre il miglior compromesso. Utilizza il nostro Calcolatore VRAM per stimare quanta memoria sarà necessaria per un determinato modello e livello di quantizzazione. Come linea guida approssimativa:
| Dimensione del modello | VRAM Q4_K_M | VRAM Q5_K_M | VRAM Q8_0 |
|---|---|---|---|
| 7B parametri | ~5 GB | ~6 GB | ~9 GB |
| 13B parametri | ~9 GB | ~11 GB | ~16 GB |
| 34B parametri | ~22 GB | ~27 GB | ~40 GB |
| 70B parametri | ~42 GB | ~51 GB | ~75 GB |
Fai clic sull'icona di download accanto al livello di quantizzazione scelto. Le dimensioni dei modelli variano da 3 GB a oltre 50 GB, a seconda delle dimensioni. Una volta scaricato, fai clic sul nome del modello nella tua libreria per caricarlo. LM Studio mostrerà l'allocazione di GPU e RAM nell'angolo in basso a destra. Se il modello non entra interamente nella VRAM, LM Studio trasferirà alcuni layer nella RAM di sistema, rallentando notevolmente l'inferenza.
Utilizzo dell'interfaccia chat
Dopo aver caricato un modello, l'interfaccia chat appare nella finestra principale. Digita il tuo prompt nella casella di testo in basso e premi Invio oppure fai clic sull'icona di invio. Il modello genera la risposta in locale: non è richiesta alcuna connessione Internet una volta caricato.
Controlli principali:
- Cursore della temperatura (barra laterale destra): regola il grado di casualità. Valori tra 0,1 e 0,3 per compiti fattuali, tra 0,7 e 1,0 per scrittura creativa
- Token massimi: limita la lunghezza della risposta. Il valore predefinito è solitamente 2048; aumentarlo per ottenere output più lunghi
- Prompt di sistema: definisce il comportamento e la personalità del modello. Fare clic su «Modifica» nella barra superiore per modificarlo
- Sequenze di arresto: token che interrompono anticipatamente la generazione, utili per formati di output strutturati
LM Studio supporta conversazioni multiround. Ogni messaggio rimane nel contesto finché non si fa clic su «Nuova chat» o finché la finestra di contesto non si riempie. La maggior parte dei modelli dispone di una finestra di contesto da 4k a 32k token: consultare la scheda del modello per i dettagli specifici.
Esecuzione di un server API locale
LM Studio include un server API compatibile con OpenAI, che consente di utilizzare modelli locali come sostituti diretti di GPT-4 o GPT-3.5 nelle applicazioni esistenti. Fare clic sull'icona </> nella barra laterale sinistra per aprire la scheda «Server locale».
Selezionare un modello caricato dal menu a discesa e fare clic su «Avvia server». Il server viene eseguito all'indirizzo http://localhost:1234 per impostazione predefinita. L'interfaccia utente mostra un esempio di codice:
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "local-model",
"messages": [{"role": "user", "content": "Ciao"}]
}'Qualsiasi strumento compatibile con il formato API di OpenAI funziona con il server di LM Studio. Impostare l'URL base su http://localhost:1234/v1 e utilizzare una qualsiasi stringa non vuota come chiave API (LM Studio non la convalida). Ciò include:
- LangChain (Python/JS): impostare
openai_api_basesu localhost - SDK Python di OpenAI:
openai.api_base = "http://localhost:1234/v1" - Editor di testo con funzionalità AI (Cursor, Continue, Cody): configurarli per puntare a localhost nelle impostazioni
- Script personalizzati: sostituire
https://api.openai.com/v1conhttp://localhost:1234/v1
Il server supporta risposte in streaming e chiamate a funzioni (se il modello è stato addestrato per farlo). Controllare i log nella scheda «Server» per eseguire il debug delle richieste.
Configurazione e impostazioni hardware
Fare clic sull'icona dell'ingranaggio (Impostazioni) nell'angolo in basso a sinistra per regolare:
- Percorso cartella modelli: modificare la cartella in cui i modelli vengono scaricati e caricati
- Livelli di offload GPU: controlla quanti livelli vengono eseguiti sulla GPU rispetto alla CPU. Il rilevamento automatico funziona bene, ma un aggiustamento manuale può essere utile se si eseguono contemporaneamente più applicazioni
- Sovrascrittura lunghezza contesto: aumentare questo valore se il modello lo supporta e si necessita di conversazioni più lunghe. Un contesto più ampio richiede più VRAM
- Thread di inferenza: numero di thread della CPU dedicati all'inferenza. Il valore predefinito è «automatico», ma impostarlo sul numero di core fisici (non hyperthreaded) può migliorare le prestazioni
Per ottenere le migliori prestazioni, chiudere altre applicazioni che richiedono intensivamente la GPU (giochi, editing video, rendering 3D) prima di caricare modelli di grandi dimensioni. Su laptop, collegare l'alimentatore e impostare la modalità di alimentazione su «Alte prestazioni»: il throttling di CPU e GPU influisce notevolmente sulla velocità di inferenza.
LM Studio vs Ollama
LM Studio e Ollama eseguono entrambi modelli locali, ma differiscono per interfaccia e flusso di lavoro:
| Funzionalità | LM Studio | Ollama |
|---|---|---|
| Interfaccia | Interfaccia grafica desktop | Linea di comando + API |
| Scoperta dei modelli | Browser integrato | Registro modelli separato |
| Formato | File GGUF | Formato personalizzato (conversione da GGUF) |
| Controllo della quantizzazione | Scelta della quantizzazione specifica | Automatico |
| Interfaccia chat | Integrata | Nessuna (utilizzare strumenti esterni) |
| Curva di apprendimento | Più basso (visuale) | Più ripido (CLI) |
Utilizzare LM Studio se si desidera un'interfaccia visuale, un controllo diretto sui file dei modelli e non si vuole usare il terminale. Utilizzare Ollama se si preferisce flussi di lavoro basati sulla riga di comando, si desidera un server leggero o si intende integrare il tutto in una pipeline automatizzata. Entrambi sono gratuiti e gestiscono l'accelerazione GPU in modo simile. Consultare la nostra guida ai modelli locali per raccomandazioni compatibili con entrambi gli strumenti.
Scelta dei modelli per LM Studio
La scelta del modello dipende dall'hardware disponibile e dall'uso previsto. Consultare la nostra Database di modelli IA per specifiche e requisiti di VRAM relativi a oltre 37 modelli.
Per 8–16 GB di VRAM: Llama 3.1 8B, Mistral 7B, Phi-3 Medium (14B). Questi modelli gestiscono bene conversazioni generali, assistenza nella programmazione e sintesi.
Per 24 GB di VRAM: Llama 3.1 70B (quantizzato Q3), Mixtral 8x7B, Command R+ 35B (quantizzato Q4). Salto significativo di qualità nel ragionamento e nell’esecuzione di istruzioni complesse.
Per 48 GB o più di VRAM: Llama 3.1 405B (quantizzato Q3), Qwen 2.5 72B (quantizzato Q5). Prestazioni quasi all’avanguardia per la maggior parte dei compiti.
Se non sei sicuro che un modello sia compatibile con il tuo hardware, utilizza il Calcolatore VRAM prima del download. Un modello che si adatta appena alla VRAM verrà spostato parzialmente nella RAM e risulterà 5–10 volte più lento rispetto a uno caricato interamente nella VRAM.
Domande frequenti
LM Studio funziona in modalità offline?
Sì, completamente. È necessaria una connessione Internet solo per scaricare i modelli inizialmente; una volta scaricati, LM Studio funziona senza alcuna connessione di rete. Modelli, inferenza e server API locale operano tutti in modalità offline. Ciò lo rende adatto a ambienti isolati (air-gapped) o all’uso in assenza di connettività.
Posso utilizzare i modelli di LM Studio nelle mie applicazioni personali?
Sì. Avvia il server API locale in LM Studio e indirizza la tua applicazione su http://localhost:1234/v1. Qualsiasi codice che utilizzi il formato dell’API OpenAI funzionerà senza modifiche. Puoi anche caricare direttamente file GGUF nel tuo codice usando librerie come llama.cpp, llama-cpp-python, oppure ctransformers—i modelli scaricati tramite LM Studio sono file GGUF standard memorizzati nella cartella cache.
Quanto costa LM Studio?
LM Studio è gratuito. Non sono previsti abbonamenti, costi per l’uso dell’API né limiti di utilizzo. Anche i modelli sono gratuiti: la maggior parte è open source e rilasciata con licenze permissive (MIT, Apache 2.0, Llama 3.1 Community License). Gli unici costi sostenuti sono quelli relativi all’hardware e all’energia elettrica. Usa il nostro calcolatore self-hosting vs API per confrontare i costi dell’inferenza locale con quelli delle API cloud.
Perché l’inferenza è lenta sul mio computer?
Tre cause comuni: (1) Il modello non entra interamente nella VRAM e viene spostato parzialmente nella RAM — controlla la visualizzazione della memoria in LM Studio e prova una quantizzazione più leggera o un modello più piccolo. (2) La GPU non viene rilevata — verifica che i driver siano aggiornati (Windows/Linux) o che tu stia utilizzando Apple Silicon (macOS). (3) Limitazione della potenza della CPU sui laptop — collega il dispositivo all’alimentazione e imposta la modalità prestazioni elevate. La velocità di inferenza scala approssimativamente con la larghezza di banda della VRAM, quindi GPU più vecchie o dedicate ai dispositivi mobili saranno più lente rispetto alle schede da desktop, anche quando dispongono di sufficiente memoria.
Posso eseguire il fine-tuning o l’addestramento di modelli in LM Studio?
No. LM Studio è dedicato esclusivamente all’inferenza: carica ed esegue modelli pre-addestrati, ma non supporta l’addestramento né il fine-tuning. Per queste attività hai bisogno di framework specifici come Axolotl, Hugging Face Transformers o MLX (per Apple Silicon). Puoi eseguire il fine-tuning altrove, esportare il modello nel formato GGUF e quindi caricare il modello fine-tuned in LM Studio.
Qual è la differenza tra le etichette di quantizzazione Q4_K_M, Q5_K_S e altre?
Il numero (Q4, Q5, Q8) indica il numero di bit per peso: valori più bassi corrispondono a dimensioni minori e velocità maggiore, mentre valori più alti garantiscono maggiore accuratezza. Il suffisso indica il metodo di quantizzazione: K_M (medio, bilanciato), K_S (piccolo, compressione più aggressiva), K_L (grande, preserva maggiore precisione). Per la maggior parte degli utenti, Q4_K_M o Q5_K_M rappresenta il compromesso ideale. Utilizza Q2 o Q3 solo se la VRAM è estremamente limitata; in questi casi la qualità peggiora in modo evidente. Q8 è vicino alla precisione completa, ma offre un miglioramento minimo della qualità rispetto a Q5 per la maggior parte dei compiti, pur raddoppiando il consumo di VRAM.

