Thursday, 20 August 2026 | Updating Daily AI insight, written for builders

LM Studio: Guida completa all'esecuzione di modelli AI locali

In breve:

  • LM Studio è un'applicazione desktop gratuita per eseguire modelli linguistici di grandi dimensioni in locale sul proprio computer, senza necessità di programmazione né di utilizzo della riga di comando
  • Consente di scaricare direttamente modelli da Hugging Face tramite il browser integrato e supporta il formato GGUF con selezione automatica della quantizzazione
  • Include un'interfaccia chat, un server API locale (compatibile con OpenAI) e accelerazione hardware automatica (CUDA, Metal, CPU)
  • Richiede una quantità sufficiente di VRAM/RAM in base alle dimensioni del modello: tipicamente almeno 8 GB per modelli da 7B, 24 GB o più per modelli da 13B

LM Studio è un'applicazione desktop che consente di scaricare, eseguire e interagire con modelli linguistici di grandi dimensioni direttamente sul proprio computer. Offre un'interfaccia grafica per operazioni che normalmente richiederebbero strumenti da riga di comando, rendendo l'intelligenza artificiale locale accessibile a sviluppatori e utenti tecnici che desiderano un pieno controllo sui propri modelli, senza inviare dati ad API esterne. L'applicazione gestisce automaticamente la ricerca, il download, la selezione della quantizzazione e l'accelerazione hardware.

A differenza dei servizi di intelligenza artificiale basati sul cloud, LM Studio funziona interamente in modalità offline una volta scaricato un modello. Le tue conversazioni, i documenti e i prompt non lasciano mai il tuo dispositivo. Ciò lo rende adatto a lavori sensibili, sperimentazioni senza costi legati alle API e ambienti con connettività Internet limitata o assente.

Installazione

Windows

Scarica l’installer da lmstudio.ai. Il blocco .exe L'installer ha generalmente dimensioni comprese tra 200 e 400 MB. Eseguilo e segui la procedura guidata di installazione. LM Studio verrà installato nella cartella C:\Users\[IlTuoNomeUtente]\AppData\Local\LM-Studio per impostazione predefinita. I modelli vengono scaricati nella cartella C:\Users\[IlTuoNomeUtente]\.cache\lm-studio\models a meno che tu non modifichi il percorso nelle impostazioni.

Per l'accelerazione GPU su Windows, sono necessari driver NVIDIA versione 522.06 o successiva per il supporto CUDA. LM Studio rileverà e utilizzerà automaticamente la tua GPU, se disponibile.

macOS

Scarica l’ .dmg file da lmstudio.ai. Apri il file e trascina LM Studio nella cartella Applicazioni. I modelli vengono scaricati nella cartella ~\/Library\/Application Support\/LMStudio\/models per impostazione predefinita.

I Mac con chip Apple Silicon (M1, M2, M3, M4) beneficiano automaticamente dell'accelerazione Metal. I Mac Intel utilizzeranno l'inferenza sulla CPU, che è significativamente più lenta ma funzionale per modelli più piccoli.

Linux

Scarica l’ .AppImage file. Rendilo eseguibile con il comando chmod +x LM-Studio-*.AppImage, quindi avvialo con .\/LM-Studio-*.AppImage. I modelli vengono scaricati nella cartella ~\/\.cache\/lm-studio\/models.

Per l'accelerazione GPU NVIDIA, installa il toolkit CUDA 11.8 o versione successiva ed assicurati che il comando nvidia-smi mostri la tua GPU. LM Studio rileverà automaticamente CUDA.

Download e caricamento dei modelli

LM Studio utilizza il formato GGUF, un formato di modelli quantizzati che riduce i requisiti di memoria mantenendo comunque un'elevata qualità. Quando apri LM Studio, fai clic sull'icona di ricerca nella barra laterale sinistra per sfogliare i modelli. La ricerca integrata attinge direttamente da Hugging Face e filtra i file GGUF compatibili.

Cerca un modello per nome (ad esempio "llama 3.1", "mistral", "phi"). Ogni risultato mostra diversi livelli di quantizzazione, etichettati come Q4_K_M, Q5_K_S, oppure Q8_0. Il numero indica la profondità in bit: Q4 utilizza 4 bit per peso, Q8 ne utilizza 8. Valori più bassi corrispondono a dimensioni del file minori e inferenze più veloci, ma con una leggera riduzione della qualità.

Per la maggior parte degli utilizzi, Q4_K_M o Q5_K_M offre il miglior compromesso. Utilizza il nostro Calcolatore VRAM per stimare quanta memoria sarà necessaria per un determinato modello e livello di quantizzazione. Come linea guida approssimativa:

Dimensione del modelloVRAM Q4_K_MVRAM Q5_K_MVRAM Q8_0
7B parametri~5 GB~6 GB~9 GB
13B parametri~9 GB~11 GB~16 GB
34B parametri~22 GB~27 GB~40 GB
70B parametri~42 GB~51 GB~75 GB

Fai clic sull'icona di download accanto al livello di quantizzazione scelto. Le dimensioni dei modelli variano da 3 GB a oltre 50 GB, a seconda delle dimensioni. Una volta scaricato, fai clic sul nome del modello nella tua libreria per caricarlo. LM Studio mostrerà l'allocazione di GPU e RAM nell'angolo in basso a destra. Se il modello non entra interamente nella VRAM, LM Studio trasferirà alcuni layer nella RAM di sistema, rallentando notevolmente l'inferenza.

Utilizzo dell'interfaccia chat

Dopo aver caricato un modello, l'interfaccia chat appare nella finestra principale. Digita il tuo prompt nella casella di testo in basso e premi Invio oppure fai clic sull'icona di invio. Il modello genera la risposta in locale: non è richiesta alcuna connessione Internet una volta caricato.

Controlli principali:

  • Cursore della temperatura (barra laterale destra): regola il grado di casualità. Valori tra 0,1 e 0,3 per compiti fattuali, tra 0,7 e 1,0 per scrittura creativa
  • Token massimi: limita la lunghezza della risposta. Il valore predefinito è solitamente 2048; aumentarlo per ottenere output più lunghi
  • Prompt di sistema: definisce il comportamento e la personalità del modello. Fare clic su «Modifica» nella barra superiore per modificarlo
  • Sequenze di arresto: token che interrompono anticipatamente la generazione, utili per formati di output strutturati

LM Studio supporta conversazioni multiround. Ogni messaggio rimane nel contesto finché non si fa clic su «Nuova chat» o finché la finestra di contesto non si riempie. La maggior parte dei modelli dispone di una finestra di contesto da 4k a 32k token: consultare la scheda del modello per i dettagli specifici.

Esecuzione di un server API locale

LM Studio include un server API compatibile con OpenAI, che consente di utilizzare modelli locali come sostituti diretti di GPT-4 o GPT-3.5 nelle applicazioni esistenti. Fare clic sull'icona </> nella barra laterale sinistra per aprire la scheda «Server locale».

Selezionare un modello caricato dal menu a discesa e fare clic su «Avvia server». Il server viene eseguito all'indirizzo http://localhost:1234 per impostazione predefinita. L'interfaccia utente mostra un esempio di codice:

curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{
    "model": "local-model",
    "messages": [{"role": "user", "content": "Ciao"}]
  }'

Qualsiasi strumento compatibile con il formato API di OpenAI funziona con il server di LM Studio. Impostare l'URL base su http://localhost:1234/v1 e utilizzare una qualsiasi stringa non vuota come chiave API (LM Studio non la convalida). Ciò include:

  • LangChain (Python/JS): impostare openai_api_base su localhost
  • SDK Python di OpenAI: openai.api_base = "http://localhost:1234/v1"
  • Editor di testo con funzionalità AI (Cursor, Continue, Cody): configurarli per puntare a localhost nelle impostazioni
  • Script personalizzati: sostituire https://api.openai.com/v1 con http://localhost:1234/v1

Il server supporta risposte in streaming e chiamate a funzioni (se il modello è stato addestrato per farlo). Controllare i log nella scheda «Server» per eseguire il debug delle richieste.

Configurazione e impostazioni hardware

Fare clic sull'icona dell'ingranaggio (Impostazioni) nell'angolo in basso a sinistra per regolare:

  • Percorso cartella modelli: modificare la cartella in cui i modelli vengono scaricati e caricati
  • Livelli di offload GPU: controlla quanti livelli vengono eseguiti sulla GPU rispetto alla CPU. Il rilevamento automatico funziona bene, ma un aggiustamento manuale può essere utile se si eseguono contemporaneamente più applicazioni
  • Sovrascrittura lunghezza contesto: aumentare questo valore se il modello lo supporta e si necessita di conversazioni più lunghe. Un contesto più ampio richiede più VRAM
  • Thread di inferenza: numero di thread della CPU dedicati all'inferenza. Il valore predefinito è «automatico», ma impostarlo sul numero di core fisici (non hyperthreaded) può migliorare le prestazioni

Per ottenere le migliori prestazioni, chiudere altre applicazioni che richiedono intensivamente la GPU (giochi, editing video, rendering 3D) prima di caricare modelli di grandi dimensioni. Su laptop, collegare l'alimentatore e impostare la modalità di alimentazione su «Alte prestazioni»: il throttling di CPU e GPU influisce notevolmente sulla velocità di inferenza.

LM Studio vs Ollama

LM Studio e Ollama eseguono entrambi modelli locali, ma differiscono per interfaccia e flusso di lavoro:

FunzionalitàLM StudioOllama
InterfacciaInterfaccia grafica desktopLinea di comando + API
Scoperta dei modelliBrowser integratoRegistro modelli separato
FormatoFile GGUFFormato personalizzato (conversione da GGUF)
Controllo della quantizzazioneScelta della quantizzazione specificaAutomatico
Interfaccia chatIntegrataNessuna (utilizzare strumenti esterni)
Curva di apprendimentoPiù basso (visuale)Più ripido (CLI)

Utilizzare LM Studio se si desidera un'interfaccia visuale, un controllo diretto sui file dei modelli e non si vuole usare il terminale. Utilizzare Ollama se si preferisce flussi di lavoro basati sulla riga di comando, si desidera un server leggero o si intende integrare il tutto in una pipeline automatizzata. Entrambi sono gratuiti e gestiscono l'accelerazione GPU in modo simile. Consultare la nostra guida ai modelli locali per raccomandazioni compatibili con entrambi gli strumenti.

Scelta dei modelli per LM Studio

La scelta del modello dipende dall'hardware disponibile e dall'uso previsto. Consultare la nostra Database di modelli IA per specifiche e requisiti di VRAM relativi a oltre 37 modelli.

Per 8–16 GB di VRAM: Llama 3.1 8B, Mistral 7B, Phi-3 Medium (14B). Questi modelli gestiscono bene conversazioni generali, assistenza nella programmazione e sintesi.

Per 24 GB di VRAM: Llama 3.1 70B (quantizzato Q3), Mixtral 8x7B, Command R+ 35B (quantizzato Q4). Salto significativo di qualità nel ragionamento e nell’esecuzione di istruzioni complesse.

Per 48 GB o più di VRAM: Llama 3.1 405B (quantizzato Q3), Qwen 2.5 72B (quantizzato Q5). Prestazioni quasi all’avanguardia per la maggior parte dei compiti.

Se non sei sicuro che un modello sia compatibile con il tuo hardware, utilizza il Calcolatore VRAM prima del download. Un modello che si adatta appena alla VRAM verrà spostato parzialmente nella RAM e risulterà 5–10 volte più lento rispetto a uno caricato interamente nella VRAM.

Domande frequenti

LM Studio funziona in modalità offline?

Sì, completamente. È necessaria una connessione Internet solo per scaricare i modelli inizialmente; una volta scaricati, LM Studio funziona senza alcuna connessione di rete. Modelli, inferenza e server API locale operano tutti in modalità offline. Ciò lo rende adatto a ambienti isolati (air-gapped) o all’uso in assenza di connettività.

Posso utilizzare i modelli di LM Studio nelle mie applicazioni personali?

Sì. Avvia il server API locale in LM Studio e indirizza la tua applicazione su http://localhost:1234/v1. Qualsiasi codice che utilizzi il formato dell’API OpenAI funzionerà senza modifiche. Puoi anche caricare direttamente file GGUF nel tuo codice usando librerie come llama.cpp, llama-cpp-python, oppure ctransformers—i modelli scaricati tramite LM Studio sono file GGUF standard memorizzati nella cartella cache.

Quanto costa LM Studio?

LM Studio è gratuito. Non sono previsti abbonamenti, costi per l’uso dell’API né limiti di utilizzo. Anche i modelli sono gratuiti: la maggior parte è open source e rilasciata con licenze permissive (MIT, Apache 2.0, Llama 3.1 Community License). Gli unici costi sostenuti sono quelli relativi all’hardware e all’energia elettrica. Usa il nostro calcolatore self-hosting vs API per confrontare i costi dell’inferenza locale con quelli delle API cloud.

Perché l’inferenza è lenta sul mio computer?

Tre cause comuni: (1) Il modello non entra interamente nella VRAM e viene spostato parzialmente nella RAM — controlla la visualizzazione della memoria in LM Studio e prova una quantizzazione più leggera o un modello più piccolo. (2) La GPU non viene rilevata — verifica che i driver siano aggiornati (Windows/Linux) o che tu stia utilizzando Apple Silicon (macOS). (3) Limitazione della potenza della CPU sui laptop — collega il dispositivo all’alimentazione e imposta la modalità prestazioni elevate. La velocità di inferenza scala approssimativamente con la larghezza di banda della VRAM, quindi GPU più vecchie o dedicate ai dispositivi mobili saranno più lente rispetto alle schede da desktop, anche quando dispongono di sufficiente memoria.

Posso eseguire il fine-tuning o l’addestramento di modelli in LM Studio?

No. LM Studio è dedicato esclusivamente all’inferenza: carica ed esegue modelli pre-addestrati, ma non supporta l’addestramento né il fine-tuning. Per queste attività hai bisogno di framework specifici come Axolotl, Hugging Face Transformers o MLX (per Apple Silicon). Puoi eseguire il fine-tuning altrove, esportare il modello nel formato GGUF e quindi caricare il modello fine-tuned in LM Studio.

Qual è la differenza tra le etichette di quantizzazione Q4_K_M, Q5_K_S e altre?

Il numero (Q4, Q5, Q8) indica il numero di bit per peso: valori più bassi corrispondono a dimensioni minori e velocità maggiore, mentre valori più alti garantiscono maggiore accuratezza. Il suffisso indica il metodo di quantizzazione: K_M (medio, bilanciato), K_S (piccolo, compressione più aggressiva), K_L (grande, preserva maggiore precisione). Per la maggior parte degli utenti, Q4_K_M o Q5_K_M rappresenta il compromesso ideale. Utilizza Q2 o Q3 solo se la VRAM è estremamente limitata; in questi casi la qualità peggiora in modo evidente. Q8 è vicino alla precisione completa, ma offre un miglioramento minimo della qualità rispetto a Q5 per la maggior parte dei compiti, pur raddoppiando il consumo di VRAM.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top
Featured on There's An AI For That