Wednesday, 26 August 2026 | Updating Daily AI insight, written for builders

LM Studio a Chicago: cosa significa la ricerca e come eseguire modelli localmente

  • Non esiste un server, una regione o un’edizione denominata «LM Studio Chicago». LM Studio è un’applicazione desktop per Windows, macOS e Linux; l’inferenza avviene sulla CPU/GPU del tuo computer, quindi la sua «localizzazione» coincide con quella della tua macchina.
  • Per eseguirlo a Chicago, basta semplicemente avviarlo: installa l’app, scarica un modello GGUF o MLX, quindi avvia il server compatibile con OpenAI all’indirizzo http://localhost:1234/v1.
  • Se «Chicago» indica la residenza dei dati (BIPA, HIPAA, contratti con i clienti), l’inferenza locale rappresenta la soluzione più sicura possibile: i prompt non raggiungono mai un fornitore esterno.
  • Se stavi cercando uno studio di design o fotografia di Chicago chiamato «LM Studio», si tratta di un’attività locale indipendente, non correlata a questo software.

LM Studio è un’applicazione desktop gratuita per l’esecuzione locale di modelli linguistici su un proprio computer — non dispone di uffici a Chicago, né di regioni server dedicate alla città, né di build specifiche per una determinata località. Le ricerche contenenti «lm studio chicago» indicano quasi sempre una delle seguenti tre possibilità: l’esecuzione di LM Studio su una workstation situata a Chicago, la conservazione dei dati all’interno dell’Illinois per motivi di conformità normativa oppure un’attività locale con nome simile.

Quale «LM Studio Chicago» stai cercando?

Ciò che probabilmente intendevi Requisiti effettivi
Eseguire LLM su una macchina situata a Chicago Installa LM Studio normalmente — nessun aspetto della configurazione dipende dalla città
Una regione server o un endpoint a bassa latenza a Chicago Non applicabile. LM Studio non offre alcun servizio ospitato. Utilizza invece un’API cloud con regione US-Central oppure posiziona fisicamente il tuo server in loco.
Residenza dei dati in Illinois o conformità normativa Inferenza locale — i dati rimangono sul dispositivo sotto il tuo pieno controllo
Acquista una GPU o una workstation nella zona di Chicago Presso rivenditori locali (il negozio Micro Center di Westmont è la scelta più comune) oppure online; consulta la guida alle GPU riportata di seguito
Uno studio di design, fotografia o architettura di Chicago chiamato LM Studio Un’attività completamente diversa — questa pagina riguarda l’applicazione per LLM

Perché non esiste una regione Chicago

LM Studio è un’interfaccia grafica (GUI) che racchiude motori di inferenza locale: llama.cpp per i modelli GGUF su tutte le piattaforme e il framework MLX di Apple sui dispositivi Apple Silicon. Il traffico di rete in uscita è limitato alla ricerca e al download dei modelli (i pesi vengono prelevati da Hugging Face tramite HTTPS), ai controlli degli aggiornamenti dell’app e, opzionalmente, ai download dei runtime. Una volta che il file del modello è presente sul disco, puoi scollegare la connessione di rete e l’app continuerà a funzionare correttamente.

Questa architettura spiega perché il concetto di «regione» è qui inappropriato: non esiste alcun piano di controllo, alcun tenant né alcun account da creare. La latenza che ti interessa è quella della larghezza di banda della memoria della tua GPU, non il tempo di round-trip verso un data center. Per maggiori informazioni sull’applicazione, consulta la documentazione ufficiale disponibile su Guida completa a LM Studio.

Installazione di LM Studio su Windows

Scarica l’ .exe lmstudio.ai. Le versioni recenti includono installatori sia per x64 che per ARM64 (Snapdragon X); la build x64 richiede una CPU compatibile con AVX2.

  • L’installer opera per utente per impostazione predefinita e viene installato in %LOCALAPPDATA%\Programs — nella maggior parte dei casi non sono necessari privilegi amministrativi.
  • I modelli vengono salvati di default in %USERPROFILE%\.lmstudiomodels. Puoi modificare questa cartella dalla scheda I miei modelli se preferisci memorizzarli su un secondo disco; già pochi modelli quantizzati da 30 miliardi di parametri possono occupare rapidamente oltre 100 GB.
  • Le GPU NVIDIA utilizzano il runtime CUDA, che LM Studio scarica come pacchetto runtime separato. Le GPU AMD e Intel ricorrono a Vulkan, mentre ROCm è disponibile su alcune schede AMD. I runtime supportati possono variare tra le diverse versioni: verifica quindi direttamente il pannello «Runtime / Hardware» nella tua installazione anziché fare ipotesi.
  • Abilita l’interfaccia a riga di comando (CLI) una sola volta con il comando cmd /c %USERPROFILE%\.lmstudiobin\lms.exe bootstrap, quindi usa il comando lms da qualsiasi shell.

Installazione di LM Studio su macOS

Le versioni attuali richiedono Apple Silicon (M1 o successivi) e una versione recente di macOS — la versione minima indicata è generalmente la 13.4. I Mac con processore Intel erano supportati solo nelle versioni precedenti; pertanto, se utilizzi un iMac del 2019, dovrai ricorrere a una build archiviata, non all’ultima versione disponibile.

  • Aprire il file .dmg e trascina LM Studio in /Applications.
  • Preferisci MLX le build MLX rispetto a quelle GGUF, qualora entrambe siano disponibili. MLX è il framework per array sviluppato da Apple ed è generalmente più veloce sfruttando la memoria unificata, anche se la disponibilità di modelli è più limitata.
  • macOS limita la quantità di memoria unificata che la GPU può allocare — all'incirca dai due terzi ai tre quarti della RAM installata. Esiste un sysctl per innalzare questo limite, ma la chiave esatta è cambiata tra le diverse versioni di macOS; pertanto, consultare la documentazione relativa alla propria versione specifica anziché copiare un vecchio comando da un forum.
  • CLI: ~/.lmstudio/bin/lms bootstrap.

Installazione di LM Studio su Linux

Su Linux viene distribuito come AppImage x86-64. Al momento della stesura di questo articolo non esiste una build ufficiale ARM per Linux, quindi dispositivi come Raspberry Pi o server Ampere non sono supportati.

chmod +x LM-Studio-*.AppImage
./LM-Studio-*.AppImage

Su Ubuntu 22.04 e versioni successive potrebbe essere necessario installare libfuse2 affinché gli AppImage possano essere montati; in alternativa, è possibile utilizzare ./LM-Studio-*.AppImage --appimage-extract-and-run. Per NVIDIA, installare prima il driver proprietario e verificarne il corretto funzionamento con nvidia-smi prima di avviare l'applicazione. I modelli vengono memorizzati nella cartella ~/.lmstudio/models nelle versioni più recenti — nelle build precedenti venivano invece salvati in una sottocartella di ~/.cache, quindi verificare sempre direttamente nell'applicazione anziché fare ipotesi.

Condivisione dei modelli con il resto dell’ufficio

Questa è la parte alla quale si riferiscono realmente la maggior parte delle domande del tipo «LLM locale a Chicago»: un singolo workstation potente, utilizzato da più sviluppatori contemporaneamente. Attivare il server dalla scheda Sviluppatore oppure dalla riga di comando.

lms server start --port 1234
lms ls          # elenco dei modelli installati
lms ps          # modelli attualmente caricati
lms load qwen2.5-coder-7b-instruct
lms unload --all
lms log stream  # monitoraggio in tempo reale delle richieste

Il server implementa il formato wire OpenAI, quindi la maggior parte degli SDK funziona semplicemente modificando l'URL base e fornendo una chiave fittizia.

Endpoint Funzione
GET /v1/models Elenca i modelli caricati e quelli disponibili
POST /v1/chat/completions Chat con supporto streaming
POST /v1/completions Completamento testuale grezzo
POST /v1/embeddings Embedding, quando è caricato un modello embedding
/api/v0/* API REST nativa di LM Studio, introdotta nelle versioni successive della serie 0.3.x; espone informazioni aggiuntive sullo stato di caricamento
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model": "qwen2.5-coder-7b-instruct", "messages": [{"role": "user", "content": "Riassumi questo repository."}]}'
from openai import OpenAI

client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
resp = client.chat.completions.create(
    model="qwen2.5-coder-7b-instruct",
    messages=[{"role": "user", "content": "Ciao"}],
)

Nota sulla sicurezza: Il server LM Studio non prevede alcuna autenticazione. Servire su rete locale è abilitabile con un semplice toggle, ma non effettuare mai un port-forwarding né associarlo a un'interfaccia pubblica. Se un team necessita di accesso, posizionarlo dietro un reverse proxy che applichi l'autenticazione oppure raggiungerlo tramite Tailscale o una VPN.

Valutazione delle caratteristiche hardware prima dell’acquisto

Quantità approssimativa di memoria richiesta da una quantizzazione a 4 bit, prima dell'aggiunta del contesto. Considerare questi valori come stime indicative per la pianificazione, non come garanzie — il metodo di quantizzazione, la dimensione della cache KV e la lunghezza del contesto influenzano tutti il consumo totale di memoria.

Dimensione del modello Memoria approssimativa con quantizzazione ~Q4 Obiettivo pratico
7–8 miliardi 5–6 GB GPU da 8 GB oppure qualsiasi Mac con 16 GB di RAM
13–14 miliardi 9–10 GB GPU da 12 GB
24B 14–16 GB GPU da 16–24 GB
30–32B 19–22 GB GPU da 24 GB (classe RTX 3090 / 4090)
70B 40–45 GB Due GPU da 24 GB ciascuna, oppure memoria unificata da 64 GB o superiore

Verificare la configurazione esatta tramite il Calcolatore VRAM prima di effettuare qualsiasi acquisto, incrociando i risultati con la tabella dei requisiti di VRAM per modello. Se ancora non si è scelta una GPU, il le migliori GPU per LLM locali confronto illustra i punti critici in cui il rapporto prezzo/GB utilizzabili cambia significativamente. Chicago offre un vantaggio particolare: il negozio Micro Center di Westmont consente di acquistare una GPU di persona e restituirla di persona qualora non si adatti al case o al budget della PSU — verificare la disponibilità prima di recarsi in negozio.

L’aspetto della residenza dei dati nell’Illinois

L'Illinois è una giurisdizione particolarmente rigorosa in materia di privacy. Il Biometric Information Privacy Act (BIPA, 740 ILCS 14) prevede un diritto d'azione privato ed è stato alla base di ingenti risarcimenti; l'Artificial Intelligence Video Interview Act impone obblighi di informativa e consenso per l'analisi AI dei colloqui di selezione; infine, emendamenti all'Illinois Human Rights Act estendono la responsabilità per discriminazioni anche all'uso di sistemi AI nelle decisioni occupazionali. L'inferenza locale elimina completamente il processore di terze parti, motivo per cui molte organizzazioni regolamentate di Chicago — sistemi ospedalieri, compagnie assicurative, studi legali, società di trading — scelgono spesso LM Studio o Ollama per strumenti interni. Ciò non esonera tuttavia dall'adempimento degli obblighi di informativa, consenso e non discriminazione. Verificare i dettagli specifici con un consulente legale, non con un semplice toggle nelle impostazioni.

Se desideri effettivamente un endpoint ospitato a Chicago

Due opzioni, nessuna delle quali prevede LM Studio. Affittare un modello ospitato tramite un'API commerciale, scegliendo una regione US-Central — i costi sono analizzati nel Calcolatore dei costi API. Oppure collocare fisicamente un proprio server GPU; Chicago è un mercato interconnesso di prim'ordine, con 350 E. Cermak tra i carrier hotel più noti del paese. Prima di impegnare capitali, calcolare attentamente i costi con il Calcolatore del punto di pareggio tra auto-hosting e utilizzo di API — per utilizzi interni a basso volume, i token API sono generalmente più convenienti rispetto all'acquisto di hardware, e il punto di pareggio si raggiunge più tardi di quanto molti team si aspettino.

Domande frequenti

Esiste un server o un data center LM Studio a Chicago?

No. LM Studio non offre alcun servizio di inferenza ospitata, pertanto non esiste alcun servizio da posizionare a Chicago o in qualsiasi altra regione. Tutta la generazione avviene sulla macchina che esegue l'applicazione. Gli unici server coinvolti sono quelli di Hugging Face per il download dei modelli e gli endpoint di aggiornamento gestiti direttamente da LM Studio.

LM Studio funziona completamente in modalità offline?

Sì, una volta scaricati i modelli. È necessaria una connessione per cercare e recuperare i pesi dei modelli e i pacchetti di runtime, ma dopo tale fase l’applicazione viene caricata ed esegue i modelli senza alcun accesso alla rete. Questa è la ragione principale per cui viene approvata anche in ambienti aziendali fortemente restrittivi o completamente isolati dalla rete (air-gapped).

LM Studio è gratuito per uso commerciale presso un’azienda di Chicago?

LM Studio ha eliminato la precedente restrizione all’uso personale e ora consente l’impiego in ambito lavorativo senza alcun costo; tuttavia, i termini di licenza sono soggetti a modifiche tra una versione e l’altra. Prima di distribuire l’applicazione su un intero team, leggi attentamente i termini attuali disponibili su lmstudio.ai. Inoltre, tieni presente che i pesi dei modelli sono regolati da licenze proprie: alcuni modelli open-weight limitano esplicitamente l’uso commerciale, indipendentemente dalle autorizzazioni concesse dal software di esecuzione.

LM Studio o Ollama per un piccolo team?

LM Studio eccelle nella scoperta e nell'iterazione: interfaccia grafica completa, browser di modelli, regolazione parametri per singolo modello e interfaccia chat utilizzabile anche da utenti non tecnici. Ollama invece prevale nel deployment headless e nello scripting, offrendo una soluzione più pulita per Docker e CI. Molti team utilizzano entrambi — LM Studio sui laptop degli sviluppatori, Ollama sul server condiviso. Vedere il Guida a Ollama per quella parte del confronto.

L’intero ufficio può connettersi a una singola macchina con LM Studio installato?

Tecnicamente sì: abilita il servizio in rete e indirizza i client verso http://<host>:1234/v1. In pratica, ricorda che non è prevista alcuna autenticazione integrata né una coda di richieste progettata per gestire molti utenti simultanei. Per qualsiasi utilizzo che vada oltre un paio di sviluppatori, inserisci un proxy con autenticazione davanti al servizio oppure passa a uno stack di servizio specializzato, come vLLM.

Come faccio a sapere quale modello scaricare per primo?

Inizia con un modello instruct da 7–8 miliardi di parametri quantizzato in Q4_K_M: si adatta quasi a qualsiasi GPU moderna e ti permette di verificare rapidamente se il tuo percorso hardware (CUDA, Metal, Vulkan) funziona correttamente. Da lì, scala progressivamente fino a raggiungere il limite della tua memoria disponibile. Le Classifica LLM e Database di modelli sono utili per confrontare le capacità di un modello rispetto alle sue dimensioni, prima di dedicare un’ora al download.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top
Featured on There's An AI For That