{"id":59,"date":"2026-05-18T12:37:28","date_gmt":"2026-05-18T12:37:28","guid":{"rendered":"https:\/\/convly.ai\/run-llama3-locally-laptop\/"},"modified":"2026-08-01T06:49:06","modified_gmt":"2026-08-01T06:49:06","slug":"run-llama3-locally-laptop","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/","title":{"rendered":"Come eseguire Llama in locale sul proprio laptop nel 2026 (guida completa alla configurazione)"},"content":{"rendered":"<p>In passato, eseguire un modello linguistico di grandi dimensioni sul proprio laptop era un progetto di ricerca; nel 2026 richiede soltanto 15 minuti di configurazione. \u00c8 possibile disporre di un assistente AI davvero performante che funzioni interamente sul proprio dispositivo \u2014 senza abbonamento, senza connessione internet e senza che alcun dato lasci mai il computer.<\/p>\n<p>Questa guida illustra l'intero processo: quali componenti hardware sono necessari, quale strumento utilizzare, quale modello scaricare e come avviarlo.<\/p>\n<div class=\"convly-tldr\">\n<h3>Punti chiave<\/h3>\n<ul>\n<li><strong>La via pi\u00f9 semplice \u00e8:<\/strong> installare Ollama o LM Studio \u2014 entrambi consentono di iniziare in pochi minuti.<\/li>\n<li><strong>Hardware:<\/strong> 16 GB di RAM rappresentano il minimo consigliato; un Mac con chip Apple Silicon o un laptop dotato di GPU dedicata sono ideali.<\/li>\n<li><strong>Dimensione del modello:<\/strong> I modelli da 7 a 8 miliardi di parametri (7\u20138B) rappresentano il compromesso ottimale per i laptop \u2014 potenti e veloci.<\/li>\n<li><strong>Quantizzazione<\/strong> riduce le dimensioni dei modelli per adattarli al proprio hardware; le versioni \"Q4\" costituiscono la scelta standard.<\/li>\n<li><strong>Perch\u00e9 farlo:<\/strong> \u00e8 gratuito, completamente privato e funziona offline.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a744b671c5fc\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a744b671c5fc\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Why_run_an_LLM_locally\" >Perch\u00e9 eseguire un modello linguistico in locale?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Step_1_Check_your_hardware\" >Passo 1: Verificare le caratteristiche hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Step_2_Choose_your_tool\" >Passo 2: Scegli il tuo strumento<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Step_3_Install_and_run_your_first_model\" >Passo 3: Installa ed esegui il tuo primo modello<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Step_4_Pick_the_right_model_and_size\" >Passo 4: Scegli il modello giusto e la sua dimensione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Step_5_Understand_quantization\" >Passo 5: Comprendi la quantizzazione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Going_further\" >Approfondimenti<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Why_its_slow_%E2%80%94_and_how_to_fix_it\" >Perch\u00e9 \u00e8 lento \u2014 e come risolvere il problema<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#FAQ\" >Domande frequenti<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Bottom_line\" >Conclusione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/convly.ai\/it\/run-llama3-locally-laptop\/#Related_articles\" >Articoli correlati<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_run_an_LLM_locally\"><\/span>Perch\u00e9 eseguire un modello linguistico in locale?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L'IA basata su cloud \u00e8 comoda, quindi perch\u00e9 eseguire un modello autonomamente? Tre motivi concreti:<\/p>\n<ul>\n<li><strong>Privacy.<\/strong> Nulla di ci\u00f2 che digiti lascia il tuo dispositivo. Per lavori sensibili, riservati o personali, questo rappresenta un vero vantaggio.<\/li>\n<li><strong>Costo.<\/strong> \u00c8 gratuito. Nessun abbonamento, nessun costo per token elaborato, nessun limite di utilizzo \u2014 puoi generare quanta output desideri.<\/li>\n<li><strong>Funzionamento offline e disponibilit\u00e0 continua.<\/strong> Funziona anche in volo, senza connessione internet, ed \u00e8 immune a limitazioni di frequenza o interruzioni del servizio.<\/li>\n<\/ul>\n<p>Il compromesso: un modello che gira su un laptop \u00e8 pi\u00f9 piccolo e meno capace rispetto ai modelli cloud all'avanguardia. Tuttavia, i moderni modelli leggeri sono sufficientemente performanti per molte attivit\u00e0 reali \u2014 stesura testi, riassunti, supporto alla programmazione, brainstorming, domande e risposte.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Check_your_hardware\"><\/span>Passo 1: Verificare le caratteristiche hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le prestazioni dei modelli linguistici locali dipendono principalmente dalla memoria. Ecco una panoramica realistica:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Il tuo laptop<\/th>\n<th>Cosa puoi eseguire<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 GB di RAM<\/td>\n<td>Solo modelli molto piccoli (1\u20133 miliardi di parametri). Utilizzabili, ma con forti limitazioni.<\/td>\n<\/tr>\n<tr>\n<td>16 GB di RAM<\/td>\n<td>Modelli da 7\u20138 miliardi di parametri in modo confortevole \u2014 il compromesso ottimale.<\/td>\n<\/tr>\n<tr>\n<td>32 GB di RAM<\/td>\n<td>Fino a modelli da circa 13\u201314 miliardi di parametri con buone prestazioni.<\/td>\n<\/tr>\n<tr>\n<td>Apple Silicon (serie M)<\/td>\n<td>Eccellente \u2014 la memoria unificata \u00e8 ideale; modelli pi\u00f9 grandi funzionano bene.<\/td>\n<\/tr>\n<tr>\n<td>GPU NVIDIA dedicata<\/td>\n<td>L'opzione pi\u00f9 veloce; la VRAM costituisce il limite massimo per la dimensione del modello.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>I due fattori determinanti: <strong>memoria totale<\/strong> (RAM o VRAM su una GPU) determina il modello pi\u00f9 grande che puoi caricare, mentre una <strong>GPU o una CPU Apple Silicon<\/strong> determina la velocit\u00e0 di esecuzione. Un laptop moderno con 16 GB di RAM \u00e8 un ottimo punto di partenza.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_Choose_your_tool\"><\/span>Passo 2: Scegli il tuo strumento<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Non interagisci direttamente con il modello grezzo, ma utilizzi uno strumento che lo scarica, gestisce ed esegue. Le migliori opzioni nel 2026 sono:<\/p>\n<ul>\n<li><strong>Ollama<\/strong> \u2014 la scelta pi\u00f9 popolare. Uno strumento pulito da riga di comando (con una semplice app grafica) che scarica ed esegue modelli con un singolo comando ed espone un\u2019API locale per consentire ad altre applicazioni di connettersi. La scelta migliore in assoluto.<\/li>\n<li><strong>LM Studio<\/strong> \u2014 un\u2019applicazione grafica curata. Puoi sfogliare e scaricare modelli, chattare tramite un\u2019interfaccia integrata, senza dover usare la riga di comando. Ideale per i principianti che preferiscono un\u2019esperienza visiva.<\/li>\n<li><strong>Jan<\/strong> \u2014 un\u2019app desktop open source focalizzata sulla privacy, un\u2019alternativa pulita a LM Studio.<\/li>\n<li><strong>llama.cpp<\/strong> \u2014 il motore ad alte prestazioni su cui si basano molti di questi strumenti. Usalo direttamente se desideri il massimo controllo ed efficienza.<\/li>\n<\/ul>\n<p>Per la maggior parte degli utenti: <strong>Ollama<\/strong> se ti trovi a tuo agio con il terminale, <strong>LM Studio<\/strong> se preferisci invece un\u2019interfaccia grafica con clic.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Install_and_run_your_first_model\"><\/span>Passo 3: Installa ed esegui il tuo primo modello<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La configurazione con Ollama \u00e8 davvero cos\u00ec breve:<\/p>\n<ol>\n<li>Scarica e installa Ollama dal suo sito ufficiale.<\/li>\n<li>Apri un terminale.<\/li>\n<li>Esegui un singolo comando:<\/li>\n<\/ol>\n<pre><code>ollama run llama3.1\n<\/code><\/pre>\n<p>Questo comando scarica il modello alla prima esecuzione (qualche gigabyte) e quindi ti inserisce direttamente in una finestra di chat. \u00c8 tutto qui: ora hai un assistente AI privato in esecuzione localmente. La volta successiva, partir\u00e0 istantaneamente.<\/p>\n<p>Con LM Studio l\u2019equivalente \u00e8: apri l\u2019app, cerca un modello, clicca su \u00abScarica\u00bb, quindi clicca per iniziare a chattare \u2014 interamente tramite l\u2019interfaccia grafica.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_Pick_the_right_model_and_size\"><\/span>Passo 4: Scegli il modello giusto e la sua dimensione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Due elementi da scegliere: la famiglia del modello e la sua dimensione.<\/p>\n<p><strong>Famiglia del modello<\/strong> \u2014 tra i modelli open source performanti che funzionano bene in locale figurano la serie <strong>Llama<\/strong> di Meta, i modelli <strong>Qwen<\/strong>di Alibaba, i modelli <strong>Gemma<\/strong>di Google, i modelli di Mistral e le versioni pi\u00f9 leggere di DeepSeek. Sono tutti validi: provane alcuni e vedi quale preferisci.<\/p>\n<p><strong>Dimensione<\/strong> \u2014 i modelli sono identificati da un numero di parametri come 3B, 8B, 14B (B = miliardi):<\/p>\n<ul>\n<li><strong>1\u20133B<\/strong> \u2014 estremamente veloci, poco impegnativi in termini di memoria, adatti a compiti semplici. Ottimi per macchine con 8 GB di RAM.<\/li>\n<li><strong>7\u20138 miliardi<\/strong> \u2014 il punto ideale per i laptop. Realisticamente capaci di svolgere attivit\u00e0 di scrittura, supporto alla programmazione e risposte a domande, e funzionano bene su sistemi con 16 GB di RAM.<\/li>\n<li><strong>13\u201314B e superiori<\/strong> \u2014 sensibilmente pi\u00f9 intelligenti, ma richiedono 32 GB di RAM o una GPU potente.<\/li>\n<\/ul>\n<p>Inizia con un modello da 8B. Offre il miglior compromesso tra capacit\u00e0 e velocit\u00e0 per la maggior parte dei laptop.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Understand_quantization\"><\/span>Passo 5: Comprendi la quantizzazione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Nei nomi dei modelli vedrai spesso etichette come <code>Q4_K_M<\/code> o <code>Q8<\/code>. Questa \u00e8 la <strong>quantizzazione<\/strong> \u2014 una tecnica di compressione che riduce la precisione dei numeri del modello, permettendo di utilizzare molta meno memoria con solo una lieve perdita di qualit\u00e0.<\/p>\n<ul>\n<li><strong>Q8<\/strong> \u2014 qualit\u00e0 pi\u00f9 alta, dimensione maggiore.<\/li>\n<li><strong>Q4<\/strong> \u2014 occupa circa met\u00e0 della memoria di Q8, mantenendo una qualit\u00e0 molto vicina. <strong>Questa \u00e8 la raccomandazione standard.<\/strong><\/li>\n<li><strong>Q2\/Q3<\/strong> \u2014 dimensione minima, ma con una degradazione della qualit\u00e0 facilmente percettibile; usala solo se la scarsit\u00e0 di memoria lo impone.<\/li>\n<\/ul>\n<p>Regola pratica: scegli una versione quantizzata del modello pi\u00f9 grande che la tua memoria pu\u00f2 contenere comodamente. Strumenti come Ollama selezionano automaticamente una quantizzazione ragionevole, quindi spesso non devi preoccupartene. <strong>Q4<\/strong> version of the largest model your memory can comfortably hold. Tools like Ollama pick a sensible quantization by default, so you often don&#8217;t have to think about it.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Going_further\"><\/span>Approfondimenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una volta avviato, puoi fare molto di pi\u00f9 che chattare da terminale:<\/p>\n<ul>\n<li><strong>Collega un\u2019interfaccia pi\u00f9 intuitiva<\/strong> \u2014 applicazioni come Open WebUI offrono una finestra simile a quella di ChatGPT per il tuo modello locale.<\/li>\n<li><strong>Usa l\u2019API locale<\/strong> \u2014 Ollama fornisce un'API sulla tua macchina, quindi puoi creare script e applicazioni che interagiscono con il tuo modello locale esattamente come faresti con un modello basato sul cloud.<\/li>\n<li><strong>Prova il recupero<\/strong> \u2014 punta una <a href=\"\/it\/rag-retrieval-augmented-generation-explained\/\">configurazione RAG<\/a> ai tuoi documenti personali per ottenere un assistente completamente privato per la \"conversazione con i tuoi file\".<\/li>\n<\/ul>\n<p><!--ai-enriched--><\/p>\n<h2><span class=\"ez-toc-section\" id=\"Why_its_slow_%E2%80%94_and_how_to_fix_it\"><\/span>Perch\u00e9 \u00e8 lento \u2014 e come risolvere il problema<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La lamentela pi\u00f9 comune dopo la prima installazione non \u00e8 che il modello non si avvii, bens\u00ec che proceda estremamente lentamente. Su un laptop, un output lento dipende quasi sempre dal fatto che il modello non sta effettivamente sfruttando la tua GPU. Il modo pi\u00f9 rapido per verificare \u00e8 eseguire un modello e, in un altro terminale, lanciare <strong>ollama ps<\/strong>. L\u2019output mostra come il modello viene distribuito: se indica il 100% GPU, tutto va bene; se mostra il 100% CPU o una suddivisione tra CPU e GPU, hai individuato il problema.<\/p>\n<p>I tre motivi pi\u00f9 comuni, in ordine di frequenza, sono:<\/p>\n<ul>\n<li><strong>La GPU non \u00e8 mai stata rilevata.<\/strong> Su Windows e Linux con scheda NVIDIA, ci\u00f2 significa generalmente che i driver della GPU sono stati installati <em>dopo<\/em> dopo il runtime, impedendogli cos\u00ec di rilevare il supporto CUDA \u2014 Ollama verifica la presenza della GPU al momento dell\u2019installazione, non durante l\u2019esecuzione. Verifica innanzitutto che <strong>nvidia-smi<\/strong> funzioni correttamente, quindi reinstalla il runtime affinch\u00e9 rilevi la GPU. Questa singola correzione risolve la maggior parte dei casi segnalati come \"sta usando la mia CPU\".<\/li>\n<li><strong>Il modello \u00e8 troppo grande per la tua VRAM.<\/strong> Quando un modello non entra interamente nella VRAM, i livelli in eccesso vengono automaticamente e silenziosamente spostati nella RAM di sistema e sulla CPU, rallentando drasticamente l\u2019intero processo. La soluzione consiste nell\u2019optare per un modello pi\u00f9 piccolo o in una quantizzazione pi\u00f9 aggressiva (una versione con valore Q inferiore), in modo che l\u2019intero modello risieda nella VRAM.<\/li>\n<li><strong>La finestra contestuale \u00e8 troppo ampia.<\/strong> Un contesto lungo consuma anch\u2019esso memoria, poich\u00e9 la cache KV cresce proporzionalmente. Se impostata troppo alta, pu\u00f2 causare il trasferimento di alcuni livelli sulla CPU. Se non hai bisogno di un prompt molto lungo, riduci la lunghezza del contesto (8K \u00e8 pi\u00f9 che sufficiente per la maggior parte dei casi): il modello si adatter\u00e0 cos\u00ec pi\u00f9 agevolmente.<\/li>\n<\/ul>\n<p>Due problemi sono specifici dei laptop. Primo, <strong>la politica di gestione dell\u2019alimentazione a batteria<\/strong>: la maggior parte dei laptop Windows riduce drasticamente le prestazioni della GPU dedicata quando non collegati all\u2019alimentazione, e il distacco dalla presa pu\u00f2 dimezzare o peggio la velocit\u00e0 di inferenza. Questo comportamento \u00e8 determinato dal firmware, non da un bug: tieni il laptop collegato all\u2019alimentazione per lavori impegnativi. Secondo, <strong>il throttling termico<\/strong>: dopo circa 10\u201320 minuti di generazione continua, un laptop sottile si surriscalda e riduce automaticamente le frequenze di clock. Sollevare il laptop di qualche centimetro su un supporto per migliorare la circolazione dell\u2019aria e preferire una quantizzazione pi\u00f9 leggera (che genera meno calore) ritardano l\u2019insorgere del throttling. Ci\u00f2 non trasforma un laptop in una workstation, ma fa la differenza tra pochi token al secondo e un assistente realmente utilizzabile.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Posso eseguire Llama su un normale laptop?<\/h3>\n<p>S\u00ec. Un laptop con 16 GB di RAM esegue agevolmente modelli da 7 a 8 miliardi di parametri (7\u20138B), che sono effettivamente utili. Anche i dispositivi con soli 8 GB di RAM possono eseguire modelli pi\u00f9 piccoli, da 1 a 3 miliardi di parametri (1\u20133B). I Mac con chip Apple Silicon e i laptop dotati di GPU dedicata eseguono particolarmente bene i modelli locali.<\/p>\n<h3>Eseguire un LLM in locale \u00e8 gratuito?<\/h3>\n<p>S\u00ec. I modelli possono essere scaricati gratuitamente e non comportano alcun costo d\u2019uso: puoi generare quanta output vuoi. L\u2019unico \"costo\" \u00e8 rappresentato dall\u2019hardware che utilizzi e dallo spazio su disco occupato dai file del modello (qualche gigabyte ciascuno).<\/p>\n<h3>Qual \u00e8 lo strumento migliore per eseguire LLM in locale?<\/h3>\n<p>Ollama \u00e8 lo strumento pi\u00f9 popolare e la scelta pi\u00f9 versatile: un semplice comando consente di scaricare ed eseguire qualsiasi modello, fornendo anche un\u2019API locale. LM Studio \u00e8 invece l\u2019opzione migliore se preferisci un\u2019applicazione grafica senza dover usare la riga di comando.<\/p>\n<h3>Di quanta RAM ho bisogno per eseguire un LLM locale?<\/h3>\n<p>16 GB rappresentano il minimo confortevole per modelli davvero performanti da 7 a 8 miliardi di parametri. Con 8 GB sei limitato a modelli pi\u00f9 piccoli, da 1 a 3 miliardi di parametri. Con 32 GB puoi eseguire modelli da 13 a 14 miliardi di parametri. Maggiore \u00e8 la memoria disponibile, pi\u00f9 grandi e intelligenti saranno i modelli che potrai eseguire.<\/p>\n<h3>Gli LLM locali sono all\u2019altezza di ChatGPT?<\/h3>\n<p>Non raggiungono le prestazioni dei modelli cloud pi\u00f9 avanzati: i modelli adatti ai laptop sono pi\u00f9 piccoli e meno potenti. Tuttavia, sono sufficientemente efficaci per molte attivit\u00e0 quotidiane: stesura testi, sintesi, supporto alla programmazione e risposte a domande. Si rinuncia parzialmente alle capacit\u00e0 in cambio di privacy totale, assenza di costi e funzionamento offline.<\/p>\n<h3>Perch\u00e9 il mio LLM locale \u00e8 cos\u00ec lento?<\/h3>\n<p>Nove volte su dieci, il modello non sta sfruttando la tua GPU. Esegui <strong>ollama ps<\/strong> mentre un modello \u00e8 caricato: se mostra il 100% CPU o una suddivisione tra CPU e GPU, questo \u00e8 il motivo. Le cause pi\u00f9 comuni sono driver GPU installati dopo il runtime (reinstalla il runtime affinch\u00e9 rilevi CUDA), un modello troppo grande per la VRAM (opta per un modello pi\u00f9 piccolo o una quantizzazione pi\u00f9 aggressiva) o una finestra contestuale talmente ampia da costringere alcuni livelli a passare sulla CPU (riducila).<\/p>\n<h3>Devo tenere il mio laptop collegato all\u2019alimentazione mentre eseguo un LLM locale?<\/h3>\n<p>S\u00ec, per qualsiasi operazione oltre a una semplice domanda. La maggior parte dei laptop Windows limita in modo aggressivo le prestazioni della GPU dedicata quando alimentati a batteria, per prolungarne l\u2019autonomia: ci\u00f2 pu\u00f2 ridurre di circa la met\u00e0 la velocit\u00e0 di generazione (token al secondo). Questo rallentamento \u00e8 dovuto alla politica di gestione dell\u2019energia implementata nel firmware, non a un difetto. Collegare il laptop all\u2019alimentazione ripristina le frequenze massime della GPU; un supporto di raffreddamento per migliorare la circolazione dell\u2019aria aiuta a prevenire il throttling termico che insorge dopo sessioni prolungate.<\/p>\n<h3>Posso utilizzare un LLM locale completamente offline?<\/h3>\n<p>S\u00ec. L\u2019unica operazione che richiede una connessione Internet \u00e8 il download iniziale del modello. Una volta che il modello \u00e8 salvato sul disco, funziona interamente offline: puoi disconnetterti completamente e continuer\u00e0 a rispondere. Questo \u00e8 il principale vantaggio in termini di privacy: i tuoi prompt non lasciano mai il tuo dispositivo, rendendo un LLM locale una scelta sensata per appunti riservati, bozze di lavoro o qualsiasi contenuto che non vorresti inviare a un servizio cloud.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Eseguire un modello di intelligenza artificiale sul proprio laptop non \u00e8 pi\u00f9 difficile. Installa <strong>Ollama<\/strong> o <strong>LM Studio<\/strong>, scarica un <strong>modello da 8 miliardi di parametri<\/strong> in una <strong>Q4<\/strong> quantizzazione adeguata e, entro 15 minuti, avrai un assistente performante, gratuito, completamente privato e funzionante offline.<\/p>\n<p>Non sostituir\u00e0 un modello cloud di ultima generazione per i compiti pi\u00f9 impegnativi, ma per la stesura quotidiana di testi, l\u2019aiuto nella programmazione e le domande private, un modello locale \u00e8 davvero utile. E una volta avviato, \u00e8 interamente sotto il tuo controllo: nessun abbonamento, nessun limite e nessun dato che lascia il tuo dispositivo.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Articoli correlati<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/it\/90-day-ai-engineer-path\/\">Da zero a ingegnere AI: il tuo percorso di apprendimento di 90 giorni<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/local-llm-ollama-setup\/\">Configurare il primo modello linguistico locale con Ollama<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/build-personal-ai-assistant-python\/\">Costruire un assistente personale basato sull\u2019intelligenza artificiale in 30 minuti (tutorial Python)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/it\/how-to-run-llama-3-locally-on-snapdragon-8-gen-4\/\">Come eseguire Llama 3 in locale su Snapdragon 8 Gen 4 (guida passo passo, 2026)<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Run a capable AI model on your own laptop \u2014 free, private, and offline. This step-by-step guide covers the hardware you need, the best tools, and which model size to pick.<\/p>","protected":false},"author":0,"featured_media":2039,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[260,256,458,259,457],"class_list":["post-59","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials","tag-lm-studio","tag-local-llm","tag-offline-ai","tag-ollama","tag-run-llama-locally"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/59","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=59"}],"version-history":[{"count":3,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/59\/revisions"}],"predecessor-version":[{"id":1042,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/59\/revisions\/1042"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2039"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=59"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=59"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=59"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}