{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-26T09:05:15","modified_gmt":"2026-08-26T09:05:15","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama non utilizza la GPU: diagnosi e correzione del fallback sulla CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Esegui <code>ollama ps<\/code> mentre un modello \u00e8 caricato \u2014 la colonna PROCESSOR indica se Ollama sta utilizzando la GPU o la CPU.<\/li>\n<li>La correzione pi\u00f9 comune su NVIDIA consiste nell\u2019installare o aggiornare il driver host in modo che <code>nvidia-smi<\/code> riconosca la scheda, quindi riavviare il servizio Ollama.<\/li>\n<li>Se il modello \u00e8 pi\u00f9 grande della tua VRAM, Ollama sposta alcuni strati sulla CPU \u2014 usa il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per verificare se il modello \u00e8 compatibile prima di scaricarlo.<\/li>\n<li>AMD, Docker e WSL2 richiedono procedure specifiche per piattaforma, descritte di seguito.<\/li>\n<\/ul>\n<\/div>\n<p>Quando Ollama non utilizza la tua GPU, la causa pi\u00f9 frequente \u00e8 un driver mancante o non compatibile. Esegui <code>ollama ps<\/code> \u2014 se la colonna PROCESSOR mostra il 100% CPU, Ollama ha effettuato un fallback completo sulla CPU. La soluzione dipende dalla tua piattaforma: NVIDIA richiede il runtime CUDA corretto, AMD richiede ROCm e Docker necessita di flag espliciti per il passaggio della GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abb33bfdf06d\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abb33bfdf06d\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Passo 1: Verifica se Ollama sta effettivamente utilizzando la GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Passo 2: NVIDIA \u2014 Driver e runtime CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Passo 3: Modello troppo grande per la VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Passo 4: GPU AMD e ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Passo 5: Docker \u2014 manca il passaggio della GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Passo 6: WSL2 su Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (Apple Silicon e AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >Verifica della correzione e prestazioni attese<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Passo 1: Verifica se Ollama sta effettivamente utilizzando la GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Prima di apportare modifiche, verifica cosa sta effettivamente facendo Ollama. Carica un modello e, mentre \u00e8 in esecuzione, apri un secondo terminale:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Esempio di output:<\/p>\n<pre><code>NAME              ID              SIZE      PROCESSOR    UNTIL\nllama3.2:8b       abc123def456    5.0 GB    100% GPU     tra 4 minuti<\/code><\/pre>\n<p>La colonna PROCESSOR \u00e8 l\u2019indicatore definitivo:<\/p>\n<table>\n<thead>\n<tr>\n<th>Valore PROCESSOR<\/th>\n<th>Significato<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100% GPU<\/td>\n<td>Tutti gli strati sulla GPU \u2014 comportamento previsto e corretto<\/td>\n<\/tr>\n<tr>\n<td>XX% GPU \/ YY% CPU<\/td>\n<td>Il modello si inserisce parzialmente nella VRAM; gli strati rimanenti vengono eseguiti sulla CPU<\/td>\n<\/tr>\n<tr>\n<td>100% CPU<\/td>\n<td>Fallback completo sulla CPU \u2014 la GPU non viene utilizzata affatto<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Su sistemi NVIDIA, esegui un controllo incrociato con <code>nvidia-smi<\/code> mentre l\u2019inferenza \u00e8 in esecuzione. La colonna Memory-Usage dovrebbe aumentare durante il caricamento del modello. Se rimane costante, la GPU \u00e8 inattiva, indipendentemente da quanto indicato da altri strumenti.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Passo 2: NVIDIA \u2014 Driver e runtime CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un driver NVIDIA mancante o obsoleto \u00e8 la causa pi\u00f9 comune di un fallback completo sulla CPU. Ollama include le proprie librerie CUDA, ma richiede comunque un driver host compatibile con CUDA 11.3 o versione successiva.<\/p>\n<h3>Verifica innanzitutto il driver<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se il comando non viene trovato, nessun driver \u00e8 installato. Se viene eseguito, annota la versione del driver e quella di CUDA nell\u2019intestazione. La versione di CUDA indicata rappresenta la versione massima supportata dal driver \u2014 non significa che sia installato un toolkit CUDA separato, e Ollama non ne ha bisogno.<\/p>\n<table>\n<thead>\n<tr>\n<th>Piattaforma<\/th>\n<th>Versione minima del driver<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (supporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows nativo<\/td>\n<td>527.xx (supporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (host Windows)<\/td>\n<td>525.xx sul lato Windows \u2014 non installare il driver NVIDIA Linux all\u2019interno di WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Installa o aggiorna il driver<\/h3>\n<p><strong>Ubuntu \/ Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Scaricalo da nvidia.com\/Download oppure utilizza GeForce Experience, quindi riavvia. \u00c8 necessario un riavvio completo \u2014 non solo un riavvio del servizio \u2014 dopo l\u2019installazione o l\u2019aggiornamento del driver.<\/p>\n<p>Dopo il riavvio, verifica che <code>nvidia-smi<\/code> mostri la tua scheda, quindi riavvia Ollama:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 riavvia l\u2019applicazione Ollama nella barra delle applicazioni oppure riavvia il sistema<\/code><\/pre>\n<p>Esegui un modello e controlla nuovamente <code>ollama ps<\/code> . Se la colonna PROCESSOR mostra ancora il 100% CPU, procedi con i passi successivi.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Passo 3: Modello troppo grande per la VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quando i pesi di un modello superano la VRAM disponibile, Ollama non rifiuta l\u2019esecuzione \u2014 suddivide invece l\u2019inferenza. Il maggior numero possibile di strati transformer viene assegnato alla GPU; il resto viene eseguito sulla CPU. Questo si manifesta come una percentuale suddivisa in <code>ollama ps<\/code> ed \u00e8 un comportamento intenzionale, non un bug.<\/p>\n<p>Un modello da 70 miliardi di parametri quantizzato in Q4_K_M richiede tipicamente circa 40 GB di VRAM, una quantit\u00e0 superiore a qualsiasi GPU consumer monoblocco. Prima di scaricare un modello di grandi dimensioni, verifica la compatibilit\u00e0 con il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a>. Per dati dettagliati sui modelli LLM pi\u00f9 diffusi, consulta <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM)<\/a>.<\/p>\n<p>Se il modello non entra nella tua VRAM, hai le seguenti opzioni:<\/p>\n<ul>\n<li>Utilizza una quantizzazione inferiore (ad esempio Q2_K o Q3_K_S) \u2014 riduce il consumo di VRAM con un lieve impatto sulla qualit\u00e0.<\/li>\n<li>Passa a una variante pi\u00f9 piccola del modello (ad esempio 8B invece di 70B). La pagina <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">I migliori modelli locali per Ollama<\/a> indica quali modelli funzionano bene sull\u2019hardware consumer.<\/li>\n<li>Accetta lo scarico parziale \u2014 le prestazioni saranno intermedie tra quelle della GPU completa e quelle della CPU completa.<\/li>\n<li>Aggiorna la tua GPU. La guida <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali<\/a> confronta le opzioni attuali in base a VRAM e prezzo.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Passo 4: GPU AMD e ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Il supporto AMD in Ollama si basa su ROCm, la piattaforma di calcolo GPU di AMD. Ollama supporta ufficialmente le schede RDNA 2 (serie RX 6000) e RDNA 3 (serie RX 7000) su Linux. Il supporto AMD su Windows \u00e8 limitato: controlla le note di rilascio della versione di Ollama installata prima di presumere che funzioni su Windows.<\/p>\n<h3>Verifica che ROCm rilevi la scheda<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Se <code>rocm-smi<\/code> non viene trovato, lo stack ROCm non \u00e8 installato. Consulta amd.com\/it\/developer\/rocm per le istruzioni di installazione aggiornate relative alla tua distribuzione, poich\u00e9 i nomi dei pacchetti e i requisiti di versione cambiano tra le diverse release di ROCm.<\/p>\n<p>Se la scheda non compare nell'output di <code>rocm-smi<\/code> dopo l'installazione:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Effettua il logout e il login nuovamente affinch\u00e9 la modifica ai gruppi entri in vigore<\/code><\/pre>\n<p>Per selezionare una GPU specifica quando sono presenti pi\u00f9 unit\u00e0:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Passo 5: Docker \u2014 manca il passaggio della GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I container Docker non hanno accesso alla GPU a meno che tu non la passi esplicitamente al container. Questo \u00e8 il motivo pi\u00f9 comune per cui Ollama ricade sull'uso della CPU nelle distribuzioni containerizzate: la GPU dell'host funziona correttamente, ma il container non riesce a vederla.<\/p>\n<h3>NVIDIA in Docker<\/h3>\n<p>Installa il NVIDIA Container Toolkit sull'host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Quindi passa la GPU all'avvio del container:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Senza l'opzione <code>--gpus all<\/code> (o <code>--gpus device=0<\/code> (per specificare una scheda precisa), il container non avr\u00e0 alcun accesso alla GPU, indipendentemente dalla configurazione dell'host.<\/p>\n<h3>AMD in Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>Il <code>:rocm<\/code> \u00e8 un tag dell'immagine obbligatorio. L'immagine predefinita <code>ollama\/ollama<\/code> non include ROCm e ricadr\u00e0 sull'uso della CPU su hardware AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Passo 6: WSL2 su Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>WSL2 pu\u00f2 condividere la GPU NVIDIA con l'host Windows, ma vale una regola assoluta: il driver NVIDIA deve essere installato su <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>Installa o aggiorna il driver NVIDIA su Windows, quindi riavvia Windows.<\/li>\n<li>WSL2 richiede il kernel 5.10.43 o successivo. Verificalo eseguendo <code>uname -r<\/code> all'interno di WSL2; aggiornalo con <code>wsl --update<\/code> da un terminale Windows.<\/li>\n<li>Il toolkit CUDA pu\u00f2 essere installato all'interno di WSL2 se il tuo flusso di lavoro lo richiede: ci\u00f2 \u00e8 indipendente dal driver e non causa conflitti.<\/li>\n<\/ul>\n<p>Verifica la visibilit\u00e0 della GPU da dentro WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se questo comando mostra la tua scheda, Ollama in esecuzione all'interno di WSL2 la utilizzer\u00e0 automaticamente. In caso di errore, aggiorna il driver lato Windows ed esegui nuovamente il comando. <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (Apple Silicon e AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Su macOS, Ollama utilizza Apple Metal per l'accelerazione GPU \u2014 non \u00e8 necessario installare driver n\u00e9 impostare variabili d'ambiente. Se utilizzi un Mac con chip Apple Silicon e Ollama risulta lento, verifica di aver installato la build nativa ARM dal sito ollama.com, anzich\u00e9 la versione x86 eseguita tramite Rosetta. I Mac con chip Apple Silicon usano memoria unificata, quindi tutta la RAM del sistema \u00e8 disponibile ai modelli: inserisci la quantit\u00e0 totale di RAM come limite di VRAM quando usi la <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>Verifica della correzione e prestazioni attese<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Dopo aver apportato le modifiche, esegui un modello e controlla contemporaneamente due indicatori:<\/p>\n<pre><code># Terminale 1 \u2014 avvia una generazione\nollama run llama3.2:8b \"Qual \u00e8 la capitale della Francia?\"\n\n# Terminale 2 \u2014 mentre sta generando\nollama ps\n\n# NVIDIA: osserva anche l'utilizzo della GPU al secondo\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Throughput di riferimento (approssimativo \u2014 varia in base alla quantizzazione, alla versione del driver e alla larghezza di banda PCIe):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modello<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (memoria unificata)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Solo CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Un throughput inferiore a dieci token al secondo, pur avendo a disposizione una GPU performante, \u00e8 l'indicatore pi\u00f9 chiaro che la correzione non ha avuto effetto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Perch\u00e9 <code>ollama ps<\/code> mostra una suddivisione GPU\/CPU invece del 100% GPU?<\/h3>\n<p>Il modello \u00e8 pi\u00f9 grande della VRAM disponibile. Ollama carica sul GPU il maggior numero possibile di layer e esegue i restanti sulla CPU. Il risultato \u00e8 pi\u00f9 veloce rispetto all'esecuzione interamente su CPU, ma pi\u00f9 lento rispetto all'esecuzione interamente su GPU. Carica un modello pi\u00f9 piccolo o passa a una quantizzazione inferiore per spostare ulteriori layer sulla GPU.<\/p>\n<h3>Ollama utilizzava la GPU in precedenza e improvvisamente ha smesso \u2014 cosa \u00e8 cambiato?<\/h3>\n<p>Un aggiornamento del driver, del sistema operativo o di Ollama stesso pu\u00f2 compromettere il rilevamento della GPU. Verifica che <code>nvidia-smi<\/code> mostri ancora la scheda, quindi esegui un riavvio completo del servizio. Se hai aggiornato di recente il driver NVIDIA, a volte \u00e8 necessario un riavvio completo del sistema anzich\u00e9 un semplice riavvio del servizio.<\/p>\n<h3>Ollama pu\u00f2 utilizzare pi\u00f9 GPU contemporaneamente?<\/h3>\n<p>S\u00ec. Ollama distribuisce automaticamente i layer del modello su tutte le GPU visibili quando ne sono presenti pi\u00f9 di una. Per limitare le GPU utilizzabili da Ollama, imposta <code>CUDA_VISIBLE_DEVICES<\/code> (NVIDIA) oppure <code>HIP_VISIBLE_DEVICES<\/code> (AMD) prima di iniziare <code>ollama serve<\/code>.<\/p>\n<h3>Ollama funziona con le schede grafiche GeForce consumer o \u00e8 necessaria una GPU per data center?<\/h3>\n<p>Le schede GeForce GTX 10xx e successive sono pienamente supportate \u2014 non \u00e8 richiesta alcuna GPU per data center. Il limite pratico per la maggior parte degli utenti \u00e8 la VRAM: una scheda da 8 GB esegue agevolmente modelli da 7\u20138 miliardi di parametri con quantizzazione Q4. Utilizza il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per verificare che un modello specifico sia compatibile prima del download.<\/p>\n<h3>La mia GPU dispone di sufficiente VRAM, ma Ollama utilizza comunque la CPU. Perch\u00e9?<\/h3>\n<p>Un altro processo potrebbe occupare la VRAM \u2014 controlla <code>nvidia-smi<\/code> per individuare altri utilizzatori, ad esempio un browser con accelerazione hardware o un altro modello in esecuzione. \u00c8 anche possibile che il modello sia stato caricato prima che il driver della GPU fosse pronto. Arresta il modello caricato con <code>ollama stop &lt;nome&gt;<\/code>, libera la VRAM in altre applicazioni e ricarica il modello.<\/p>\n<h3>Dove posso trovare ulteriori informazioni sulla configurazione di Ollama e sulla scelta dei modelli?<\/h3>\n<p>Il <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">Guida completa a Ollama<\/a> tratta in modo approfondito le variabili d\u2019ambiente, la gestione dei modelli e l\u2019utilizzo dell\u2019API. Per scegliere il modello pi\u00f9 adatto al tuo hardware specifico, consulta il <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">I migliori modelli locali per Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or CPU.The most common fix on NVIDIA is installing or updating the host driver so nvidia-smi sees the card, then restarting the Ollama service. If the model is larger than your VRAM, Ollama offloads layers to CPU \u2014 use the VRAM calculator to check whether your model fits before downloading it. AMD, Docker, and WSL2 each require platform-specific steps covered below.<\/p>","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":3,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2339,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2339"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}