{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-14T20:17:07","modified_gmt":"2026-08-14T20:17:07","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama non utilizza la GPU: diagnosi e correzione del fallback sulla CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Esegui <code>ollama ps<\/code> mentre un modello \u00e8 caricato \u2014 la colonna PROCESSOR indica se Ollama sta utilizzando la GPU o la CPU.<\/li>\n<li>La correzione pi\u00f9 comune su NVIDIA consiste nell\u2019installare o aggiornare il driver host in modo che <code>nvidia-smi<\/code> riconosca la scheda, quindi riavviare il servizio Ollama.<\/li>\n<li>Se il modello \u00e8 pi\u00f9 grande della tua VRAM, Ollama sposta alcuni strati sulla CPU \u2014 usa il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per verificare se il modello \u00e8 compatibile prima di scaricarlo.<\/li>\n<li>AMD, Docker e WSL2 richiedono procedure specifiche per piattaforma, descritte di seguito.<\/li>\n<\/ul>\n<\/div>\n<p>Quando Ollama non utilizza la tua GPU, la causa pi\u00f9 frequente \u00e8 un driver mancante o non compatibile. Esegui <code>ollama ps<\/code> \u2014 se la colonna PROCESSOR mostra il 100% CPU, Ollama ha effettuato un fallback completo sulla CPU. La soluzione dipende dalla tua piattaforma: NVIDIA richiede il runtime CUDA corretto, AMD richiede ROCm e Docker necessita di flag espliciti per il passaggio della GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7fb8b6942ea\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7fb8b6942ea\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Passo 1: Verifica se Ollama sta effettivamente utilizzando la GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Passo 2: NVIDIA \u2014 Driver e runtime CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Passo 3: Modello troppo grande per la VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Passo 4: GPU AMD e ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Passo 5: Docker \u2014 manca il passaggio della GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Passo 6: WSL2 su Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (Apple Silicon e AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >Verifica della correzione e prestazioni attese<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/it\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Passo 1: Verifica se Ollama sta effettivamente utilizzando la GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Prima di apportare modifiche, verifica cosa sta effettivamente facendo Ollama. Carica un modello e, mentre \u00e8 in esecuzione, apri un secondo terminale:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Esempio di output:<\/p>\n<pre><code>NAME              ID              SIZE      PROCESSOR    UNTIL\nllama3.2:8b       abc123def456    5.0 GB    100% GPU     tra 4 minuti<\/code><\/pre>\n<p>La colonna PROCESSOR \u00e8 l\u2019indicatore definitivo:<\/p>\n<table>\n<thead>\n<tr>\n<th>Valore PROCESSOR<\/th>\n<th>Significato<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100% GPU<\/td>\n<td>Tutti gli strati sulla GPU \u2014 comportamento previsto e corretto<\/td>\n<\/tr>\n<tr>\n<td>XX% GPU \/ YY% CPU<\/td>\n<td>Il modello si inserisce parzialmente nella VRAM; gli strati rimanenti vengono eseguiti sulla CPU<\/td>\n<\/tr>\n<tr>\n<td>100% CPU<\/td>\n<td>Fallback completo sulla CPU \u2014 la GPU non viene utilizzata affatto<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Su sistemi NVIDIA, esegui un controllo incrociato con <code>nvidia-smi<\/code> mentre l\u2019inferenza \u00e8 in esecuzione. La colonna Memory-Usage dovrebbe aumentare durante il caricamento del modello. Se rimane costante, la GPU \u00e8 inattiva, indipendentemente da quanto indicato da altri strumenti.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Passo 2: NVIDIA \u2014 Driver e runtime CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un driver NVIDIA mancante o obsoleto \u00e8 la causa pi\u00f9 comune di un fallback completo sulla CPU. Ollama include le proprie librerie CUDA, ma richiede comunque un driver host compatibile con CUDA 11.3 o versione successiva.<\/p>\n<h3>Verifica innanzitutto il driver<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se il comando non viene trovato, nessun driver \u00e8 installato. Se viene eseguito, annota la versione del driver e quella di CUDA nell\u2019intestazione. La versione di CUDA indicata rappresenta la versione massima supportata dal driver \u2014 non significa che sia installato un toolkit CUDA separato, e Ollama non ne ha bisogno.<\/p>\n<table>\n<thead>\n<tr>\n<th>Piattaforma<\/th>\n<th>Versione minima del driver<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (supporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows nativo<\/td>\n<td>527.xx (supporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (host Windows)<\/td>\n<td>525.xx sul lato Windows \u2014 non installare il driver NVIDIA Linux all\u2019interno di WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Installa o aggiorna il driver<\/h3>\n<p><strong>Ubuntu \/ Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Scaricalo da nvidia.com\/Download oppure utilizza GeForce Experience, quindi riavvia. \u00c8 necessario un riavvio completo \u2014 non solo un riavvio del servizio \u2014 dopo l\u2019installazione o l\u2019aggiornamento del driver.<\/p>\n<p>Dopo il riavvio, verifica che <code>nvidia-smi<\/code> mostri la tua scheda, quindi riavvia Ollama:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 riavvia l\u2019applicazione Ollama nella barra delle applicazioni oppure riavvia il sistema<\/code><\/pre>\n<p>Esegui un modello e controlla nuovamente <code>ollama ps<\/code> . Se la colonna PROCESSOR mostra ancora il 100% CPU, procedi con i passi successivi.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Passo 3: Modello troppo grande per la VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quando i pesi di un modello superano la VRAM disponibile, Ollama non rifiuta l\u2019esecuzione \u2014 suddivide invece l\u2019inferenza. Il maggior numero possibile di strati transformer viene assegnato alla GPU; il resto viene eseguito sulla CPU. Questo si manifesta come una percentuale suddivisa in <code>ollama ps<\/code> ed \u00e8 un comportamento intenzionale, non un bug.<\/p>\n<p>Un modello da 70 miliardi di parametri quantizzato in Q4_K_M richiede tipicamente circa 40 GB di VRAM, una quantit\u00e0 superiore a qualsiasi GPU consumer monoblocco. Prima di scaricare un modello di grandi dimensioni, verifica la compatibilit\u00e0 con il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a>. Per dati dettagliati sui modelli LLM pi\u00f9 diffusi, consulta <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Requisiti di VRAM per ogni principale modello linguistico di grandi dimensioni (LLM)<\/a>.<\/p>\n<p>Se il modello non entra nella tua VRAM, hai le seguenti opzioni:<\/p>\n<ul>\n<li>Utilizza una quantizzazione inferiore (ad esempio Q2_K o Q3_K_S) \u2014 riduce il consumo di VRAM con un lieve impatto sulla qualit\u00e0.<\/li>\n<li>Passa a una variante pi\u00f9 piccola del modello (ad esempio 8B invece di 70B). La pagina <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">I migliori modelli locali per Ollama<\/a> indica quali modelli funzionano bene sull\u2019hardware consumer.<\/li>\n<li>Accetta lo scarico parziale \u2014 le prestazioni saranno intermedie tra quelle della GPU completa e quelle della CPU completa.<\/li>\n<li>Aggiorna la tua GPU. La guida <a href=\"https:\/\/convly.ai\/it\/best-gpus-for-local-llms-2026\/\">le migliori GPU per LLM locali<\/a> confronta le opzioni attuali in base a VRAM e prezzo.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Passo 4: GPU AMD e ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Il supporto AMD in Ollama si basa su ROCm, la piattaforma di calcolo GPU di AMD. Ollama supporta ufficialmente le schede RDNA 2 (serie RX 6000) e RDNA 3 (serie RX 7000) su Linux. Il supporto AMD su Windows \u00e8 limitato: controlla le note di rilascio della versione di Ollama installata prima di presumere che funzioni su Windows.<\/p>\n<h3>Verifica che ROCm rilevi la scheda<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Se <code>rocm-smi<\/code> non viene trovato, lo stack ROCm non \u00e8 installato. Consulta amd.com\/it\/developer\/rocm per le istruzioni di installazione aggiornate relative alla tua distribuzione, poich\u00e9 i nomi dei pacchetti e i requisiti di versione cambiano tra le diverse release di ROCm.<\/p>\n<p>Se la scheda non compare nell'output di <code>rocm-smi<\/code> dopo l'installazione:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Effettua il logout e il login nuovamente affinch\u00e9 la modifica ai gruppi entri in vigore<\/code><\/pre>\n<p>Per selezionare una GPU specifica quando sono presenti pi\u00f9 unit\u00e0:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Passo 5: Docker \u2014 manca il passaggio della GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I container Docker non hanno accesso alla GPU a meno che tu non la passi esplicitamente al container. Questo \u00e8 il motivo pi\u00f9 comune per cui Ollama ricade sull'uso della CPU nelle distribuzioni containerizzate: la GPU dell'host funziona correttamente, ma il container non riesce a vederla.<\/p>\n<h3>NVIDIA in Docker<\/h3>\n<p>Installa il NVIDIA Container Toolkit sull'host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Quindi passa la GPU all'avvio del container:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Senza l'opzione <code>--gpus all<\/code> (o <code>--gpus device=0<\/code> (per specificare una scheda precisa), il container non avr\u00e0 alcun accesso alla GPU, indipendentemente dalla configurazione dell'host.<\/p>\n<h3>AMD in Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>Il <code>:rocm<\/code> \u00e8 un tag dell'immagine obbligatorio. L'immagine predefinita <code>ollama\/ollama<\/code> non include ROCm e ricadr\u00e0 sull'uso della CPU su hardware AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Passo 6: WSL2 su Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>WSL2 pu\u00f2 condividere la GPU NVIDIA con l'host Windows, ma vale una regola assoluta: il driver NVIDIA deve essere installato su <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>Installa o aggiorna il driver NVIDIA su Windows, quindi riavvia Windows.<\/li>\n<li>WSL2 richiede il kernel 5.10.43 o successivo. Verificalo eseguendo <code>uname -r<\/code> all'interno di WSL2; aggiornalo con <code>wsl --update<\/code> da un terminale Windows.<\/li>\n<li>Il toolkit CUDA pu\u00f2 essere installato all'interno di WSL2 se il tuo flusso di lavoro lo richiede: ci\u00f2 \u00e8 indipendente dal driver e non causa conflitti.<\/li>\n<\/ul>\n<p>Verifica la visibilit\u00e0 della GPU da dentro WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se questo comando mostra la tua scheda, Ollama in esecuzione all'interno di WSL2 la utilizzer\u00e0 automaticamente. In caso di errore, aggiorna il driver lato Windows ed esegui nuovamente il comando. <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (Apple Silicon e AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Su macOS, Ollama utilizza Apple Metal per l'accelerazione GPU \u2014 non \u00e8 necessario installare driver n\u00e9 impostare variabili d'ambiente. Se utilizzi un Mac con chip Apple Silicon e Ollama risulta lento, verifica di aver installato la build nativa ARM dal sito ollama.com, anzich\u00e9 la versione x86 eseguita tramite Rosetta. I Mac con chip Apple Silicon usano memoria unificata, quindi tutta la RAM del sistema \u00e8 disponibile ai modelli: inserisci la quantit\u00e0 totale di RAM come limite di VRAM quando usi la <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>Verifica della correzione e prestazioni attese<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Dopo aver apportato le modifiche, esegui un modello e controlla contemporaneamente due indicatori:<\/p>\n<pre><code># Terminale 1 \u2014 avvia una generazione\nollama run llama3.2:8b \"Qual \u00e8 la capitale della Francia?\"\n\n# Terminale 2 \u2014 mentre sta generando\nollama ps\n\n# NVIDIA: osserva anche l'utilizzo della GPU al secondo\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Throughput di riferimento (approssimativo \u2014 varia in base alla quantizzazione, alla versione del driver e alla larghezza di banda PCIe):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modello<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (memoria unificata)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Solo CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Un throughput inferiore a dieci token al secondo, pur avendo a disposizione una GPU performante, \u00e8 l'indicatore pi\u00f9 chiaro che la correzione non ha avuto effetto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Perch\u00e9 <code>ollama ps<\/code> mostra una suddivisione GPU\/CPU invece del 100% GPU?<\/h3>\n<p>Il modello \u00e8 pi\u00f9 grande della VRAM disponibile. Ollama carica sul GPU il maggior numero possibile di layer e esegue i restanti sulla CPU. Il risultato \u00e8 pi\u00f9 veloce rispetto all'esecuzione interamente su CPU, ma pi\u00f9 lento rispetto all'esecuzione interamente su GPU. Carica un modello pi\u00f9 piccolo o passa a una quantizzazione inferiore per spostare ulteriori layer sulla GPU.<\/p>\n<h3>Ollama utilizzava la GPU in precedenza e improvvisamente ha smesso \u2014 cosa \u00e8 cambiato?<\/h3>\n<p>Un aggiornamento del driver, del sistema operativo o di Ollama stesso pu\u00f2 compromettere il rilevamento della GPU. Verifica che <code>nvidia-smi<\/code> mostri ancora la scheda, quindi esegui un riavvio completo del servizio. Se hai aggiornato di recente il driver NVIDIA, a volte \u00e8 necessario un riavvio completo del sistema anzich\u00e9 un semplice riavvio del servizio.<\/p>\n<h3>Ollama pu\u00f2 utilizzare pi\u00f9 GPU contemporaneamente?<\/h3>\n<p>S\u00ec. Ollama distribuisce automaticamente i layer del modello su tutte le GPU visibili quando ne sono presenti pi\u00f9 di una. Per limitare le GPU utilizzabili da Ollama, imposta <code>CUDA_VISIBLE_DEVICES<\/code> (NVIDIA) oppure <code>HIP_VISIBLE_DEVICES<\/code> (AMD) prima di iniziare <code>ollama serve<\/code>.<\/p>\n<h3>Ollama funziona con le schede grafiche GeForce consumer o \u00e8 necessaria una GPU per data center?<\/h3>\n<p>Le schede GeForce GTX 10xx e successive sono pienamente supportate \u2014 non \u00e8 richiesta alcuna GPU per data center. Il limite pratico per la maggior parte degli utenti \u00e8 la VRAM: una scheda da 8 GB esegue agevolmente modelli da 7\u20138 miliardi di parametri con quantizzazione Q4. Utilizza il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per verificare che un modello specifico sia compatibile prima del download.<\/p>\n<h3>La mia GPU dispone di sufficiente VRAM, ma Ollama utilizza comunque la CPU. Perch\u00e9?<\/h3>\n<p>Un altro processo potrebbe occupare la VRAM \u2014 controlla <code>nvidia-smi<\/code> per individuare altri utilizzatori, ad esempio un browser con accelerazione hardware o un altro modello in esecuzione. \u00c8 anche possibile che il modello sia stato caricato prima che il driver della GPU fosse pronto. Arresta il modello caricato con <code>ollama stop &lt;nome&gt;<\/code>, libera la VRAM in altre applicazioni e ricarica il modello.<\/p>\n<h3>Dove posso trovare ulteriori informazioni sulla configurazione di Ollama e sulla scelta dei modelli?<\/h3>\n<p>Il <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">Guida completa a Ollama<\/a> tratta in modo approfondito le variabili d\u2019ambiente, la gestione dei modelli e l\u2019utilizzo dell\u2019API. Per scegliere il modello pi\u00f9 adatto al tuo hardware specifico, consulta il <a href=\"https:\/\/convly.ai\/it\/best-local-llms-to-run-on-ollama-2026\/\">I migliori modelli locali per Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2207,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2207"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}