{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-26T09:05:15","modified_gmt":"2026-08-26T09:05:15","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama N\u00e3o Est\u00e1 Usando a GPU: Diagn\u00f3stico e Corre\u00e7\u00e3o do Uso For\u00e7ado da CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Executar <code>ollama ps<\/code> enquanto um modelo estiver carregado \u2014 a coluna PROCESSOR indica se o Ollama est\u00e1 usando a GPU ou a CPU.<\/li>\n<li>A corre\u00e7\u00e3o mais comum em sistemas NVIDIA \u00e9 instalar ou atualizar o driver do host para que <code>nvidia-smi<\/code> reconhe\u00e7a a placa, seguido de uma reinicializa\u00e7\u00e3o do servi\u00e7o Ollama.<\/li>\n<li>Se o modelo for maior do que sua VRAM, o Ollama descarrega camadas para a CPU \u2014 use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para verificar se seu modelo cabe na VRAM antes de baix\u00e1-lo.<\/li>\n<li>AMD, Docker e WSL2 exigem etapas espec\u00edficas por plataforma, detalhadas abaixo.<\/li>\n<\/ul>\n<\/div>\n<p>Quando o Ollama n\u00e3o est\u00e1 utilizando sua GPU, a causa mais comum \u00e9 um driver ausente ou incompat\u00edvel. Execute <code>ollama ps<\/code> \u2014 se a coluna PROCESSOR mostrar 100% CPU, o Ollama recorreu inteiramente \u00e0 CPU. A solu\u00e7\u00e3o depende da sua plataforma: sistemas NVIDIA exigem o runtime CUDA correto, AMD requer o ROCm e Docker necessita de flags expl\u00edcitas de passagem de GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abb33f815bf9\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abb33f815bf9\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Etapa 1: Confirme se o Ollama Est\u00e1 Realmente Usando a GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Etapa 2: NVIDIA \u2014 Drivers e Runtime CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Etapa 3: Modelo Muito Grande para a VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Etapa 4: GPU AMD e ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Etapa 5: Docker \u2014 Falta de Passagem de GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Etapa 6: WSL2 no Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (Apple Silicon e AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >Verifica\u00e7\u00e3o da Corre\u00e7\u00e3o e Taxa de Processamento Esperada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Etapa 1: Confirme se o Ollama Est\u00e1 Realmente Usando a GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de realizar qualquer altera\u00e7\u00e3o, verifique o que o Ollama est\u00e1 realmente fazendo. Carregue um modelo e, enquanto ele estiver em execu\u00e7\u00e3o, abra um segundo terminal:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Exemplo de sa\u00edda:<\/p>\n<pre><code>NOME              ID              TAMANHO   PROCESSOR    AT\u00c9\nllama3.2:8b       abc123def456    5,0 GB    100% GPU     Daqui a 4 minutos<\/code><\/pre>\n<p>A coluna PROCESSOR \u00e9 o indicador definitivo:<\/p>\n<table>\n<thead>\n<tr>\n<th>Valor da coluna PROCESSOR<\/th>\n<th>Significado<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100% GPU<\/td>\n<td>Todas as camadas na GPU \u2014 comportamento esperado e correto<\/td>\n<\/tr>\n<tr>\n<td>XX% GPU \/ YY% CPU<\/td>\n<td>O modelo cabe parcialmente na VRAM; as camadas restantes s\u00e3o executadas na CPU<\/td>\n<\/tr>\n<tr>\n<td>100% CPU<\/td>\n<td>Recorr\u00eancia total \u00e0 CPU \u2014 a GPU n\u00e3o est\u00e1 sendo utilizada de forma alguma<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Em sistemas NVIDIA, confirme tamb\u00e9m com <code>nvidia-smi<\/code> durante a infer\u00eancia. A coluna Memory-Usage deve aumentar \u00e0 medida que o modelo \u00e9 carregado. Se permanecer constante, a GPU est\u00e1 ociosa, independentemente do que outros utilit\u00e1rios possam indicar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Etapa 2: NVIDIA \u2014 Drivers e Runtime CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Um driver NVIDIA ausente ou desatualizado \u00e9 a causa mais comum de recorr\u00eancia total \u00e0 CPU. O Ollama inclui suas pr\u00f3prias bibliotecas CUDA, mas ainda exige um driver do sistema hospedeiro compat\u00edvel com CUDA 11.3 ou posterior.<\/p>\n<h3>Verifique primeiro o driver<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se o comando n\u00e3o for encontrado, nenhum driver est\u00e1 instalado. Se for executado, anote a vers\u00e3o do driver e a vers\u00e3o do CUDA no cabe\u00e7alho. A vers\u00e3o do CUDA exibida corresponde \u00e0 vers\u00e3o m\u00e1xima suportada pelo driver \u2014 isso n\u00e3o significa que um toolkit CUDA separado esteja instalado, e o Ollama n\u00e3o o requer.<\/p>\n<table>\n<thead>\n<tr>\n<th>Plataforma<\/th>\n<th>Vers\u00e3o m\u00ednima do driver<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (suporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows nativo<\/td>\n<td>527.xx (suporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (host Windows)<\/td>\n<td>525.xx no lado Windows \u2014 n\u00e3o instale o driver NVIDIA Linux dentro do WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Instale ou atualize o driver<\/h3>\n<p><strong>Ubuntu\/Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Baixe do site nvidia.com\/Download ou use o GeForce Experience e, em seguida, reinicie o sistema. Uma reinicializa\u00e7\u00e3o completa \u2014 e n\u00e3o apenas uma reinicializa\u00e7\u00e3o do servi\u00e7o \u2014 \u00e9 obrigat\u00f3ria ap\u00f3s a instala\u00e7\u00e3o ou atualiza\u00e7\u00e3o do driver.<\/p>\n<p>Ap\u00f3s a reinicializa\u00e7\u00e3o, confirme que <code>nvidia-smi<\/code> reconhece sua placa e reinicie o Ollama:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 reinicie o aplicativo Ollama na \u00e1rea de notifica\u00e7\u00e3o ou reinicie o sistema<\/code><\/pre>\n<p>Execute um modelo e verifique novamente <code>ollama ps<\/code> . Se a coluna PROCESSOR ainda mostrar 100% CPU, prossiga para as pr\u00f3ximas etapas.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Etapa 3: Modelo Muito Grande para a VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quando os pesos de um modelo excedem a VRAM dispon\u00edvel, o Ollama n\u00e3o recusa sua execu\u00e7\u00e3o \u2014 ele divide a infer\u00eancia. Tantas camadas do transformador quanto poss\u00edvel s\u00e3o enviadas para a GPU; as demais s\u00e3o executadas na CPU. Isso aparece como uma porcentagem dividida em <code>ollama ps<\/code> e constitui um comportamento intencional, n\u00e3o um erro.<\/p>\n<p>Um modelo de 70 bilh\u00f5es de par\u00e2metros com quantiza\u00e7\u00e3o Q4_K_M geralmente requer cerca de 40 GB de VRAM, o que supera qualquer GPU voltada ao consumidor. Antes de baixar um modelo grande, verifique se ele cabe na sua VRAM usando o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>. Para valores espec\u00edficos por modelo entre os LLMs mais populares, consulte <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para todos os principais modelos de linguagem (LLM)<\/a>.<\/p>\n<p>Se o modelo n\u00e3o couber na sua VRAM, suas op\u00e7\u00f5es s\u00e3o:<\/p>\n<ul>\n<li>Utilize uma quantiza\u00e7\u00e3o inferior (por exemplo, Q2_K ou Q3_K_S) \u2014 reduz o uso de VRAM com um pequeno impacto na qualidade.<\/li>\n<li>Mude para uma variante menor do modelo (por exemplo, 8B em vez de 70B). A p\u00e1gina <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores modelos locais para Ollama<\/a> explica quais modelos funcionam bem em hardware voltado ao consumidor.<\/li>\n<li>Aceite a descarga parcial \u2014 o desempenho ficar\u00e1 entre os valores obtidos com GPU completa e CPU completa.<\/li>\n<li>Atualize sua GPU. O guia <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais<\/a> compara as op\u00e7\u00f5es atuais com base na capacidade de VRAM e pre\u00e7o.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Etapa 4: GPU AMD e ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O suporte \u00e0 AMD no Ollama \u00e9 baseado no ROCm, a plataforma de computa\u00e7\u00e3o GPU da AMD. O Ollama oferece suporte oficial \u00e0s placas RDNA 2 (s\u00e9rie RX 6000) e RDNA 3 (s\u00e9rie RX 7000) no Linux. O suporte \u00e0 AMD no Windows \u00e9 limitado \u2014 verifique as notas de vers\u00e3o do seu Ollama instalado antes de esperar que ele funcione no Windows.<\/p>\n<h3>Verifique se o ROCm detecta a placa<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Se <code>rocm-smi<\/code> n\u00e3o for encontrado, a pilha ROCm n\u00e3o est\u00e1 instalada. Consulte amd.com\/pt-br\/developer\/rocm para obter as instru\u00e7\u00f5es atuais de instala\u00e7\u00e3o compat\u00edveis com sua distribui\u00e7\u00e3o, pois os nomes dos pacotes e os requisitos de vers\u00e3o mudam entre as vers\u00f5es do ROCm.<\/p>\n<p>Se a placa estiver ausente na sa\u00edda de <code>rocm-smi<\/code> ap\u00f3s a instala\u00e7\u00e3o:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Fa\u00e7a logout e login novamente para que a altera\u00e7\u00e3o nos grupos entre em vigor<\/code><\/pre>\n<p>Para direcionar uma GPU espec\u00edfica quando v\u00e1rias estiverem presentes:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Etapa 5: Docker \u2014 Falta de Passagem de GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cont\u00eaineres Docker n\u00e3o t\u00eam acesso \u00e0 GPU a menos que voc\u00ea a passe explicitamente ao cont\u00eainer. Esse \u00e9 o motivo mais comum pelo qual o Ollama recai na CPU em implanta\u00e7\u00f5es baseadas em cont\u00eaineres \u2014 a GPU do host est\u00e1 funcionando normalmente, mas o cont\u00eainer n\u00e3o consegue v\u00ea-la.<\/p>\n<h3>NVIDIA no Docker<\/h3>\n<p>Instale a NVIDIA Container Toolkit no host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Em seguida, passe a GPU ao iniciar o cont\u00eainer:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Sem a op\u00e7\u00e3o <code>--gpus all<\/code> (ou <code>--gpus device=0<\/code> (para uma placa espec\u00edfica), o cont\u00eainer n\u00e3o ter\u00e1 acesso \u00e0 GPU, independentemente da configura\u00e7\u00e3o do host.<\/p>\n<h3>AMD no Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>O <code>:rocm<\/code> a tag da imagem \u00e9 obrigat\u00f3ria. A imagem padr\u00e3o <code>ollama\/ollama<\/code> n\u00e3o inclui o ROCm e recair\u00e1 na CPU em hardware AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Etapa 6: WSL2 no Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O WSL2 pode compartilhar a GPU NVIDIA com o host Windows, mas h\u00e1 uma regra absoluta: o driver NVIDIA deve ser instalado no <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>atualize ou instale o driver NVIDIA no Windows e reinicie o sistema.<\/li>\n<li>O WSL2 exige kernel 5.10.43 ou posterior. Verifique com <code>uname -r<\/code> dentro do WSL2; atualize com <code>wsl --update<\/code> em um terminal do Windows.<\/li>\n<li>O toolkit CUDA pode ser instalado dentro do WSL2, caso seu fluxo de trabalho exija \u2014 isso \u00e9 independente do driver e n\u00e3o causa conflitos.<\/li>\n<\/ul>\n<p>Verifique a visibilidade da GPU dentro do WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se esse comando exibir sua placa, o Ollama executado dentro do WSL2 a utilizar\u00e1 automaticamente. Caso falhe, atualize o driver do lado do Windows e execute novamente <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (Apple Silicon e AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>No macOS, o Ollama usa a tecnologia Apple Metal para acelera\u00e7\u00e3o por GPU \u2014 nenhum driver precisa ser instalado e nenhuma vari\u00e1vel de ambiente precisa ser configurada. Se voc\u00ea estiver usando um Mac com chip Apple Silicon e o Ollama estiver executando lentamente, confirme se instalou a vers\u00e3o nativa ARM do site ollama.com, e n\u00e3o a vers\u00e3o x86 executada sob o Rosetta. Os Macs com Apple Silicon usam mem\u00f3ria unificada, portanto toda a RAM do sistema est\u00e1 dispon\u00edvel para os modelos \u2014 insira a quantidade total de RAM como limite de VRAM ao usar a <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>Verifica\u00e7\u00e3o da Corre\u00e7\u00e3o e Taxa de Processamento Esperada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ap\u00f3s realizar altera\u00e7\u00f5es, execute um modelo e verifique simultaneamente dois indicadores:<\/p>\n<pre><code># Terminal 1 \u2014 inicie uma gera\u00e7\u00e3o\nollama run llama3.2:8b \"Qual \u00e9 a capital da Fran\u00e7a?\"\n\n# Terminal 2 \u2014 enquanto a gera\u00e7\u00e3o estiver em andamento\nollama ps\n\n# NVIDIA: observe tamb\u00e9m a utiliza\u00e7\u00e3o da GPU por segundo\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Taxa de transfer\u00eancia de refer\u00eancia (aproximada \u2014 varia conforme a quantiza\u00e7\u00e3o, vers\u00e3o do driver e largura de banda PCIe):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modelo<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (mem\u00f3ria unificada)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Apenas CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Uma taxa de poucos tokens por segundo mesmo com uma GPU capaz presente \u00e9 o sinal mais claro de que a corre\u00e7\u00e3o n\u00e3o surtiu efeito.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Por que o <code>ollama ps<\/code> mostra uma divis\u00e3o GPU\/CPU em vez de 100% GPU?<\/h3>\n<p>O modelo \u00e9 maior do que a VRAM dispon\u00edvel. O Ollama aloca o m\u00e1ximo poss\u00edvel de camadas na GPU e executa o restante na CPU. O resultado \u00e9 mais r\u00e1pido do que a execu\u00e7\u00e3o totalmente na CPU, mas mais lento do que a execu\u00e7\u00e3o totalmente na GPU. Carregue um modelo menor ou mude para uma quantiza\u00e7\u00e3o inferior para transferir mais camadas para a GPU.<\/p>\n<h3>O Ollama estava usando a GPU anteriormente e, de repente, parou \u2014 o que mudou?<\/h3>\n<p>Uma atualiza\u00e7\u00e3o do driver, do sistema operacional ou uma nova vers\u00e3o do Ollama pode interromper a detec\u00e7\u00e3o da GPU. Verifique se <code>nvidia-smi<\/code> ainda mostra a placa, depois reinicie completamente o servi\u00e7o. Se voc\u00ea atualizou recentemente o driver NVIDIA, \u00e0s vezes \u00e9 necess\u00e1rio reiniciar o sistema inteiro, em vez de apenas reiniciar o servi\u00e7o.<\/p>\n<h3>O Ollama pode usar m\u00faltiplas GPUs simultaneamente?<\/h3>\n<p>Sim. O Ollama distribui automaticamente as camadas do modelo entre todas as GPUs vis\u00edveis sempre que houver mais de uma presente. Para restringir quais GPUs o Ollama deve usar, defina <code>CUDA_VISIBLE_DEVICES<\/code> (NVIDIA) ou <code>HIP_VISIBLE_DEVICES<\/code> (AMD) antes de iniciar <code>ollama serve<\/code>.<\/p>\n<h3>O Ollama funciona com placas GeForce voltadas para consumidores ou preciso de uma GPU para data center?<\/h3>\n<p>As placas GeForce GTX 10xx e posteriores s\u00e3o totalmente compat\u00edveis \u2014 n\u00e3o \u00e9 necess\u00e1ria nenhuma GPU para data center. O limite pr\u00e1tico para a maioria dos usu\u00e1rios \u00e9 a quantidade de VRAM: uma placa com 8 GB executa confortavelmente modelos de 7\u20138 bilh\u00f5es de par\u00e2metros na quantiza\u00e7\u00e3o Q4. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para verificar se um modelo espec\u00edfico cabe na sua GPU antes de baix\u00e1-lo.<\/p>\n<h3>Minha GPU tem VRAM suficiente, mas o Ollama ainda usa a CPU. Por qu\u00ea?<\/h3>\n<p>Outro processo pode estar ocupando a VRAM \u2014 verifique o <code>nvidia-smi<\/code> para identificar outros consumidores, como um navegador com acelera\u00e7\u00e3o por hardware ou outro modelo em execu\u00e7\u00e3o. \u00c9 poss\u00edvel tamb\u00e9m que o modelo tenha sido carregado antes de o driver da GPU ficar pronto. Interrompa o modelo carregado com <code>ollama stop &lt;nome&gt;<\/code>, libere a VRAM em outros aplicativos e recarregue o modelo.<\/p>\n<h3>Onde posso saber mais sobre como configurar o Ollama e escolher modelos?<\/h3>\n<p>O <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">Guia completo do Ollama<\/a> aborda em profundidade vari\u00e1veis de ambiente, gerenciamento de modelos e uso da API. Para saber qual modelo executar no seu hardware espec\u00edfico, consulte o <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores modelos locais para Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or CPU.The most common fix on NVIDIA is installing or updating the host driver so nvidia-smi sees the card, then restarting the Ollama service. If the model is larger than your VRAM, Ollama offloads layers to CPU \u2014 use the VRAM calculator to check whether your model fits before downloading it. AMD, Docker, and WSL2 each require platform-specific steps covered below.<\/p>","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":3,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2339,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2339"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}