{"id":2205,"date":"2026-08-14T20:17:07","date_gmt":"2026-08-14T20:17:07","guid":{"rendered":"https:\/\/convly.ai\/?p=2205"},"modified":"2026-08-14T20:17:07","modified_gmt":"2026-08-14T20:17:07","slug":"ollama-not-using-gpu-fix","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/","title":{"rendered":"Ollama N\u00e3o Est\u00e1 Usando a GPU: Diagn\u00f3stico e Corre\u00e7\u00e3o do Uso For\u00e7ado da CPU"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Executar <code>ollama ps<\/code> enquanto um modelo estiver carregado \u2014 a coluna PROCESSOR indica se o Ollama est\u00e1 usando a GPU ou a CPU.<\/li>\n<li>A corre\u00e7\u00e3o mais comum em sistemas NVIDIA \u00e9 instalar ou atualizar o driver do host para que <code>nvidia-smi<\/code> reconhe\u00e7a a placa, seguido de uma reinicializa\u00e7\u00e3o do servi\u00e7o Ollama.<\/li>\n<li>Se o modelo for maior do que sua VRAM, o Ollama descarrega camadas para a CPU \u2014 use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para verificar se seu modelo cabe na VRAM antes de baix\u00e1-lo.<\/li>\n<li>AMD, Docker e WSL2 exigem etapas espec\u00edficas por plataforma, detalhadas abaixo.<\/li>\n<\/ul>\n<\/div>\n<p>Quando o Ollama n\u00e3o est\u00e1 utilizando sua GPU, a causa mais comum \u00e9 um driver ausente ou incompat\u00edvel. Execute <code>ollama ps<\/code> \u2014 se a coluna PROCESSOR mostrar 100% CPU, o Ollama recorreu inteiramente \u00e0 CPU. A solu\u00e7\u00e3o depende da sua plataforma: sistemas NVIDIA exigem o runtime CUDA correto, AMD requer o ROCm e Docker necessita de flags expl\u00edcitas de passagem de GPU.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7fb8ecbe309\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7fb8ecbe309\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\" >Etapa 1: Confirme se o Ollama Est\u00e1 Realmente Usando a GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\" >Etapa 2: NVIDIA \u2014 Drivers e Runtime CUDA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_3_Model_Too_Large_for_VRAM\" >Etapa 3: Modelo Muito Grande para a VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_4_AMD_GPU_and_ROCm\" >Etapa 4: GPU AMD e ROCm<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\" >Etapa 5: Docker \u2014 Falta de Passagem de GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Step_6_WSL2_on_Windows\" >Etapa 6: WSL2 no Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\" >macOS \u2014 Metal (Apple Silicon e AMD)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Verifying_the_Fix_and_Expected_Throughput\" >Verifica\u00e7\u00e3o da Corre\u00e7\u00e3o e Taxa de Processamento Esperada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/ollama-not-using-gpu-fix\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Step_1_Confirm_Whether_Ollama_Is_Using_the_GPU\"><\/span>Etapa 1: Confirme se o Ollama Est\u00e1 Realmente Usando a GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de realizar qualquer altera\u00e7\u00e3o, verifique o que o Ollama est\u00e1 realmente fazendo. Carregue um modelo e, enquanto ele estiver em execu\u00e7\u00e3o, abra um segundo terminal:<\/p>\n<pre><code>ollama ps<\/code><\/pre>\n<p>Exemplo de sa\u00edda:<\/p>\n<pre><code>NOME              ID              TAMANHO   PROCESSOR    AT\u00c9\nllama3.2:8b       abc123def456    5,0 GB    100% GPU     Daqui a 4 minutos<\/code><\/pre>\n<p>A coluna PROCESSOR \u00e9 o indicador definitivo:<\/p>\n<table>\n<thead>\n<tr>\n<th>Valor da coluna PROCESSOR<\/th>\n<th>Significado<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>100% GPU<\/td>\n<td>Todas as camadas na GPU \u2014 comportamento esperado e correto<\/td>\n<\/tr>\n<tr>\n<td>XX% GPU \/ YY% CPU<\/td>\n<td>O modelo cabe parcialmente na VRAM; as camadas restantes s\u00e3o executadas na CPU<\/td>\n<\/tr>\n<tr>\n<td>100% CPU<\/td>\n<td>Recorr\u00eancia total \u00e0 CPU \u2014 a GPU n\u00e3o est\u00e1 sendo utilizada de forma alguma<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Em sistemas NVIDIA, confirme tamb\u00e9m com <code>nvidia-smi<\/code> durante a infer\u00eancia. A coluna Memory-Usage deve aumentar \u00e0 medida que o modelo \u00e9 carregado. Se permanecer constante, a GPU est\u00e1 ociosa, independentemente do que outros utilit\u00e1rios possam indicar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_2_NVIDIA_%E2%80%94_Drivers_and_CUDA_Runtime\"><\/span>Etapa 2: NVIDIA \u2014 Drivers e Runtime CUDA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Um driver NVIDIA ausente ou desatualizado \u00e9 a causa mais comum de recorr\u00eancia total \u00e0 CPU. O Ollama inclui suas pr\u00f3prias bibliotecas CUDA, mas ainda exige um driver do sistema hospedeiro compat\u00edvel com CUDA 11.3 ou posterior.<\/p>\n<h3>Verifique primeiro o driver<\/h3>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se o comando n\u00e3o for encontrado, nenhum driver est\u00e1 instalado. Se for executado, anote a vers\u00e3o do driver e a vers\u00e3o do CUDA no cabe\u00e7alho. A vers\u00e3o do CUDA exibida corresponde \u00e0 vers\u00e3o m\u00e1xima suportada pelo driver \u2014 isso n\u00e3o significa que um toolkit CUDA separado esteja instalado, e o Ollama n\u00e3o o requer.<\/p>\n<table>\n<thead>\n<tr>\n<th>Plataforma<\/th>\n<th>Vers\u00e3o m\u00ednima do driver<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Linux<\/td>\n<td>525.xx (suporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>Windows nativo<\/td>\n<td>527.xx (suporta CUDA 12.0)<\/td>\n<\/tr>\n<tr>\n<td>WSL2 (host Windows)<\/td>\n<td>525.xx no lado Windows \u2014 n\u00e3o instale o driver NVIDIA Linux dentro do WSL2<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h3>Instale ou atualize o driver<\/h3>\n<p><strong>Ubuntu\/Debian:<\/strong><\/p>\n<pre><code>sudo apt install nvidia-driver-550\nsudo reboot<\/code><\/pre>\n<p><strong>Windows:<\/strong> Baixe do site nvidia.com\/Download ou use o GeForce Experience e, em seguida, reinicie o sistema. Uma reinicializa\u00e7\u00e3o completa \u2014 e n\u00e3o apenas uma reinicializa\u00e7\u00e3o do servi\u00e7o \u2014 \u00e9 obrigat\u00f3ria ap\u00f3s a instala\u00e7\u00e3o ou atualiza\u00e7\u00e3o do driver.<\/p>\n<p>Ap\u00f3s a reinicializa\u00e7\u00e3o, confirme que <code>nvidia-smi<\/code> reconhece sua placa e reinicie o Ollama:<\/p>\n<pre><code># Linux (systemd)\nsudo systemctl restart ollama\n\n# macOS\nlaunchctl kickstart -k gui\/$(id -u)\/com.ollama.ollama\n\n# Windows \u2014 reinicie o aplicativo Ollama na \u00e1rea de notifica\u00e7\u00e3o ou reinicie o sistema<\/code><\/pre>\n<p>Execute um modelo e verifique novamente <code>ollama ps<\/code> . Se a coluna PROCESSOR ainda mostrar 100% CPU, prossiga para as pr\u00f3ximas etapas.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_3_Model_Too_Large_for_VRAM\"><\/span>Etapa 3: Modelo Muito Grande para a VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quando os pesos de um modelo excedem a VRAM dispon\u00edvel, o Ollama n\u00e3o recusa sua execu\u00e7\u00e3o \u2014 ele divide a infer\u00eancia. Tantas camadas do transformador quanto poss\u00edvel s\u00e3o enviadas para a GPU; as demais s\u00e3o executadas na CPU. Isso aparece como uma porcentagem dividida em <code>ollama ps<\/code> e constitui um comportamento intencional, n\u00e3o um erro.<\/p>\n<p>Um modelo de 70 bilh\u00f5es de par\u00e2metros com quantiza\u00e7\u00e3o Q4_K_M geralmente requer cerca de 40 GB de VRAM, o que supera qualquer GPU voltada ao consumidor. Antes de baixar um modelo grande, verifique se ele cabe na sua VRAM usando o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>. Para valores espec\u00edficos por modelo entre os LLMs mais populares, consulte <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para todos os principais modelos de linguagem (LLM)<\/a>.<\/p>\n<p>Se o modelo n\u00e3o couber na sua VRAM, suas op\u00e7\u00f5es s\u00e3o:<\/p>\n<ul>\n<li>Utilize uma quantiza\u00e7\u00e3o inferior (por exemplo, Q2_K ou Q3_K_S) \u2014 reduz o uso de VRAM com um pequeno impacto na qualidade.<\/li>\n<li>Mude para uma variante menor do modelo (por exemplo, 8B em vez de 70B). A p\u00e1gina <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores modelos locais para Ollama<\/a> explica quais modelos funcionam bem em hardware voltado ao consumidor.<\/li>\n<li>Aceite a descarga parcial \u2014 o desempenho ficar\u00e1 entre os valores obtidos com GPU completa e CPU completa.<\/li>\n<li>Atualize sua GPU. O guia <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais<\/a> compara as op\u00e7\u00f5es atuais com base na capacidade de VRAM e pre\u00e7o.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Step_4_AMD_GPU_and_ROCm\"><\/span>Etapa 4: GPU AMD e ROCm<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O suporte \u00e0 AMD no Ollama \u00e9 baseado no ROCm, a plataforma de computa\u00e7\u00e3o GPU da AMD. O Ollama oferece suporte oficial \u00e0s placas RDNA 2 (s\u00e9rie RX 6000) e RDNA 3 (s\u00e9rie RX 7000) no Linux. O suporte \u00e0 AMD no Windows \u00e9 limitado \u2014 verifique as notas de vers\u00e3o do seu Ollama instalado antes de esperar que ele funcione no Windows.<\/p>\n<h3>Verifique se o ROCm detecta a placa<\/h3>\n<pre><code>rocm-smi<\/code><\/pre>\n<p>Se <code>rocm-smi<\/code> n\u00e3o for encontrado, a pilha ROCm n\u00e3o est\u00e1 instalada. Consulte amd.com\/pt-br\/developer\/rocm para obter as instru\u00e7\u00f5es atuais de instala\u00e7\u00e3o compat\u00edveis com sua distribui\u00e7\u00e3o, pois os nomes dos pacotes e os requisitos de vers\u00e3o mudam entre as vers\u00f5es do ROCm.<\/p>\n<p>Se a placa estiver ausente na sa\u00edda de <code>rocm-smi<\/code> ap\u00f3s a instala\u00e7\u00e3o:<\/p>\n<pre><code>sudo usermod -aG render,video $USER\n# Fa\u00e7a logout e login novamente para que a altera\u00e7\u00e3o nos grupos entre em vigor<\/code><\/pre>\n<p>Para direcionar uma GPU espec\u00edfica quando v\u00e1rias estiverem presentes:<\/p>\n<pre><code>HIP_VISIBLE_DEVICES=0 ollama serve<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Step_5_Docker_%E2%80%94_Missing_GPU_Passthrough\"><\/span>Etapa 5: Docker \u2014 Falta de Passagem de GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cont\u00eaineres Docker n\u00e3o t\u00eam acesso \u00e0 GPU a menos que voc\u00ea a passe explicitamente ao cont\u00eainer. Esse \u00e9 o motivo mais comum pelo qual o Ollama recai na CPU em implanta\u00e7\u00f5es baseadas em cont\u00eaineres \u2014 a GPU do host est\u00e1 funcionando normalmente, mas o cont\u00eainer n\u00e3o consegue v\u00ea-la.<\/p>\n<h3>NVIDIA no Docker<\/h3>\n<p>Instale a NVIDIA Container Toolkit no host:<\/p>\n<pre><code>sudo apt install nvidia-container-toolkit\nsudo nvidia-ctk runtime configure --runtime=docker\nsudo systemctl restart docker<\/code><\/pre>\n<p>Em seguida, passe a GPU ao iniciar o cont\u00eainer:<\/p>\n<pre><code>docker run -d --gpus all \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama<\/code><\/pre>\n<p>Sem a op\u00e7\u00e3o <code>--gpus all<\/code> (ou <code>--gpus device=0<\/code> (para uma placa espec\u00edfica), o cont\u00eainer n\u00e3o ter\u00e1 acesso \u00e0 GPU, independentemente da configura\u00e7\u00e3o do host.<\/p>\n<h3>AMD no Docker<\/h3>\n<pre><code>docker run -d \n  --device \/dev\/kfd --device \/dev\/dri \n  -v ollama:\/root\/.ollama \n  -p 11434:11434 \n  ollama\/ollama:rocm<\/code><\/pre>\n<p>O <code>:rocm<\/code> a tag da imagem \u00e9 obrigat\u00f3ria. A imagem padr\u00e3o <code>ollama\/ollama<\/code> n\u00e3o inclui o ROCm e recair\u00e1 na CPU em hardware AMD.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Step_6_WSL2_on_Windows\"><\/span>Etapa 6: WSL2 no Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O WSL2 pode compartilhar a GPU NVIDIA com o host Windows, mas h\u00e1 uma regra absoluta: o driver NVIDIA deve ser instalado no <strong>Windows<\/strong>Windows<\/p>\n<ul>\n<li>atualize ou instale o driver NVIDIA no Windows e reinicie o sistema.<\/li>\n<li>O WSL2 exige kernel 5.10.43 ou posterior. Verifique com <code>uname -r<\/code> dentro do WSL2; atualize com <code>wsl --update<\/code> em um terminal do Windows.<\/li>\n<li>O toolkit CUDA pode ser instalado dentro do WSL2, caso seu fluxo de trabalho exija \u2014 isso \u00e9 independente do driver e n\u00e3o causa conflitos.<\/li>\n<\/ul>\n<p>Verifique a visibilidade da GPU dentro do WSL2:<\/p>\n<pre><code>nvidia-smi<\/code><\/pre>\n<p>Se esse comando exibir sua placa, o Ollama executado dentro do WSL2 a utilizar\u00e1 automaticamente. Caso falhe, atualize o driver do lado do Windows e execute novamente <code>wsl --update<\/code>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"macOS_%E2%80%94_Metal_Apple_Silicon_and_AMD\"><\/span>macOS \u2014 Metal (Apple Silicon e AMD)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>No macOS, o Ollama usa a tecnologia Apple Metal para acelera\u00e7\u00e3o por GPU \u2014 nenhum driver precisa ser instalado e nenhuma vari\u00e1vel de ambiente precisa ser configurada. Se voc\u00ea estiver usando um Mac com chip Apple Silicon e o Ollama estiver executando lentamente, confirme se instalou a vers\u00e3o nativa ARM do site ollama.com, e n\u00e3o a vers\u00e3o x86 executada sob o Rosetta. Os Macs com Apple Silicon usam mem\u00f3ria unificada, portanto toda a RAM do sistema est\u00e1 dispon\u00edvel para os modelos \u2014 insira a quantidade total de RAM como limite de VRAM ao usar a <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Verifying_the_Fix_and_Expected_Throughput\"><\/span>Verifica\u00e7\u00e3o da Corre\u00e7\u00e3o e Taxa de Processamento Esperada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ap\u00f3s realizar altera\u00e7\u00f5es, execute um modelo e verifique simultaneamente dois indicadores:<\/p>\n<pre><code># Terminal 1 \u2014 inicie uma gera\u00e7\u00e3o\nollama run llama3.2:8b \"Qual \u00e9 a capital da Fran\u00e7a?\"\n\n# Terminal 2 \u2014 enquanto a gera\u00e7\u00e3o estiver em andamento\nollama ps\n\n# NVIDIA: observe tamb\u00e9m a utiliza\u00e7\u00e3o da GPU por segundo\nnvidia-smi dmon -s u<\/code><\/pre>\n<p>Taxa de transfer\u00eancia de refer\u00eancia (aproximada \u2014 varia conforme a quantiza\u00e7\u00e3o, vers\u00e3o do driver e largura de banda PCIe):<\/p>\n<table>\n<thead>\n<tr>\n<th>Hardware<\/th>\n<th>Modelo<\/th>\n<th>~tok\/s<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 4090 (24 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>120\u2013160<\/td>\n<\/tr>\n<tr>\n<td>RTX 3080 (10 GB)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>60\u201380<\/td>\n<\/tr>\n<tr>\n<td>Apple M3 Pro (mem\u00f3ria unificada)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>40\u201360<\/td>\n<\/tr>\n<tr>\n<td>Apenas CPU (Ryzen 9 7950X)<\/td>\n<td>Llama 3.1 8B Q4<\/td>\n<td>5\u201315<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Uma taxa de poucos tokens por segundo mesmo com uma GPU capaz presente \u00e9 o sinal mais claro de que a corre\u00e7\u00e3o n\u00e3o surtiu efeito.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Por que o <code>ollama ps<\/code> mostra uma divis\u00e3o GPU\/CPU em vez de 100% GPU?<\/h3>\n<p>O modelo \u00e9 maior do que a VRAM dispon\u00edvel. O Ollama aloca o m\u00e1ximo poss\u00edvel de camadas na GPU e executa o restante na CPU. O resultado \u00e9 mais r\u00e1pido do que a execu\u00e7\u00e3o totalmente na CPU, mas mais lento do que a execu\u00e7\u00e3o totalmente na GPU. Carregue um modelo menor ou mude para uma quantiza\u00e7\u00e3o inferior para transferir mais camadas para a GPU.<\/p>\n<h3>O Ollama estava usando a GPU anteriormente e, de repente, parou \u2014 o que mudou?<\/h3>\n<p>Uma atualiza\u00e7\u00e3o do driver, do sistema operacional ou uma nova vers\u00e3o do Ollama pode interromper a detec\u00e7\u00e3o da GPU. Verifique se <code>nvidia-smi<\/code> ainda mostra a placa, depois reinicie completamente o servi\u00e7o. Se voc\u00ea atualizou recentemente o driver NVIDIA, \u00e0s vezes \u00e9 necess\u00e1rio reiniciar o sistema inteiro, em vez de apenas reiniciar o servi\u00e7o.<\/p>\n<h3>O Ollama pode usar m\u00faltiplas GPUs simultaneamente?<\/h3>\n<p>Sim. O Ollama distribui automaticamente as camadas do modelo entre todas as GPUs vis\u00edveis sempre que houver mais de uma presente. Para restringir quais GPUs o Ollama deve usar, defina <code>CUDA_VISIBLE_DEVICES<\/code> (NVIDIA) ou <code>HIP_VISIBLE_DEVICES<\/code> (AMD) antes de iniciar <code>ollama serve<\/code>.<\/p>\n<h3>O Ollama funciona com placas GeForce voltadas para consumidores ou preciso de uma GPU para data center?<\/h3>\n<p>As placas GeForce GTX 10xx e posteriores s\u00e3o totalmente compat\u00edveis \u2014 n\u00e3o \u00e9 necess\u00e1ria nenhuma GPU para data center. O limite pr\u00e1tico para a maioria dos usu\u00e1rios \u00e9 a quantidade de VRAM: uma placa com 8 GB executa confortavelmente modelos de 7\u20138 bilh\u00f5es de par\u00e2metros na quantiza\u00e7\u00e3o Q4. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para verificar se um modelo espec\u00edfico cabe na sua GPU antes de baix\u00e1-lo.<\/p>\n<h3>Minha GPU tem VRAM suficiente, mas o Ollama ainda usa a CPU. Por qu\u00ea?<\/h3>\n<p>Outro processo pode estar ocupando a VRAM \u2014 verifique o <code>nvidia-smi<\/code> para identificar outros consumidores, como um navegador com acelera\u00e7\u00e3o por hardware ou outro modelo em execu\u00e7\u00e3o. \u00c9 poss\u00edvel tamb\u00e9m que o modelo tenha sido carregado antes de o driver da GPU ficar pronto. Interrompa o modelo carregado com <code>ollama stop &lt;nome&gt;<\/code>, libere a VRAM em outros aplicativos e recarregue o modelo.<\/p>\n<h3>Onde posso saber mais sobre como configurar o Ollama e escolher modelos?<\/h3>\n<p>O <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">Guia completo do Ollama<\/a> aborda em profundidade vari\u00e1veis de ambiente, gerenciamento de modelos e uso da API. Para saber qual modelo executar no seu hardware espec\u00edfico, consulte o <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores modelos locais para Ollama<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>Run ollama ps while a model is loaded \u2014 the PROCESSOR column tells you whether Ollama is using GPU or [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2205","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2205"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205\/revisions"}],"predecessor-version":[{"id":2207,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2205\/revisions\/2207"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2206"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2205"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2205"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2205"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}