Friday, 14 August 2026 | Updating Daily AI insight, written for builders

Ollama Não Está Usando a GPU: Diagnóstico e Correção do Uso Forçado da CPU

  • Executar ollama ps enquanto um modelo estiver carregado — a coluna PROCESSOR indica se o Ollama está usando a GPU ou a CPU.
  • A correção mais comum em sistemas NVIDIA é instalar ou atualizar o driver do host para que nvidia-smi reconheça a placa, seguido de uma reinicialização do serviço Ollama.
  • Se o modelo for maior do que sua VRAM, o Ollama descarrega camadas para a CPU — use o Calculadora de VRAM para verificar se seu modelo cabe na VRAM antes de baixá-lo.
  • AMD, Docker e WSL2 exigem etapas específicas por plataforma, detalhadas abaixo.

Quando o Ollama não está utilizando sua GPU, a causa mais comum é um driver ausente ou incompatível. Execute ollama ps — se a coluna PROCESSOR mostrar 100% CPU, o Ollama recorreu inteiramente à CPU. A solução depende da sua plataforma: sistemas NVIDIA exigem o runtime CUDA correto, AMD requer o ROCm e Docker necessita de flags explícitas de passagem de GPU.

Etapa 1: Confirme se o Ollama Está Realmente Usando a GPU

Antes de realizar qualquer alteração, verifique o que o Ollama está realmente fazendo. Carregue um modelo e, enquanto ele estiver em execução, abra um segundo terminal:

ollama ps

Exemplo de saída:

NOME              ID              TAMANHO   PROCESSOR    ATÉ
llama3.2:8b       abc123def456    5,0 GB    100% GPU     Daqui a 4 minutos

A coluna PROCESSOR é o indicador definitivo:

Valor da coluna PROCESSORSignificado
100% GPUTodas as camadas na GPU — comportamento esperado e correto
XX% GPU / YY% CPUO modelo cabe parcialmente na VRAM; as camadas restantes são executadas na CPU
100% CPURecorrência total à CPU — a GPU não está sendo utilizada de forma alguma

Em sistemas NVIDIA, confirme também com nvidia-smi durante a inferência. A coluna Memory-Usage deve aumentar à medida que o modelo é carregado. Se permanecer constante, a GPU está ociosa, independentemente do que outros utilitários possam indicar.

Etapa 2: NVIDIA — Drivers e Runtime CUDA

Um driver NVIDIA ausente ou desatualizado é a causa mais comum de recorrência total à CPU. O Ollama inclui suas próprias bibliotecas CUDA, mas ainda exige um driver do sistema hospedeiro compatível com CUDA 11.3 ou posterior.

Verifique primeiro o driver

nvidia-smi

Se o comando não for encontrado, nenhum driver está instalado. Se for executado, anote a versão do driver e a versão do CUDA no cabeçalho. A versão do CUDA exibida corresponde à versão máxima suportada pelo driver — isso não significa que um toolkit CUDA separado esteja instalado, e o Ollama não o requer.

PlataformaVersão mínima do driver
Linux525.xx (suporta CUDA 12.0)
Windows nativo527.xx (suporta CUDA 12.0)
WSL2 (host Windows)525.xx no lado Windows — não instale o driver NVIDIA Linux dentro do WSL2

Instale ou atualize o driver

Ubuntu/Debian:

sudo apt install nvidia-driver-550
sudo reboot

Windows: Baixe do site nvidia.com/Download ou use o GeForce Experience e, em seguida, reinicie o sistema. Uma reinicialização completa — e não apenas uma reinicialização do serviço — é obrigatória após a instalação ou atualização do driver.

Após a reinicialização, confirme que nvidia-smi reconhece sua placa e reinicie o Ollama:

# Linux (systemd)
sudo systemctl restart ollama

# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama

# Windows — reinicie o aplicativo Ollama na área de notificação ou reinicie o sistema

Execute um modelo e verifique novamente ollama ps . Se a coluna PROCESSOR ainda mostrar 100% CPU, prossiga para as próximas etapas.

Etapa 3: Modelo Muito Grande para a VRAM

Quando os pesos de um modelo excedem a VRAM disponível, o Ollama não recusa sua execução — ele divide a inferência. Tantas camadas do transformador quanto possível são enviadas para a GPU; as demais são executadas na CPU. Isso aparece como uma porcentagem dividida em ollama ps e constitui um comportamento intencional, não um erro.

Um modelo de 70 bilhões de parâmetros com quantização Q4_K_M geralmente requer cerca de 40 GB de VRAM, o que supera qualquer GPU voltada ao consumidor. Antes de baixar um modelo grande, verifique se ele cabe na sua VRAM usando o Calculadora de VRAM. Para valores específicos por modelo entre os LLMs mais populares, consulte Requisitos de VRAM para todos os principais modelos de linguagem (LLM).

Se o modelo não couber na sua VRAM, suas opções são:

  • Utilize uma quantização inferior (por exemplo, Q2_K ou Q3_K_S) — reduz o uso de VRAM com um pequeno impacto na qualidade.
  • Mude para uma variante menor do modelo (por exemplo, 8B em vez de 70B). A página melhores modelos locais para Ollama explica quais modelos funcionam bem em hardware voltado ao consumidor.
  • Aceite a descarga parcial — o desempenho ficará entre os valores obtidos com GPU completa e CPU completa.
  • Atualize sua GPU. O guia melhores GPUs para LLMs locais compara as opções atuais com base na capacidade de VRAM e preço.

Etapa 4: GPU AMD e ROCm

O suporte à AMD no Ollama é baseado no ROCm, a plataforma de computação GPU da AMD. O Ollama oferece suporte oficial às placas RDNA 2 (série RX 6000) e RDNA 3 (série RX 7000) no Linux. O suporte à AMD no Windows é limitado — verifique as notas de versão do seu Ollama instalado antes de esperar que ele funcione no Windows.

Verifique se o ROCm detecta a placa

rocm-smi

Se rocm-smi não for encontrado, a pilha ROCm não está instalada. Consulte amd.com/pt-br/developer/rocm para obter as instruções atuais de instalação compatíveis com sua distribuição, pois os nomes dos pacotes e os requisitos de versão mudam entre as versões do ROCm.

Se a placa estiver ausente na saída de rocm-smi após a instalação:

sudo usermod -aG render,video $USER
# Faça logout e login novamente para que a alteração nos grupos entre em vigor

Para direcionar uma GPU específica quando várias estiverem presentes:

HIP_VISIBLE_DEVICES=0 ollama serve

Etapa 5: Docker — Falta de Passagem de GPU

Contêineres Docker não têm acesso à GPU a menos que você a passe explicitamente ao contêiner. Esse é o motivo mais comum pelo qual o Ollama recai na CPU em implantações baseadas em contêineres — a GPU do host está funcionando normalmente, mas o contêiner não consegue vê-la.

NVIDIA no Docker

Instale a NVIDIA Container Toolkit no host:

sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Em seguida, passe a GPU ao iniciar o contêiner:

docker run -d --gpus all 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama

Sem a opção --gpus all (ou --gpus device=0 (para uma placa específica), o contêiner não terá acesso à GPU, independentemente da configuração do host.

AMD no Docker

docker run -d 
  --device /dev/kfd --device /dev/dri 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama:rocm

O :rocm a tag da imagem é obrigatória. A imagem padrão ollama/ollama não inclui o ROCm e recairá na CPU em hardware AMD.

Etapa 6: WSL2 no Windows

O WSL2 pode compartilhar a GPU NVIDIA com o host Windows, mas há uma regra absoluta: o driver NVIDIA deve ser instalado no WindowsWindows

  • atualize ou instale o driver NVIDIA no Windows e reinicie o sistema.
  • O WSL2 exige kernel 5.10.43 ou posterior. Verifique com uname -r dentro do WSL2; atualize com wsl --update em um terminal do Windows.
  • O toolkit CUDA pode ser instalado dentro do WSL2, caso seu fluxo de trabalho exija — isso é independente do driver e não causa conflitos.

Verifique a visibilidade da GPU dentro do WSL2:

nvidia-smi

Se esse comando exibir sua placa, o Ollama executado dentro do WSL2 a utilizará automaticamente. Caso falhe, atualize o driver do lado do Windows e execute novamente wsl --update.

macOS — Metal (Apple Silicon e AMD)

No macOS, o Ollama usa a tecnologia Apple Metal para aceleração por GPU — nenhum driver precisa ser instalado e nenhuma variável de ambiente precisa ser configurada. Se você estiver usando um Mac com chip Apple Silicon e o Ollama estiver executando lentamente, confirme se instalou a versão nativa ARM do site ollama.com, e não a versão x86 executada sob o Rosetta. Os Macs com Apple Silicon usam memória unificada, portanto toda a RAM do sistema está disponível para os modelos — insira a quantidade total de RAM como limite de VRAM ao usar a Calculadora de VRAM.

Verificação da Correção e Taxa de Processamento Esperada

Após realizar alterações, execute um modelo e verifique simultaneamente dois indicadores:

# Terminal 1 — inicie uma geração
ollama run llama3.2:8b "Qual é a capital da França?"

# Terminal 2 — enquanto a geração estiver em andamento
ollama ps

# NVIDIA: observe também a utilização da GPU por segundo
nvidia-smi dmon -s u

Taxa de transferência de referência (aproximada — varia conforme a quantização, versão do driver e largura de banda PCIe):

HardwareModelo~tok/s
RTX 4090 (24 GB)Llama 3.1 8B Q4120–160
RTX 3080 (10 GB)Llama 3.1 8B Q460–80
Apple M3 Pro (memória unificada)Llama 3.1 8B Q440–60
Apenas CPU (Ryzen 9 7950X)Llama 3.1 8B Q45–15

Uma taxa de poucos tokens por segundo mesmo com uma GPU capaz presente é o sinal mais claro de que a correção não surtiu efeito.

Perguntas frequentes

Por que o ollama ps mostra uma divisão GPU/CPU em vez de 100% GPU?

O modelo é maior do que a VRAM disponível. O Ollama aloca o máximo possível de camadas na GPU e executa o restante na CPU. O resultado é mais rápido do que a execução totalmente na CPU, mas mais lento do que a execução totalmente na GPU. Carregue um modelo menor ou mude para uma quantização inferior para transferir mais camadas para a GPU.

O Ollama estava usando a GPU anteriormente e, de repente, parou — o que mudou?

Uma atualização do driver, do sistema operacional ou uma nova versão do Ollama pode interromper a detecção da GPU. Verifique se nvidia-smi ainda mostra a placa, depois reinicie completamente o serviço. Se você atualizou recentemente o driver NVIDIA, às vezes é necessário reiniciar o sistema inteiro, em vez de apenas reiniciar o serviço.

O Ollama pode usar múltiplas GPUs simultaneamente?

Sim. O Ollama distribui automaticamente as camadas do modelo entre todas as GPUs visíveis sempre que houver mais de uma presente. Para restringir quais GPUs o Ollama deve usar, defina CUDA_VISIBLE_DEVICES (NVIDIA) ou HIP_VISIBLE_DEVICES (AMD) antes de iniciar ollama serve.

O Ollama funciona com placas GeForce voltadas para consumidores ou preciso de uma GPU para data center?

As placas GeForce GTX 10xx e posteriores são totalmente compatíveis — não é necessária nenhuma GPU para data center. O limite prático para a maioria dos usuários é a quantidade de VRAM: uma placa com 8 GB executa confortavelmente modelos de 7–8 bilhões de parâmetros na quantização Q4. Use o Calculadora de VRAM para verificar se um modelo específico cabe na sua GPU antes de baixá-lo.

Minha GPU tem VRAM suficiente, mas o Ollama ainda usa a CPU. Por quê?

Outro processo pode estar ocupando a VRAM — verifique o nvidia-smi para identificar outros consumidores, como um navegador com aceleração por hardware ou outro modelo em execução. É possível também que o modelo tenha sido carregado antes de o driver da GPU ficar pronto. Interrompa o modelo carregado com ollama stop <nome>, libere a VRAM em outros aplicativos e recarregue o modelo.

Onde posso saber mais sobre como configurar o Ollama e escolher modelos?

O Guia completo do Ollama aborda em profundidade variáveis de ambiente, gerenciamento de modelos e uso da API. Para saber qual modelo executar no seu hardware específico, consulte o melhores modelos locais para Ollama.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de desempenho por preço e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de hospedagem local. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top
Featured on There's An AI For That