Tuesday, 29 September 2026 | Updating Daily AI insight, written for builders

Ollama Não Está Usando a GPU: Diagnóstico e Correção do Uso Forçado da CPU

Atualizado · Originally published August 14, 2026
  • Executar ollama ps enquanto um modelo estiver carregado — a coluna PROCESSOR indica se o Ollama está usando a GPU ou a CPU.
  • A correção mais comum em sistemas NVIDIA é instalar ou atualizar o driver do host para que nvidia-smi reconheça a placa, seguido de uma reinicialização do serviço Ollama.
  • Se o modelo for maior do que sua VRAM, o Ollama descarrega camadas para a CPU — use o Calculadora de VRAM para verificar se seu modelo cabe na VRAM antes de baixá-lo.
  • AMD, Docker e WSL2 exigem etapas específicas por plataforma, detalhadas abaixo.

Quando o Ollama não está utilizando sua GPU, a causa mais comum é um driver ausente ou incompatível. Execute ollama ps — se a coluna PROCESSOR mostrar 100% CPU, o Ollama recorreu inteiramente à CPU. A solução depende da sua plataforma: sistemas NVIDIA exigem o runtime CUDA correto, AMD requer o ROCm e Docker necessita de flags explícitas de passagem de GPU.

Etapa 1: Confirme se o Ollama Está Realmente Usando a GPU

Antes de realizar qualquer alteração, verifique o que o Ollama está realmente fazendo. Carregue um modelo e, enquanto ele estiver em execução, abra um segundo terminal:

ollama ps

Exemplo de saída:

NOME              ID              TAMANHO   PROCESSOR    ATÉ
llama3.2:8b       abc123def456    5,0 GB    100% GPU     Daqui a 4 minutos

A coluna PROCESSOR é o indicador definitivo:

Valor da coluna PROCESSOR Significado
100% GPU Todas as camadas na GPU — comportamento esperado e correto
XX% GPU / YY% CPU O modelo cabe parcialmente na VRAM; as camadas restantes são executadas na CPU
100% CPU Recorrência total à CPU — a GPU não está sendo utilizada de forma alguma

Em sistemas NVIDIA, confirme também com nvidia-smi durante a inferência. A coluna Memory-Usage deve aumentar à medida que o modelo é carregado. Se permanecer constante, a GPU está ociosa, independentemente do que outros utilitários possam indicar.

Etapa 2: NVIDIA — Drivers e Runtime CUDA

Um driver NVIDIA ausente ou desatualizado é a causa mais comum de recorrência total à CPU. O Ollama inclui suas próprias bibliotecas CUDA, mas ainda exige um driver do sistema hospedeiro compatível com CUDA 11.3 ou posterior.

Verifique primeiro o driver

nvidia-smi

Se o comando não for encontrado, nenhum driver está instalado. Se for executado, anote a versão do driver e a versão do CUDA no cabeçalho. A versão do CUDA exibida corresponde à versão máxima suportada pelo driver — isso não significa que um toolkit CUDA separado esteja instalado, e o Ollama não o requer.

Plataforma Versão mínima do driver
Linux 525.xx (suporta CUDA 12.0)
Windows nativo 527.xx (suporta CUDA 12.0)
WSL2 (host Windows) 525.xx no lado Windows — não instale o driver NVIDIA Linux dentro do WSL2

Instale ou atualize o driver

Ubuntu/Debian:

sudo apt install nvidia-driver-550
sudo reboot

Windows: Baixe do site nvidia.com/Download ou use o GeForce Experience e, em seguida, reinicie o sistema. Uma reinicialização completa — e não apenas uma reinicialização do serviço — é obrigatória após a instalação ou atualização do driver.

Após a reinicialização, confirme que nvidia-smi reconhece sua placa e reinicie o Ollama:

# Linux (systemd)
sudo systemctl restart ollama

# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama

# Windows — reinicie o aplicativo Ollama na área de notificação ou reinicie o sistema

Execute um modelo e verifique novamente ollama ps . Se a coluna PROCESSOR ainda mostrar 100% CPU, prossiga para as próximas etapas.

Etapa 3: Modelo Muito Grande para a VRAM

Quando os pesos de um modelo excedem a VRAM disponível, o Ollama não recusa sua execução — ele divide a inferência. Tantas camadas do transformador quanto possível são enviadas para a GPU; as demais são executadas na CPU. Isso aparece como uma porcentagem dividida em ollama ps e constitui um comportamento intencional, não um erro.

Um modelo de 70 bilhões de parâmetros com quantização Q4_K_M geralmente requer cerca de 40 GB de VRAM, o que supera qualquer GPU voltada ao consumidor. Antes de baixar um modelo grande, verifique se ele cabe na sua VRAM usando o Calculadora de VRAM. Para valores específicos por modelo entre os LLMs mais populares, consulte Requisitos de VRAM para todos os principais modelos de linguagem (LLM).

Se o modelo não couber na sua VRAM, suas opções são:

  • Utilize uma quantização inferior (por exemplo, Q2_K ou Q3_K_S) — reduz o uso de VRAM com um pequeno impacto na qualidade.
  • Mude para uma variante menor do modelo (por exemplo, 8B em vez de 70B). A página melhores modelos locais para Ollama explica quais modelos funcionam bem em hardware voltado ao consumidor.
  • Aceite a descarga parcial — o desempenho ficará entre os valores obtidos com GPU completa e CPU completa.
  • Atualize sua GPU. O guia melhores GPUs para LLMs locais compara as opções atuais com base na capacidade de VRAM e preço.

Etapa 4: GPU AMD e ROCm

O suporte à AMD no Ollama é baseado no ROCm, a plataforma de computação GPU da AMD. O Ollama oferece suporte oficial às placas RDNA 2 (série RX 6000) e RDNA 3 (série RX 7000) no Linux. O suporte à AMD no Windows é limitado — verifique as notas de versão do seu Ollama instalado antes de esperar que ele funcione no Windows.

Verifique se o ROCm detecta a placa

rocm-smi

Se rocm-smi não for encontrado, a pilha ROCm não está instalada. Consulte amd.com/pt-br/developer/rocm para obter as instruções atuais de instalação compatíveis com sua distribuição, pois os nomes dos pacotes e os requisitos de versão mudam entre as versões do ROCm.

Se a placa estiver ausente na saída de rocm-smi após a instalação:

sudo usermod -aG render,video $USER
# Faça logout e login novamente para que a alteração nos grupos entre em vigor

Para direcionar uma GPU específica quando várias estiverem presentes:

HIP_VISIBLE_DEVICES=0 ollama serve

Etapa 5: Docker — Falta de Passagem de GPU

Contêineres Docker não têm acesso à GPU a menos que você a passe explicitamente ao contêiner. Esse é o motivo mais comum pelo qual o Ollama recai na CPU em implantações baseadas em contêineres — a GPU do host está funcionando normalmente, mas o contêiner não consegue vê-la.

NVIDIA no Docker

Instale a NVIDIA Container Toolkit no host:

sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Em seguida, passe a GPU ao iniciar o contêiner:

docker run -d --gpus all 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama

Sem a opção --gpus all (ou --gpus device=0 (para uma placa específica), o contêiner não terá acesso à GPU, independentemente da configuração do host.

AMD no Docker

docker run -d 
  --device /dev/kfd --device /dev/dri 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama:rocm

O :rocm a tag da imagem é obrigatória. A imagem padrão ollama/ollama não inclui o ROCm e recairá na CPU em hardware AMD.

Etapa 6: WSL2 no Windows

O WSL2 pode compartilhar a GPU NVIDIA com o host Windows, mas há uma regra absoluta: o driver NVIDIA deve ser instalado no WindowsWindows

  • atualize ou instale o driver NVIDIA no Windows e reinicie o sistema.
  • O WSL2 exige kernel 5.10.43 ou posterior. Verifique com uname -r dentro do WSL2; atualize com wsl --update em um terminal do Windows.
  • O toolkit CUDA pode ser instalado dentro do WSL2, caso seu fluxo de trabalho exija — isso é independente do driver e não causa conflitos.

Verifique a visibilidade da GPU dentro do WSL2:

nvidia-smi

Se esse comando exibir sua placa, o Ollama executado dentro do WSL2 a utilizará automaticamente. Caso falhe, atualize o driver do lado do Windows e execute novamente wsl --update.

macOS — Metal (Apple Silicon e AMD)

No macOS, o Ollama usa a tecnologia Apple Metal para aceleração por GPU — nenhum driver precisa ser instalado e nenhuma variável de ambiente precisa ser configurada. Se você estiver usando um Mac com chip Apple Silicon e o Ollama estiver executando lentamente, confirme se instalou a versão nativa ARM do site ollama.com, e não a versão x86 executada sob o Rosetta. Os Macs com Apple Silicon usam memória unificada, portanto toda a RAM do sistema está disponível para os modelos — insira a quantidade total de RAM como limite de VRAM ao usar a Calculadora de VRAM.

Verificação da Correção e Taxa de Processamento Esperada

Após realizar alterações, execute um modelo e verifique simultaneamente dois indicadores:

# Terminal 1 — inicie uma geração
ollama run llama3.2:8b "Qual é a capital da França?"

# Terminal 2 — enquanto a geração estiver em andamento
ollama ps

# NVIDIA: observe também a utilização da GPU por segundo
nvidia-smi dmon -s u

Taxa de transferência de referência (aproximada — varia conforme a quantização, versão do driver e largura de banda PCIe):

Hardware Modelo ~tok/s
RTX 4090 (24 GB) Llama 3.1 8B Q4 120–160
RTX 3080 (10 GB) Llama 3.1 8B Q4 60–80
Apple M3 Pro (memória unificada) Llama 3.1 8B Q4 40–60
Apenas CPU (Ryzen 9 7950X) Llama 3.1 8B Q4 5–15

Uma taxa de poucos tokens por segundo mesmo com uma GPU capaz presente é o sinal mais claro de que a correção não surtiu efeito.

Perguntas frequentes

Por que o ollama ps mostra uma divisão GPU/CPU em vez de 100% GPU?

O modelo é maior do que a VRAM disponível. O Ollama aloca o máximo possível de camadas na GPU e executa o restante na CPU. O resultado é mais rápido do que a execução totalmente na CPU, mas mais lento do que a execução totalmente na GPU. Carregue um modelo menor ou mude para uma quantização inferior para transferir mais camadas para a GPU.

O Ollama estava usando a GPU anteriormente e, de repente, parou — o que mudou?

Uma atualização do driver, do sistema operacional ou uma nova versão do Ollama pode interromper a detecção da GPU. Verifique se nvidia-smi ainda mostra a placa, depois reinicie completamente o serviço. Se você atualizou recentemente o driver NVIDIA, às vezes é necessário reiniciar o sistema inteiro, em vez de apenas reiniciar o serviço.

O Ollama pode usar múltiplas GPUs simultaneamente?

Sim. O Ollama distribui automaticamente as camadas do modelo entre todas as GPUs visíveis sempre que houver mais de uma presente. Para restringir quais GPUs o Ollama deve usar, defina CUDA_VISIBLE_DEVICES (NVIDIA) ou HIP_VISIBLE_DEVICES (AMD) antes de iniciar ollama serve.

O Ollama funciona com placas GeForce voltadas para consumidores ou preciso de uma GPU para data center?

As placas GeForce GTX 10xx e posteriores são totalmente compatíveis — não é necessária nenhuma GPU para data center. O limite prático para a maioria dos usuários é a quantidade de VRAM: uma placa com 8 GB executa confortavelmente modelos de 7–8 bilhões de parâmetros na quantização Q4. Use o Calculadora de VRAM para verificar se um modelo específico cabe na sua GPU antes de baixá-lo.

Minha GPU tem VRAM suficiente, mas o Ollama ainda usa a CPU. Por quê?

Outro processo pode estar ocupando a VRAM — verifique o nvidia-smi para identificar outros consumidores, como um navegador com aceleração por hardware ou outro modelo em execução. É possível também que o modelo tenha sido carregado antes de o driver da GPU ficar pronto. Interrompa o modelo carregado com ollama stop <nome>, libere a VRAM em outros aplicativos e recarregue o modelo.

Onde posso saber mais sobre como configurar o Ollama e escolher modelos?

O Guia completo do Ollama aborda em profundidade variáveis de ambiente, gerenciamento de modelos e uso da API. Para saber qual modelo executar no seu hardware específico, consulte o melhores modelos locais para Ollama.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de desempenho por preço e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de hospedagem local. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top