- Executar
ollama psenquanto um modelo estiver carregado — a coluna PROCESSOR indica se o Ollama está usando a GPU ou a CPU. - A correção mais comum em sistemas NVIDIA é instalar ou atualizar o driver do host para que
nvidia-smireconheça a placa, seguido de uma reinicialização do serviço Ollama. - Se o modelo for maior do que sua VRAM, o Ollama descarrega camadas para a CPU — use o Calculadora de VRAM para verificar se seu modelo cabe na VRAM antes de baixá-lo.
- AMD, Docker e WSL2 exigem etapas específicas por plataforma, detalhadas abaixo.
Quando o Ollama não está utilizando sua GPU, a causa mais comum é um driver ausente ou incompatível. Execute ollama ps — se a coluna PROCESSOR mostrar 100% CPU, o Ollama recorreu inteiramente à CPU. A solução depende da sua plataforma: sistemas NVIDIA exigem o runtime CUDA correto, AMD requer o ROCm e Docker necessita de flags explícitas de passagem de GPU.
- Etapa 1: Confirme se o Ollama Está Realmente Usando a GPU
- Etapa 2: NVIDIA — Drivers e Runtime CUDA
- Etapa 3: Modelo Muito Grande para a VRAM
- Etapa 4: GPU AMD e ROCm
- Etapa 5: Docker — Falta de Passagem de GPU
- Etapa 6: WSL2 no Windows
- macOS — Metal (Apple Silicon e AMD)
- Verificação da Correção e Taxa de Processamento Esperada
- Perguntas frequentes
Etapa 1: Confirme se o Ollama Está Realmente Usando a GPU
Antes de realizar qualquer alteração, verifique o que o Ollama está realmente fazendo. Carregue um modelo e, enquanto ele estiver em execução, abra um segundo terminal:
ollama psExemplo de saída:
NOME ID TAMANHO PROCESSOR ATÉ
llama3.2:8b abc123def456 5,0 GB 100% GPU Daqui a 4 minutosA coluna PROCESSOR é o indicador definitivo:
| Valor da coluna PROCESSOR | Significado |
|---|---|
| 100% GPU | Todas as camadas na GPU — comportamento esperado e correto |
| XX% GPU / YY% CPU | O modelo cabe parcialmente na VRAM; as camadas restantes são executadas na CPU |
| 100% CPU | Recorrência total à CPU — a GPU não está sendo utilizada de forma alguma |
Em sistemas NVIDIA, confirme também com nvidia-smi durante a inferência. A coluna Memory-Usage deve aumentar à medida que o modelo é carregado. Se permanecer constante, a GPU está ociosa, independentemente do que outros utilitários possam indicar.
Etapa 2: NVIDIA — Drivers e Runtime CUDA
Um driver NVIDIA ausente ou desatualizado é a causa mais comum de recorrência total à CPU. O Ollama inclui suas próprias bibliotecas CUDA, mas ainda exige um driver do sistema hospedeiro compatível com CUDA 11.3 ou posterior.
Verifique primeiro o driver
nvidia-smiSe o comando não for encontrado, nenhum driver está instalado. Se for executado, anote a versão do driver e a versão do CUDA no cabeçalho. A versão do CUDA exibida corresponde à versão máxima suportada pelo driver — isso não significa que um toolkit CUDA separado esteja instalado, e o Ollama não o requer.
| Plataforma | Versão mínima do driver |
|---|---|
| Linux | 525.xx (suporta CUDA 12.0) |
| Windows nativo | 527.xx (suporta CUDA 12.0) |
| WSL2 (host Windows) | 525.xx no lado Windows — não instale o driver NVIDIA Linux dentro do WSL2 |
Instale ou atualize o driver
Ubuntu/Debian:
sudo apt install nvidia-driver-550
sudo rebootWindows: Baixe do site nvidia.com/Download ou use o GeForce Experience e, em seguida, reinicie o sistema. Uma reinicialização completa — e não apenas uma reinicialização do serviço — é obrigatória após a instalação ou atualização do driver.
Após a reinicialização, confirme que nvidia-smi reconhece sua placa e reinicie o Ollama:
# Linux (systemd)
sudo systemctl restart ollama
# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama
# Windows — reinicie o aplicativo Ollama na área de notificação ou reinicie o sistemaExecute um modelo e verifique novamente ollama ps . Se a coluna PROCESSOR ainda mostrar 100% CPU, prossiga para as próximas etapas.
Etapa 3: Modelo Muito Grande para a VRAM
Quando os pesos de um modelo excedem a VRAM disponível, o Ollama não recusa sua execução — ele divide a inferência. Tantas camadas do transformador quanto possível são enviadas para a GPU; as demais são executadas na CPU. Isso aparece como uma porcentagem dividida em ollama ps e constitui um comportamento intencional, não um erro.
Um modelo de 70 bilhões de parâmetros com quantização Q4_K_M geralmente requer cerca de 40 GB de VRAM, o que supera qualquer GPU voltada ao consumidor. Antes de baixar um modelo grande, verifique se ele cabe na sua VRAM usando o Calculadora de VRAM. Para valores específicos por modelo entre os LLMs mais populares, consulte Requisitos de VRAM para todos os principais modelos de linguagem (LLM).
Se o modelo não couber na sua VRAM, suas opções são:
- Utilize uma quantização inferior (por exemplo, Q2_K ou Q3_K_S) — reduz o uso de VRAM com um pequeno impacto na qualidade.
- Mude para uma variante menor do modelo (por exemplo, 8B em vez de 70B). A página melhores modelos locais para Ollama explica quais modelos funcionam bem em hardware voltado ao consumidor.
- Aceite a descarga parcial — o desempenho ficará entre os valores obtidos com GPU completa e CPU completa.
- Atualize sua GPU. O guia melhores GPUs para LLMs locais compara as opções atuais com base na capacidade de VRAM e preço.
Etapa 4: GPU AMD e ROCm
O suporte à AMD no Ollama é baseado no ROCm, a plataforma de computação GPU da AMD. O Ollama oferece suporte oficial às placas RDNA 2 (série RX 6000) e RDNA 3 (série RX 7000) no Linux. O suporte à AMD no Windows é limitado — verifique as notas de versão do seu Ollama instalado antes de esperar que ele funcione no Windows.
Verifique se o ROCm detecta a placa
rocm-smiSe rocm-smi não for encontrado, a pilha ROCm não está instalada. Consulte amd.com/pt-br/developer/rocm para obter as instruções atuais de instalação compatíveis com sua distribuição, pois os nomes dos pacotes e os requisitos de versão mudam entre as versões do ROCm.
Se a placa estiver ausente na saída de rocm-smi após a instalação:
sudo usermod -aG render,video $USER
# Faça logout e login novamente para que a alteração nos grupos entre em vigorPara direcionar uma GPU específica quando várias estiverem presentes:
HIP_VISIBLE_DEVICES=0 ollama serveEtapa 5: Docker — Falta de Passagem de GPU
Contêineres Docker não têm acesso à GPU a menos que você a passe explicitamente ao contêiner. Esse é o motivo mais comum pelo qual o Ollama recai na CPU em implantações baseadas em contêineres — a GPU do host está funcionando normalmente, mas o contêiner não consegue vê-la.
NVIDIA no Docker
Instale a NVIDIA Container Toolkit no host:
sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart dockerEm seguida, passe a GPU ao iniciar o contêiner:
docker run -d --gpus all
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollamaSem a opção --gpus all (ou --gpus device=0 (para uma placa específica), o contêiner não terá acesso à GPU, independentemente da configuração do host.
AMD no Docker
docker run -d
--device /dev/kfd --device /dev/dri
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollama:rocmO :rocm a tag da imagem é obrigatória. A imagem padrão ollama/ollama não inclui o ROCm e recairá na CPU em hardware AMD.
Etapa 6: WSL2 no Windows
O WSL2 pode compartilhar a GPU NVIDIA com o host Windows, mas há uma regra absoluta: o driver NVIDIA deve ser instalado no WindowsWindows
- atualize ou instale o driver NVIDIA no Windows e reinicie o sistema.
- O WSL2 exige kernel 5.10.43 ou posterior. Verifique com
uname -rdentro do WSL2; atualize comwsl --updateem um terminal do Windows. - O toolkit CUDA pode ser instalado dentro do WSL2, caso seu fluxo de trabalho exija — isso é independente do driver e não causa conflitos.
Verifique a visibilidade da GPU dentro do WSL2:
nvidia-smiSe esse comando exibir sua placa, o Ollama executado dentro do WSL2 a utilizará automaticamente. Caso falhe, atualize o driver do lado do Windows e execute novamente wsl --update.
macOS — Metal (Apple Silicon e AMD)
No macOS, o Ollama usa a tecnologia Apple Metal para aceleração por GPU — nenhum driver precisa ser instalado e nenhuma variável de ambiente precisa ser configurada. Se você estiver usando um Mac com chip Apple Silicon e o Ollama estiver executando lentamente, confirme se instalou a versão nativa ARM do site ollama.com, e não a versão x86 executada sob o Rosetta. Os Macs com Apple Silicon usam memória unificada, portanto toda a RAM do sistema está disponível para os modelos — insira a quantidade total de RAM como limite de VRAM ao usar a Calculadora de VRAM.
Verificação da Correção e Taxa de Processamento Esperada
Após realizar alterações, execute um modelo e verifique simultaneamente dois indicadores:
# Terminal 1 — inicie uma geração
ollama run llama3.2:8b "Qual é a capital da França?"
# Terminal 2 — enquanto a geração estiver em andamento
ollama ps
# NVIDIA: observe também a utilização da GPU por segundo
nvidia-smi dmon -s uTaxa de transferência de referência (aproximada — varia conforme a quantização, versão do driver e largura de banda PCIe):
| Hardware | Modelo | ~tok/s |
|---|---|---|
| RTX 4090 (24 GB) | Llama 3.1 8B Q4 | 120–160 |
| RTX 3080 (10 GB) | Llama 3.1 8B Q4 | 60–80 |
| Apple M3 Pro (memória unificada) | Llama 3.1 8B Q4 | 40–60 |
| Apenas CPU (Ryzen 9 7950X) | Llama 3.1 8B Q4 | 5–15 |
Uma taxa de poucos tokens por segundo mesmo com uma GPU capaz presente é o sinal mais claro de que a correção não surtiu efeito.
Perguntas frequentes
Por que o ollama ps mostra uma divisão GPU/CPU em vez de 100% GPU?
O modelo é maior do que a VRAM disponível. O Ollama aloca o máximo possível de camadas na GPU e executa o restante na CPU. O resultado é mais rápido do que a execução totalmente na CPU, mas mais lento do que a execução totalmente na GPU. Carregue um modelo menor ou mude para uma quantização inferior para transferir mais camadas para a GPU.
O Ollama estava usando a GPU anteriormente e, de repente, parou — o que mudou?
Uma atualização do driver, do sistema operacional ou uma nova versão do Ollama pode interromper a detecção da GPU. Verifique se nvidia-smi ainda mostra a placa, depois reinicie completamente o serviço. Se você atualizou recentemente o driver NVIDIA, às vezes é necessário reiniciar o sistema inteiro, em vez de apenas reiniciar o serviço.
O Ollama pode usar múltiplas GPUs simultaneamente?
Sim. O Ollama distribui automaticamente as camadas do modelo entre todas as GPUs visíveis sempre que houver mais de uma presente. Para restringir quais GPUs o Ollama deve usar, defina CUDA_VISIBLE_DEVICES (NVIDIA) ou HIP_VISIBLE_DEVICES (AMD) antes de iniciar ollama serve.
O Ollama funciona com placas GeForce voltadas para consumidores ou preciso de uma GPU para data center?
As placas GeForce GTX 10xx e posteriores são totalmente compatíveis — não é necessária nenhuma GPU para data center. O limite prático para a maioria dos usuários é a quantidade de VRAM: uma placa com 8 GB executa confortavelmente modelos de 7–8 bilhões de parâmetros na quantização Q4. Use o Calculadora de VRAM para verificar se um modelo específico cabe na sua GPU antes de baixá-lo.
Minha GPU tem VRAM suficiente, mas o Ollama ainda usa a CPU. Por quê?
Outro processo pode estar ocupando a VRAM — verifique o nvidia-smi para identificar outros consumidores, como um navegador com aceleração por hardware ou outro modelo em execução. É possível também que o modelo tenha sido carregado antes de o driver da GPU ficar pronto. Interrompa o modelo carregado com ollama stop <nome>, libere a VRAM em outros aplicativos e recarregue o modelo.
Onde posso saber mais sobre como configurar o Ollama e escolher modelos?
O Guia completo do Ollama aborda em profundidade variáveis de ambiente, gerenciamento de modelos e uso da API. Para saber qual modelo executar no seu hardware específico, consulte o melhores modelos locais para Ollama.

