Tuesday, 1 September 2026 | Updating Daily AI insight, written for builders

Ollama no Windows: Guia de instalação e instruções de configuração

Resumo rápido:

  • Baixe o instalador oficial em ollama.com/download, execute-o e o Ollama será instalado como um serviço em segundo plano
  • Requer Windows 10 ou superior e, no mínimo, 8 GB de RAM; GPUs NVIDIA/AMD são detectadas automaticamente para aceleração
  • Execute modelos com ollama run <modelo> no Prompt de Comando ou PowerShell — nenhuma configuração adicional é necessária
  • Os modelos são instalados, por padrão, em %USERPROFILE%\.ollama\models — é possível alterar esse caminho usando a variável de ambiente OLLAMA_MODELS OLLAMA_MODELS

O Ollama no Windows é um aplicativo nativo que executa modelos de linguagem grandes localmente, sem Docker nem WSL2. O instalador para Windows configura o Ollama como um serviço do sistema que inicia automaticamente e fornece aceleração por GPU por meio de DirectML e CUDA. A instalação leva menos de dois minutos, e você pode executar modelos como Llama 3.3 70B ou Mistral 7B imediatamente pela linha de comando.

Requisitos do sistema para Ollama no Windows

O Ollama requer Windows 10 (compilação 1903 ou posterior) ou Windows 11. As especificações mínimas de hardware são:

Componente Mínimo Recomendado
Sistema operacional Windows 10 (1903+) Windows 11
RAM 8 GB 16 GB ou mais
Espaço em disco 10 GB livres 50+ GB para vários modelos
GPU (opcional) NVIDIA GTX 1050 ou equivalente AMD NVIDIA RTX 3060 12 GB ou superior

A aceleração por GPU funciona com GPUs NVIDIA (CUDA 11.8 ou posterior) e GPUs AMD recentes (via ROCm no Windows). O instalador inclui as bibliotecas necessárias para GPU; você não precisa instalar o CUDA separadamente. Sem GPU, o Ollama recorre à inferência por CPU, que é 5–10 vezes mais lenta, mas funcional para modelos menores.

O tamanho do modelo determina os requisitos reais de RAM ou VRAM. Por exemplo, Mistral 7B requer aproximadamente 4,5 GB de VRAM em quantização de 4 bits, enquanto o Llama 3.3 70B exige cerca de 40 GB. Consulte a Calculadora de VRAM página de detalhes do modelo no Hugging Face ou no site oficial do Ollama

Instalando o Ollama no Windows

O instalador oficial para Windows é um único executável que gerencia todas as dependências:

  1. Baixar OllamaSetup.exe de ollama.com/download
  2. Execute o instalador — privilégios de administrador são necessários
  3. Aceite a licença e clique em Instalar (o local padrão é C:\Program Files\Ollama)
  4. O instalador conclui em 30–60 segundos e inicia automaticamente o serviço Ollama

Após a instalação, abra o Prompt de Comando ou o PowerShell e verifique com:

ollama --version

Você deverá ver uma saída como ollama version 0.x.x. O serviço Ollama roda em segundo plano — você verá um ícone do Ollama na área de notificação quando estiver ativo.

Suporte e detecção de GPU

O Ollama detecta e usa automaticamente as GPUs disponíveis no Windows. Para confirmar se a aceleração por GPU está funcionando:

ollama run llama3.3:70b "test"

Enquanto o modelo é carregado, observe o Gerenciador de Tarefas (guia Desempenho). Se a utilização da GPU aparecer sob GPU 0 ou GPU 1, a aceleração está ativa. Na primeira execução, o modelo é baixado (5–40 GB, conforme o tamanho) para %USERPROFILE%\.ollama\models%USERPROFILE%\.ollama\models

Usuários de NVIDIA com GPUs RTX 3060 ou mais recentes obtêm o melhor desempenho graças aos 12+ GB de VRAM e às otimizações das arquiteturas Ampere/Ada. O suporte a GPUs AMD no Windows está melhorando, mas ainda fica atrás da NVIDIA — espere uma inferência 20–30% mais lenta em hardware AMD equivalente. GPUs Intel Arc não são oficialmente suportadas até setembro de 2026.

Se o Ollama não detectar sua GPU, verifique se seus drivers estão atualizados (NVIDIA: 537.13 ou posterior; AMD: Adrenalin 23.11 ou posterior). As mensagens de erro do Ollama normalmente indicam se a GPU foi ignorada devido à VRAM insuficiente ou drivers ausentes.

Executando seu primeiro modelo

O ollama run o comando faz o download, carrega e inicia uma sessão interativa com um modelo:

ollama run phi4

baixa, carrega e inicia uma sessão interativa com um modelo: isso baixa o Phi-4 (aproximadamente 9 GB de VRAM com quantização de 4 bits) e abre um prompt de chat. Digite sua pergunta, pressione Enter e o modelo responderá localmente. Saia com /bye Ctrl+D

Modelos comuns para testar em hardware Windows:

Modelo VRAM (4 bits) Melhor Para
Mistral 7B ~4,5 GB Tarefas gerais, respostas rápidas
Llama 3.1 8B ~5 GB Qualidade e velocidade equilibradas
Phi-4 ~9 GB Raciocínio e tamanho compacto
Llama 3.3 70B ~40 GB GPUs de alta performance, melhor qualidade

Navegue pelos modelos disponíveis em Lista de modelos do Ollama ou pesquise na biblioteca com ollama list após baixar pelo menos um modelo.

Configuração e variáveis de ambiente

O Ollama lê a configuração a partir das variáveis de ambiente do Windows. Defina-as em Propriedades do Sistema → Variáveis de Ambiente ou no PowerShell com $env:VARIABLE_NAME.

Principais variáveis:

  • OLLAMA_MODELS: Diretório para armazenamento de modelos (padrão: %USERPROFILE%\.ollama\models). Altere isso se sua unidade C: tiver espaço limitado.
  • OLLAMA_HOST: Endereço do servidor (padrão: 127.0.0.1:11434). Defina como 0.0.0.0:11434 para aceitar conexões de rede.
  • OLLAMA_NUM_PARALLEL: Número de requisições simultâneas (padrão: 1). Aumente esse valor se estiver atendendo múltiplos clientes.
  • OLLAMA_MAX_LOADED_MODELS: Número de modelos mantidos na VRAM (padrão: 1). Defina como 2 ou mais se você tiver 24 GB ou mais de VRAM e desejar alternância instantânea entre modelos.

Após alterar as variáveis de ambiente, reinicie o serviço Ollama por meio do Gerenciador de Serviços (Win+R, digite services.msc, localize o serviço Ollama, clique com o botão direito e selecione Reiniciar) ou reinicie o computador.

Para mover modelos para uma unidade diferente, defina OLLAMA_MODELS e reinicie o serviço. Os modelos existentes precisam ser baixados novamente — o Ollama não migra automaticamente os modelos já instalados.

Ajuste de desempenho

A velocidade de inferência depende da VRAM disponível, do tamanho do modelo e do nível de quantização. Um modelo de 7B de parâmetros com quantização de 4 bits gera entre 30 e 60 tokens por segundo em uma RTX 3060, enquanto modelos de 70B caem para 3–8 tokens por segundo, a menos que você tenha 48 GB ou mais de VRAM distribuídos entre várias GPUs.

Configurações com múltiplas GPUs funcionam automaticamente — o Ollama distribui as camadas do modelo pelas GPUs detectadas. Por exemplo, duas RTX 3090 (24 GB cada) conseguem executar o Llama 3.3 70B com velocidade aceitável, enquanto uma única RTX 3090 teria de descarregar camadas para a memória RAM do sistema, resultando em desempenho muito lento.

Se o desempenho for mais lento que o esperado:

  • Verifique o Gerenciador de Tarefas durante a inferência — uso da CPU acima de 30% indica que parte do modelo está na memória RAM do sistema devido à VRAM insuficiente
  • Experimente uma quantização menor (por exemplo, ollama pull mistral:7b-instruct-q4_K_M em vez da quantização padrão Q8)
  • Feche outros aplicativos que utilizam a GPU (navegadores com aceleração por hardware, jogos, editores de vídeo)
  • Atualize os drivers da GPU — versões mais recentes dos drivers NVIDIA melhoram a velocidade de inferência em 5–10% em comparação com versões anteriores de seis meses

Para atualizações de hardware, consulte o melhores GPUs para LLMs locais guia de comparação de custo-benefício entre opções da NVIDIA e da AMD.

Integração com aplicações

O Ollama expõe uma API REST em localhost:11434 compatível com a estrutura da API da OpenAI. Aplicações que suportam endpoints compatíveis com a OpenAI podem apontar para o Ollama com poucas ou nenhuma modificação.

Exemplo de comando curl para gerar texto:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Explique o Docker em uma frase"
}'

Integrações populares incluem Open WebUI (interface web), Continue.dev (extensão para VS Code) e LangChain (Python). O serviço Ollama deve estar em execução para que as chamadas à API funcionem — ele é iniciado automaticamente ao ligar o computador por padrão.

Perguntas frequentes

O Ollama exige WSL2 ou Docker no Windows?

Não. O instalador para Windows é um aplicativo nativo que executa o Ollama como um serviço do Windows, sem virtualização nem contêineres. Versões anteriores exigiam Docker, mas a versão nativa para Windows eliminou essa dependência no final de 2024. Se você instalou o Ollama antes de novembro de 2024, desinstale a versão baseada em Docker e baixe o instalador nativo atual.

Posso usar o Ollama offline após baixar os modelos?

Sim. Assim que um modelo for baixado com ollama pull <modelo>, ele será armazenado localmente e executado sem necessidade de acesso à internet. O único requisito de rede é o download inicial — os modelos variam de 2 GB (modelos pequenos de 7B) a mais de 80 GB (modelos grandes de 70B ou superiores). Após o download, desconecte-se da rede e o Ollama continuará funcionando normalmente.

Quanto custa executar modelos Ollama em comparação com APIs?

O Ollama é gratuito — você paga apenas pelo hardware e pela energia elétrica. Compare isso com os custos das APIs: Claude Sonnet 5 cobra US$ 2,00 por milhão de tokens de entrada, portanto 10 milhões de tokens (cerca de 7,5 milhões de palavras) custam US$ 20. Uma configuração auto-hospedada torna-se economicamente vantajosa rapidamente se você processar volumes significativos. Use a calculadora de autohospedagem versus API calculadora de retorno sobre investimento para estimar seu ponto de equilíbrio com base no volume esperado de uso.

Quais modelos funcionam melhor em GPUs voltadas ao consumidor?

Para GPUs com 8–12 GB de VRAM (RTX 3060, 4060 Ti), modelos como Mistral 7B (~4,5 GB com quantização de 4 bits), Llama 3.1 8B (~5 GB) e Phi-4 (~9 GB) oferecem excelente relação entre qualidade e desempenho. Se você dispuser de 16–24 GB de VRAM (RTX 3090, 4090), modelos como Mistral NeMo 12B (~7,5 GB) e até mesmo o Llama 3.3 70B (~40 GB com quantização agressiva ou descarregamento para RAM) tornam-se viáveis. Consulte Requisitos de VRAM por modelo para obter uma lista completa.

O Ollama pode usar simultaneamente GPUs NVIDIA e AMD?

Não. O Ollama utiliza ou CUDA (NVIDIA) ou ROCm (AMD), dependendo do que detecta primeiro, mas não é possível misturar backends de GPU em uma única sessão. Se você possui tanto GPUs NVIDIA quanto AMD, o Ollama prioriza as NVIDIA. O suporte a múltiplas GPUs funciona apenas quando todas as GPUs usam a mesma pilha de drivers — duas placas NVIDIA ou duas placas AMD, não uma de cada.

Como faço para desinstalar o Ollama no Windows?

Abra Configurações → Aplicativos → Aplicativos Instalados, localize o Ollama e clique em Desinstalar. Isso remove o aplicativo e o serviço, mas mantém os modelos na pasta %USERPROFILE%.ollama. Exclua essa pasta manualmente para recuperar espaço em disco. Caso o serviço não seja encerrado durante a desinstalação, abra o Gerenciador de Tarefas, localize o processo OllamaService.exe em Processos em Segundo Plano e finalize-o antes de tentar novamente.

Próximos passos

Após instalar o Ollama no Windows, explore a biblioteca completa de modelos em Guia completo do Ollama para entender como a escolha do modelo, a quantização e a janela de contexto afetam a qualidade. Para cargas de trabalho em produção, calcule os custos contínuos das APIs em comparação com a hospedagem local usando a Calculadora de custos de API calculadora de retorno sobre investimento para determinar se a inferência local ou as APIs em nuvem atendem melhor às suas necessidades orçamentárias e de escala.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de desempenho por preço e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de hospedagem local. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top