Instalar o Ollama é realmente uma tarefa de dois minutos em todos os principais sistemas operacionais. Este guia fornece os passos exatos para Mac, Windows e Linux, mostra como executar seu primeiro modelo e aborda os poucos erros com os quais os usuários realmente se deparam.
Novo no uso dessa ferramenta? Comece com o que é o Ollama e como ele funciona, depois volte aqui para instalá-lo.
- Quick answer: How do you install Ollama?
- Antes de instalar: seu computador é capaz de executá-lo?
- Instalar no macOS
- Instalar no Windows
- Instalar no Linux
- Execute seu primeiro modelo
- Verifique se a API está em execução
- Problemas comuns de instalação e soluções
- Configure o Ollama após a instalação: armazenamento, memória e interface gráfica
- Perguntas frequentes
- Conclusão
- Artigos relacionados
Quick answer: How do you install Ollama?
Installing Ollama is a download-and-run process that takes around two minutes on every major operating system. On macOS, download the app from ollama.com or run brew install ollama; on Windows, run the official installer, which is native and needs no WSL; on Linux, run the one-liner curl -fsSL https://ollama.com/install.sh | sh. Then pull and run your first model with ollama run gemma4, and confirm it works when the local API answers at http://localhost:11434.
- macOS: download the app from ollama.com or run
brew install ollama. - Windows: run the official
.exeinstaller — native, no WSL required — then checkollama --version. - Linux: um único comando —
curl -fsSL https://ollama.com/install.sh | sh. - First model to run:
ollama run gemma4downloads and runs a strong all-rounder in a single command. - RAM you need: roughly as much free RAM (or VRAM) as the quantized model size — around 4–5 GB for a 7B model and about 8 GB for a 13B model.
Principais conclusões
- Mac: baixe o aplicativo em ollama.com ou
brew install ollama. - Windows: baixe e execute o instalador oficial — nativo, sem necessidade de WSL.
- Linux: um único comando —
curl -fsSL https://ollama.com/install.sh | sh. - Primeiro modelo:
ollama run gemma4faz o download e executa um modelo versátil e potente. - Verifique se está funcionando: a API responde em
http://localhost:11434.
Antes de instalar: seu computador é capaz de executá-lo?
O próprio Ollama é pequeno, mas os modelos modelos não são. Uma regra prática rápida: você precisa de aproximadamente tanta memória RAM (ou VRAM) livre quanto o tamanho do modelo quantizado — cerca de 4–5 GB para um modelo de 7B, 8 GB para um modelo de 13B e muito mais para os modelos maiores. Se você não tem certeza do que seu hardware suporta, leia primeiro nosso guia de requisitos do sistema para o Ollama para escolher um modelo que realmente caiba na sua máquina.
Instalar no macOS
O caminho mais fácil é usar o aplicativo nativo:
- Acesse ollama.com/download e baixe o aplicativo para macOS.
- Abra o arquivo
.dmge arraste o Ollama para a pasta Aplicativos. - Inicie-o — o Ollama é executado em segundo plano e o comando
ollamatorna-se disponível no seu terminal.
Prefere a linha de comando? Use o Homebrew:
brew install ollama
Em chips Apple Silicon (M1–M5), o Ollama utiliza automaticamente a GPU por meio do backend MLX da Apple (a partir da versão v0.19), proporcionando inferência rápida sem configuração adicional.
Instalar no Windows
Ollama é executado nativamente no Windows — você não precisa mais do WSL:
- Baixe o instalador para Windows em ollama.com/download.
- Execute o arquivo
.exee siga as instruções na tela. - Abrir PowerShell ou Prompt de Comando e digite
ollama --versionpara confirmar que ele foi instalado.
Se você possui uma GPU NVIDIA, o Ollama a detecta automaticamente e usa CUDA. Nenhuma manipulação complexa dos drivers é necessária, desde que seus drivers de GPU estejam atualizados.
Instalar no Linux
Um único comando faz tudo:
curl -fsSL https://ollama.com/install.sh | sh
Isso instala o Ollama e o configura como um serviço systemd que inicia automaticamente na inicialização do sistema. Para confirmar se está em execução:
systemctl status ollama
No Ubuntu e na maioria das distribuições Linux, o instalador detecta GPUs NVIDIA e AMD e configura automaticamente o backend adequado. Para placas AMD especificamente, certifique-se de que o ROCm esteja instalado — consulte nossa análise detalhada sobre ROCm vs CUDA para saber o estado do suporte à AMD em 2026.
Execute seu primeiro modelo
Com o Ollama instalado, baixe e execute um modelo com um único comando:
ollama run gemma4
Na primeira execução, o modelo é baixado (alguns gigabytes) e, em seguida, você é direcionado para um prompt interativo de chat. Faça uma pergunta e obtenha uma resposta — inteiramente em sua máquina. Alguns comandos úteis:
ollama list— exibe os modelos que você já baixou.ollama pull qwen3— baixa um modelo sem executá-lo.ollama rm gemma4— exclui um modelo para recuperar espaço em disco.ollama ps— mostra quais modelos estão atualmente carregados na memória.
Não tem certeza de qual modelo escolher para começar? Nosso guia sobre os melhores LLMs locais no Ollama recomenda modelos conforme seu caso de uso e hardware disponível.
Verifique se a API está em execução
O Ollama expõe uma API REST na porta 11434. Para confirmar se ela está ativa, execute:
curl http://localhost:11434/api/tags
Uma resposta JSON listando seus modelos indica que tudo está funcionando corretamente. Esse endpoint é o que seus próprios aplicativos usarão — e, como o Ollama oferece uma API compatível com OpenAI, grande parte do código existente funciona apenas alterando a URL base.
Problemas comuns de instalação e soluções
- ‘ollama: comando não encontrado’ (Mac/Linux): o aplicativo foi instalado, mas não está incluído no seu
PATH. No Mac, certifique-se de ter aberto o aplicativo ao menos uma vez; no Linux, abra um novo shell após a instalação. - Os downloads de modelos são lentos ou travam: O Ollama baixa arquivos grandes; um download interrompido geralmente é retomado com sucesso ao executar novamente
ollama pull <modelo>— o processo é retomado, não reiniciado. - A GPU não está sendo utilizada: verifique o comando
ollama ps— se ele mostrar 100% de uso da CPU, seus drivers de GPU podem estar desatualizados ou o modelo pode ser muito grande para caber na VRAM, forçando seu deslocamento para a CPU. Experimente um modelo menor ou mais fortemente quantizado. - Erros de ‘memória insuficiente’: o modelo é maior do que a memória RAM/VRAM disponível. Baixe uma versão com menor quantização (procure por variantes
q4) ou um modelo de tamanho reduzido. Nossa guia de requisitos de sistema tabela de compatibilidade de modelos - mostra quais modelos cabem em quais configurações. A porta 11434 já está em uso:
ollama psoutra instância do Ollama está em execução. Interrompa-a (
Configure o Ollama após a instalação: armazenamento, memória e interface gráfica
Instalar o Ollama é a parte fácil. Algumas configurações determinam se ele permanecerá discreto ou consumirá silenciosamente seu disco rígido e RAM. Todas são variáveis de ambiente, e onde você as define depende do seu sistema operacional: no macOS, use launchctl setenv, no Linux edite o serviço com systemctl edit ollama.service e adicione uma linha Environment= e, no Windows, adicione uma variável de ambiente de usuário nas Configurações. Reinicie o Ollama após qualquer alteração para que ela entre em vigor.
As quatro mais importantes são:
- OLLAMA_MODELS — define onde os modelos são armazenados. Os modelos são grandes, e os locais padrão ficam na unidade do sistema (
~/.ollama/modelsno macOS,/usr/share/ollama/.ollama/modelsno Linux,C:\Users\<você>\.ollama\modelsno Windows). Aponte essa variável para uma unidade maior ou mais rápida antes de baixar vários modelos. No Linux, certifique-se de que o usuárioollamatenha permissão de leitura e gravação no novo diretório. - OLLAMA_KEEP_ALIVE — por quanto tempo um modelo permanece na memória após uma solicitação. O padrão é 5 minutos. Defina-a como
-1para manter o modelo carregado na memória, garantindo que o primeiro prompt nunca seja lento, ou como0para descarregá-lo imediatamente e liberar a VRAM assim que você terminar. - OLLAMA_CONTEXT_LENGTH — a janela de contexto. Por padrão, o Ollama usa um valor conservador de 4096 tokens, de modo que documentos longos são truncados silenciosamente. Aumente esse valor (por exemplo, para 8192 ou mais), caso seu modelo o suporte, e combine-o com OLLAMA_FLASH_ATTENTION=1 para reduzir o custo adicional de memória.
- OLLAMA_HOST — endereço ao qual o servidor se vincula. Por padrão, o Ollama escuta apenas em
127.0.0.1:11434, de modo que nenhum outro dispositivo em sua rede pode acessá-lo. Defina-o como0.0.0.0:11434para usar o Ollama a partir de outra máquina, de um telefone ou de um contêiner Docker.
Uma advertência importante sobre este último ponto: a API do Ollama não possui autenticação embutida. Associado a 0.0.0.0 significa que qualquer pessoa capaz de acessar a porta 11434 poderá executar modelos em seu hardware. Faça isso apenas em uma LAN confiável e coloque-o atrás de um proxy reverso ou de uma regra de firewall se a máquina estiver exposta à internet.
Por fim, a linha de comando é adequada para testes, mas tediosa para uso diário. A solução mais comum é Open WebUI, uma interface auto-hospedada, no estilo ChatGPT, que se comunica com seu Ollama local. O caminho mais rápido é usar o Docker: o contêiner atende internamente na porta 8080, portanto mapeie-a para uma porta do host com -p 3000:8080 e abra http://localhost:3000, depois aponte-a para sua instância do Ollama. Você obtém histórico de conversas, alternância entre modelos e upload de documentos — tudo executado inteiramente em sua própria máquina.
Perguntas frequentes
Como instalar o Ollama no Windows?
Baixe o instalador nativo em ollama.com/download e execute o .exe. Ollama é executado nativamente no Windows, sem necessidade de WSL, e utiliza automaticamente uma GPU NVIDIA via CUDA, caso você a possua. Confirme a instalação com ollama --version no PowerShell.
Como instalar o Ollama no Linux?
Executar curl -fsSL https://ollama.com/install.sh | sh. Isso instala o Ollama e o registra como um serviço systemd. Verifique-o com systemctl status ollama. O instalador detecta automaticamente GPUs NVIDIA e AMD.
Posso instalar o Ollama com o Homebrew?
Sim — brew install ollama Funciona no macOS. O aplicativo nativo de ollama.com é igualmente bom e inclui presença na barra de menus; a instalação via Homebrew é conveniente se você gerencia tudo pela linha de comando.
Onde o Ollama armazena os modelos?
Por padrão, no Mac e no Linux em ~/.ollama/models, e no Windows, dentro do seu perfil de usuário. Os modelos podem ter vários gigabytes cada, portanto use ollama list para acompanhar o que você baixou e ollama rm <modelo> para limpar.
O Ollama é seguro para instalar?
Sim. O Ollama é de código aberto (licença MIT) e amplamente utilizado. Aplica-se a cautela habitual ao instalador de uma linha para Linux — é o script oficial do projeto, mas, se preferir, você pode baixar e inspecionar install.sh antes de executá-lo.
Por que o Ollama continua cortando prompts ou documentos longos?
Ollama usa, por padrão, uma janela de contexto de 4096 tokens, independentemente da capacidade real do modelo; portanto, entradas mais longas são truncadas sem aviso. Aumente esse valor iniciando o servidor com OLLAMA_CONTEXT_LENGTH um valor maior (por exemplo, 8192 ou mais), até o limite suportado pelo modelo. Uma janela de contexto maior consome mais memória, portanto habilite OLLAMA_FLASH_ATTENTION=1 para compensar esse custo e monitore sua margem de memória RAM ou VRAM.
Como acessar o Ollama a partir de outro computador na minha rede?
Por padrão, o Ollama escuta apenas em localhost, tornando-o invisível para outros dispositivos. Defina OLLAMA_HOST=0.0.0.0:11434 e reinicie-o; em seguida, conecte-se usando o endereço IP local (LAN) da máquina hospedeira na porta 11434. Observe que não há autenticação na API, portanto exponha-a apenas em redes de sua confiança e utilize uma regra de firewall ou um proxy reverso caso a máquina seja acessível de fora de sua residência ou escritório.
Como impedir que o Ollama recarregue o modelo a cada solicitação?
Esse atraso ocorre porque o modelo é descarregado da memória entre os usos. Por padrão, o Ollama mantém o modelo carregado por 5 minutos; defina OLLAMA_KEEP_ALIVE=-1 para mantê-lo residente indefinidamente, garantindo respostas instantâneas às solicitações. A contrapartida é que o modelo ocupará sua memória RAM ou VRAM continuamente; use 0 em vez disso, se preferir liberar essa memória imediatamente após a conclusão de cada solicitação.
Conclusão
Em qualquer sistema operacional, instalar o Ollama é uma operação de download e execução que leva cerca de dois minutos, e seu primeiro modelo local está a um único comando de distância. Escolha um modelo compatível com seu hardware, confirme se a API responde na porta 11434 e você terá um LLM privado e gratuito rodando em sua própria máquina. A partir daí, explore quais modelos executar e quanta capacidade de hardware cada um exige.

