O motivo mais comum pelo qual um modelo não executa no Ollama não é um bug — é simplesmente maior do que sua memória disponível. O próprio Ollama é leve; são os modelos que exigem recursos de hardware. Este guia fornece os valores reais de RAM e VRAM necessários para cada tamanho de modelo em 2026, além de uma fórmula simples para você saber exatamente o que caberá antes você gastar dez minutos baixando algo que não será carregado.
Se ainda não instalou o Ollama, comece com nosso guia passo a passo de instalação.
Principais conclusões
- Regra geral: um modelo quantizado (Q4) precisa aproximadamente de 0,6 GB de memória por bilhão de parâmetros, além de margem de segurança para o contexto.
- Modelos de 2–3B: executam na CPU, com cerca de 2–4 GB de RAM. Funcionam bem até mesmo em laptops básicos.
- Modelos de 7–8B: cerca de 6–8 GB de RAM/VRAM. A faixa ideal para a maioria dos laptops.
- Modelos de 27–34B: cerca de 20–24 GB de VRAM. Exigem uma GPU de alto desempenho ou chips Apple Silicon com grande quantidade de memória unificada.
- Modelos de 70B ou maiores: 40 GB ou mais — requerem uma GPU para estações de trabalho, um sistema multi-GPU ou memória unificada de 64 GB ou superior.
Por que a memória é o fator determinante
Para gerar texto, os pesos de um modelo precisam residir em memória rápida — seja a VRAM da sua GPU ou a RAM do sistema, caso esteja executando na CPU. Se o modelo não couber, ocorre uma das duas coisas: o Ollama transfere parte dele para uma memória mais lenta (resultando em queda drástica de desempenho), ou recusa-se a carregar com um erro de memória insuficiente. Todos os demais fatores — velocidade da CPU, disco rígido, sistema operacional — têm muito menos impacto do que ter a quantidade adequada do tipo certo de memória.
Dois fatores definem esse requisito:
- Contagem de parâmetros — um modelo de 7B possui 7 bilhões de pesos; um modelo de 70B tem dez vezes mais.
- Quantização — o Ollama utiliza pesos comprimidos no formato GGUF. Uma quantização de 4 bits (Q4) reduz aproximadamente à metade o consumo de memória em comparação com 8 bits, com perda mínima de qualidade, razão pela qual é o padrão recomendado.
A fórmula simplificada
Para um modelo quantizado em 4 bits — o padrão que o Ollama baixa automaticamente — estime:
Memória necessária ≈ (número de parâmetros em bilhões) × 0,6 GB + sobrecarga do contexto
Assim, um modelo de 7B precisa de cerca de 4–5 GB, um modelo de 13B requer aproximadamente 8 GB, um modelo de 27B demanda cerca de 18–20 GB e um modelo de 70B exige 40 GB ou mais. Adicione uma pequena margem adicional para o cache KV, cujo tamanho aumenta conforme suas conversas se tornam mais longas. Reserve sempre alguns gigabytes de espaço livre para o seu sistema operacional.
Requisitos por tamanho de modelo
| Tamanho do modelo | Memória (Q4) | Executa em | Exemplos de modelos |
|---|---|---|---|
| 2–3B | ~2–4 GB | CPU / qualquer laptop | Gemma2 2B, Phi-4 mini |
| 7–8B | ~6–8 GB | GPU de entrada / laptop com 16 GB | DeepSeek-R1 7B, Llama 3.3 8B |
| 13–14B | ~10–12 GB | GPU de faixa intermediária | Phi-4, Qwen médio |
| 27–34B | ~18–24 GB | GPU de alta performance / Apple Silicon | Gemma 4 26B, Qwen 3.6 27B |
| 70B | ~40–48 GB | Estação de trabalho / múltiplas GPUs | Classe Llama 70B |
| 200B+ (MoE) | 100 GB+ | Servidor / memória unificada de grande capacidade | Qwen3 235B-A22B |
Para uma análise mais detalhada por modelos específicos, consulte nosso guia sobre Requisitos de VRAM para todos os principais modelos de linguagem (LLM).
GPU vs CPU vs Apple Silicon
GPU NVIDIA — o padrão ouro. A VRAM é o limite rígido: o modelo precisa caber inteiramente na memória da sua placa para rodar com desempenho. Uma placa com 24 GB (RTX 4090/5090) executa confortavelmente modelos de até ~27–34B.
Apenas CPU — funciona para modelos pequenos (2–8B), mas é muito mais lento, pois a largura de banda da memória do sistema não consegue acompanhar uma GPU. É perfeitamente adequado para tarefas leves em um laptop sem GPU dedicada.
Apple Silicon — um caso especial, e bastante vantajoso. Como os Macs utilizam memória unificada memória unificada entre CPU e GPU, um Mac com 64 GB pode carregar modelos que exigiriam um PC caro com múltiplas GPUs. Desde que a versão 0.19 do Ollama (março de 2026) introduziu o backend MLX, o Apple Silicon também ficou muito mais rápido — tornando um Mac com muita memória uma das melhores opções de máquina única para LLMs locais disponíveis no mercado. Para comparar esse desempenho com o de uma GPU dedicada, veja Strix Halo vs Apple M4 Pro.
GPU AMD — suportada via ROCm. Funciona bem para inferência em 2026; confira nosso Análise comparativa entre ROCm e CUDA para o estado atual.
Como fazer um modelo grande caber
Se o modelo que você deseja estiver apenas acima da sua capacidade de memória, há alternativas antes de desistir:
- Use uma quantização menor — baixe uma variante
q4ou até mesmoq3em vez deq8. Você sacrifica um pouco de qualidade em troca de uma economia significativa de memória. - Escolha um modelo menor — um modelo bem escolhido de 8B frequentemente supera um modelo de 27B que mal roda e sofre com paginação.
- Reduza a janela de contexto — um contexto menor consome menos memória para o cache KV.
- Feche outros aplicativos — em máquinas com CPU ou memória unificada, a RAM livre é seu orçamento.
Para escolher um modelo compatível com seu hardware, consulte o melhores LLMs locais para executar no Ollama.
Pré-requisitos de armazenamento e software frequentemente esquecidos
RAM e VRAM recebem toda a atenção, mas dois requisitos menos evidentes causam mais falhas em instalações iniciais do que qualquer outro: espaço em disco e a pilha de software subjacente. Se esses forem configurados incorretamente, o Ollama ou recusa-se a ser instalado ou falha no meio de um download de modelo.
Espaço em disco. O binário do Ollama em si é pequeno — reserve aproximadamente 4 GB para a instalação. São os modelos que consomem seu disco. Cada modelo é baixado uma única vez e armazenado em cache no disco, sendo então carregado na memória durante a execução; portanto, você precisa de espaço suficiente para armazenar integralmente os pesos dos modelos, além do que já estiver livre. Como orientação geral, usando quantização comum de 4 bits:
- Um modelo de 8B (e.g. Llama 3.1 8B): about 5 GB on disk.
- Um modelo da classe 20B: aproximadamente 12–14 GB.
- Um modelo de 70B: cerca de 40 GB.
- Um modelo MoE muito grande (classe Llama 4): 65 GB ou mais.
Esses valores somam-se rapidamente. Uma coleção casual de alguns modelos ocupa entre 30 e 80 GB; manter várias variantes grandes facilmente ultrapassa os 200 GB. Um SSD de 512 GB é um limite razoável se você pretende acumular modelos.
Use um SSD, idealmente NVMe. Como os pesos são lidos do disco para a RAM ou VRAM toda vez que um modelo é carregado pela primeira vez, uma unidade mecânica lenta resulta diretamente em inicialização lenta — um modelo de 40 GB é carregado com extrema dificuldade a partir de um disco giratório. Um armazenamento rápido não altera a taxa de tokens por segundo após o carregamento do modelo, mas faz com que a primeira solicitação pareça instantânea, em vez de uma espera de 30 segundos.
Sistema operacional e drivers. O Ollama executa nativamente nas três plataformas, mas cada uma possui um requisito mínimo:
- macOS: 11 (Big Sur) ou posterior, tanto em chips Apple Silicon quanto em Intel.
- Windows: Windows 10 versão 22H2 ou posterior (edições Home ou Pro), em arquiteturas x86_64 e ARM64 — assim, dispositivos com processadores Snapdragon executam o Ollama nativamente, sem necessidade de emulação x86.
- Linux: a maioria das distribuições modernas (Ubuntu 18.04+, Debian, Fedora, RHEL, Arch).
Para aceleração por GPU, também é necessário ter drivers atualizados: um driver NVIDIA recente — 531 ou posterior (e 570 ou posterior para placas mais antigas das gerações Maxwell e Pascal) — para CUDA, ou uma pilha de drivers compatível com Vulkan ou ROCm v7 para GPUs AMD Radeon. Caso os drivers estejam ausentes ou desatualizados, o Ollama reverterá silenciosamente para a CPU — essa é a causa mais comum de lentidão em máquinas que 'possuem uma boa GPU'.
Perguntas frequentes
Quanta memória RAM preciso para executar o Ollama?
Depende inteiramente do modelo. O próprio Ollama exige quase nada; é o modelo que define o requisito. Como regra geral, um modelo em 4 bits necessita de cerca de 0,6 GB por bilhão de parâmetros — ou seja, ~4–5 GB para um modelo de 7B, ~8 GB para um de 13B e 40 GB ou mais para um de 70B. Reserve sempre alguns gigabytes livres para o seu sistema operacional.
Posso executar o Ollama sem GPU?
Sim. Modelos pequenos (2–8B) funcionam bem na CPU, embora mais lentamente do que em uma GPU. Um modelo como o Gemma2 2B precisa de apenas cerca de 1,7 GB de RAM e opera em laptops básicos. Para modelos acima de ~13B, uma GPU ou Apple Silicon com memória unificada faz uma diferença real.
Quanta VRAM preciso para um modelo de 7B?
Cerca de 6–8 GB para um modelo de 7B quantizado em 4 bits, incluindo sobrecarga de contexto. Isso cabe confortavelmente na maioria das GPUs discretas de entrada e em laptops com 16 GB de memória unificada ou memória do sistema.
Por que o Ollama está executando tão lentamente?
Quase sempre porque o modelo não cabe inteiramente na VRAM da sua GPU, fazendo com que parte dele seja transferida para a memória do sistema ou para a CPU. Verifique com ollama ps — se ele indicar alto uso da CPU, mude para um modelo menor ou para uma quantização mais agressiva, de modo que o modelo inteiro caiba na memória rápida.
Um Mac é bom para executar o Ollama?
Sim, muitas vezes excelente. A memória unificada da Apple Silicon permite que um Mac com 64 GB execute modelos que, de outra forma, exigiriam um custoso PC com múltiplas GPUs, e o backend MLX (desde a versão v0.19) também tornou-o rápido. Um Mac com alta capacidade de memória é uma das melhores opções de máquina única para LLMs locais em 2026.
Quanto espaço em disco preciso para o Ollama?
Plan for about 4 GB for the Ollama install itself, then add the size of each model you pull. At 4-bit quantization an 8B model is roughly 5 GB, a 70B is around 40 GB, and the largest models exceed 65 GB. A typical multi-model setup lands between 30 and 80 GB, so a 512 GB SSD is a comfortable starting point. An SSD (preferably NVMe) is strongly recommended, because models load off disk every time you first run them.
Onde o Ollama armazena os modelos, e posso movê-los para outro disco?
Por padrão, o Ollama armazena os modelos baixados em uma pasta oculta no seu diretório pessoal — ~/.ollama no macOS e Linux, e %HOMEPATH%.ollama no Windows. Se seu disco do sistema for pequeno, você pode redirecionar o armazenamento para um disco maior ou externo definindo a variável de ambiente OLLAMA_MODELS antes de iniciar o Ollama. Essa é a solução mais limpa quando o disco de inicialização esgota seu espaço disponível.
Quais sistemas operacionais o Ollama suporta?
O Ollama executa nativamente no macOS 11 (Big Sur) ou posterior, no Windows 10 versão 22H2 ou posterior (64 bits, incluindo dispositivos ARM64 como laptops Snapdragon) e na maioria das distribuições modernas de Linux, como Ubuntu 18.04+, Fedora e Arch. Para aceleração por GPU, também é necessário um driver atualizado — um driver NVIDIA recente para CUDA, ou um driver compatível com ROCm/Vulkan para GPUs AMD — caso contrário, o Ollama executará apenas na CPU.
Conclusão
Antes de baixar qualquer coisa, faça rapidamente a conta: parâmetros × 0,6 GB para um modelo em 4 bits, além de uma margem de segurança. Compare esse valor com sua VRAM (NVIDIA/AMD) ou memória unificada (Apple), e você nunca mais enfrentará frustrantes erros de memória insuficiente. Em caso de dúvida, comece com um modelo um tamanho menor do que o que você imagina — um modelo que caiba bem e rode rápido é melhor do que um maior que trava.

