{"id":790,"date":"2026-06-06T01:59:14","date_gmt":"2026-06-06T01:59:14","guid":{"rendered":"https:\/\/convly.ai\/ollama-system-requirements-2026\/"},"modified":"2026-08-01T06:47:14","modified_gmt":"2026-08-01T06:47:14","slug":"ollama-system-requirements-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/","title":{"rendered":"Requisitos do sistema para o Ollama em 2026: Quanta RAM e VRAM voc\u00ea realmente precisa"},"content":{"rendered":"<p>O motivo mais comum pelo qual um modelo n\u00e3o executa no Ollama n\u00e3o \u00e9 um bug \u2014 \u00e9 simplesmente maior do que sua mem\u00f3ria dispon\u00edvel. O pr\u00f3prio Ollama \u00e9 leve; s\u00e3o os modelos que exigem recursos de hardware. Este guia fornece os valores reais de RAM e VRAM necess\u00e1rios para cada tamanho de modelo em 2026, al\u00e9m de uma f\u00f3rmula simples para voc\u00ea saber exatamente o que caber\u00e1 <em>antes<\/em> voc\u00ea gastar dez minutos baixando algo que n\u00e3o ser\u00e1 carregado.<\/p>\n<p>Se ainda n\u00e3o instalou o Ollama, comece com nosso <a href=\"https:\/\/convly.ai\/pt\/how-to-install-ollama-2026\/\">guia passo a passo de instala\u00e7\u00e3o<\/a>.<\/p>\n<div class=\"convly-tldr\">\n<h3>Principais conclus\u00f5es<\/h3>\n<ul>\n<li><strong>Regra geral:<\/strong> um modelo quantizado (Q4) precisa aproximadamente de <strong>0,6 GB de mem\u00f3ria por bilh\u00e3o de par\u00e2metros<\/strong>, al\u00e9m de margem de seguran\u00e7a para o contexto.<\/li>\n<li><strong>Modelos de 2\u20133B:<\/strong> executam na CPU, com cerca de 2\u20134 GB de RAM. Funcionam bem at\u00e9 mesmo em laptops b\u00e1sicos.<\/li>\n<li><strong>Modelos de 7\u20138B:<\/strong> cerca de 6\u20138 GB de RAM\/VRAM. A faixa ideal para a maioria dos laptops.<\/li>\n<li><strong>Modelos de 27\u201334B:<\/strong> cerca de 20\u201324 GB de VRAM. Exigem uma GPU de alto desempenho ou chips Apple Silicon com grande quantidade de mem\u00f3ria unificada.<\/li>\n<li><strong>Modelos de 70B ou maiores:<\/strong> 40 GB ou mais \u2014 requerem uma GPU para esta\u00e7\u00f5es de trabalho, um sistema multi-GPU ou mem\u00f3ria unificada de 64 GB ou superior.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a745a0dbf3a2\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a745a0dbf3a2\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#Why_memory_is_the_whole_story\" >Por que a mem\u00f3ria \u00e9 o fator determinante<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#The_simple_formula\" >A f\u00f3rmula simplificada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#Requirements_by_model_size\" >Requisitos por tamanho de modelo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#GPU_vs_CPU_vs_Apple_Silicon\" >GPU vs CPU vs Apple Silicon<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#How_to_make_a_big_model_fit\" >Como fazer um modelo grande caber<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#Storage_and_software_prerequisites_people_forget\" >Pr\u00e9-requisitos de armazenamento e software frequentemente esquecidos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#FAQ\" >Perguntas frequentes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#Bottom_line\" >Conclus\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/ollama-system-requirements-2026\/#Related_articles\" >Artigos relacionados<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Why_memory_is_the_whole_story\"><\/span>Por que a mem\u00f3ria \u00e9 o fator determinante<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Para gerar texto, os pesos de um modelo precisam residir em mem\u00f3ria r\u00e1pida \u2014 seja a VRAM da sua GPU ou a RAM do sistema, caso esteja executando na CPU. Se o modelo n\u00e3o couber, ocorre uma das duas coisas: o Ollama transfere parte dele para uma mem\u00f3ria mais lenta (resultando em queda dr\u00e1stica de desempenho), ou recusa-se a carregar com um erro de mem\u00f3ria insuficiente. Todos os demais fatores \u2014 velocidade da CPU, disco r\u00edgido, sistema operacional \u2014 t\u00eam muito menos impacto do que ter a quantidade adequada do tipo certo de mem\u00f3ria.<\/p>\n<p>Dois fatores definem esse requisito:<\/p>\n<ol>\n<li><strong>Contagem de par\u00e2metros<\/strong> \u2014 um modelo de 7B possui 7 bilh\u00f5es de pesos; um modelo de 70B tem dez vezes mais.<\/li>\n<li><strong>Quantiza\u00e7\u00e3o<\/strong> \u2014 o Ollama utiliza pesos comprimidos no formato GGUF. Uma quantiza\u00e7\u00e3o de 4 bits (Q4) reduz aproximadamente \u00e0 metade o consumo de mem\u00f3ria em compara\u00e7\u00e3o com 8 bits, com perda m\u00ednima de qualidade, raz\u00e3o pela qual \u00e9 o padr\u00e3o recomendado.<\/li>\n<\/ol>\n<h2><span class=\"ez-toc-section\" id=\"The_simple_formula\"><\/span>A f\u00f3rmula simplificada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Para um modelo quantizado em 4 bits \u2014 o padr\u00e3o que o Ollama baixa automaticamente \u2014 estime:<\/p>\n<blockquote>\n<p><strong>Mem\u00f3ria necess\u00e1ria \u2248 (n\u00famero de par\u00e2metros em bilh\u00f5es) \u00d7 0,6 GB + sobrecarga do contexto<\/strong><\/p>\n<\/blockquote>\n<p>Assim, um modelo de 7B precisa de cerca de 4\u20135 GB, um modelo de 13B requer aproximadamente 8 GB, um modelo de 27B demanda cerca de 18\u201320 GB e um modelo de 70B exige 40 GB ou mais. Adicione uma pequena margem adicional para o cache KV, cujo tamanho aumenta conforme suas conversas se tornam mais longas. Reserve sempre alguns gigabytes de espa\u00e7o livre para o seu sistema operacional.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Requirements_by_model_size\"><\/span>Requisitos por tamanho de modelo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Tamanho do modelo<\/th>\n<th>Mem\u00f3ria (Q4)<\/th>\n<th>Executa em<\/th>\n<th>Exemplos de modelos<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>2\u20133B<\/td>\n<td>~2\u20134 GB<\/td>\n<td>CPU \/ qualquer laptop<\/td>\n<td>Gemma2 2B, Phi-4 mini<\/td>\n<\/tr>\n<tr>\n<td>7\u20138B<\/td>\n<td>~6\u20138 GB<\/td>\n<td>GPU de entrada \/ laptop com 16 GB<\/td>\n<td>DeepSeek-R1 7B, Llama 3.3 8B<\/td>\n<\/tr>\n<tr>\n<td>13\u201314B<\/td>\n<td>~10\u201312 GB<\/td>\n<td>GPU de faixa intermedi\u00e1ria<\/td>\n<td>Phi-4, Qwen m\u00e9dio<\/td>\n<\/tr>\n<tr>\n<td>27\u201334B<\/td>\n<td>~18\u201324 GB<\/td>\n<td>GPU de alta performance \/ Apple Silicon<\/td>\n<td>Gemma 4 26B, Qwen 3.6 27B<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>~40\u201348 GB<\/td>\n<td>Esta\u00e7\u00e3o de trabalho \/ m\u00faltiplas GPUs<\/td>\n<td>Classe Llama 70B<\/td>\n<\/tr>\n<tr>\n<td>200B+ (MoE)<\/td>\n<td>100 GB+<\/td>\n<td>Servidor \/ mem\u00f3ria unificada de grande capacidade<\/td>\n<td>Qwen3 235B-A22B<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para uma an\u00e1lise mais detalhada por modelos espec\u00edficos, consulte nosso guia sobre <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para todos os principais modelos de linguagem (LLM)<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_vs_CPU_vs_Apple_Silicon\"><\/span>GPU vs CPU vs Apple Silicon<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>GPU NVIDIA<\/strong> \u2014 o padr\u00e3o ouro. A VRAM \u00e9 o limite r\u00edgido: o modelo precisa caber inteiramente na mem\u00f3ria da sua placa para rodar com desempenho. Uma placa com 24 GB (RTX 4090\/5090) executa confortavelmente modelos de at\u00e9 ~27\u201334B.<\/p>\n<p><strong>Apenas CPU<\/strong> \u2014 funciona para modelos pequenos (2\u20138B), mas \u00e9 muito mais lento, pois a largura de banda da mem\u00f3ria do sistema n\u00e3o consegue acompanhar uma GPU. \u00c9 perfeitamente adequado para tarefas leves em um laptop sem GPU dedicada.<\/p>\n<p><strong>Apple Silicon<\/strong> \u2014 um caso especial, e bastante vantajoso. Como os Macs utilizam <em>mem\u00f3ria unificada<\/em> mem\u00f3ria unificada entre CPU e GPU, um Mac com 64 GB pode carregar modelos que exigiriam um PC caro com m\u00faltiplas GPUs. Desde que a vers\u00e3o 0.19 do Ollama (mar\u00e7o de 2026) introduziu o backend MLX, o Apple Silicon tamb\u00e9m ficou muito mais r\u00e1pido \u2014 tornando um Mac com muita mem\u00f3ria uma das melhores op\u00e7\u00f5es de m\u00e1quina \u00fanica para LLMs locais dispon\u00edveis no mercado. Para comparar esse desempenho com o de uma GPU dedicada, veja <a href=\"https:\/\/convly.ai\/pt\/amd-strix-halo-vs-apple-m4-pro\/\">Strix Halo vs Apple M4 Pro<\/a>.<\/p>\n<p><strong>GPU AMD<\/strong> \u2014 suportada via ROCm. Funciona bem para infer\u00eancia em 2026; confira nosso <a href=\"https:\/\/convly.ai\/pt\/amd-rocm-vs-nvidia-cuda-2026\/\">An\u00e1lise comparativa entre ROCm e CUDA<\/a> para o estado atual.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_make_a_big_model_fit\"><\/span>Como fazer um modelo grande caber<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Se o modelo que voc\u00ea deseja estiver apenas acima da sua capacidade de mem\u00f3ria, h\u00e1 alternativas antes de desistir:<\/p>\n<ul>\n<li><strong>Use uma quantiza\u00e7\u00e3o menor<\/strong> \u2014 baixe uma variante <code>q4<\/code> ou at\u00e9 mesmo <code>q3<\/code> em vez de <code>q8<\/code>. Voc\u00ea sacrifica um pouco de qualidade em troca de uma economia significativa de mem\u00f3ria.<\/li>\n<li><strong>Escolha um modelo menor<\/strong> \u2014 um modelo bem escolhido de 8B frequentemente supera um modelo de 27B que mal roda e sofre com pagina\u00e7\u00e3o.<\/li>\n<li><strong>Reduza a janela de contexto<\/strong> \u2014 um contexto menor consome menos mem\u00f3ria para o cache KV.<\/li>\n<li><strong>Feche outros aplicativos<\/strong> \u2014 em m\u00e1quinas com CPU ou mem\u00f3ria unificada, a RAM livre \u00e9 seu or\u00e7amento.<\/li>\n<\/ul>\n<p>Para escolher um modelo compat\u00edvel com seu hardware, consulte o <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores LLMs locais para executar no Ollama<\/a>.<\/p>\n<p><!--ai-enriched--><\/p>\n<h2><span class=\"ez-toc-section\" id=\"Storage_and_software_prerequisites_people_forget\"><\/span>Pr\u00e9-requisitos de armazenamento e software frequentemente esquecidos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>RAM e VRAM recebem toda a aten\u00e7\u00e3o, mas dois requisitos menos evidentes causam mais falhas em instala\u00e7\u00f5es iniciais do que qualquer outro: espa\u00e7o em disco e a pilha de software subjacente. Se esses forem configurados incorretamente, o Ollama ou recusa-se a ser instalado ou falha no meio de um download de modelo.<\/p>\n<p><strong>Espa\u00e7o em disco.<\/strong> O bin\u00e1rio do Ollama em si \u00e9 pequeno \u2014 reserve aproximadamente <strong>4&nbsp;GB<\/strong> para a instala\u00e7\u00e3o. S\u00e3o os modelos que consomem seu disco. Cada modelo \u00e9 baixado uma \u00fanica vez e armazenado em cache no disco, sendo ent\u00e3o carregado na mem\u00f3ria durante a execu\u00e7\u00e3o; portanto, voc\u00ea precisa de espa\u00e7o suficiente para armazenar integralmente os pesos dos modelos, al\u00e9m do que j\u00e1 estiver livre. Como orienta\u00e7\u00e3o geral, usando quantiza\u00e7\u00e3o comum de 4 bits:<\/p>\n<ul>\n<li><strong>Um modelo de 8B<\/strong> (por exemplo, Llama 3.1 8B): cerca de 5&nbsp;GB em disco.<\/li>\n<li><strong>Um modelo da classe 20B:<\/strong> aproximadamente 12\u201314&nbsp;GB.<\/li>\n<li><strong>Um modelo de 70B:<\/strong> cerca de 40&nbsp;GB.<\/li>\n<li><strong>Um modelo MoE muito grande<\/strong> (classe Llama&nbsp;4): 65&nbsp;GB ou mais.<\/li>\n<\/ul>\n<p>Esses valores somam-se rapidamente. Uma cole\u00e7\u00e3o casual de alguns modelos ocupa entre 30 e 80&nbsp;GB; manter v\u00e1rias variantes grandes facilmente ultrapassa os 200&nbsp;GB. Um SSD de 512&nbsp;GB \u00e9 um limite razo\u00e1vel se voc\u00ea pretende acumular modelos.<\/p>\n<p><strong>Use um SSD, idealmente NVMe.<\/strong> Como os pesos s\u00e3o lidos do disco para a RAM ou VRAM toda vez que um modelo \u00e9 carregado pela primeira vez, uma unidade mec\u00e2nica lenta resulta diretamente em inicializa\u00e7\u00e3o lenta \u2014 um modelo de 40&nbsp;GB \u00e9 carregado com extrema dificuldade a partir de um disco girat\u00f3rio. Um armazenamento r\u00e1pido n\u00e3o altera a taxa de tokens por segundo ap\u00f3s o carregamento do modelo, mas faz com que a primeira solicita\u00e7\u00e3o pare\u00e7a instant\u00e2nea, em vez de uma espera de 30 segundos.<\/p>\n<p><strong>Sistema operacional e drivers.<\/strong> O Ollama executa nativamente nas tr\u00eas plataformas, mas cada uma possui um requisito m\u00ednimo:<\/p>\n<ul>\n<li><strong>macOS:<\/strong> 11 (Big Sur) ou posterior, tanto em chips Apple Silicon quanto em Intel.<\/li>\n<li><strong>Windows:<\/strong> Windows 10 vers\u00e3o 22H2 ou posterior (edi\u00e7\u00f5es Home ou Pro), em arquiteturas x86_64 e ARM64 \u2014 assim, dispositivos com processadores Snapdragon executam o Ollama nativamente, sem necessidade de emula\u00e7\u00e3o x86.<\/li>\n<li><strong>Linux:<\/strong> a maioria das distribui\u00e7\u00f5es modernas (Ubuntu 18.04+, Debian, Fedora, RHEL, Arch).<\/li>\n<\/ul>\n<p>Para acelera\u00e7\u00e3o por GPU, tamb\u00e9m \u00e9 necess\u00e1rio ter drivers atualizados: um driver NVIDIA recente \u2014 <strong>531 ou posterior<\/strong> (e 570 ou posterior para placas mais antigas das gera\u00e7\u00f5es Maxwell e Pascal) \u2014 para CUDA, ou uma pilha de drivers compat\u00edvel com Vulkan ou ROCm v7 para GPUs AMD Radeon. Caso os drivers estejam ausentes ou desatualizados, o Ollama reverter\u00e1 silenciosamente para a CPU \u2014 essa \u00e9 a causa mais comum de lentid\u00e3o em m\u00e1quinas que 'possuem uma boa GPU'.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Quanta mem\u00f3ria RAM preciso para executar o Ollama?<\/h3>\n<p>Depende inteiramente do modelo. O pr\u00f3prio Ollama exige quase nada; \u00e9 o modelo que define o requisito. Como regra geral, um modelo em 4 bits necessita de cerca de 0,6 GB por bilh\u00e3o de par\u00e2metros \u2014 ou seja, ~4\u20135 GB para um modelo de 7B, ~8 GB para um de 13B e 40 GB ou mais para um de 70B. Reserve sempre alguns gigabytes livres para o seu sistema operacional.<\/p>\n<h3>Posso executar o Ollama sem GPU?<\/h3>\n<p>Sim. Modelos pequenos (2\u20138B) funcionam bem na CPU, embora mais lentamente do que em uma GPU. Um modelo como o Gemma2 2B precisa de apenas cerca de 1,7 GB de RAM e opera em laptops b\u00e1sicos. Para modelos acima de ~13B, uma GPU ou Apple Silicon com mem\u00f3ria unificada faz uma diferen\u00e7a real.<\/p>\n<h3>Quanta VRAM preciso para um modelo de 7B?<\/h3>\n<p>Cerca de 6\u20138 GB para um modelo de 7B quantizado em 4 bits, incluindo sobrecarga de contexto. Isso cabe confortavelmente na maioria das GPUs discretas de entrada e em laptops com 16 GB de mem\u00f3ria unificada ou mem\u00f3ria do sistema.<\/p>\n<h3>Por que o Ollama est\u00e1 executando t\u00e3o lentamente?<\/h3>\n<p>Quase sempre porque o modelo n\u00e3o cabe inteiramente na VRAM da sua GPU, fazendo com que parte dele seja transferida para a mem\u00f3ria do sistema ou para a CPU. Verifique com <code>ollama ps<\/code> \u2014 se ele indicar alto uso da CPU, mude para um modelo menor ou para uma quantiza\u00e7\u00e3o mais agressiva, de modo que o modelo inteiro caiba na mem\u00f3ria r\u00e1pida.<\/p>\n<h3>Um Mac \u00e9 bom para executar o Ollama?<\/h3>\n<p>Sim, muitas vezes excelente. A mem\u00f3ria unificada da Apple Silicon <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\" data-wpil-monitor-id=\"62\">permite que um Mac com 64 GB execute modelos<\/a> que, de outra forma, exigiriam um custoso PC com m\u00faltiplas GPUs, e o backend MLX (desde a vers\u00e3o v0.19) tamb\u00e9m tornou-o r\u00e1pido. Um Mac com alta capacidade de mem\u00f3ria \u00e9 uma das melhores op\u00e7\u00f5es de m\u00e1quina \u00fanica para LLMs locais em 2026.<\/p>\n<h3>Quanto espa\u00e7o em disco preciso para o Ollama?<\/h3>\n<p>Planeje cerca de 4&nbsp;GB para a instala\u00e7\u00e3o do Ollama propriamente dita, adicionando em seguida o tamanho de cada modelo que voc\u00ea baixar. Com quantiza\u00e7\u00e3o de 4 bits, um modelo de 8B ocupa aproximadamente 5&nbsp;GB, um de 70B cerca de 40&nbsp;GB, e os maiores modelos superam os 65&nbsp;GB. Uma configura\u00e7\u00e3o t\u00edpica com m\u00faltiplos modelos fica entre 30 e 80&nbsp;GB, logo um SSD de 512&nbsp;GB \u00e9 um ponto de partida confort\u00e1vel. Recomenda-se fortemente o uso de um SSD (preferencialmente NVMe), pois os modelos s\u00e3o carregados do disco toda vez que voc\u00ea os executa pela primeira vez.<\/p>\n<h3>Onde o Ollama armazena os modelos, e posso mov\u00ea-los para outro disco?<\/h3>\n<p>Por padr\u00e3o, o Ollama armazena os modelos baixados em uma pasta oculta no seu diret\u00f3rio pessoal \u2014 <strong>~\/.ollama<\/strong> no macOS e Linux, e <strong>%HOMEPATH%.ollama<\/strong> no Windows. Se seu disco do sistema for pequeno, voc\u00ea pode redirecionar o armazenamento para um disco maior ou externo definindo a vari\u00e1vel de ambiente <strong>OLLAMA_MODELS<\/strong> antes de iniciar o Ollama. Essa \u00e9 a solu\u00e7\u00e3o mais limpa quando o disco de inicializa\u00e7\u00e3o esgota seu espa\u00e7o dispon\u00edvel.<\/p>\n<h3>Quais sistemas operacionais o Ollama suporta?<\/h3>\n<p>O Ollama executa nativamente no macOS 11 (Big Sur) ou posterior, no Windows 10 vers\u00e3o 22H2 ou posterior (64 bits, incluindo dispositivos ARM64 como laptops Snapdragon) e na maioria das distribui\u00e7\u00f5es modernas de Linux, como Ubuntu 18.04+, Fedora e Arch. Para acelera\u00e7\u00e3o por GPU, tamb\u00e9m \u00e9 necess\u00e1rio um driver atualizado \u2014 um driver NVIDIA recente para CUDA, ou um driver compat\u00edvel com ROCm\/Vulkan para GPUs AMD \u2014 caso contr\u00e1rio, o Ollama executar\u00e1 apenas na CPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclus\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de baixar qualquer coisa, fa\u00e7a rapidamente a conta: par\u00e2metros \u00d7 0,6 GB para um modelo em 4 bits, al\u00e9m de uma margem de seguran\u00e7a. Compare esse valor com sua VRAM (NVIDIA\/AMD) ou mem\u00f3ria unificada (Apple), e voc\u00ea nunca mais enfrentar\u00e1 frustrantes erros de mem\u00f3ria insuficiente. Em caso de d\u00favida, comece com um modelo um tamanho menor do que o que voc\u00ea imagina \u2014 um modelo que caiba bem e rode r\u00e1pido \u00e9 melhor do que um maior que trava.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Artigos relacionados<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/pt\/deepseek-v4-flash-vs-gemini-3-5-flash\/\">DeepSeek V4-Flash vs Gemini 3.5 Flash: Specs, Pricing &amp; Which to Choose (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/ollama-vs-jan-2026\/\">Ollama vs Jan: Qual aplicativo local de IA vence em 2026?<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">LM Studio: O Guia Completo (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/claude-5-new-ai-models-june-2026\/\">Existe um Claude 5? Claude Fable 5 e todos os principais modelos de IA de junho de 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/llm-hallucinations-complete-guide\/\">Alucina\u00e7\u00f5es em Modelos de Linguagem de Grande Porte em 2026: Por que ocorrem e como evit\u00e1-las<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/prompt-engineering-techniques\/\">Engenharia de Prompt em 2026: 12 T\u00e9cnicas que Realmente Funcionam<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">O que \u00e9 o Ollama? O guia completo para executar modelos de linguagem de grande porte localmente em 2026<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>The number-one reason a model fails to run isn&#8217;t a bug \u2014 it&#8217;s memory. Here&#8217;s exactly how much RAM and VRAM each Ollama model size needs, and a formula to know before you download.<\/p>","protected":false},"author":1,"featured_media":1955,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[3],"tags":[642,643,640,644,641,639],"class_list":["post-790","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-llms","tag-local-llm-vram","tag-ollama-gpu","tag-ollama-hardware-requirements","tag-ollama-ram","tag-ollama-requirements","tag-ollama-system-requirements"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/790","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=790"}],"version-history":[{"count":5,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/790\/revisions"}],"predecessor-version":[{"id":1432,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/790\/revisions\/1432"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/1955"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=790"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=790"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=790"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}