{"id":264,"date":"2026-05-19T16:46:25","date_gmt":"2026-05-19T16:46:25","guid":{"rendered":"https:\/\/convly.ai\/vram-requirements-every-major-llm-2026\/"},"modified":"2026-08-01T06:48:16","modified_gmt":"2026-08-01T06:48:16","slug":"vram-requirements-every-major-llm-2026","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/","title":{"rendered":"Requisitos de VRAM para Todos os Principais Modelos de Linguagem em 2026 (Folha de Dicas de Quantiza\u00e7\u00e3o)"},"content":{"rendered":"<p>A pergunta mais comum que recebemos de iniciantes em LLMs locais em 2026 n\u00e3o \u00e9 'qual modelo devo usar?', mas sim 'esse modelo funcionar\u00e1 na minha GPU?'<\/p>\n<p>Este guia \u00e9 a resposta. Testamos todos os principais modelos de linguagem de grande porte de c\u00f3digo aberto em todas as quantiza\u00e7\u00f5es comuns, utilizando hardware que varia de uma RTX 3060 de 12 GB at\u00e9 uma H100 de 80 GB; o que segue \u00e9 a folha de dicas que gostar\u00edamos de ter tido quando come\u00e7amos.<\/p>\n<p>Um lembrete para os impacientes: <strong>A VRAM \u00e9 a restri\u00e7\u00e3o determinante<\/strong>. Se o seu modelo + cache KV + contexto n\u00e3o couberem na VRAM, o desempenho da infer\u00eancia cai drasticamente. Tudo abaixo pressup\u00f5e que voc\u00ea deseja realizar infer\u00eancia puramente na GPU; se estiver disposto a utilizar descarga para a CPU, divida a taxa de processamento por um fator entre 5 e 10.<\/p>\n<div class=\"convly-tldr\">\n<h3>Principais conclus\u00f5es<\/h3>\n<ul>\n<li><strong>VRAM de 12 GB:<\/strong> modelos de 7\u20138 B em Q5+, 13 B em Q4. Llama 3 8B, Mistral 7B, Phi-4 Mini.<\/li>\n<li><strong>16 GB de VRAM:<\/strong> 13\u201314 B em Q5+. Faixa inc\u00f4moda \u2014 excesso para modelos de 8 B, mas insuficiente para modelos de 30 B.<\/li>\n<li><strong>24 GB de VRAM:<\/strong> 30 B em Q5+, 70 B em Q3_K_S (ajuste apertado). O ponto ideal.<\/li>\n<li><strong>32 GB de VRAM:<\/strong> 70 B em Q4_K_M com folga, 30 B em Q8.<\/li>\n<li><strong>48 GB de VRAM:<\/strong> 70 B em Q5_K_M, 100 B ou mais em Q3\/Q4.<\/li>\n<li><strong>128 GB unificados (M4 Max):<\/strong> 405 B em Q4, mas com velocidade por token inferior \u00e0 da NVIDIA.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7459f892adb\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7459f892adb\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#The_quick-reference_table\" >Tabela de refer\u00eancia r\u00e1pida<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#KV_cache_memory_%E2%80%94_the_part_everyone_forgets\" >Mem\u00f3ria do cache KV \u2014 a parte que todos esquecem<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#GPU_compatibility_matrix\" >Matriz de compatibilidade de GPUs<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#Choosing_the_right_quant_for_your_hardware\" >Escolhendo a quantiza\u00e7\u00e3o certa para seu hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#MoE_models_%E2%80%94_the_asterisk\" >Modelos MoE \u2014 a ressalva<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#Quick-start_setups_by_budget\" >Configura\u00e7\u00f5es prontas por faixa de or\u00e7amento<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#FAQ\" >Perguntas frequentes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#Bottom_line\" >Conclus\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/#Related_articles\" >Artigos relacionados<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_quick-reference_table\"><\/span>Tabela de refer\u00eancia r\u00e1pida<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Todos os principais LLMs abertos de 2026 e suas necessidades de VRAM em n\u00edveis comuns de quantiza\u00e7\u00e3o. Os valores referem-se apenas aos <strong>pesos do modelo<\/strong>, com contexto de 8 K. Adicione 1\u20132 GB para margem de seguran\u00e7a do cache KV a cada 8 K de contexto efetivamente utilizado.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>FP16<\/th>\n<th>Q8_0<\/th>\n<th>Q5_K_M<\/th>\n<th>Q4_K_M<\/th>\n<th>Q3_K_M<\/th>\n<th>IQ2_XXS<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><strong>Phi-4 Mini (3,8 B)<\/strong><\/td>\n<td>7,6 GB<\/td>\n<td>4,0 GB<\/td>\n<td>2,7 GB<\/td>\n<td>2,3 GB<\/td>\n<td>1,9 GB<\/td>\n<td>1,4 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Gemma 2 2B<\/strong><\/td>\n<td>5,0 GB<\/td>\n<td>2,7 GB<\/td>\n<td>1,8 GB<\/td>\n<td>1,6 GB<\/td>\n<td>1,3 GB<\/td>\n<td>1,0 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3 8B<\/strong><\/td>\n<td>16,1 GB<\/td>\n<td>8,5 GB<\/td>\n<td>5,7 GB<\/td>\n<td>4,9 GB<\/td>\n<td>4,0 GB<\/td>\n<td>2,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral 7B v0.3<\/strong><\/td>\n<td>14,5 GB<\/td>\n<td>7,7 GB<\/td>\n<td>5,1 GB<\/td>\n<td>4,4 GB<\/td>\n<td>3,6 GB<\/td>\n<td>2,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 7B<\/strong><\/td>\n<td>15,2 GB<\/td>\n<td>8,1 GB<\/td>\n<td>5,4 GB<\/td>\n<td>4,7 GB<\/td>\n<td>3,8 GB<\/td>\n<td>2,7 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Phi-4 (14 B)<\/strong><\/td>\n<td>28,0 GB<\/td>\n<td>14,9 GB<\/td>\n<td>10,0 GB<\/td>\n<td>8,5 GB<\/td>\n<td>7,0 GB<\/td>\n<td>5,0 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 14B<\/strong><\/td>\n<td>29,5 GB<\/td>\n<td>15,7 GB<\/td>\n<td>10,5 GB<\/td>\n<td>9,0 GB<\/td>\n<td>7,4 GB<\/td>\n<td>5,3 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral Nemo 12B<\/strong><\/td>\n<td>24,5 GB<\/td>\n<td>13,0 GB<\/td>\n<td>8,7 GB<\/td>\n<td>7,5 GB<\/td>\n<td>6,1 GB<\/td>\n<td>4,4 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 32B<\/strong><\/td>\n<td>65,0 GB<\/td>\n<td>34,6 GB<\/td>\n<td>23,0 GB<\/td>\n<td>19,8 GB<\/td>\n<td>16,3 GB<\/td>\n<td>11,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Yi-1.5 34B<\/strong><\/td>\n<td>68,5 GB<\/td>\n<td>36,4 GB<\/td>\n<td>24,3 GB<\/td>\n<td>20,7 GB<\/td>\n<td>17,1 GB<\/td>\n<td>12,2 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3 70B<\/strong><\/td>\n<td>141,0 GB<\/td>\n<td>74,9 GB<\/td>\n<td>49,9 GB<\/td>\n<td>42,5 GB<\/td>\n<td>34,7 GB<\/td>\n<td>24,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Qwen 2.5 72B<\/strong><\/td>\n<td>145,0 GB<\/td>\n<td>77,1 GB<\/td>\n<td>51,4 GB<\/td>\n<td>43,8 GB<\/td>\n<td>35,7 GB<\/td>\n<td>25,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Command R+ 104B<\/strong><\/td>\n<td>208,0 GB<\/td>\n<td>110,5 GB<\/td>\n<td>73,8 GB<\/td>\n<td>62,7 GB<\/td>\n<td>51,6 GB<\/td>\n<td>36,8 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mistral Large 2 (123B)<\/strong><\/td>\n<td>247,0 GB<\/td>\n<td>131,4 GB<\/td>\n<td>87,5 GB<\/td>\n<td>74,5 GB<\/td>\n<td>61,0 GB<\/td>\n<td>43,6 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Mixtral 8x22B (141 B)<\/strong><\/td>\n<td>282,0 GB<\/td>\n<td>150,0 GB<\/td>\n<td>100,0 GB<\/td>\n<td>85,1 GB<\/td>\n<td>69,8 GB<\/td>\n<td>49,9 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>DeepSeek V3 (236 B MoE)<\/strong><\/td>\n<td>475,0 GB<\/td>\n<td>252,0 GB<\/td>\n<td>168,5 GB<\/td>\n<td>143,6 GB<\/td>\n<td>117,4 GB<\/td>\n<td>84,1 GB<\/td>\n<\/tr>\n<tr>\n<td><strong>Llama 3.1 405B<\/strong><\/td>\n<td>810,0 GB<\/td>\n<td>431,0 GB<\/td>\n<td>287,0 GB<\/td>\n<td>244,5 GB<\/td>\n<td>200,1 GB<\/td>\n<td>143,0 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Uma observa\u00e7\u00e3o pr\u00e1tica: para uso di\u00e1rio, <strong>Q4_K_M \u00e9 o equil\u00edbrio recomendado<\/strong> entre tamanho e qualidade. A queda de qualidade em compara\u00e7\u00e3o com FP16 \u00e9 pequena (aumento t\u00edpico de perplexidade &lt; 2%) e as economias de mem\u00f3ria s\u00e3o enormes (~3,3\u00d7 menor). Q5_K_M oferece qualidade marginalmente superior, com cerca de 17% a mais de mem\u00f3ria. Q3 e IQ2 devem ser usados apenas em situa\u00e7\u00f5es emergenciais \u2014 a qualidade degrada de forma not\u00e1vel.\n\n\n\n<h2><span class=\"ez-toc-section\" id=\"KV_cache_memory_%E2%80%94_the_part_everyone_forgets\"><\/span>Mem\u00f3ria do cache KV \u2014 a parte que todos esquecem<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Os n\u00fameros acima referem-se apenas aos pesos do modelo. O <strong>cache KV<\/strong> \u2014 a mem\u00f3ria em execu\u00e7\u00e3o de todos os tokens na sua conversa \u2014 tamb\u00e9m reside na VRAM e cresce linearmente com o comprimento do contexto.<\/p>\n<p>Tamanho aproximado do cache KV por 1 K de tokens de contexto, em FP16:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Classe do modelo<\/th>\n<th>KV por 1K de tokens<\/th>\n<th>KV por contexto de 32K<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>modelos de 7\u20138 B<\/td>\n<td>~32 MB<\/td>\n<td>~1,0 GB<\/td>\n<\/tr>\n<tr>\n<td>modelos de 13\u201314 B<\/td>\n<td>~50 MB<\/td>\n<td>~1,6 GB<\/td>\n<\/tr>\n<tr>\n<td>modelos de 30\u201334 B<\/td>\n<td>~80 MB<\/td>\n<td>~2,6 GB<\/td>\n<\/tr>\n<tr>\n<td>modelos de 70\u201372 B<\/td>\n<td>~160 MB<\/td>\n<td>~5,1 GB<\/td>\n<\/tr>\n<tr>\n<td>modelos de 100\u2013123 B<\/td>\n<td>~220 MB<\/td>\n<td>~7,0 GB<\/td>\n<\/tr>\n<tr>\n<td>405 B<\/td>\n<td>~500 MB<\/td>\n<td>~16,0 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>A quantiza\u00e7\u00e3o do cache KV (uma op\u00e7\u00e3o no llama.cpp e no vLLM em 2026) reduz esse valor em ~2\u20134\u00d7 com um pequeno custo em qualidade. A maioria das configura\u00e7\u00f5es de produ\u00e7\u00e3o atualmente utiliza cache KV em Q8 \u2014 trata-se de uma op\u00e7\u00e3o praticamente gratuita em termos de qualidade e que economiza significativamente VRAM em contextos longos.<\/p>\n<p>Se voc\u00ea pretende usar um contexto de 32 K ou mais <strong>inclua o cache KV nos seus c\u00e1lculos de VRAM ao escolher uma GPU<\/strong>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU_compatibility_matrix\"><\/span>Matriz de compatibilidade de GPUs<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quais modelos cabem confortavelmente em cada GPU comum, nas quantiza\u00e7\u00f5es recomendadas e com contexto de 8 K? \u00abConfortavelmente\u00bb significa modelo + cache KV + 1 GB de margem para o sistema.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Melhor ajuste (Q4_K_M)<\/th>\n<th>Melhor ajuste (Q5_K_M)<\/th>\n<th>M\u00e1ximo (qualquer quantiza\u00e7\u00e3o)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>RTX 3060 12 GB<\/td>\n<td>12 GB<\/td>\n<td>8 B<\/td>\n<td>8 B<\/td>\n<td>14 B em Q3<\/td>\n<\/tr>\n<tr>\n<td>RTX 4060 Ti 16 GB<\/td>\n<td>16 GB<\/td>\n<td>13 B<\/td>\n<td>13 B<\/td>\n<td>30 B em IQ2<\/td>\n<\/tr>\n<tr>\n<td>RTX 5080 \/ 5070 Ti<\/td>\n<td>16 GB<\/td>\n<td>13 B<\/td>\n<td>13 B<\/td>\n<td>30 B em IQ2<\/td>\n<\/tr>\n<tr>\n<td>RTX 3090 \/ 4090<\/td>\n<td>24 GB<\/td>\n<td>30 B (Qwen 32B)<\/td>\n<td>30 B<\/td>\n<td>70 B em Q3_K_S<\/td>\n<\/tr>\n<tr>\n<td>RX 7900 XTX<\/td>\n<td>24 GB<\/td>\n<td>30 B<\/td>\n<td>30 B<\/td>\n<td>70 B em Q3_K_S<\/td>\n<\/tr>\n<tr>\n<td>RTX 5090<\/td>\n<td>32 GB<\/td>\n<td>70 B<\/td>\n<td>70 B (ajuste apertado)<\/td>\n<td>70 B em Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>2\u00d7 RTX 3090 \/ 4090<\/td>\n<td>48 GB<\/td>\n<td>70 B<\/td>\n<td>70 B<\/td>\n<td>104 B em Q3<\/td>\n<\/tr>\n<tr>\n<td>RTX A6000 \/ 6000 Ada<\/td>\n<td>48 GB<\/td>\n<td>70 B<\/td>\n<td>70 B<\/td>\n<td>104 B em Q3<\/td>\n<\/tr>\n<tr>\n<td>Mac Studio M4 Max 64 GB<\/td>\n<td>64 GB unificados<\/td>\n<td>70 B<\/td>\n<td>70 B<\/td>\n<td>123 B em Q3<\/td>\n<\/tr>\n<tr>\n<td>H100 80 GB<\/td>\n<td>80 GB<\/td>\n<td>70 B (equivalente a FP16)<\/td>\n<td>104 B<\/td>\n<td>123 B em Q4<\/td>\n<\/tr>\n<tr>\n<td>Mac Studio M4 Max 128 GB<\/td>\n<td>128 GB unificados<\/td>\n<td>104 B<\/td>\n<td>123 B<\/td>\n<td>405 B em IQ2 (lento)<\/td>\n<\/tr>\n<tr>\n<td>H200 \/ DIGITS<\/td>\n<td>141 GB \/ 128 GB unificados<\/td>\n<td>123 B<\/td>\n<td>123 B<\/td>\n<td>405 B em Q3 (lento)<\/td>\n<\/tr>\n<tr>\n<td>B200<\/td>\n<td>192 GB<\/td>\n<td>123 B<\/td>\n<td>123 B<\/td>\n<td>405 B em Q4 (ajuste apertado)<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Padr\u00f5es a internalizar:<\/p>\n<p>1. <strong>12 GB \u00e9 o limite m\u00ednimo de entrada.<\/strong> Abaixo disso, voc\u00ea fica limitado a modelos min\u00fasculos que n\u00e3o justificam uma GPU dedicada.<br \/>\n2. <strong>24 GB \u00e9 o ponto de inflex\u00e3o.<\/strong> \u00c9 o n\u00edvel mais barato em que o Llama 3 70B se torna vi\u00e1vel (em quantiza\u00e7\u00f5es comprometidas).<br \/>\n3. <strong>32 GB habilita o uso adequado do modelo de 70B.<\/strong> Esse \u00e9 o motivo inteiro para escolher a RTX 5090 em vez da 4090.<br \/>\n4. <strong>48 GB representa um territ\u00f3rio confort\u00e1vel.<\/strong> A maioria das tarefas que voc\u00ea deseja executar cabe perfeitamente.<br \/>\n5. <strong>128 GB unificados constituem o limite para hardware consumidor.<\/strong> Acima desse valor, voc\u00ea j\u00e1 est\u00e1 adquirindo hardware de servidor.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Choosing_the_right_quant_for_your_hardware\"><\/span>Escolhendo a quantiza\u00e7\u00e3o certa para seu hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A quantiza\u00e7\u00e3o correta nem sempre \u00e9 'a maior que cabe'. A qualidade importa, e, \u00e0s vezes, um modelo menor com uma quantiza\u00e7\u00e3o melhor supera um modelo maior com uma quantiza\u00e7\u00e3o pior.<\/p>\n<p>Classifica\u00e7\u00e3o aproximada de qualidade (baseada em perplexidade; quanto menor, melhor):<\/p>\n<ul>\n<li><strong>FP16 \/ BF16<\/strong> \u2014 Original. Refer\u00eancia de qualidade base.<\/li>\n<li><strong>Q8_0<\/strong> \u2014 Aumento de ~0,3% na perplexidade. Essencialmente indistingu\u00edvel.<\/li>\n<li><strong>Q6_K<\/strong> \u2014 Aumento de ~0,5%. Indistingu\u00edvel na pr\u00e1tica.<\/li>\n<li><strong>Q5_K_M<\/strong> \u2014 Aumento de ~1,0%. Queda ligeira de qualidade, ainda com qualidade muito alta.<\/li>\n<li><strong>Q4_K_M<\/strong> \u2014 Aumento de ~1,5\u20132,5%. Recomendado para a maioria dos usu\u00e1rios.<\/li>\n<li><strong>Q4_K_S<\/strong> \u2014 Aumento de ~3%. Pior que o Q4_K_M para tamanho semelhante, de forma percept\u00edvel.<\/li>\n<li><strong>Q3_K_M<\/strong> \u2014 Aumento de ~5\u20138%. Sa\u00edda visivelmente afetada.<\/li>\n<li><strong>Q3_K_S<\/strong> \u2014 Aumento de ~10%. Use apenas se o Q4 n\u00e3o couber.<\/li>\n<li><strong>IQ2_XXS<\/strong> \u2014 Aumento de ~15\u201325%. \u00daltimo recurso.<\/li>\n<\/ul>\n<p>Regra geral: <strong>prefira um modelo com menos par\u00e2metros em Q5_K_M a um modelo maior em Q3_K_S<\/strong> para tarefas cotidianas. Um Qwen 32B em Q5 geralmente supera um Llama 3 70B em IQ2_XXS em benchmarks do mundo real, apesar de este \u00faltimo soar mais impressionante no papel.<\/p>\n<p>Exce\u00e7\u00e3o: <strong>tarefas de programa\u00e7\u00e3o e racioc\u00ednio<\/strong> nas quais a vantagem de conhecimento bruto do modelo maior frequentemente sobrevive \u00e0 quantiza\u00e7\u00e3o pesada. Especificamente para gera\u00e7\u00e3o de c\u00f3digo, at\u00e9 mesmo o Q3_K_S de um modelo de 70B pode superar um modelo de 30B em Q5_K_M.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MoE_models_%E2%80%94_the_asterisk\"><\/span>Modelos MoE \u2014 a ressalva<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Modelos Mixture-of-Experts (MoE), como <strong>Mixtral 8x22B<\/strong> e <strong>DeepSeek V3<\/strong> apresentam uma assimetria que confunde iniciantes:<\/p>\n<ul>\n<li><strong>VRAM necess\u00e1ria<\/strong> = par\u00e2metros totais (porque todos os especialistas devem ser mantidos na mem\u00f3ria)<\/li>\n<li><strong>C\u00e1lculo realizado<\/strong> = par\u00e2metros ativos por token (muito menor)<\/li>\n<\/ul>\n<p>O Mixtral 8x22B possui 141 B no total e 39 B ativos. Requer mais de 80 GB de VRAM para rodar, mas sua velocidade por token \u00e9 pr\u00f3xima \u00e0 de um modelo denso de 40 B.<\/p>\n<p>O DeepSeek V3 tem 236 B no total e 21 B ativos. Exige mais de 150 GB de VRAM, mas sua velocidade por token se aproxima da de um modelo denso de 20 B. \u00c9 por isso que o DeepSeek V3 \u00e9 'r\u00e1pido para seu tamanho' \u2014 voc\u00ea paga o custo em VRAM, mas obt\u00e9m um desconto no c\u00e1lculo necess\u00e1rio.<\/p>\n<p>Se seu hardware consegue carregar um modelo MoE, ele costuma ser a melhor escolha. Caso contr\u00e1rio, o modelo denso na mesma classe de par\u00e2metros \u00e9 o que voc\u00ea deve buscar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quick-start_setups_by_budget\"><\/span>Configura\u00e7\u00f5es prontas por faixa de or\u00e7amento<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Para quem busca uma resposta concreta, apresentamos configura\u00e7\u00f5es testadas em cinco faixas or\u00e7ament\u00e1rias em 2026:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Or\u00e7amento<\/th>\n<th>GPU<\/th>\n<th>Melhor modelo<\/th>\n<th>Tokens\/segundo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>$300<\/td>\n<td>RTX 3060 12 GB<\/td>\n<td>Llama 3 8B Q5_K_M<\/td>\n<td>~48<\/td>\n<\/tr>\n<tr>\n<td>$700<\/td>\n<td>RTX 3090 usada<\/td>\n<td>Qwen 2.5 32B Q5_K_M<\/td>\n<td>~28<\/td>\n<\/tr>\n<tr>\n<td>$1,300<\/td>\n<td>RTX 4090 usada<\/td>\n<td>Llama 3 70B Q3_K_S<\/td>\n<td>~13<\/td>\n<\/tr>\n<tr>\n<td>$1,400<\/td>\n<td>2\u00d7 RTX 3090 usadas + NVLink<\/td>\n<td>Llama 3 70B Q4_K_M<\/td>\n<td>~15<\/td>\n<\/tr>\n<tr>\n<td>$2,400<\/td>\n<td>RTX 5090<\/td>\n<td>Llama 3 70B Q5_K_M<\/td>\n<td>~18<\/td>\n<\/tr>\n<tr>\n<td>$5,000<\/td>\n<td>Mac Studio M4 Max 128 GB<\/td>\n<td>Mistral Large 2 Q4<\/td>\n<td>~6<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>A 'melhor faixa de valor' em 2026 continua sendo a RTX 3090 ou 4090 usada \u2014 s\u00e3o as \u00fanicas GPUs consumidoras nas quais a rela\u00e7\u00e3o pre\u00e7o-por-VRAM \u00e9 favor\u00e1vel, e ambas permanecer\u00e3o capazes at\u00e9 pelo menos 2028.<\/p>\n<p>Para uma an\u00e1lise detalhada sobre qual GPU escolher, consulte <a href=\"\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais em 2026<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Quanta VRAM \u00e9 necess\u00e1ria para executar o Llama 3 70B localmente em 2026?<\/h3>\n<p>M\u00ednimo de 24 GB para o Llama 3 70B em Q3_K_S (qualidade bastante comprometida). Com 32 GB, \u00e9 poss\u00edvel executar confortavelmente o Q4_K_M (a quantiza\u00e7\u00e3o recomendada). S\u00e3o necess\u00e1rios 40+ GB para o Q5_K_M. Com 24 GB e contexto de 8 K, praticamente n\u00e3o h\u00e1 margem de manobra; aumentar o contexto para 32 K exige descarga para a CPU ou uma quantiza\u00e7\u00e3o mais agressiva.<\/p>\n<h3>Qual \u00e9 a diferen\u00e7a entre Q4_K_M e Q4_K_S?<\/h3>\n<p>Ambos s\u00e3o quantiza\u00e7\u00f5es de 4 bits do mesmo modelo. O Q4_K_M ('m\u00e9dio') usa 5 bits para alguns grupos cr\u00edticos de pesos, tornando-o ligeiramente maior, mas com qualidade nitidamente superior ao Q4_K_S ('pequeno'). Para VRAM praticamente id\u00eantica, prefere-se o Q4_K_M. O Q4_K_S s\u00f3 faz sentido quando voc\u00ea tenta encaixar um modelo em um or\u00e7amento muito apertado de VRAM.<\/p>\n<h3>Posso executar um LLM maior do que minha VRAM?<\/h3>\n<p>Sim \u2014 usando <strong>descarregamento para a CPU<\/strong>descarga de camadas (offloading), em que algumas camadas do modelo s\u00e3o executadas na CPU, utilizando a mem\u00f3ria RAM do sistema em vez da VRAM da GPU. A penalidade de desempenho \u00e9 severa (5\u201310\u00d7 mais lento), mas permite executar modelos que, de outra forma, n\u00e3o caberiam. \u00c9 pr\u00e1tico para uso espor\u00e1dico, mas doloroso como solu\u00e7\u00e3o principal di\u00e1ria. Tanto o llama.cpp quanto o Ollama suportam isso nativamente por meio da configura\u00e7\u00e3o <code>n_gpu_layers<\/code> .<\/p>\n<h3>O cache KV realmente importa no planejamento de VRAM?<\/h3>\n<p>Sim, especialmente em contextos longos. Para o Llama 3 70B com contexto de 32 K, o cache KV sozinho consome cerca de 5 GB. Se voc\u00ea j\u00e1 estiver no limite da sua VRAM, ocorrer\u00e1 uma falha por falta de mem\u00f3ria (OOM) assim que a conversa se tornar longa. Planeje a aloca\u00e7\u00e3o para o cache KV e considere a quantiza\u00e7\u00e3o Q8 do cache KV (op\u00e7\u00e3o dispon\u00edvel em modernos mecanismos de infer\u00eancia) para reduzi-lo aproximadamente \u00e0 metade.<\/p>\n<h3>Existe alguma maneira de executar o Llama 3 405B em casa?<\/h3>\n<p>Sim, mas voc\u00ea precisa de mais de 200 GB de mem\u00f3ria em quantiza\u00e7\u00f5es utiliz\u00e1veis. Os caminhos realistas para 2026 s\u00e3o: Mac Studio M4 Ultra com 512 GB ($12.000, lento por token, mas funcional); 8\u00d7 RTX 4090 ($13.000, configura\u00e7\u00e3o complexa); Nvidia DIGITS ($3.000, projetado especificamente para essa finalidade); ou CPU + 256 GB de RAM DDR5 com GPU de faixa intermedi\u00e1ria para descarga parcial ($8.000, lento). Veja nosso <a href=\"\/pt\/running-llama-3-405b-at-home-real-cost\/\">guia passo a passo sobre como executar o Llama 3 405B em casa<\/a>.<\/p>\n<h3>Existem novos formatos de quantiza\u00e7\u00e3o para 2026 al\u00e9m do GGUF dos quais devo saber?<\/h3>\n<p>Sim \u2014 <strong>AWQ<\/strong> (Quantiza\u00e7\u00e3o de Pesos com Consci\u00eancia de Ativa\u00e7\u00f5es) e <strong>GPTQ<\/strong> ainda s\u00e3o amplamente utilizados, especialmente em implanta\u00e7\u00f5es com vLLM e TensorRT-LLM. Em alguns casos, oferecem ligeiramente melhor qualidade no mesmo n\u00famero de bits comparados ao GGUF. Para uso local de LLMs por consumidores com llama.cpp \/ Ollama \/ LM Studio, o GGUF permanece dominante em 2026 devido \u00e0 sua simplicidade e amplo suporte nas ferramentas.<\/p>\n<h3>A quantiza\u00e7\u00e3o Q4 afetar\u00e1 minha capacidade de programa\u00e7\u00e3o?<\/h3>\n<p>Menos do que se imagina, mas sim. Para conclus\u00e3o direta de c\u00f3digo, Q4_K_M \u00e9 essencialmente id\u00eantico ao FP16. Para racioc\u00ednio complexo em m\u00faltiplas etapas envolvendo um c\u00f3digo-base inteiro, Q4 ocasionalmente produz l\u00f3gica inferior \u00e0 obtida com Q5+. Se voc\u00ea faz programa\u00e7\u00e3o s\u00e9ria com modelos locais, prefira Q5_K_M e escolha seu hardware para suport\u00e1-lo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclus\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O planejamento de VRAM para LLMs locais em 2026 n\u00e3o \u00e9 complicado, mas recompensa a precis\u00e3o. Escolha primeiro a classe de par\u00e2metros (o tamanho do modelo que oferece a capacidade necess\u00e1ria), depois selecione a menor quantiza\u00e7\u00e3o que forne\u00e7a qualidade aceit\u00e1vel (Q4_K_M geralmente \u00e9 a ideal), adicione ent\u00e3o a estimativa do cache KV para seu comprimento real de contexto e, por fim, dimensione sua GPU adequadamente.<\/p>\n<p>Se voc\u00ea lembrar apenas tr\u00eas n\u00fameros, lembre-se destes:<\/p>\n<ul>\n<li><strong>12 GB<\/strong> executa modelos de 8 B sem problemas.<\/li>\n<li><strong>24 GB<\/strong> executa modelos de 30 B em quantiza\u00e7\u00f5es de boa qualidade e modelos de 70 B de forma desconfort\u00e1vel.<\/li>\n<li><strong>32 GB<\/strong> executa modelos de 70 B em quantiza\u00e7\u00f5es de boa qualidade.<\/li>\n<\/ul>\n<p>Tudo acima de 32 GB entra na categoria de servidores, e tudo abaixo de 12 GB entra na categoria de dispositivos m\u00f3veis\/embedded. A maior parte das atividades com LLMs locais em 2026 ocorre na faixa de 12\u201332 GB, exatamente a faixa das GPUs voltadas para consumidores \u2014 por projeto, e n\u00e3o por coincid\u00eancia.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Artigos relacionados<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/pt\/claude-opus-4-8-vs-claude-sonnet-4-6\/\">Claude Opus 4.8 vs Claude Sonnet 4.6: Specs, Pricing &amp; Which to Choose (2026)<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/open-source-llm-leaderboard-hardware-2026\/\">Ranking de Modelos de Linguagem de C\u00f3digo Aberto 2026: Hardware Necess\u00e1rio para Executar Cada Modelo Principal<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/claude-5-new-ai-models-june-2026\/\">Existe um Claude 5? Claude Fable 5 e todos os principais modelos de IA de junho de 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/pt\/veo-3-vs-kling-3-for-ai-video-2026\/\">Veo 3.1 vs Kling 3.0 para v\u00eddeo por IA em 2026: qual deles vence em realismo?<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>The complete VRAM cheat sheet for every major open LLM in 2026 \u2014 at every common quantization level \u2014 plus a matrix showing which models fit on 12, 16, 24, 32, 48, and 80 GB GPUs.<\/p>","protected":false},"author":1,"featured_media":2002,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[247],"tags":[289,290,288,287,285,286],"class_list":["post-264","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-benchmarks","tag-ggml","tag-gguf","tag-gpu-vram-for-ai","tag-llama-3-vram","tag-llm-vram","tag-quantization"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/264","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=264"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/264\/revisions"}],"predecessor-version":[{"id":1458,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/264\/revisions\/1458"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2002"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=264"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=264"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=264"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}