{"id":2605,"date":"2026-09-09T20:14:45","date_gmt":"2026-09-09T20:14:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2605"},"modified":"2026-09-09T20:14:45","modified_gmt":"2026-09-09T20:14:45","slug":"gguf-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/gguf-models\/","title":{"rendered":"Modelos GGUF: O que s\u00e3o e como execut\u00e1-los"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF \u00e9 um formato de cont\u00eainer de arquivo \u00fanico para modelos quantizados<\/strong>, criado para <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a>. Um <code>.gguf<\/code> \u00fanico arquivo cont\u00e9m os pesos, o tokenizador, o modelo de conversa\u00e7\u00e3o (chat template) e os metadados \u2014 sem pasta de configura\u00e7\u00e3o, sem arquivos separados do tokenizador.<\/li>\n<li><strong>GGUF models are what Ollama, LM Studio, KoboldCpp, Jan and llama.cpp actually load.<\/strong> Se voc\u00ea executa um modelo localmente em hardware de consumo, quase certamente est\u00e1 executando um modelo GGUF.<\/li>\n<li><strong>Escolha padr\u00e3o: <code>Q4_K_M<\/code>.<\/strong> Aproximadamente 0,6 GB de arquivo por bilh\u00e3o de par\u00e2metros \u2014 um modelo de 8B fica pr\u00f3ximo de 5 GB, o que corresponde \u00e0 cifra de ~5 GB em 4 bits listada pela <a href=\"https:\/\/convly.ai\/pt\/models\/\">base de dados de modelos Convly<\/a> para o Llama 3.1 8B.<\/li>\n<li><strong>GGUF destina-se \u00e0 infer\u00eancia local para um \u00fanico usu\u00e1rio.<\/strong> For concurrent serving use safetensors with vLLM or an API instead.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (GPT-Generated Unified Format) \u00e9 o formato de arquivo usado pelo ecossistema llama.cpp\/ggml para armazenar um modelo pronto para infer\u00eancia. Um \u00fanico <code>.gguf<\/code> arquivo cont\u00e9m os tensores quantizados, al\u00e9m de tudo necess\u00e1rio para us\u00e1-los: vocabul\u00e1rio, configura\u00e7\u00f5es do tokenizador, modelo de conversa\u00e7\u00e3o (chat template) e metadados da arquitetura. Ele substituiu o formato mais antigo GGML em agosto de 2023 e \u00e9 agora o padr\u00e3o de fato para executar modelos em laptops, desktops e CPUs.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa1d0830b63d\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa1d0830b63d\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#What_is_actually_inside_a_gguf_file\" >O que realmente h\u00e1 dentro de um arquivo .gguf<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#How_to_read_a_GGUF_filename\" >Como ler o nome de um arquivo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Sizing_which_GGUF_models_fit_your_GPU\" >Dimensionamento: quais modelos GGUF cabem na sua GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Where_to_download_GGUF_models\" >Onde baixar modelos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Running_GGUF_models_on_Linux\" >Executando modelos GGUF no Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Running_GGUF_models_on_macOS\" >Executando modelos GGUF no macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Running_GGUF_models_on_Windows\" >Executando modelos GGUF no Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Loading_an_arbitrary_GGUF_into_Ollama\" >Carregando um GGUF arbitr\u00e1rio no Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#When_GGUF_is_the_wrong_answer\" >Quando GGUF n\u00e3o \u00e9 a solu\u00e7\u00e3o adequada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/pt\/gguf-models\/#Frequently_asked_questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_is_actually_inside_a_gguf_file\"><\/span>O que realmente h\u00e1 dentro de um arquivo .gguf<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Um arquivo GGUF \u00e9 composto por um cabe\u00e7alho, um bloco de metadados com pares chave-valor e, em seguida, os dados dos tensores. Os metadados s\u00e3o a parte que realmente importa na pr\u00e1tica \u2014 \u00e9 por isso que um modelo GGUF n\u00e3o requer arquivos auxiliares. A <a href=\"https:\/\/huggingface.co\/docs\/hub\/en\/gguf\" rel=\"noopener\" target=\"_blank\">documenta\u00e7\u00e3o GGUF<\/a> do Hugging Face descreve a estrutura e o visualizador integrado de metadados GGUF do Hub, que permite inspecionar o tipo de quantiza\u00e7\u00e3o, o comprimento do contexto e o modelo de conversa\u00e7\u00e3o (chat template) de um arquivo antes de baixar v\u00e1rios gigabytes dele.<\/p>\n<p>Chaves t\u00edpicas de metadados incluem a arquitetura (<code>llama<\/code>, <code>qwen3<\/code>, <code>gemma3<\/code>, <code>phi3<\/code>), o comprimento de contexto de treinamento, as configura\u00e7\u00f5es RoPE, o vocabul\u00e1rio completo e o modelo de conversa\u00e7\u00e3o Jinja. Um carregador l\u00ea esse bloco e se configura automaticamente; voc\u00ea n\u00e3o precisa passar manualmente um tokenizador ou um formato de prompt.<\/p>\n<h3>GGUF versus safetensors<\/h3>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Runtime principal<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>PyTorch, vLLM, Transformers, TGI<\/td>\n<\/tr>\n<tr>\n<td>Arquivos por modelo<\/td>\n<td>Um (ou fragmentos numerados)<\/td>\n<td>Pesos mais pasta de configura\u00e7\u00e3o\/tokenizador<\/td>\n<\/tr>\n<tr>\n<td>Quantiza\u00e7\u00e3o<\/td>\n<td>Incorporada (Q4_K_M, Q8_0, IQ\u2026)<\/td>\n<td>Normalmente FP16\/BF16, ou variantes GPTQ\/AWQ<\/td>\n<\/tr>\n<tr>\n<td>CPU + descarga parcial para GPU<\/td>\n<td>Sim, objetivo central de projeto<\/td>\n<td>Limitado e lento<\/td>\n<\/tr>\n<tr>\n<td>Atendimento concorrente em lote<\/td>\n<td>Fraco<\/td>\n<td>Fortes<\/td>\n<\/tr>\n<tr>\n<td>Ajuste fino<\/td>\n<td>N\u00e3o (converta de volta primeiro)<\/td>\n<td>Sim<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_a_GGUF_filename\"><\/span>Como ler o nome de um arquivo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Os arquivos normalmente s\u00e3o nomeados <code>Modelo-Nome-8B-Instruct-Q4_K_M.gguf<\/code>. O sufixo indica a combina\u00e7\u00e3o de quantiza\u00e7\u00e3o. O n\u00famero representa a largura nominal em bits; <code>_K<\/code> significa k-quants, que mant\u00eam os tensores de aten\u00e7\u00e3o e incorpora\u00e7\u00e3o (embedding) com maior precis\u00e3o do que os pesos principais da camada feed-forward; <code>S<\/code>\/<code>M<\/code>\/<code>L<\/code> s\u00e3o variantes pequena\/m\u00e9dia\/grande dessa combina\u00e7\u00e3o.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Aprox. bits\/peso<\/th>\n<th>Tamanho aproximado, modelo de 8B<\/th>\n<th>Quando us\u00e1-lo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>~8,5 GB<\/td>\n<td>Refer\u00eancia quase sem perdas; apenas para modelos pequenos<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>~6,6 GB<\/td>\n<td>Voc\u00ea tem VRAM de sobra<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>~5,7 GB<\/td>\n<td>Padr\u00e3o com vi\u00e9s para qualidade<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.9<\/td>\n<td>~4,9 GB<\/td>\n<td><strong>O padr\u00e3o habitual<\/strong><\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~4.5<\/td>\n<td>~4,5 GB<\/td>\n<td>Legado; alguns aceleradores preferem esse formato<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>~4,0 GB<\/td>\n<td>Comprimir um modelo maior em pouca VRAM<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~2,5\u20133,4<\/td>\n<td>~2,5\u20133,4 GB<\/td>\n<td>\u00daltimo recurso; degrada\u00e7\u00e3o percept\u00edvel<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Trate a coluna de bits por peso como aproximada. Os tamanhos reais variam conforme a arquitetura do modelo (um vocabul\u00e1rio amplo inflaciona os tensores de embedding) e conforme a vers\u00e3o do llama.cpp, pois as combina\u00e7\u00f5es de quantiza\u00e7\u00e3o s\u00e3o ajustadas ao longo do tempo. A fam\u00edlia <code>IQ<\/code> (de IQ2_XXS at\u00e9 IQ4_NL) usa calibra\u00e7\u00e3o por matriz de import\u00e2ncia para manter melhor desempenho em larguras de bit muito baixas, e quantizadores como Bartowski e Unsloth publicam variantes IQ al\u00e9m dos K-quants padr\u00e3o.<\/p>\n<p>O consenso da comunidade \u2014 n\u00e3o uma medi\u00e7\u00e3o da Convly \u2014 \u00e9 que Q4_K_M representa o ponto ideal e que a qualidade cai acentuadamente abaixo de cerca de 3 bits por peso: modelos menores degradam-se mais rapidamente do que modelos maiores na mesma quantiza\u00e7\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Sizing_which_GGUF_models_fit_your_GPU\"><\/span>Dimensionamento: quais modelos GGUF cabem na sua GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O tamanho do arquivo \u00e9 o piso, n\u00e3o o total. Adicione o cache KV para seu comprimento de contexto, al\u00e9m de cerca de 500 MB\u20131 GB de sobrecarga. Essas cifras de 4 bits v\u00eam do <a href=\"https:\/\/convly.ai\/pt\/models\/\">base de dados de modelos Convly<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>VRAM em 4 bits<\/th>\n<th>Contexto<\/th>\n<th>GPU realista<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>~3 GB<\/td>\n<td>128K<\/td>\n<td>Qualquer placa com 6 GB, GPU integrada<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 GB<\/td>\n<td>32K<\/td>\n<td>Placa com 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 GB<\/td>\n<td>128K<\/td>\n<td>Placa com 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 14B<\/td>\n<td>~9 GB<\/td>\n<td>128K<\/td>\n<td>Placa com 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 GB<\/td>\n<td>16K<\/td>\n<td>Placa com 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 27B<\/td>\n<td>~16 GB<\/td>\n<td>128K<\/td>\n<td>Placa com 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>~20 GB<\/td>\n<td>128K<\/td>\n<td>Placa com 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 GB<\/td>\n<td>128K<\/td>\n<td>2\u00d724 GB ou mem\u00f3ria unificada de 48 GB<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 (completo)<\/td>\n<td>~400 GB<\/td>\n<td>128K<\/td>\n<td>Apenas em servidores multi-GPU<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Mixture-of-experts models are the trap here. Qwen3 30B-A3B activates only ~3B parameters per token but still needs all ~18 GB resident. At the extreme, the database puts Kimi K3 at ~1.4 TB at 4-bit \u2014 a GGUF exists in principle, but no single machine you own will hold it. For an exact figure at your context length, use the <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> ou a an\u00e1lise detalhada por modelo em <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para todos os principais modelos de linguagem (LLM)<\/a>. Se voc\u00ea ainda est\u00e1 escolhendo hardware, <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para LLMs locais<\/a> aborda a rela\u00e7\u00e3o custo-benef\u00edcio entre VRAM e pre\u00e7o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_download_GGUF_models\"><\/span>Onde baixar modelos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Hugging Face<\/strong> \u2014 filtre a lista de modelos com <a href=\"https:\/\/huggingface.co\/models?library=gguf\" rel=\"noopener\" target=\"_blank\">library=gguf<\/a>. A maioria dos reposit\u00f3rios fornece todas as quantiza\u00e7\u00f5es em um \u00fanico reposit\u00f3rio; baixe apenas o arquivo necess\u00e1rio, n\u00e3o o reposit\u00f3rio inteiro.<\/li>\n<li><strong>biblioteca do Ollama<\/strong> \u2014 <a href=\"https:\/\/ollama.com\/library\" rel=\"noopener\" target=\"_blank\">ollama.com\/library<\/a> oferece GGUF pr\u00e9-empacotados com o modelo de conversa\u00e7\u00e3o j\u00e1 configurado. Consulte o <a href=\"https:\/\/convly.ai\/pt\/ollama-models-list-2026\/\">Lista de modelos do Ollama<\/a>.<\/li>\n<li><strong>LM Studio<\/strong> \u2014 a guia Descobrir do aplicativo pesquisa reposit\u00f3rios GGUF no Hugging Face e indica quais quantiza\u00e7\u00f5es cabem na RAM\/VRAM detectada do seu sistema. Passo a passo: <a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">Guia completo do LM Studio<\/a>.<\/li>\n<\/ul>\n<p>Modelos grandes chegam fragmentados como <code>model-00001-of-00003.gguf<\/code> e assim por diante. Baixe todos os fragmentos na mesma pasta e aponte o carregador para o fragmento 00001 \u2014 ele localizar\u00e1 automaticamente os demais.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Linux\"><\/span>Executando modelos GGUF no Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Compile o llama.cpp com suporte CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j<\/code><\/pre>\n<p>Os bin\u00e1rios ficam em <code>build\/bin\/<\/code>. Inicie um servidor compat\u00edvel com OpenAI:<\/p>\n<pre><code>.\/build\/bin\/llama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080<\/code><\/pre>\n<p><code>-ngl<\/code> (<code>--n-gpu-layers<\/code>) \u00e9 o controle de descarga (offload): <code>99<\/code> significa \"todos os layers na GPU\", <code>0<\/code> significa CPU apenas, e valores intermedi\u00e1rios dividem o modelo quando ele n\u00e3o cabe inteiramente na GPU. <code>-c<\/code> define o contexto; mant\u00ea-lo no contexto total treinado do modelo pode consumir mais VRAM do que os pr\u00f3prios pesos. O endpoint resultante \u00e9 <code>http:\/\/localhost:8080\/v1\/chat\/completions<\/code>.<\/p>\n<p>Duas ressalvas sobre vers\u00f5es: a flag CMake era <code>LLAMA_CUBLAS<\/code> nas vers\u00f5es anteriores, e os bin\u00e1rios foram renomeados (<code>main<\/code> \u2192 <code>llama-cli<\/code>, <code>server<\/code> \u2192 <code>llama-server<\/code>) em 2024. Verifique o README do reposit\u00f3rio para a vers\u00e3o que voc\u00ea clonou. Para GPUs AMD ou Intel, substitua a flag do backend ROCm\/Vulkan\/SYCL documentada l\u00e1, em vez de tentar adivinhar.<\/p>\n<p>Se voc\u00ea usar o Ollama em vez disso, os modelos ficam em <code>\/usr\/share\/ollama\/.ollama\/models<\/code> quando ele \u00e9 executado como servi\u00e7o do sistema, ou <code>~\/.ollama\/models<\/code> para uma instala\u00e7\u00e3o por usu\u00e1rio. Veja <a href=\"https:\/\/convly.ai\/pt\/how-to-install-ollama-2026\/\">como instalar o Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_macOS\"><\/span>Executando modelos GGUF no macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O Apple Silicon \u00e9 incomumente eficiente com GGUF porque a mem\u00f3ria unificada permite que a GPU acesse a maior parte da RAM do sistema \u2014 um Mac de 64 GB pode carregar um modelo de 70B em 4 bits com cerca de 40 GB, que exigiria duas placas de PC com 24 GB cada.<\/p>\n<pre><code>brew install llama.cpp\nllama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 --port 8080<\/code><\/pre>\n<p>A descarga para Metal est\u00e1 habilitada na compila\u00e7\u00e3o do Homebrew, portanto, normalmente voc\u00ea n\u00e3o precisa <code>-ngl<\/code>. O macOS limita quanto de RAM a GPU pode alocar (ajust\u00e1vel via um <code>iogpu<\/code> sysctl, cujo valor varia conforme a vers\u00e3o do macOS), ent\u00e3o deixe uma margem de seguran\u00e7a para o sistema operacional. O Ollama armazena modelos em <code>~\/.ollama\/models<\/code>; o LM Studio usa <code>~\/.lmstudio\/models<\/code> nas vers\u00f5es atuais e <code>~\/.cache\/lm-studio\/models<\/code> nas vers\u00f5es mais antigas \u2014 a guia Meus Modelos exibe e permite alterar o caminho real.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Windows\"><\/span>Executando modelos GGUF no Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tr\u00eas abordagens, da mais simples \u00e0 mais complexa:<\/p>\n<ol>\n<li><strong>LM Studio<\/strong> \u2014 instalador gr\u00e1fico, busca integrada de modelos e alternador para servidor local. A melhor op\u00e7\u00e3o padr\u00e3o para usu\u00e1rios n\u00e3o desenvolvedores.<\/li>\n<li><strong>Ollama<\/strong> \u2014 instalador nativo para Windows; os modelos s\u00e3o salvos em <code>C:\\Users&lt;voc\u00ea&gt;\\.ollama\\models<\/code>. Defina a vari\u00e1vel de ambiente <code>OLLAMA_MODELS<\/code> para mov\u00ea-los para fora da unidade do sistema. Contexto adicional: <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">o que \u00e9 Ollama<\/a>.<\/li>\n<li><strong>Bin\u00e1rios pr\u00e9-compilados do llama.cpp<\/strong> \u2014 a p\u00e1gina de Lan\u00e7amentos no GitHub publica builds compactadas para Windows por backend (CUDA, Vulkan, CPU). Descompacte e execute <code>llama-server.exe -m model.gguf -ngl 99<\/code> no PowerShell. Escolha a build CUDA para GPUs NVIDIA; o Vulkan \u00e9 a op\u00e7\u00e3o segura e compat\u00edvel com fornecedores diversos (AMD e Intel Arc).<\/li>\n<\/ol>\n<p>Detalhes espec\u00edficos do Windows: a verifica\u00e7\u00e3o em tempo real do Windows Defender reduz significativamente o tempo de carregamento inicial de arquivos de v\u00e1rios gigabytes, e executar o llama.cpp dentro do WSL2 consome uma parcela da mem\u00f3ria RAM destinada \u00e0 m\u00e1quina virtual. As compila\u00e7\u00f5es nativas para Windows geralmente representam o caminho mais simples.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_an_arbitrary_GGUF_into_Ollama\"><\/span>Carregando um GGUF arbitr\u00e1rio no Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Vers\u00f5es recentes do Ollama conseguem baixar diretamente do Hugging Face:<\/p>\n<pre><code>ollama run hf.co\/&lt;user&gt;\/&lt;repo&gt;:Q4_K_M<\/code><\/pre>\n<p>Para um arquivo local, crie um Modelfile no mesmo diret\u00f3rio:<\/p>\n<pre><code>FROM .\/model-Q4_K_M.gguf<\/code><\/pre>\n<p>ent\u00e3o <code>ollama create my-model -f Modelfile<\/code> e <code>ollama run my-model<\/code>. Se o GGUF n\u00e3o incluir um modelo de conversa\u00e7\u00e3o utiliz\u00e1vel, adicione uma linha <code>TEMPLATE<\/code> e <code>PARAMETER stop<\/code> \u2014 as diretivas exatas suportadas no Modelfile evolu\u00edram ao longo das vers\u00f5es, portanto consulte <code>ollama help create<\/code> para verificar as op\u00e7\u00f5es dispon\u00edveis na sua vers\u00e3o. Sele\u00e7\u00f5es recomendadas: <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores LLMs locais para Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_is_the_wrong_answer\"><\/span>Quando GGUF n\u00e3o \u00e9 a solu\u00e7\u00e3o adequada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF optimizes one user at a time. Serving many concurrent requests, or needing tensor parallelism across GPUs, points to safetensors with vLLM or SGLang. And running locally is not automatically cheaper: hosted Llama 3.3 70B is $0.10 in \/ $0.32 out per 1M tokens, while frontier hosted models like Claude Sonnet 5 sit at $2.00 in \/ $10.00 out per 1M tokens for 1M context. Run your own volume through the <a href=\"https:\/\/convly.ai\/pt\/ai-api-cost-calculator\/\">Calculadora de custos de API<\/a> e o <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de ponto de equil\u00edbrio entre hospedagem local e uso de API<\/a> antes de comprar uma GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>O que significa GGUF e como ele difere do GGML?<\/h3>\n<p>GGUF significa GPT-Generated Unified Format (Formato Unificado Gerado por GPT). O GGML foi o formato anterior do mesmo projeto; ele perdia compatibilidade sempre que novos metadados eram necess\u00e1rios. O GGUF introduziu um bloco extens\u00edvel de metadados baseado em pares chave-valor, permitindo adicionar novas arquiteturas e op\u00e7\u00f5es sem invalidar arquivos antigos. Arquivos <code>.bin<\/code> GGML anteriores ao GGUF n\u00e3o s\u00e3o mais carregados pela vers\u00e3o atual do llama.cpp.<\/p>\n<h3>Qual quantiza\u00e7\u00e3o devo baixar?<\/h3>\n<p>Comece com Q4_K_M. Se o modelo ainda deixar v\u00e1rios GB de VRAM livres, avance para Q5_K_M ou Q6_K. Se n\u00e3o couber na mem\u00f3ria dispon\u00edvel, prefira um modelo menor em Q4_K_M em vez do mesmo modelo em Q2_K \u2014 um modelo de 14B em 4 bits geralmente supera um modelo de 32B distorcido para 2 bits. Verifique a adequa\u00e7\u00e3o usando o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> no comprimento de contexto pretendido.<\/p>\n<h3>Posso executar modelos GGUF sem uma GPU?<\/h3>\n<p>Yes \u2014 CPU-only inference is what GGUF was built for. Speed is bound by memory bandwidth, so expect single-digit tokens per second for a 7B\u20138B model at Q4_K_M on typical dual-channel desktop RAM, and slower for anything larger. Small models like Gemma 3 4B (~3 GB at 4-bit) are the practical CPU-only choice.<\/p>\n<h3>Posso converter um modelo do Hugging Face para GGUF eu mesmo?<\/h3>\n<p>Sim. O llama.cpp inclui um script de convers\u00e3o (<code>convert_hf_to_gguf.py<\/code> nas vers\u00f5es atuais; o nome do arquivo usava h\u00edfens nas vers\u00f5es anteriores) que gera um GGUF em F16, seguido pela compress\u00e3o desse arquivo pelo bin\u00e1rio <code>llama-quantize<\/code> para uma quantiza\u00e7\u00e3o alvo. Consulte a ajuda do script com <code>--help<\/code> na c\u00f3pia que voc\u00ea clonou, e confirme se sua arquitetura \u00e9 suportada antes de iniciar \u2014 arquiteturas n\u00e3o suportadas falham durante a convers\u00e3o.<\/p>\n<h3>Os modelos GGUF suportam vis\u00e3o ou chamadas de ferramentas?<\/h3>\n<p>A chamada de ferramentas funciona onde o modelo define essa funcionalidade no seu modelo de conversa\u00e7\u00e3o (chat template) e seu carregador respeita esse modelo. Modelos multimodais exigem um segundo arquivo \u2014 um GGUF <code>mmproj<\/code> que cont\u00e9m o projetor visual \u2014 carregado em conjunto com os pesos textuais. As ferramentas multimodais no llama.cpp j\u00e1 foram renomeadas e reorganizadas mais de uma vez, portanto siga sempre a documenta\u00e7\u00e3o atual do reposit\u00f3rio, e n\u00e3o tutoriais antigos.<\/p>\n<h3>A quantiza\u00e7\u00e3o altera a janela de contexto?<\/h3>\n<p>N\u00e3o. O contexto \u00e9 uma propriedade do modelo, n\u00e3o da quantiza\u00e7\u00e3o: o Llama 3.3 70B tem 128K e o Llama 4 Scout tem 10M, independentemente de voc\u00ea execut\u00e1-lo em F16 ou Q4_K_M. O que muda \u00e9 se voc\u00ea consegue acomodar o cache KV necess\u00e1rio para aquele contexto na mem\u00f3ria dispon\u00edvel. Compare contexto e pre\u00e7os entre modelos na <a href=\"https:\/\/convly.ai\/pt\/llm-leaderboard\/\">Ranking de LLMs<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is a single-file container format for quantized models, created for llama.cpp. One .gguf file holds the weights, the tokenizer, [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2606,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2605","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2605","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2605"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2605\/revisions"}],"predecessor-version":[{"id":2607,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2605\/revisions\/2607"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2606"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2605"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2605"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2605"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}