{"id":2103,"date":"2026-08-03T20:03:24","date_gmt":"2026-08-03T20:03:24","guid":{"rendered":"https:\/\/convly.ai\/?p=2103"},"modified":"2026-08-03T20:03:24","modified_gmt":"2026-08-03T20:03:24","slug":"what-is-gguf-format-explained","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/","title":{"rendered":"O que \u00e9 GGUF? O formato de arquivo para LLMs por tr\u00e1s do Ollama e do llama.cpp, explicado"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF \u00e9 o formato de arquivo usado para executar modelos de linguagem de grande porte (LLM) localmente.<\/strong> It packs a model&#8217;s weights, tokenizer and configuration into a single binary file that llama.cpp, Ollama, LM Studio and most other local-LLM tools load directly.<\/li>\n<li><strong>Substituiu o GGML em agosto de 2023<\/strong> porque os arquivos GGML deixavam de funcionar sempre que o formato era alterado. O GGUF \u00e9 versionado e extens\u00edvel, de modo que arquivos antigos continuam operacionais.<\/li>\n<li><strong>O sufixo indica o n\u00edvel de quantiza\u00e7\u00e3o.<\/strong> Q4_K_M (~4,9 GB para um modelo de 8B) \u00e9 a configura\u00e7\u00e3o padr\u00e3o equilibrada entre qualidade e tamanho; Q8_0 \u00e9 quase sem perdas, com cerca de 8,5 GB; F16 \u00e9 n\u00e3o quantizado.<\/li>\n<li><strong>Regra pr\u00e1tica:<\/strong> escolha a maior quantiza\u00e7\u00e3o cujo tamanho do arquivo caiba na sua VRAM, reservando 1\u20132 GB adicionais para o contexto.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (geralmente expandido como GPT-Generated Unified Format, ou Formato Unificado Gerado por GPT) \u00e9 um formato de arquivo bin\u00e1rio para armazenar modelos de linguagem de grande porte: os pesos, o tokenizador e todos os metadados de configura\u00e7\u00e3o em um \u00fanico arquivo autocontido. \u00c9 o formato nativo do <strong>llama.cpp<\/strong>, e \u00e9 o que <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, KoboldCpp, Jan e a maioria das outras aplica\u00e7\u00f5es locais para LLMs efetivamente executam. Se voc\u00ea j\u00e1 baixou um arquivo com a extens\u00e3o <code>.gguf<\/code>, ou puxou um modelo com <code>ollama run<\/code>, voc\u00ea estava utilizando esse formato.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a71289a641da\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a71289a641da\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#What_a_GGUF_file_actually_contains\" >O que um arquivo GGUF realmente cont\u00e9m<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#Why_GGUF_replaced_GGML\" >Por que o GGUF substituiu o GGML<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#How_to_read_the_quantisation_suffixes\" >Como interpretar os sufixos de quantiza\u00e7\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#Picking_a_quantisation_for_your_VRAM\" >Escolhendo uma quantiza\u00e7\u00e3o adequada \u00e0 sua VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#GGUF_vs_safetensors\" >GGUF versus safetensors<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#Where_GGUF_files_come_from\" >De onde v\u00eam os arquivos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/what-is-gguf-format-explained\/#Frequently_asked_questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_a_GGUF_file_actually_contains\"><\/span>O que um arquivo GGUF realmente cont\u00e9m<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Um arquivo GGUF come\u00e7a com os quatro bytes ASCII <code>GGUF<\/code>, seguidos por um n\u00famero de vers\u00e3o, uma se\u00e7\u00e3o de metadados em par chave-valor e, em seguida, os pr\u00f3prios tensores. Os metadados representam a decis\u00e3o de projeto mais importante: eles armazenam a arquitetura do modelo, o comprimento m\u00e1ximo de contexto, o vocabul\u00e1rio do tokenizador, o modelo de conversa (chat template) e os detalhes da quantiza\u00e7\u00e3o como chaves nomeadas, permitindo que um ambiente de execu\u00e7\u00e3o carregue qualquer arquivo GGUF sem necessitar de um arquivo separado <code>config.json<\/code> ou arquivos de tokenizador ao lado dele.<\/p>\n<p>Tr\u00eas consequ\u00eancias pr\u00e1ticas decorrem desse projeto:<\/p>\n<ul>\n<li><strong>Um \u00fanico arquivo representa o modelo inteiro.<\/strong> Voc\u00ea pode copiar um arquivo <code>.gguf<\/code> entre m\u00e1quinas e ele funcionar\u00e1 imediatamente. (Modelos muito grandes s\u00e3o \u00e0s vezes divididos em partes numeradas, como <code>-00001-of-00002.gguf<\/code>, mas isso ainda corresponde logicamente a um \u00fanico modelo.)<\/li>\n<li><strong>\u00c9 mape\u00e1vel na mem\u00f3ria.<\/strong> Os ambientes de execu\u00e7\u00e3o podem usar <code>mmap<\/code> o arquivo e carregar os pesos sob demanda por pagina\u00e7\u00e3o, o que torna o carregamento r\u00e1pido e permite que modelos maiores que a mem\u00f3ria RAM dispon\u00edvel sejam inicializados.<\/li>\n<li><strong>A quantiza\u00e7\u00e3o est\u00e1 incorporada ao formato.<\/strong> Um arquivo GGUF armazena pesos j\u00e1 comprimidos com 2\u20138 bits por peso, raz\u00e3o pela qual um modelo de 8 bilh\u00f5es de par\u00e2metros pode ter apenas 4,9 GB em vez de 16 GB.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_replaced_GGML\"><\/span>Por que o GGUF substituiu o GGML<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de agosto de 2023, o llama.cpp usava um formato chamado GGML (nomeado ap\u00f3s a biblioteca de tensores subjacente). O GGML funcionava, mas tinha um defeito estrutural: seu layout de arquivo era r\u00edgido e n\u00e3o versionado. Toda vez que o llama.cpp adicionava uma nova funcionalidade \u2014 novas arquiteturas, m\u00e9todos de quantiza\u00e7\u00e3o aprimorados, par\u00e2metros de escalonamento RoPE \u2014 o formato precisava ser alterado, e todos os arquivos de modelos existentes em todos os discos r\u00edgidos deixavam de funcionar. Em poucos meses, os usu\u00e1rios tiveram de baixar novamente ou converter novamente toda a sua cole\u00e7\u00e3o de modelos diversas vezes.<\/p>\n<p>O GGUF, introduzido pelo projeto llama.cpp em agosto de 2023, resolveu esse problema com duas mudan\u00e7as:<\/p>\n<ul>\n<li><strong>Versionamento.<\/strong> O arquivo declara explicitamente sua vers\u00e3o de formato, permitindo que os leitores saibam exatamente como analis\u00e1-lo.<\/li>\n<li><strong>Metadados extens\u00edveis no formato chave-valor.<\/strong> Novas informa\u00e7\u00f5es (um novo campo de arquitetura, um modelo de conversa\u00e7\u00e3o, um hiperpar\u00e2metro adicional) s\u00e3o simplesmente novas chaves. Arquivos antigos sem essa chave continuam carreg\u00e1veis; arquivos novos com ela funcionam em ambientes de execu\u00e7\u00e3o atualizados. Nada \u00e9 quebrado retroativamente.<\/li>\n<\/ul>\n<p>O llama.cpp descartou o suporte ao GGML logo ap\u00f3s essa mudan\u00e7a, e o ecossistema seguiu o mesmo caminho. Hoje, GGML sobrevive apenas como nome da biblioteca de tensores subjacente; se voc\u00ea encontrar um arquivo de modelo com extens\u00e3o <code>.ggml<\/code> ou <code>.bin<\/code> de 2023, ele n\u00e3o ser\u00e1 carregado por nenhuma ferramenta atual, devendo-se baixar, em vez disso, uma vers\u00e3o no formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_the_quantisation_suffixes\"><\/span>Como interpretar os sufixos de quantiza\u00e7\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Todo nome de arquivo GGUF inclui um sufixo como <code>Q4_K_M<\/code> que descreve o grau de compress\u00e3o aplicado aos pesos. O padr\u00e3o \u00e9 o seguinte:<\/p>\n<ul>\n<li><strong>O n\u00famero ap\u00f3s Q<\/strong> indica aproximadamente os bits por peso: Q4 \u2248 4 bits, Q8 \u2248 8 bits. Menos bits significam um arquivo menor e qualidade reduzida.<\/li>\n<li><strong>_K<\/strong> indica os m\u00e9todos mais recentes de \"k-quant\", que alocam bits adicionais para os tensores mais relevantes \u00e0 qualidade da sa\u00edda. Para o mesmo tamanho de arquivo, uma quantiza\u00e7\u00e3o K supera o estilo anterior.<\/li>\n<li><strong>_S \/ _M \/ _L<\/strong> (pequeno\/m\u00e9dio\/grande) s\u00e3o variantes dentro de uma mesma fam\u00edlia K \u2014 <code>_M<\/code> mant\u00e9m alguns tensores mais sens\u00edveis com maior precis\u00e3o do que <code>_S<\/code>.<\/li>\n<li><strong>_0<\/strong> (como em <code>Q8_0<\/code>, <code>Q4_0<\/code>) indica a antiga e mais simples quantiza\u00e7\u00e3o por blocos. <code>Q8_0<\/code> ainda \u00e9 amplamente utilizada porque, com 8 bits, o m\u00e9todo simples j\u00e1 \u00e9 praticamente sem perdas; <code>Q4_0<\/code> est\u00e1 quase obsoleto \u2014 prefira os prefixos <code>Q4_K_M<\/code>.<\/li>\n<li><strong>IQ<\/strong> (como<code>IQ2_M<\/code>, <code>IQ3_XS<\/code>\u2026), que s\u00e3o \"i-quants\" constru\u00eddos com uma matriz de import\u00e2ncia, usados para comprimir modelos abaixo de 4 bits com menos degrada\u00e7\u00e3o do que as alternativas.<\/li>\n<li><strong>F16 \/ BF16 \/ F32<\/strong> indicam pesos n\u00e3o quantizados de 16 ou 32 bits \u2014 a qualidade de refer\u00eancia, com o maior tamanho poss\u00edvel.<\/li>\n<\/ul>\n<p>A seguir, apresentamos os custos pr\u00e1ticos das op\u00e7\u00f5es mais comuns, usando modelos instrucionais da classe Llama de 8B como exemplo (os tamanhos s\u00e3o aproximados e variam ligeiramente conforme o modelo):<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Tamanho do arquivo (modelo de 8B)<\/th>\n<th>Qualidade em rela\u00e7\u00e3o a F16<\/th>\n<th>Quando usar<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F16<\/td>\n<td>~16,1 GB<\/td>\n<td>Refer\u00eancia<\/td>\n<td>Testes comparativos, quantiza\u00e7\u00e3o adicional; raramente vale a pena executar<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8,5 GB<\/td>\n<td>Praticamente indistingu\u00edvel<\/td>\n<td>Voc\u00ea tem VRAM suficiente e deseja a m\u00e1xima qualidade<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6,6 GB<\/td>\n<td>Perda negligenci\u00e1vel<\/td>\n<td>Excelente qualidade com uma redu\u00e7\u00e3o significativa de tamanho<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5,7 GB<\/td>\n<td>Perda muito pequena<\/td>\n<td>Bom equil\u00edbrio<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4,9 GB<\/td>\n<td>Perda pequena, geralmente aceit\u00e1vel<\/td>\n<td><strong>Padr\u00e3o padr\u00e3o.<\/strong> Melhor rela\u00e7\u00e3o qualidade-por-gigabyte para a maioria das pessoas<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~4,0 GB<\/td>\n<td>Degrada\u00e7\u00e3o percept\u00edvel<\/td>\n<td>Apenas quando o Q4 realmente n\u00e3o cabe<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~3,2 GB<\/td>\n<td>Degrada\u00e7\u00e3o significativa<\/td>\n<td>\u00daltimo recurso; um modelo menor em Q4 costuma ser melhor<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Duas regras \u00fateis: a quantiza\u00e7\u00e3o prejudica mais modelos pequenos do que grandes (um modelo de 70B em Q3 se mant\u00e9m muito melhor do que um de 8B em Q3), e abaixo do Q4 a curva de qualidade cai acentuadamente. Em caso de d\u00favida, <code>Q4_K_M<\/code> \u00e9 o padr\u00e3o da comunidade por um bom motivo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Picking_a_quantisation_for_your_VRAM\"><\/span>Escolhendo uma quantiza\u00e7\u00e3o adequada \u00e0 sua VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A mem\u00f3ria total necess\u00e1ria \u00e9 aproximadamente <em>tamanho do arquivo + cache de contexto + sobrecarga<\/em>. Reserve 1\u20132 GB al\u00e9m do tamanho do arquivo para alguns milhares de tokens de contexto; reserve ainda mais se voc\u00ea usar contextos longos. O modelo executa na maior velocidade poss\u00edvel quando todo esse conjunto cabe na VRAM da GPU; ferramentas baseadas em llama.cpp podem descarregar as camadas restantes para a RAM do sistema, o que ainda funciona, mas fica muito mais lento \u00e0 medida que mais camadas s\u00e3o descarregadas.<\/p>\n<table>\n<thead>\n<tr>\n<th>VRAM<\/th>\n<th>O que cabe confortavelmente<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 GB<\/td>\n<td>modelos de 7\u20138B em Q4_K_M ou Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>12 GB<\/td>\n<td>8B em Q8_0, ou 12\u201314B em Q4_K_M<\/td>\n<\/tr>\n<tr>\n<td>16 GB<\/td>\n<td>14B em Q5_K_M\/Q6_K<\/td>\n<\/tr>\n<tr>\n<td>24 GB<\/td>\n<td>~32B em Q4_K_M, ou 14B em Q8_0 com contexto longo<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para n\u00fameros exatos sobre um modelo espec\u00edfico e comprimento de contexto, a <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> faz os c\u00e1lculos automaticamente, e h\u00e1 uma an\u00e1lise detalhada por modelo em <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para todos os principais modelos de linguagem (LLM)<\/a>. Se voc\u00ea est\u00e1 escolhendo hardware em vez de uma quantiza\u00e7\u00e3o, comece com <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">as melhores GPUs para LLMs locais<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_safetensors\"><\/span>GGUF versus safetensors<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Esses dois formatos coexistem porque atendem a ambientes de execu\u00e7\u00e3o diferentes, n\u00e3o porque um esteja superando o outro.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Projetado para<\/td>\n<td>llama.cpp e seu ecossistema<\/td>\n<td>Ecossistema Hugging Face \/ PyTorch<\/td>\n<\/tr>\n<tr>\n<td>Conte\u00fado<\/td>\n<td>Pesos + tokenizador + configura\u00e7\u00e3o em um \u00fanico arquivo<\/td>\n<td>Apenas tensores; configura\u00e7\u00e3o e tokenizador est\u00e3o em arquivos JSON separados<\/td>\n<\/tr>\n<tr>\n<td>Quantiza\u00e7\u00e3o<\/td>\n<td>Incorporada ao formato (Q4_K_M etc.)<\/td>\n<td>Geralmente FP16\/BF16; quantizados por m\u00e9todos separados (GPTQ, AWQ)<\/td>\n<\/tr>\n<tr>\n<td>Ambientes de execu\u00e7\u00e3o t\u00edpicos<\/td>\n<td>Ollama, LM Studio, llama.cpp, KoboldCpp, Jan<\/td>\n<td>transformers, vLLM, TGI, SGLang<\/td>\n<\/tr>\n<tr>\n<td>Ponto ideal<\/td>\n<td>Hardware consumidor, h\u00edbrido CPU+GPU, uso individual<\/td>\n<td>GPUs para datacenter, atendimento com alta vaz\u00e3o, treinamento<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>A decis\u00e3o realmente envolve qual software voc\u00ea usa: ferramentas desktop e Ollama exigem GGUF; pilhas de atendimento em GPU e qualquer tarefa envolvendo ajuste fino exigem safetensors. Os publicadores de modelos normalmente lan\u00e7am primeiro os safetensors, e a comunidade converte para GGUF em poucos dias.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_GGUF_files_come_from\"><\/span>De onde v\u00eam os arquivos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quase todos os arquivos GGUF est\u00e3o hospedados no Hugging Face. Laborat\u00f3rios ocasionalmente publicam oficialmente vers\u00f5es GGUF, mas a maioria vem de quantizadores da comunidade \u2014 contas como <code>bartowski<\/code>, <code>unsloth<\/code>, <code>lmstudio-community<\/code> e <code>ggml-org<\/code> \u2014 que convertem cada novo lan\u00e7amento para toda a gama de n\u00edveis de quantiza\u00e7\u00e3o. Um reposit\u00f3rio chamado algo como <code>Meta-Llama-3.1-8B-Instruct-GGUF<\/code> conter\u00e1 um arquivo para cada n\u00edvel de quantiza\u00e7\u00e3o.<\/p>\n<p>Voc\u00ea tamb\u00e9m pode converter um modelo pessoalmente usando as ferramentas do llama.cpp: <code>convert_hf_to_gguf.py<\/code> converte um modelo do Hugging Face para um GGUF em F16, e o bin\u00e1rio <code>llama-quantize<\/code> (compilado ao construir o llama.cpp) comprime-o para a quantiza\u00e7\u00e3o escolhida, por exemplo. <code>modelo llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code>.<\/p>\n<h3>Carregando um GGUF no Ollama<\/h3>\n<p>O Ollama pode baixar diretamente reposit\u00f3rios GGUF do Hugging Face, especificando a quantiza\u00e7\u00e3o ap\u00f3s os dois-pontos:<\/p>\n<pre><code>ollama run hf.co\/bartowski\/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M<\/code><\/pre>\n<p>Para um arquivo que voc\u00ea j\u00e1 possui em disco, crie um arquivo de texto simples chamado <code>Modelfile<\/code> contendo:<\/p>\n<pre><code>FROM .\/my-model.gguf<\/code><\/pre>\n<p>em seguida, registre-o e execute-o:<\/p>\n<pre><code>ollama create my-model -f Modelfile\nollama run my-model<\/code><\/pre>\n<p>As vers\u00f5es atuais do Ollama leem automaticamente o modelo de conversa\u00e7\u00e3o (chat template) embutido nos metadados do GGUF; se um modelo importado gerar sa\u00edda ileg\u00edvel, a corre\u00e7\u00e3o geralmente consiste em adicionar explicitamente uma linha <code>TEMPLATE<\/code> ao Modelfile. O <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">guia completo do Ollama<\/a> aborda os Modelfiles em profundidade.<\/p>\n<h3>Carregando um GGUF no LM Studio<\/h3>\n<p>O caminho habitual \u00e9 o downloader integrado: abra a guia Descobrir (Discover), pesquise um modelo e o LM Studio listar\u00e1 as quantiza\u00e7\u00f5es GGUF dispon\u00edveis, indicando quais delas s\u00e3o compat\u00edveis com seu hardware. Para importar um arquivo que voc\u00ea j\u00e1 possui, use a interface de linha de comando (CLI) (<code>lms import path\/to\/model.gguf<\/code>) ou coloque-o no diret\u00f3rio de modelos do LM Studio \u2014 o caminho padr\u00e3o exato varia conforme a vers\u00e3o e o sistema operacional, mas a guia Meus Modelos (My Models) mostra-o e permite alter\u00e1-lo. Os arquivos devem estar organizados em uma estrutura de subpastas no formato <code>editor\/nome-do-modelo\/<\/code> para serem reconhecidos. Consulte o <a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">guia completo do LM Studio<\/a> para o passo a passo completo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>O GGUF \u00e9 exclusivamente para CPU ou tamb\u00e9m utiliza a GPU?<\/h3>\n<p>Ambas as op\u00e7\u00f5es s\u00e3o poss\u00edveis. O llama.cpp nasceu como um projeto de infer\u00eancia para CPU, mas transfere camadas do modelo para a GPU (CUDA, Metal, Vulkan, ROCm) e pode executar totalmente na GPU quando o modelo cabe inteiramente na VRAM. O Ollama e o LM Studio gerenciam automaticamente a divis\u00e3o entre CPU e GPU; ao usar diretamente o llama.cpp, voc\u00ea controla essa divis\u00e3o com a flag <code>-ngl<\/code> (n\u00famero de camadas na GPU).<\/p>\n<h3>Qual \u00e9 a diferen\u00e7a entre Q4_K_M e Q4_K_S?<\/h3>\n<p>Ambas s\u00e3o quantiza\u00e7\u00f5es k-quants de aproximadamente 4 bits; a letra indica a variante de tamanho. <code>_M<\/code> (m\u00e9dio) preserva mais tensores sens\u00edveis \u00e0 qualidade em precis\u00e3o superior comparado ao <code>_S<\/code> (pequeno), sendo portanto ligeiramente maior e ligeiramente melhor. A diferen\u00e7a \u00e9 pequena \u2014 escolha <code>_M<\/code> a menos que os \u00faltimos poucos centenas de megabytes sejam decisivos para saber se o modelo cabe na mem\u00f3ria dispon\u00edvel.<\/p>\n<h3>Quanta qualidade eu realmente perco com a quantiza\u00e7\u00e3o?<\/h3>\n<p>Nas quantiza\u00e7\u00f5es Q8_0 e Q6_K, praticamente nenhuma \u2014 testes cegos t\u00eam dificuldade em distingui-las da representa\u00e7\u00e3o F16. A Q4_K_M apresenta uma pequena perda mensur\u00e1vel, que a maioria dos usu\u00e1rios nunca percebe em conversas, embora possa fazer diferen\u00e7a em tarefas precisas, como gera\u00e7\u00e3o de c\u00f3digo ou c\u00e1lculos matem\u00e1ticos. Abaixo da Q4, a degrada\u00e7\u00e3o torna-se evidente, e modelos menores sofrem mais do que modelos maiores.<\/p>\n<h3>Posso usar GGUF com transformers ou vLLM?<\/h3>\n<p>H\u00e1 suporte, mas ele \u00e9 limitado e n\u00e3o representa o caminho nativo \u2014 o transformers pode desquantizar alguns arquivos GGUF durante o carregamento, e o vLLM possui suporte experimental para GGUF, cuja disponibilidade varia conforme a arquitetura. Se voc\u00ea est\u00e1 desenvolvendo sobre essas pilhas, utilize safetensors; o GGUF deve ser considerado, preferencialmente, o formato destinado \u00e0s implementa\u00e7\u00f5es da fam\u00edlia llama.cpp.<\/p>\n<h3>Por que meu modelo est\u00e1 dividido em v\u00e1rios arquivos .gguf?<\/h3>\n<p>Modelos muito grandes s\u00e3o fragmentados em partes nomeadas, por exemplo, <code>model-00001-of-00002.gguf<\/code>\u2014 principalmente para respeitar os limites de tamanho de arquivo em plataformas de hospedagem. Mantenha todas as partes na mesma pasta e aponte seu ambiente de execu\u00e7\u00e3o para o primeiro arquivo; o llama.cpp e as ferramentas constru\u00eddas sobre ele carregam automaticamente as demais.<\/p>\n<p>Uma vez que voc\u00ea sabe qual quantiza\u00e7\u00e3o \u00e9 compat\u00edvel com seu hardware, a pr\u00f3xima pergunta pr\u00e1tica \u00e9 qual modelo utilizar nela \u2014 a <a href=\"https:\/\/convly.ai\/pt\/models\/\">banco de dados de modelos<\/a> lista detalhada cont\u00e9m especifica\u00e7\u00f5es, requisitos de VRAM e pre\u00e7os para 37 modelos atuais, e <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">os melhores modelos locais para Ollama<\/a> \u00e9 uma boa lista inicial para come\u00e7ar.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is the file format for running LLMs locally. It packs a model&#8217;s weights, tokenizer and configuration into a single [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2104,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2103","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2103","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2103"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2103\/revisions"}],"predecessor-version":[{"id":2105,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2103\/revisions\/2105"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2104"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2103"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2103"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2103"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}