{"id":2608,"date":"2026-09-10T20:40:34","date_gmt":"2026-09-10T20:40:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2608"},"modified":"2026-09-10T20:40:34","modified_gmt":"2026-09-10T20:40:34","slug":"gguf-model","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/gguf-model\/","title":{"rendered":"Formato GGUF: o que \u00e9 e como execut\u00e1-lo"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF<\/strong> (GPT-Generated Unified Format, ou Formato Unificado Gerado por GPT) \u00e9 um formato bin\u00e1rio de arquivo \u00fanico para modelos de linguagem grandes quantizados, introduzido pelo projeto llama.cpp em agosto de 2023 como sucessor do GGML.<\/li>\n<li>Agrupa pesos, tokenizador, modelo de conversa e metadados em um \u00fanico <code>.gguf<\/code> arquivo que roda na CPU, GPU ou em uma combina\u00e7\u00e3o dessas, por meio de <strong>llama.cpp<\/strong>, <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, <strong>KoboldCpp<\/strong> e <strong>text-generation-webui<\/strong>.<\/li>\n<li>n\u00edveis de quantiza\u00e7\u00e3o como <code>Q4_K_M<\/code>, <code>Q5_K_M<\/code> e <code>Q8_0<\/code> trocam qualidade por tamanho \u2014 uma quantiza\u00e7\u00e3o de 4 bits de um modelo de 8B requer aproximadamente 5 GB de RAM ou VRAM.<\/li>\n<li>Obtenha os arquivos no Hugging Face (busque por &ldquo;GGUF&rdquo;) e carregue-os com <code>llama-cli -m model.gguf<\/code> ou <code>ollama run<\/code>, escolhendo uma quantiza\u00e7\u00e3o compat\u00edvel com seu hardware usando o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>.<\/li>\n<\/ul>\n<\/div>\n<p>A <strong>modelo GGUF<\/strong> \u00e9 um modelo de linguagem grande empacotado no formato de arquivo GGUF \u2014 um cont\u00eainer de arquivo \u00fanico que armazena os pesos quantizados, o tokenizador, os hiperpar\u00e2metros e o modelo de prompt de um modelo. Foi criado por Georgi Gerganov e pelo projeto <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a> project in August 2023 to replace the older GGML format. GGUF is what makes it possible to download one file, point a runtime at it, and get a working local LLM on a laptop or workstation.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa323fd6f57a\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa323fd6f57a\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#What_GGUF_Actually_Is\" >O que o GGUF realmente \u00e9<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#Quantization_The_Naming_Scheme\" >Quantiza\u00e7\u00e3o: o esquema de nomenclatura<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#Where_to_Get_GGUF_Files\" >Onde obter arquivos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#Running_a_GGUF_Model\" >Executando um modelo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\" >GGUF versus Safetensors versus AWQ versus GPTQ<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#When_GGUF_Is_Not_the_Right_Answer\" >Quando o GGUF n\u00e3o \u00e9 a solu\u00e7\u00e3o adequada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#Converting_a_Model_to_GGUF\" >Convertendo um modelo para GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/gguf-model\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_GGUF_Actually_Is\"><\/span>O que o GGUF realmente \u00e9<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF significa <em>GPT-Generated Unified Format<\/em>. Estruturalmente, trata-se de um arquivo bin\u00e1rio com um cabe\u00e7alho, um bloco de metadados no formato chave-valor, um \u00edndice de tensores e os pr\u00f3prios dados dos tensores. A <a href=\"https:\/\/github.com\/ggml-org\/ggml\/blob\/master\/docs\/gguf.md\" rel=\"noopener\" target=\"_blank\">especifica\u00e7\u00e3o oficial do GGUF<\/a> no reposit\u00f3rio ggml define essa estrutura.<\/p>\n<p>Duas propriedades s\u00e3o relevantes para os usu\u00e1rios:<\/p>\n<ul>\n<li><strong>Autossuficiente.<\/strong> O arquivo inclui o tokenizador, tokens especiais, IDs de EOS\/BOS, modelo de conversa e metadados da arquitetura. Voc\u00ea n\u00e3o precisa de um arquivo separado <code>tokenizer.json<\/code> ou <code>config.json<\/code> ao lado dele.<\/li>\n<li><strong>Mape\u00e1vel na mem\u00f3ria.<\/strong> Os runtimes usam <code>mmap()<\/code> para mapear o arquivo, de modo que a inicializa\u00e7\u00e3o \u00e9 quase instant\u00e2nea e o sistema operacional carrega os pesos sob demanda. \u00c9 por isso que um GGUF de 40 GB abre em segundos, mesmo em um SSD lento.<\/li>\n<\/ul>\n<p>O GGUF substituiu o GGML porque este \u00faltimo n\u00e3o possu\u00eda versionamento, misturava metadados com pesos e apresentava falhas sempre que surgia uma nova arquitetura. J\u00e1 o GGUF \u00e9 versionado e extens\u00edvel.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_The_Naming_Scheme\"><\/span>Quantiza\u00e7\u00e3o: o esquema de nomenclatura<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A maioria dos arquivos GGUF que voc\u00ea baixa est\u00e1 <em>quantizada<\/em> \u2014 ou seja, os pesos s\u00e3o armazenados com menos bits do que o original em FP16. O sufixo no nome do arquivo indica qual esquema foi utilizado. As fam\u00edlias atuais est\u00e3o documentadas no <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/blob\/master\/tools\/quantize\/README.md\" rel=\"noopener\" target=\"_blank\">README de quantiza\u00e7\u00e3o do llama.cpp<\/a>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Quant<\/th>\n<th>Bits\/peso (aproximadamente)<\/th>\n<th>Uso t\u00edpico<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q2_K<\/td>\n<td>~2.6<\/td>\n<td>Menor tamanho, perda de qualidade percept\u00edvel<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>Compress\u00e3o agressiva<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.8<\/td>\n<td>Padr\u00e3o mais comum \u2014 bom equil\u00edbrio entre tamanho e qualidade<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>Qualidade superior, arquivo maior<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>Quase sem perdas em compara\u00e7\u00e3o com FP16<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>Efetivamente sem perdas, cerca de 2\u00d7 o tamanho do Q4<\/td>\n<\/tr>\n<tr>\n<td>F16 \/ BF16<\/td>\n<td>16<\/td>\n<td>Refer\u00eancia n\u00e3o quantizada<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>O <code>_K<\/code> As variantes k-quants utilizam precis\u00e3o vari\u00e1vel por bloco de tensor. Os sufixos <code>_M<\/code> \/ <code>_S<\/code> \/ <code>_L<\/code> indicam predefini\u00e7\u00f5es m\u00e9dias, pequenas ou grandes de mistura de blocos. Variantes mais recentes (por exemplo, <code>IQ<\/code> IQ4_XS <code>) empregam calibra\u00e7\u00e3o por matriz de import\u00e2ncia para melhorar a qualidade ao mesmo or\u00e7amento de bits.<\/code>) use importance-matrix calibration for better quality at the same bit budget.<\/p>\n<p>Como regra pr\u00e1tica para VRAM, considere o tamanho do arquivo no disco e adicione aproximadamente 1\u20133 GB para o cache KV em contextos curtos, e mais para contextos longos. A partir da <a href=\"https:\/\/convly.ai\/pt\/models\/\">base de dados de modelos Convly<\/a>: Llama 3.1 8B needs around 5&nbsp;GB at 4-bit, Llama 3.3 70B around 40&nbsp;GB, and Mistral 7B around 4.5&nbsp;GB. For anything larger, the <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">tabela de requisitos de VRAM<\/a> \u00e9 a pesquisa mais r\u00e1pida.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Get_GGUF_Files\"><\/span>Onde obter arquivos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Quase toda a distribui\u00e7\u00e3o de GGUF ocorre no Hugging Face. Pesquise pelo nome do modelo seguido de &ldquo;GGUF&rdquo;. Requantizadores confi\u00e1veis incluem <strong>bartowski<\/strong>, <strong>Qwen<\/strong> (oficial para Qwen3), <strong>lmstudio-community<\/strong>, <strong>unsloth<\/strong> e <strong>MaziyarPanahi<\/strong>. Meta, Google, Mistral and Microsoft publish some official GGUF builds; for others the community quantizes from the released safetensors.<\/p>\n<p>Um reposit\u00f3rio normalmente cont\u00e9m um arquivo por n\u00edvel de quantiza\u00e7\u00e3o, por exemplo, <code>Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf<\/code>. Para modelos com mais de ~50&nbsp;GB, o arquivo \u00e9 dividido em fragmentos (shards) nomeados como <code>-00001-of-00003.gguf<\/code>; os ambientes de execu\u00e7\u00e3o carregam-nos automaticamente a partir do primeiro fragmento.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_a_GGUF_Model\"><\/span>Executando um modelo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Compile o llama.cpp a partir do c\u00f3digo-fonte ou instale o bin\u00e1rio pr\u00e9-compilado. Com CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j\n.\/build\/bin\/llama-cli -m ~\/models\/llama-3.1-8b-instruct-Q4_K_M.gguf \n    -p \"Explique o GGUF em um \u00fanico par\u00e1grafo.\" -n 256 -ngl 99<\/code><\/pre>\n<p>O <code>-ngl<\/code> A flag -ngl (n-gpu-layers) define quantas camadas do transformador ser\u00e3o movidas para a GPU. Defina-a com um valor alto o suficiente para que todo o modelo caiba na VRAM; se voc\u00ea esgotar a mem\u00f3ria, reduza esse valor e as camadas restantes permanecer\u00e3o na CPU. Para disponibilizar uma API HTTP compat\u00edvel com OpenAI, use <code>llama-server<\/code> na porta 8080 por padr\u00e3o.<\/p>\n<h3>macOS<\/h3>\n<p>No Apple Silicon, o llama.cpp usa automaticamente o backend Metal. Instale via Homebrew:<\/p>\n<pre><code>brew install llama.cpp\nllama-cli -m ~\/models\/qwen3-8b-Q5_K_M.gguf -p \"Ol\u00e1\" -ngl 99<\/code><\/pre>\n<p>A mem\u00f3ria unificada significa que o limite <code>-ngl<\/code> ceiling is your total RAM minus the OS overhead. A 32&nbsp;GB M-series Mac comfortably runs Qwen3 14B or Gemma 3 12B at Q4_K_M &mdash; the database lists those at ~9&nbsp;GB and ~8&nbsp;GB of VRAM respectively.<\/p>\n<p>Para uma interface gr\u00e1fica (GUI), <a href=\"https:\/\/convly.ai\/pt\/lm-studio-complete-guide-2026\/\">LM Studio<\/a> \u00e9 a escolha habitual no Mac. Ele baixa arquivos GGUF diretamente do Hugging Face e exp\u00f5e um servidor local compat\u00edvel com a API OpenAI.<\/p>\n<h3>Windows<\/h3>\n<p>Tr\u00eas rotas pr\u00e1ticas:<\/p>\n<ul>\n<li><strong>Ollama.<\/strong> Instale a partir do <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, ent\u00e3o <code>ollama run llama3.1:8b<\/code>. O Ollama faz o download de suas pr\u00f3prias vers\u00f5es curadas em GGUF. Para carregar um arquivo arbitr\u00e1rio, crie um Modelfile com uma linha <code>FROM .\/mymodel.gguf<\/code> e execute <code>ollama create mymodel -f Modelfile<\/code>. Consulte nosso <a href=\"https:\/\/convly.ai\/pt\/how-to-install-ollama-2026\/\">Guia de instala\u00e7\u00e3o do Ollama<\/a>.<\/li>\n<li><strong>LM Studio.<\/strong> Instala\u00e7\u00e3o em um clique, navega\u00e7\u00e3o e download de GGUF por meio de uma interface gr\u00e1fica, com controle deslizante para descarregar carga para a GPU.<\/li>\n<li><strong>bin\u00e1rios pr\u00e9-compilados do llama.cpp.<\/strong> O projeto fornece pacotes ZIP pr\u00e9-compilados para Windows com suporte a CPU, CUDA e Vulkan na <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/releases\" rel=\"noopener\" target=\"_blank\">lan\u00e7amentos no GitHub<\/a>. Descompacte e execute <code>llama-cli.exe<\/code> da mesma forma que no Linux.<\/li>\n<\/ul>\n<p>Quanto \u00e0 escolha da GPU, o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">guia de GPUs locais para LLMs<\/a> aborda as op\u00e7\u00f5es atuais de pre\u00e7o\/VRAM.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\"><\/span>GGUF versus Safetensors versus AWQ versus GPTQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Formato<\/th>\n<th>Runtime principal<\/th>\n<th>Precis\u00e3o<\/th>\n<th>Melhor para<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>2\u20138 bits + F16<\/td>\n<td>CPU, mista CPU\/GPU, Apple Silicon, uso individual<\/td>\n<\/tr>\n<tr>\n<td>Safetensors (FP16\/BF16)<\/td>\n<td>Transformers, vLLM<\/td>\n<td>16 bits<\/td>\n<td>Treinamento, pesquisa, infer\u00eancia em precis\u00e3o total<\/td>\n<\/tr>\n<tr>\n<td>AWQ<\/td>\n<td>vLLM, AutoAWQ<\/td>\n<td>4 bits<\/td>\n<td>Atendimento em GPU com alta vaz\u00e3o<\/td>\n<\/tr>\n<tr>\n<td>GPTQ<\/td>\n<td>vLLM, ExLlamaV2<\/td>\n<td>3\u20138 bits<\/td>\n<td>Infer\u00eancia exclusiva em GPU com processamento em lote<\/td>\n<\/tr>\n<tr>\n<td>MLX<\/td>\n<td>MLX (Apple)<\/td>\n<td>4\u201316 bits<\/td>\n<td>Exclusivo para Apple Silicon<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Escolha GGUF quando o alvo for um \u00fanico usu\u00e1rio em hardware heterog\u00eaneo ou quando voc\u00ea quiser garantir que o modelo seja executado mesmo na CPU. Escolha vLLM com safetensors AWQ\/GPTQ ao servir muitos usu\u00e1rios simult\u00e2neos em uma GPU de datacenter.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_Is_Not_the_Right_Answer\"><\/span>Quando o GGUF n\u00e3o \u00e9 a solu\u00e7\u00e3o adequada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O GGUF pressup\u00f5e infer\u00eancia com fluxo \u00fanico e tamanho de lote igual a 1. A vaz\u00e3o \u00e9 muito menor que a do vLLM ou do TensorRT-LLM sob carga concorrente, e n\u00e3o h\u00e1 aten\u00e7\u00e3o paginada. Se voc\u00ea est\u00e1 disponibilizando uma API para tr\u00e1fego real, uma implanta\u00e7\u00e3o em FP16 ou AWQ com vLLM superar\u00e1 o GGUF em tokens\/segundo\/d\u00f3lar, mesmo antes de considerar o tempo gasto pelos desenvolvedores.<\/p>\n<p>It also breaks down at the top end of model size. Kimi K3 needs ~1.4&nbsp;TB of VRAM at 4-bit and DeepSeek V4-Pro around 800&nbsp;GB &mdash; those are multi-node deployments, not desktop GGUF workloads. And for frontier hosted models like <a href=\"https:\/\/convly.ai\/pt\/models\/\">Claude Sonnet 4.6<\/a> a US$ 3 na entrada \/ US$ 15 na sa\u00edda por 1 milh\u00e3o de tokens ou Gemini 3.6 Flash a US$ 1,50 na entrada \/ US$ 7,50 na sa\u00edda, n\u00e3o existem pesos locais para convers\u00e3o. Fa\u00e7a as contas no <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a> antes de se comprometer com a compra de uma GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Converting_a_Model_to_GGUF\"><\/span>Convertendo um modelo para GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Se um modelo existe no Hugging Face como safetensors, mas ainda ningu\u00e9m o quantizou, o fluxo de trabalho \u00e9:<\/p>\n<pre><code># no reposit\u00f3rio llama.cpp\npip install -r requirements.txt\npython convert_hf_to_gguf.py \/caminho\/para\/o-modelo-hf --outfile model-f16.gguf\n.\/build\/bin\/llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code><\/pre>\n<p>O script de convers\u00e3o s\u00f3 suporta arquiteturas que o llama.cpp j\u00e1 aprendeu \u2014 llama, mistral, qwen2\/3, gemma, phi e uma lista crescente de outras. Arquiteturas novas exigem primeiramente uma altera\u00e7\u00e3o no c\u00f3digo. Os nomes de arquivos e flags no script mudaram entre vers\u00f5es do llama.cpp, portanto verifique <code>python convert_hf_to_gguf.py --help<\/code> contra o commit usado na sua compila\u00e7\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>GGUF \u00e9 a mesma coisa que GGML?<\/h3>\n<p>N\u00e3o. GGML foi o formato anterior usado pelo llama.cpp at\u00e9 meados de 2023. GGUF o substituiu em agosto de 2023 com um cabe\u00e7alho versionado, metadados embutidos e um layout est\u00e1vel de tensores. Arquivos <code>.bin<\/code> GGML antigos n\u00e3o s\u00e3o mais carregados pela vers\u00e3o atual do llama.cpp; voc\u00ea precisa encontrar uma vers\u00e3o GGUF re-quantizada.<\/p>\n<h3>Qual quantiza\u00e7\u00e3o devo baixar?<\/h3>\n<p>Comece com <code>Q4_K_M<\/code>. Ele se adapta \u00e0 maior variedade poss\u00edvel de hardware, e a perda de qualidade em rela\u00e7\u00e3o ao FP16 \u00e9 pequena para a maioria dos modelos com mais de 7 bilh\u00f5es de par\u00e2metros. Suba para <code>Q5_K_M<\/code> ou <code>Q6_K<\/code> se voc\u00ea tiver VRAM ociosa e valorizar precis\u00e3o em codifica\u00e7\u00e3o ou racioc\u00ednio. Reduza para <code>Q3_K_M<\/code> ou uma variante <code>IQ3<\/code> apenas se o modelo, de outra forma, n\u00e3o couber na mem\u00f3ria dispon\u00edvel.<\/p>\n<h3>Can GGUF models use my GPU?<\/h3>\n<p>Sim. O llama.cpp suporta CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (multi-fornecedor) e SYCL (Intel). A flag <code>-ngl<\/code> descarrega camadas para a GPU. Se o modelo couber inteiramente na VRAM, o throughput fica pr\u00f3ximo ao de runtimes dedicados a GPU; em descarga parcial, a velocidade \u00e9 determinada pela camada mais lenta, seja qual for o n\u00edvel de mem\u00f3ria em que ela resida.<\/p>\n<h3>GGUF funciona com modelos de vis\u00e3o ou \u00e1udio?<\/h3>\n<p>Parcialmente. O llama.cpp suporta modelos multimodais no estilo LLaVA por meio de um arquivo <code>mmproj<\/code> GGUF pareado que cont\u00e9m o projetor visual. O suporte a Qwen-VL, Gemma 3 Vision e similares foi adicionado progressivamente, mas ainda fica atr\u00e1s das vers\u00f5es textuais. Modelos de \u00e1udio como Whisper t\u00eam seu pr\u00f3prio formato relacionado, tratado por <code>whisper.cpp<\/code>, e n\u00e3o pelo bin\u00e1rio principal do llama.cpp.<\/p>\n<h3>Como escolher um modelo GGUF compat\u00edvel com meu hardware?<\/h3>\n<p>Consulte o modelo na <a href=\"https:\/\/convly.ai\/pt\/models\/\">base de dados de modelos Convly<\/a> para obter sua estimativa de VRAM em 4 bits, depois subtraia 1\u20133&nbsp;GB de margem para contexto e sobrecarga do sistema operacional. Em uma placa de 24&nbsp;GB, Qwen3 32B (~20&nbsp;GB) ou Gemma 3 27B (~16&nbsp;GB) em Q4 s\u00e3o op\u00e7\u00f5es confort\u00e1veis. O <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> lida com contextos mais longos, cujo cache KV cresce significativamente.<\/p>\n<h3>Arquivos GGUF s\u00e3o seguros para execu\u00e7\u00e3o?<\/h3>\n<p>The weights themselves are just numbers &mdash; unlike Python pickle-based checkpoints, GGUF does not execute code on load. The risk is a maliciously crafted file triggering a parser bug in the runtime. Stick to known Hugging Face uploaders (bartowski, unsloth, lmstudio-community, official vendor accounts) and keep llama.cpp, Ollama or LM Studio updated.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF (GPT-Generated Unified Format) is a single-file binary format for quantized large language models, introduced by the llama.cpp project in [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2609,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2608","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2608","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2608"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2608\/revisions"}],"predecessor-version":[{"id":2610,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2608\/revisions\/2610"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2609"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2608"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2608"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2608"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}