{"id":2608,"date":"2026-09-10T20:40:34","date_gmt":"2026-09-10T20:40:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2608"},"modified":"2026-09-10T20:40:34","modified_gmt":"2026-09-10T20:40:34","slug":"gguf-model","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/gguf-model\/","title":{"rendered":"Formato de modelo GGUF: qu\u00e9 es y c\u00f3mo ejecutar uno"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF<\/strong> (GPT-Generated Unified Format, formato unificado generado por GPT) es un formato binario de un solo archivo para modelos de lenguaje grandes cuantizados, presentado por el proyecto llama.cpp en agosto de 2023 como sucesor de GGML.<\/li>\n<li>Agrupa pesos, tokenizador, plantilla de chat y metadatos en uno solo <code>.gguf<\/code> archivo que se ejecuta en CPU, GPU o una combinaci\u00f3n de ambas mediante <strong>llama.cpp<\/strong>, <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>, <strong>KoboldCpp<\/strong> y <strong>text-generation-webui<\/strong>.<\/li>\n<li>Niveles de cuantizaci\u00f3n como <code>Q4_K_M<\/code>, <code>Q5_K_M<\/code> y <code>Q8_0<\/code> intercambian calidad por tama\u00f1o: una cuantizaci\u00f3n de 4 bits de un modelo de 8B requiere aproximadamente 5 GB de RAM o VRAM.<\/li>\n<li>Obtenga los archivos desde Hugging Face (busque \u00abGGUF\u00bb) y c\u00e1rguelos con <code>llama-cli -m model.gguf<\/code> o <code>ollama run<\/code>, y seleccione una cuantizaci\u00f3n que se adapte a su hardware usando la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a>.<\/li>\n<\/ul>\n<\/div>\n<p>A <strong>modelo GGUF<\/strong> es un modelo de lenguaje grande empaquetado en el formato de archivo GGUF: un contenedor de un solo archivo que contiene los pesos cuantizados, el tokenizador, los hiperpar\u00e1metros y la plantilla de indicaciones para un modelo. Fue creado por Georgi Gerganov y el proyecto <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a> project in August 2023 to replace the older GGML format. GGUF is what makes it possible to download one file, point a runtime at it, and get a working local LLM on a laptop or workstation.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa324023e1fb\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa324023e1fb\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#What_GGUF_Actually_Is\" >Qu\u00e9 es realmente GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#Quantization_The_Naming_Scheme\" >Cuantizaci\u00f3n: el esquema de nomenclatura<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#Where_to_Get_GGUF_Files\" >D\u00f3nde conseguir archivos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#Running_a_GGUF_Model\" >Ejecutar un modelo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\" >GGUF frente a Safetensors frente a AWQ frente a GPTQ<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#When_GGUF_Is_Not_the_Right_Answer\" >Cu\u00e1ndo GGUF no es la respuesta adecuada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#Converting_a_Model_to_GGUF\" >Convertir un modelo a GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/gguf-model\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_GGUF_Actually_Is\"><\/span>Qu\u00e9 es realmente GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF significa <em>GPT-Generated Unified Format<\/em>. Estructuralmente, es un archivo binario con una cabecera, un bloque de metadatos clave-valor, un \u00edndice de tensores y los propios datos tensoriales. La <a href=\"https:\/\/github.com\/ggml-org\/ggml\/blob\/master\/docs\/gguf.md\" rel=\"noopener\" target=\"_blank\">especificaci\u00f3n oficial de GGUF<\/a> en el repositorio ggml define su estructura.<\/p>\n<p>Dos propiedades son fundamentales para los usuarios:<\/p>\n<ul>\n<li><strong>Aut\u00f3nomo.<\/strong> El archivo incluye el tokenizador, los tokens especiales, los identificadores EOS\/BOS, la plantilla de chat y los metadatos de arquitectura. No necesita un archivo separado <code>tokenizer.json<\/code> o <code>config.json<\/code> junto a \u00e9l.<\/li>\n<li><strong>Mapeable en memoria.<\/strong> Los entornos de ejecuci\u00f3n usan <code>mmap()<\/code> para mapear el archivo, por lo que el inicio es casi instant\u00e1neo y el sistema operativo carga los pesos bajo demanda. Por eso un archivo GGUF de 40 GB se abre en segundos incluso en un SSD lento.<\/li>\n<\/ul>\n<p>GGUF reemplaz\u00f3 a GGML porque GGML carec\u00eda de control de versiones, mezclaba metadatos con pesos y dejaba de funcionar cada vez que aparec\u00eda una nueva arquitectura. GGUF s\u00ed tiene control de versiones y es extensible.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_The_Naming_Scheme\"><\/span>Cuantizaci\u00f3n: el esquema de nomenclatura<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La mayor\u00eda de los archivos GGUF que descarga est\u00e1n <em>cuantizados<\/em> \u2014es decir, los pesos se almacenan con menos bits que el original en FP16. El sufijo del nombre de archivo indica qu\u00e9 esquema se utiliz\u00f3. Las familias actuales est\u00e1n documentadas en el <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/blob\/master\/tools\/quantize\/README.md\" rel=\"noopener\" target=\"_blank\">README de cuantizaci\u00f3n de llama.cpp<\/a>.<\/p>\n<table>\n<thead>\n<tr>\n<th>Cuantizaci\u00f3n<\/th>\n<th>Bits\/peso (aprox.)<\/th>\n<th>Uso t\u00edpico<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q2_K<\/td>\n<td>~2.6<\/td>\n<td>M\u00e1s peque\u00f1o, p\u00e9rdida de calidad perceptible<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>Compresi\u00f3n agresiva<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.8<\/td>\n<td>Valor predeterminado m\u00e1s com\u00fan: buen equilibrio entre tama\u00f1o y calidad<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>Mayor calidad, archivo m\u00e1s grande<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>Casi sin p\u00e9rdida frente a FP16<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>Efectivamente sin p\u00e9rdida, ~2\u00d7 el tama\u00f1o de Q4<\/td>\n<\/tr>\n<tr>\n<td>F16 \/ BF16<\/td>\n<td>16<\/td>\n<td>Referencia sin cuantizar<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>El <code>_K<\/code> Las variantes k-quants usan precisi\u00f3n variable por bloque de tensores. Los sufijos <code>_M<\/code> \/ <code>_S<\/code> \/ <code>_L<\/code> indican ajustes preestablecidos de mezcla de bloques: medio, peque\u00f1o o grande. Variantes m\u00e1s recientes (por ejemplo, <code>IQ<\/code> IQ4_XS <code>) emplean calibraci\u00f3n mediante matriz de importancia para lograr mejor calidad con el mismo presupuesto de bits.<\/code>utiliza la calibraci\u00f3n mediante matriz de importancia para obtener una mejor calidad con el mismo presupuesto de bits.<\/p>\n<p>Como regla general para la VRAM, tome el tama\u00f1o del archivo en disco y sume aproximadamente 1\u20133 GB para la cach\u00e9 KV en contextos cortos, y m\u00e1s para contextos largos. Desde la <a href=\"https:\/\/convly.ai\/es\/models\/\">base de datos de modelos Convly<\/a>: Llama 3.1 8B needs around 5&nbsp;GB at 4-bit, Llama 3.3 70B around 40&nbsp;GB, and Mistral 7B around 4.5&nbsp;GB. For anything larger, the <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">tabla de requisitos de VRAM<\/a> es la b\u00fasqueda m\u00e1s r\u00e1pida.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_Get_GGUF_Files\"><\/span>D\u00f3nde conseguir archivos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Casi toda la distribuci\u00f3n de GGUF se realiza en Hugging Face. Busque el nombre del modelo junto con \u00abGGUF\u00bb. Entre los re-cuantizadores fiables se incluyen <strong>bartowski<\/strong>, <strong>Qwen<\/strong> (oficial para Qwen3), <strong>lmstudio-community<\/strong>, <strong>unsloth<\/strong> y <strong>MaziyarPanahi<\/strong>. Meta, Google, Mistral and Microsoft publish some official GGUF builds; for others the community quantizes from the released safetensors.<\/p>\n<p>Un repositorio suele contener un archivo por nivel de cuantizaci\u00f3n, por ejemplo: <code>Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf<\/code>. Para modelos de m\u00e1s de ~50&nbsp;GB, el archivo se divide en fragmentos (shards) cuyos nombres siguen el patr\u00f3n <code>-00001-of-00003.gguf<\/code>; los entornos de ejecuci\u00f3n los cargan autom\u00e1ticamente a partir del primer fragmento.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_a_GGUF_Model\"><\/span>Ejecutar un modelo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Linux<\/h3>\n<p>Compile llama.cpp desde el c\u00f3digo fuente o instale el binario precompilado. Con CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j\n.\/build\/bin\/llama-cli -m ~\/models\/llama-3.1-8b-instruct-Q4_K_M.gguf \n    -p \"Explica GGUF en un p\u00e1rrafo.\" -n 256 -ngl 99<\/code><\/pre>\n<p>El <code>-ngl<\/code> La bandera \u00abn-gpu-layers\u00bb determina cu\u00e1ntas capas del transformador se trasladan a la GPU. Establ\u00e9zcala lo suficientemente alta como para que todo el modelo quepa en la VRAM; si se queda sin memoria, reduzca su valor y el resto permanecer\u00e1 en la CPU. Para ofrecer una API HTTP compatible con OpenAI, use <code>llama-server<\/code> en el puerto 8080 de forma predeterminada.<\/p>\n<h3>macOS<\/h3>\n<p>En Apple Silicon, llama.cpp utiliza autom\u00e1ticamente el backend Metal. Inst\u00e1lelo mediante Homebrew:<\/p>\n<pre><code>brew install llama.cpp\nllama-cli -m ~\/models\/qwen3-8b-Q5_K_M.gguf -p \"Hola\" -ngl 99<\/code><\/pre>\n<p>La memoria unificada significa que el l\u00edmite es su RAM total menos la sobrecarga del sistema operativo. Un Mac de la serie M con 32&nbsp;GB de RAM ejecuta c\u00f3modamente Qwen3 de 14B o <code>-ngl<\/code> ceiling is your total RAM minus the OS overhead. A 32&nbsp;GB M-series Mac comfortably runs Qwen3 14B or Gemma 3 12B at Q4_K_M &mdash; the database lists those at ~9&nbsp;GB and ~8&nbsp;GB of VRAM respectively.<\/p>\n<p>Para una interfaz gr\u00e1fica (GUI), <a href=\"https:\/\/convly.ai\/es\/lm-studio-complete-guide-2026\/\">LM Studio<\/a> es la opci\u00f3n habitual en Mac. Descarga autom\u00e1ticamente los archivos GGUF desde Hugging Face y expone un servidor local compatible con la API de OpenAI.<\/p>\n<h3>Windows<\/h3>\n<p>Tres v\u00edas pr\u00e1cticas:<\/p>\n<ul>\n<li><strong>Ollama.<\/strong> Inst\u00e1lelo desde <a href=\"https:\/\/ollama.com\/download\" rel=\"noopener\" target=\"_blank\">ollama.com\/download<\/a>, entonces <code>ollama run llama3.1:8b<\/code>. Ollama descarga sus propias versiones curadas de GGUF. Para cargar un archivo arbitrario, cree un archivo Modelfile con una l\u00ednea <code>FROM .\/mymodel.gguf<\/code> y ejecute <code>ollama create mymodel -f Modelfile<\/code>. Consulte nuestra <a href=\"https:\/\/convly.ai\/es\/how-to-install-ollama-2026\/\">Gu\u00eda de instalaci\u00f3n de Ollama<\/a>.<\/li>\n<li><strong>LM Studio.<\/strong> Instalaci\u00f3n en un solo clic, exploraci\u00f3n y descarga de GGUF desde una interfaz gr\u00e1fica, control deslizante para la descarga de carga a la GPU.<\/li>\n<li><strong>binarios precompilados de llama.cpp.<\/strong> El proyecto proporciona paquetes comprimidos precompilados para Windows (CPU, CUDA y Vulkan) en la <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\/releases\" rel=\"noopener\" target=\"_blank\">versiones de GitHub<\/a>. Descompr\u00edmalos y ejecute <code>llama-cli.exe<\/code> de la misma manera que en Linux.<\/li>\n<\/ul>\n<p>En cuanto a la elecci\u00f3n de GPU, la <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">gu\u00eda local de GPUs para LLM<\/a> cubre las opciones actuales en t\u00e9rminos de precio y VRAM disponibles.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_Safetensors_vs_AWQ_vs_GPTQ\"><\/span>GGUF frente a Safetensors frente a AWQ frente a GPTQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Formato<\/th>\n<th>Entorno de ejecuci\u00f3n principal<\/th>\n<th>Precisi\u00f3n<\/th>\n<th>Ideal para<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GGUF<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>2\u20138 bits + F16<\/td>\n<td>CPU, CPU\/GPU mixto, Apple Silicon, usuario \u00fanico<\/td>\n<\/tr>\n<tr>\n<td>Safetensors (FP16\/BF16)<\/td>\n<td>Transformers, vLLM<\/td>\n<td>16 bits<\/td>\n<td>Entrenamiento, investigaci\u00f3n, inferencia en precisi\u00f3n completa<\/td>\n<\/tr>\n<tr>\n<td>AWQ<\/td>\n<td>vLLM, AutoAWQ<\/td>\n<td>4 bits<\/td>\n<td>Servicio GPU de alto rendimiento<\/td>\n<\/tr>\n<tr>\n<td>GPTQ<\/td>\n<td>vLLM, ExLlamaV2<\/td>\n<td>3\u20138 bits<\/td>\n<td>Inferencia exclusiva en GPU con agrupamiento (batching)<\/td>\n<\/tr>\n<tr>\n<td>MLX<\/td>\n<td>MLX (Apple)<\/td>\n<td>4\u201316 bits<\/td>\n<td>Exclusivo para Apple Silicon<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Elija GGUF cuando el destino sea un \u00fanico usuario en hardware heterog\u00e9neo o cuando necesite que el modelo se ejecute incluso en CPU. Elija vLLM con safetensors AWQ\/GPTQ cuando est\u00e9 atendiendo a muchos usuarios concurrentes en una GPU de centro de datos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_Is_Not_the_Right_Answer\"><\/span>Cu\u00e1ndo GGUF no es la respuesta adecuada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF asume inferencia secuencial con tama\u00f1o de lote igual a uno (batch-size-1). Su rendimiento es mucho menor que el de vLLM o TensorRT-LLM bajo carga concurrente, y no dispone de atenci\u00f3n paginada (paged attention). Si est\u00e1 ofreciendo una API para tr\u00e1fico real, una implementaci\u00f3n en FP16 o AWQ sobre vLLM superar\u00e1 a GGUF en tokens\/segundo\/d\u00f3lar, incluso antes de considerar el tiempo de desarrollo invertido.<\/p>\n<p>It also breaks down at the top end of model size. Kimi K3 needs ~1.4&nbsp;TB of VRAM at 4-bit and DeepSeek V4-Pro around 800&nbsp;GB &mdash; those are multi-node deployments, not desktop GGUF workloads. And for frontier hosted models like <a href=\"https:\/\/convly.ai\/es\/models\/\">Claude Sonnet 4.6<\/a> a 3 d\u00f3lares por entrada \/ 15 d\u00f3lares por salida por cada mill\u00f3n de tokens o Gemini 3.6 Flash a 1,50 d\u00f3lares por entrada \/ 7,50 d\u00f3lares por salida, no existen pesos locales que convertir. Calcule los costos con precisi\u00f3n antes de comprometerse con la compra de una GPU. <a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">calculadora de autohospedaje frente a API<\/a> antes de comprometerse con la compra de una GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Converting_a_Model_to_GGUF\"><\/span>Convertir un modelo a GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Si un modelo est\u00e1 disponible en Hugging Face en formato safetensors pero a\u00fan nadie lo ha cuantizado, el flujo de trabajo es:<\/p>\n<pre><code># en el repositorio llama.cpp\npip install -r requirements.txt\npython convert_hf_to_gguf.py \/ruta\/a\/modelo-hf --outfile modelo-f16.gguf\n.\/build\/bin\/llama-quantize modelo-f16.gguf modelo-Q4_K_M.gguf Q4_K_M<\/code><\/pre>\n<p>El script de conversi\u00f3n solo admite las arquitecturas que llama.cpp ya conoce: llama, mistral, qwen2\/3, gemma, phi y una lista creciente de otras. Para arquitecturas novedosas es necesario modificar primero el c\u00f3digo. Los nombres de archivo y las banderas del script han cambiado entre versiones de llama.cpp, as\u00ed que consulte <code>python convert_hf_to_gguf.py --help<\/code> en relaci\u00f3n con el commit con el que compil\u00f3.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfEs GGUF lo mismo que GGML?<\/h3>\n<p>No. GGML era el formato anterior utilizado por llama.cpp hasta mediados de 2023. GGUF lo reemplaz\u00f3 en agosto de 2023 con un encabezado versionado, metadatos integrados y una disposici\u00f3n estable de tensores. Los archivos antiguos en formato <code>.bin<\/code> GGML ya no se cargan en la versi\u00f3n actual de llama.cpp; debe buscar una versi\u00f3n re-cuantizada en formato GGUF.<\/p>\n<h3>\u00bfQu\u00e9 cuantizaci\u00f3n debo descargar?<\/h3>\n<p>Comience con <code>Q4_K_M<\/code>. Es el formato que mejor se adapta a la mayor variedad de hardware, y la p\u00e9rdida de calidad frente a FP16 es peque\u00f1a para la mayor\u00eda de los modelos con m\u00e1s de 7 mil millones de par\u00e1metros. Pase a <code>Q5_K_M<\/code> o <code>Q6_K<\/code> si dispone de VRAM adicional y le importa especialmente la precisi\u00f3n en programaci\u00f3n o razonamiento. Reduzca a <code>Q3_K_M<\/code> o a una variante <code>IQ3<\/code> \u00fanicamente si el modelo, de otro modo, no cabe en su hardware.<\/p>\n<h3>Can GGUF models use my GPU?<\/h3>\n<p>S\u00ed. llama.cpp admite CUDA (NVIDIA), ROCm (AMD), Metal (Apple), Vulkan (multi-fabricante) y SYCL (Intel). La bandera <code>-ngl<\/code> descarga capas a la GPU. Si el modelo cabe \u00edntegramente en la VRAM, el rendimiento es cercano al de entornos GPU dedicados; si la descarga es parcial, la velocidad queda limitada por la capa m\u00e1s lenta, sea cual sea su ubicaci\u00f3n f\u00edsica.<\/p>\n<h3>\u00bfFunciona GGUF con modelos de visi\u00f3n o audio?<\/h3>\n<p>Parcialmente. llama.cpp admite modelos visuales multimodales tipo LLaVA mediante un archivo <code>mmproj<\/code> GGUF emparejado que contiene el proyector visual. El soporte para Qwen-VL, Gemma 3 Vision y similares se ha ido incorporando progresivamente, aunque sigue rezagado respecto a las versiones exclusivamente textuales. Los modelos de audio como Whisper utilizan su propio formato relacionado, gestionado por <code>whisper.cpp<\/code>, no por el binario principal de llama.cpp.<\/p>\n<h3>\u00bfC\u00f3mo elijo un modelo GGUF que se adapte a mi hardware?<\/h3>\n<p>Busque el modelo en la <a href=\"https:\/\/convly.ai\/es\/models\/\">base de datos de modelos Convly<\/a> para conocer su requerimiento de VRAM en cuantizaci\u00f3n de 4 bits, luego reste 1\u20133&nbsp;GB como margen de seguridad para el contexto y la sobrecarga del sistema operativo. En una tarjeta de 24&nbsp;GB, Qwen3 32B (~20&nbsp;GB) o Gemma 3 27B (~16&nbsp;GB) en cuantizaci\u00f3n Q4 son opciones c\u00f3modas. El <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> maneja contextos m\u00e1s largos, lo que incrementa significativamente la cach\u00e9 KV.<\/p>\n<h3>\u00bfSon seguros los archivos GGUF para ejecutarlos?<\/h3>\n<p>The weights themselves are just numbers &mdash; unlike Python pickle-based checkpoints, GGUF does not execute code on load. The risk is a maliciously crafted file triggering a parser bug in the runtime. Stick to known Hugging Face uploaders (bartowski, unsloth, lmstudio-community, official vendor accounts) and keep llama.cpp, Ollama or LM Studio updated.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF (GPT-Generated Unified Format) is a single-file binary format for quantized large language models, introduced by the llama.cpp project in [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2609,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2608","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2608","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2608"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2608\/revisions"}],"predecessor-version":[{"id":2610,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2608\/revisions\/2610"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2609"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2608"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2608"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2608"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}