{"id":2605,"date":"2026-09-09T20:14:45","date_gmt":"2026-09-09T20:14:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2605"},"modified":"2026-09-09T20:14:45","modified_gmt":"2026-09-09T20:14:45","slug":"gguf-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/gguf-models\/","title":{"rendered":"Modelos GGUF: qu\u00e9 son y c\u00f3mo ejecutarlos"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF es un formato de contenedor de un solo archivo para modelos cuantizados<\/strong>, creado para <a href=\"https:\/\/github.com\/ggml-org\/llama.cpp\" rel=\"noopener\" target=\"_blank\">llama.cpp<\/a>. Un <code>.gguf<\/code> solo archivo contiene los pesos, el tokenizador, la plantilla de chat y los metadatos: nada de carpetas de configuraci\u00f3n ni archivos separados del tokenizador.<\/li>\n<li><strong>GGUF models are what Ollama, LM Studio, KoboldCpp, Jan and llama.cpp actually load.<\/strong> Si ejecutas un modelo localmente en hardware de consumo, casi con toda seguridad est\u00e1s ejecutando GGUF.<\/li>\n<li><strong>Elecci\u00f3n predeterminada: <code>Q4_K_M<\/code>.<\/strong> Aproximadamente 0,6 GB de archivo por mil millones de par\u00e1metros: un modelo de 8B ocupa cerca de 5 GB, lo que coincide con la cifra de ~5 GB en 4 bits que <a href=\"https:\/\/convly.ai\/es\/models\/\">base de datos de modelos Convly<\/a> enumera para Llama 3.1 8B.<\/li>\n<li><strong>GGUF est\u00e1 dise\u00f1ado para inferencia local por un solo usuario.<\/strong> For concurrent serving use safetensors with vLLM or an API instead.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (GPT-Generated Unified Format) es el formato de archivo que utiliza el ecosistema llama.cpp\/ggml para almacenar un modelo listo para inferencia. Un \u00fanico <code>.gguf<\/code> archivo contiene los tensores cuantizados, adem\u00e1s de todo lo necesario para usarlos: vocabulario, configuraci\u00f3n del tokenizador, plantilla de chat y metadatos de la arquitectura. Reemplaz\u00f3 al antiguo formato GGML en agosto de 2023 y ahora es el est\u00e1ndar de facto para ejecutar modelos en port\u00e1tiles, equipos de sobremesa y CPUs.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_87_1 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6aa1d088e0676\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6aa1d088e0676\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#What_is_actually_inside_a_gguf_file\" >\u00bfQu\u00e9 contiene realmente un archivo .gguf?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#How_to_read_a_GGUF_filename\" >C\u00f3mo interpretar el nombre de un archivo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Sizing_which_GGUF_models_fit_your_GPU\" >Tama\u00f1o: \u00bfqu\u00e9 modelos GGUF caben en tu GPU?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Where_to_download_GGUF_models\" >D\u00f3nde descargar modelos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Running_GGUF_models_on_Linux\" >Ejecutar modelos GGUF en Linux<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Running_GGUF_models_on_macOS\" >Ejecutar modelos GGUF en macOS<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Running_GGUF_models_on_Windows\" >Ejecutar modelos GGUF en Windows<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Loading_an_arbitrary_GGUF_into_Ollama\" >Cargar un archivo GGUF arbitrario en Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#When_GGUF_is_the_wrong_answer\" >Cu\u00e1ndo GGUF no es la soluci\u00f3n adecuada<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/es\/gguf-models\/#Frequently_asked_questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_is_actually_inside_a_gguf_file\"><\/span>\u00bfQu\u00e9 contiene realmente un archivo .gguf?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un archivo GGUF consta de un encabezado, un bloque de metadatos clave-valor y, a continuaci\u00f3n, los datos de los tensores. Los metadatos son la parte que pr\u00e1cticamente importa: por eso un modelo GGUF no requiere archivos auxiliares. La <a href=\"https:\/\/huggingface.co\/docs\/hub\/en\/gguf\" rel=\"noopener\" target=\"_blank\">documentaci\u00f3n oficial de GGUF de Hugging Face<\/a> describe su estructura y el visor integrado de metadatos GGUF del Hub, que permite inspeccionar el tipo de cuantizaci\u00f3n, la longitud de contexto y la plantilla de chat de un archivo antes de descargar varios gigabytes.<\/p>\n<p>Las claves de metadatos t\u00edpicas incluyen la arquitectura (<code>llama<\/code>, <code>qwen3<\/code>, <code>gemma3<\/code>, <code>phi3<\/code>), la longitud de contexto de entrenamiento, la configuraci\u00f3n RoPE, el vocabulario completo y la plantilla de chat Jinja. Un cargador lee ese bloque y se configura autom\u00e1ticamente; no es necesario pasar manualmente un tokenizador ni un formato de indicaci\u00f3n.<\/p>\n<h3>GGUF frente a safetensors<\/h3>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Entorno de ejecuci\u00f3n principal<\/td>\n<td>llama.cpp, Ollama, LM Studio<\/td>\n<td>PyTorch, vLLM, Transformers, TGI<\/td>\n<\/tr>\n<tr>\n<td>Archivos por modelo<\/td>\n<td>Uno (o fragmentos numerados)<\/td>\n<td>Pesos m\u00e1s carpeta de configuraci\u00f3n\/tokenizador<\/td>\n<\/tr>\n<tr>\n<td>Cuantizaci\u00f3n<\/td>\n<td>Incorporada (Q4_K_M, Q8_0, IQ\u2026)<\/td>\n<td>Normalmente FP16\/BF16, o variantes GPTQ\/AWQ<\/td>\n<\/tr>\n<tr>\n<td>CPU + descarga parcial a GPU<\/td>\n<td>S\u00ed, objetivo central de dise\u00f1o<\/td>\n<td>Limitada y lenta<\/td>\n<\/tr>\n<tr>\n<td>Servicio simult\u00e1neo por lotes<\/td>\n<td>D\u00e9bil<\/td>\n<td>Fuerte<\/td>\n<\/tr>\n<tr>\n<td>Ajuste fino<\/td>\n<td>No (primero debe convertirse de nuevo)<\/td>\n<td>S\u00ed<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_a_GGUF_filename\"><\/span>C\u00f3mo interpretar el nombre de un archivo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Los archivos suelen nombrarse <code>Modelo-Nombre-8B-Instruct-Q4_K_M.gguf<\/code>. El sufijo indica la combinaci\u00f3n de cuantizaci\u00f3n. El n\u00famero representa el ancho de bits nominal; <code>_K<\/code> significa k-quants, que mantienen los tensores de atenci\u00f3n y de incrustaci\u00f3n (embeddings) con mayor precisi\u00f3n que los pesos principales de la capa de retroalimentaci\u00f3n (feed-forward); <code>S<\/code>\/<code>M<\/code>\/<code>L<\/code> son variantes peque\u00f1as\/medianas\/grandes de esa combinaci\u00f3n.<\/p>\n<table>\n<thead>\n<tr>\n<th>Cuantizaci\u00f3n<\/th>\n<th>Aprox. bits\/peso<\/th>\n<th>Tama\u00f1o aproximado, modelo de 8B<\/th>\n<th>Cu\u00e1ndo usarlo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Q8_0<\/td>\n<td>~8.5<\/td>\n<td>~8,5 GB<\/td>\n<td>Referencia casi sin p\u00e9rdida; solo para modelos peque\u00f1os<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6.6<\/td>\n<td>~6,6 GB<\/td>\n<td>Tienes VRAM de sobra<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5.7<\/td>\n<td>~5,7 GB<\/td>\n<td>Predeterminado orientado a la calidad<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4.9<\/td>\n<td>~4,9 GB<\/td>\n<td><strong>El valor predeterminado habitual<\/strong><\/td>\n<\/tr>\n<tr>\n<td>Q4_0<\/td>\n<td>~4.5<\/td>\n<td>~4,5 GB<\/td>\n<td>Herencia; algunos aceleradores lo prefieren<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~3.9<\/td>\n<td>~4,0 GB<\/td>\n<td>Apretar un modelo m\u00e1s grande en poca VRAM<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~2,5\u20133,4<\/td>\n<td>~2,5\u20133,4 GB<\/td>\n<td>\u00daltimo recurso; degradaci\u00f3n notable<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Trate la columna de bits por peso como aproximada. Los tama\u00f1os reales var\u00edan seg\u00fan la arquitectura del modelo (un vocabulario amplio infla los tensores de incrustaci\u00f3n) y seg\u00fan la versi\u00f3n de llama.cpp, ya que las combinaciones de cuantizaci\u00f3n se ajustan con el tiempo. La <code>IQ<\/code> familia (IQ2_XXS hasta IQ4_NL) emplea una calibraci\u00f3n basada en matrices de importancia para mantener mejor su rendimiento a anchos de bit muy bajos, y cuantizadores como Bartowski y Unsloth publican variantes IQ junto con los K-quants est\u00e1ndar.<\/p>\n<p>El consenso comunitario \u2014no una medici\u00f3n de Convly\u2014 es que Q4_K_M representa el punto \u00f3ptimo y que la calidad disminuye bruscamente por debajo de aproximadamente 3 bits por peso: los modelos peque\u00f1os se degradan m\u00e1s r\u00e1pido que los grandes a la misma cuantizaci\u00f3n.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Sizing_which_GGUF_models_fit_your_GPU\"><\/span>Tama\u00f1o: \u00bfqu\u00e9 modelos GGUF caben en tu GPU?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>El tama\u00f1o del archivo es el l\u00edmite inferior, no el total. A\u00f1ada la cach\u00e9 KV correspondiente a su longitud de contexto, m\u00e1s unos 500 MB\u20131 GB de sobrecarga. Estas cifras de 4 bits provienen de la <a href=\"https:\/\/convly.ai\/es\/models\/\">base de datos de modelos Convly<\/a>:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>VRAM en 4 bits<\/th>\n<th>Contexto<\/th>\n<th>GPU realista<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Gemma 3 4B<\/td>\n<td>~3 GB<\/td>\n<td>128 K<\/td>\n<td>Cualquier tarjeta de 6 GB o GPU integrada<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B<\/td>\n<td>~4,5 GB<\/td>\n<td>32K<\/td>\n<td>Tarjeta de 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>~5 GB<\/td>\n<td>128 K<\/td>\n<td>Tarjeta de 8 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 14B<\/td>\n<td>~9 GB<\/td>\n<td>128 K<\/td>\n<td>Tarjeta de 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Phi-4<\/td>\n<td>~9 GB<\/td>\n<td>16K<\/td>\n<td>Tarjeta de 12 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 3 27B<\/td>\n<td>~16 GB<\/td>\n<td>128 K<\/td>\n<td>Tarjeta de 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>~20 GB<\/td>\n<td>128 K<\/td>\n<td>Tarjeta de 24 GB<\/td>\n<\/tr>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>~40 GB<\/td>\n<td>128 K<\/td>\n<td>2\u00d724 GB o memoria unificada de 48 GB<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1 (completo)<\/td>\n<td>~400 GB<\/td>\n<td>128 K<\/td>\n<td>Solo para servidores multi-GPU<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Mixture-of-experts models are the trap here. Qwen3 30B-A3B activates only ~3B parameters per token but still needs all ~18 GB resident. At the extreme, the database puts Kimi K3 at ~1.4 TB at 4-bit \u2014 a GGUF exists in principle, but no single machine you own will hold it. For an exact figure at your context length, use the <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> o el desglose por modelo en <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para cada LLM importante<\/a>. Si a\u00fan est\u00e1 eligiendo hardware, <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">mejoras GPUs para modelos de lenguaje local<\/a> analiza el compromiso entre VRAM y precio.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_to_download_GGUF_models\"><\/span>D\u00f3nde descargar modelos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Hugging Face<\/strong> \u2014 filtre la lista de modelos con <a href=\"https:\/\/huggingface.co\/models?library=gguf\" rel=\"noopener\" target=\"_blank\">library=gguf<\/a>. La mayor\u00eda de los repositorios incluyen todas las cuantizaciones en un mismo repositorio; descargue \u00fanicamente el archivo que necesite, no todo el repositorio.<\/li>\n<li><strong>biblioteca de Ollama<\/strong> \u2014 <a href=\"https:\/\/ollama.com\/library\" rel=\"noopener\" target=\"_blank\">ollama.com\/library<\/a> ofrece GGUF preempaquetados con la plantilla de chat ya configurada. Consulte la <a href=\"https:\/\/convly.ai\/es\/ollama-models-list-2026\/\">Lista de modelos de Ollama<\/a>.<\/li>\n<li><strong>LM Studio<\/strong> \u2014 la pesta\u00f1a Descubrir de la aplicaci\u00f3n busca repositorios de GGUF en Hugging Face y se\u00f1ala qu\u00e9 cuantizaciones caben en la RAM\/VRAM detectada. Tutorial: <a href=\"https:\/\/convly.ai\/es\/lm-studio-complete-guide-2026\/\">Gu\u00eda completa de LM Studio<\/a>.<\/li>\n<\/ul>\n<p>Los modelos grandes llegan fragmentados como <code>model-00001-of-00003.gguf<\/code> y as\u00ed sucesivamente. Descargue todos los fragmentos en la misma carpeta y apunte el cargador al fragmento 00001: este encontrar\u00e1 autom\u00e1ticamente los dem\u00e1s.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Linux\"><\/span>Ejecutar modelos GGUF en Linux<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Compile llama.cpp con soporte CUDA:<\/p>\n<pre><code>git clone https:\/\/github.com\/ggml-org\/llama.cpp\ncd llama.cpp\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release -j<\/code><\/pre>\n<p>Los binarios se ubican en <code>build\/bin\/<\/code>. Inicie un servidor compatible con OpenAI:<\/p>\n<pre><code>.\/build\/bin\/llama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 -ngl 99 --port 8080<\/code><\/pre>\n<p><code>-ngl<\/code> (<code>--n-gpu-layers<\/code>) es el control de descarga: <code>99<\/code> significa \u00abtodas las capas en la GPU\u00bb; <code>0<\/code> significa solo CPU, y los valores intermedios dividen el modelo cuando este no cabe \u00edntegramente. <code>-c<\/code> establece el contexto; dejarlo en el contexto completo entrenado del modelo puede consumir m\u00e1s VRAM que los propios pesos. El punto final es entonces <code>http:\/\/localhost:8080\/v1\/chat\/completions<\/code>.<\/p>\n<p>Dos advertencias sobre versiones: la bandera de CMake era <code>LLAMA_CUBLAS<\/code> en versiones anteriores, y los binarios fueron renombrados (<code>main<\/code> \u2192 <code>llama-cli<\/code>, <code>server<\/code> \u2192 <code>llama-server<\/code>) en 2024. Consulte el README del repositorio para la versi\u00f3n que haya clonado. Para GPUs AMD o Intel, sustituya la bandera del backend ROCm\/Vulkan\/SYCL documentada all\u00ed, en lugar de adivinar.<\/p>\n<p>Si usa Ollama en su lugar, los modelos residen en <code>\/usr\/share\/ollama\/.ollama\/models<\/code> cuando se ejecuta como servicio del sistema, o <code>~\/.ollama\/models<\/code> para una instalaci\u00f3n por usuario. Consulte <a href=\"https:\/\/convly.ai\/es\/how-to-install-ollama-2026\/\">c\u00f3mo instalar Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_macOS\"><\/span>Ejecutar modelos GGUF en macOS<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Apple Silicon es inusualmente eficiente con GGUF porque su memoria unificada permite que la GPU acceda a la mayor parte de la RAM del sistema: un Mac de 64 GB puede alojar un modelo de 70B cuantizado a 4 bits de ~40 GB, que en un PC requerir\u00eda dos tarjetas gr\u00e1ficas de 24 GB.<\/p>\n<pre><code>brew install llama.cpp\nllama-server -m ~\/models\/model-Q4_K_M.gguf -c 8192 --port 8080<\/code><\/pre>\n<p>La descarga a Metal est\u00e1 habilitada en la compilaci\u00f3n de Homebrew, por lo que generalmente no necesita <code>-ngl<\/code>. macOS limita la cantidad de RAM que la GPU puede asignar (ajustable mediante un <code>iogpu<\/code> sysctl, cuyo valor var\u00eda seg\u00fan la versi\u00f3n de macOS), as\u00ed que deje margen suficiente para el sistema operativo. Ollama almacena los modelos en <code>~\/.ollama\/models<\/code>; LM Studio utiliza <code>~\/.lmstudio\/models<\/code> en versiones actuales y <code>~\\\/\\.cache\\\/lm-studio\\\/models<\/code> en versiones anteriores \u2014 la pesta\u00f1a \u00abMis modelos\u00bb muestra y permite modificar la ruta real.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Running_GGUF_models_on_Windows\"><\/span>Ejecutar modelos GGUF en Windows<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tres v\u00edas, de m\u00e1s sencilla a m\u00e1s compleja:<\/p>\n<ol>\n<li><strong>LM Studio<\/strong> \u2014 Instalador gr\u00e1fico, b\u00fasqueda integrada de modelos dentro de la aplicaci\u00f3n y activador para servidor local. Es la opci\u00f3n predeterminada m\u00e1s adecuada para usuarios no desarrolladores.<\/li>\n<li><strong>Ollama<\/strong> \u2014 Instalador nativo para Windows; los modelos se guardan en <code>C:\\Users\\&lt;t\u00fa&gt;\\.ollama\\models<\/code>. Establezca la variable de entorno <code>OLLAMA_MODELS<\/code> para ubicarlos fuera de la unidad del sistema. Antecedentes: <a href=\"https:\/\/convly.ai\/es\/what-is-ollama-complete-guide-2026\/\">qu\u00e9 es Ollama<\/a>.<\/li>\n<li><strong>Binarios precompilados de llama.cpp<\/strong> \u2014 La p\u00e1gina de versiones (Releases) de GitHub publica paquetes comprimidos para Windows, espec\u00edficos para cada backend (CUDA, Vulkan, CPU). Descomprima y ejecute <code>llama-server.exe -m model.gguf -ngl 99<\/code> desde PowerShell. Elija la versi\u00f3n CUDA para GPUs NVIDIA; Vulkan es la alternativa segura multiplataforma para AMD e Intel Arc.<\/li>\n<\/ol>\n<p>Aspectos particulares de Windows: el escaneo en tiempo real de Windows Defender ralentiza la primera carga de archivos de varios gigabytes, y ejecutar llama.cpp dentro de WSL2 le resta una porci\u00f3n de RAM a la m\u00e1quina virtual. Las compilaciones nativas para Windows suelen ser la opci\u00f3n m\u00e1s sencilla.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_an_arbitrary_GGUF_into_Ollama\"><\/span>Cargar un archivo GGUF arbitrario en Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Versiones recientes de Ollama pueden descargar directamente desde Hugging Face:<\/p>\n<pre><code>ollama run hf.co\/\/:Q4_K_M<\/code><\/pre>\n<p>Para un archivo local, cree un archivo Modelfile en el mismo directorio:<\/p>\n<pre><code>FROM .\/model-Q4_K_M.gguf<\/code><\/pre>\n<p>entonces <code>ollama create my-model -f Modelfile<\/code> y <code>ollama run my-model<\/code>. Si el GGUF carece de una plantilla de chat utilizable, agregue una l\u00ednea <code>TEMPLATE<\/code> y <code>PARAMETER stop<\/code> \u2014 las directivas exactas admitidas en Modelfile han evolucionado con las versiones, as\u00ed que consulte <code>ollama help create<\/code> para su versi\u00f3n espec\u00edfica. Selecciones recomendadas: <a href=\"https:\/\/convly.ai\/es\/best-local-llms-to-run-on-ollama-2026\/\">mejores modelos de lenguaje locales para Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_GGUF_is_the_wrong_answer\"><\/span>Cu\u00e1ndo GGUF no es la soluci\u00f3n adecuada<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>GGUF optimizes one user at a time. Serving many concurrent requests, or needing tensor parallelism across GPUs, points to safetensors with vLLM or SGLang. And running locally is not automatically cheaper: hosted Llama 3.3 70B is $0.10 in \/ $0.32 out per 1M tokens, while frontier hosted models like Claude Sonnet 5 sit at $2.00 in \/ $10.00 out per 1M tokens for 1M context. Run your own volume through the <a href=\"https:\/\/convly.ai\/es\/ai-api-cost-calculator\/\">Calculadora de costos de API<\/a> y la <a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">calculadora de punto de equilibrio entre alojamiento local y uso de API<\/a> antes de adquirir una GPU.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfQu\u00e9 significa GGUF y en qu\u00e9 se diferencia de GGML?<\/h3>\n<p>GGUF significa Formato Unificado Generado por GPT. GGML fue el formato anterior del mismo proyecto; romp\u00eda la compatibilidad cada vez que se requer\u00edan nuevos metadatos. GGUF incorpor\u00f3 un bloque extensible de metadatos clave-valor, lo que permite a\u00f1adir nuevas arquitecturas y opciones sin invalidar archivos antiguos. Los archivos <code>.bin<\/code> GGML anteriores a GGUF ya no se cargan en las versiones actuales de llama.cpp.<\/p>\n<h3>\u00bfQu\u00e9 cuantizaci\u00f3n debo descargar?<\/h3>\n<p>Comience con Q4_K_M. Si el modelo a\u00fan deja varios GB de VRAM libres, pruebe Q5_K_M o Q6_K. Si no cabe en la memoria disponible, prefiera un modelo m\u00e1s peque\u00f1o en Q4_K_M antes que el mismo modelo en Q2_K: un modelo de 14B a 4 bits suele superar ampliamente a uno de 32B degradado a 2 bits. Verifique el ajuste con la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para su longitud de contexto prevista.<\/p>\n<h3>\u00bfPuedo ejecutar modelos GGUF sin GPU?<\/h3>\n<p>Yes \u2014 CPU-only inference is what GGUF was built for. Speed is bound by memory bandwidth, so expect single-digit tokens per second for a 7B\u20138B model at Q4_K_M on typical dual-channel desktop RAM, and slower for anything larger. Small models like Gemma 3 4B (~3 GB at 4-bit) are the practical CPU-only choice.<\/p>\n<h3>\u00bfPuedo convertir yo mismo un modelo de Hugging Face a GGUF?<\/h3>\n<p>S\u00ed. llama.cpp incluye un script de conversi\u00f3n (<code>convert_hf_to_gguf.py<\/code> en versiones actuales; en versiones anteriores el nombre del archivo usaba guiones) que genera un GGUF en F16, y luego el binario <code>llama-quantize<\/code> lo comprime a la cuantizaci\u00f3n objetivo. Revise la ayuda del script con <code>--help<\/code> en la copia que clon\u00f3, y confirme que su arquitectura es compatible antes de comenzar: las arquitecturas no soportadas fallan durante la conversi\u00f3n.<\/p>\n<h3>\u00bfAdmiten los modelos GGUF visi\u00f3n o llamadas a herramientas?<\/h3>\n<p>La invocaci\u00f3n de herramientas (tool calling) funciona cuando la plantilla de chat del modelo lo define y su cargador respeta dicha plantilla. Los modelos multimodales requieren un segundo archivo: un <code>mmproj<\/code> GGUF que contiene el proyector visual, cargado junto con los pesos del texto. Las herramientas multimodales de llama.cpp han sido renombradas y reorganizadas varias veces, as\u00ed que siga siempre la documentaci\u00f3n actual del repositorio y no tutoriales obsoletos.<\/p>\n<h3>\u00bfLa cuantizaci\u00f3n modifica la ventana de contexto?<\/h3>\n<p>No. El contexto es una propiedad del modelo, no de la cuantizaci\u00f3n: Llama 3.3 70B tiene 128K y Llama 4 Scout tiene 10M, independientemente de que ejecute en F16 o Q4_K_M. Lo que cambia es si puede permitirse la cach\u00e9 KV para ese contexto en memoria. Compare contexto y precios entre modelos en la <a href=\"https:\/\/convly.ai\/es\/llm-leaderboard\/\">Clasificaci\u00f3n de modelos de lenguaje grande (LLM)<\/a>.<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is a single-file container format for quantized models, created for llama.cpp. One .gguf file holds the weights, the tokenizer, [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2606,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2605","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2605","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2605"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2605\/revisions"}],"predecessor-version":[{"id":2607,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2605\/revisions\/2607"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2606"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2605"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2605"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2605"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}