{"id":2103,"date":"2026-08-03T20:03:24","date_gmt":"2026-08-03T20:03:24","guid":{"rendered":"https:\/\/convly.ai\/?p=2103"},"modified":"2026-08-03T20:03:24","modified_gmt":"2026-08-03T20:03:24","slug":"what-is-gguf-format-explained","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/","title":{"rendered":"\u00bfQu\u00e9 es GGUF? El formato de archivo de LLM detr\u00e1s de Ollama y llama.cpp, explicado"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li><strong>GGUF es el formato de archivo para ejecutar LLMs localmente.<\/strong> It packs a model&#8217;s weights, tokenizer and configuration into a single binary file that llama.cpp, Ollama, LM Studio and most other local-LLM tools load directly.<\/li>\n<li><strong>Reemplaz\u00f3 a GGML en agosto de 2023<\/strong> porque los archivos GGML dejaban de funcionar cada vez que el formato cambiaba. GGUF est\u00e1 versionado y es extensible, por lo que los archivos antiguos siguen funcionando.<\/li>\n<li><strong>El sufijo indica el nivel de cuantizaci\u00f3n.<\/strong> Q4_K_M (~4,9 GB para un modelo de 8B) es la opci\u00f3n predeterminada est\u00e1ndar en cuanto a calidad\/tama\u00f1o; Q8_0 es casi sin p\u00e9rdida (~8,5 GB); F16 no est\u00e1 cuantizado.<\/li>\n<li><strong>Regla general:<\/strong> elige la cuantizaci\u00f3n m\u00e1s grande cuyo tama\u00f1o de archivo quepa en tu VRAM, dejando 1\u20132 GB libres para el contexto.<\/li>\n<\/ul>\n<\/div>\n<p>GGUF (normalmente expandido como GPT-Generated Unified Format, o Formato Unificado Generado por GPT) es un formato de archivo binario para almacenar modelos de lenguaje grandes: los pesos, el tokenizador y todos los metadatos de configuraci\u00f3n en un \u00fanico archivo aut\u00f3nomo. Es el formato nativo de <strong>llama.cpp<\/strong>, y es el que utilizan <strong>Ollama<\/strong>, <strong>LM Studio<\/strong>KoboldCpp, Jan y la mayor\u00eda de otras aplicaciones locales para LLM. Si alguna vez has descargado un archivo con la extensi\u00f3n <code>.gguf<\/code>, o has extra\u00eddo un modelo con <code>ollama run<\/code>ollama run<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a712b0b70b00\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a712b0b70b00\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#What_a_GGUF_file_actually_contains\" >Qu\u00e9 contiene realmente un archivo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#Why_GGUF_replaced_GGML\" >Por qu\u00e9 GGUF reemplaz\u00f3 a GGML<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#How_to_read_the_quantisation_suffixes\" >C\u00f3mo interpretar los sufijos de cuantizaci\u00f3n<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#Picking_a_quantisation_for_your_VRAM\" >Elegir una cuantizaci\u00f3n seg\u00fan tu VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#GGUF_vs_safetensors\" >GGUF frente a safetensors<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#Where_GGUF_files_come_from\" >De d\u00f3nde provienen los archivos GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/what-is-gguf-format-explained\/#Frequently_asked_questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_a_GGUF_file_actually_contains\"><\/span>Qu\u00e9 contiene realmente un archivo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un archivo GGUF comienza con los cuatro bytes ASCII <code>GGUF<\/code>, seguidos de un n\u00famero de versi\u00f3n, una secci\u00f3n de metadatos clave-valor y, despu\u00e9s, los tensores propiamente dichos. Los metadatos representan la decisi\u00f3n de dise\u00f1o m\u00e1s importante: almacenan la arquitectura del modelo, la longitud del contexto, el vocabulario del tokenizador, la plantilla de chat y los detalles de la cuantizaci\u00f3n como claves con nombre, de modo que un entorno de ejecuci\u00f3n pueda cargar cualquier archivo GGUF sin necesidad de un archivo separado <code>config.json<\/code> o archivos de tokenizador junto con \u00e9l.<\/p>\n<p>De este dise\u00f1o se derivan tres consecuencias pr\u00e1cticas:<\/p>\n<ul>\n<li><strong>Un \u00fanico archivo constituye el modelo completo.<\/strong> Puedes copiar un archivo <code>.gguf<\/code> entre m\u00e1quinas y funcionar\u00e1 directamente. (Los modelos muy grandes a veces se dividen en partes numeradas, como <code>-00001-of-00002.gguf<\/code>, pero a\u00fan as\u00ed representan un solo modelo l\u00f3gico.)<\/li>\n<li><strong>Es asignable a memoria (memory-mappable).<\/strong> Los entornos de ejecuci\u00f3n pueden usar <code>mmap<\/code> el archivo y cargar los pesos por demanda mediante paginaci\u00f3n, lo que acelera la carga y permite iniciar modelos m\u00e1s grandes que la RAM disponible.<\/li>\n<li><strong>La cuantizaci\u00f3n est\u00e1 integrada en el formato.<\/strong> Un archivo GGUF almacena los pesos ya comprimidos a 2\u20138 bits por peso, raz\u00f3n por la cual un modelo de 8 mil millones de par\u00e1metros puede ocupar solo 4,9 GB en lugar de 16 GB.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Why_GGUF_replaced_GGML\"><\/span>Por qu\u00e9 GGUF reemplaz\u00f3 a GGML<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Antes de agosto de 2023, llama.cpp utilizaba un formato denominado GGML (llamado as\u00ed por la biblioteca de tensores subyacente). GGML funcionaba, pero ten\u00eda un defecto estructural: su disposici\u00f3n en el archivo era r\u00edgida e invariable. Cada vez que llama.cpp incorporaba una nueva caracter\u00edstica \u2014nuevas arquitecturas, mejores m\u00e9todos de cuantizaci\u00f3n, par\u00e1metros de escalado RoPE\u2014, el formato deb\u00eda modificarse, y todos los archivos de modelos existentes en todos los discos duros dejaban de funcionar. Los usuarios tuvieron que volver a descargar o convertir \u00edntegramente sus colecciones de modelos varias veces en pocos meses.<\/p>\n<p>GGUF, introducido por el proyecto llama.cpp en agosto de 2023, resolvi\u00f3 este problema mediante dos cambios:<\/p>\n<ul>\n<li><strong>Control de versiones.<\/strong> El archivo declara expl\u00edcitamente su versi\u00f3n de formato, de modo que los lectores saben exactamente c\u00f3mo analizarlo.<\/li>\n<li><strong>Metadatos extensibles basados en pares clave-valor.<\/strong> Nueva informaci\u00f3n (un campo para arquitectura, una plantilla de chat, un hiperpar\u00e1metro adicional) simplemente se a\u00f1ade como una nueva clave. Los archivos antiguos sin esa clave siguen cargando correctamente; los nuevos archivos que la incluyen funcionan en entornos de ejecuci\u00f3n actualizados. Nada se rompe retroactivamente.<\/li>\n<\/ul>\n<p>llama.cpp elimin\u00f3 el soporte para GGML poco despu\u00e9s, y el ecosistema lo sigui\u00f3. Hoy en d\u00eda, GGML subsiste \u00fanicamente como nombre de la biblioteca de tensores subyacente; si encuentras un archivo de modelo con extensi\u00f3n <code>.ggml<\/code> o <code>.bin<\/code> del a\u00f1o 2023, no se cargar\u00e1 en ninguna herramienta actual, por lo que deber\u00edas descargar en su lugar una versi\u00f3n en formato GGUF.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"How_to_read_the_quantisation_suffixes\"><\/span>C\u00f3mo interpretar los sufijos de cuantizaci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cada nombre de archivo GGUF incluye un sufijo como <code>Q4_K_M<\/code> que indica el grado de compresi\u00f3n aplicado a los pesos. El patr\u00f3n es el siguiente:<\/p>\n<ul>\n<li><strong>El n\u00famero tras la letra Q<\/strong> indica aproximadamente los bits por peso: Q4 \u2248 4 bits, Q8 \u2248 8 bits. Menos bits implican un archivo m\u00e1s peque\u00f1o y una calidad inferior.<\/li>\n<li><strong>_K<\/strong> denota los m\u00e9todos de \u00abcuantizaci\u00f3n k\u00bb m\u00e1s recientes, que destinan bits adicionales a los tensores m\u00e1s cr\u00edticos para la calidad de salida. A igual tama\u00f1o, una cuantizaci\u00f3n K supera a la versi\u00f3n anterior.<\/li>\n<li><strong>_S \/ _M \/ _L<\/strong> (peque\u00f1o\/mediano\/grande) son variantes dentro de una misma familia K \u2014 <code>_M<\/code> conserva algunos tensores especialmente sensibles con mayor precisi\u00f3n que <code>_S<\/code>.<\/li>\n<li><strong>_0<\/strong> (como en <code>Q8_0<\/code>, <code>Q4_0<\/code>) indica la antigua y m\u00e1s sencilla cuantizaci\u00f3n por bloques. <code>Q8_0<\/code> sigue siendo ampliamente utilizada porque, a 8 bits, dicho m\u00e9todo simple ya es pr\u00e1cticamente sin p\u00e9rdida; <code>Q4_0<\/code> est\u00e1 casi obsoleto: se recomienda preferir prefijos <code>Q4_K_M<\/code>.<\/li>\n<li><strong>IQ<\/strong> (por ejemplo,<code>IQ2_M<\/code>, <code>IQ3_XS<\/code>\u2026), conocidos como \u00abi-cuantizaciones\u00bb, construidos mediante una matriz de importancia, dise\u00f1ados para comprimir modelos por debajo de 4 bits con menos deterioro que las alternativas.<\/li>\n<li><strong>F16 \/ BF16 \/ F32<\/strong> indican pesos sin cuantizar de 16 o 32 bits \u2014la calidad de referencia, pero con el tama\u00f1o m\u00e1ximo.<\/li>\n<\/ul>\n<p>A continuaci\u00f3n se muestra el coste pr\u00e1ctico de las opciones m\u00e1s comunes, tomando como ejemplo modelos instruct de clase Llama de 8 mil millones de par\u00e1metros (los tama\u00f1os son aproximados y var\u00edan ligeramente seg\u00fan el modelo):<\/p>\n<table>\n<thead>\n<tr>\n<th>Cuantizaci\u00f3n<\/th>\n<th>Tama\u00f1o del archivo (modelo de 8B)<\/th>\n<th>Calidad frente a F16<\/th>\n<th>Cu\u00e1ndo usarla<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F16<\/td>\n<td>~16,1 GB<\/td>\n<td>Referencia<\/td>\n<td>Para pruebas de rendimiento o para realizar una cuantizaci\u00f3n posterior; rara vez merece la pena ejecutarlo<\/td>\n<\/tr>\n<tr>\n<td>Q8_0<\/td>\n<td>~8,5 GB<\/td>\n<td>Pr\u00e1cticamente indistinguible<\/td>\n<td>Si dispones de suficiente VRAM y deseas la m\u00e1xima calidad<\/td>\n<\/tr>\n<tr>\n<td>Q6_K<\/td>\n<td>~6,6 GB<\/td>\n<td>P\u00e9rdida despreciable<\/td>\n<td>Gran calidad con un ahorro significativo de tama\u00f1o<\/td>\n<\/tr>\n<tr>\n<td>Q5_K_M<\/td>\n<td>~5,7 GB<\/td>\n<td>P\u00e9rdida muy leve<\/td>\n<td>Buen equilibrio<\/td>\n<\/tr>\n<tr>\n<td>Q4_K_M<\/td>\n<td>~4,9 GB<\/td>\n<td>P\u00e9rdida peque\u00f1a, generalmente aceptable<\/td>\n<td><strong>El valor predeterminado est\u00e1ndar.<\/strong> La mejor relaci\u00f3n calidad por gigabyte para la mayor\u00eda de los usuarios<\/td>\n<\/tr>\n<tr>\n<td>Q3_K_M<\/td>\n<td>~4,0 GB<\/td>\n<td>Degradaci\u00f3n notable<\/td>\n<td>Solo cuando Q4 realmente no cabe<\/td>\n<\/tr>\n<tr>\n<td>Q2_K \/ IQ2<\/td>\n<td>~3,2 GB<\/td>\n<td>Degradaci\u00f3n significativa<\/td>\n<td>\u00daltimo recurso; a menudo es preferible un modelo m\u00e1s peque\u00f1o en Q4<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Dos reglas \u00fatiles: la cuantizaci\u00f3n afecta m\u00e1s a los modelos peque\u00f1os que a los grandes (un modelo de 70B en Q3 se mantiene mucho mejor que uno de 8B en Q3), y por debajo de Q4 la curva de calidad cae bruscamente. En caso de duda, <code>Q4_K_M<\/code> es el valor predeterminado de la comunidad por una raz\u00f3n.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Picking_a_quantisation_for_your_VRAM\"><\/span>Elegir una cuantizaci\u00f3n seg\u00fan tu VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La memoria total necesaria es aproximadamente <em>tama\u00f1o del archivo + cach\u00e9 de contexto + sobrecarga<\/em>. Reserve 1\u20132 GB adicionales al tama\u00f1o del archivo para unos pocos miles de tokens de contexto, y m\u00e1s si utiliza contextos largos. El modelo se ejecuta a m\u00e1xima velocidad cuando toda esa memoria cabe en la VRAM de la GPU; las herramientas basadas en llama.cpp pueden descargar el resto a la RAM del sistema, lo cual sigue funcionando, pero se vuelve considerablemente m\u00e1s lento cuanto m\u00e1s capas se descarguen.<\/p>\n<table>\n<thead>\n<tr>\n<th>VRAM<\/th>\n<th>Lo que cabe c\u00f3modamente<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>8 GB<\/td>\n<td>Modelos de 7\u20138B en Q4_K_M o Q5_K_M<\/td>\n<\/tr>\n<tr>\n<td>12 GB<\/td>\n<td>8B en Q8_0, o 12\u201314B en Q4_K_M<\/td>\n<\/tr>\n<tr>\n<td>16 GB<\/td>\n<td>14B en Q5_K_M\/Q6_K<\/td>\n<\/tr>\n<tr>\n<td>24 GB<\/td>\n<td>~32B en Q4_K_M, o 14B en Q8_0 con contexto largo<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Para cifras exactas sobre un modelo y una longitud de contexto espec\u00edficos, la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> realiza autom\u00e1ticamente los c\u00e1lculos, y hay un desglose por modelo en <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para cada LLM importante<\/a>. Si est\u00e1 eligiendo hardware en lugar de una cuantizaci\u00f3n, comience con <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">las mejores GPUs para LLM locales<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GGUF_vs_safetensors\"><\/span>GGUF frente a safetensors<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Estos dos formatos coexisten porque sirven a entornos de ejecuci\u00f3n distintos, no porque uno est\u00e9 reemplazando al otro.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>GGUF<\/th>\n<th>safetensors<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Dise\u00f1ado para<\/td>\n<td>llama.cpp y su ecosistema<\/td>\n<td>El ecosistema Hugging Face \/ PyTorch<\/td>\n<\/tr>\n<tr>\n<td>Contenido<\/td>\n<td>Pesos + tokenizador + configuraci\u00f3n en un solo archivo<\/td>\n<td>Solo tensores; la configuraci\u00f3n y el tokenizador son archivos JSON independientes<\/td>\n<\/tr>\n<tr>\n<td>Cuantizaci\u00f3n<\/td>\n<td>Incorporada al formato (Q4_K_M, etc.)<\/td>\n<td>Normalmente FP16\/BF16; cuantizados mediante m\u00e9todos independientes (GPTQ, AWQ)<\/td>\n<\/tr>\n<tr>\n<td>Entornos de ejecuci\u00f3n t\u00edpicos<\/td>\n<td>Ollama, LM Studio, llama.cpp, KoboldCpp, Jan<\/td>\n<td>transformers, vLLM, TGI, SGLang<\/td>\n<\/tr>\n<tr>\n<td>Punto \u00f3ptimo<\/td>\n<td>Hardware de consumo, h\u00edbrido CPU+GPU, uso individual<\/td>\n<td>GPUs para centros de datos, servicio de alto rendimiento, entrenamiento<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La decisi\u00f3n depende realmente del software que utilice: las herramientas de escritorio y Ollama requieren GGUF; las pilas de servicio en GPU y cualquier proceso que implique ajuste fino requieren safetensors. Los editores de modelos suelen publicar primero safetensors, y la comunidad los convierte a GGUF en cuesti\u00f3n de d\u00edas.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Where_GGUF_files_come_from\"><\/span>De d\u00f3nde provienen los archivos GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Casi todos los archivos GGUF se alojan en Hugging Face. Algunos laboratorios publican oficialmente GGUF, pero la mayor\u00eda provienen de cuantizadores comunitarios \u2014cuentas como <code>bartowski<\/code>, <code>unsloth<\/code>, <code>lmstudio-community<\/code> y <code>ggml-org<\/code> \u2014 que convierten cada nueva versi\u00f3n en todo el rango de cuantizaciones disponibles. Un repositorio llamado, por ejemplo, <code>Meta-Llama-3.1-8B-Instruct-GGUF<\/code> contendr\u00e1 un archivo por nivel de cuantizaci\u00f3n.<\/p>\n<p>Tambi\u00e9n puede convertir usted mismo un modelo mediante las herramientas de llama.cpp: <code>convert_hf_to_gguf.py<\/code> convierte un modelo de Hugging Face en un GGUF en F16, y el binario <code>llama-quantize<\/code> (compilado al construir llama.cpp) lo comprime a la cuantizaci\u00f3n elegida, p. ej. <code>modelo llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M<\/code>.<\/p>\n<h3>Cargar un GGUF en Ollama<\/h3>\n<p>Ollama puede descargar repositorios GGUF directamente desde Hugging Face; la cuantizaci\u00f3n se especifica despu\u00e9s de los dos puntos:<\/p>\n<pre><code>ollama run hf.co\/bartowski\/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M<\/code><\/pre>\n<p>Para un archivo que ya tenga en disco, cree un archivo de texto sin formato denominado <code>Modelfile<\/code> que contenga:<\/p>\n<pre><code>FROM .\/my-model.gguf<\/code><\/pre>\n<p>y luego reg\u00edstrelo y ejecute:<\/p>\n<pre><code>ollama create my-model -f Modelfile\nollama run my-model<\/code><\/pre>\n<p>Las versiones actuales de Ollama leen autom\u00e1ticamente la plantilla de chat integrada en los metadatos del GGUF; si un modelo importado genera una salida distorsionada, normalmente la soluci\u00f3n consiste en agregar expl\u00edcitamente una l\u00ednea <code>TEMPLATE<\/code> al Modelfile. La <a href=\"https:\/\/convly.ai\/es\/what-is-ollama-complete-guide-2026\/\">gu\u00eda completa de Ollama<\/a> explica detalladamente los Modelfiles.<\/p>\n<h3>Cargar un GGUF en LM Studio<\/h3>\n<p>El m\u00e9todo habitual es usar el descargador integrado: abra la pesta\u00f1a \u00abDescubrir\u00bb, busque un modelo y LM Studio mostrar\u00e1 las cuantizaciones GGUF disponibles, indicando cu\u00e1les son compatibles con su hardware. Para importar un archivo que ya tenga, use la CLI (<code>lms import path\/to\/model.gguf<\/code>) o col\u00f3quelo en el directorio de modelos de LM Studio \u2014la ruta predeterminada exacta var\u00eda seg\u00fan la versi\u00f3n y el sistema operativo, pero la pesta\u00f1a \u00abMis modelos\u00bb muestra dicha ruta y permite modificarla. Los archivos deben organizarse en una estructura de subcarpetas del tipo <code>editor\/nombre-del-modelo\/<\/code> para que sean reconocidos. Consulte la <a href=\"https:\/\/convly.ai\/es\/lm-studio-complete-guide-2026\/\">gu\u00eda completa de LM Studio<\/a> para ver el procedimiento paso a paso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfGGUF funciona \u00fanicamente en CPU o tambi\u00e9n utiliza la GPU?<\/h3>\n<p>Ambas opciones. llama.cpp naci\u00f3 como un proyecto de inferencia en CPU, pero traslada capas del modelo a la GPU (CUDA, Metal, Vulkan, ROCm) y puede ejecutarse completamente en GPU cuando el modelo cabe \u00edntegramente en la VRAM. Ollama y LM Studio gestionan autom\u00e1ticamente la divisi\u00f3n entre CPU y GPU; al usar llama.cpp directamente, usted controla esta distribuci\u00f3n mediante la bandera <code>-ngl<\/code> (n\u00famero de capas en GPU).<\/p>\n<h3>\u00bfCu\u00e1l es la diferencia entre Q4_K_M y Q4_K_S?<\/h3>\n<p>Ambas son cuantizaciones k-quants de aproximadamente 4 bits; la letra indica la variante de tama\u00f1o. <code>_M<\/code> \u00abM\u00bb (mediana) conserva m\u00e1s tensores sensibles a la calidad con mayor precisi\u00f3n que <code>_S<\/code> \u00abS\u00bb (peque\u00f1a), por lo que es ligeramente mayor y ofrece un rendimiento ligeramente mejor. La diferencia es peque\u00f1a: elija <code>_M<\/code> Q4_K_M<\/p>\n<h3>a menos que los \u00faltimos cientos de megabytes determinen si el modelo cabe en su hardware.<\/h3>\n<p>\u00bfQu\u00e9 p\u00e9rdida real de calidad implica la cuantizaci\u00f3n?<\/p>\n<h3>En Q8_0 y Q6_K pr\u00e1cticamente no hay p\u00e9rdida: pruebas ciegas tienen dificultades para distinguirlos de F16. Q4_K_M presenta una ligera p\u00e9rdida medible que la mayor\u00eda de los usuarios no percibe durante conversaciones, aunque puede ser relevante en tareas precisas como generaci\u00f3n de c\u00f3digo o c\u00e1lculos matem\u00e1ticos. Por debajo de Q4 la degradaci\u00f3n se vuelve evidente, y los modelos peque\u00f1os se ven afectados m\u00e1s que los grandes.<\/h3>\n<p>\u00bfPuedo usar GGUF con transformers o vLLM?<\/p>\n<h3>Existe cierto soporte, pero es limitado y no constituye el flujo nativo: transformers puede descuantizar algunos archivos GGUF al cargarlos, y vLLM dispone de soporte experimental para GGUF que var\u00eda seg\u00fan la arquitectura. Si est\u00e1 desarrollando sobre estas pilas, use safetensors; GGUF debe considerarse principalmente el formato destinado a los entornos de ejecuci\u00f3n de la familia llama.cpp.<\/h3>\n<p>\u00bfPor qu\u00e9 est\u00e1 mi modelo dividido en varios archivos .gguf? <code>Los modelos muy grandes se dividen en fragmentos (shards) cuyos nombres siguen el patr\u00f3n<\/code>model-00001-of-00002.gguf<\/p>\n<p>principalmente para respetar los l\u00edmites de tama\u00f1o de archivo en plataformas de alojamiento. Guarde todos los fragmentos en la misma carpeta y apunte su entorno de ejecuci\u00f3n al primero: llama.cpp y las herramientas basadas en \u00e9l cargar\u00e1n autom\u00e1ticamente los restantes. <a href=\"https:\/\/convly.ai\/es\/models\/\">base de datos de modelos<\/a> Una vez que sepa qu\u00e9 cuantizaci\u00f3n se adapta a su hardware, la siguiente pregunta pr\u00e1ctica es qu\u00e9 modelo elegir para ella: la <a href=\"https:\/\/convly.ai\/es\/best-local-llms-to-run-on-ollama-2026\/\">lista de los mejores modelos locales para Ollama<\/a> es una buena selecci\u00f3n inicial; adem\u00e1s, la<\/p>","protected":false},"excerpt":{"rendered":"<p>GGUF is the file format for running LLMs locally. It packs a model&#8217;s weights, tokenizer and configuration into a single [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2104,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2103","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2103","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2103"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2103\/revisions"}],"predecessor-version":[{"id":2105,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2103\/revisions\/2105"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2104"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2103"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2103"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2103"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}