{"id":2182,"date":"2026-08-12T20:06:35","date_gmt":"2026-08-12T20:06:35","guid":{"rendered":"https:\/\/convly.ai\/?p=2182"},"modified":"2026-08-12T20:06:35","modified_gmt":"2026-08-12T20:06:35","slug":"text-generation-webui-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/text-generation-webui-guide\/","title":{"rendered":"Text Generation WebUI (Oobabooga): Gu\u00eda de instalaci\u00f3n, cargadores y uso"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>text-generation-webui (ampliamente conocida como <em>oobabooga<\/em> por el nombre de usuario de su autor en GitHub) es una interfaz gratuita, de c\u00f3digo abierto y basada en navegador para ejecutar modelos de lenguaje de gran tama\u00f1o (LLM) localmente en tu propio hardware.<\/li>\n<li>Inst\u00e1lala mediante scripts de un solo clic: <code>start_windows.bat<\/code>, <code>start_linux.sh<\/code>, o <code>start_macos.sh<\/code> \u2014 no se requiere configuraci\u00f3n manual del entorno Python.<\/li>\n<li>Admite m\u00faltiples motores de inferencia: llama.cpp para archivos GGUF, ExLlamaV2 para modelos EXL2\/GPTQ en NVIDIA y Transformers para modelos de Hugging Face.<\/li>\n<li>Incluye una extensi\u00f3n compatible con la API de OpenAI (<code>--extensions openai<\/code>) para que otras aplicaciones se conecten a tu modelo local sin necesidad de modificar su c\u00f3digo.<\/li>\n<\/ul>\n<\/div>\n<p>text-generation-webui es una interfaz web de c\u00f3digo abierto y autohospedada para ejecutar modelos de lenguaje de gran tama\u00f1o localmente. Se mantiene en GitHub bajo el nombre de <strong>oobabooga\/text-generation-webui<\/strong>, y se ejecuta en tu navegador en la direcci\u00f3n <code>http:\/\/localhost:7860<\/code>, supports a wide range of model formats through swappable inference backends, and exposes an OpenAI-compatible REST API. It is the most feature-complete local LLM frontend available, at the cost of a steeper setup curve than desktop apps like LM Studio.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7d153e0dae3\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7d153e0dae3\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\" >Instalaci\u00f3n de text-generation-webui<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#Installing_text-generation-webui\" >Cargadores de modelos: \u00bfcu\u00e1l elegir?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#Model_Loaders_Which_One_to_Use\" >Carga paso a paso de un modelo GGUF<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#Loading_a_GGUF_Model_Step_by_Step\" >La extensi\u00f3n de API compatible con OpenAI<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#The_OpenAI-Compatible_API_Extension\" >text-generation-webui frente a LM Studio frente a Jan<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#text-generation-webui_vs_LM_Studio_vs_Jan\" >El nombre de usuario del proyecto en GitHub es<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/text-generation-webui-guide\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_text-generation-webui_Is_and_Why_People_Call_It_Oobabooga\"><\/span>Instalaci\u00f3n de text-generation-webui<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>, que se ha convertido en el t\u00e9rmino abreviado usado por la comunidad para referirse a la herramienta misma. Ambos nombres hacen referencia al mismo proyecto alojado en <em>oobabooga<\/em>github.com\/oobabooga\/text-generation-webui <a href=\"https:\/\/github.com\/oobabooga\/text-generation-webui\" rel=\"noopener noreferrer\" target=\"_blank\">La interfaz est\u00e1 construida sobre Gradio y se ejecuta \u00edntegramente en tu m\u00e1quina local: ning\u00fan dato abandona tu sistema. Adem\u00e1s del chat b\u00e1sico, admite:<\/a>.<\/p>\n<p>Tres modos de entrada: Chat (modo instructivo), Chat (rol interpretativo con tarjetas de personajes) y Cuaderno (completado en bruto)<\/p>\n<ul>\n<li>Carga de adaptadores LoRA para pesos ajustados finamente sobre un modelo base<\/li>\n<li>Un sistema de extensiones con complementos comunitarios para res\u00famenes, s\u00edntesis de voz, generaci\u00f3n de descripciones de im\u00e1genes, etc.<\/li>\n<li>Un punto final de API compatible con OpenAI para conectar clientes de terceros y scripts de automatizaci\u00f3n<\/li>\n<li>Antes de elegir un modelo, utiliza la<\/li>\n<\/ul>\n<p>para confirmar que tu GPU puede alojarlo \u2014 los requisitos var\u00edan considerablemente seg\u00fan el tama\u00f1o del modelo y el nivel de cuantizaci\u00f3n. <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> La ruta recomendada en todas las plataformas es el instalador de un solo clic. Este crea un entorno Conda aislado e instala autom\u00e1ticamente todas las dependencias de Python. No instales el software en tu entorno Python del sistema a menos que tengas una raz\u00f3n espec\u00edfica para hacerlo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installing_text-generation-webui\"><\/span>Cargadores de modelos: \u00bfcu\u00e1l elegir?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Clona el repositorio o descarga un archivo ZIP con una versi\u00f3n estable desde la p\u00e1gina de GitHub:<\/p>\n<h3>Windows<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui<br \/><code>en la carpeta clonada.<\/code><\/li>\n<li>Haga doble clic en <code>start_windows.bat<\/code> El script detecta el tipo de GPU (NVIDIA, AMD o solo CPU) e instala las dependencias correspondientes; selecciona la opci\u00f3n adecuada cuando se te solicite.<\/li>\n<li>Una vez completada la configuraci\u00f3n, el servidor se inicia autom\u00e1ticamente. Abre<\/li>\n<li>en tu navegador. <code>http:\/\/localhost:7860<\/code> En ejecuciones posteriores, haz doble clic nuevamente sobre<\/li>\n<\/ol>\n<p>. El entorno Conda ya est\u00e1 creado; el inicio tarda solo unos segundos. <code>start_windows.bat<\/code> Clona el repositorio y accede al directorio:<\/p>\n<h3>Linux<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n<pre><code>Haz que el script sea ejecutable y luego ejec\u00fatalo:<\/code><\/pre>\n<\/li>\n<li>chmod +x start_linux.sh\n.\/start_linux.sh\n<pre><code>Selecciona tu tipo de GPU cuando se te solicite: NVIDIA, AMD, solo CPU o Apple Silicon (esta \u00faltima opci\u00f3n no aplica en Linux, aunque aparecer\u00e1 en el mensaje).<\/code><\/pre>\n<\/li>\n<li>Accede a la interfaz en<\/li>\n<li>una vez que el servidor est\u00e9 en ejecuci\u00f3n. <code>http:\/\/localhost:7860<\/code> Clona el repositorio y ejecuta el script de inicio:<\/li>\n<\/ol>\n<h3>macOS<\/h3>\n<ol>\n<li>git clone https:\/\/github.com\/oobabooga\/text-generation-webui\ncd text-generation-webui\n.\/start_macos.sh\n<pre><code>Selecciona la opci\u00f3n D (Apple Silicon \/ Metal) o C (solo CPU) cuando se te solicite.<\/code><\/pre>\n<\/li>\n<li>El motor de inferencia llama.cpp utiliza Metal para aceleraci\u00f3n GPU en chips de la serie M \u2014 no se requiere CUDA.<\/li>\n<li>Los usuarios de macOS est\u00e1n limitados a los cargadores llama.cpp y Transformers. ExLlamaV2 requiere CUDA y no funciona en Apple Silicon.<\/li>\n<\/ol>\n<p>text-generation-webui separa el motor de inferencia de la interfaz de usuario. Debes seleccionar un cargador por modelo desde la pesta\u00f1a<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Loaders_Which_One_to_Use\"><\/span>Carga paso a paso de un modelo GGUF<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Cargador <strong>Modelo<\/strong> Formato<\/p>\n<table>\n<thead>\n<tr>\n<th>Cargador<\/th>\n<th>Formato<\/th>\n<th>Hardware<\/th>\n<th>Cu\u00e1ndo usar<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>llama.cpp<\/td>\n<td>GGUF<\/td>\n<td>NVIDIA, AMD, Apple Silicon, CPU<\/td>\n<td>Predeterminado para archivos GGUF; el m\u00e1s portable entre plataformas<\/td>\n<\/tr>\n<tr>\n<td>ExLlamaV2<\/td>\n<td>EXL2, GPTQ<\/td>\n<td>Solo para CUDA de NVIDIA<\/td>\n<td>Mayor rendimiento en NVIDIA; preferido frente a AutoGPTQ para modelos nuevos<\/td>\n<\/tr>\n<tr>\n<td>Transformadores<\/td>\n<td>Hugging Face (fp16, bf16, int8, int4)<\/td>\n<td>NVIDIA, CPU<\/td>\n<td>Modelos originales de Hugging Face; m\u00e1s lentos, pero con la mayor compatibilidad<\/td>\n<\/tr>\n<tr>\n<td>AutoAWQ<\/td>\n<td>AWQ<\/td>\n<td>CUDA de NVIDIA<\/td>\n<td>Modelos cuantizados con AWQ<\/td>\n<\/tr>\n<tr>\n<td>AutoGPTQ<\/td>\n<td>GPTQ<\/td>\n<td>CUDA de NVIDIA<\/td>\n<td>Modelos GPTQ antiguos; ExLlamaV2 es m\u00e1s r\u00e1pido para el mismo formato<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Predeterminado pr\u00e1ctico:<\/strong> Si descarg\u00f3 un archivo <code>.gguf<\/code> (el formato m\u00e1s com\u00fan en las p\u00e1ginas de modelos de Hugging Face), use <strong>llama.cpp<\/strong>. Si dispone de una GPU NVIDIA y desea la m\u00e1xima velocidad de generaci\u00f3n, busque una variante EXL2 del mismo modelo y utilice <strong>ExLlamaV2<\/strong>.<\/p>\n<p>Para conocer qu\u00e9 modelos caben realistamente en qu\u00e9 GPUs, consulte <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM para los principales LLM<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Loading_a_GGUF_Model_Step_by_Step\"><\/span>La extensi\u00f3n de API compatible con OpenAI<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li><strong>Copie el archivo<\/strong> en la carpeta <code>text-generation-webui\/models\/<\/code>. Los archivos GGUF monol\u00edticos (por ejemplo, <code>mistral-7b-instruct.Q4_K_M.gguf<\/code>) se colocan directamente en esa carpeta. Los archivos divididos en varias partes deben ubicarse en una subcarpeta con nombre.<\/li>\n<li><strong>Abra la pesta\u00f1a Modelo<\/strong> la direcci\u00f3n <code>http:\/\/localhost:7860<\/code>.<\/li>\n<li>Seleccione su archivo desde el men\u00fa desplegable de modelos (haga clic en el icono de actualizaci\u00f3n si no aparece).<\/li>\n<li>Establece <strong>Cargador<\/strong> a <code>llama.cpp<\/code>.<\/li>\n<li>Establece <strong>n-gpu-layers<\/strong> para controlar la descarga a la GPU. Introduzca un n\u00famero grande (por ejemplo, <code>999<\/code>) para trasladar tantas capas como sea posible a la VRAM; introduzca <code>0<\/code> para inferencia exclusivamente en CPU.<\/li>\n<li>Haga clic <strong>Cargue<\/strong>. Un mensaje de confirmaci\u00f3n aparecer\u00e1 en el cuadro de estado una vez que el modelo est\u00e9 listo.<\/li>\n<\/ol>\n<p>Cambie a la pesta\u00f1a <strong>Chat<\/strong> para iniciar una conversaci\u00f3n o a la pesta\u00f1a <strong>Predeterminado<\/strong> para completar directamente el indicador (prompt). La plantilla de instrucci\u00f3n se configura autom\u00e1ticamente para familias de modelos conocidas; para modelos desconocidos, selecci\u00f3nela manualmente desde el men\u00fa desplegable <strong>Plantilla de instrucci\u00f3n<\/strong> en la pesta\u00f1a Par\u00e1metros.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_OpenAI-Compatible_API_Extension\"><\/span>text-generation-webui frente a LM Studio frente a Jan<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La extensi\u00f3n integrada <code>openai<\/code> expone puntos finales REST que replican el formato de las API de OpenAI Chat Completions y Completions. Cualquier cliente que acepte una URL base personalizada \u2014LangChain, Open WebUI, Continue.dev o un simple script <code>curl<\/code> \u2014 puede conectarse a su modelo local sin necesidad de modificar el c\u00f3digo.<\/p>\n<p>Habil\u00edtela pasando una bandera al iniciar:<\/p>\n<pre><code># Linux \/ macOS\n.\/start_linux.sh --extensions openai\n\n# o inicie server.py directamente dentro del entorno Conda\npython server.py --extensions openai<\/code><\/pre>\n<p>Alternativamente, habil\u00edtela desde la pesta\u00f1a <strong>Sesi\u00f3n<\/strong> de la interfaz de usuario y luego haga clic en <strong>Aplicar banderas \/ Reiniciar<\/strong>.<\/p>\n<p>De forma predeterminada, la API escucha en el puerto 5000, independientemente de la interfaz Gradio, que usa el puerto 7860. Configure su cliente para apuntar a:<\/p>\n<pre><code>base_url = \"http:\/\/localhost:5000\/v1\"\napi_key  = \"cualquier_valor\"  # requerido por la mayor\u00eda de los clientes, pero no se valida localmente<\/code><\/pre>\n<p>Los puntos finales admitidos incluyen <code>\/v1\/chat\/completions<\/code>, <code>\/v1\/completions<\/code>, y <code>\/v1\/models<\/code>. El puerto se puede configurar mediante la bandera de inicio <code>--api-port<\/code> .<\/p>\n<h2><span class=\"ez-toc-section\" id=\"text-generation-webui_vs_LM_Studio_vs_Jan\"><\/span>El nombre de usuario del proyecto en GitHub es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Las tres herramientas ejecutan modelos localmente, sin depender de la nube. Est\u00e1n orientadas a distintos usuarios y casos de uso.<\/p>\n<table>\n<thead>\n<tr>\n<th><\/th>\n<th>text-generation-webui<\/th>\n<th>LM Studio<\/th>\n<th>Jan<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Interfaz<\/td>\n<td>Navegador (Gradio)<\/td>\n<td>Escritorio nativo<\/td>\n<td>Escritorio nativo<\/td>\n<\/tr>\n<tr>\n<td>Complejidad de configuraci\u00f3n<\/td>\n<td>Medio (script de un solo clic)<\/td>\n<td>Bajo (instalador gr\u00e1fico)<\/td>\n<td>Bajo (instalador gr\u00e1fico)<\/td>\n<\/tr>\n<tr>\n<td>Formatos de modelo<\/td>\n<td>GGUF, EXL2, GPTQ, AWQ, HF fp16<\/td>\n<td>Principalmente GGUF<\/td>\n<td>Principalmente GGUF<\/td>\n<\/tr>\n<tr>\n<td>Explorador integrado de modelos<\/td>\n<td>No<\/td>\n<td>S\u00ed<\/td>\n<td>S\u00ed<\/td>\n<\/tr>\n<tr>\n<td>API compatible con OpenAI<\/td>\n<td>S\u00ed (extensi\u00f3n)<\/td>\n<td>S\u00ed (integrado)<\/td>\n<td>S\u00ed (integrado)<\/td>\n<\/tr>\n<tr>\n<td>Sistema de extensiones o complementos<\/td>\n<td>S\u00ed<\/td>\n<td>Limitado<\/td>\n<td>Limitado<\/td>\n<\/tr>\n<tr>\n<td>Apple Silicon (Metal)<\/td>\n<td>S\u00ed (llama.cpp)<\/td>\n<td>S\u00ed<\/td>\n<td>S\u00ed<\/td>\n<\/tr>\n<tr>\n<td>Ideal para<\/td>\n<td>Usuarios avanzados, automatizaci\u00f3n e investigaci\u00f3n<\/td>\n<td>Principiantes y uso diario de chat<\/td>\n<td>Usuarios centrados en software de c\u00f3digo abierto<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Elija text-generation-webui<\/strong> cuando necesite varios backends de carga, rendimiento EXL2 en GPUs NVIDIA, carga de adaptadores LoRA, el ecosistema de extensiones o acceso mediante API mediante scripts para automatizaci\u00f3n y flujos de trabajo de desarrollo.<\/p>\n<p><strong>Elija LM Studio o Jan<\/strong> cuando desee un instalador pulido, b\u00fasqueda integrada de modelos con descargas de un solo clic y configuraci\u00f3n m\u00ednima. Consulte la <a href=\"https:\/\/convly.ai\/es\/lm-studio-complete-guide-2026\/\">Gu\u00eda completa de LM Studio<\/a> para una gu\u00eda detallada sobre esta opci\u00f3n.<\/p>\n<p>Si est\u00e1 evaluando si la inferencia local justifica el costo del hardware, la <a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">calculadora de punto de equilibrio entre alojamiento local y uso de API<\/a> puede cuantificar el equilibrio entre ese gasto y el pago por acceso a una API seg\u00fan su volumen de uso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfPor qu\u00e9 tarda tanto la instalaci\u00f3n de un solo clic la primera vez?<\/h3>\n<p>Descarga Miniconda y construye desde cero un entorno aislado de Python con PyTorch y todas las bibliotecas de carga de modelos. En una conexi\u00f3n r\u00e1pida, esto suele tardar entre 5 y 15 minutos. En los inicios posteriores se omite este paso y la aplicaci\u00f3n se inicia en pocos segundos.<\/p>\n<h3>\u00bfPuedo ejecutar text-generation-webui sin GPU?<\/h3>\n<p>S\u00ed. Seleccione la opci\u00f3n \u00absolo CPU\u00bb durante la instalaci\u00f3n y luego configure <code>n-gpu-layers<\/code> a <code>0<\/code> al cargar un modelo GGUF. Un modelo de 7B puede generar entre 2 y 5 tokens por segundo en una CPU de escritorio moderna: suficiente para pruebas, pero lento para conversaciones. Las cuantizaciones m\u00e1s peque\u00f1as (Q4 y menores) mejoran el rendimiento. Consulte <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">mejoras GPUs para modelos de lenguaje local<\/a> si est\u00e1 considerando una actualizaci\u00f3n de hardware.<\/p>\n<h3>\u00bfC\u00f3mo actualizo text-generation-webui?<\/h3>\n<p>Ejecutar <code>git pull<\/code> dentro del directorio del repositorio para obtener el c\u00f3digo m\u00e1s reciente y, a continuaci\u00f3n, vuelva a ejecutar el script de inicio. Este detecta cambios en el entorno y actualiza autom\u00e1ticamente las dependencias. Tambi\u00e9n puede ejecutar <code>pip install -r requirements.txt<\/code> manualmente dentro del entorno Conda activo si prefiere una actualizaci\u00f3n espec\u00edfica.<\/p>\n<h3>\u00bfCu\u00e1l es la diferencia entre GGUF y EXL2?<\/h3>\n<p>Ambos son formatos cuantizados que reducen el tama\u00f1o del archivo del modelo y los requisitos de VRAM. GGUF (mediante llama.cpp) funciona en GPUs NVIDIA, AMD y Apple Silicon; es la opci\u00f3n m\u00e1s portable y dispone de la mayor variedad de modelos disponibles. EXL2 (mediante ExLlamaV2) solo es compatible con GPUs NVIDIA, pero normalmente genera tokens m\u00e1s r\u00e1pido a calidad equivalente. Si dispone de una GPU NVIDIA y la velocidad es su prioridad, vale la pena usar EXL2.<\/p>\n<h3>\u00bfD\u00f3nde se guardan los registros de las conversaciones?<\/h3>\n<p>Los registros se almacenan en <code>text-generation-webui\/logs\/<\/code>. Cada conversaci\u00f3n se guarda como un archivo JSON. Tambi\u00e9n puede exportarla directamente desde la interfaz de la pesta\u00f1a \u00abChat\u00bb, usando el bot\u00f3n de descarga situado debajo de la ventana de conversaci\u00f3n.<\/p>\n<h3>\u00bfPueden conectarse varios usuarios a una misma instancia?<\/h3>\n<p>El <code>--listen<\/code> hace que el servidor est\u00e9 accesible en su red local, en lugar de limitarse a localhost. Sin embargo, text-generation-webui no est\u00e1 dise\u00f1ado para despliegues productivos multiusuario: carece de autenticaci\u00f3n integrada y su interfaz Gradio opera en modo de sesi\u00f3n \u00fanica. La extensi\u00f3n de API OpenAI gestiona mejor las solicitudes API simult\u00e1neas que la interfaz web en escenarios con m\u00faltiples clientes, pero si desea exponerla m\u00e1s all\u00e1 de localhost, debe colocar delante un proxy inverso con autenticaci\u00f3n.<\/p>","protected":false},"excerpt":{"rendered":"<p>text-generation-webui (widely called oobabooga after its GitHub author) is a free, open-source, browser-based interface for running LLMs locally on your [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2183,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2182","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2182","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2182"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2182\/revisions"}],"predecessor-version":[{"id":2184,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2182\/revisions\/2184"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2183"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2182"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2182"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2182"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}