Wednesday, 12 August 2026 | Updating Daily AI insight, written for builders

Text Generation WebUI (Oobabooga): Guía de instalación, cargadores y uso

  • text-generation-webui (ampliamente conocida como oobabooga por el nombre de usuario de su autor en GitHub) es una interfaz gratuita, de código abierto y basada en navegador para ejecutar modelos de lenguaje de gran tamaño (LLM) localmente en tu propio hardware.
  • Instálala mediante scripts de un solo clic: start_windows.bat, start_linux.sh, o start_macos.sh — no se requiere configuración manual del entorno Python.
  • Admite múltiples motores de inferencia: llama.cpp para archivos GGUF, ExLlamaV2 para modelos EXL2/GPTQ en NVIDIA y Transformers para modelos de Hugging Face.
  • Incluye una extensión compatible con la API de OpenAI (--extensions openai) para que otras aplicaciones se conecten a tu modelo local sin necesidad de modificar su código.

text-generation-webui es una interfaz web de código abierto y autohospedada para ejecutar modelos de lenguaje de gran tamaño localmente. Se mantiene en GitHub bajo el nombre de oobabooga/text-generation-webui, y se ejecuta en tu navegador en la dirección http://localhost:7860, admite una amplia gama de formatos de modelo mediante motores de inferencia intercambiables y expone una API REST compatible con OpenAI. Es la interfaz gráfica más completa disponible, aunque su configuración inicial es más compleja que la de aplicaciones de escritorio como LLM local ¿Qué es text-generation-webui (y por qué la gente la llama Oobabooga)? LM Studio.

Instalación de text-generation-webui

, que se ha convertido en el término abreviado usado por la comunidad para referirse a la herramienta misma. Ambos nombres hacen referencia al mismo proyecto alojado en oobaboogagithub.com/oobabooga/text-generation-webui La interfaz está construida sobre Gradio y se ejecuta íntegramente en tu máquina local: ningún dato abandona tu sistema. Además del chat básico, admite:.

Tres modos de entrada: Chat (modo instructivo), Chat (rol interpretativo con tarjetas de personajes) y Cuaderno (completado en bruto)

  • Carga de adaptadores LoRA para pesos ajustados finamente sobre un modelo base
  • Un sistema de extensiones con complementos comunitarios para resúmenes, síntesis de voz, generación de descripciones de imágenes, etc.
  • Un punto final de API compatible con OpenAI para conectar clientes de terceros y scripts de automatización
  • Antes de elegir un modelo, utiliza la

para confirmar que tu GPU puede alojarlo — los requisitos varían considerablemente según el tamaño del modelo y el nivel de cuantización. Calculadora de VRAM La ruta recomendada en todas las plataformas es el instalador de un solo clic. Este crea un entorno Conda aislado e instala automáticamente todas las dependencias de Python. No instales el software en tu entorno Python del sistema a menos que tengas una razón específica para hacerlo.

Cargadores de modelos: ¿cuál elegir?

Clona el repositorio o descarga un archivo ZIP con una versión estable desde la página de GitHub:

Windows

  1. git clone https://github.com/oobabooga/text-generation-webui
    en la carpeta clonada.
  2. Haga doble clic en start_windows.bat El script detecta el tipo de GPU (NVIDIA, AMD o solo CPU) e instala las dependencias correspondientes; selecciona la opción adecuada cuando se te solicite.
  3. Una vez completada la configuración, el servidor se inicia automáticamente. Abre
  4. en tu navegador. http://localhost:7860 En ejecuciones posteriores, haz doble clic nuevamente sobre

. El entorno Conda ya está creado; el inicio tarda solo unos segundos. start_windows.bat Clona el repositorio y accede al directorio:

Linux

  1. git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui
    Haz que el script sea ejecutable y luego ejecútalo:
  2. chmod +x start_linux.sh ./start_linux.sh
    Selecciona tu tipo de GPU cuando se te solicite: NVIDIA, AMD, solo CPU o Apple Silicon (esta última opción no aplica en Linux, aunque aparecerá en el mensaje).
  3. Accede a la interfaz en
  4. una vez que el servidor esté en ejecución. http://localhost:7860 Clona el repositorio y ejecuta el script de inicio:

macOS

  1. git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui ./start_macos.sh
    Selecciona la opción D (Apple Silicon / Metal) o C (solo CPU) cuando se te solicite.
  2. El motor de inferencia llama.cpp utiliza Metal para aceleración GPU en chips de la serie M — no se requiere CUDA.
  3. Los usuarios de macOS están limitados a los cargadores llama.cpp y Transformers. ExLlamaV2 requiere CUDA y no funciona en Apple Silicon.

text-generation-webui separa el motor de inferencia de la interfaz de usuario. Debes seleccionar un cargador por modelo desde la pestaña

Carga paso a paso de un modelo GGUF

Cargador Modelo Formato

CargadorFormatoHardwareCuándo usar
llama.cppGGUFNVIDIA, AMD, Apple Silicon, CPUPredeterminado para archivos GGUF; el más portable entre plataformas
ExLlamaV2EXL2, GPTQSolo para CUDA de NVIDIAMayor rendimiento en NVIDIA; preferido frente a AutoGPTQ para modelos nuevos
TransformadoresHugging Face (fp16, bf16, int8, int4)NVIDIA, CPUModelos originales de Hugging Face; más lentos, pero con la mayor compatibilidad
AutoAWQAWQCUDA de NVIDIAModelos cuantizados con AWQ
AutoGPTQGPTQCUDA de NVIDIAModelos GPTQ antiguos; ExLlamaV2 es más rápido para el mismo formato

Predeterminado práctico: Si descargó un archivo .gguf (el formato más común en las páginas de modelos de Hugging Face), use llama.cpp. Si dispone de una GPU NVIDIA y desea la máxima velocidad de generación, busque una variante EXL2 del mismo modelo y utilice ExLlamaV2.

Para conocer qué modelos caben realistamente en qué GPUs, consulte Requisitos de VRAM para los principales LLM.

La extensión de API compatible con OpenAI

  1. Copie el archivo en la carpeta text-generation-webui/models/. Los archivos GGUF monolíticos (por ejemplo, mistral-7b-instruct.Q4_K_M.gguf) se colocan directamente en esa carpeta. Los archivos divididos en varias partes deben ubicarse en una subcarpeta con nombre.
  2. Abra la pestaña Modelo la dirección http://localhost:7860.
  3. Seleccione su archivo desde el menú desplegable de modelos (haga clic en el icono de actualización si no aparece).
  4. Establece Cargador a llama.cpp.
  5. Establece n-gpu-layers para controlar la descarga a la GPU. Introduzca un número grande (por ejemplo, 999) para trasladar tantas capas como sea posible a la VRAM; introduzca 0 para inferencia exclusivamente en CPU.
  6. Haga clic Cargue. Un mensaje de confirmación aparecerá en el cuadro de estado una vez que el modelo esté listo.

Cambie a la pestaña Chat para iniciar una conversación o a la pestaña Predeterminado para completar directamente el indicador (prompt). La plantilla de instrucción se configura automáticamente para familias de modelos conocidas; para modelos desconocidos, selecciónela manualmente desde el menú desplegable Plantilla de instrucción en la pestaña Parámetros.

text-generation-webui frente a LM Studio frente a Jan

La extensión integrada openai expone puntos finales REST que replican el formato de las API de OpenAI Chat Completions y Completions. Cualquier cliente que acepte una URL base personalizada —LangChain, Open WebUI, Continue.dev o un simple script curl — puede conectarse a su modelo local sin necesidad de modificar el código.

Habilítela pasando una bandera al iniciar:

# Linux / macOS
./start_linux.sh --extensions openai

# o inicie server.py directamente dentro del entorno Conda
python server.py --extensions openai

Alternativamente, habilítela desde la pestaña Sesión de la interfaz de usuario y luego haga clic en Aplicar banderas / Reiniciar.

De forma predeterminada, la API escucha en el puerto 5000, independientemente de la interfaz Gradio, que usa el puerto 7860. Configure su cliente para apuntar a:

base_url = "http://localhost:5000/v1"
api_key  = "cualquier_valor"  # requerido por la mayoría de los clientes, pero no se valida localmente

Los puntos finales admitidos incluyen /v1/chat/completions, /v1/completions, y /v1/models. El puerto se puede configurar mediante la bandera de inicio --api-port .

El nombre de usuario del proyecto en GitHub es

Las tres herramientas ejecutan modelos localmente, sin depender de la nube. Están orientadas a distintos usuarios y casos de uso.

text-generation-webuiLM StudioJan
InterfazNavegador (Gradio)Escritorio nativoEscritorio nativo
Complejidad de configuraciónMedio (script de un solo clic)Bajo (instalador gráfico)Bajo (instalador gráfico)
Formatos de modeloGGUF, EXL2, GPTQ, AWQ, HF fp16Principalmente GGUFPrincipalmente GGUF
Explorador integrado de modelosNo
API compatible con OpenAISí (extensión)Sí (integrado)Sí (integrado)
Sistema de extensiones o complementosLimitadoLimitado
Apple Silicon (Metal)Sí (llama.cpp)
Ideal paraUsuarios avanzados, automatización e investigaciónPrincipiantes y uso diario de chatUsuarios centrados en software de código abierto

Elija text-generation-webui cuando necesite varios backends de carga, rendimiento EXL2 en GPUs NVIDIA, carga de adaptadores LoRA, el ecosistema de extensiones o acceso mediante API mediante scripts para automatización y flujos de trabajo de desarrollo.

Elija LM Studio o Jan cuando desee un instalador pulido, búsqueda integrada de modelos con descargas de un solo clic y configuración mínima. Consulte la Guía completa de LM Studio para una guía detallada sobre esta opción.

Si está evaluando si la inferencia local justifica el costo del hardware, la calculadora de punto de equilibrio entre alojamiento local y uso de API puede cuantificar el equilibrio entre ese gasto y el pago por acceso a una API según su volumen de uso.

Preguntas frecuentes

¿Por qué tarda tanto la instalación de un solo clic la primera vez?

Descarga Miniconda y construye desde cero un entorno aislado de Python con PyTorch y todas las bibliotecas de carga de modelos. En una conexión rápida, esto suele tardar entre 5 y 15 minutos. En los inicios posteriores se omite este paso y la aplicación se inicia en pocos segundos.

¿Puedo ejecutar text-generation-webui sin GPU?

Sí. Seleccione la opción «solo CPU» durante la instalación y luego configure n-gpu-layers a 0 al cargar un modelo GGUF. Un modelo de 7B puede generar entre 2 y 5 tokens por segundo en una CPU de escritorio moderna: suficiente para pruebas, pero lento para conversaciones. Las cuantizaciones más pequeñas (Q4 y menores) mejoran el rendimiento. Consulte mejoras GPUs para modelos de lenguaje local si está considerando una actualización de hardware.

¿Cómo actualizo text-generation-webui?

Ejecutar git pull dentro del directorio del repositorio para obtener el código más reciente y, a continuación, vuelva a ejecutar el script de inicio. Este detecta cambios en el entorno y actualiza automáticamente las dependencias. También puede ejecutar pip install -r requirements.txt manualmente dentro del entorno Conda activo si prefiere una actualización específica.

¿Cuál es la diferencia entre GGUF y EXL2?

Ambos son formatos cuantizados que reducen el tamaño del archivo del modelo y los requisitos de VRAM. GGUF (mediante llama.cpp) funciona en GPUs NVIDIA, AMD y Apple Silicon; es la opción más portable y dispone de la mayor variedad de modelos disponibles. EXL2 (mediante ExLlamaV2) solo es compatible con GPUs NVIDIA, pero normalmente genera tokens más rápido a calidad equivalente. Si dispone de una GPU NVIDIA y la velocidad es su prioridad, vale la pena usar EXL2.

¿Dónde se guardan los registros de las conversaciones?

Los registros se almacenan en text-generation-webui/logs/. Cada conversación se guarda como un archivo JSON. También puede exportarla directamente desde la interfaz de la pestaña «Chat», usando el botón de descarga situado debajo de la ventana de conversación.

¿Pueden conectarse varios usuarios a una misma instancia?

El --listen hace que el servidor esté accesible en su red local, en lugar de limitarse a localhost. Sin embargo, text-generation-webui no está diseñado para despliegues productivos multiusuario: carece de autenticación integrada y su interfaz Gradio opera en modo de sesión única. La extensión de API OpenAI gestiona mejor las solicitudes API simultáneas que la interfaz web en escenarios con múltiples clientes, pero si desea exponerla más allá de localhost, debe colocar delante un proxy inverso con autenticación.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That