Monday, 28 September 2026 | Updating Daily AI insight, written for builders

GPT-OSS de Ollama: Guía completa para ejecutar los modelos abiertos de OpenAI

En resumen

  • gpt-oss:20b se ejecuta con ~16 GB de memoria (cabe en la mayoría de las GPU para juegos), gpt-oss:120b requiere ~70 GB (una única GPU de 80 GB o distribución entre tarjetas de consumo)
  • Instale con ollama pull gpt-oss:20b o ollama pull gpt-oss:120b, luego ejecute con ollama run gpt-oss:20b
  • Ambas variantes utilizan la cuantización MXFP4 a 4,25 bits por parámetro y admiten ventanas de contexto de 128 K.
  • Lanzados por OpenAI como modelos de pesos abiertos en colaboración con Ollama, comparables en calidad con Llama 3.1 y Qwen 2.5.

OpenAI lanzó gpt-oss como modelos de pesos abiertos en agosto de 2025, distribuidos exclusivamente a través de Ollama. La familia gpt-oss consta de dos variantes: un modelo de 20 mil millones de parámetros que se ejecuta cómodamente en hardware de consumo y un modelo de 120 mil millones de parámetros que ofrece un rendimiento cercano al de los sistemas punteros en una única GPU de gama alta. Ambos emplean la cuantización MXFP4, empaquetando los pesos del modelo a 4,25 bits por parámetro sin comprometer significativamente la calidad frente a la inferencia en precisión completa.

¿Qué son los modelos GPT-OSS?

Los modelos gpt-oss representan el primer lanzamiento de OpenAI con pesos abiertos, tras la presión del sector por mayor transparencia y reproducibilidad. A diferencia de GPT-4 o GPT-4o, estos modelos se distribuyen con todos sus pesos, detalles arquitectónicos y licencias permisivas que permiten su uso comercial sin restricciones.

Ambos modelos admiten una ventana de contexto de 128 K tokens, gestionan conversaciones multiturno y siguen instrucciones con un nivel comparable al de otros modelos abiertos de su clase de parámetros. La variante de 20 B compite directamente con Llama 3.1 8B y Mistral 7B, mientras que el modelo de 120 B se sitúa entre Llama 3.1 70B y los sistemas punteros completos como GPT-4.

OpenAI colaboró con Ollama para gestionar la distribución y la optimización de la inferencia. Esto significa que instala y ejecuta gpt-oss de la misma manera que cualquier otro modelo de Ollama, sin necesidad de pasos adicionales de conversión ni cuantización.

Requisitos de hardware

La tabla siguiente muestra el hardware mínimo y recomendado para cada variante de gpt-oss. Las cifras de memoria incluyen los pesos del modelo más un margen razonable para el contexto y los búferes de inferencia.

Modelo Parámetros Tamaño en disco Memoria mínima Memoria recomendada Hardware de ejemplo
gpt-oss:20b 20B 14 GB 16 GB 24 GB RTX 4090, RTX 3090, A5000
gpt-oss:120b 120B 65 GB 70 GB 80 GB A100 80 GB, H100, 2× RTX 4090

El modelo de 20 mil millones de parámetros cabe cómodamente en las GPU de consumo lanzadas desde 2020. Si dispone de una RTX 3090 o RTX 4090 con 24 GB de VRAM, puede ejecutar gpt-oss:20b dejando espacio suficiente para una ventana de contexto de 16 K tokens. Con 16 GB (RTX 4080, RTX 3080 Ti), aún puede ejecutar el modelo, pero debe limitar la longitud del contexto a 8 K tokens para evitar desbordamientos de memoria.

El modelo de 120 mil millones de parámetros requiere hardware de centro de datos o una configuración multi-GPU de consumo. Una A100 de 80 GB lo gestiona cómodamente. Dos RTX 4090 en un equipo de sobremesa pueden dividir el modelo entre ambas tarjetas, aunque la velocidad de inferencia disminuye ligeramente comparada con implementaciones de una sola GPU. Utilice la Calculadora de VRAM para estimar los requisitos de memoria según distintas longitudes de contexto.

CPU y RAM del sistema

Si no dispone de suficiente VRAM, Ollama descargará capas a la RAM del sistema y las ejecutará en la CPU. Para gpt-oss:20b, necesita al menos 32 GB de RAM del sistema si ejecuta el modelo íntegramente en la CPU. Para gpt-oss:120b, la inferencia en CPU es poco práctica: espere varios segundos por token incluso en sistemas con muchos núcleos. Consulte la mejor Tarjetas gráficas para LLM locales guía si está construyendo o actualizando hardware específicamente para la inferencia de modelos.

Instalación

En primer lugar, instale Ollama si aún no lo ha hecho. El proceso varía según la plataforma:

macOS

Descargue la aplicación de Ollama para macOS desde ollama.com y arrástrela a /Applications. El instalador configura automáticamente la CLI de ollama . Alternativamente, instálelo mediante Homebrew:

brew install ollama

Linux

Ejecute el script oficial de instalación, que coloca el binario en /usr/local/bin/ollama y configura un servicio systemd:

curl -fsSL https://ollama.com/install.sh | sh

Para instalación manual o instrucciones específicas por distribución, consulte la Guía de instalación de Ollama.

Windows

Descarga el instalador para Windows desde ollama.com y ejecútelo. El instalador agrega Ollama a su PATH y inicia automáticamente el servicio en segundo plano. Tras la instalación, abra PowerShell o el símbolo del sistema para verificarlo:

ollama --version

Descarga y ejecución de los modelos

Una vez instalado Ollama, descargue el modelo que desee. Para la variante de 20 mil millones de parámetros:

ollama pull gpt-oss:20b

Para la variante de 120 mil millones de parámetros:

ollama pull gpt-oss:120b

La descarga de los pesos del modelo se realiza en ~/.ollama/models en macOS y Linux, o en %USERPROFILE%\.ollama\models en Windows. La descarga admite reanudación, por lo que puede interrumpirla y reiniciarla sin perder progreso.

Tras descargarlo, inicie una sesión interactiva:

ollama run gpt-oss:20b

O bien, para el modelo más grande:

ollama run gpt-oss:120b

Esto abre una interfaz de chat. Escribe tu indicación (prompt), presiona Entrar y el modelo transmitirá su respuesta en tiempo real. Escribe /adios para salir.

Acceso a la API

Ollama ejecuta un servidor HTTP local en http://localhost:11434. Puedes enviar solicitudes mediante curl, Python o cualquier cliente HTTP:

curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explica la cuantización MXFP4 en una sola oración."
}'

Para aplicaciones estructuradas, utiliza el SDK de Ollama para Python o JavaScript. Ambos están disponibles mediante los gestores de paquetes estándar (pip install ollama, npm install ollama) y ofrecen interfaces tipadas para generación, incrustaciones (embeddings) y gestión de modelos.

Rendimiento y comparación entre modelos

El modelo de 20 mil millones de parámetros genera entre 15 y 30 tokens por segundo en una RTX 4090, dependiendo de la longitud del contexto y la complejidad de la indicación. El modelo de 120 mil millones de parámetros produce entre 8 y 15 tokens por segundo en una A100 de 80 GB. Ambas cifras corresponden a la configuración predeterminada, sin optimizaciones adicionales como la decodificación especulativa.

En cuanto a calidad, gpt-oss:20b obtiene resultados comparables a los de Llama 3.1 8B y Mistral 7B en benchmarks de razonamiento como MMLU y GSM8K. Supera a ambos en el seguimiento de instrucciones con múltiples turnos, probablemente gracias al ajuste mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) de OpenAI. La variante de 120B se acerca a la calidad de GPT-3.5 Turbo, lo que la convierte en el modelo abierto más potente disponible bajo los 200 mil millones de parámetros hasta agosto de 2026.

En comparación con los modelos propietarios basados en API, ejecutar gpt-oss localmente resulta rentable a partir de aproximadamente 2 millones de tokens mensuales para el modelo de 20B, o 500 000 tokens mensuales para el modelo de 120B, siempre que ya poseas el hardware necesario. Usa la calculadora de autohospedaje frente a API calculadora de punto de equilibrio

Cuantización MXFP4

Ambos modelos gpt-oss incluyen integrada la cuantización MXFP4. MXFP4 es un formato de punto flotante con escalado microscópico que representa los pesos con un promedio de 4,25 bits por parámetro, frente a los 16 bits de la precisión media estándar. A diferencia de esquemas de cuantización anteriores como GPTQ o AWQ, MXFP4 conserva mayor rango dinámico, reduciendo así la pérdida de precisión típicamente asociada con compresiones agresivas.

En la práctica, los modelos cuantizados con MXFP4 se comportan casi idénticamente a sus contrapartes de precisión completa en la mayoría de las tareas. La cuantización se aplica durante el entrenamiento, no de forma posterior, lo que permite que el modelo se adapte a la menor precisión. Este enfoque reduce los requisitos de VRAM aproximadamente un 75 % respecto a FP16, haciendo viable la ejecución de modelos de 120 mil millones de parámetros en una única GPU de consumo.

Ventana de contexto y uso de memoria

Ambas variantes de gpt-oss admiten una ventana de contexto de 128 K tokens, equivalente a unos 100 000 palabras en inglés. Sin embargo, aprovechar efectivamente toda esta ventana de contexto requiere memoria adicional significativa más allá de los pesos base del modelo.

Para gpt-oss:20b, una ventana de contexto de 128 K añade aproximadamente 8 GB de sobrecarga de memoria. Con 24 GB de VRAM, puedes utilizar cómodamente toda la ventana. Con 16 GB, deberías limitar el contexto a 32 K–48 K tokens para evitar quedarte sin memoria durante la generación.

Para gpt-oss:120b, una ventana de contexto de 128 K añade aproximadamente 20 GB de sobrecarga. Una GPU de 80 GB puede gestionarla, pero una implementación de 70 GB (dos GPUs de consumo) debería limitar el contexto a 64 K tokens. Consulta Requisitos de VRAM por modelo las curvas detalladas de escalado de memoria

Preguntas frecuentes

¿Puedo ajustar finamente (fine-tune) los modelos gpt-oss?

Sí. OpenAI publicó gpt-oss bajo una licencia permisiva que permite el ajuste fino con cualquier finalidad, incluidas aplicaciones comerciales. Puedes usar frameworks estándar de ajuste fino como Axolotl o Hugging Face TRL. Los pesos del modelo son compatibles con la arquitectura Llama, por lo que la mayoría de las herramientas diseñadas para Llama funcionan sin modificaciones.

¿Cómo se compara gpt-oss:120b con Llama 3.1 70B?

gpt-oss:120b supera a Llama 3.1 70B en el seguimiento de instrucciones y las conversaciones con múltiples turnos, especialmente en tareas que exigen mantener el contexto a lo largo de muchos intercambios. Llama 3.1 70B obtiene ligeramente mejores resultados en benchmarks puros de razonamiento como MATH y DROP. Ambos modelos son prácticamente equivalentes en tareas de programación. El modelo de 120B requiere más VRAM (70 GB frente a 40 GB), pero ofrece una mejora notable en calidad para interacciones tipo asistente.

¿Puedo ejecutar gpt-oss:120b en varias GPUs de consumo?

Sí. Ollama divide automáticamente el modelo entre las GPUs disponibles si una sola GPU no dispone de suficiente memoria. Dos RTX 4090 (48 GB combinados de VRAM) pueden ejecutar gpt-oss:120b, aunque la velocidad de inferencia disminuye un 20–30 % respecto a una única GPU de 80 GB debido a la sobrecarga de comunicación entre GPUs. Tres o más GPUs aportan rendimientos decrecientes; si dispones del presupuesto para ello, una única A100 o H100 resulta más rentable.

¿Funciona gpt-oss sin conexión?

Sí, una vez que hayas descargado el modelo mediante ollama pull. Ollama almacena íntegramente los pesos del modelo localmente y la inferencia se realiza completamente en tu equipo. El único acceso a la red ocurre durante la descarga inicial y al comprobar actualizaciones del modelo. Puedes desactivar las actualizaciones automáticas estableciendo OLLAMA_SKIP_UPGRADE=1 en su entorno.

¿Qué licencia se aplica a las salidas generadas por gpt-oss?

La licencia de gpt-oss de OpenAI no reclama propiedad alguna sobre las salidas generadas. Tú eres propietario de las salidas que produces y puedes utilizarlas con cualquier finalidad, incluidos productos y servicios comerciales. Esto difiere de los términos de servicio de la API de OpenAI, que restringen ciertos usos. Revisa siempre el texto completo de la licencia incluido con la descarga del modelo para confirmar los términos más recientes.

¿Puedo usar los modelos gpt-oss con fines comerciales?

Sí. La licencia permite su uso comercial sin restricciones, incluida la integración del modelo en productos propietarios, su oferta como servicio o su utilización para generar contenido destinado a la venta. No estás obligado a liberar como código abierto trabajos derivados ni a revelar que has usado gpt-oss en tu producto, aunque se recomienda mencionar su uso.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top