{"id":2235,"date":"2026-08-18T20:04:34","date_gmt":"2026-08-18T20:04:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2235"},"modified":"2026-08-23T03:54:48","modified_gmt":"2026-08-23T03:54:48","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/","title":{"rendered":"GPT-OSS de Ollama: Gu\u00eda completa para ejecutar los modelos abiertos de OpenAI"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>En resumen<\/strong><\/p>\n<ul>\n<li><strong>gpt-oss:20b<\/strong> se ejecuta con ~16 GB de memoria (cabe en la mayor\u00eda de las GPU para juegos), <strong>gpt-oss:120b<\/strong> requiere ~70 GB (una \u00fanica GPU de 80 GB o distribuci\u00f3n entre tarjetas de consumo)<\/li>\n<li>Instale con <code>ollama pull gpt-oss:20b<\/code> o <code>ollama pull gpt-oss:120b<\/code>, luego ejecute con <code>ollama run gpt-oss:20b<\/code><\/li>\n<li>Ambas variantes utilizan la cuantizaci\u00f3n MXFP4 a 4,25 bits por par\u00e1metro y admiten ventanas de contexto de 128 K.<\/li>\n<li>Lanzados por OpenAI como modelos de pesos abiertos en colaboraci\u00f3n con Ollama, comparables en calidad con Llama 3.1 y Qwen 2.5.<\/li>\n<\/ul>\n<\/div>\n<p>OpenAI lanz\u00f3 gpt-oss como modelos de pesos abiertos en agosto de 2025, distribuidos exclusivamente a trav\u00e9s de Ollama. La familia gpt-oss consta de dos variantes: un modelo de 20 mil millones de par\u00e1metros que se ejecuta c\u00f3modamente en hardware de consumo y un modelo de 120 mil millones de par\u00e1metros que ofrece un rendimiento cercano al de los sistemas punteros en una \u00fanica GPU de gama alta. Ambos emplean la cuantizaci\u00f3n MXFP4, empaquetando los pesos del modelo a 4,25 bits por par\u00e1metro sin comprometer significativamente la calidad frente a la inferencia en precisi\u00f3n completa.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abaaba920dc5\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abaaba920dc5\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#What_Are_the_GPT-OSS_Models\" >\u00bfQu\u00e9 son los modelos GPT-OSS?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Hardware_Requirements\" >Requisitos de hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Installation\" >Instalaci\u00f3n<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Pulling_and_Running_the_Models\" >Descarga y ejecuci\u00f3n de los modelos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Performance_and_Model_Comparison\" >Rendimiento y comparaci\u00f3n entre modelos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#MXFP4_Quantisation\" >Cuantizaci\u00f3n MXFP4<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Context_Window_and_Memory_Usage\" >Ventana de contexto y uso de memoria<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Are_the_GPT-OSS_Models\"><\/span>\u00bfQu\u00e9 son los modelos GPT-OSS?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Los modelos gpt-oss representan el primer lanzamiento de OpenAI con pesos abiertos, tras la presi\u00f3n del sector por mayor transparencia y reproducibilidad. A diferencia de GPT-4 o GPT-4o, estos modelos se distribuyen con todos sus pesos, detalles arquitect\u00f3nicos y licencias permisivas que permiten su uso comercial sin restricciones.<\/p>\n<p>Both models support a 128K token context window, handle multi-turn conversations, and perform instruction following comparable to other open models in their parameter class. The 20B variant competes directly with Llama 3.1 8B and Mistral 7B, while the 120B model sits between Llama 3.1 70B and full frontier systems like GPT-4.<\/p>\n<p>OpenAI colabor\u00f3 con Ollama para gestionar la distribuci\u00f3n y la optimizaci\u00f3n de la inferencia. Esto significa que instala y ejecuta gpt-oss de la misma manera que cualquier otro <a href=\"https:\/\/convly.ai\/es\/what-is-ollama-complete-guide-2026\/\">modelo de Ollama<\/a>, sin necesidad de pasos adicionales de conversi\u00f3n ni cuantizaci\u00f3n.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Requisitos de hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La tabla siguiente muestra el hardware m\u00ednimo y recomendado para cada variante de gpt-oss. Las cifras de memoria incluyen los pesos del modelo m\u00e1s un margen razonable para el contexto y los b\u00faferes de inferencia.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>Par\u00e1metros<\/th>\n<th>Tama\u00f1o en disco<\/th>\n<th>Memoria m\u00ednima<\/th>\n<th>Memoria recomendada<\/th>\n<th>Hardware de ejemplo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>gpt-oss:20b<\/td>\n<td>20B<\/td>\n<td>14 GB<\/td>\n<td>16 GB<\/td>\n<td>24 GB<\/td>\n<td>RTX 4090, RTX 3090, A5000<\/td>\n<\/tr>\n<tr>\n<td>gpt-oss:120b<\/td>\n<td>120B<\/td>\n<td>65 GB<\/td>\n<td>70 GB<\/td>\n<td>80 GB<\/td>\n<td>A100 80 GB, H100, 2\u00d7 RTX 4090<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>El modelo de 20 mil millones de par\u00e1metros cabe c\u00f3modamente en las GPU de consumo lanzadas desde 2020. Si dispone de una RTX 3090 o RTX 4090 con 24 GB de VRAM, puede ejecutar gpt-oss:20b dejando espacio suficiente para una ventana de contexto de 16 K tokens. Con 16 GB (RTX 4080, RTX 3080 Ti), a\u00fan puede ejecutar el modelo, pero debe limitar la longitud del contexto a 8 K tokens para evitar desbordamientos de memoria.<\/p>\n<p>El modelo de 120 mil millones de par\u00e1metros requiere hardware de centro de datos o una configuraci\u00f3n multi-GPU de consumo. Una A100 de 80 GB lo gestiona c\u00f3modamente. Dos RTX 4090 en un equipo de sobremesa pueden dividir el modelo entre ambas tarjetas, aunque la velocidad de inferencia disminuye ligeramente comparada con implementaciones de una sola GPU. Utilice la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar los requisitos de memoria seg\u00fan distintas longitudes de contexto.<\/p>\n<h3>CPU y RAM del sistema<\/h3>\n<p>Si no dispone de suficiente VRAM, Ollama descargar\u00e1 capas a la RAM del sistema y las ejecutar\u00e1 en la CPU. Para gpt-oss:20b, necesita al menos 32 GB de RAM del sistema si ejecuta el modelo \u00edntegramente en la CPU. Para gpt-oss:120b, la inferencia en CPU es poco pr\u00e1ctica: espere varios segundos por token incluso en sistemas con muchos n\u00facleos. Consulte la <a href=\"https:\/\/convly.ai\/es\/best-gpus-for-local-llms-2026\/\">gu\u00eda de las mejores GPUs para LLMs locales<\/a> si est\u00e1 construyendo o actualizando hardware espec\u00edficamente para la inferencia de modelos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installation\"><\/span>Instalaci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>En primer lugar, instale Ollama si a\u00fan no lo ha hecho. El proceso var\u00eda seg\u00fan la plataforma:<\/p>\n<h3>macOS<\/h3>\n<p>Descargue la aplicaci\u00f3n de Ollama para macOS desde <code>ollama.com<\/code> y arr\u00e1strela a <code>\/Applications<\/code>. El instalador configura autom\u00e1ticamente la CLI de <code>ollama<\/code> . Alternativamente, inst\u00e1lelo mediante Homebrew:<\/p>\n<pre><code>brew install ollama<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ejecute el script oficial de instalaci\u00f3n, que coloca el binario en <code>\/usr\/local\/bin\/ollama<\/code> y configura un servicio systemd:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Para instalaci\u00f3n manual o instrucciones espec\u00edficas por distribuci\u00f3n, consulte la <a href=\"https:\/\/convly.ai\/es\/how-to-install-ollama-2026\/\">Gu\u00eda de instalaci\u00f3n de Ollama<\/a>.<\/p>\n<h3>Windows<\/h3>\n<p>Descarga el instalador para Windows desde <code>ollama.com<\/code> y ejec\u00fatelo. El instalador agrega Ollama a su PATH y inicia autom\u00e1ticamente el servicio en segundo plano. Tras la instalaci\u00f3n, abra PowerShell o el s\u00edmbolo del sistema para verificarlo:<\/p>\n<pre><code>ollama --version<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_the_Models\"><\/span>Descarga y ejecuci\u00f3n de los modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Una vez instalado Ollama, descargue el modelo que desee. Para la variante de 20 mil millones de par\u00e1metros:<\/p>\n<pre><code>ollama pull gpt-oss:20b<\/code><\/pre>\n<p>Para la variante de 120 mil millones de par\u00e1metros:<\/p>\n<pre><code>ollama pull gpt-oss:120b<\/code><\/pre>\n<p>La descarga de los pesos del modelo se realiza en <code>~\/.ollama\/models<\/code> en macOS y Linux, o en <code>%USERPROFILE%\\.ollama\\models<\/code> en Windows. La descarga admite reanudaci\u00f3n, por lo que puede interrumpirla y reiniciarla sin perder progreso.<\/p>\n<p>Tras descargarlo, inicie una sesi\u00f3n interactiva:<\/p>\n<pre><code>ollama run gpt-oss:20b<\/code><\/pre>\n<p>O bien, para el modelo m\u00e1s grande:<\/p>\n<pre><code>ollama run gpt-oss:120b<\/code><\/pre>\n<p>Esto abre una interfaz de chat. Escribe tu indicaci\u00f3n (prompt), presiona Entrar y el modelo transmitir\u00e1 su respuesta en tiempo real. Escribe <code>\/adios<\/code> para salir.<\/p>\n<h3>Acceso a la API<\/h3>\n<p>Ollama ejecuta un servidor HTTP local en <code>http:\/\/localhost:11434<\/code>. Puedes enviar solicitudes mediante curl, Python o cualquier cliente HTTP:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"gpt-oss:20b\",\n  \"prompt\": \"Explica la cuantizaci\u00f3n MXFP4 en una sola oraci\u00f3n.\"\n}'<\/code><\/pre>\n<p>Para aplicaciones estructuradas, utiliza el SDK de Ollama para Python o JavaScript. Ambos est\u00e1n disponibles mediante los gestores de paquetes est\u00e1ndar (<code>pip install ollama<\/code>, <code>npm install ollama<\/code>) y ofrecen interfaces tipadas para generaci\u00f3n, incrustaciones (embeddings) y gesti\u00f3n de modelos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_and_Model_Comparison\"><\/span>Rendimiento y comparaci\u00f3n entre modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>El modelo de 20 mil millones de par\u00e1metros genera entre 15 y 30 tokens por segundo en una RTX 4090, dependiendo de la longitud del contexto y la complejidad de la indicaci\u00f3n. El modelo de 120 mil millones de par\u00e1metros produce entre 8 y 15 tokens por segundo en una A100 de 80 GB. Ambas cifras corresponden a la configuraci\u00f3n predeterminada, sin optimizaciones adicionales como la decodificaci\u00f3n especulativa.<\/p>\n<p>En cuanto a calidad, gpt-oss:20b obtiene resultados comparables a los de Llama 3.1 8B y Mistral 7B en benchmarks de razonamiento como MMLU y GSM8K. Supera a ambos en el seguimiento de instrucciones con m\u00faltiples turnos, probablemente gracias al ajuste mediante aprendizaje por refuerzo a partir de retroalimentaci\u00f3n humana (RLHF) de OpenAI. La variante de 120B se acerca a la calidad de GPT-3.5 Turbo, lo que la convierte en el modelo abierto m\u00e1s potente disponible bajo los 200 mil millones de par\u00e1metros hasta agosto de 2026.<\/p>\n<p>En comparaci\u00f3n con los modelos propietarios basados en API, ejecutar gpt-oss localmente resulta rentable a partir de aproximadamente 2 millones de tokens mensuales para el modelo de 20B, o 500 000 tokens mensuales para el modelo de 120B, siempre que ya poseas el hardware necesario. Usa la <a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">calculadora de autohospedaje frente a API<\/a> calculadora de punto de equilibrio<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MXFP4_Quantisation\"><\/span>Cuantizaci\u00f3n MXFP4<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambos modelos gpt-oss incluyen integrada la cuantizaci\u00f3n MXFP4. MXFP4 es un formato de punto flotante con escalado microsc\u00f3pico que representa los pesos con un promedio de 4,25 bits por par\u00e1metro, frente a los 16 bits de la precisi\u00f3n media est\u00e1ndar. A diferencia de esquemas de cuantizaci\u00f3n anteriores como GPTQ o AWQ, MXFP4 conserva mayor rango din\u00e1mico, reduciendo as\u00ed la p\u00e9rdida de precisi\u00f3n t\u00edpicamente asociada con compresiones agresivas.<\/p>\n<p>En la pr\u00e1ctica, los modelos cuantizados con MXFP4 se comportan casi id\u00e9nticamente a sus contrapartes de precisi\u00f3n completa en la mayor\u00eda de las tareas. La cuantizaci\u00f3n se aplica durante el entrenamiento, no de forma posterior, lo que permite que el modelo se adapte a la menor precisi\u00f3n. Este enfoque reduce los requisitos de VRAM aproximadamente un 75 % respecto a FP16, haciendo viable la ejecuci\u00f3n de modelos de 120 mil millones de par\u00e1metros en una \u00fanica GPU de consumo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_Window_and_Memory_Usage\"><\/span>Ventana de contexto y uso de memoria<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambas variantes de gpt-oss admiten una ventana de contexto de 128 K tokens, equivalente a unos 100 000 palabras en ingl\u00e9s. Sin embargo, aprovechar efectivamente toda esta ventana de contexto requiere memoria adicional significativa m\u00e1s all\u00e1 de los pesos base del modelo.<\/p>\n<p>Para gpt-oss:20b, una ventana de contexto de 128 K a\u00f1ade aproximadamente 8 GB de sobrecarga de memoria. Con 24 GB de VRAM, puedes utilizar c\u00f3modamente toda la ventana. Con 16 GB, deber\u00edas limitar el contexto a 32 K\u201348 K tokens para evitar quedarte sin memoria durante la generaci\u00f3n.<\/p>\n<p>Para gpt-oss:120b, una ventana de contexto de 128 K a\u00f1ade aproximadamente 20 GB de sobrecarga. Una GPU de 80 GB puede gestionarla, pero una implementaci\u00f3n de 70 GB (dos GPUs de consumo) deber\u00eda limitar el contexto a 64 K tokens. Consulta <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM por modelo<\/a> las curvas detalladas de escalado de memoria<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfPuedo ajustar finamente (fine-tune) los modelos gpt-oss?<\/h3>\n<p>S\u00ed. OpenAI public\u00f3 gpt-oss bajo una licencia permisiva que permite el ajuste fino con cualquier finalidad, incluidas aplicaciones comerciales. Puedes usar frameworks est\u00e1ndar de ajuste fino como Axolotl o Hugging Face TRL. Los pesos del modelo son compatibles con la arquitectura Llama, por lo que la mayor\u00eda de las herramientas dise\u00f1adas para Llama funcionan sin modificaciones.<\/p>\n<h3>\u00bfC\u00f3mo se compara gpt-oss:120b con Llama 3.1 70B?<\/h3>\n<p>gpt-oss:120b supera a Llama 3.1 70B en el seguimiento de instrucciones y las conversaciones con m\u00faltiples turnos, especialmente en tareas que exigen mantener el contexto a lo largo de muchos intercambios. Llama 3.1 70B obtiene ligeramente mejores resultados en benchmarks puros de razonamiento como MATH y DROP. Ambos modelos son pr\u00e1cticamente equivalentes en tareas de programaci\u00f3n. El modelo de 120B requiere m\u00e1s VRAM (70 GB frente a 40 GB), pero ofrece una mejora notable en calidad para interacciones tipo asistente.<\/p>\n<h3>\u00bfPuedo ejecutar gpt-oss:120b en varias GPUs de consumo?<\/h3>\n<p>S\u00ed. Ollama divide autom\u00e1ticamente el modelo entre las GPUs disponibles si una sola GPU no dispone de suficiente memoria. Dos RTX 4090 (48 GB combinados de VRAM) pueden ejecutar gpt-oss:120b, aunque la velocidad de inferencia disminuye un 20\u201330 % respecto a una \u00fanica GPU de 80 GB debido a la sobrecarga de comunicaci\u00f3n entre GPUs. Tres o m\u00e1s GPUs aportan rendimientos decrecientes; si dispones del presupuesto para ello, una \u00fanica A100 o H100 resulta m\u00e1s rentable.<\/p>\n<h3>\u00bfFunciona gpt-oss sin conexi\u00f3n?<\/h3>\n<p>S\u00ed, una vez que hayas descargado el modelo mediante <code>ollama pull<\/code>. Ollama almacena \u00edntegramente los pesos del modelo localmente y la inferencia se realiza completamente en tu equipo. El \u00fanico acceso a la red ocurre durante la descarga inicial y al comprobar actualizaciones del modelo. Puedes desactivar las actualizaciones autom\u00e1ticas estableciendo <code>OLLAMA_SKIP_UPGRADE=1<\/code> en su entorno.<\/p>\n<h3>\u00bfQu\u00e9 licencia se aplica a las salidas generadas por gpt-oss?<\/h3>\n<p>La licencia de gpt-oss de OpenAI no reclama propiedad alguna sobre las salidas generadas. T\u00fa eres propietario de las salidas que produces y puedes utilizarlas con cualquier finalidad, incluidos productos y servicios comerciales. Esto difiere de los t\u00e9rminos de servicio de la API de OpenAI, que restringen ciertos usos. Revisa siempre el texto completo de la licencia incluido con la descarga del modelo para confirmar los t\u00e9rminos m\u00e1s recientes.<\/p>\n<h3>\u00bfPuedo usar los modelos gpt-oss con fines comerciales?<\/h3>\n<p>S\u00ed. La licencia permite su uso comercial sin restricciones, incluida la integraci\u00f3n del modelo en productos propietarios, su oferta como servicio o su utilizaci\u00f3n para generar contenido destinado a la venta. No est\u00e1s obligado a liberar como c\u00f3digo abierto trabajos derivados ni a revelar que has usado gpt-oss en tu producto, aunque se recomienda mencionar su uso.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DRgpt-oss:20b runs in ~16GB memory (fits most gaming GPUs), gpt-oss:120b needs ~70GB (single 80GB GPU or split across consumer cards)Install with ollama pull gpt-oss:20b or ollama pull gpt-oss:120b, then run with ollama run gpt-oss:20bBoth variants use MXFP4 quantisation at 4.25 bits per parameter and support 128K context windowsReleased by OpenAI as open-weight models in partnership with Ollama, comparable to Llama 3.1 and Qwen 2.5 in quality OpenAI released gpt-oss as open-weight models in August 2025, distributed exclusively through Ollama.<\/p>","protected":false},"author":1,"featured_media":2236,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2235","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2235","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2235"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2235\/revisions"}],"predecessor-version":[{"id":2278,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2235\/revisions\/2278"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2236"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2235"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2235"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2235"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}