- gpt-oss:20b roda com cerca de 16 GB de memória (compatível com a maioria das GPUs voltadas para jogos), gpt-oss:120b requer cerca de 70 GB (uma única GPU de 80 GB ou divisão entre placas consumidoras)
- Instale com
ollama pull gpt-oss:20bouollama pull gpt-oss:120b, em seguida, execute comollama run gpt-oss:20b - Ambas as variantes utilizam a quantização MXFP4 com 4,25 bits por parâmetro e suportam janelas de contexto de 128K tokens
- Lançados pela OpenAI como modelos de pesos abertos em parceria com a Ollama, com qualidade comparável à dos modelos Llama 3.1 e Qwen 2.5
A OpenAI lançou o gpt-oss como modelos de pesos abertos em agosto de 2025, distribuídos exclusivamente pela Ollama. A família gpt-oss é composta por duas variantes: um modelo de 20 bilhões de parâmetros que roda confortavelmente em hardware consumidor e um modelo de 120 bilhões de parâmetros que oferece desempenho próximo ao estado da arte em uma única GPU de alto desempenho. Ambos empregam a quantização MXFP4, compactando os pesos do modelo a 4,25 bits por parâmetro, mantendo uma qualidade próxima à da inferência em precisão total.
O que são os modelos GPT-OSS?
Os modelos gpt-oss representam o primeiro lançamento da OpenAI com pesos abertos, em resposta à pressão da indústria por transparência e reprodutibilidade. Diferentemente do GPT-4 ou do GPT-4o, esses modelos são disponibilizados com todos os pesos, detalhes arquiteturais e licenças permissivas que permitem uso comercial sem restrições.
Ambos os modelos suportam uma janela de contexto de 128K tokens, lidam com conversas multi-turno e executam instruções com desempenho comparável ao de outros modelos abertos de sua classe de parâmetros. A variante de 20B compete diretamente com Llama 3.1 8B e Mistral 7B, enquanto o modelo de 120B posiciona-se entre o Llama 3.1 70B e sistemas de ponta completos, como o GPT-4.
A OpenAI fez parceria com a Ollama para gerenciar a distribuição e a otimização da inferência. Isso significa que você instala e executa o gpt-oss da mesma forma que qualquer outro modelo Ollama, sem etapas adicionais de conversão ou quantização.
Requisitos de hardware
A tabela abaixo mostra os requisitos mínimos e recomendados de hardware para cada variante do gpt-oss. Os valores de memória levam em conta os pesos do modelo mais uma sobrecarga razoável para contexto e buffers de inferência.
| Modelo | Parâmetros | Tamanho no disco | Memória mínima | Memória recomendada | Hardware de exemplo |
|---|---|---|---|---|---|
| gpt-oss:20b | 20B | 14 GB | 16 GB | 24 GB | RTX 4090, RTX 3090, A5000 |
| gpt-oss:120b | 120B | 65 GB | 70 GB | 80 GB | A100 80 GB, H100, 2× RTX 4090 |
O modelo de 20 bilhões de parâmetros cabe confortavelmente em GPUs consumidoras lançadas desde 2020. Se você possui uma RTX 3090 ou RTX 4090 com 24 GB de VRAM, poderá executar o gpt-oss:20b com espaço suficiente para uma janela de contexto de 16K tokens. Com 16 GB (RTX 4080, RTX 3080 Ti), ainda é possível executar o modelo, mas recomenda-se limitar o comprimento do contexto a 8K tokens para evitar estouro de memória.
O modelo de 120 bilhões de parâmetros exige hardware de datacenter ou uma configuração multi-GPU voltada para consumidores. Uma A100 de 80 GB o executa com folga. Duas RTX 4090 em um desktop conseguem dividir o modelo entre ambas as placas, embora a velocidade de inferência diminua ligeiramente em comparação com implantações de GPU única. Use o Calculadora de VRAM para estimar os requisitos de memória para diferentes comprimentos de contexto.
CPU e RAM do sistema
Se você não dispuser de VRAM suficiente, a Ollama descarregará camadas para a RAM do sistema e as executará na CPU. Para o gpt-oss:20b, são necessários pelo menos 32 GB de RAM do sistema caso a execução ocorra inteiramente na CPU. Já para o gpt-oss:120b, a inferência via CPU é inviável — espere vários segundos por token, mesmo em sistemas com grande número de núcleos. Consulte o melhor Placas de vídeo para LLMs locais guia se você estiver montando ou atualizando hardware especificamente para inferência de modelos.
Instalação
Primeiro, instale a Ollama, caso ainda não o tenha feito. O processo varia conforme a plataforma:
macOS
Baixe o aplicativo Ollama para macOS em ollama.com e arraste-o para /Applications. O instalador configura automaticamente a CLI da ollama . Alternativamente, instale via Homebrew:
brew install ollama
Linux
Execute o script oficial de instalação, que coloca o binário em /usr/local/bin/ollama e configura um serviço systemd:
curl -fsSL https://ollama.com/install.sh | sh
Para instalação manual ou instruções específicas por distribuição, consulte a Guia de instalação do Ollama.
Windows
Baixe o instalador para Windows em ollama.com e execute-o. O instalador adiciona a Ollama ao seu PATH e inicia automaticamente o serviço em segundo plano. Após a instalação, abra o PowerShell ou o Prompt de Comando para verificar:
ollama --version
Baixando e executando os modelos
Uma vez instalada a Ollama, baixe o modelo desejado. Para a variante de 20 bilhões de parâmetros:
ollama pull gpt-oss:20b
Para a variante de 120 bilhões de parâmetros:
ollama pull gpt-oss:120b
O download transfere os pesos do modelo para ~/.ollama/models no macOS e Linux, ou para %USERPROFILE%\.ollama\models no Windows. O download é retomável, portanto você pode interrompê-lo e reiniciá-lo sem perder progresso.
Após baixar o modelo, inicie uma sessão interativa:
ollama run gpt-oss:20b
Ou, para o modelo maior:
ollama run gpt-oss:120b
Isso abre uma interface de chat. Digite seu prompt, pressione Enter e o modelo transmitirá sua resposta em tempo real. Digite /bye para sair.
Acesso à API
O Ollama executa um servidor HTTP local em http://localhost:11434. Você pode enviar solicitações usando curl, Python ou qualquer cliente HTTP:
curl http://localhost:11434/api/generate -d '{
"model": "gpt-oss:20b",
"prompt": "Explique a quantização MXFP4 em uma frase."
}'
Para aplicações estruturadas, use o SDK Python ou JavaScript do Ollama. Ambos estão disponíveis por meio dos gerenciadores de pacotes padrão (pip install ollama, npm install ollama) e fornecem interfaces tipadas para geração, incorporação (embedding) e gerenciamento de modelos.
Desempenho e comparação entre modelos
O modelo de 20 bilhões de parâmetros gera de 15 a 30 tokens por segundo em uma RTX 4090, dependendo do comprimento do contexto e da complexidade do prompt. O modelo de 120 bilhões de parâmetros gera de 8 a 15 tokens por segundo em uma A100 de 80 GB. Ambas as métricas assumem configurações padrão, sem otimizações adicionais, como decodificação especulativa.
Em termos de qualidade, o gpt-oss:20b apresenta desempenho comparável ao Llama 3.1 8B e ao Mistral 7B em benchmarks de raciocínio, como MMLU e GSM8K. Ele supera ambos no seguimento de instruções em múltiplas etapas, provavelmente devido ao ajuste por aprendizado por reforço com feedback humano (RLHF) realizado pela OpenAI. A variante de 120B aproxima-se da qualidade do GPT-3.5 Turbo, tornando-a o modelo aberto mais forte com menos de 200 bilhões de parâmetros até agosto de 2026.
Comparado a modelos proprietários acessados via API, executar o gpt-oss localmente torna-se economicamente vantajoso a partir de aproximadamente 2 milhões de tokens por mês para o modelo de 20B, ou 500 mil tokens por mês para o modelo de 120B — desde que você já possua o hardware necessário. Use a calculadora de autohospedagem versus API calculadora de ponto de equilíbrio
Quantização MXFP4
Ambos os modelos gpt-oss são distribuídos com a quantização MXFP4 integrada. MXFP4 é um formato de ponto flutuante com microescala que representa os pesos com uma média de 4,25 bits por parâmetro, reduzindo-os de 16 bits usados na precisão de meia precisão padrão. Diferentemente de esquemas de quantização anteriores, como GPTQ ou AWQ, o MXFP4 preserva maior faixa dinâmica, diminuindo a perda de precisão normalmente associada à compressão agressiva.
Na prática, modelos quantizados em MXFP4 se comportam quase identicamente às suas contrapartes de precisão total na maioria das tarefas. A quantização ocorre durante o treinamento, e não posteriormente, permitindo que o modelo se adapte à menor precisão. Essa abordagem reduz os requisitos de VRAM em cerca de 75% em comparação ao FP16, tornando viável executar modelos de 120 bilhões de parâmetros em uma única GPU voltada ao consumidor.
Janela de contexto e uso de memória
Ambas as variantes do gpt-oss suportam uma janela de contexto de 128K tokens, equivalente a aproximadamente 100.000 palavras em inglês. No entanto, utilizar efetivamente toda essa janela de contexto exige memória adicional significativa além dos pesos-base do modelo.
Para o gpt-oss:20b, uma janela de contexto de 128K acrescenta aproximadamente 8 GB de sobrecarga de memória. Com 24 GB de VRAM, você pode usar confortavelmente toda a janela. Com 16 GB, recomenda-se limitar o contexto a 32K–48K tokens para evitar esgotamento de memória durante a geração.
Para o gpt-oss:120b, uma janela de contexto de 128K acrescenta cerca de 20 GB de sobrecarga. Uma GPU de 80 GB consegue lidar com isso, mas uma implantação de 70 GB (duas GPUs voltadas ao consumidor) deve limitar o contexto a 64K tokens. Consulte Requisitos de VRAM por modelo o gráfico detalhado de escalonamento de memória
Perguntas frequentes
Posso fazer fine-tuning nos modelos gpt-oss?
Sim. A OpenAI lançou o gpt-oss sob uma licença permissiva que permite o fine-tuning para qualquer finalidade, inclusive aplicações comerciais. Você pode usar frameworks padrão de fine-tuning, como Axolotl ou Hugging Face TRL. Os pesos do modelo são compatíveis com a arquitetura Llama, portanto a maioria das ferramentas desenvolvidas para Llama funciona sem modificações.
Como o gpt-oss:120b se compara ao Llama 3.1 70B?
O gpt-oss:120b supera o Llama 3.1 70B no seguimento de instruções e em conversas com múltiplas etapas, especialmente em tarefas que exigem manter o contexto ao longo de muitas trocas. O Llama 3.1 70B leva ligeira vantagem em benchmarks puramente de raciocínio, como MATH e DROP. Ambos os modelos têm desempenho aproximadamente equivalente em tarefas de programação. O modelo de 120B exige mais VRAM (70 GB contra 40 GB), mas oferece uma melhoria perceptível na qualidade das interações no estilo assistente.
Posso executar o gpt-oss:120b em múltiplas GPUs voltadas ao consumidor?
Sim. O Ollama divide automaticamente o modelo entre as GPUs disponíveis caso uma única GPU não tenha memória suficiente. Duas RTX 4090s (48 GB combinados de VRAM) conseguem executar o gpt-oss:120b, embora a velocidade de inferência caia 20–30% em comparação com uma única GPU de 80 GB devido à sobrecarga de comunicação entre GPUs. Três ou mais GPUs trazem retornos decrescentes; se seu orçamento permitir, uma única A100 ou H100 é mais custo-efetiva.
O gpt-oss funciona offline?
Sim, assim que você baixar o modelo com ollama pullollama pull gpt-oss:20b (ou gpt-oss:120b). OLLAMA_SKIP_UPGRADE=1 em seu ambiente.
Qual licença se aplica às saídas geradas pelo gpt-oss?
A licença gpt-oss da OpenAI não reivindica propriedade sobre as saídas geradas. Você detém os direitos sobre as saídas que produzir e pode utilizá-las para qualquer finalidade, inclusive produtos e serviços comerciais. Isso difere dos termos de serviço da API da OpenAI, que restringem certos casos de uso. Revise sempre o texto completo da licença incluído no download do modelo para confirmar os termos mais recentes.
Posso usar os modelos gpt-oss comercialmente?
Sim. A licença permite o uso comercial sem restrições, incluindo a incorporação do modelo em produtos proprietários, sua oferta como serviço ou seu uso para gerar conteúdo destinado à venda. Você não é obrigado a disponibilizar como código aberto trabalhos derivados nem a divulgar que utilizou o gpt-oss em seu produto, embora a atribuição seja incentivada.
