{"id":2235,"date":"2026-08-18T20:04:34","date_gmt":"2026-08-18T20:04:34","guid":{"rendered":"https:\/\/convly.ai\/?p=2235"},"modified":"2026-08-23T03:54:48","modified_gmt":"2026-08-23T03:54:48","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS: Guia Completo para Executar os Modelos Abertos da OpenAI"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Resumo<\/strong><\/p>\n<ul>\n<li><strong>gpt-oss:20b<\/strong> roda com cerca de 16 GB de mem\u00f3ria (compat\u00edvel com a maioria das GPUs voltadas para jogos), <strong>gpt-oss:120b<\/strong> requer cerca de 70 GB (uma \u00fanica GPU de 80 GB ou divis\u00e3o entre placas consumidoras)<\/li>\n<li>Instale com <code>ollama pull gpt-oss:20b<\/code> ou <code>ollama pull gpt-oss:120b<\/code>, em seguida, execute com <code>ollama run gpt-oss:20b<\/code><\/li>\n<li>Ambas as variantes utilizam a quantiza\u00e7\u00e3o MXFP4 com 4,25 bits por par\u00e2metro e suportam janelas de contexto de 128K tokens<\/li>\n<li>Lan\u00e7ados pela OpenAI como modelos de pesos abertos em parceria com a Ollama, com qualidade compar\u00e1vel \u00e0 dos modelos Llama 3.1 e Qwen 2.5<\/li>\n<\/ul>\n<\/div>\n<p>A OpenAI lan\u00e7ou o gpt-oss como modelos de pesos abertos em agosto de 2025, distribu\u00eddos exclusivamente pela Ollama. A fam\u00edlia gpt-oss \u00e9 composta por duas variantes: um modelo de 20 bilh\u00f5es de par\u00e2metros que roda confortavelmente em hardware consumidor e um modelo de 120 bilh\u00f5es de par\u00e2metros que oferece desempenho pr\u00f3ximo ao estado da arte em uma \u00fanica GPU de alto desempenho. Ambos empregam a quantiza\u00e7\u00e3o MXFP4, compactando os pesos do modelo a 4,25 bits por par\u00e2metro, mantendo uma qualidade pr\u00f3xima \u00e0 da infer\u00eancia em precis\u00e3o total.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6abaab8a23ed8\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6abaab8a23ed8\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#What_Are_the_GPT-OSS_Models\" >O que s\u00e3o os modelos GPT-OSS?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Hardware_Requirements\" >Requisitos de hardware<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Installation\" >Instala\u00e7\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Pulling_and_Running_the_Models\" >Baixando e executando os modelos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Performance_and_Model_Comparison\" >Desempenho e compara\u00e7\u00e3o entre modelos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#MXFP4_Quantisation\" >Quantiza\u00e7\u00e3o MXFP4<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Context_Window_and_Memory_Usage\" >Janela de contexto e uso de mem\u00f3ria<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Are_the_GPT-OSS_Models\"><\/span>O que s\u00e3o os modelos GPT-OSS?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Os modelos gpt-oss representam o primeiro lan\u00e7amento da OpenAI com pesos abertos, em resposta \u00e0 press\u00e3o da ind\u00fastria por transpar\u00eancia e reprodutibilidade. Diferentemente do GPT-4 ou do GPT-4o, esses modelos s\u00e3o disponibilizados com todos os pesos, detalhes arquiteturais e licen\u00e7as permissivas que permitem uso comercial sem restri\u00e7\u00f5es.<\/p>\n<p>Both models support a 128K token context window, handle multi-turn conversations, and perform instruction following comparable to other open models in their parameter class. The 20B variant competes directly with Llama 3.1 8B and Mistral 7B, while the 120B model sits between Llama 3.1 70B and full frontier systems like GPT-4.<\/p>\n<p>A OpenAI fez parceria com a Ollama para gerenciar a distribui\u00e7\u00e3o e a otimiza\u00e7\u00e3o da infer\u00eancia. Isso significa que voc\u00ea instala e executa o gpt-oss da mesma forma que qualquer outro <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">modelo Ollama<\/a>, sem etapas adicionais de convers\u00e3o ou quantiza\u00e7\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Hardware_Requirements\"><\/span>Requisitos de hardware<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A tabela abaixo mostra os requisitos m\u00ednimos e recomendados de hardware para cada variante do gpt-oss. Os valores de mem\u00f3ria levam em conta os pesos do modelo mais uma sobrecarga razo\u00e1vel para contexto e buffers de infer\u00eancia.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>Par\u00e2metros<\/th>\n<th>Tamanho no disco<\/th>\n<th>Mem\u00f3ria m\u00ednima<\/th>\n<th>Mem\u00f3ria recomendada<\/th>\n<th>Hardware de exemplo<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>gpt-oss:20b<\/td>\n<td>20B<\/td>\n<td>14 GB<\/td>\n<td>16 GB<\/td>\n<td>24 GB<\/td>\n<td>RTX 4090, RTX 3090, A5000<\/td>\n<\/tr>\n<tr>\n<td>gpt-oss:120b<\/td>\n<td>120B<\/td>\n<td>65 GB<\/td>\n<td>70 GB<\/td>\n<td>80 GB<\/td>\n<td>A100 80 GB, H100, 2\u00d7 RTX 4090<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>O modelo de 20 bilh\u00f5es de par\u00e2metros cabe confortavelmente em GPUs consumidoras lan\u00e7adas desde 2020. Se voc\u00ea possui uma RTX 3090 ou RTX 4090 com 24 GB de VRAM, poder\u00e1 executar o gpt-oss:20b com espa\u00e7o suficiente para uma janela de contexto de 16K tokens. Com 16 GB (RTX 4080, RTX 3080 Ti), ainda \u00e9 poss\u00edvel executar o modelo, mas recomenda-se limitar o comprimento do contexto a 8K tokens para evitar estouro de mem\u00f3ria.<\/p>\n<p>O modelo de 120 bilh\u00f5es de par\u00e2metros exige hardware de datacenter ou uma configura\u00e7\u00e3o multi-GPU voltada para consumidores. Uma A100 de 80 GB o executa com folga. Duas RTX 4090 em um desktop conseguem dividir o modelo entre ambas as placas, embora a velocidade de infer\u00eancia diminua ligeiramente em compara\u00e7\u00e3o com implanta\u00e7\u00f5es de GPU \u00fanica. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar os requisitos de mem\u00f3ria para diferentes comprimentos de contexto.<\/p>\n<h3>CPU e RAM do sistema<\/h3>\n<p>Se voc\u00ea n\u00e3o dispuser de VRAM suficiente, a Ollama descarregar\u00e1 camadas para a RAM do sistema e as executar\u00e1 na CPU. Para o gpt-oss:20b, s\u00e3o necess\u00e1rios pelo menos 32 GB de RAM do sistema caso a execu\u00e7\u00e3o ocorra inteiramente na CPU. J\u00e1 para o gpt-oss:120b, a infer\u00eancia via CPU \u00e9 invi\u00e1vel \u2014 espere v\u00e1rios segundos por token, mesmo em sistemas com grande n\u00famero de n\u00facleos. Consulte o <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">guia das melhores GPUs para LLMs locais<\/a> se voc\u00ea estiver montando ou atualizando hardware especificamente para infer\u00eancia de modelos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Installation\"><\/span>Instala\u00e7\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Primeiro, instale a Ollama, caso ainda n\u00e3o o tenha feito. O processo varia conforme a plataforma:<\/p>\n<h3>macOS<\/h3>\n<p>Baixe o aplicativo Ollama para macOS em <code>ollama.com<\/code> e arraste-o para <code>\/Applications<\/code>. O instalador configura automaticamente a CLI da <code>ollama<\/code> . Alternativamente, instale via Homebrew:<\/p>\n<pre><code>brew install ollama<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Execute o script oficial de instala\u00e7\u00e3o, que coloca o bin\u00e1rio em <code>\/usr\/local\/bin\/ollama<\/code> e configura um servi\u00e7o systemd:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Para instala\u00e7\u00e3o manual ou instru\u00e7\u00f5es espec\u00edficas por distribui\u00e7\u00e3o, consulte a <a href=\"https:\/\/convly.ai\/pt\/how-to-install-ollama-2026\/\">Guia de instala\u00e7\u00e3o do Ollama<\/a>.<\/p>\n<h3>Windows<\/h3>\n<p>Baixe o instalador para Windows em <code>ollama.com<\/code> e execute-o. O instalador adiciona a Ollama ao seu PATH e inicia automaticamente o servi\u00e7o em segundo plano. Ap\u00f3s a instala\u00e7\u00e3o, abra o PowerShell ou o Prompt de Comando para verificar:<\/p>\n<pre><code>ollama --version<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_the_Models\"><\/span>Baixando e executando os modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Uma vez instalada a Ollama, baixe o modelo desejado. Para a variante de 20 bilh\u00f5es de par\u00e2metros:<\/p>\n<pre><code>ollama pull gpt-oss:20b<\/code><\/pre>\n<p>Para a variante de 120 bilh\u00f5es de par\u00e2metros:<\/p>\n<pre><code>ollama pull gpt-oss:120b<\/code><\/pre>\n<p>O download transfere os pesos do modelo para <code>~\/.ollama\/models<\/code> no macOS e Linux, ou para <code>%USERPROFILE%\\.ollama\\models<\/code> no Windows. O download \u00e9 retom\u00e1vel, portanto voc\u00ea pode interromp\u00ea-lo e reinici\u00e1-lo sem perder progresso.<\/p>\n<p>Ap\u00f3s baixar o modelo, inicie uma sess\u00e3o interativa:<\/p>\n<pre><code>ollama run gpt-oss:20b<\/code><\/pre>\n<p>Ou, para o modelo maior:<\/p>\n<pre><code>ollama run gpt-oss:120b<\/code><\/pre>\n<p>Isso abre uma interface de chat. Digite seu prompt, pressione Enter e o modelo transmitir\u00e1 sua resposta em tempo real. Digite <code>\/bye<\/code> para sair.<\/p>\n<h3>Acesso \u00e0 API<\/h3>\n<p>O Ollama executa um servidor HTTP local em <code>http:\/\/localhost:11434<\/code>. Voc\u00ea pode enviar solicita\u00e7\u00f5es usando curl, Python ou qualquer cliente HTTP:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"gpt-oss:20b\",\n  \"prompt\": \"Explique a quantiza\u00e7\u00e3o MXFP4 em uma frase.\"\n}'<\/code><\/pre>\n<p>Para aplica\u00e7\u00f5es estruturadas, use o SDK Python ou JavaScript do Ollama. Ambos est\u00e3o dispon\u00edveis por meio dos gerenciadores de pacotes padr\u00e3o (<code>pip install ollama<\/code>, <code>npm install ollama<\/code>) e fornecem interfaces tipadas para gera\u00e7\u00e3o, incorpora\u00e7\u00e3o (embedding) e gerenciamento de modelos.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_and_Model_Comparison\"><\/span>Desempenho e compara\u00e7\u00e3o entre modelos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O modelo de 20 bilh\u00f5es de par\u00e2metros gera de 15 a 30 tokens por segundo em uma RTX 4090, dependendo do comprimento do contexto e da complexidade do prompt. O modelo de 120 bilh\u00f5es de par\u00e2metros gera de 8 a 15 tokens por segundo em uma A100 de 80 GB. Ambas as m\u00e9tricas assumem configura\u00e7\u00f5es padr\u00e3o, sem otimiza\u00e7\u00f5es adicionais, como decodifica\u00e7\u00e3o especulativa.<\/p>\n<p>Em termos de qualidade, o gpt-oss:20b apresenta desempenho compar\u00e1vel ao Llama 3.1 8B e ao Mistral 7B em benchmarks de racioc\u00ednio, como MMLU e GSM8K. Ele supera ambos no seguimento de instru\u00e7\u00f5es em m\u00faltiplas etapas, provavelmente devido ao ajuste por aprendizado por refor\u00e7o com feedback humano (RLHF) realizado pela OpenAI. A variante de 120B aproxima-se da qualidade do GPT-3.5 Turbo, tornando-a o modelo aberto mais forte com menos de 200 bilh\u00f5es de par\u00e2metros at\u00e9 agosto de 2026.<\/p>\n<p>Comparado a modelos propriet\u00e1rios acessados via API, executar o gpt-oss localmente torna-se economicamente vantajoso a partir de aproximadamente 2 milh\u00f5es de tokens por m\u00eas para o modelo de 20B, ou 500 mil tokens por m\u00eas para o modelo de 120B \u2014 desde que voc\u00ea j\u00e1 possua o hardware necess\u00e1rio. Use a <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a> calculadora de ponto de equil\u00edbrio<\/p>\n<h2><span class=\"ez-toc-section\" id=\"MXFP4_Quantisation\"><\/span>Quantiza\u00e7\u00e3o MXFP4<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambos os modelos gpt-oss s\u00e3o distribu\u00eddos com a quantiza\u00e7\u00e3o MXFP4 integrada. MXFP4 \u00e9 um formato de ponto flutuante com microescala que representa os pesos com uma m\u00e9dia de 4,25 bits por par\u00e2metro, reduzindo-os de 16 bits usados na precis\u00e3o de meia precis\u00e3o padr\u00e3o. Diferentemente de esquemas de quantiza\u00e7\u00e3o anteriores, como GPTQ ou AWQ, o MXFP4 preserva maior faixa din\u00e2mica, diminuindo a perda de precis\u00e3o normalmente associada \u00e0 compress\u00e3o agressiva.<\/p>\n<p>Na pr\u00e1tica, modelos quantizados em MXFP4 se comportam quase identicamente \u00e0s suas contrapartes de precis\u00e3o total na maioria das tarefas. A quantiza\u00e7\u00e3o ocorre durante o treinamento, e n\u00e3o posteriormente, permitindo que o modelo se adapte \u00e0 menor precis\u00e3o. Essa abordagem reduz os requisitos de VRAM em cerca de 75% em compara\u00e7\u00e3o ao FP16, tornando vi\u00e1vel executar modelos de 120 bilh\u00f5es de par\u00e2metros em uma \u00fanica GPU voltada ao consumidor.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_Window_and_Memory_Usage\"><\/span>Janela de contexto e uso de mem\u00f3ria<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ambas as variantes do gpt-oss suportam uma janela de contexto de 128K tokens, equivalente a aproximadamente 100.000 palavras em ingl\u00eas. No entanto, utilizar efetivamente toda essa janela de contexto exige mem\u00f3ria adicional significativa al\u00e9m dos pesos-base do modelo.<\/p>\n<p>Para o gpt-oss:20b, uma janela de contexto de 128K acrescenta aproximadamente 8 GB de sobrecarga de mem\u00f3ria. Com 24 GB de VRAM, voc\u00ea pode usar confortavelmente toda a janela. Com 16 GB, recomenda-se limitar o contexto a 32K\u201348K tokens para evitar esgotamento de mem\u00f3ria durante a gera\u00e7\u00e3o.<\/p>\n<p>Para o gpt-oss:120b, uma janela de contexto de 128K acrescenta cerca de 20 GB de sobrecarga. Uma GPU de 80 GB consegue lidar com isso, mas uma implanta\u00e7\u00e3o de 70 GB (duas GPUs voltadas ao consumidor) deve limitar o contexto a 64K tokens. Consulte <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Requisitos de VRAM por modelo<\/a> o gr\u00e1fico detalhado de escalonamento de mem\u00f3ria<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Posso fazer fine-tuning nos modelos gpt-oss?<\/h3>\n<p>Sim. A OpenAI lan\u00e7ou o gpt-oss sob uma licen\u00e7a permissiva que permite o fine-tuning para qualquer finalidade, inclusive aplica\u00e7\u00f5es comerciais. Voc\u00ea pode usar frameworks padr\u00e3o de fine-tuning, como Axolotl ou Hugging Face TRL. Os pesos do modelo s\u00e3o compat\u00edveis com a arquitetura Llama, portanto a maioria das ferramentas desenvolvidas para Llama funciona sem modifica\u00e7\u00f5es.<\/p>\n<h3>Como o gpt-oss:120b se compara ao Llama 3.1 70B?<\/h3>\n<p>O gpt-oss:120b supera o Llama 3.1 70B no seguimento de instru\u00e7\u00f5es e em conversas com m\u00faltiplas etapas, especialmente em tarefas que exigem manter o contexto ao longo de muitas trocas. O Llama 3.1 70B leva ligeira vantagem em benchmarks puramente de racioc\u00ednio, como MATH e DROP. Ambos os modelos t\u00eam desempenho aproximadamente equivalente em tarefas de programa\u00e7\u00e3o. O modelo de 120B exige mais VRAM (70 GB contra 40 GB), mas oferece uma melhoria percept\u00edvel na qualidade das intera\u00e7\u00f5es no estilo assistente.<\/p>\n<h3>Posso executar o gpt-oss:120b em m\u00faltiplas GPUs voltadas ao consumidor?<\/h3>\n<p>Sim. O Ollama divide automaticamente o modelo entre as GPUs dispon\u00edveis caso uma \u00fanica GPU n\u00e3o tenha mem\u00f3ria suficiente. Duas RTX 4090s (48 GB combinados de VRAM) conseguem executar o gpt-oss:120b, embora a velocidade de infer\u00eancia caia 20\u201330% em compara\u00e7\u00e3o com uma \u00fanica GPU de 80 GB devido \u00e0 sobrecarga de comunica\u00e7\u00e3o entre GPUs. Tr\u00eas ou mais GPUs trazem retornos decrescentes; se seu or\u00e7amento permitir, uma \u00fanica A100 ou H100 \u00e9 mais custo-efetiva.<\/p>\n<h3>O gpt-oss funciona offline?<\/h3>\n<p>Sim, assim que voc\u00ea baixar o modelo com <code>ollama pull<\/code>ollama pull gpt-oss:20b (ou gpt-oss:120b). <code>OLLAMA_SKIP_UPGRADE=1<\/code> em seu ambiente.<\/p>\n<h3>Qual licen\u00e7a se aplica \u00e0s sa\u00eddas geradas pelo gpt-oss?<\/h3>\n<p>A licen\u00e7a gpt-oss da OpenAI n\u00e3o reivindica propriedade sobre as sa\u00eddas geradas. Voc\u00ea det\u00e9m os direitos sobre as sa\u00eddas que produzir e pode utiliz\u00e1-las para qualquer finalidade, inclusive produtos e servi\u00e7os comerciais. Isso difere dos termos de servi\u00e7o da API da OpenAI, que restringem certos casos de uso. Revise sempre o texto completo da licen\u00e7a inclu\u00eddo no download do modelo para confirmar os termos mais recentes.<\/p>\n<h3>Posso usar os modelos gpt-oss comercialmente?<\/h3>\n<p>Sim. A licen\u00e7a permite o uso comercial sem restri\u00e7\u00f5es, incluindo a incorpora\u00e7\u00e3o do modelo em produtos propriet\u00e1rios, sua oferta como servi\u00e7o ou seu uso para gerar conte\u00fado destinado \u00e0 venda. Voc\u00ea n\u00e3o \u00e9 obrigado a disponibilizar como c\u00f3digo aberto trabalhos derivados nem a divulgar que utilizou o gpt-oss em seu produto, embora a atribui\u00e7\u00e3o seja incentivada.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DRgpt-oss:20b runs in ~16GB memory (fits most gaming GPUs), gpt-oss:120b needs ~70GB (single 80GB GPU or split across consumer cards)Install with ollama pull gpt-oss:20b or ollama pull gpt-oss:120b, then run with ollama run gpt-oss:20bBoth variants use MXFP4 quantisation at 4.25 bits per parameter and support 128K context windowsReleased by OpenAI as open-weight models in partnership with Ollama, comparable to Llama 3.1 and Qwen 2.5 in quality OpenAI released gpt-oss as open-weight models in August 2025, distributed exclusively through Ollama.<\/p>","protected":false},"author":1,"featured_media":2236,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[9],"tags":[],"class_list":["post-2235","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tutorials"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2235","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2235"}],"version-history":[{"count":2,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2235\/revisions"}],"predecessor-version":[{"id":2278,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2235\/revisions\/2278"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2236"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2235"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2235"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2235"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}