{"id":2199,"date":"2026-08-14T06:18:40","date_gmt":"2026-08-14T06:18:40","guid":{"rendered":"https:\/\/convly.ai\/?p=2199"},"modified":"2026-08-14T06:18:40","modified_gmt":"2026-08-14T06:18:40","slug":"ollama-gpt-oss-guide","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/","title":{"rendered":"Ollama GPT OSS: Executando LLMs de c\u00f3digo aberto localmente (Guia)"},"content":{"rendered":"<div class=\"convly-tldr\"><strong>Resumo<\/strong><\/p>\n<ul>\n<li>A OpenAI n\u00e3o lan\u00e7ou uma fam\u00edlia de modelos chamada \"GPT-OSS\". O termo de pesquisa provavelmente se refere \u00e0 execu\u00e7\u00e3o de alternativas de c\u00f3digo aberto (Llama 3, Mistral, Qwen) por meio do Ollama.<\/li>\n<li>O Ollama executa centenas de modelos de pesos abertos localmente. Op\u00e7\u00f5es populares: <code>ollama pull llama3.1:8b<\/code>, <code>ollama pull mistral:7b<\/code>, <code>ollama pull qwen2.5:7b<\/code>.<\/li>\n<li>Requisitos de VRAM: modelos de 7B exigem 6\u20138 GB (quantiza\u00e7\u00e3o Q4), modelos de 13B exigem 10\u201314 GB e modelos de 70B exigem 40\u201348 GB. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar.<\/li>\n<li>Modelos quantizados (Q4, Q5) cabem em GPUs voltadas para consumidores com perda m\u00ednima de qualidade. O formato FP16 oferece a melhor qualidade, mas duplica o uso de VRAM.<\/li>\n<\/ul>\n<\/div>\n<p>Se voc\u00ea pesquisou por \"ollama gpt oss\", provavelmente deseja executar modelos de linguagem de grande porte de c\u00f3digo aberto localmente usando o Ollama \u2014 por\u00e9m a OpenAI n\u00e3o lan\u00e7ou nenhuma fam\u00edlia de modelos de pesos abertos chamada \"GPT-OSS\". A OpenAI lan\u00e7ou o GPT-2 em 2019 como modelo de pesos abertos, mas seus modelos mais recentes (GPT-4, GPT-4o, GPT-4.1) continuam sendo produtos propriet\u00e1rios acess\u00edveis apenas por meio de API. O que <em>n\u00e3o<\/em> existe s\u00e3o centenas de modelos de pesos abertos da Meta (Llama), Mistral AI, Alibaba (Qwen) e outros, que voc\u00ea pode baixar e executar localmente via Ollama em seu pr\u00f3prio hardware. Este guia aborda quais modelos funcionam, os requisitos de VRAM para cada tamanho, como a quantiza\u00e7\u00e3o afeta a qualidade e como eles se comparam entre si.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a7ee9f27841a\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a7ee9f27841a\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#What_Ollama_Actually_Runs\" >O que o Ollama realmente executa<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Open-Source_Model_Families_Available_in_Ollama\" >Fam\u00edlias de modelos de c\u00f3digo aberto dispon\u00edveis no Ollama<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Pulling_and_Running_a_Model\" >Baixando e executando um modelo<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Parameter_Sizes_and_VRAM_Requirements\" >Tamanhos de par\u00e2metros e requisitos de VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Quantization_Quality_vs_VRAM_Trade-Off\" >Quantiza\u00e7\u00e3o: equil\u00edbrio entre qualidade e VRAM<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Performance_Comparison_7B_Class\" >Compara\u00e7\u00e3o de desempenho: classe de 7B<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Which_Model_to_Pick\" >Qual modelo escolher<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#When_to_Self-Host_vs_Use_an_API\" >Quando hospedar localmente versus usar uma API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Platform-Specific_Notes\" >Observa\u00e7\u00f5es espec\u00edficas por plataforma<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/pt\/ollama-gpt-oss-guide\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Actually_Runs\"><\/span>O que o Ollama realmente executa<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O Ollama \u00e9 um mecanismo de infer\u00eancia local que baixa, quantiza e executa modelos de linguagem de grande porte (LLMs) de pesos abertos no macOS, Linux e Windows. Ele n\u00e3o hospeda modelos da OpenAI. O <a href=\"https:\/\/convly.ai\/pt\/ollama-models-list-2026\/\">Lista de modelos do Ollama<\/a> includes Llama 3.1, Mistral 7B, Qwen 2.5, Gemma 2, Phi-3, and dozens more. Each model is available in multiple quantization levels (Q4_K_M, Q5_K_M, FP16) to trade VRAM for quality.<\/p>\n<p>Etapas completas de instala\u00e7\u00e3o: <a href=\"https:\/\/convly.ai\/pt\/how-to-install-ollama-2026\/\">como instalar o Ollama<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Open-Source_Model_Families_Available_in_Ollama\"><\/span>Fam\u00edlias de modelos de c\u00f3digo aberto dispon\u00edveis no Ollama<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<table>\n<thead>\n<tr>\n<th>Fam\u00edlia de modelos<\/th>\n<th>Desenvolvedor<\/th>\n<th>Tamanhos de par\u00e2metros<\/th>\n<th>Licen\u00e7a<\/th>\n<th>Destaque<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1<\/td>\n<td>Meta<\/td>\n<td>8B, 70B, 405B<\/td>\n<td>Llama 3.1 (licen\u00e7a comercialmente amig\u00e1vel)<\/td>\n<td>Melhor racioc\u00ednio geral em cada faixa de tamanho<\/td>\n<\/tr>\n<tr>\n<td>Mistral<\/td>\n<td>Mistral AI<\/td>\n<td>7B, 22B (Mixtral 8x7B)<\/td>\n<td>Apache 2.0<\/td>\n<td>R\u00e1pido, eficiente e excelente em programa\u00e7\u00e3o<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5<\/td>\n<td>Alibaba<\/td>\n<td>0,5B, 1,5B, 3B, 7B, 14B, 32B, 72B<\/td>\n<td>Apache 2.0<\/td>\n<td>Multil\u00edngue, com suporte a contextos longos (128k)<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2<\/td>\n<td>Google<\/td>\n<td>2B, 9B, 27B<\/td>\n<td>Gemma (licen\u00e7a comercialmente amig\u00e1vel)<\/td>\n<td>Pequeno, r\u00e1pido e capaz de rodar na CPU<\/td>\n<\/tr>\n<tr>\n<td>Phi-3.5<\/td>\n<td>Microsoft<\/td>\n<td>3,8B (mini), 14B (medium)<\/td>\n<td>MIT<\/td>\n<td>Compacto e com bom desempenho em benchmarks de racioc\u00ednio<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>O <a href=\"https:\/\/convly.ai\/pt\/models\/\">Banco de dados de modelos de IA<\/a> lista especifica\u00e7\u00f5es, requisitos de VRAM e pre\u00e7os para 37 modelos, incluindo todos os citados acima.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Pulling_and_Running_a_Model\"><\/span>Baixando e executando um modelo<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ap\u00f3s instalar o Ollama, baixe um modelo com o comando <code>ollama pull &lt;modelo&gt;:&lt;tag&gt;<\/code>. A tag especifica a contagem de par\u00e2metros e o n\u00edvel de quantiza\u00e7\u00e3o. Exemplos:<\/p>\n<pre><code>ollama pull llama3.1:8b\nollama pull mistral:7b-instruct-q4_K_M\nollama pull qwen2.5:7b\nollama pull gemma2:9b<\/code><\/pre>\n<p>Execute o modelo:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<p>Isso abre uma sess\u00e3o interativa de bate-papo. Digite seu prompt, pressione Enter e o modelo gerar\u00e1 uma resposta localmente. Para sair, digite <code>\/bye<\/code>.<\/p>\n<p>Para usar o modelo programaticamente por meio da API:<\/p>\n<pre><code>curl http:\/\/localhost:11434\/api\/generate -d '{\n  \"model\": \"llama3.1:8b\",\n  \"prompt\": \"Explique recurs\u00e3o em uma frase.\"\n}'<\/code><\/pre>\n<p>O Ollama exp\u00f5e um endpoint compat\u00edvel com a API da OpenAI, <code>\/v1\/chat\/completions<\/code> de modo que voc\u00ea pode apontar seu c\u00f3digo existente com SDK da OpenAI para <code>http:\/\/localhost:11434<\/code> e substituir facilmente por um modelo local.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Parameter_Sizes_and_VRAM_Requirements\"><\/span>Tamanhos de par\u00e2metros e requisitos de VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O tamanho do modelo (7B, 13B, 70B) determina sua qualidade e consumo de VRAM. Modelos maiores apresentam melhor capacidade de racioc\u00ednio, mas exigem mais mem\u00f3ria de GPU. A quantiza\u00e7\u00e3o (Q4, Q5, FP16) comprime os pesos para reduzir o uso de VRAM com um pequeno custo em qualidade.<\/p>\n<table>\n<thead>\n<tr>\n<th>Contagem de par\u00e2metros<\/th>\n<th>Quantiza\u00e7\u00e3o<\/th>\n<th>VRAM (aproximada)<\/th>\n<th>Modelos de Exemplo<\/th>\n<th>Recomenda\u00e7\u00e3o de GPU<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>7B<\/td>\n<td>Q4_K_M<\/td>\n<td>4,5 GB<\/td>\n<td>Llama 3.1 8B, Mistral 7B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>Q5_K_M<\/td>\n<td>5,5 GB<\/td>\n<td>Igual ao acima<\/td>\n<td>Igual<\/td>\n<\/tr>\n<tr>\n<td>7B<\/td>\n<td>FP16<\/td>\n<td>14 GB<\/td>\n<td>Igual ao acima<\/td>\n<td>RTX 4060 Ti (16 GB), RTX 4070<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>Q4_K_M<\/td>\n<td>8 GB<\/td>\n<td>Qwen 2.5 14B, Phi-3.5 14B<\/td>\n<td>RTX 3060 (12 GB), RTX 4060 Ti (16 GB)<\/td>\n<\/tr>\n<tr>\n<td>13B<\/td>\n<td>FP16<\/td>\n<td>26 GB<\/td>\n<td>Igual<\/td>\n<td>RTX 4090 (24 GB) ou A5000 (24 GB)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>Q4_K_M<\/td>\n<td>40 GB<\/td>\n<td>Llama 3.1 70B, Qwen 2.5 72B<\/td>\n<td>A100 (40\/80 GB), duas RTX 3090 (48 GB no total)<\/td>\n<\/tr>\n<tr>\n<td>70B<\/td>\n<td>FP16<\/td>\n<td>140 GB<\/td>\n<td>Igual<\/td>\n<td>Configura\u00e7\u00e3o multi-GPU ou A100 de 80 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Use a <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar as necessidades de mem\u00f3ria de qualquer modelo e n\u00edvel de quantiza\u00e7\u00e3o. O <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Guia de requisitos de VRAM<\/a> lista valores precisos para todos os principais modelos.<\/p>\n<p>Para decis\u00f5es de compra de GPU, consulte <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">melhores GPUs para executar LLMs localmente<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Quantization_Quality_vs_VRAM_Trade-Off\"><\/span>Quantiza\u00e7\u00e3o: equil\u00edbrio entre qualidade e VRAM<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A quantiza\u00e7\u00e3o reduz a precis\u00e3o dos pesos do modelo de n\u00fameros de ponto flutuante de 16 bits (FP16) para inteiros de 4 ou 5 bits (Q4, Q5). Isso reduz a VRAM em 60\u201375%, com perda m\u00ednima de qualidade na maioria das tarefas.<\/p>\n<ul>\n<li><strong>Q4_K_M<\/strong>: Quantiza\u00e7\u00e3o de 4 bits. Menor consumo de VRAM, ligeira queda de qualidade em racioc\u00ednio complexo. Ideal para chatbots, resumos e conclus\u00e3o de c\u00f3digo.<\/li>\n<li><strong>Q5_K_M<\/strong>: Quantiza\u00e7\u00e3o de 5 bits. Cerca de 20% mais VRAM que Q4, qualidade mais pr\u00f3xima da FP16. Melhor equil\u00edbrio para a maioria dos usu\u00e1rios.<\/li>\n<li><strong>Q8_0<\/strong>: Quantiza\u00e7\u00e3o de 8 bits. Qualidade quase equivalente \u00e0 FP16, com redu\u00e7\u00e3o de 50% na VRAM. Use se houver margem suficiente de VRAM dispon\u00edvel.<\/li>\n<li><strong>FP16<\/strong>: Precis\u00e3o total. Melhor qualidade, mas consome o dobro da VRAM de Q4. Necess\u00e1rio apenas para pesquisa ou quando degrada\u00e7\u00f5es de qualidade forem inaceit\u00e1veis.<\/li>\n<\/ul>\n<p>Example: Llama 3.1 8B at Q4_K_M uses 4.5 GB and scores 67.2 on MMLU. At FP16 it uses 14 GB and scores 68.1 on MMLU. For most tasks the 0.9-point difference is imperceptible.<\/p>\n<p>Para baixar uma quantiza\u00e7\u00e3o espec\u00edfica:<\/p>\n<pre><code>ollama pull llama3.1:8b-instruct-q4_K_M\nollama pull llama3.1:8b-instruct-fp16<\/code><\/pre>\n<p>Se voc\u00ea omitir a tag de quantiza\u00e7\u00e3o, o Ollama usa Q4_K_M como padr\u00e3o.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Comparison_7B_Class\"><\/span>Compara\u00e7\u00e3o de desempenho: classe de 7B<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A classe de tamanho 7B\u20138B \u00e9 a mais popular para uso local. Ela cabe em GPUs voltadas para consumidores e oferece excelentes resultados em programa\u00e7\u00e3o, racioc\u00ednio e conversa\u00e7\u00e3o.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>MMLU (sem exemplos)<\/th>\n<th>HumanEval (pass@1)<\/th>\n<th>Comprimento do contexto<\/th>\n<th>VRAM (Q4)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.1 8B<\/td>\n<td>67.2<\/td>\n<td>62.2<\/td>\n<td>128k<\/td>\n<td>4,5 GB<\/td>\n<\/tr>\n<tr>\n<td>Mistral 7B v0.3<\/td>\n<td>62.5<\/td>\n<td>40.2<\/td>\n<td>32k<\/td>\n<td>4,1 GB<\/td>\n<\/tr>\n<tr>\n<td>Qwen 2.5 7B<\/td>\n<td>70.3<\/td>\n<td>61.6<\/td>\n<td>128k<\/td>\n<td>4,3 GB<\/td>\n<\/tr>\n<tr>\n<td>Gemma 2 9B<\/td>\n<td>71.3<\/td>\n<td>61.0<\/td>\n<td>8k<\/td>\n<td>5,2 GB<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Qwen 2.5 7B e Gemma 2 9B lideram no MMLU (conhecimento geral). Llama 3.1 8B lidera no HumanEval (programa\u00e7\u00e3o). Mistral 7B \u00e9 o mais r\u00e1pido e possui a licen\u00e7a mais permissiva (Apache 2.0). O <a href=\"https:\/\/convly.ai\/pt\/llm-leaderboard\/\">Ranking de LLMs<\/a> classifica todos os modelos por intelig\u00eancia, custo e comprimento de contexto.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_Model_to_Pick\"><\/span>Qual modelo escolher<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><strong>Melhor qualidade geral (classe 7B)<\/strong>: <code>ollama pull qwen2.5:7b<\/code> ou <code>ollama pull llama3.1:8b<\/code><\/li>\n<li><strong>Melhor para programa\u00e7\u00e3o<\/strong>: <code>ollama pull llama3.1:8b<\/code> ou <code>ollama pull qwen2.5-coder:7b<\/code><\/li>\n<li><strong>Infer\u00eancia mais r\u00e1pida<\/strong>: <code>ollama pull mistral:7b<\/code> ou <code>ollama pull gemma2:2b<\/code> (para CPU\/baixa VRAM)<\/li>\n<li><strong>Multil\u00edngue<\/strong>: <code>ollama pull qwen2.5:7b<\/code> (suporta 29 idiomas)<\/li>\n<li><strong>Documentos longos (contexto de 128k ou mais)<\/strong>: <code>ollama pull llama3.1:8b<\/code> ou <code>ollama pull qwen2.5:7b<\/code><\/li>\n<li><strong>Racioc\u00ednio mais forte (se voc\u00ea tiver 40+ GB de VRAM)<\/strong>: <code>ollama pull llama3.1:70b<\/code> ou <code>ollama pull qwen2.5:72b<\/code><\/li>\n<\/ul>\n<p>O <a href=\"https:\/\/convly.ai\/pt\/best-local-llms-to-run-on-ollama-2026\/\">melhores LLMs locais para Ollama<\/a> guia compara todos os modelos e recomenda tags espec\u00edficas conforme o caso de uso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"When_to_Self-Host_vs_Use_an_API\"><\/span>Quando hospedar localmente versus usar uma API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Executar o Ollama localmente faz sentido se:<\/p>\n<ul>\n<li>Voc\u00ea j\u00e1 possui uma GPU com 12+ GB de VRAM (RTX 3060, 4060 Ti ou superior)<\/li>\n<li>Voc\u00ea processa dados sens\u00edveis que n\u00e3o podem sair de sua rede<\/li>\n<li>Voc\u00ea gera mais de 5 milh\u00f5es de tokens por m\u00eas (os custos da API superam o custo total de propriedade \u2014 TCO \u2014 do autohospedagem)<\/li>\n<li>Voc\u00ea precisa de tempo de atividade garantido e sem limites de taxa<\/li>\n<\/ul>\n<p>Use uma API hospedada (OpenAI, Anthropic, Groq) se:<\/p>\n<ul>\n<li>Voc\u00ea gera menos de 1 milh\u00e3o de tokens por m\u00eas (a amortiza\u00e7\u00e3o da GPU para hospedagem pr\u00f3pria leva anos)<\/li>\n<li>Voc\u00ea precisa da qualidade absolutamente mais alta (Claude 3.5 Sonnet e GPT-4o superam todos os modelos abertos)<\/li>\n<li>Voc\u00ea n\u00e3o quer gerenciar infraestrutura de infer\u00eancia<\/li>\n<\/ul>\n<p>O <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a> estima o ponto de equil\u00edbrio com base no seu volume de tokens, custo da GPU e tarifa de eletricidade. O <a href=\"https:\/\/convly.ai\/pt\/ai-api-cost-calculator\/\">Calculadora de custos de API<\/a> projeta o gasto mensal por modelo.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Platform-Specific_Notes\"><\/span>Observa\u00e7\u00f5es espec\u00edficas por plataforma<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>macOS<\/h3>\n<p>Ollama usa Metal para acelera\u00e7\u00e3o por GPU em Macs com chips M1\/M2\/M3. A mem\u00f3ria unificada significa que VRAM = RAM do sistema. Um M2 Max com 64 GB consegue executar o Llama 3.1 70B em Q4 (40 GB) com espa\u00e7o suficiente para o sistema operacional. Instale via Homebrew:<\/p>\n<pre><code>brew install ollama<\/code><\/pre>\n<p>Inicie o servi\u00e7o:<\/p>\n<pre><code>ollama serve<\/code><\/pre>\n<h3>Linux<\/h3>\n<p>Ollama exige GPUs NVIDIA com CUDA 11.8+ ou GPUs AMD com ROCm 5.7+. Instale com:<\/p>\n<pre><code>curl -fsSL https:\/\/ollama.com\/install.sh | sh<\/code><\/pre>\n<p>Isso instala o bin\u00e1rio em <code>\/usr\/local\/bin\/ollama<\/code> e cria um servi\u00e7o systemd. Inicie-o com:<\/p>\n<pre><code>sudo systemctl start ollama<\/code><\/pre>\n<p>Os modelos s\u00e3o baixados para <code>~\/.ollama\/models<\/code>. Para alterar esse local, defina <code>OLLAMA_MODELS=\/caminho\/para\/modelos<\/code> no arquivo <code>\/etc\/systemd\/system\/ollama.service<\/code>.<\/p>\n<h3>Windows<\/h3>\n<p>Ollama para Windows exige GPUs NVIDIA com CUDA 11.8+ e driver 520+. Baixe o instalador em <code>ollama.com<\/code> e execute-o. O servi\u00e7o inicia automaticamente. Os modelos s\u00e3o baixados para <code>C:\\Users\\\\.ollama\\models<\/code>.<\/p>\n<p>Para executar pelo PowerShell:<\/p>\n<pre><code>ollama run llama3.1:8b<\/code><\/pre>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>A OpenAI oferece um modelo de c\u00f3digo aberto que posso executar no Ollama?<\/h3>\n<p>N\u00e3o. A OpenAI lan\u00e7ou o GPT-2 (2019) como modelo de pesos abertos, mas todos os modelos recentes (GPT-3.5, GPT-4, GPT-4o, o1) s\u00e3o propriet\u00e1rios e acess\u00edveis apenas por meio de API. Se voc\u00ea deseja racioc\u00ednio de qualidade equivalente \u00e0 OpenAI localmente, experimente o Llama 3.1 70B ou o Qwen 2.5 72B \u2014 ambos superam o GPT-3.5 na maioria dos benchmarks e rodam no Ollama com 40 GB de VRAM em quantiza\u00e7\u00e3o Q4.<\/p>\n<h3>Posso executar o Ollama em uma CPU sem GPU?<\/h3>\n<p>Sim, mas a infer\u00eancia ser\u00e1 10 a 50 vezes mais lenta. Modelos pequenos (Gemma 2 2B, Qwen 2.5 0,5B, Phi-3.5 mini 3,8B) s\u00e3o utiliz\u00e1veis em CPUs modernas (16+ threads). Modelos maiores (7B+) gerar\u00e3o 1 a 3 tokens por segundo em CPU, o que \u00e9 muito lento para uso interativo. Caso voc\u00ea n\u00e3o tenha uma GPU, considere usar uma API hospedada \u2014 consulte o <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a>.<\/p>\n<h3>Quanto custa executar o Ollama comparado \u00e0 API da OpenAI?<\/h3>\n<p>A OpenAI cobra US$ 0,15 por milh\u00e3o de tokens de entrada e US$ 0,60 por milh\u00e3o de tokens de sa\u00edda para o GPT-4o mini. Uma GPU de 12 GB (RTX 4060 Ti, US$ 400) executando o Llama 3.1 8B consome cerca de US$ 0,05\/hora em eletricidade (tarifa de US$ 0,12\/kWh, consumo do sistema de 400 W). O ponto de equil\u00edbrio ocorre em torno de 3 a 5 milh\u00f5es de tokens\/m\u00eas. A <a href=\"https:\/\/convly.ai\/pt\/ai-api-cost-calculator\/\">Calculadora de custos de API<\/a> e <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de hospedagem pr\u00f3pria<\/a> mostra o Custo Total de Propriedade (TCO) exato para o seu caso de uso.<\/p>\n<h3>Qual \u00e9 a diferen\u00e7a entre Q4_K_M, Q5_K_M e FP16?<\/h3>\n<p>Q4_K_M usa quantiza\u00e7\u00e3o de 4 bits (menor uso de VRAM, leve perda de qualidade). Q5_K_M usa quantiza\u00e7\u00e3o de 5 bits (20% mais VRAM, qualidade mais pr\u00f3xima da original). FP16 \u00e9 precis\u00e3o total de 16 bits (melhor qualidade, mas o dobro de VRAM em compara\u00e7\u00e3o com Q4). Para a maioria das tarefas, Q5_K_M representa o melhor equil\u00edbrio. Use FP16 apenas se tiver VRAM ociosa e precisar dos \u00faltimos 1\u20132% de qualidade para pesquisa ou produ\u00e7\u00e3o.<\/p>\n<h3>Posso fazer fine-tuning de modelos no Ollama?<\/h3>\n<p>N\u00e3o. Ollama \u00e9 um mecanismo de infer\u00eancia, n\u00e3o um framework de treinamento. Para fazer fine-tuning em um modelo aberto, use Hugging Face Transformers com PEFT\/LoRA, Axolotl ou LLaMA Factory. Exporte os pesos ajustados para o formato GGUF e importe-os no Ollama com o comando <code>ollama create<\/code>. O bloco <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">Guia completo do Ollama<\/a> aborda esse fluxo de trabalho.<\/p>\n<h3>Qual GPU devo comprar para executar modelos de 7B localmente?<\/h3>\n<p>Para quantiza\u00e7\u00e3o Q4 (4,5 GB de VRAM): RTX 3060 12 GB (US$ 250 usado) ou RTX 4060 Ti 16 GB (US$ 450 novo). Para FP16 (14 GB de VRAM): RTX 4060 Ti 16 GB ou RTX 4070 (US$ 550\u2013600). Para modelos de 70B em Q4 (40 GB): duas RTX 3090 24 GB (US$ 1800 usado) ou A100 40 GB (US$ 6000+ usado). O <a href=\"https:\/\/convly.ai\/pt\/best-gpus-for-local-llms-2026\/\">guia das melhores GPUs<\/a> apresenta benchmarks de rela\u00e7\u00e3o custo-desempenho para todas as classes de tamanho.<\/p>","protected":false},"excerpt":{"rendered":"<p>TL;DR OpenAI has not released a model family called &#8220;GPT-OSS&#8221;. The search term likely refers to running open-source alternatives (Llama [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2200,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2199","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2199","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2199"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2199\/revisions"}],"predecessor-version":[{"id":2201,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2199\/revisions\/2201"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2200"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2199"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2199"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2199"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}