Friday, 14 August 2026 | Updating Daily AI insight, written for builders

Ollama GPT OSS: Executando LLMs de código aberto localmente (Guia)

Resumo

  • A OpenAI não lançou uma família de modelos chamada "GPT-OSS". O termo de pesquisa provavelmente se refere à execução de alternativas de código aberto (Llama 3, Mistral, Qwen) por meio do Ollama.
  • O Ollama executa centenas de modelos de pesos abertos localmente. Opções populares: ollama pull llama3.1:8b, ollama pull mistral:7b, ollama pull qwen2.5:7b.
  • Requisitos de VRAM: modelos de 7B exigem 6–8 GB (quantização Q4), modelos de 13B exigem 10–14 GB e modelos de 70B exigem 40–48 GB. Use o Calculadora de VRAM para estimar.
  • Modelos quantizados (Q4, Q5) cabem em GPUs voltadas para consumidores com perda mínima de qualidade. O formato FP16 oferece a melhor qualidade, mas duplica o uso de VRAM.

Se você pesquisou por "ollama gpt oss", provavelmente deseja executar modelos de linguagem de grande porte de código aberto localmente usando o Ollama — porém a OpenAI não lançou nenhuma família de modelos de pesos abertos chamada "GPT-OSS". A OpenAI lançou o GPT-2 em 2019 como modelo de pesos abertos, mas seus modelos mais recentes (GPT-4, GPT-4o, GPT-4.1) continuam sendo produtos proprietários acessíveis apenas por meio de API. O que não existe são centenas de modelos de pesos abertos da Meta (Llama), Mistral AI, Alibaba (Qwen) e outros, que você pode baixar e executar localmente via Ollama em seu próprio hardware. Este guia aborda quais modelos funcionam, os requisitos de VRAM para cada tamanho, como a quantização afeta a qualidade e como eles se comparam entre si.

O que o Ollama realmente executa

O Ollama é um mecanismo de inferência local que baixa, quantiza e executa modelos de linguagem de grande porte (LLMs) de pesos abertos no macOS, Linux e Windows. Ele não hospeda modelos da OpenAI. O Lista de modelos do Ollama inclui o Llama 3.1, Mistral 7B, o Qwen 2.5, o Gemma 2, o Phi-3 e dezenas de outros. Cada modelo está disponível em diversos níveis de quantização (Q4_K_M, Q5_K_M, FP16) para equilibrar uso de VRAM e qualidade.

Etapas completas de instalação: como instalar o Ollama.

Famílias de modelos de código aberto disponíveis no Ollama

Família de modelosDesenvolvedorTamanhos de parâmetrosLicençaDestaque
Llama 3.1Meta8B, 70B, 405BLlama 3.1 (licença comercialmente amigável)Melhor raciocínio geral em cada faixa de tamanho
MistralMistral AI7B, 22B (Mixtral 8x7B)Apache 2.0Rápido, eficiente e excelente em programação
Qwen 2.5Alibaba0,5B, 1,5B, 3B, 7B, 14B, 32B, 72BApache 2.0Multilíngue, com suporte a contextos longos (128k)
Gemma 2Google2B, 9B, 27BGemma (licença comercialmente amigável)Pequeno, rápido e capaz de rodar na CPU
Phi-3.5Microsoft3,8B (mini), 14B (medium)MITCompacto e com bom desempenho em benchmarks de raciocínio

O Banco de dados de modelos de IA lista especificações, requisitos de VRAM e preços para 37 modelos, incluindo todos os citados acima.

Baixando e executando um modelo

Após instalar o Ollama, baixe um modelo com o comando ollama pull <modelo>:<tag>. A tag especifica a contagem de parâmetros e o nível de quantização. Exemplos:

ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9b

Execute o modelo:

ollama run llama3.1:8b

Isso abre uma sessão interativa de bate-papo. Digite seu prompt, pressione Enter e o modelo gerará uma resposta localmente. Para sair, digite /bye.

Para usar o modelo programaticamente por meio da API:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Explique recursão em uma frase."
}'

O Ollama expõe um endpoint compatível com a API da OpenAI, /v1/chat/completions de modo que você pode apontar seu código existente com SDK da OpenAI para http://localhost:11434 e substituir facilmente por um modelo local.

Tamanhos de parâmetros e requisitos de VRAM

O tamanho do modelo (7B, 13B, 70B) determina sua qualidade e consumo de VRAM. Modelos maiores apresentam melhor capacidade de raciocínio, mas exigem mais memória de GPU. A quantização (Q4, Q5, FP16) comprime os pesos para reduzir o uso de VRAM com um pequeno custo em qualidade.

Contagem de parâmetrosQuantizaçãoVRAM (aproximada)Modelos de ExemploRecomendação de GPU
7BQ4_K_M4,5 GBLlama 3.1 8B, Mistral 7BRTX 3060 (12 GB), RTX 4060 Ti (16 GB)
7BQ5_K_M5,5 GBIgual ao acimaIgual
7BFP1614 GBIgual ao acimaRTX 4060 Ti (16 GB), RTX 4070
13BQ4_K_M8 GBQwen 2.5 14B, Phi-3.5 14BRTX 3060 (12 GB), RTX 4060 Ti (16 GB)
13BFP1626 GBIgualRTX 4090 (24 GB) ou A5000 (24 GB)
70BQ4_K_M40 GBLlama 3.1 70B, Qwen 2.5 72BA100 (40/80 GB), duas RTX 3090 (48 GB no total)
70BFP16140 GBIgualConfiguração multi-GPU ou A100 de 80 GB

Use a Calculadora de VRAM para estimar as necessidades de memória de qualquer modelo e nível de quantização. O Guia de requisitos de VRAM lista valores precisos para todos os principais modelos.

Para decisões de compra de GPU, consulte melhores GPUs para executar LLMs localmente.

Quantização: equilíbrio entre qualidade e VRAM

A quantização reduz a precisão dos pesos do modelo de números de ponto flutuante de 16 bits (FP16) para inteiros de 4 ou 5 bits (Q4, Q5). Isso reduz a VRAM em 60–75%, com perda mínima de qualidade na maioria das tarefas.

  • Q4_K_M: Quantização de 4 bits. Menor consumo de VRAM, ligeira queda de qualidade em raciocínio complexo. Ideal para chatbots, resumos e conclusão de código.
  • Q5_K_M: Quantização de 5 bits. Cerca de 20% mais VRAM que Q4, qualidade mais próxima da FP16. Melhor equilíbrio para a maioria dos usuários.
  • Q8_0: Quantização de 8 bits. Qualidade quase equivalente à FP16, com redução de 50% na VRAM. Use se houver margem suficiente de VRAM disponível.
  • FP16: Precisão total. Melhor qualidade, mas consome o dobro da VRAM de Q4. Necessário apenas para pesquisa ou quando degradações de qualidade forem inaceitáveis.

Exemplo: Llama 3.1 8B o modelo Llama 3.1 8B em Q4_K_M usa 4,5 GB de VRAM e obtém 67,2 pontos no MMLU. Em FP16, usa 14 GB e alcança 68,1 pontos no MMLU. Para a maioria das tarefas, essa diferença de 0,9 ponto é imperceptível.

Para baixar uma quantização específica:

ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16

Se você omitir a tag de quantização, o Ollama usa Q4_K_M como padrão.

Comparação de desempenho: classe de 7B

A classe de tamanho 7B–8B é a mais popular para uso local. Ela cabe em GPUs voltadas para consumidores e oferece excelentes resultados em programação, raciocínio e conversação.

ModeloMMLU (sem exemplos)HumanEval (pass@1)Comprimento do contextoVRAM (Q4)
Llama 3.1 8B67.262.2128k4,5 GB
Mistral 7B v0.362.540.232k4,1 GB
Qwen 2.5 7B70.361.6128k4,3 GB
Gemma 2 9B71.361.08k5,2 GB

Qwen 2.5 7B e Gemma 2 9B lideram no MMLU (conhecimento geral). Llama 3.1 8B lidera no HumanEval (programação). Mistral 7B é o mais rápido e possui a licença mais permissiva (Apache 2.0). O Ranking de LLMs classifica todos os modelos por inteligência, custo e comprimento de contexto.

Qual modelo escolher

  • Melhor qualidade geral (classe 7B): ollama pull qwen2.5:7b ou ollama pull llama3.1:8b
  • Melhor para programação: ollama pull llama3.1:8b ou ollama pull qwen2.5-coder:7b
  • Inferência mais rápida: ollama pull mistral:7b ou ollama pull gemma2:2b (para CPU/baixa VRAM)
  • Multilíngue: ollama pull qwen2.5:7b (suporta 29 idiomas)
  • Documentos longos (contexto de 128k ou mais): ollama pull llama3.1:8b ou ollama pull qwen2.5:7b
  • Raciocínio mais forte (se você tiver 40+ GB de VRAM): ollama pull llama3.1:70b ou ollama pull qwen2.5:72b

O melhores LLMs locais para Ollama guia compara todos os modelos e recomenda tags específicas conforme o caso de uso.

Quando hospedar localmente versus usar uma API

Executar o Ollama localmente faz sentido se:

  • Você já possui uma GPU com 12+ GB de VRAM (RTX 3060, 4060 Ti ou superior)
  • Você processa dados sensíveis que não podem sair de sua rede
  • Você gera mais de 5 milhões de tokens por mês (os custos da API superam o custo total de propriedade — TCO — do autohospedagem)
  • Você precisa de tempo de atividade garantido e sem limites de taxa

Use uma API hospedada (OpenAI, Anthropic, Groq) se:

  • Você gera menos de 1 milhão de tokens por mês (a amortização da GPU para hospedagem própria leva anos)
  • Você precisa da qualidade absolutamente mais alta (Claude 3.5 Sonnet e GPT-4o superam todos os modelos abertos)
  • Você não quer gerenciar infraestrutura de inferência

O calculadora de autohospedagem versus API estima o ponto de equilíbrio com base no seu volume de tokens, custo da GPU e tarifa de eletricidade. O Calculadora de custos de API projeta o gasto mensal por modelo.

Observações específicas por plataforma

macOS

Ollama usa Metal para aceleração por GPU em Macs com chips M1/M2/M3. A memória unificada significa que VRAM = RAM do sistema. Um M2 Max com 64 GB consegue executar o Llama 3.1 70B em Q4 (40 GB) com espaço suficiente para o sistema operacional. Instale via Homebrew:

brew install ollama

Inicie o serviço:

ollama serve

Linux

Ollama exige GPUs NVIDIA com CUDA 11.8+ ou GPUs AMD com ROCm 5.7+. Instale com:

curl -fsSL https://ollama.com/install.sh | sh

Isso instala o binário em /usr/local/bin/ollama e cria um serviço systemd. Inicie-o com:

sudo systemctl start ollama

Os modelos são baixados para ~/.ollama/models. Para alterar esse local, defina OLLAMA_MODELS=/caminho/para/modelos no arquivo /etc/systemd/system/ollama.service.

Windows

Ollama para Windows exige GPUs NVIDIA com CUDA 11.8+ e driver 520+. Baixe o instalador em ollama.com e execute-o. O serviço inicia automaticamente. Os modelos são baixados para C:\Users\\.ollama\models.

Para executar pelo PowerShell:

ollama run llama3.1:8b

Perguntas frequentes

A OpenAI oferece um modelo de código aberto que posso executar no Ollama?

Não. A OpenAI lançou o GPT-2 (2019) como modelo de pesos abertos, mas todos os modelos recentes (GPT-3.5, GPT-4, GPT-4o, o1) são proprietários e acessíveis apenas por meio de API. Se você deseja raciocínio de qualidade equivalente à OpenAI localmente, experimente o Llama 3.1 70B ou o Qwen 2.5 72B — ambos superam o GPT-3.5 na maioria dos benchmarks e rodam no Ollama com 40 GB de VRAM em quantização Q4.

Posso executar o Ollama em uma CPU sem GPU?

Sim, mas a inferência será 10 a 50 vezes mais lenta. Modelos pequenos (Gemma 2 2B, Qwen 2.5 0,5B, Phi-3.5 mini 3,8B) são utilizáveis em CPUs modernas (16+ threads). Modelos maiores (7B+) gerarão 1 a 3 tokens por segundo em CPU, o que é muito lento para uso interativo. Caso você não tenha uma GPU, considere usar uma API hospedada — consulte o calculadora de autohospedagem versus API.

Quanto custa executar o Ollama comparado à API da OpenAI?

A OpenAI cobra US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída para o GPT-4o mini. Uma GPU de 12 GB (RTX 4060 Ti, US$ 400) executando o Llama 3.1 8B consome cerca de US$ 0,05/hora em eletricidade (tarifa de US$ 0,12/kWh, consumo do sistema de 400 W). O ponto de equilíbrio ocorre em torno de 3 a 5 milhões de tokens/mês. A Calculadora de custos de API e calculadora de hospedagem própria mostra o Custo Total de Propriedade (TCO) exato para o seu caso de uso.

Qual é a diferença entre Q4_K_M, Q5_K_M e FP16?

Q4_K_M usa quantização de 4 bits (menor uso de VRAM, leve perda de qualidade). Q5_K_M usa quantização de 5 bits (20% mais VRAM, qualidade mais próxima da original). FP16 é precisão total de 16 bits (melhor qualidade, mas o dobro de VRAM em comparação com Q4). Para a maioria das tarefas, Q5_K_M representa o melhor equilíbrio. Use FP16 apenas se tiver VRAM ociosa e precisar dos últimos 1–2% de qualidade para pesquisa ou produção.

Posso fazer fine-tuning de modelos no Ollama?

Não. Ollama é um mecanismo de inferência, não um framework de treinamento. Para fazer fine-tuning em um modelo aberto, use Hugging Face Transformers com PEFT/LoRA, Axolotl ou LLaMA Factory. Exporte os pesos ajustados para o formato GGUF e importe-os no Ollama com o comando ollama create. O bloco Guia completo do Ollama aborda esse fluxo de trabalho.

Qual GPU devo comprar para executar modelos de 7B localmente?

Para quantização Q4 (4,5 GB de VRAM): RTX 3060 12 GB (US$ 250 usado) ou RTX 4060 Ti 16 GB (US$ 450 novo). Para FP16 (14 GB de VRAM): RTX 4060 Ti 16 GB ou RTX 4070 (US$ 550–600). Para modelos de 70B em Q4 (40 GB): duas RTX 3090 24 GB (US$ 1800 usado) ou A100 40 GB (US$ 6000+ usado). O guia das melhores GPUs apresenta benchmarks de relação custo-desempenho para todas as classes de tamanho.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de desempenho por preço e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de hospedagem local. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top
Featured on There's An AI For That