- A OpenAI não lançou uma família de modelos chamada "GPT-OSS". O termo de pesquisa provavelmente se refere à execução de alternativas de código aberto (Llama 3, Mistral, Qwen) por meio do Ollama.
- O Ollama executa centenas de modelos de pesos abertos localmente. Opções populares:
ollama pull llama3.1:8b,ollama pull mistral:7b,ollama pull qwen2.5:7b. - Requisitos de VRAM: modelos de 7B exigem 6–8 GB (quantização Q4), modelos de 13B exigem 10–14 GB e modelos de 70B exigem 40–48 GB. Use o Calculadora de VRAM para estimar.
- Modelos quantizados (Q4, Q5) cabem em GPUs voltadas para consumidores com perda mínima de qualidade. O formato FP16 oferece a melhor qualidade, mas duplica o uso de VRAM.
Se você pesquisou por "ollama gpt oss", provavelmente deseja executar modelos de linguagem de grande porte de código aberto localmente usando o Ollama — porém a OpenAI não lançou nenhuma família de modelos de pesos abertos chamada "GPT-OSS". A OpenAI lançou o GPT-2 em 2019 como modelo de pesos abertos, mas seus modelos mais recentes (GPT-4, GPT-4o, GPT-4.1) continuam sendo produtos proprietários acessíveis apenas por meio de API. O que não existe são centenas de modelos de pesos abertos da Meta (Llama), Mistral AI, Alibaba (Qwen) e outros, que você pode baixar e executar localmente via Ollama em seu próprio hardware. Este guia aborda quais modelos funcionam, os requisitos de VRAM para cada tamanho, como a quantização afeta a qualidade e como eles se comparam entre si.
- O que o Ollama realmente executa
- Famílias de modelos de código aberto disponíveis no Ollama
- Baixando e executando um modelo
- Tamanhos de parâmetros e requisitos de VRAM
- Quantização: equilíbrio entre qualidade e VRAM
- Comparação de desempenho: classe de 7B
- Qual modelo escolher
- Quando hospedar localmente versus usar uma API
- Observações específicas por plataforma
- Perguntas frequentes
O que o Ollama realmente executa
O Ollama é um mecanismo de inferência local que baixa, quantiza e executa modelos de linguagem de grande porte (LLMs) de pesos abertos no macOS, Linux e Windows. Ele não hospeda modelos da OpenAI. O Lista de modelos do Ollama inclui o Llama 3.1, Mistral 7B, o Qwen 2.5, o Gemma 2, o Phi-3 e dezenas de outros. Cada modelo está disponível em diversos níveis de quantização (Q4_K_M, Q5_K_M, FP16) para equilibrar uso de VRAM e qualidade.
Etapas completas de instalação: como instalar o Ollama.
Famílias de modelos de código aberto disponíveis no Ollama
| Família de modelos | Desenvolvedor | Tamanhos de parâmetros | Licença | Destaque |
|---|---|---|---|---|
| Llama 3.1 | Meta | 8B, 70B, 405B | Llama 3.1 (licença comercialmente amigável) | Melhor raciocínio geral em cada faixa de tamanho |
| Mistral | Mistral AI | 7B, 22B (Mixtral 8x7B) | Apache 2.0 | Rápido, eficiente e excelente em programação |
| Qwen 2.5 | Alibaba | 0,5B, 1,5B, 3B, 7B, 14B, 32B, 72B | Apache 2.0 | Multilíngue, com suporte a contextos longos (128k) |
| Gemma 2 | 2B, 9B, 27B | Gemma (licença comercialmente amigável) | Pequeno, rápido e capaz de rodar na CPU | |
| Phi-3.5 | Microsoft | 3,8B (mini), 14B (medium) | MIT | Compacto e com bom desempenho em benchmarks de raciocínio |
O Banco de dados de modelos de IA lista especificações, requisitos de VRAM e preços para 37 modelos, incluindo todos os citados acima.
Baixando e executando um modelo
Após instalar o Ollama, baixe um modelo com o comando ollama pull <modelo>:<tag>. A tag especifica a contagem de parâmetros e o nível de quantização. Exemplos:
ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9bExecute o modelo:
ollama run llama3.1:8bIsso abre uma sessão interativa de bate-papo. Digite seu prompt, pressione Enter e o modelo gerará uma resposta localmente. Para sair, digite /bye.
Para usar o modelo programaticamente por meio da API:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Explique recursão em uma frase."
}'O Ollama expõe um endpoint compatível com a API da OpenAI, /v1/chat/completions de modo que você pode apontar seu código existente com SDK da OpenAI para http://localhost:11434 e substituir facilmente por um modelo local.
Tamanhos de parâmetros e requisitos de VRAM
O tamanho do modelo (7B, 13B, 70B) determina sua qualidade e consumo de VRAM. Modelos maiores apresentam melhor capacidade de raciocínio, mas exigem mais memória de GPU. A quantização (Q4, Q5, FP16) comprime os pesos para reduzir o uso de VRAM com um pequeno custo em qualidade.
| Contagem de parâmetros | Quantização | VRAM (aproximada) | Modelos de Exemplo | Recomendação de GPU |
|---|---|---|---|---|
| 7B | Q4_K_M | 4,5 GB | Llama 3.1 8B, Mistral 7B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 7B | Q5_K_M | 5,5 GB | Igual ao acima | Igual |
| 7B | FP16 | 14 GB | Igual ao acima | RTX 4060 Ti (16 GB), RTX 4070 |
| 13B | Q4_K_M | 8 GB | Qwen 2.5 14B, Phi-3.5 14B | RTX 3060 (12 GB), RTX 4060 Ti (16 GB) |
| 13B | FP16 | 26 GB | Igual | RTX 4090 (24 GB) ou A5000 (24 GB) |
| 70B | Q4_K_M | 40 GB | Llama 3.1 70B, Qwen 2.5 72B | A100 (40/80 GB), duas RTX 3090 (48 GB no total) |
| 70B | FP16 | 140 GB | Igual | Configuração multi-GPU ou A100 de 80 GB |
Use a Calculadora de VRAM para estimar as necessidades de memória de qualquer modelo e nível de quantização. O Guia de requisitos de VRAM lista valores precisos para todos os principais modelos.
Para decisões de compra de GPU, consulte melhores GPUs para executar LLMs localmente.
Quantização: equilíbrio entre qualidade e VRAM
A quantização reduz a precisão dos pesos do modelo de números de ponto flutuante de 16 bits (FP16) para inteiros de 4 ou 5 bits (Q4, Q5). Isso reduz a VRAM em 60–75%, com perda mínima de qualidade na maioria das tarefas.
- Q4_K_M: Quantização de 4 bits. Menor consumo de VRAM, ligeira queda de qualidade em raciocínio complexo. Ideal para chatbots, resumos e conclusão de código.
- Q5_K_M: Quantização de 5 bits. Cerca de 20% mais VRAM que Q4, qualidade mais próxima da FP16. Melhor equilíbrio para a maioria dos usuários.
- Q8_0: Quantização de 8 bits. Qualidade quase equivalente à FP16, com redução de 50% na VRAM. Use se houver margem suficiente de VRAM disponível.
- FP16: Precisão total. Melhor qualidade, mas consome o dobro da VRAM de Q4. Necessário apenas para pesquisa ou quando degradações de qualidade forem inaceitáveis.
Exemplo: Llama 3.1 8B o modelo Llama 3.1 8B em Q4_K_M usa 4,5 GB de VRAM e obtém 67,2 pontos no MMLU. Em FP16, usa 14 GB e alcança 68,1 pontos no MMLU. Para a maioria das tarefas, essa diferença de 0,9 ponto é imperceptível.
Para baixar uma quantização específica:
ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16Se você omitir a tag de quantização, o Ollama usa Q4_K_M como padrão.
Comparação de desempenho: classe de 7B
A classe de tamanho 7B–8B é a mais popular para uso local. Ela cabe em GPUs voltadas para consumidores e oferece excelentes resultados em programação, raciocínio e conversação.
| Modelo | MMLU (sem exemplos) | HumanEval (pass@1) | Comprimento do contexto | VRAM (Q4) |
|---|---|---|---|---|
| Llama 3.1 8B | 67.2 | 62.2 | 128k | 4,5 GB |
| Mistral 7B v0.3 | 62.5 | 40.2 | 32k | 4,1 GB |
| Qwen 2.5 7B | 70.3 | 61.6 | 128k | 4,3 GB |
| Gemma 2 9B | 71.3 | 61.0 | 8k | 5,2 GB |
Qwen 2.5 7B e Gemma 2 9B lideram no MMLU (conhecimento geral). Llama 3.1 8B lidera no HumanEval (programação). Mistral 7B é o mais rápido e possui a licença mais permissiva (Apache 2.0). O Ranking de LLMs classifica todos os modelos por inteligência, custo e comprimento de contexto.
Qual modelo escolher
- Melhor qualidade geral (classe 7B):
ollama pull qwen2.5:7bouollama pull llama3.1:8b - Melhor para programação:
ollama pull llama3.1:8bouollama pull qwen2.5-coder:7b - Inferência mais rápida:
ollama pull mistral:7bouollama pull gemma2:2b(para CPU/baixa VRAM) - Multilíngue:
ollama pull qwen2.5:7b(suporta 29 idiomas) - Documentos longos (contexto de 128k ou mais):
ollama pull llama3.1:8bouollama pull qwen2.5:7b - Raciocínio mais forte (se você tiver 40+ GB de VRAM):
ollama pull llama3.1:70bouollama pull qwen2.5:72b
O melhores LLMs locais para Ollama guia compara todos os modelos e recomenda tags específicas conforme o caso de uso.
Quando hospedar localmente versus usar uma API
Executar o Ollama localmente faz sentido se:
- Você já possui uma GPU com 12+ GB de VRAM (RTX 3060, 4060 Ti ou superior)
- Você processa dados sensíveis que não podem sair de sua rede
- Você gera mais de 5 milhões de tokens por mês (os custos da API superam o custo total de propriedade — TCO — do autohospedagem)
- Você precisa de tempo de atividade garantido e sem limites de taxa
Use uma API hospedada (OpenAI, Anthropic, Groq) se:
- Você gera menos de 1 milhão de tokens por mês (a amortização da GPU para hospedagem própria leva anos)
- Você precisa da qualidade absolutamente mais alta (Claude 3.5 Sonnet e GPT-4o superam todos os modelos abertos)
- Você não quer gerenciar infraestrutura de inferência
O calculadora de autohospedagem versus API estima o ponto de equilíbrio com base no seu volume de tokens, custo da GPU e tarifa de eletricidade. O Calculadora de custos de API projeta o gasto mensal por modelo.
Observações específicas por plataforma
macOS
Ollama usa Metal para aceleração por GPU em Macs com chips M1/M2/M3. A memória unificada significa que VRAM = RAM do sistema. Um M2 Max com 64 GB consegue executar o Llama 3.1 70B em Q4 (40 GB) com espaço suficiente para o sistema operacional. Instale via Homebrew:
brew install ollamaInicie o serviço:
ollama serveLinux
Ollama exige GPUs NVIDIA com CUDA 11.8+ ou GPUs AMD com ROCm 5.7+. Instale com:
curl -fsSL https://ollama.com/install.sh | shIsso instala o binário em /usr/local/bin/ollama e cria um serviço systemd. Inicie-o com:
sudo systemctl start ollamaOs modelos são baixados para ~/.ollama/models. Para alterar esse local, defina OLLAMA_MODELS=/caminho/para/modelos no arquivo /etc/systemd/system/ollama.service.
Windows
Ollama para Windows exige GPUs NVIDIA com CUDA 11.8+ e driver 520+. Baixe o instalador em ollama.com e execute-o. O serviço inicia automaticamente. Os modelos são baixados para C:\Users\\.ollama\models.
Para executar pelo PowerShell:
ollama run llama3.1:8bPerguntas frequentes
A OpenAI oferece um modelo de código aberto que posso executar no Ollama?
Não. A OpenAI lançou o GPT-2 (2019) como modelo de pesos abertos, mas todos os modelos recentes (GPT-3.5, GPT-4, GPT-4o, o1) são proprietários e acessíveis apenas por meio de API. Se você deseja raciocínio de qualidade equivalente à OpenAI localmente, experimente o Llama 3.1 70B ou o Qwen 2.5 72B — ambos superam o GPT-3.5 na maioria dos benchmarks e rodam no Ollama com 40 GB de VRAM em quantização Q4.
Posso executar o Ollama em uma CPU sem GPU?
Sim, mas a inferência será 10 a 50 vezes mais lenta. Modelos pequenos (Gemma 2 2B, Qwen 2.5 0,5B, Phi-3.5 mini 3,8B) são utilizáveis em CPUs modernas (16+ threads). Modelos maiores (7B+) gerarão 1 a 3 tokens por segundo em CPU, o que é muito lento para uso interativo. Caso você não tenha uma GPU, considere usar uma API hospedada — consulte o calculadora de autohospedagem versus API.
Quanto custa executar o Ollama comparado à API da OpenAI?
A OpenAI cobra US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída para o GPT-4o mini. Uma GPU de 12 GB (RTX 4060 Ti, US$ 400) executando o Llama 3.1 8B consome cerca de US$ 0,05/hora em eletricidade (tarifa de US$ 0,12/kWh, consumo do sistema de 400 W). O ponto de equilíbrio ocorre em torno de 3 a 5 milhões de tokens/mês. A Calculadora de custos de API e calculadora de hospedagem própria mostra o Custo Total de Propriedade (TCO) exato para o seu caso de uso.
Qual é a diferença entre Q4_K_M, Q5_K_M e FP16?
Q4_K_M usa quantização de 4 bits (menor uso de VRAM, leve perda de qualidade). Q5_K_M usa quantização de 5 bits (20% mais VRAM, qualidade mais próxima da original). FP16 é precisão total de 16 bits (melhor qualidade, mas o dobro de VRAM em comparação com Q4). Para a maioria das tarefas, Q5_K_M representa o melhor equilíbrio. Use FP16 apenas se tiver VRAM ociosa e precisar dos últimos 1–2% de qualidade para pesquisa ou produção.
Posso fazer fine-tuning de modelos no Ollama?
Não. Ollama é um mecanismo de inferência, não um framework de treinamento. Para fazer fine-tuning em um modelo aberto, use Hugging Face Transformers com PEFT/LoRA, Axolotl ou LLaMA Factory. Exporte os pesos ajustados para o formato GGUF e importe-os no Ollama com o comando ollama create. O bloco Guia completo do Ollama aborda esse fluxo de trabalho.
Qual GPU devo comprar para executar modelos de 7B localmente?
Para quantização Q4 (4,5 GB de VRAM): RTX 3060 12 GB (US$ 250 usado) ou RTX 4060 Ti 16 GB (US$ 450 novo). Para FP16 (14 GB de VRAM): RTX 4060 Ti 16 GB ou RTX 4070 (US$ 550–600). Para modelos de 70B em Q4 (40 GB): duas RTX 3090 24 GB (US$ 1800 usado) ou A100 40 GB (US$ 6000+ usado). O guia das melhores GPUs apresenta benchmarks de relação custo-desempenho para todas as classes de tamanho.

