A precificação da API Gemini começa em US$ 1,25 por 1 milhão de tokens de entrada no Gemini 2.5 Pro e chega a
US$ 2,00 no Gemini 3.1 Pro, com preços de saída entre US$ 7,50 e US$ 12,00. As tarifas anunciadas são
competitivas, mas a precificação da Gemini possui uma característica que nenhum de seus concorrentes oferece em grau semelhante:
prompts acima de aproximadamente 200 mil tokens são cobrados a uma taxa superior em diversos modelos. Para uma família
que se orgulha de suportar contexto de até 1 milhão de tokens, esse é exatamente o número que determina sua conta real.
Precificação da API Gemini: todos os modelos, por 1 milhão de tokens
| Modelo | Entrada: US$ por 1 milhão | Saída: US$ por 1 milhão | Custo médio ponderado por US$ 1 milhão | Contexto |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | $2.70 | 1 milhão |
| Gemini 2.5 Pro | $1.25 | $10.00 | $3.00 | 1 milhão (1.048.576 tokens) |
| Gemini 3.5 Flash | $1.50 | $9.00 | $3.00 | 1 milhão |
| Gemini 3.1 Pro | $2.00 | $12.00 | $4.00 | 1,05 milhão |
O valor combinado representa a taxa efetiva para uma proporção de entrada para saída de 4:1, que corresponde ao que uma carga de trabalho típica de chat ou recuperação realmente gera. Trata-se do número a ser comparado entre provedores — um preço de entrada divulgado esconde o quanto a saída realmente custa.
Quanto a Gemini custa por mês
| Carga de trabalho | Tokens/mês | Gemini 3.6 Flash mais barato | Gemini 3.1 Pro camada com maior capacidade |
|---|---|---|---|
| Projeto paralelo | 1 milhão de tokens de entrada / 0,25 milhão de tokens de saída | $3.38 | $5.00 |
| Equipe pequena | 20 milhões de tokens de entrada / 5 milhões de tokens de saída | $68 | $100 |
| Produção | 200 milhões de tokens de entrada / 50 milhões de tokens de saída | $675 | $1,000 |
Modele seus próprios volumes na Calculadora de custos de API de IA.
Como a Gemini se compara a outros provedores
Modelo mais barato de cada provedor, garantindo assim uma comparação justa com base no custo de entrada.
| Provedor | Modelo mais barato | Custo médio ponderado por US$ 1 milhão |
|---|---|---|
| Mistral AI | Mistral 7B | $0.0220 |
| Meta | Llama 3.1 8B | $0.0220 |
| Alibaba | Qwen3 8B | $0.0600 |
| Google esta página | Gemma 3 4B | $0.0600 |
| Microsoft | Phi-4 | $0.0840 |
| DeepSeek | DeepSeek V4-Flash | $0.168 |
| Moonshot AI | Kimi K2.7 Code | $0.980 |
| Anthropic | Claude Haiku 4.5 | $1.80 |
| Zhipu AI | GLM 5.2 | $2.00 |
| xAI | Grok 4 | $5.40 |
| OpenAI | GPT-5.6 Sol | $10.00 |
O modelo mais barato não é necessariamente o de melhor custo-benefício — verifique também sua capacidade, além do preço, no Ranking de LLMs, ou explore todos os modelos disponíveis no Banco de dados de modelos de IA.
Qual modelo Gemini você deve usar?
O aspecto interessante da linha atual do Google é que a camada mais barata costuma ser a
melhor opção.
Gemini 3.5 Flash supera o Gemini 3.1 Pro em benchmarks de programação e agentes
enquanto opera cerca de quatro vezes mais rápido e cerca de 25% mais barato, mantendo o mesmo
contexto de 1 milhão de tokens. Quando o modelo mais rápido e mais barato também obtém pontuação superior, a versão Pro deixa de ser a escolha padrão e passa a ser uma opção especializada. Para assistentes de programação, loops de agentes e qualquer cenário em que o usuário aguarda uma resposta, o Flash vence em todos os critérios simultaneamente — algo raro na seleção de modelos, onde velocidade, custo e qualidade normalmente envolvem trade-offs entre si.
o padrão e torna-se uma escolha especializada. Para assistentes de programação, loops de agentes e qualquer cenário
em que o usuário aguarda uma resposta, o Flash se destaca em todos os aspectos simultaneamente — o que é raro na
seleção de modelos, onde velocidade, custo e qualidade normalmente se compensam mutuamente.
Gemini 3.6 Flash, lançado em 21 de julho de 2026, é o mais recente da linha. Sua
taxa de entrada permanece inalterada em US$ 1,50, enquanto a de saída cai de US$ 9,00 para US$ 7,50 — uma redução de 17% no lado da fatura que normalmente predomina. Para cargas de trabalho intensivas em geração, trata-se de uma economia direta sem nenhuma implicação de redução de capacidade decorrente da precificação, tornando-o a escolha padrão dentro da camada Flash para novos projetos. Em cargas de trabalho intensivas em prompts, como recuperação, os dois modelos têm custo equivalente, já que a taxa de entrada é idêntica. Para esclarecer uma dúvida frequente: não existe Gemini 4 até julho de 2026.
conta que geralmente predomina. Para cargas de trabalho intensivas em geração, essa economia é direta
e não implica nenhuma redução de capacidade, conforme indicado pela precificação, tornando-o a escolha padrão
dentro da categoria Flash para novos trabalhos. Em cargas de trabalho baseadas principalmente em prompts (recuperação), os dois modelos são
intercambiáveis em termos de custo, já que a entrada é idêntica. Para esclarecer uma dúvida comum: não existe nenhum
Gemini 4 até julho de 2026.
Gemini 3.1 Pro vale a pena escolher por sua profundidade multimodal, e não por padrão, considerando que o Flash supera-o em tarefas de programação a um preço menor.
padrão, dado que o Flash supera-o em tarefas de programação por um preço menor.
Gemini 2.5 Pro continua amplamente implantado e bem suportado. Alcançou disponibilidade geral em 17 de junho de 2025 e foi líder de referência em benchmarks de programação, matemática e raciocínio com contexto longo, com suporte nativo para contexto de 1.048.576 tokens e entrada totalmente multimodal — texto, imagens, áudio, vídeo e PDFs. Modelos mais recentes da série 3.x o substituem, mas, ao custo de US$ 1,25 por entrada, ainda é uma das melhores opções em relação custo-benefício entre os principais modelos de raciocínio.
disponibilidade geral em 17 de junho de 2025 e foi líder de referência em programação, matemática e
raciocínio com contexto longo, com um contexto nativo de 1.048.576 tokens e suporte completo a entradas multimodais — texto,
imagens, áudio, vídeo e PDFs. Modelos mais recentes da série 3.x o substituem, mas, ao custo de US$ 1,25 por entrada, ele ainda é
uma das melhores opções em termos de custo-benefício entre os modelos de raciocínio de ponta.
O limite de 200 mil tokens é o ponto-chave a ser considerado no planejamento
A cobrança por contexto longo da Gemini é onde os orçamentos costumam estourar. O Gemini 3.1 Pro cobra prompts acima de
200 mil tokens a uma taxa de entrada aproximadamente duas vezes maior. O Gemini 2.5 Pro tem uma estrutura explícita por faixas: US$ 1,25 por 1 milhão de tokens de entrada até 200 mil, subindo para US$ 2,50 acima desse limite, com a taxa de saída passando de US$ 10,00 para US$ 15,00.
1 milhão de tokens de entrada até 200 mil, com aumento para US$ 2,50 acima desse limite, enquanto o custo por token de saída passa de US$ 10 para US$ 15.
A consequência prática é que uma funcionalidade que custa determinado valor em testes pode custar o dobro na produção, pois o limite é avaliado por requisição e depende inteiramente da quantidade de conteúdo colado pelo usuário. Orçar uma funcionalidade com contexto longo com base apenas na tarifa anunciada subestimará substancialmente a fatura assim que os prompts reais começarem a chegar.
que, em produção, porque o limite é ultrapassado por solicitação e depende inteiramente de quanto
um usuário colou no campo de entrada. Orçar uma funcionalidade de contexto longo com base apenas na taxa anunciada subestimará
substancialmente a fatura assim que as solicitações reais começarem a chegar.
Há duas respostas razoáveis. Projetar soluções que evitem ultrapassar esse limite, utilizando estratégias agressivas de recuperação e reranking para manter os prompts abaixo dele — o que, em geral, também melhora a qualidade das respostas, já que a atenção em contextos extremamente longos não é uniforme. Ou comparar com um modelo que aplique uma única taxa fixa em toda a sua janela de contexto;
reordenando os resultados para manter os prompts abaixo desse limite — o que, normalmente, também melhora a qualidade das respostas, já que
a atenção em contextos muito extensos não é uniforme. Ou compare com um modelo que cobra uma taxa fixa para toda a sua janela de contexto;
taxa fixa em toda a sua janela; Claude Opus
4.8 não possui nenhuma taxa adicional para contexto longo, o que, em cargas de trabalho genuinamente intensivas em recuperação, pode acabar sendo mais econômico apesar de seu preço de tabela mais elevado.
acabar sendo mais econômico, apesar de ter um preço de tabela mais alto.
Os modelos abertos do Google têm precificação separada
Gemma 3 é a família de modelos de pesos abertos do Google e está fora desta tabela porque representa uma proposta distinta: modelos de 4B, 12B e 27B parâmetros sob licença aberta, multimodais (texto e imagens), com contexto de 128K tokens e tão acessíveis em APIs hospedadas (US$ 0,05 a US$ 0,16 por 1 milhão de tokens) que a decisão real passa a ser se vale a pena executá-los localmente. O Gemma 3 de 27B requer cerca de 16 GB de VRAM em precisão de 4 bits, o que permite executá-lo em uma única placa gráfica voltada para consumidores. Dimensione-o na
proposta: modelos de 4 B, 12 B e 27 B de parâmetros sob licença aberta, multimodais (texto e imagens),
com contexto de até 128 K e suficientemente acessíveis em APIs hospedadas (US$ 0,05 a US$ 0,16 por 1 milhão de tokens), de modo que a decisão real seja
se executá-los localmente ou não. O Gemma 3 de 27 B requer cerca de 16 GB de VRAM em quantização de 4 bits, o que o torna viável em
um único cartão para consumidores. Dimensione-o no
Calculadora de VRAM, ou avalie se
executar localmente é mais vantajoso do que usar a API, conforme seu volume de uso, com a ajuda do
auto-hospedagem versus API
calculadora.
Perguntas frequentes
Quanto custa a API Gemini?
A precificação da API Gemini varia de US$ 2,70 por 1 milhão de tokens combinados (blended) no Gemini 3.6 Flash até US$ 4,00 no Gemini 3.1 Pro. A taxa combinada assume uma proporção de 4:1 entre tokens de entrada e saída. Entrada e saída são cobradas separadamente, sendo a saída sempre o lado mais caro.
Qual é o modelo Gemini mais barato?
Gemini 3.6 Flash, a US$ 1,50 por 1 milhão de tokens de entrada e US$ 7,50 por 1 milhão de tokens de saída. Uma carga de trabalho mensal de uma pequena equipe com 20 milhões de tokens de entrada e 5 milhões de tokens de saída custa cerca de US$ 68 nesse modelo.
Quanto custa o Gemini por mês?
Com 20 milhões de tokens de entrada e 5 milhões de tokens de saída por mês, o Gemini 3.6 Flash custa cerca de US$ 68, enquanto o Gemini 3.1 Pro custa cerca de US$ 100. Um projeto paralelo com 1 milhão de tokens de entrada e 0,25 milhão de tokens de saída custa apenas uma fração desse valor. Utilize a calculadora de custos da API de IA para estimar seus próprios volumes.
O Gemini é mais barato que a Mistral AI?
Na precificação de nível básico, o Gemini começa em US$ 2,70 por 1 milhão de tokens combinados (blended), enquanto a Mistral AI começa em US$ 0,0220 para o modelo Mistral 7B. A Mistral AI representa o ponto de entrada mais barato, embora as capacidades difiram — compare ambos no leaderboard antes de migrar.
Por que o Gemini cobra mais pelos tokens de saída do que pelos de entrada?
Os tokens de saída são gerados um por um e não podem ser processados em lote como um prompt, tornando seu fornecimento mais caro. É por isso que cargas de trabalho intensivas em prompts — como recuperação e classificação — são muito mais baratas de executar do que aquelas intensivas em geração, e também por que a taxa combinada é mais relevante do que o preço de entrada divulgado.
Os preços correspondem às tarifas listadas oficialmente para a principal API de cada modelo e são revisados conforme os provedores as alteram. Descontos por volume, processamento em lote ou cache de entradas não estão incluídos. Última revisão em agosto de 2026.

