Quanto custará mensalmente a API da OpenAI, Anthropic ou DeepSeek? Google Insira seu volume de uso e compare todos os modelos lado a lado — os preços são atualizados em tempo real a partir do nosso Banco de dados de modelos de IA.
| Modelo | Desenvolvedor | US$ por 1 milhão de tokens de entrada | US$ por 1 milhão de tokens de saída | Custo estimado mensal |
|---|
Estimativa = (entrada em milhões × preço por milhão de tokens de entrada) + (saída em milhões × preço por milhão de tokens de saída). As faturas reais podem variar conforme o uso de cache, descontos por lote e sobretaxas para contextos longos. Modelos de código aberto que você hospeda localmente não estão listados aqui (seu custo é com hardware e energia elétrica, não por token).
O modelo mais barato nem sempre é a melhor opção — verifique a página de cada modelo para conhecer sua janela de contexto, benchmarks e capacidades antes de mudar. E lembre-se: modelos de código aberto que você hospeda localmente não têm nenhum custo por token.
Quanto custa uma API de LLM e como você a calcula?
Os preços das APIs de IA são cobrados por token, faturados separadamente para entrada (seu prompt mais qualquer contexto que você envia) e saída (a resposta do modelo), com valores cotados por milhão de tokens. Para estimar uma conta, multiplique seus tokens de entrada pelo preço de entrada, some os tokens de saída multiplicados pelo preço de saída, e então ajuste esse valor conforme o número de requisições executadas por mês. Em 2026, os preços de entrada variam aproximadamente entre USD 0,10 e USD 5 por milhão de tokens, enquanto os de saída ficam entre USD 0,30 e USD 30 por milhão, sendo quase sempre mais caros que os de entrada — tipicamente 2–5× (uma mediana de cerca de 4×).
- A fórmula: custo mensal ≈ (requisições/mês × tokens médios de entrada × preço de entrada ÷ 1.000.000) + (requisições/mês × tokens médios de saída × preço de saída ÷ 1.000.000).
- Regra token-por-palavra: cerca de 1,3 token por palavra em inglês, ou seja, 1.000 tokens ≈ 750 palavras e 1 milhão de tokens ≈ 750.000 palavras.
- Variação de preços: modelos orçamentários/"lite" ficam próximos de USD 0,10–USD 0,15 por milhão de tokens de entrada; modelos avançados de ponta atingem cerca de USD 5 de entrada e USD 25–USD 30 de saída.
- Modelos de pesos abertos auto-hospedados não possuem taxa por token — você paga pela GPU, energia elétrica e hospedagem em vez disso.
Perguntas frequentes
Como calcular o custo mensal de uma API de IA?
Tome seus tokens médios de entrada e saída por requisição, multiplique cada um pelo preço por milhão desse modelo (os preços de entrada e saída são distintos), some-os para obter o custo por requisição e, em seguida, multiplique pelo volume mensal de requisições. Por exemplo, 100.000 requisições por mês com 1.000 tokens de entrada e 500 de saída cada resulta em 100 milhões de tokens de entrada e 50 milhões de saída; a USD 1/M de entrada e USD 4/M de saída, isso equivale a USD 100 + USD 200 = USD 300 por mês.
Por que os tokens de saída custam mais que os de entrada?
Os tokens de entrada são processados em uma única passagem paralela, enquanto cada token de saída exige sua própria passagem completa (forward pass) pelo modelo, tornando a geração de texto muito mais intensiva em recursos computacionais do que sua leitura. É por isso que os tokens de saída costumam ser precificados 2–5× mais caros que os de entrada, com uma razão típica em torno de 4×. Ao estimar uma conta, considere adequadamente o peso dos tokens de saída, em vez de supor que entrada e saída têm o mesmo custo.
O que significa exatamente "custo por 1 milhão de tokens"?
Os provedores cotam preços por um milhão de tokens, em vez de por requisição, porque as contagens de tokens variam muito entre chamadas. Um token equivale aproximadamente a ¾ de uma palavra em inglês, portanto um milhão de tokens corresponde a cerca de 750.000 palavras — o tamanho de um livro longo. Para obter seu custo real, divida o preço cotado por milhão por 1.000.000 e multiplique pelo número exato de tokens enviados e recebidos.
Qual é a API de LLM mais barata em 2026?
As opções de menor custo são as APIs "flash", "lite" e de modelos abertos, que ficam em torno de USD 0,10–USD 0,15 por milhão de tokens de entrada e aproximadamente USD 0,30–USD 0,60 por milhão de tokens de saída — frequentemente 30–50× mais baratas que modelos avançados de ponta, cujos preços giram em torno de USD 5 de entrada / USD 25–USD 30 de saída. O melhor custo-benefício geralmente é o modelo mais barato que ainda atende ao seu critério de qualidade, portanto escolha o modelo adequado à tarefa, em vez de adotar por padrão o mais caro. Como os preços mudam a cada trimestre, use as cifras atualizadas na calculadora acima antes de comprometer-se com volumes maiores.
Modelos de código aberto ou pesos abertos têm custo por token em suas APIs?
Não — se você auto-hospedar um modelo de pesos abertos (como Llama, Qwen, DeepSeek ou variantes do Mistral), não há nenhuma cobrança por token nas APIs; você paga apenas pela GPU ou servidor, eletricidade e manutenção. Isso inverte a economia: o auto-hospedagem representa um custo fixo por hora, independentemente do uso, tornando-se vantajosa apenas em volumes altos e constantes. Em volumes baixos ou intermitentes, uma API hospedada quase sempre sai mais barata, pois você paga exatamente pelos tokens utilizados.
Quanta VRAM preciso para auto-hospedar um modelo em vez de pagar por token?
Em quantização de 4 bits, um modelo requer aproximadamente 0,5–0,6 GB de VRAM por bilhão de parâmetros, além de espaço extra para o cache KV, que cresce com o comprimento do contexto. Assim, um modelo de 8B precisa de cerca de 5–6 GB e cabe em uma GPU de consumo; um modelo de 70B requer cerca de 40–48 GB (uma placa de data center ou duas placas de 24 GB); adicionar uma margem de segurança de 15–20% para o cache KV e sobrecargas é uma boa regra prática. Janelas de contexto mais longas e tamanhos maiores de lote aumentam a exigência do cache KV, portanto dimensione com base nos comprimentos reais de seus prompts, não apenas nos pesos do modelo.
Como posso reduzir minha conta de API de IA?
Os principais fatores de redução são enviar menos tokens e escolher um nível de modelo mais barato para tarefas simples. O cache de prompts pode reduzir o custo de system prompts ou contextos repetidos em até ~90%, e endpoints em lote ou assíncronos normalmente oferecem desconto de cerca de 50% para trabalhos não urgentes. Reduzir o contexto extenso, limitar o comprimento máximo da saída e direcionar requisições simples para um modelo lite, reservando modelos de ponta apenas para tarefas difíceis, geralmente reduz significativamente a conta.
Mais ferramentas gratuitas da Convly
Custo combinado da API por 1 milhão de tokens — quanto os modelos de IA realmente custam
$0.02
$0.02
$0.03
$0.06
$0.07
$0.07
$0.09
$0.10
$0.13
$0.15
$10.00
$10.00
$11.25
$11.25
$20.00
$20.00
Blended cost = (3 × input + output) ÷ 4 · 10 cheapest + 6 priciest of 37 tracked, log scale · full spread 909× · Green = best value, orange = highest. Updated Sep 21, 2026.
🔍 Incorpore este gráfico no seu site (gratuito, com atribuição)
Obtenha os números antes de todos os outros
Um e-mail por semana: quais modelos de IA mudaram de preço, o que os novos benchmarks realmente mediram e qual GPU vale a pena comprar. Sem exageros, sem conteúdo supérfluo.
Grátis. Cancelamento em um clique. Nunca vendemos nem compartilhamos seu endereço.
