Friday, 7 August 2026 | Updating Daily AI insight, written for builders

Preços da API Claude (2026): Custo por 1 milhão de tokens para cada modelo

Os preços da API Claude variam de US$ 1 por 1 milhão de tokens de entrada no Claude Haiku 4.5 até US$ 10
no Claude Fable 5.
A Anthropic cobra separadamente os tokens de entrada e saída, sendo que os tokens de saída custam cinco vezes mais que os de entrada em toda a faixa de modelos — portanto, o preço anunciado para entrada revela muito pouco sobre o custo real efetivo.
O quadro abaixo lista todos os modelos atuais, e a coluna 'valor médio ponderado'
é a referência mais adequada para comparação.
Preços da API Claude: custo por 1 milhão de tokens para cada modelo

O valor médio ponderado corresponde à taxa efetiva considerando uma proporção de 4:1 entre tokens de entrada e saída, que é típica em cargas de trabalho reais de chat ou recuperação de informações. Trata-se do valor mais indicado para comparações entre provedores — um preço anunciado apenas para entrada mascara substancialmente o custo real associado aos tokens de saída.

ModeloEntrada: US$ por 1 milhãoSaída: US$ por 1 milhãoCusto médio ponderado por US$ 1 milhãoContexto
Claude Haiku 4.5$1.00$5.00$1.80200 mil
Claude Sonnet 5$2.00$10.00$3.601 milhão
Claude Sonnet 4.6$3.00$15.00$5.401 milhão
Claude Opus 5$5.00$25.00$9.001 milhão
Claude Opus 4.8$5.00$25.00$9.001 milhão
Claude Fable 5$10.00$50.00$18.001 milhão

O valor combinado representa a taxa efetiva para uma proporção de entrada para saída de 4:1, que corresponde ao que uma carga de trabalho típica de chat ou recuperação realmente gera. Trata-se do número a ser comparado entre provedores — um preço de entrada divulgado esconde o quanto a saída realmente custa.

mais barato

Carga de trabalhoTokens/mêsClaude Haiku 4.5
mais barato
Claude Fable 5
camada com maior capacidade
Projeto paralelo1 milhão de tokens de entrada / 0,25 milhão de tokens de saída$2.25$23
Equipe pequena20 milhões de tokens de entrada / 5 milhões de tokens de saída$45$450
Produção200 milhões de tokens de entrada / 50 milhões de tokens de saída$450$4,500

Modele seus próprios volumes na Calculadora de custos de API de IA.

Como o Claude se compara a outros provedores

Modelo mais barato de cada provedor, garantindo assim uma comparação justa com base no custo de entrada.

ProvedorModelo mais baratoCusto médio ponderado por US$ 1 milhão
Mistral AIMistral 7B$0.0220
MetaLlama 3.1 8B$0.0220
AlibabaQwen3 8B$0.0600
GoogleGemma 3 4B$0.0600
MicrosoftPhi-4$0.0840
DeepSeekDeepSeek V4-Flash$0.168
Moonshot AIKimi K2.7 Code$0.980
Anthropic esta páginaClaude Haiku 4.5$1.80
Zhipu AIGLM 5.2$2.00
xAIGrok 4$5.40
OpenAIGPT-5.6 Sol$10.00

O modelo mais barato não é necessariamente o de melhor custo-benefício — verifique também sua capacidade, além do preço, no Ranking de LLMs, ou explore todos os modelos disponíveis no Banco de dados de modelos de IA.

Qual modelo Claude você deve usar?

A linha da Anthropic é uma escada de capacidades direta, e a maioria das equipes paga a mais ao começar
no topo dela.

Haiku 4.5 deve ser tratado como padrão, e não como alternativa de contingência. Com custo de $1 por milhão de tokens de entrada e $5 por milhão de tokens de saída, ele suporta um volume de tráfego cerca de dez vezes maior que um modelo da categoria Opus pelo mesmo valor, e a grande maioria das tarefas executadas por uma aplicação em produção — classificação, extração, roteamento e geração de curto prazo — nunca exigiu um modelo de ponta. Seu contexto de 200K é o único limite real; os demais modelos da linha alcançam 1M.
$1 por milhão de tokens de entrada / $5 por milhão de tokens de saída
mesmo dinheiro, e a vasta maioria do que uma aplicação em produção faz — classificação,
extração, roteamento, geração de curto prazo — nunca precisou de um modelo de ponta. Seu contexto de 200K
é o único limite real; os demais modelos da linha alcançam 1M.

Sonnet 5 é o modelo de trabalho contínuo. Seu desempenho em benchmarks é fortemente voltado para programação: 85,2% no
SWE-Bench Verified, 80,4% no Terminal-Bench 2.1 e 81,2% no OSWorld-Verified. Esses valores ficam
próximos aos de modelos que custam várias vezes mais, o que justifica plenamente posicionar o Sonnet
— e não o Opus — no centro de um agente especializado em programação.

Opus 5 é o modelo principal, classificado em primeiro lugar no Índice de Inteligência Artificial da Artificial Analysis
com nota 61. Ele foi lançado mantendo os mesmos preços do Opus anterior, de modo que qualquer usuário já migrado para o Opus 4.8 pode atualizar-se simplesmente alterando a string do modelo, sem impacto orçamentário — uma mudança recomendável a ser feita imediatamente, pois um salto geracional de capacidade sem aumento de preço é raro.
com uma alteração na string do modelo e sem consequência orçamentária — vale a pena fazer isso imediatamente, pois um salto geracional de capacidade a preços inalterados é raro.
geracional de capacidade a preços inalterados é raro.

Fable 5 faz sentido apenas no topo da curva de dificuldade. Ao custar US$ 50 por 1 milhão
de tokens de saída, seu preço é aproximadamente cinco vezes maior que o do Opus na parte de saída, portanto rotear solicitações comuns para ele consome orçamento sem ganho mensurável.
para ele consome orçamento sem ganho mensurável. Reserve-o para tarefas nas quais uma resposta incorreta tem alto custo: agentes multietapa sem supervisão humana, pesquisas profundas ou refatorações em grandes bases de código.
tarefas nas quais uma resposta incorreta tem alto custo: agentes multietapa sem supervisão humana, pesquisas profundas ou refatorações em grandes bases de código.

O padrão eficaz consiste em um roteador — Haiku como primeira camada, escalando para Sonnet ou Opus apenas quando uma verificação de confiança falhar.
equipes que monitoram sua composição de tokens normalmente descobrem que os tokens de saída são onde o custo real ocorre, e que limitar
e mover rascunhos iniciais max_tokens para uma camada mais barata gera economias maiores do que qualquer técnica de compressão de prompts.
para uma camada mais barata gera economias maiores do que qualquer técnica de compressão de prompts.

Três aspectos da precificação do Claude que surpreendem muitos usuários

O preço do Sonnet 5 é temporário. A tarifa de $2/$10 é introdutória e vigorará
até 31 de agosto de 2026, após o que passará à precificação padrão de $3/$15. Trata-se de um aumento de 50%
e será aplicado automaticamente a qualquer carga de trabalho dimensionada com base nos valores atuais. Se você
está modelando a economia unitária de um produto que será lançado este ano, faça-o com base em $3/$15 e considere
a taxa atual como um desconto.

O modo Rápido do Opus 5 duplica ambas as tarifas. A camada Rápida, disponível apenas via API, cobra
$10/$50 em vez de $5/$25. Esse custo adicional só é justificado quando a latência é crítica para o produto — assistentes interativos de programação, loops de agentes em tempo real com usuários aguardando resposta.
para assistentes interativos de programação, loops de agentes em tempo real com usuários aguardando resposta. Para processamento em lote, agentes noturnos
e qualquer tarefa enfileirada, o modo padrão oferece a mesma inteligência pela metade do preço.

Não há taxa adicional para contextos longos. Essa é a vantagem discreta sobre concorrentes.
O Claude Opus 4.8 cobra seu contexto de 1 milhão de tokens à mesma taxa desde o primeiro até o
milionésimo token. Vários modelos concorrentes aumentam progressivamente a tarifa de entrada assim que o prompt ultrapassa um determinado limiar —
o GPT-5.6 Sol cobra o dobro na entrada e 1,5x na saída acima de 272K tokens, e o Gemini 3.1 Pro eleva aproximadamente ao dobro a tarifa de entrada acima de 200K.
o GPT-5.6 Sol cobra o dobro na entrada e 1,5x na saída acima de 272K tokens, e o Gemini 3.1 Pro eleva aproximadamente ao dobro a tarifa de entrada acima de 200K. Isso torna suas funcionalidades de contexto longo imprevisíveis do ponto de vista orçamentário,
porque a mesma funcionalidade custa valores diferentes dependendo da quantidade de texto colado pelo usuário. Com
o Claude, você pode dimensionar seus prompts com base no que produz a melhor resposta, e não em torno de um "penhasco" tarifário.
o Claude, você pode dimensionar seus prompts com base no que produz a melhor resposta, e não em torno de um "penhasco" tarifário.

Perguntas frequentes

Quanto custa a API do Claude?

A precificação da API do Claude varia de $1,80 por 1 milhão de tokens combinados (blended) no Claude Haiku 4.5 até $18,00 no Claude Fable 5. A tarifa combinada assume uma proporção de 4:1 entre tokens de entrada e saída. Entrada e saída são cobradas separadamente, sendo sempre a saída o lado mais caro.

Qual é o modelo Claude mais barato?

Claude Haiku 4.5, a US$ 1,00 por 1 milhão de tokens de entrada e US$ 5,00 por 1 milhão de tokens de saída. Uma carga de trabalho mensal de uma pequena equipe, com 20 milhões de tokens de entrada e 5 milhões de tokens de saída, custa cerca de US$ 45 nesse modelo.

Quanto custa o Claude por mês?

Com 20 milhões de tokens de entrada e 5 milhões de tokens de saída por mês, o Claude Haiku 4.5 custa cerca de US$ 45, enquanto o Claude Fable 5 custa cerca de US$ 450. Um projeto paralelo com 1 milhão de tokens de entrada e 250 mil tokens de saída custa apenas uma fração desse valor. Use a calculadora de custos da API de IA para seus próprios volumes.

O Claude é mais barato que a Mistral AI?

Na faixa de preços de entrada, o Claude começa em US$ 1,80 por 1 milhão de tokens combinados (blended), enquanto a Mistral AI começa em US$ 0,0220 para o modelo Mistral 7B. A Mistral AI representa o ponto de entrada mais econômico, embora suas capacidades sejam diferentes — compare ambos no ranking oficial antes de migrar.

Por que o Claude cobra mais pelos tokens de saída do que pelos de entrada?

Os tokens de saída são gerados um por um e não podem ser processados em lote como um prompt, tornando seu fornecimento mais caro. É por isso que cargas de trabalho intensivas em prompts — como recuperação e classificação — são muito mais baratas de executar do que aquelas intensivas em geração, e também por que a taxa combinada é mais relevante do que o preço de entrada divulgado.

Os preços correspondem às tarifas listadas oficialmente para a principal API de cada modelo e são revisados conforme os provedores as alteram. Descontos por volume, processamento em lote ou cache de entradas não estão incluídos. Última revisão em agosto de 2026.

Scroll to Top
Featured on There's An AI For That