A precificação da API DeepSeek começa em US$ 0,14 por 1 milhão de tokens de entrada no DeepSeek V4-Flash — cerca de
um sexagésimo do que modelos de ponta cobram. Essa diferença, e não a contagem de parâmetros, é o motivo pelo qual
o DeepSeek é relevante. Todos os modelos dessa linha também são disponibilizados sob licença aberta, portanto o preço da API
representa uma taxa de conveniência, e não a única forma de executá-los.
Precificação da API DeepSeek: todos os modelos, por 1 milhão de tokens
| Modelo | Entrada: US$ por 1 milhão | Saída: US$ por 1 milhão | Custo médio ponderado por US$ 1 milhão | Contexto |
|---|---|---|---|---|
| DeepSeek V4-Flash pesos abertos | $0.140 | $0.280 | $0.168 | 1 milhão |
| DeepSeek V4-Pro pesos abertos | $0.435 | $0.870 | $0.522 | 1 milhão |
| DeepSeek R1 Distill Llama 70B pesos abertos | $0.800 | $0.800 | $0.800 | 128K |
| DeepSeek R1 pesos abertos | $0.500 | $2.15 | $0.830 | 128K |
O valor combinado representa a taxa efetiva para uma proporção de entrada para saída de 4:1, que corresponde ao que uma carga de trabalho típica de chat ou recuperação realmente gera. Trata-se do número a ser comparado entre provedores — um preço de entrada divulgado esconde o quanto a saída realmente custa.
Quanto o DeepSeek custa por mês
| Carga de trabalho | Tokens/mês | DeepSeek V4-Flash mais barato | DeepSeek R1 camada com maior capacidade |
|---|---|---|---|
| Projeto paralelo | 1 milhão de tokens de entrada / 0,25 milhão de tokens de saída | $0.21 | $1.04 |
| Equipe pequena | 20 milhões de tokens de entrada / 5 milhões de tokens de saída | $4.20 | $21 |
| Produção | 200 milhões de tokens de entrada / 50 milhões de tokens de saída | $42 | $208 |
Modele seus próprios volumes na Calculadora de custos de API de IA.
Como o DeepSeek se compara a outros provedores
Modelo mais barato de cada provedor, garantindo assim uma comparação justa com base no custo de entrada.
| Provedor | Modelo mais barato | Custo médio ponderado por US$ 1 milhão |
|---|---|---|
| Mistral AI | Mistral 7B | $0.0220 |
| Meta | Llama 3.1 8B | $0.0220 |
| Alibaba | Qwen3 8B | $0.0600 |
| Gemma 3 4B | $0.0600 | |
| Microsoft | Phi-4 | $0.0840 |
| DeepSeek esta página | DeepSeek V4-Flash | $0.168 |
| Moonshot AI | Kimi K2.7 Code | $0.980 |
| Anthropic | Claude Haiku 4.5 | $1.80 |
| Zhipu AI | GLM 5.2 | $2.00 |
| xAI | Grok 4 | $5.40 |
| OpenAI | GPT-5.6 Sol | $10.00 |
O modelo mais barato não é necessariamente o de melhor custo-benefício — verifique também sua capacidade, além do preço, no Ranking de LLMs, ou explore todos os modelos disponíveis no Banco de dados de modelos de IA.
Qual modelo DeepSeek você deve usar?
V4-Flash é o trabalho pesado em volume: 284 bilhões de parâmetros no total, com cerca de 13 bilhões
ativos por token, um contexto de 1 milhão de tokens e uma taxa combinada próxima de US$ 0,17 por 1 milhão, comparada aos US$ 10 cobrados por um modelo de ponta.
Para classificação em massa, processamento de documentos, resumo inicial, geração de dados sintéticos e camada de recuperação em um pipeline RAG, ele é quase incomparável em termos de capacidade por dólar. Um contexto de 1 milhão de tokens a esse preço não existe em nenhum outro lugar.
geração de dados e na camada de recuperação de um pipeline RAG, é quase incomparável em
capacidade por dólar. Um contexto de 1 milhão a esse preço não existe em nenhum outro lugar.
V4-Pro é a versão aberta de referência — uma mistura de especialistas com 1,6 trilhão de parâmetros,
ativando cerca de 49 bilhões de parâmetros por token, com um contexto de 1 milhão de tokens. Com uma taxa combinada de aproximadamente US$ 0,52, ele opera por cerca de um vigésimo do preço dos modelos de ponta, mantendo desempenho sólido em raciocínio geral.
opera por cerca de um vigésimo do custo das soluções de ponta, mantendo desempenho sólido em raciocínio geral.
R1 é o modelo aberto de referência em raciocínio — uma mistura de especialistas com 671 bilhões de parâmetros e 37 bilhões
ativos, oferecendo raciocínio em cadeia (chain-of-thought) a uma fração do custo proprietário. Seu contexto de 128K
é mais estreito que os 1 milhão de tokens da linha V4.
R1 Distill Llama 70B existe por um único motivo: hardware. O R1 completo requer cerca de
400 GB de VRAM em precisão de 4 bits; a versão distill precisa de cerca de 40 GB, o que o torna viável não mais apenas para "alugar um servidor", mas sim para "comprar uma estação de trabalho". Além disso, cobra US$ 0,80 tanto para entrada quanto para saída, de modo que cargas de trabalho intensivas em geração não custam mais do que aquelas intensivas em prompts — algo incomumente simples de orçamentar.
“comprar uma estação de trabalho”. Além disso, cobra $0,80 tanto para entrada quanto para saída, de modo que cargas de trabalho voltadas para geração não custam mais do que aquelas centradas em prompts — algo incomumente simples de orçamentar.
workloads cost no more than prompt-heavy ones — unusually simple to budget.
O custo de migração é menor do que você imagina
O detalhe que torna o DeepSeek uma opção genuína, e não mera curiosidade, é que a API do V4-Pro
aceita tanto os formatos de requisição da OpenAI quanto da Anthropic. A migração normalmente exige apenas alterar a URL base e a chave de acesso, sem necessidade de reescrita. A fricção de integração que normalmente protege os provedores estabelecidos praticamente desaparece, o que torna uma diferença de custo 20 vezes maior algo concretamente aplicável, e não meramente teórico.
mudança, em vez de uma reescrita. A fricção de integração que normalmente protege os provedores estabelecidos desaparece em grande parte, o que torna uma diferença de custo de 20x viável na prática, e não apenas teórica.
providers largely disappears, which is what makes a 20x cost difference actionable instead of
theoretical.
O padrão sensato não é migrar integralmente, mas sim rotear: enviar a maior parte do tráfego — alta volumetria e baixo risco — para o V4-Flash e manter um modelo de ponta apenas para as requisições que realmente o exigem. A maioria das aplicações descobre que essa divisão está fortemente inclinada para o lado mais econômico.
maioria de tráfego de baixo risco para o V4-Flash e manter um modelo de ponta apenas para as solicitações que realmente o exigirem. A maioria das aplicações descobre que essa divisão favorece fortemente a opção mais econômica.
genuinely need it. Most applications discover that the split is heavily weighted toward the
cheap side.
As pesos abertos alteram os cálculos?
Todos os modelos DeepSeek listados aqui são passíveis de download aberto, o que levanta a pergunta óbvia. Para
a maioria das equipes, a resposta honesta é que a licença garante auditabilidade e portabilidade entre provedores,
mais do que uma implantação realista em instalações próprias.
Os requisitos de hardware são o motivo. O V4-Pro exige cerca de 800 GB de VRAM em precisão de 4 bits — uma operação de data center envolvendo oito GPUs H100 de 80 GB ou mais. O R1 exige cerca de 400 GB. O V4-Flash exige cerca de
140 GB, ou duas GPUs H100 de 80 GB. Apenas a versão distill do R1, com 40 GB, cabe em hardware que uma pequena equipe efetivamente adquiriria.
140 GB ou duas GPUs H100 de 80 GB. Apenas a versão distilada R1, com 40 GB, cabe em hardware acessível a uma pequena equipe.
realmente comprar.
Comparado à precificação da API, tão baixa, o autohospedagem precisa superar uma barreira elevada: só compensa quando seu volume é suficientemente alto para manter esse hardware ocupado continuamente, e o ponto de equilíbrio
muda toda vez que o DeepSeek reduz seus preços. Faça os cálculos com seu próprio volume de tokens antes de
se comprometer com hardware. O que os pesos abertos garantem, de fato, é que você nunca ficará preso a um fornecedor, vítima de aumento abusivo de preços ou abandonado por uma descontinuação — o que tem valor mesmo que você nunca os baixe.
calculadora de autohospedagem versus API
antes de comprometer-se com o hardware. O que os pesos abertos garantem, de fato, é que você nunca poderá ser
travado, vítima de preços abusivos ou deixado para trás por uma obsolescência — o que já tem um valor, mesmo que você
nunca os baixe.
Perguntas frequentes
Quanto custa a API DeepSeek?
A precificação da API DeepSeek varia de US$ 0,168 por 1 milhão de tokens combinados no DeepSeek V4-Flash até US$ 0,830 no DeepSeek R1. A taxa combinada assume uma proporção de 4:1 entre tokens de entrada e saída. Entrada e saída são cobradas separadamente, sendo a saída sempre o lado mais caro.
Qual é o modelo DeepSeek mais barato?
DeepSeek V4-Flash, a US$ 0,140 por 1 milhão de tokens de entrada e US$ 0,280 por 1 milhão de tokens de saída. Uma carga de trabalho mensal de uma pequena equipe com 20 milhões de tokens de entrada e 5 milhões de tokens de saída custa cerca de US$ 4,20 nesse modelo.
Quanto o DeepSeek custa por mês?
Com 20 milhões de tokens de entrada e 5 milhões de tokens de saída por mês, o DeepSeek V4-Flash custa cerca de US$ 4,20 e o DeepSeek R1 cerca de US$ 21. Um projeto paralelo com 1 milhão/0,25 milhão custa uma fração mínima disso. Use a calculadora de custos de APIs de IA para seus próprios volumes.
O DeepSeek é mais barato que a Mistral AI?
Na precificação de nível básico, o DeepSeek começa em US$ 0,168 por 1 milhão de tokens combinados, enquanto a Mistral AI começa em US$ 0,0220 na Mistral 7B. A Mistral AI é o ponto de entrada mais barato, embora a capacidade difira — compare ambos no leaderboard antes de mudar.
Por que o DeepSeek cobra mais pelos tokens de saída do que pelos de entrada?
Os tokens de saída são gerados um por um e não podem ser processados em lote como um prompt, tornando seu fornecimento mais caro. É por isso que cargas de trabalho intensivas em prompts — como recuperação e classificação — são muito mais baratas de executar do que aquelas intensivas em geração, e também por que a taxa combinada é mais relevante do que o preço de entrada divulgado.
Os preços correspondem às tarifas listadas oficialmente para a principal API de cada modelo e são revisados conforme os provedores as alteram. Descontos por volume, processamento em lote ou cache de entradas não estão incluídos. Última revisão em agosto de 2026.

