Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

DeepSeek em 2026: Como um laboratório chinês tornou-se o rei do custo-benefício em IA

Atualizado · Publicado originalmente em 30 de maio de 2026

Nenhuma empresa fez mais para redefinir a economia da IA do que DeepSeek. No início de 2025, surpreendeu a indústria ao igualar modelos de ponta a uma fração do custo; em meados de 2026, com DeepSeek V4, ocupa o topo dos rankings de modelos de pesos abertos, cobrando apenas um décimo do valor praticado por laboratórios norte-americanos. Este é o panorama completo: quem é a DeepSeek, o que a V4 realmente oferece e os argumentos honestos a favor e contra sua adoção.

Principais conclusões

  • DeepSeek V4 (abril de 2026) é um modelo MoE (Mixture-of-Experts) de 1,6 trilhão de parâmetros com pesos abertos, licenciado sob a permissiva licença MIT.
  • Melhor custo-benefício em IA: ~$0.44/$0.87 per million tokens — 5-10x cheaper than GPT-5.5 or Claude Opus 4.8.
  • Codificação de classe mundial: 80,6% no SWE-bench Verificado e 93,5 no LiveCodeBench — competitivo com os melhores modelos ocidentais.
  • Contexto de 1 milhão de tokens e recuperação de longo contexto genuinamente eficaz.
  • Reservas: os dados trafegam pela China na API hospedada; a moderação de conteúdo reflete as regulamentações chinesas. A hospedagem própria dos pesos abertos evita ambos os problemas.

Quem é a DeepSeek

A DeepSeek é um laboratório de IA com sede em Hangzhou, desmembrado da High-Flyer, um fundo quantitativo fundado por Liang Wenfeng. Essa origem é relevante: a High-Flyer já havia estocado milhares de GPUs para negociação quantitativa, e a DeepSeek herdou tanto o hardware quanto uma cultura de engenharia voltada obsessivamente à eficiência. Enquanto laboratórios norte-americanos corriam para gastar mais, a característica definidora da DeepSeek tornou-se fazer mais com menos — uma filosofia que gerou modelos treinados com um custo relatado como fração do orçamento de seus concorrentes.

Os lançamentos da DeepSeek em 2025 (V3 e o modelo de raciocínio R1) foram o momento em que o Ocidente percebeu que os modelos chineses de pesos abertos não estavam anos atrás — estavam apenas meses atrás, e rapidamente alcançando o ritmo. A V4 é a continuação dessa trajetória.

EmpresaDeepSeek (Hangzhou, China)
Financiada porFundo quantitativo High-Flyer
Modelo mais recenteDeepSeek V4 (24 de abril de 2026)
ArquiteturaV4-Pro: MoE de 1,6 trilhão de parâmetros, com 49 bilhões ativos por token · V4-Flash: MoE de 284 bilhões de parâmetros, com 13 bilhões ativos
Janela de contexto1.000.000 de tokens
LicençaMIT (pesos totalmente abertos)
Preços da API~US$ 0,44 na entrada / US$ 0,87 na saída por 1 milhão de tokens
Ideal paraCodificação sensível ao custo, agentes e tarefas de longo contexto

What DeepSeek V4 actually is

A DeepSeek V4 foi lançada em 24 de abril de 2026 como dois modelos de pesos abertos:

  • V4-Pro — um modelo MoE (Mixture-of-Experts) de 1,6 trilhão de parâmetros, com 49 bilhões de parâmetros ativos por token. Trata-se do modelo principal.
  • V4-Flash — uma versão mais leve, com MoE de 284 bilhões de parâmetros e 13 bilhões ativos, projetada para servidores de alta vazão e baixo custo.

Ambos suportam uma janela de contexto de 1 milhão de tokens e lançar sob a licença MIT, o que significa que você pode baixar os pesos do Hugging Face, ajustá-los finamente e implantá-los comercialmente sem restrições ou royalties. Essa abertura é exatamente o ponto estratégico central: a DeepSeek cede o modelo gratuitamente e compete com base no preço da inferência e na marca.

A precificação que redefiniu o mercado

Essa é a manchete. A partir de uma alteração permanente de preços em maio de 2026, a API da DeepSeek custa aproximadamente US$ 0,44 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída para o modelo Pro. O V4-Flash é cerca de dez vezes mais barato ainda (~US$ 0,10/US$ 0,20).

Para contextualizar:

ModeloEntrada / 1 milhãoSaída / 1 milhãoPesos abertos
DeepSeek V4-Pro~$0.44~$0.87Sim (MIT)
GPT-5.5~$1.25~$10Não
Claude Opus 4.8~$5~$25Não
Gemini 3.5 Flash~$0.30~$2.50Não

Para uma equipe que processa milhões de tokens diariamente por meio de um agente, a diferença entre a DeepSeek e o Claude Opus equivale à diferença entre um orçamento de hobby e um item sério de infraestrutura.

Benchmarks — o modelo é realmente bom?

Baixo custo não importa se a saída for fraca. A DeepSeek V4 não é fraca. Benchmarks independentes e fornecidos pelo próprio fabricante posicionam a V4-Pro-Max em:

  • 80,6% no SWE-bench Verified — tarefas reais de engenharia de software, competitivas com modelos ocidentais de ponta.
  • 93,5 no LiveCodeBench — codificação robusta sob testes resistentes à contaminação.
  • 83,5 no MRCR 1M needle-in-a-haystack retrieval — actually surpassing Gemini 3.1 Pro on academic long-context benchmarks.

O padrão observado em 2026 é que a DeepSeek deixou de ser apenas 'boa para o preço'. Em codificação e longo contexto, ela é simplesmente boa — e o preço é um bônus.

Onde a DeepSeek se destaca

1. Custo por unidade de inteligência

Nenhum outro modelo se aproxima dessa relação custo-desempenho nesta categoria de qualidade. Se sua carga de trabalho for intensiva em tokens — agentes de programação, processamento de documentos ou RAG sobre grandes corpora — a DeepSeek muda o que é economicamente viável.

2. Pesos abertos sob licença MIT

Você pode hospedar o modelo localmente. Para setores regulados, ambientes isolados (air-gapped) ou qualquer pessoa desconfortável em enviar dados a terceiros, a capacidade de executar a V4 em seu próprio hardware (ou em uma nuvem neutra) é decisiva. A MIT é a licença mais permissiva já adotada por um modelo de ponta.

3. Longo contexto que funciona de verdade

A janela de 1 milhão de tokens não é apenas um número de folha de especificações. Os resultados no MRCR demonstram que a V4 realmente aproveita seu contexto — o que é essencial para raciocínio em bases de código inteiras e análise de documentos extensos.

Onde a DeepSeek perde — as ressalvas honestas

1. Residência dos dados na API hospedada

Se você utilizar a própria API da DeepSeek (em vez de um provedor ocidental ou hospedagem própria), seus prompts serão roteados por servidores na China e estarão sujeitos à legislação chinesa. Para muitas startups isso é irrelevante; para empresas com requisitos rigorosos de soberania de dados, trata-se de um impedimento. A solução alternativa é realista: como os pesos são licenciados sob a MIT, você pode executar a V4 por meio de um provedor ocidental (Together, Fireworks, OpenRouter) ou em sua própria infraestrutura, mantendo os dados totalmente fora da China.

2. Moderação de conteúdo alinhada às regras chinesas

Como todos os modelos hospedados na China, a implantação oficial da DeepSeek restringe temas politicamente sensíveis conforme as regulamentações chinesas. Os pesos abertos, quando auto-hospedados, comportam-se de forma diferente, mas a API hospedada recusará ou desviará certos assuntos. Saiba disso antes de construir um produto com base nesse endpoint hospedado.

3. Ferramentas e ecossistema menos polidos

O ecossistema de desenvolvedores da DeepSeek — SDKs, documentação, integrações — está evoluindo rapidamente, mas ainda fica atrás do OpenAI e da Anthropic. Você troca acabamento refinado por preço vantajoso.

DeepSeek versus a concorrência

DimensãoDeepSeek V4Qwen3.7 MaxKimi K2.6GPT-5.5
Relação preço/desempenhoClasse mundialBomMuito boaCara
Pesos abertosSim (MIT)Não (Max)SimNão
Codificação (SWE-bench)80.6%Fortes80.2%Fortes
Janela de contexto1 milhão1 milhão262K400K
Maturidade do ecossistemaEm evoluçãoBomEm evoluçãoMelhor

Vantagens e desvantagens

Vantagens da DeepSeek

  • Relação inigualável entre preço e desempenho, com qualidade de ponta
  • Pesos totalmente abertos sob licença MIT — passíveis de auto-hospedagem
  • Codificação e longo contexto de classe avançada
  • Janela de contexto de 1 milhão de tokens que realmente funciona
  • Derrubou os preços de toda a indústria

Desvantagens do DeepSeek

  • As rotas da API hospedada roteiam dados pela China
  • A moderação de conteúdo reflete as regulamentações chinesas
  • As ferramentas para desenvolvedores são menos refinadas do que as dos laboratórios norte-americanos
  • Preocupações com marca/confiança para algumas empresas

Como acessar o DeepSeek

  • API hospedada: platform.deepseek.com — a mais barata, mas os dados passam pela China.
  • Provedores ocidentais: Together AI, Fireworks e OpenRouter hospedam os pesos abertos — residência de dados no Ocidente, com custo ligeiramente superior.
  • Auto-hospedagem: Baixe os pesos da versão V4 do Hugging Face (licença MIT) e execute-os em suas próprias GPUs ou em uma nuvem neutra. Ideal para privacidade e conformidade.
  • Aplicativo para consumidores: O aplicativo e o site de bate-papo DeepSeek, destinados ao uso casual.

O que é necessário para auto-hospedar o DeepSeek V4

O termo ‘pesos abertos’ soa como ‘roda no meu PC gamer’. Não roda. A DeepSeek V4 é disponibilizada em duas variantes abertas lançadas em abril de 2026, e a diferença de requisitos de hardware entre elas é enorme. O ponto de partida honesto: ambas são modelos Mixture-of-Experts (MoE), o que tem uma consequência contra-intuitiva. Apenas uma fração dos parâmetros é ativada por token, mas todos os pesos de cada especialista ainda precisam estar residentes na VRAM. A contagem de parâmetros ativos informa sobre velocidade, não sobre a quantidade de memória que você precisa adquirir.

VarianteParâmetros totais / ativosOcupação realista local
V4-Flash284B / 13B~170 GB em precisão nativa; ~90–100 GB com quantização INT4 comunitária
V4-Pro1,6T / 49B~860 GB em precisão nativa — exclusivo para clusters

A V4-Pro não é um modelo para uso doméstico. Com cerca de 860 GB apenas para os pesos, ela exige um nó multi-GPU (por exemplo, 8 aceleradores da classe H200) ou vários nós interconectados. A menos que você seja um laboratório ou uma startup com financiamento, trate a versão Pro como um modelo acessível apenas via API.

A V4-Flash é a variante auto-hospedável, embora mesmo ela seja exigente. Em seu checkpoint nativo FP4+FP8, são necessários cerca de 170 GB de VRAM — um par de placas para data center, como as H200, ou aproximadamente quatro A100 de 80 GB. Uma quantização agressiva em INT4 feita pela comunidade reduz esse requisito para cerca de 90–100 GB, cabendo em um sistema com quatro RTX 4090 para uso interno com baixa concorrência. Algumas pessoas conseguem executá-la em duas placas de consumo, mas espere lotes muito pequenos, contexto curto e throughput de nível protótipo, não adequado para uma API em produção.

Para servir modelos, o vLLM é o padrão: ele entende a paralelização por especialistas e o comportamento do cache KV da V4, e sua paralelização tensorial prefere contagens de GPUs potências de dois (2, 4, 8). Os 1 milhão de tokens de contexto são reais, mas exigem memória adicional para o cache KV; portanto, dimensione sua infraestrutura com base no comprimento real do contexto que você utilizará, não no máximo teórico.

A pergunta decisiva raramente é «posso executá-lo?», mas sim «devo executá-lo?». A API hospedada da DeepSeek é tão barata que o autohospedagem só se torna vantajosa em termos de custo com uso sustentado e de alto volume. Abaixo desse patamar, você está adquirindo exatamente uma coisa que a API não pode oferecer: o controle sobre seus dados. Execute-o localmente quando a privacidade ou o isolamento físico (air-gapping) forem requisitos; caso contrário, a API quase sempre será o caminho mais econômico e rápido.

Perguntas frequentes

O DeepSeek é seguro para uso?

Para trabalhos não sensíveis, sim. Para dados sensíveis ou regulamentados, evite a API hospedada na China e opte pela auto-hospedagem dos pesos abertos ou por um provedor ocidental. O próprio modelo não é um malware; a preocupação refere-se exclusivamente ao roteamento de dados e à jurisdição.

O DeepSeek é realmente gratuito?

Os pesos são gratuitos (licença MIT) — você paga apenas pelo poder computacional caso faça a auto-hospedagem. A API hospedada é paga, mas extremamente barata (~US$ 0,44/US$ 0,87 por milhão de tokens). Há também um aplicativo gratuito de bate-papo para consumidores.

O DeepSeek é melhor que o ChatGPT?

Em relação ao custo-desempenho, decisivamente. Em termos de capacidade de ponta bruta e sofisticação do ecossistema, o GPT-5.5 ainda lidera. Para tarefas de programação e cargas de trabalho sensíveis ao custo, o DeepSeek é frequentemente a escolha mais inteligente; para raciocínio altamente exigente e ferramentas mais completas, o GPT-5.5 vence.

Posso executar o DeepSeek offline?

Sim — esse é justamente o propósito dos pesos abertos. A versão V4-Flash (284B) roda em uma estação de trabalho multi-GPU de alto desempenho; a V4-Pro (1,6T) exige hardware robusto, mas pode ser auto-hospedada por organizações com infraestrutura adequada.

O DeepSeek censura respostas?

A API hospedada na China restringe temas politicamente sensíveis conforme as regulamentações chinesas. Os pesos abertos auto-hospedados comportam-se de forma mais aberta. Este é o aspecto mais importante a compreender antes de desenvolver aplicações com base no endpoint hospedado.

Quem detém a propriedade do DeepSeek?

O DeepSeek é um laboratório de IA com sede em Hangzhou, originado da High-Flyer, um fundo hedge quantitativo chinês fundado por Liang Wenfeng. Essa origem no setor de fundos hedge proporcionou-lhe tanto um grande cluster pré-existente de GPUs quanto uma cultura de engenharia voltada obsessivamente para a eficiência — fator fundamental para o baixo custo operacional de seus modelos.

O DeepSeek está proibido nos EUA ou na Europa?

Não há proibição geral para consumidores em 2026, mas diversos governos e grandes organizações restringiram o uso do aplicativo hospedado do DeepSeek em dispositivos oficiais devido a preocupações com residência de dados — os dados processados pela API hospedada na China estão sujeitos à legislação chinesa. Os pesos abertos não são afetados: você pode executá-los em seu próprio hardware ou em um provedor ocidental sem quaisquer dessas restrições, sendo esse o caminho recomendado para usos sensíveis.

Quais hardwares são necessários para executar localmente o DeepSeek V4?

Isso depende inteiramente da variante. O V4-Pro (1,6 trilhão de parâmetros) exige um cluster de servidores com múltiplas GPUs e aproximadamente 860 GB de VRAM, sendo inviável para indivíduos. Já o V4-Flash (284 bilhões de parâmetros) é a opção viável para autohospedagem: cerca de 170 GB de VRAM em precisão nativa ou próximo de 90–100 GB com quantização agressiva em INT4 — o que implica uma configuração multiplaca de data center ou uma caixa com quatro placas RTX 4090 para cargas de trabalho leves e internas. Por ser um modelo Mixture-of-Experts (MoE), todos os pesos dos especialistas devem residir na memória, mesmo que apenas uma pequena fração seja executada por token.

É mais barato autohospedar o DeepSeek ou usar sua API?

Para quase todos, a API é mais barata. Os preços da API hospedada da DeepSeek são tão baixos que comprar e manter GPUs só compensa com volumes sustentados e muito altos de tokens — tipicamente centenas de milhões de tokens por mês. A verdadeira razão para optar pelo autohospedagem não é o custo, mas sim o controle: manter os dados em seus próprios servidores, atender a exigências regulatórias ou operar totalmente offline. Se esses não forem requisitos, a API deve ser a escolha padrão.

Qual é a diferença entre o DeepSeek V4-Pro e o V4-Flash?

São duas versões distintas da mesma geração. O V4-Pro é o modelo principal com 1,6 trilhão de parâmetros (49 bilhões ativos por token), projetado para capacidade máxima e executado em clusters. Já o V4-Flash é uma versão mais enxuta, com 284 bilhões de parâmetros (13 bilhões ativos), significativamente mais barata de implantar, mais rápida e a única que uma pequena equipe pode razoavelmente autohospedar. Ambos compartilham a arquitetura Mixture-of-Experts (MoE) e a janela de contexto de 1 milhão de tokens, de modo que, para muitas tarefas, o Flash entrega a maior parte do valor a uma fração do custo de hardware.

Conclusão

O DeepSeek é a força mais importante na precificação de IA hoje. A DeepSeek V4 oferece desempenho de ponta em programação e em contextos longos, é disponibilizada como pesos totalmente abertos sob licença MIT e custa uma fração de qualquer modelo de ponta ocidental. Para desenvolvedores que valorizam o custo — a maioria deles — tornou-se impossível ignorá-la.

As ressalvas são reais, mas administráveis: contorne a API hospedada na China para dados sensíveis mediante auto-hospedagem ou uso de um provedor ocidental, e entenda previamente o comportamento de moderação de conteúdo antes de lançar seu produto. Faça isso, e a DeepSeek V4 é, possivelmente, o melhor custo-benefício em inteligência artificial em 2026 — e o sinal mais claro de que está chegando ao fim a era em que laboratórios norte-americanos cobram preços premium por capacidades de ponta.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor do Convly.ai. Ele desenvolveu e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de preço-desempenho e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de autohospedagem. Escreve sobre precificação de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo consistentemente dados mensuráveis às declarações dos fornecedores.

Scroll to Top
Featured on There's An AI For That