À six semaines d'intervalle ce printemps, les deux laboratoires d'IA les plus en vue de Chine ont chacun lancé un nouveau produit phare. DeepSeek V4 a été lancé le 24 avril — 1 600 milliards de paramètres, sous licence MIT, avec les poids disponibles sur Hugging Face le jour même. Alibaba a riposté le 20 mai avec Qwen3.7 Max, un modèle de raisonnement à poids fermés doté d’un contexte d’un million de tokens et dont le prix est à la hauteur de son ambition.
Sur le papier, ils semblent être des concurrents. En réalité, ils s’adressent à des clientèles différentes. L’un est le modèle « frontier » sérieux le moins cher que vous puissiez exploiter vous-même ; l’autre est une API plus aboutie et plus rapide que vous louez à l’unité (token). Cet article analyse les domaines dans lesquels chacun excelle réellement : le codage, le raisonnement, le contexte, la vitesse, ainsi que l’élément qui met fin à la plupart des débats : le coût par million de tokens.
Points clés
- Très proches au niveau du codage. Vendor SWE-bench Verified scores land at 80.6% (DeepSeek V4-Pro) versus 80.4% (Qwen3.7 Max) — a rounding error apart.
- Qwen prend l'avantage grâce à son intelligence innée. Selon l'analyse indépendante d'Artificial Analysis, il obtient un score de 57 sur son indice d'intelligence, contre 52 pour DeepSeek V4-Pro.
- DeepSeek est bien moins cher. V4-Pro consomme $0,435/$0,87 par million de jetons d'entrée/sortie ; Qwen3.7 Max consomme $2,50/$7,50, soit environ 6 à 9 fois plus.
- Le véritable clivage, c'est entre « ouvert » et « fermé ». DeepSeek V4 ships open weights you can self-host; Qwen3.7 Max is API-only, with no open release as of June 2026.
- Les deux revendiquent un contexte de 1 million de jetons — mais Qwen est nettement plus rapide, avec environ 193 tokens/seconde, contre environ 80 pour DeepSeek.
- Il convient d'interpréter les analyses comparatives des fournisseurs avec prudence. Plusieurs chiffres clés sont fournis par les auteurs eux-mêmes et n'ont pas encore été reproduits de manière indépendante.
Les deux modèles en bref
DeepSeek V4 est en réalité disponible en deux versions. La V4-Pro est la plus puissante : 1,6 billion de paramètres au total, dont 49 milliards actifs par token, et repose sur une architecture « Mixture-of-Experts » clairsemée. Il existe également V4-Flash, un modèle de 284 milliards/13 milliards de paramètres destiné à des tâches moins coûteuses et à haut débit. Les deux modèles prennent en charge un contexte de 1 million de tokens et offrent une capacité de sortie maximale exceptionnellement élevée de 384 000 tokens. Ils sont tous deux distribués sous la licence permissive MIT, et leurs poids sont disponibles sur Hugging Face.
Qwen 3.7 Max est d’un tout autre genre. Alibaba n’a pas divulgué le nombre de ses paramètres — des observateurs indépendants l’estiment à environ un billion au total dans un MoE clairsemé — et, surtout, il s’agit d’un modèle à poids fermés et accessible uniquement via une API. Il n’existe aucune version téléchargeable à la date de juin 2026, ce qui marque une rupture notable avec l’héritage open source de Qwen (la gamme 3.6 propose toujours des modèles ouverts, comme la variante dense 27B). Qwen3.7 Max est clairement présenté comme un modèle de raisonnement et d’agent, s’appuyant sur une chaîne de pensée étendue avant de répondre.
Ce contexte est important pour la suite. Si vous voulez comprendre pourquoi ces deux laboratoires s'investissent autant dans ce projet, notre dossier explicatif sur l'ascension de DeepSeek présente le contexte stratégique.
| Spécifications | DeepSeek V4-Pro | Qwen3.7 Max |
|---|---|---|
| Publié | 24 avril 2026 | 20 mai 2026 |
| Poids | Open (MIT, sur Hugging Face) | Fermé / API uniquement |
| Paramètres | 1,6 T au total / 49 milliards actifs (ministère de l'Éducation) | Non communiqué (estimation : environ 1 T, marge d'erreur) |
| Fenêtre de contexte | 1 000 000 jetons | 1 000 000 jetons |
| Sortie maximale | 384 000 jetons | environ 65 000 jetons |
| Prix d'achat (/M) | $0.435 | $2.50 |
| Prix de vente (/M) | $0.87 | $7.50 |
| Vitesse de sortie | environ 80 jetons/seconde | environ 193 jetons/seconde |
Programmation : ex æquo au classement de référence
Le benchmark que tout le monde consulte en premier est SWE-bench Verified, un ensemble de tickets GitHub réels filtrés par des humains. Ici, les deux modèles sont pratiquement à égalité : la configuration la plus performante de DeepSeek (parfois appelée V4-Pro-Max) affiche un score de 80,61 TP3T, tandis que Qwen3.7 Max affiche 80,41 TP3T. Cet écart est négligeable.
Si l’on creuse un peu plus, le tableau varie selon le type de tâche. DeepSeek affiche des chiffres vertigineux en matière de programmation de type « concours » — 93,5 sur LiveCodeBench et un score de 3 206 sur Codeforces — qui reposent sur la résolution algorithmique de casse-têtes. Les points forts de Qwen résident davantage dans l’ingénierie agentique en plusieurs étapes : il affiche un score de 60,6 sur le SWE-bench Pro, plus difficile, et de 69,7 sur Terminal-Bench 2.0, des benchmarks qui récompensent un modèle capable de naviguer dans un dépôt, d’exécuter des commandes et de procéder par itérations plutôt que d’exécuter une fonction en une seule fois.
En résumé : pour les boucles d’agents autonomes visant à “ corriger ce code source ”, Qwen3.7 Max présente un léger avantage ; pour la génération de code brut et les problèmes de type compétition, DeepSeek est au moins à égalité avec lui et coûte nettement moins cher. Aucun des deux n’est toutefois le champion en termes de rapport poids/performance pour les configurations locales — ce titre revient toujours aux modèles plus petits présentés dans notre meilleur Modèle de langage local dédié au codage guide.
Une mise en garde qu’il convient de rappeler : la plupart de ces chiffres sont fournis par les fabricants. En juin 2026, les tests indépendants sont rares, et l’évaluation du V4-Pro réalisée par le CAISI (NIST) américain a conclu que ses performances en conditions réelles accusaient un retard d’environ huit mois par rapport aux principaux systèmes américains. Considérez les scores marketing comme un plafond, et non comme une garantie.
Raisonnement et intelligence générale
Pour une comparaison à égalité de conditions, la référence neutre la plus utile est Artificial Analysis, qui gère son propre indice composite d’intelligence. Dans ce classement, Qwen 3.7 Max obtient un score de 57 (ce qui le place dans le top 10 parmi plus de 150 modèles suivis), contre 52 pour DeepSeek V4-Pro dans sa configuration de raisonnement maximal. Qwen arrive en tête, mais les deux modèles se situent largement dans la zone d’avant-garde.
En matière de tests de raisonnement individuels, les fournisseurs se livrent une bataille acharnée. Qwen3.7 Max affiche un score de 92,4 au GPQA Diamond, un test de référence scientifique de niveau universitaire ; le V4-Pro de DeepSeek revendique quant à lui un score d’environ 90 à ce même test. Les deux laboratoires vantent des scores quasi parfaits lors de concours de mathématiques complexes tels que l’HMMT et l’AIME 2026, lorsqu’ils sont autorisés à utiliser des outils et à recourir à une réflexion approfondie — des chiffres qui en disent davantage sur la puissance de calcul disponible pendant l’épreuve que sur les capacités de base.
On observe une différence de comportement plus subtile. Qwen3.7 Max a été réglé pour s’abstenir plus souvent lorsqu’il n’est pas sûr d’une réponse, ce qui lui a valu le taux d’hallucination le plus bas parmi les modèles de pointe selon les propres rapports de Qwen (environ 22,91 TP3T), mais a également réduit la précision brute de rappel sur les benchmarks de connaissances pures. Si votre application repose sur la recherche augmentée et que vous préférez qu’un modèle réponde “ Je ne sais pas ” plutôt que d’inventer des réponses, c’est un atout. Si vous souhaitez qu’il tente toujours sa chance, c’est une particularité dont il faudra tenir compte.
Contexte, vitesse et « coût de la verbosité »
Les deux modèles annoncent une fenêtre de contexte de 1 million de tokens et s'appuient tous deux sur un mécanisme d'attention à long contexte remanié — des évaluateurs tiers ont fait état d'un rappel solide de la part de Qwen au-delà de la barre des 800 000 tokens. Que ce soit pour le raisonnement portant sur l'ensemble d'un référentiel ou pour l'alimentation d'une pile de longs documents, les deux modèles sont capables de traiter ces volumes.
C'est au niveau de la vitesse qu'ils se distinguent. Lors de tests indépendants, Qwen 3.7 Max atteint un débit d'environ 193 tokens par seconde ; DeepSeek V4-Pro en gère environ 80. Le temps de réponse de DeepSeek (temps avant l’affichage du premier token) est en réalité plus court (environ 1,87 s contre 2,65 s pour Qwen), ce qui donne l’impression que DeepSeek est plus réactif. début, mais Qwen traite les longues générations beaucoup plus rapidement.
Les deux sont également particulièrement « bavards ». Lors de l’exécution de l’Artificial Analysis Intelligence Index, DeepSeek V4-Pro a consommé 190 millions de jetons de sortie et Qwen3.7 Max 97 millions — des chiffres bien supérieurs à la moyenne du secteur, DeepSeek figurant parmi les modèles les plus gourmands en jetons testés. Cette verbosité se répercute sur le coût de la sortie — et comme les tokens de sortie sont les plus onéreux, un modèle de raisonnement prolixe peut discrètement faire grimper votre facture bien au-delà de ce qu’indique le prix unitaire par token.
Prix : quand l'écart devient un gouffre
C'est la victoire la plus nette du classement, et elle revient à DeepSeek.
| Modèle | Entrée /M | Débit /M | Lecture du cache /M | Mélange AA /M |
|---|---|---|---|---|
| DeepSeek V4-Pro | $0.435 | $0.87 | ~$0.004 | $0.18 |
| DeepSeek V4-Flash | $0.14 | $0.28 | ~$0.003 | — |
| Qwen3.7 Max | $2.50 | $7.50 | ~$0.25 | $1.43 |
DeepSeek V4-Pro est environ six fois moins cher en entrée et près de neuf fois moins cher en sortie que Qwen3.7 Max. Si l’on passe à la version V4-Flash, l’écart se creuse jusqu’à devenir absurde pour les tâches de chat ou de classification à haut volume. La tarification des accès au cache de DeepSeek est également extrêmement agressive : près de $0,004 par million pour les préfixes répétés, soit une remise d’environ 99% qui rend les invites système longues et stables pratiquement gratuites.
Qwen offre également une mise en cache rapide (les lectures en cache avoisinent les $0,25/M, soit une réduction de 90%), et selon la métrique combinée d’Artificial Analysis, l’écart effectif se réduit à environ 8x au lieu des 9x annoncés. Mais quelle que soit la manière dont on interprète ces chiffres, Qwen ne s’avère jamais bon marché. Vous payez pour cette vitesse supplémentaire et les quelques points supplémentaires à l’indice d’intelligence.
Lequel devriez-vous vraiment utiliser ?
Pick DeepSeek V4 if…
- Vous souhaitez disposer de modèles de poids ouverts que vous pouvez héberger vous-même, ajuster ou exécuter en mode « air-gapped » sous licence MIT ? Très bien.
- Le prix est le facteur déterminant : ce produit est 6 à 9 fois moins cher, sans compter l'importante remise liée au cache.
- Pour les tâches de génération de grande envergure, vous aurez besoin des sorties les plus longues (jusqu'à 384 000 tokens).
- Votre travail consiste en des exercices de programmation ou de mathématiques de niveau compétitif.
Choisissez Qwen 3.7 Max si…
- Vous recherchez la plus haute intelligence générale mesurée parmi les deux et cela ne vous dérange pas de payer.
- Le débit est un facteur essentiel : il permet d'obtenir des résultats deux fois plus rapidement.
- Vous mettez en place des boucles d'ingénierie autonomes en plusieurs étapes qui permettent de prendre une longueur d'avance.
- Vous préférez une API gérée et fermée, avec moins de « hallucinations », à l'auto-hébergement.
Pour la plupart des équipes, le choix relève davantage d’une question de budget et de maîtrise que de capacités. La qualité des solutions est suffisamment proche pour que ce soient les axes « ouvert vs fermé » et « économique vs haut de gamme » qui fassent pencher la balance. Si vous envisagez également des options occidentales, découvrez comment se positionnent les différents acteurs dans notre Comparaison détaillée entre GPT-5, Claude 4 et Gemini 3, et notre Comparaison entre DeepSeek et ChatGPT aborde plus en détail l'écart de valeur transfrontalier.
FAQ
Quel est le meilleur modèle pour le codage : DeepSeek V4 ou Qwen3.7 Max ?
Ils sont pratiquement à égalité sur le benchmark SWE-bench Verified (80,61 TP3T contre 80,41 TP3T). DeepSeek semble plus performant sur les benchmarks de programmation compétitive tels que LiveCodeBench et Codeforces, tandis que Qwen3.7 Max revendique un avantage sur les tâches d'ingénierie agentique telles que SWE-bench Pro et Terminal-Bench. Pour la plupart des tâches de programmation, les deux sont largement à la hauteur.
Quel modèle est le plus économique à l'usage ?
DeepSeek V4 est nettement moins cher. Le coût de la version V4-Pro s’élève à $0,435/$0,87 par million de jetons d’entrée/sortie, contre $2,50/$7,50 pour le Qwen3.7 Max — soit environ 6 à 9 fois moins cher. La variante V4-Flash de DeepSeek et sa tarification agressive du cache creusent encore davantage l’écart pour les utilisations à haut volume.
Puis-je télécharger ces modèles et les héberger moi-même ?
DeepSeek V4 (versions Pro et Flash) est fourni avec des paramètres ouverts sous licence MIT sur Hugging Face, ce qui vous permet de l'héberger vous-même et de l'ajuster. Qwen3.7 Max est un modèle aux paramètres fermés, disponible uniquement via API depuis juin 2026 ; aucune version téléchargeable n'est disponible.
Est-ce que les deux prennent vraiment en charge une fenêtre de contexte d'un million de jetons ?
Oui, les deux modèles annoncent un contexte de 1 million de tokens. DeepSeek prend également en charge jusqu’à 384 000 tokens en sortie, tandis que Qwen 3.7 Max plafonne la sortie à environ 65 000. Des évaluateurs indépendants ont signalé que Qwen présentait une excellente capacité de rappel des contextes longs au-delà de la barre des 800 000.
Lequel est le plus rapide ?
Qwen 3.7 génère un nombre maximal de flux plus rapidement : environ 193 tokens/seconde contre environ 80 pour DeepSeek V4-Pro, selon des tests indépendants. DeepSeek affiche un temps de réponse jusqu’au premier token légèrement inférieur, ce qui lui permet de commencer à répondre plus tôt, mais Qwen termine les générations longues plus rapidement.
Les résultats des tests de performance sont-ils fiables ?
Il convient de les considérer avec prudence. De nombreux chiffres phares sont communiqués par les fournisseurs eux-mêmes et n’ont pas encore été validés de manière indépendante. Des agrégateurs neutres tels qu’Artificial Analysis attribuent à Qwen3.7 Max un indice d’intelligence composite plus élevé (57 contre 52), et une évaluation du gouvernement américain (CAISI/NIST) a révélé que DeepSeek V4-Pro accuse un retard d’environ huit mois par rapport aux principaux modèles américains.
Qwen 3.7 Max est-il réellement plus performant que DeepSeek V4 ?
En ce qui concerne l'évaluation composite indépendante, l'écart est minime : 57 contre 52 sur l'indice d'intelligence d'analyse artificielle. La différence est réelle mais faible, et elle s'accompagne d'un coût élevé en termes de prix et d'ouverture. La question de savoir si ces quelques points justifient de payer environ 8 fois plus dépend entièrement de votre cas d'utilisation.
Conclusion
Ces deux modèles sont plus proches l’un de l’autre que ne le laisse entendre le battage médiatique. Sur le benchmark qui compte le plus pour les ingénieurs — le SWE-bench Verified —, ils sont à égalité, tandis que sur le benchmark d’intelligence générale Qwen3.7, Max devance de justesse, un écart confirmé par des sources indépendantes. Si la qualité seule faisait la différence, Qwen l’emporterait aux points.
Mais la qualité est rarement le seul critère déterminant. DeepSeek V4 est un modèle à poids libre, sous licence MIT, et 6 à 9 fois moins cher, ce qui en fait le choix par défaut pour tous ceux qui se soucient du coût, du contrôle ou de l’exécution de modèles sur leur propre matériel. Qwen3.7 Max est le choix idéal lorsque vous recherchez une API gérée légèrement plus intelligente et nettement plus rapide, et que le budget n’est pas une contrainte. La plupart des équipes opteront pour DeepSeek et ne remarqueront ce qui leur manque que lors des tâches agentiques les plus difficiles — si tant est qu’elles s’en rendent compte.

