Deux des laboratoires chinois les plus dynamiques en intelligence artificielle ont lancé, à un jour d'intervalle ce mois-ci, de nouveaux modèles open-weight dédiés à la programmation. Moonshot a présenté Kimi K2.7 Code le 12 juin ; Zhipu (Z.ai) a répondu le 13 juin avec GLM 5.2 . Ces deux modèles sont d'énormes architectures MoE (Mixture-of-Experts), disposent de licences permissives et visent explicitement la même tâche : la programmation agente à long terme, sans recourir aux coûts associés à Claude ou à GPT.
The twist is in how each lab handled benchmarks. Moonshot published a stack of first-party numbers for K2.7 Code on day one. Zhipu deployed GLM 5.2 to its Coding Plan tiers first with no benchmark table at all, then released a full benchmark set alongside the API and MIT open weights days later. So as of this writing, both models now have vendor-published coding scores — but neither has a deep bench of fully independent SWE-bench numbers yet, and Moonshot’s headline figures sit on proprietary in-house suites that practitioners have already started to question. Here’s how the two actually stack up, what we can verify, and what’s still a question mark.
Points clés
- Des architectures différentes, mais un objectif identique. Kimi K2.7 Code is a 1T-param MoE with 32B active and 256K context; GLM 5.2 is ~744-753B total with ~40B active and a full 1M context.
- Les deux modèles disposent désormais de benchmarks fournis par leurs éditeurs. Moonshot reports +21.8% on its own Kimi Code Bench v2 (62.0 vs 50.9) plus ~30% fewer reasoning tokens. Zhipu later published GLM 5.2 scores too — SWE-bench Pro 62.1, Terminal-Bench 2.1 81.0, FrontierSWE 74.4 — beating GPT-5.5 on several long-horizon suites. Treat both vendors’ numbers with caution until independent runs land.
- Le tarif favorise Kimi au niveau du coût par jeton, et GLM au niveau du forfait mensuel. Kimi est facturé à 0,95 $ en entrée / 4,00 $ en sortie par million de jetons ; GLM est facturé environ à 1,40 $ en entrée / 4,40 $ en sortie, ou selon un forfait mensuel « GLM Coding Plan » à partir de 10 $/mois (version Lite).
- Les deux modèles sont véritablement ouverts et compatibles avec une utilisation commerciale. GLM 5.2 est sous licence MIT ; Kimi utilise une licence MIT modifiée (utilisation commerciale autorisée, avec obligation d’attribution uniquement si vous dépassez 100 millions d’utilisateurs actifs mensuels ou un chiffre d’affaires mensuel de 20 millions de dollars).
- GLM s’intègre nativement à Claude Code. Z.ai expose un point de terminaison compatible avec Anthropic, permettant ainsi aux agents existants utilisant Claude Code ou le SDK Anthropic de fonctionner immédiatement, moyennant simplement un changement d’URL de base et de clé d’API.
- L’exécution locale des poids n’est pas envisageable sur un ordinateur portable. Avec plus de 744 milliards et 1 000 milliards de paramètres, ces modèles nécessitent des serveurs multi-GPU ou une forte quantification — la plupart des utilisateurs commenceront donc par les API cloud.
- Version en 30 secondes
- Architecture et paramètres actifs
- Fenêtre de contexte : 1 million contre 256 Ko
- Benchmarks de codage (et l'écart de transparence)
- Tarification et rapport qualité-prix
- Licence et caractère ouvert
- Capacités agentic et utilisation d'outils
- Comment exécuter concrètement chacun des deux modèles
- Leur positionnement par rapport à DeepSeek V4 et à Qwen 3.x
- FAQ
- Conclusion
- Articles connexes
Version en 30 secondes
Si vous recherchez le contexte le plus long, les meilleurs scores de codage publiés parmi les modèles open-weight, une licence MIT, une facturation mensuelle forfaitaire et une compatibilité immédiate avec Claude Code, GLM 5.2 constitue aujourd’hui l’offre la plus complète. Si, en revanche, vous privilégiez le tarif le plus bas par jeton, la meilleure réduction sur les jetons mis en cache pour les boucles d’agents gourmandes en jetons, ainsi que des gains mesurés en efficacité token, Kimi K2.7 Code s’impose comme un choix plus léger. Pour l’instant, les benchmarks des deux fournisseurs sont internes, et un test comparatif mono-tâche a accordé à GLM une légère avance — toute proclamation d’un vainqueur définitif cette semaine repose donc davantage sur le marketing des éditeurs que sur des données indépendantes.
Architecture et paramètres actifs
Ces modèles reposent sur la même idée générale — une vaste architecture MoE (Mixture of Experts) creuse, où seul un sous-ensemble des paramètres est activé par jeton — mais ils l’ajustent différemment.
Sur le papier, Kimi K2.7 Code est le modèle le plus volumineux : 1 trillion de paramètres au total, dont 32 milliards activés par jeton, tirés de 384 experts (8 experts routés plus 1 expert partagé par jeton). Cette activation creuse explique pourquoi un modèle d’un trillion de paramètres peut être déployé à un coût raisonnable. GLM 5.2 est plus petit en termes de paramètres totaux (les documents de Z.ai mentionnent environ 753 milliards, tandis que des outils comme vLLM indiquent environ 744 milliards), mais active légèrement plus de paramètres par jeton (~40 milliards) et mise sur un contexte plus long ainsi qu’un système dual d’effort cognitif — un mode « High » pour les tâches courantes et un mode « Max » pour les problèmes complexes d’architecture et de débogage.
L’interprétation pratique est la suivante : le plus grand nombre d’experts de Kimi pourrait favoriser la diversité des connaissances, tandis que le nombre supérieur de paramètres activés par jeton chez GLM, combiné à ses modes d’effort, vise une profondeur accrue sur un problème unique et complexe. Les benchmarks publiés penchent actuellement en faveur de GLM pour l’ingénierie à long terme, mais ces résultats proviennent des éditeurs eux-mêmes ; il convient donc de considérer leur argumentation architecturale comme une preuve complémentaire plutôt qu’un verdict définitif.
Fenêtre de contexte : 1 million contre 256 Ko
C’est la différence la plus claire et la plus vérifiable. GLM 5.2 intègre un contexte authentique de 1 000 000 de jetons (la glm-5.2[1m] variante), avec une sortie limitée à environ 128 000–131 000 jetons. Kimi K2.7 Code offre un contexte de 256 000 jetons (262 144 jetons) et un plafond de sortie par défaut bien plus faible, fixé à 32 768 jetons.
Pour les travaux agents à l’échelle d’un dépôt — chargement d’une grande base de code, traces longues de planification puis d’exécution, refactorisations multi-fichiers en une seule passe — la fenêtre de 1 million de jetons de GLM constitue un avantage réel, aligné sur ce que proposent désormais les modèles open-source de pointe tels que DeepSeek V4 and Qwen 3.6 Plus now offer. That said, 256K is still large, and in agentic loops most well-built tools retrieve and chunk context rather than stuffing the whole repo in. Bigger context helps; it isn’t automatically better code.
Benchmarks de codage (et l'écart de transparence)
C’est ici qu’il faut garder un esprit critique, car chaque chiffre présenté ci-dessous provient directement des éditeurs.
Moonshot affirme que K2.7 Code obtient un score de 62,0 sur son benchmark interne Kimi Code Bench v2, soit une progression de 21,8 % par rapport aux 50,9 obtenus par K2.6, accompagnée de gains sur Program Bench et des suites agentic axées sur MCP, ainsi qu’une réduction d’environ 30 % de la consommation de jetons de raisonnement. Ce sont des affirmations précises — mais elles reposent sur des benchmarks propriétaires de Moonshot, et au moins un média (VentureBeat) rapporte que des praticiens estiment que ces chiffres ne se vérifient pas pleinement en conditions réelles. Aucun résultat indépendant sur SWE-bench Verified ou SWE-bench Pro n’était disponible pour K2.7 Code au moment de la rédaction.
GLM 5.2 came out the other way around: it launched on Zhipu’s Coding Plan tiers with no benchmark table, then Z.ai published a full set alongside the API and open weights. Those scores are strong — SWE-bench Pro 62.1 (vs GPT-5.5’s 58.6 and GLM 5.1’s 58.4), Terminal-Bench 2.1 (Terminus-2) 81.0 (vs GPT-5.5’s 84.0), FrontierSWE 74.4% (vs GPT-5.5’s 72.6%), plus long-horizon wins on PostTrainBench (34.3 vs 28.4) and SWE-Marathon (13.0 vs 12.0). Several of those were run by outside evaluators (Proximal, the PostTrainBench team, Abundant AI), but they’re surfaced and curated by Z.ai, so treat them as vendor-published rather than fully independent. The takeaway: GLM 5.2 posts the stronger open-weight coding numbers on paper, while still trailing Claude Opus 4.8 on most of them.
Un point de données plus proche de la neutralité existe néanmoins. Une comparaison tête-à-tête, menée de façon relativement indépendante par Kilo, a attribué à GLM 5.2 un avantage en matière de planification — 9,0 contre 8,1 pour Kimi sur une tâche de service de drapeaux fonctionnels backend, GLM ayant passé les 15/15 vérifications contre 14/15 pour Kimi, les deux modèles produisant des versions fonctionnelles quasi identiques. Il s’agit d’un signal utile, mais il ne repose que sur une seule tâche évaluée par un seul acteur, et non sur une suite de benchmarks.
| Spécifications | GLM 5.2 (Zhipu / Z.ai) | Kimi K2.7 Code (Moonshot) |
|---|---|---|
| Publié | 13 juin 2026 | 12 juin 2026 |
| Paramètres totaux / actifs | ~744–753 milliards MoE / ~40 milliards | 1 trillion MoE / 32 milliards (384 experts) |
| Fenêtre de contexte | 1 000 000 jetons | 256 000 jetons (262 144) |
| Sortie maximale | ~128–131 000 jetons | ~32 000 jetons (32 768) |
| Benchmarks officiels de codage | SWE-bench Pro 62,1 ; Terminal-Bench 2.1 81,0 ; FrontierSWE 74,4 % (publiés par l’éditeur, certains exécutés par des tiers) | +21,8 % sur Kimi Code Bench v2 (62,0 contre 50,9, déclaré par l’éditeur) |
| SWE-bench indépendant | Pas encore disponible (suites publiques) | Pas encore disponible |
| Prix de l’API (par million) | ~1,40 $ en entrée / ~4,40 $ en sortie ; abonnement forfaitaire à partir de 10 $/mois | 0,95 $ en entrée / 4,00 $ en sortie ; 0,19 $ pour les entrées mises en cache |
| Licence | MIT | Licence MIT modifiée (utilisation commerciale autorisée ; attribution requise si >100 M d’utilisateurs actifs mensuels ou >20 M $ de revenus mensuels) |
| Compatibilité des points de terminaison | Compatible OpenAI et Anthropic | Compatible OpenAI (Moonshot / OpenRouter) |
Tarification et rapport qualité-prix
Les modèles de tarification sont structurés différemment, donc la réponse à la question « lequel est le moins cher ? » dépend de l’usage.
Kimi K2.7 Code suit un modèle d’API à l’usage simple : 0,95 $ par million de jetons d’entrée, 4,00 $ par million de jetons de sortie, et un taux notable de 0,19 $ par million pour les jetons d’entrée mis en cache. Ce taux de mise en cache est crucial pour le codage agent, où une grande partie du contexte stable est renvoyée à chaque étape. À ces tarifs, Kimi est nettement moins coûteux que les modèles de pointe occidentaux — rien qu’au niveau du prix de sortie, plus de dix fois moins cher que les options haut de gamme.
GLM 5.2 suit un modèle à l’usage d’environ 1,40 $ d’entrée / 4,40 $ de sortie par million (disponible en temps réel chez des fournisseurs comme FriendliAI, Novita et Z.ai), mais Zhipu propose également le GLM Coding Plan, un abonnement forfaitaire avec des niveaux Lite, Pro, Max et Team. Le niveau Lite commence à 10 $/mois (environ 400 prompts/semaine), le Pro à 30 $/mois et le Max à 80 $/mois — une excellente valeur si vous codez quotidiennement avec ce modèle et souhaitez une facturation prévisible.
Si vous êtes un développeur solo qui passe sa journée entière dans un agent, l’abonnement forfaitaire de GLM peut s’avérer le choix le plus économique en pratique. Si vos charges de travail varient ou sont ponctuelles, ou si vous développez un produit par-dessus, le tarif à l’usage de Kimi, combiné à son faible coût de mise en cache, est plus facile à modéliser. Pour une vue d’ensemble plus large des coûts parmi les options auto-hébergées, notre comparatif des meilleur Modèle de langage local dédié au codage en 2026 met les deux modèles en perspective.
Licence et caractère ouvert
Les deux modèles sont véritablement open-weight, ce qui les distingue des laboratoires fermés de pointe — mais les détails juridiques diffèrent.
GLM 5.2 utilise une licence MIT classique : vous pouvez l’utiliser, la modifier et la distribuer à des fins commerciales, sans restriction. Kimi K2.7 Code adopte une licence MIT modifiée, qui autorise aussi l’usage commercial, mais ajoute une condition : si votre produit dépasse 100 millions d’utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, vous devez afficher de façon visible « Kimi K2.7 Code » dans l’interface utilisateur. Pour quasiment toutes les équipes, cela ne pose aucun problème ; pour un hyperscaler, c’est une clause réelle. Sur le seul critère de permissivité, la licence MIT de GLM 5.2 lui donne un léger avantage.
Points forts de GLM 5.2
- Contexte complet de 1 million de jetons adapté aux travaux à l’échelle d’un dépôt
- Meilleurs scores de codage publiés parmi les modèles open-weight
- Licence MIT sans restriction
- Compatibilité immédiate avec les points de terminaison Anthropic et OpenAI
- Plan de codage à tarif forfaitaire à partir de 10 $/mois
- Contrôle dual de l’effort cognitif (modes « High » et « Max »)
Mises en garde concernant GLM 5.2
- Les benchmarks sont publiés par l’éditeur (certains exécutés par des tiers) ; aucune suite SWE-bench indépendante étendue n’est encore disponible
- Tarif par jeton de l’API légèrement supérieur à celui de Kimi
- Nombre total de paramètres inférieur
Capacités agentic et utilisation d'outils
Les deux modèles ciblent explicitement les agents de codage à long terme, et non seulement la complétion de snippets, et tous deux exposent des capacités solides d’appel d’outils.
Le point fort de GLM 5.2 pour les concepteurs d’agents réside dans sa compatibilité : comme Z.ai fournit un point de terminaison compatible Anthropic (en plus d’un point de terminaison compatible OpenAI), vous pouvez rediriger Claude Code ou un agent utilisant le SDK Anthropic vers ce modèle simplement en changeant l’URL de base et la clé — sans réécriture. Il s’intègre nativement à Cline, Cursor et plus de 20 outils de développement, et ses scores publiés à long terme (FrontierSWE, PostTrainBench, SWE-Marathon) visent précisément les charges de travail d’agents s’étalant sur plusieurs heures. Kimi K2.7 Code mise sur l’efficacité mesurée des agents : la réduction de ~30 % des jetons de raisonnement rapportée par Moonshot vise directement le coût et la latence des boucles d’agents multi-étapes, et le modèle affiche des gains sur des suites orientées MCP. Si vous choisissez un cadre d’agent autour de l’un ou l’autre, notre guide sur les meilleur frameworks d’agents IA en 2026 traite de la couche d’orchestration.
Comment exécuter concrètement chacun des deux modèles
Il existe deux voies, et pour la plupart des personnes, la réponse passe par le cloud.
API cloud est la solution la plus simple. Kimi K2.7 Code est disponible via l’API de Moonshot et des agrégateurs comme OpenRouter ; GLM 5.2 est accessible via le GLM Coding Plan et des points de terminaison compatibles OpenAI/Anthropic (URL de base api.z.ai). C’est là que devrait commencer la quasi-totalité des utilisateurs.
Poids ouverts sont publiés — Kimi K2.7 Code est disponible sur Hugging Face avec un support pour vLLM, SGLang et KTransformers, et les poids MIT de GLM 5.2 sont téléchargeables — mais les exigences matérielles sont importantes. Un modèle d’un trillion de paramètres (même avec seulement 32 milliards activés) ou un modèle d’environ 750 milliards nécessite des serveurs multi-GPU ou une quantification GGUF très agressive pour fonctionner localement ; il ne s’agit pas de modèles exécutables sur une seule carte graphique grand public. Si votre objectif est d’héberger localement des modèles de codage plus petits sur du matériel grand public, vous obtiendrez de bien meilleurs résultats avec les Meilleurs modèles de langage locaux à exécuter sur Ollama en 2026 que par l'un ou l'autre de ces poids lourds.
How they fit next to DeepSeek V4 and Qwen 3.x
Neither model exists in a vacuum. DeepSeek V4-Pro (released April 2026) ships 1.6T params with a 1M context and an MIT license, and posts a verified 80.6% on SWE-bench Verified — currently the strongest open-weight number around. Qwen 3.6 Plus also offers a 1M context and a frontier-competitive 78.8% on SWE-bench Verified. In other words, GLM 5.2 and Kimi K2.7 Code are entering a crowded, fast-moving field where rivals already have published, partly independent benchmarks on the standard public suites. GLM 5.2’s vendor numbers are competitive, but the gold-standard SWE-bench Verified comparisons still belong to DeepSeek and Qwen for now. For a closer look at that pair, see our comparaison DeepSeek V4 contre Qwen3.
FAQ
GLM 5.2 ou Kimi K2.7 Code est-il meilleur pour la programmation ?
Il n'existe pas encore de réponse entièrement indépendante, mais d'après les résultats publiés, GLM 5.2 semble plus performant pour la programmation à long terme : les benchmarks de Zhipu le placent à 62,1 % sur SWE-bench Pro et à 74,4 % sur FrontierSWE, dépassant GPT-5.5 sur plusieurs suites, avec une fenêtre contextuelle de 1 million de jetons et une compatibilité avec Claude Code. Kimi K2.7 Code est moins coûteux par jeton et affiche un gain de +21,8 % sur son propre benchmark dédié à la programmation. Un test tête-à-tête mono-tâche (Kilo) a accordé à GLM un léger avantage en matière de planification (9,0 contre 8,1, et 15/15 contre 14/15 validations). Tous les scores mentionnés ici proviennent de publications du fournisseur ; attendez donc les résultats indépendants sur SWE-bench avant de considérer ces chiffres comme définitifs.
GLM 5.2 dispose-t-il de benchmarks publiés ?
Oui — mais pas à sa sortie. Zhipu a déployé GLM 5.2 pour la première fois dans ses niveaux « Coding Plan » le 13 juin 2026, sans tableau de benchmarks, puis a publié l'intégralité de ses résultats quelques jours plus tard, simultanément au lancement de son API et à la diffusion de ses poids open-weight sous licence MIT : SWE-bench Pro (62,1 %), Terminal-Bench 2.1 (81,0 %), FrontierSWE (74,4 %), PostTrainBench (34,3 %) et SWE-Marathon (13,0 %), surpassant GPT-5.5 sur plusieurs suites axées sur la programmation à long terme, tout en restant inférieur à Claude Opus 4.8 sur la plupart des benchmarks. Certains de ces tests ont été réalisés par des évaluateurs tiers, mais leur conception et leur sélection ont été pilotées par Z.ai : il s'agit donc de résultats publiés par le fournisseur, non d'évaluations entièrement indépendantes.
Puis-je utiliser GLM 5.2 avec Claude Code ?
Oui. Z.ai expose un point de terminaison compatible Anthropic (sous api.z.ai, par exemple https://api.z.ai/api/anthropic ou le point de terminaison dédié à la programmation), ce qui vous permet de faire pointer Claude Code ou un agent basé sur le SDK Anthropic vers GLM 5.2 en définissant simplement ANTHROPIC_BASE_URL et votre clé API Z.ai, puis en sélectionnant le modèle glm-5.2 (ou glm-5.2[1m]) — aucune modification de code n'est requise. Prévoyez toutefois d'augmenter le délai d'attente maximal des requêtes, car la latence avant le premier jeton sur une fenêtre contextuelle de 1 million de jetons est supérieure à la valeur par défaut de Claude.
Quel est le coût de chaque modèle ?
Kimi K2.7 Code est facturé à hauteur de 0,95 $ par million de jetons d'entrée, 4,00 $ par million de jetons de sortie, et 0,19 $ par million de jetons mis en cache. GLM 5.2 est facturé environ 1,40 $ par million de jetons d'entrée / 4,40 $ par million de jetons de sortie, ou vendu via le forfait « GLM Coding Plan », à partir de 10 $/mois (version Lite), 30 $ pour la version Pro et 80 $ pour la version Max.
Kimi K2.7 Code est-il gratuit pour une utilisation commerciale ?
De fait, oui. Il utilise une licence MIT modifiée autorisant l'usage commercial ; la seule condition supplémentaire stipule que les produits dépassant 100 millions d'utilisateurs actifs mensuels ou générant plus de 20 millions de dollars de revenus mensuels doivent afficher la mention « Kimi K2.7 Code » dans leur interface utilisateur. La licence MIT classique de GLM 5.2 ne comporte aucune clause similaire.
Puis-je exécuter localement ces modèles ?
Les poids sont disponibles — Kimi K2.7 Code sur Hugging Face (compatible vLLM/SGLang/KTransformers) et GLM 5.2 sous licence MIT — mais il s'agit de très grands modèles MoE (Mixture of Experts). Vous devrez probablement recourir à des serveurs multi-GPU ou appliquer une forte quantification ; aucun des deux ne fonctionne confortablement sur une seule carte graphique grand public.
Lequel offre la plus grande fenêtre contextuelle ?
GLM 5.2, et de loin : 1 000 000 de jetons contre 256 000 pour Kimi K2.7 Code. Cela rend GLM mieux adapté aux contextes couvrant l'intégralité d'un dépôt ou à des traces d'agents extrêmement longues, bien que des outils d'agent performants réduisent la fréquence à laquelle on a besoin de la fenêtre complète.
Conclusion
Il s'agit de deux excellents modèles open-source dédiés à la programmation, lancés à un jour d'intervalle, et le verdict honnête est qu'ils sont très proches — GLM 5.2 détient actuellement un léger avantage sur le papier. Les deux fournisseurs ont publié des benchmarks spécifiques à la programmation, et ceux de Zhipu sont les plus élevés (62,1 % sur SWE-bench Pro, 74,4 % sur FrontierSWE, supérieurs à GPT-5.5 sur plusieurs suites axées sur la programmation à long terme), en plus d'une fenêtre contextuelle de 1 million de jetons, d'une licence MIT sans restriction, d'une facturation prévisible à tarif fixe et d'une intégration transparente avec Claude Code. Kimi K2.7 Code répond avec le prix le plus bas par jeton, une remise intéressante sur les jetons mis en cache, des boucles d'agent particulièrement efficaces en termes de consommation de jetons, ainsi que des gains propres qu'il revendique.
Si vous mettez en production un produit ou si vous exécutez des charges de travail variables intensives, commencez par l'API à l'usage de Kimi et profitez de sa remise sur la mise en cache. Si vous passez vos journées immergé dans un agent de programmation et que vous accordez une grande importance à une fenêtre contextuelle de 1 million de jetons, aux meilleurs scores publiés et à une compatibilité immédiate avec Anthropic, le forfait « Coding Plan » de GLM 5.2 est difficile à battre. Et quel que soit votre choix, souvenez-vous que tous les chiffres cités ici proviennent des fournisseurs — attendez les résultats indépendants sur SWE-bench Verified avant de considérer comme établie toute affirmation marketing. Dans un domaine où DeepSeek V4-Pro affiche déjà un score vérifié de 80,6 % sur SWE-bench Verified, la référence pour désigner le « meilleur modèle open-source de programmation » repose sur les évaluations d'observateurs neutres, non sur les déclarations des laboratoires ayant conçu les modèles.

