Thursday, 6 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Kimi K2.7 Code expliqué : le modèle ouvert de programmation de Moonshot, doté de 1 000 milliards de paramètres

Mis à jour · Originally published June 19, 2026

Moonshot AI released Kimi K2.7 Code on June 12, 2026, and the name matters more than usual. This is not a new general chatbot called “Kimi 2.7.” It is a coding-only model: a 1-trillion-parameter Mixture-of-Experts system tuned specifically to plan, edit files, run tools, and grind through multi-step software tasks. For ordinary chat, Moonshot still points you at the older K2.6.

L’argument central est l’efficacité. Selon les affirmations de Moonshot, K2.7 Code obtient de meilleurs scores en codage que K2.6 tout en consommant environ 30 % moins de jetons de raisonnement, et son tarif est fixé à 0,95 $ par million de jetons d’entrée et à 4,00 $ par million de jetons de sortie. Il s’agit d’une fraction du prix demandé par les modèles fermés de pointe. Les poids sont publiés sous une licence MIT modifiée, ce qui vous permet également de l’exécuter localement — à condition de disposer du matériel requis pour un modèle occupant environ 595 Go sur disque, même dans sa version native quantifiée en 4 bits. Voici ce qui est vérifié, ce qui est déclaré par le fournisseur et où il s’inscrit dans le paysage actuel.

Points clés

  • Dédié au codage uniquement, pas à la conversation. « Kimi K2.7 Code » est un modèle spécialisé dédié aux agents intelligents pour le codage ; Moonshot recommande K2.6 pour les usages généraux.
  • MoE de 1 téraparamètre, 32 milliards actifs. 384 experts (8 routés + 1 partagé), 61 couches, fenêtre de contexte de 256 K, vocabulaire de 160 K, mécanisme d’attention MLA, ainsi qu’un encodeur visuel MoonViT de 400 millions de paramètres pour les entrées d’image et de vidéo.
  • Le raisonnement est obligatoire. Il n’existe aucun mode sans raisonnement ; toute tentative de désactivation déclenche une erreur API.
  • Améliorations déclarées par le fournisseur par rapport à K2.6 : +21,8 % sur Kimi Code Bench v2, +11,0 % sur Program Bench, +31,5 % sur MLS Bench Lite, avec environ 30 % moins de jetons de raisonnement.
  • Tarification agressive : $0.95 in / $4.00 out per million tokens, with cache hits near $0.19 — roughly 6x under Claude Opus 4.8 and up to ~12x under Claude Fable 5 on output.
  • Poids ouverts, exigences matérielles élevées. Licence MIT modifiée sur Hugging Face ; les poids sont fournis nativement en int4 (~595 Go), et une inférence locale réaliste nécessite encore environ 8 GPU de classe 80 Go (~640 Go de VRAM).

Ce qu’est réellement Kimi K2.7 Code

K2.7 Code est la dernière livraison de la série Kimi en constante évolution de Moonshot, et c’est le premier modèle que l’entreprise a scindé en une version spécialisée dans le codage plutôt qu’en un modèle général disposant d’un mode dédié au codage. Son objectif de conception est l’ingénierie logicielle à long terme : le type de travail où un agent lit un dépôt, planifie une modification, édite plusieurs fichiers, lance une compilation, analyse l’erreur générée, puis itère. Il est conçu pour agir, non pour converser.

Cette focalisation se reflète dans les paramètres par défaut. Le modèle s’exécute systématiquement avec le « raisonnement » activé — il est impossible de le désactiver, et l’API rejette toute requête tentant de le faire. L’hypothèse est que, pour le codage par agents intelligents, les traces de raisonnement justifient pleinement leur coût, et que les gains d’efficacité de K2.7 permettent de maîtriser ce coût. Si vous recherchez un modèle capable de répondre rapidement et à moindre coût à une question simple, Moonshot elle-même vous conseille d’utiliser K2.6 à la place. Nous présentons l’ensemble de la famille dans notre article Explication de Moonshot Kimi.

Spécifications et architecture

L’architecture repose sur un MoE creux (sparse MoE). Parmi les 1 téraparamètre au total, environ 32 milliards seulement s’activent par jeton, ce qui maintient le coût et la latence d’inférence bien en dessous de ce qu’impliquerait un modèle dense de 1 téraparamètre.

SpécificationsKimi K2.7 Code
Nombre total de paramètres1 téraparamètre (MoE)
Actifs par jeton~32 milliards
Experts384 (8 routés + 1 partagé)
Couches61 (dont 1 dense)
Fenêtre de contexte256 K tokens (262 144)
Vocabulaire160 K
AttentionMLA (attention latente multi-têtes)
ModalitéTexte, image, vidéo (via l’encodeur MoonViT de 400 M paramètres)
Précision nativeINT4 (poids MoE), attention en BF16
Mode réflexionObligatoire (ne peut pas être désactivé)
LicenceLicence MIT modifiée (poids ouverts)

L’entrée multimodale native constitue un véritable différentiateur pour un modèle dédié au codage. Vous pouvez lui fournir une capture d’écran d’une interface défectueuse, un diagramme ou un court enregistrement vidéo accompagné du code correspondant. La plupart des modèles ouverts axés sur le codage traitent uniquement du texte, ce qui élargit considérablement les cas d’usage pratiques — par exemple le débogage à partir d’une capture d’écran ou l’implémentation à partir d’une maquette — sans nécessiter de pipeline visuel séparé.

Les gains sur les benchmarks, interprétés objectivement

Les performances annoncées par Moonshot comparent K2.7 Code à K2.6 sur ses propres suites internes. Ces résultats sont fournis par le constructeur et reposent sur les benchmarks de Moonshot ; ils doivent donc être considérés comme indicatifs plutôt que comme une vérité objective neutre.

Benchmark (annoncé par le constructeur)K2.6K2.7 CodeModifier
Kimi Code Bench v250.962.0+21.8%
Program Bench48.353.6+11.0%
MLS Bench Lite26.735.1+31.5%
MCPMark Verified72.881.1+11.4%
Tokens de raisonnement utilisésréférenceenviron 30 % moins nombreuxplus efficace

Sur les benchmarks d’agents utilisant des outils (MCP Atlas, MCPMark Verified, Claw 24/7 de Kimi), Moonshot rapporte des gains d’environ 10 % par rapport à K2.6 — plus modestes, mais dans la bonne direction.

Des données indépendantes commencent à émerger. Artificial Analysis, qui réalise ses propres mesures plutôt que de republier les affirmations des constructeurs, place K2.7 Code à 42 sur son « Intelligence Index » composite, le classant aux alentours de la 6ᵉ position parmi les modèles à poids ouverts qu’il suit. Il atteint un débit de sortie d’environ 55,8 tokens par seconde, avec un délai moyen de 2,25 secondes avant le premier token sur l’API standard de Moonshot — un résultat honorable, sans toutefois battre des records ; par ailleurs, le mode réflexion obligatoire signifie que la latence réelle dans une tâche complète d’agent dépasse largement ce délai avant le premier token. (Moonshot propose également un point de terminaison haute vitesse nettement plus rapide, mais le modèle présenté ici est celui soumis aux benchmarks.)

The most useful third-party comparison comes from head-to-head coding tests. On MCPMark Verified, an agent-tool benchmark, K2.7 Code scores 81.1, edging out Claude Opus 4.8 at 76.4 — but GPT-5.5 sits well ahead at 92.9. On Moonshot’s own Program Bench, GPT-5.5 leads 69.1 to 53.6. The honest summary: K2.7 Code is competitive with frontier models on some agentic-tool tasks and clearly behind on others. It is not the new state of the art. Its case rests on price.

Tarification et rapport qualité-prix

C’est ici que K2.7 Code se distingue. Voici sa tarification API publiée, comparée à celle des modèles fermés de pointe actuels, par million de tokens.

ModèleEntréeSortie
Kimi K2.7 Code$0.95$4.00
Claude Opus 4.8$5.00$25.00
GPT-5.5$5.00$30.00
Claude Fable 5$10.00$50.00

En sortie, K2.7 Code coûte environ 6 fois moins cher qu’Opus 4.8 et plus de 12 fois moins cher que Fable 5. Les hits de cache coûtent environ 0,19 $ par million de tokens en entrée, ce qui revêt une grande importance pour les agents qui relisent fréquemment les mêmes fichiers. Combiné à la réduction d’environ 30 % du nombre de tokens de raisonnement par tâche, cet avantage s’amplifie encore.

Le compromis est simple : une capacité brute moindre par appel, mais le même budget permet d’effectuer bien plus d’appels. Pour des charges de travail intensives impliquant des agents — bots CI, refactorisations massives, génération de tests, tri automatisé — exécuter plusieurs fois K2.7 Code et conserver le meilleur résultat peut s’avérer plus rentable qu’un seul appel coûteux à un modèle de pointe. En revanche, pour une décision architecturale unique et subtile, le taux de réussite supérieur du modèle de pointe justifiera probablement encore la prime associée. Si vous évaluez différentes options sur le marché, notre synthèse des meilleurs assistants IA pour la programmation met cela en perspective.

Points forts

  • Poids ouverts sous une licence MIT modifiée permissive
  • Coût très faible par token, avec des hits de cache peu coûteux
  • Entrée native d’images et de vidéos, rare pour un modèle dédié au codage
  • Contexte de 256 K tokens adapté aux tâches agentic couvrant l’intégralité d’un dépôt
  • Réduction d’environ 30 % des tokens de raisonnement, réduisant les coûts liés aux agents

Limitations

  • Inférieur à GPT-5.5 sur plusieurs benchmarks de codage
  • Le mode réflexion obligatoire ajoute de la latence et exclut les appels rapides non fondés sur le raisonnement
  • L’hébergement local requiert des GPU de classe centre de données
  • Les gains annoncés sont fournis par le constructeur sur des suites internes
  • Non recommandé pour les conversations générales — conçu délibérément pour une utilisation ciblée

Comment l’utiliser : via l’API ou en exécutant les poids localement

La voie la plus simple consiste à utiliser l’API. K2.7 Code est disponible via l’API Kimi de Moonshot et sa CLI Kimi Code, et il prend en charge les conventions standard d’appel d’outils, ce qui permet de l’intégrer facilement dans la plupart des configurations d’agents existantes. Si vous développez sur des infrastructures d’agents, consultez notre guide sur les meilleurs frameworks d’agents IA pour savoir où s’insère un modèle comme celui-ci.

Exécuter les poids ouverts est une autre affaire, et c’est là qu’il faut garder les pieds sur terre. Comme Kimi K2 Thinking auparavant, K2.7 Code est livré pré-quantifié en int4 natif — les poids MoE sont stockés en 4 bits grâce à un entraînement tenant compte de la quantification, tandis que l’attention reste en BF16 — ce qui explique pourquoi la version publiée sur Hugging Face occupe environ 595 Go sur disque, contre environ 2 To qu’aurait nécessité une copie BF16 intégrale d’un modèle de 1 T paramètres. (Moonshot ne distribue pas de version BF16 intégrale.) Le déploiement est pris en charge par vLLM, SGLang et KTransformers.

ConfigurationRéalisme
≈ 8 GPU de classe 80 Go (≈ 640 Go de VRAM), int4 natifConfiguration recommandée en production pour contexte complet (≈ 5× H200 constitue une équivalence approximative)
4× RTX 4090 (96 Go), avec déchargement vers CPU/RAMPossible, mais contexte limité à ~64 K–128 K et débit nettement inférieur
GPU grand public uniqueNon viable pour le modèle complet

En résumé, « poids ouverts » ne signifie pas « fonctionne sur votre ordinateur portable ». Même en int4 natif, les poids occupent plus de 500 Go, si bien que, pour la plupart des équipes, l’API constitue la solution la plus rationnelle, tandis que l’hébergement local est réservé aux organisations disposant de budgets GPU importants ou de contraintes strictes en matière de résidence des données. Si l’hébergement local est une exigence impérative, envisagez des modèles plus petits présentés dans notre meilleur LLM local guide dédié au codage qui couvre des modèles adaptés au matériel réel.

Comparaison avec K2.6 et ses concurrents

Par rapport à K2.6, K2.7 Code est un meilleur outil pour les agents de codage soutenus et multi-étapes, mais un outil moins adapté à tout le reste — Moonshot lui-même recommande de conserver K2.6 pour les tâches générales. Cette spécialisation est délibérée : un modèle optimisé pour le codage agentic, l’autre pour la polyvalence.

Face au champ ouvert plus large, le concurrent évident de 2026 est le GLM-5.2 de Zhipu, un autre grand modèle ouvert qui vise la même niche d’agents spécialisés dans la programmation ; nous analysons ce dernier dans notre article dédié au GLM-5.2, et comparons les deux modèles dans GLM-5.2 contre Kimi K2.7 pour la programmation. Une comparaison directe équitable reste difficile à trancher : Zhipu a publié le GLM-5.2 sans communiquer de résultats de benchmarks officiels, et aucune tierce partie neutre n’a encore publié de scores comparables sur des tâches d’agentification liées à la programmation pour les deux modèles. Tout jugement quant à un « vainqueur » serait donc prématuré aujourd’hui. Face aux modèles fermés de pointe, K2.7 Code se positionne comme une solution économique, non comme un leader en termes de capacités : vous acceptez un écart mesurable avec GPT-5.5 en échange de poids ouverts et d’un prix pouvant être jusqu’à dix fois inférieur.

FAQ

Kimi K2.7 Code est-il un chatbot ou un modèle spécialisé en programmation ?

Il s’agit d’un modèle spécialisé en programmation, conçu pour des tâches logicielles autonomes — planification, édition de fichiers, exécution d’outils et débogage sur plusieurs étapes. Il n’est pas conçu comme un chatbot généraliste. Moonshot recommande plutôt l’ancienne version K2.6 pour les conversations générales, réservant K2.7 Code exclusivement aux tâches de programmation.

Quel est le coût de Kimi K2.7 Code ?

L’API affiche un tarif de 0,95 $ par million de jetons d’entrée et de 4,00 $ par million de jetons de sortie, avec des accès au cache à environ 0,19 $ par million de jetons d’entrée. Ce tarif est ainsi environ six fois moins élevé que celui de Claude Opus 4.8 pour les sorties, et plus de douze fois inférieur à celui de Claude Fable 5.

Puis-je exécuter Kimi K2.7 Code localement ?

Oui, les poids sont publics sous une licence MIT modifiée, mais il s’agit d’un modèle de 1 téraparamètre occupant environ 595 Go sur disque, même dans son format natif int4. Une configuration de production réaliste nécessite environ 8 GPU de classe 80 Go (~640 Go de VRAM) — soit approximativement l’équivalent de cinq H200. Un système équipé de quatre RTX 4090 peut certes l’exécuter, mais uniquement avec déchargement vers le CPU/la RAM, contexte réduit et débit inférieur ; aucun GPU grand public individuel ne peut accueillir l’intégralité du modèle.

En quoi K2.7 Code est-il meilleur que K2.6 ?

Moonshot indique des gains de +21,8 % sur Kimi Code Bench v2, +11,0 % sur Program Bench, +31,5 % sur MLS Bench Lite et +11,4 % sur MCPMark Verified, ainsi qu’une réduction d’environ 30 % du nombre de jetons de raisonnement requis par tâche. Ces chiffres proviennent de rapports internes de Moonshot sur ses propres benchmarks, et doivent donc être considérés comme indicatifs.

Kimi K2.7 Code prend-il en charge les images ?

Oui. Il intègre un encodeur visuel MoonViT de 400 millions de paramètres et accepte des entrées textuelles, d’images et de vidéos. Cela lui permet de traiter des captures d’écran, des diagrammes ou de courtes séquences vidéo — une fonctionnalité inhabituelle pour un modèle ouvert axé sur la programmation.

Kimi K2.7 Code est-il meilleur que GPT-5.5 pour la programmation ?

Non, sur la plupart des benchmarks. GPT-5.5 devance K2.7 Code sur Program Bench (69,1 contre 53,6) et sur MCPMark Verified (92,9 contre 81,1). L’avantage de K2.7 Code réside dans son coût : l’écart tarifaire permet de l’exécuter bien plus fréquemment pour le même budget, ce qui constitue un atout décisif pour les charges de travail intensives impliquant des agents autonomes.

Qu’est-ce que le « mode réflexion » et puis-je le désactiver ?

Le mode réflexion correspond à l’étape interne de raisonnement du modèle avant qu’il ne produise sa réponse. Chez K2.7 Code, ce mode est obligatoire — il n’existe pas de mode « sans réflexion », et l’API renvoie une erreur si vous tentez de le désactiver. L’amélioration revendiquée est qu’il atteint désormais les bonnes réponses en utilisant environ 30 % moins de jetons de raisonnement que K2.6.

Conclusion

Kimi K2.7 Code est une sortie ciblée et délibérément spécialisée : un agent de programmation open-weight de 1 téraparamètre qui sacrifie une réelle lacune en capacité face à GPT-5.5 pour offrir un prix très compétitif et une licence permettant de posséder pleinement le modèle. Il ne figurera pas en tête des classements, et son mode réflexion obligatoire combiné à la contrainte matérielle d’un centre de données — plus d’un téraoctet de poids même en quantification native 4 bits — signifie qu’il ne convient pas à tous. Toutefois, pour les équipes menant des volumes élevés de tâches de programmation automatisées, où le coût par tâche s’accumule rapidement, il constitue l’un des choix économiques les plus crédibles de 2026. Utilisez l’API, sauf si vous disposez des GPU requis et d’une raison impérieuse d’héberger le modèle vous-même ; testez-le sur vos propres dépôts avant de vous engager pleinement ; et conservez K2.6 pour les échanges conversationnels auxquels K2.7 Code n’a jamais été destiné.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles d’IA du site, son indice prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’auto-hébergement. Il écrit notamment des articles sur la tarification des modèles, les résultats des benchmarks et le matériel requis pour exécuter localement des modèles d’IA, privilégiant systématiquement les chiffres vérifiables aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That