{"id":1718,"date":"2026-07-29T13:02:55","date_gmt":"2026-07-29T13:02:55","guid":{"rendered":"https:\/\/convly.ai\/?p=1718"},"modified":"2026-07-29T13:02:55","modified_gmt":"2026-07-29T13:02:55","slug":"microsoft-llm-routing-architecture-aks","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/","title":{"rendered":"L\u2019architecture de routage des grands mod\u00e8les linguistiques (LLM) de Microsoft pour les agents IA sur AKS d\u00e9taill\u00e9e"},"content":{"rendered":"<p>Selon un rapport d\u2019InfoQ, Microsoft a d\u00e9taill\u00e9 une architecture de routage des grands mod\u00e8les linguistiques (LLM) en trois couches destin\u00e9e aux agents IA s\u2019ex\u00e9cutant sur Azure Kubernetes Service (AKS). Cette architecture de routage des LLM r\u00e9pond \u00e0 l\u2019une des questions op\u00e9rationnelles les plus pressantes dans le domaine actuel des agents IA : quel mod\u00e8le doit traiter quelle demande, et quelle partie de la pile logicielle doit prendre cette d\u00e9cision ? Bien que le titre d\u2019InfoQ ne fournisse que peu de d\u00e9tails techniques, cette divulgation rev\u00eat une importance particuli\u00e8re, car le routage devient rapidement le point de contr\u00f4le central des co\u00fbts, de la latence et de la qualit\u00e9 dans les syst\u00e8mes d\u2019agents en production \u2014 et le fait qu\u2019un important fournisseur de services cloud en fasse un motif architectural formalis\u00e9 constitue un signal m\u00e9ritant une attention soutenue.<\/p>\n<div class=\"convly-tldr\">\n<h3>Points cl\u00e9s<\/h3>\n<ul>\n<li>Selon InfoQ, Microsoft a d\u00e9taill\u00e9 une architecture de routage des LLM en trois couches destin\u00e9e aux agents IA s\u2019ex\u00e9cutant sur Azure Kubernetes Service (AKS).<\/li>\n<li>Le routage des LLM d\u00e9termine quel mod\u00e8le traite chaque demande et est devenu un levier essentiel pour ma\u00eetriser les co\u00fbts, la latence et la qualit\u00e9 des sorties dans les syst\u00e8mes d\u2019agents.<\/li>\n<li>Les charges de travail agentic multiplient le nombre d\u2019appels aux mod\u00e8les par t\u00e2che, transformant ainsi un routage intelligent d\u2019une simple optimisation en une n\u00e9cessit\u00e9 \u00e9conomique.<\/li>\n<li>Concevoir le routeur sur AKS sugg\u00e8re que le routage est consid\u00e9r\u00e9 comme une infrastructure de plateforme plut\u00f4t que comme un code applicatif.<\/li>\n<li>Au-del\u00e0 du titre, les pr\u00e9cisions techniques restent limit\u00e9es ; la signification plus large r\u00e9side dans le fait qu\u2019un grand fournisseur de services cloud \u00e9l\u00e8ve le routage des mod\u00e8les au rang de motif de conception de premier plan.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a705c41ae873\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a705c41ae873\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#What_InfoQ_reports_about_Microsofts_three-layer_routing_design\" >Ce que rapporte InfoQ sur la conception de routage en trois couches de Microsoft<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#Why_LLM_routing_has_become_critical_for_AI_agents\" >Pourquoi le routage des LLM est devenu critique pour les agents IA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#Inside_a_layered_routing_stack_what_three_layers_typically_mean\" >\u00c0 l\u2019int\u00e9rieur d\u2019une pile de routage en couches : ce que signifient typiquement ces trois couches<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#Why_Azure_Kubernetes_Service_as_the_platform\" >Pourquoi Azure Kubernetes Service comme plateforme<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#The_economics_routing_as_the_new_cost-control_layer\" >L\u2019aspect \u00e9conomique : le routage comme nouvelle couche de ma\u00eetrise des co\u00fbts<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#What_it_means_for_teams_building_AI_agents\" >Ce que cela implique pour les \u00e9quipes d\u00e9veloppant des agents IA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#Frequently_asked_questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/microsoft-llm-routing-architecture-aks\/#The_bottom_line\" >En r\u00e9sum\u00e9<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_InfoQ_reports_about_Microsofts_three-layer_routing_design\"><\/span>Ce que rapporte InfoQ sur la conception de routage en trois couches de Microsoft<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>InfoQ, une publication sp\u00e9cialis\u00e9e dans l\u2019architecture logicielle orient\u00e9e vers les praticiens, a couvert ce qu\u2019elle d\u00e9crit comme une architecture de routage des LLM en trois couches, con\u00e7ue par Microsoft pour les agents IA sur AKS. Ce cadre est en soi remarquable : il ne s\u2019agit pas d\u2019un lancement de produit grand public, mais d\u2019un compte rendu ax\u00e9 sur l\u2019ing\u00e9nierie expliquant comment le trafic des agents peut \u00eatre achemin\u00e9 entre diff\u00e9rents grands mod\u00e8les linguistiques sur une infrastructure Kubernetes g\u00e9r\u00e9e. Au-del\u00e0 du titre, les informations disponibles ne pr\u00e9cisent pas le contenu de chaque couche, ne nomment pas les mod\u00e8les sp\u00e9cifiques impliqu\u00e9s, ni ne citent de chiffres de performance ; toute affirmation d\u00e9taill\u00e9e concernant les composants internes doit donc \u00eatre formul\u00e9e avec prudence jusqu\u2019\u00e0 l\u2019examen du document complet. Ce qui peut \u00eatre affirm\u00e9 avec certitude, c\u2019est que Microsoft pr\u00e9sente le routage \u2014 la logique situ\u00e9e entre un agent et un ensemble de mod\u00e8les \u2014 comme un syst\u00e8me structur\u00e9 et hi\u00e9rarchis\u00e9 en soi, et qu\u2019AKS est la plateforme retenue pour en d\u00e9crire l\u2019impl\u00e9mentation. Pour les \u00e9quipes infrastructure, cette combinaison de routage et de Kubernetes constitue l\u2019essence m\u00eame de l\u2019histoire.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Why_LLM_routing_has_become_critical_for_AI_agents\"><\/span>Pourquoi le routage des LLM est devenu critique pour les agents IA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Pour comprendre pourquoi cela importe, examinons comment les agents consomment r\u00e9ellement les mod\u00e8les. Une seule demande utilisateur adress\u00e9e \u00e0 un agent entra\u00eene rarement un seul appel au mod\u00e8le. L\u2019agent peut planifier, d\u00e9composer la t\u00e2che, s\u00e9lectionner des outils, r\u00e9diger un brouillon, v\u00e9rifier, r\u00e9sumer ou retenter \u2014 chaque \u00e9tape g\u00e9n\u00e9rant sa propre requ\u00eate d\u2019inf\u00e9rence. Certaines de ces \u00e9tapes n\u00e9cessitent effectivement un mod\u00e8le de pointe ; beaucoup d\u2019autres non. Envoyer chaque appel au mod\u00e8le le plus volumineux et le plus co\u00fbteux gonfle inutilement les factures et la latence sans am\u00e9liorer la qualit\u00e9, tandis qu\u2019envoyer syst\u00e9matiquement toutes les demandes \u00e0 un petit mod\u00e8le d\u00e9grade les r\u00e9sultats sur les \u00e9tapes complexes.<\/p>\n<p>Le routage des LLM consiste \u00e0 associer chaque appel au mod\u00e8le le moins co\u00fbteux suffisant pour accomplir la t\u00e2che. Bien mis en \u0153uvre, il permet de r\u00e9duire substantiellement les d\u00e9penses tout en maintenant une qualit\u00e9 constante, car la distribution de la difficult\u00e9 entre les sous-t\u00e2ches d\u2019un agent est fortement biais\u00e9e vers les cas simples. \u00c0 mesure que le nombre de mod\u00e8les viables augmente \u2014 un paysage que vous pouvez explorer dans notre <a href=\"https:\/\/convly.ai\/fr\/models\/\">Base de donn\u00e9es des mod\u00e8les IA<\/a> \u2014 la d\u00e9cision de routage devient \u00e0 la fois plus pr\u00e9cieuse et plus difficile \u00e0 prendre manuellement. C\u2019est pr\u00e9cis\u00e9ment ce foss\u00e9 qu\u2019une architecture de routage formalis\u00e9e est con\u00e7ue pour combler.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Inside_a_layered_routing_stack_what_three_layers_typically_mean\"><\/span>\u00c0 l\u2019int\u00e9rieur d\u2019une pile de routage en couches : ce que signifient typiquement ces trois couches<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le titre d\u2019InfoQ ne pr\u00e9cise pas le contenu des trois couches de Microsoft, aussi ce qui suit rel\u00e8ve-t-il du contexte g\u00e9n\u00e9ral du secteur plut\u00f4t que d\u2019un fait rapport\u00e9. En pratique, les conceptions de routage en couches s\u00e9parent g\u00e9n\u00e9ralement trois pr\u00e9occupations. La premi\u00e8re est une couche passerelle ou politique : authentification, quotas, isolement des clients, filtrage de s\u00e9curit\u00e9 et observabilit\u00e9 \u2014 autant de garde-fous travers\u00e9s par chaque demande, ind\u00e9pendamment de sa destination. La deuxi\u00e8me est la couche de d\u00e9cision : une logique qui classe la demande entrante selon sa difficult\u00e9, son domaine ou sa sensibilit\u00e9 \u00e0 la latence, puis s\u00e9lectionne un mod\u00e8le, un d\u00e9ploiement ou une r\u00e9gion en cons\u00e9quence, parfois \u00e0 l\u2019aide d\u2019un petit mod\u00e8le classificateur pour prendre la d\u00e9cision. La troisi\u00e8me est la couche de service ou backend : les pools d\u2019extr\u00e9mit\u00e9s (endpoints) de mod\u00e8les eux-m\u00eames, dot\u00e9s d\u2019\u00e9quilibrage de charge, de basculement en cas de panne (failover) et de surveillance de leur \u00e9tat de sant\u00e9.<\/p>\n<p>Cette s\u00e9paration des responsabilit\u00e9s est cruciale, car ces pr\u00e9occupations \u00e9voluent \u00e0 des rythmes diff\u00e9rents. Les politiques sont stables ; les heuristiques de routage \u00e9voluent hebdomadairement \u00e0 mesure que les mod\u00e8les et leurs prix changent ; les pools backend sont mis \u00e0 jour \u00e0 chaque nouveau lancement d\u2019une version de mod\u00e8le. Une architecture en couches permet aux \u00e9quipes de mettre \u00e0 jour un niveau sans d\u00e9stabiliser les autres \u2014 le m\u00eame raisonnement qui avait conduit l\u2019infrastructure web \u00e0 s\u00e9parer il y a une g\u00e9n\u00e9ration les niveaux edge, application et donn\u00e9es. Si la conception de Microsoft suit ce sch\u00e9ma g\u00e9n\u00e9ral, elle apporterait une discipline op\u00e9rationnelle famili\u00e8re \u00e0 une partie de la pile IA que de nombreuses \u00e9quipes g\u00e8rent encore \u00e0 l\u2019aide de simples instructions conditionnelles ad hoc.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Why_Azure_Kubernetes_Service_as_the_platform\"><\/span>Pourquoi Azure Kubernetes Service comme plateforme<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Placer le routeur sur AKS, comme l\u2019indique le rapport d\u2019InfoQ, constitue un choix significatif. Kubernetes conf\u00e8re \u00e0 l\u2019infrastructure de routage des propri\u00e9t\u00e9s que la logique int\u00e9gr\u00e9e \u00e0 l\u2019application ne poss\u00e8de pas : mise \u00e0 l\u2019\u00e9chelle horizontale automatique face \u00e0 des pics de trafic d\u2019agents, isolement r\u00e9seau entre clients, d\u00e9ploiement d\u00e9claratif de nouvelles r\u00e8gles de routage, et possibilit\u00e9 d\u2019ex\u00e9cuter des serveurs de mod\u00e8les acc\u00e9l\u00e9r\u00e9s par GPU dans le m\u00eame cluster que le routeur lui-m\u00eame. Cela rend \u00e9galement l\u2019architecture, en principe, portable, puisque les primitives Kubernetes se traduisent d\u2019un environnement \u00e0 l\u2019autre.<\/p>\n<p>Il existe aussi une dimension strat\u00e9gique. Un routeur natif Kubernetes peut \u00eatre plac\u00e9 en amont d\u2019un environnement h\u00e9t\u00e9rog\u00e8ne : d\u2019un c\u00f4t\u00e9, des mod\u00e8les accessibles via des API h\u00e9berg\u00e9es, de l\u2019autre, des mod\u00e8les open-weight auto-h\u00e9berg\u00e9s s\u2019ex\u00e9cutant dans le cluster, la couche de routage arbitrant entre eux \u00e0 la demande. Pour les organisations qui p\u00e8sent ce compromis, notre <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> quantifie le point de basculement pour une charge de travail donn\u00e9e. Traiter le routage comme une infrastructure de cluster plut\u00f4t que comme un code applicatif est ce qui rend de tels environnements hybrides v\u00e9ritablement g\u00e9rables.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_economics_routing_as_the_new_cost-control_layer\"><\/span>L\u2019aspect \u00e9conomique : le routage comme nouvelle couche de ma\u00eetrise des co\u00fbts<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La logique commerciale sous-jacente au routage est simple. Les charges de travail d\u2019agents sont voraces en jetons (tokens), dont les prix varient \u00e9norm\u00e9ment selon les cat\u00e9gories de mod\u00e8les. Un routeur qui dirige m\u00eame la moiti\u00e9 des appels d\u2019un agent vers un mod\u00e8le dix fois moins cher \u2014 sans perte perceptible de qualit\u00e9 sur ces appels \u2014 transforme radicalement l\u2019\u00e9conomie unitaire du produit construit par-dessus. C\u2019est pourquoi le routage est pass\u00e9 du statut de simple curiosit\u00e9 acad\u00e9mique \u00e0 celui de n\u00e9cessit\u00e9 op\u00e9rationnelle, et pourquoi la description par des fournisseurs de services cloud d\u2019architectures de r\u00e9f\u00e9rence \u00e0 ce sujet rev\u00eat une importance capitale pour toutes les \u00e9quipes exploitant des agents \u00e0 grande \u00e9chelle. Vous pouvez mod\u00e9liser l\u2019effet d\u2019un redimensionnement du trafic entre diff\u00e9rentes cat\u00e9gories de mod\u00e8les \u00e0 l\u2019aide de notre <a href=\"https:\/\/convly.ai\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts des API IA<\/a>, et comparer la valeur offerte par diff\u00e9rents mod\u00e8les dans notre <a href=\"https:\/\/convly.ai\/fr\/ai-price-performance-index-2026\/\">Indice prix-performance IA<\/a>.<\/p>\n<p>\u00c0 titre d\u2019information g\u00e9n\u00e9rale, les principales approches de routage se comparent comme suit :<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Approche<\/th>\n<th>Fonctionnement<\/th>\n<th>Points forts<\/th>\n<th>Compromis<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Un seul mod\u00e8le pour tous les appels<\/td>\n<td>Chaque demande est envoy\u00e9e \u00e0 un mod\u00e8le unique choisi<\/td>\n<td>Simple ; comportement pr\u00e9visible<\/td>\n<td>Surco\u00fbt pour les appels simples ou sous-performance pour les appels complexes<\/td>\n<\/tr>\n<tr>\n<td>Routage statique bas\u00e9 sur des r\u00e8gles<\/td>\n<td>Des r\u00e8gles \u00e9crites manuellement associent les types de demandes aux mod\u00e8les<\/td>\n<td>Transparent ; facile \u00e0 auditer<\/td>\n<td>Fragile ; n\u00e9cessite une mise \u00e0 jour manuelle constante \u00e0 mesure que les mod\u00e8les \u00e9voluent<\/td>\n<\/tr>\n<tr>\n<td>Routage dynamique en couches<\/td>\n<td>Des niveaux d\u00e9di\u00e9s g\u00e8rent respectivement les politiques, la s\u00e9lection des mod\u00e8les et le service<\/td>\n<td>S\u2019adapte \u00e0 chaque demande ; \u00e9volue op\u00e9rationnellement ; prend en charge les environnements hybrides<\/td>\n<td>Infrastructure plus complexe \u00e0 concevoir, surveiller et ajuster<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"What_it_means_for_teams_building_AI_agents\"><\/span>Ce que cela implique pour les \u00e9quipes d\u00e9veloppant des agents IA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Pour les d\u00e9veloppeurs, la conclusion pratique est que le routage m\u00e9rite la m\u00eame attention architecturale que la logique de l\u2019agent lui-m\u00eame. Les \u00e9quipes d\u00e9ployant des agents \u2014 qu\u2019il s\u2019agisse de chatbots de support client ou de syst\u00e8mes orient\u00e9s d\u00e9veloppeurs pr\u00e9sent\u00e9s dans notre guide sur <a href=\"https:\/\/convly.ai\/fr\/best-ai-coding-agents-2026\/\">agents de codage IA<\/a> \u2014 increasingly find that model selection per call, not prompt engineering, is the biggest remaining lever on cost and latency. A vendor-published reference architecture, even one whose details are still emerging, gives platform teams something concrete to benchmark their own designs against.<\/p>\n<p>Elle donne \u00e9galement un aper\u00e7u de la direction prise par l\u2019\u00e9cosyst\u00e8me : le routage devient une fonctionnalit\u00e9 g\u00e9r\u00e9e au niveau de la plate-forme cloud, plut\u00f4t qu\u2019un composant que chaque \u00e9quipe doit reconstruire individuellement. Si la logique de routage migre vers l\u2019infrastructure au niveau du cluster, comme sur des services tels qu\u2019Azure Kubernetes Service (AKS), la diff\u00e9renciation entre les produits d\u2019agents se d\u00e9place davantage vers le haut de la pile \u2014 vers la conception des t\u00e2ches, l\u2019int\u00e9gration des outils et l\u2019\u00e9valuation \u2014 tandis que les couches inf\u00e9rieures (\u00ab plumbing \u00bb) se standardisent.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Que vient pr\u00e9cis\u00e9ment de publier Microsoft ?<\/strong> Selon InfoQ, Microsoft a d\u00e9taill\u00e9 une architecture de routage LLM en trois couches destin\u00e9e aux agents IA s\u2019ex\u00e9cutant sur Azure Kubernetes Service. Le contenu pr\u00e9cis de chaque couche ainsi que toute donn\u00e9e relative aux performances n\u2019ont pas \u00e9t\u00e9 explicit\u00e9s dans les documents disponibles au moment de la r\u00e9daction de cet article.<\/p>\n<p><strong>Qu\u2019est-ce que le routage LLM ?<\/strong> Il s\u2019agit de la pratique consistant \u00e0 diriger chaque requ\u00eate d\u2019inf\u00e9rence vers le mod\u00e8le le plus adapt\u00e9 parmi un ensemble d\u2019options, en \u00e9quilibrant co\u00fbts, latence et qualit\u00e9 attendue \u2014 plut\u00f4t que d\u2019acheminer l\u2019int\u00e9gralit\u00e9 du trafic vers un seul mod\u00e8le.<\/p>\n<p><strong>Pourquoi ex\u00e9cuter un routeur LLM sur Kubernetes ?<\/strong> Kubernetes fournit la mise \u00e0 l\u2019\u00e9chelle automatique, l\u2019isolation, une configuration d\u00e9clarative et une prise en charge des charges de travail GPU, ce qui permet au routage de fonctionner comme une infrastructure partag\u00e9e au niveau de la plate-forme, desservant de nombreux agents et \u00e9quipes, au lieu d\u2019une logique dupliqu\u00e9e au sein de chaque application.<\/p>\n<p><strong>Le routage permet-il r\u00e9ellement de r\u00e9duire les co\u00fbts li\u00e9s \u00e0 l\u2019IA ?<\/strong> En g\u00e9n\u00e9ral, oui : comme la plupart des sous-t\u00e2ches trait\u00e9es par les agents sont simples, les rediriger vers des mod\u00e8les moins co\u00fbteux permet de r\u00e9duire significativement les d\u00e9penses, tout en r\u00e9servant les mod\u00e8les haut de gamme aux requ\u00eates qui en ont r\u00e9ellement besoin. Le montant exact des \u00e9conomies d\u00e9pend enti\u00e8rement du mix de charges de travail.<\/p>\n<p><strong>Quelles informations restent inconnues concernant la conception de Microsoft ?<\/strong> Les mod\u00e8les impliqu\u00e9s, la logique d\u00e9cisionnelle int\u00e9gr\u00e9e \u00e0 la couche de routage, les r\u00e9sultats des benchmarks ainsi que les d\u00e9tails relatifs \u00e0 la disponibilit\u00e9 g\u00e9n\u00e9rale ne sont pas confirm\u00e9s par les articles principaux ; ils devront \u00eatre v\u00e9rifi\u00e9s \u00e0 partir du rapport complet publi\u00e9 par InfoQ et de la documentation officielle de Microsoft.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_bottom_line\"><\/span>En r\u00e9sum\u00e9<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L\u2019architecture de routage LLM en trois couches de Microsoft, rapport\u00e9e par InfoQ, constitue une divulgation technique \u00e9troite mais aux implications larges. Elle confirme que le routage de mod\u00e8les \u2014 c\u2019est-\u00e0-dire la d\u00e9cision, requ\u00eate par requ\u00eate, du LLM charg\u00e9 d\u2019ex\u00e9cuter le travail \u2014 a \u00e9volu\u00e9 d\u2019une optimisation interne vers un motif architectural nomm\u00e9 et structur\u00e9, que l\u2019un des principaux fournisseurs de services cloud est d\u00e9sormais pr\u00eat \u00e0 documenter pour son service Kubernetes g\u00e9r\u00e9. Pour toute personne exploitant des agents IA en production, le message est clair : le routeur devient le c\u0153ur \u00e9conomique et op\u00e9rationnel de la pile d\u2019agents, et m\u00e9rite d\u2019\u00eatre con\u00e7u de fa\u00e7on r\u00e9fl\u00e9chie plut\u00f4t que d\u2019\u00eatre h\u00e9rit\u00e9 de mani\u00e8re accidentelle. Les d\u00e9tails sp\u00e9cifiques de l\u2019impl\u00e9mentation de Microsoft m\u00e9ritent une analyse approfondie \u00e0 mesure que de nouvelles informations viendront compl\u00e9ter le tableau.<\/p>\n<p><em>Sources : news.google.com. Publi\u00e9 le 29 juillet 2026.<\/em><\/p>","protected":false},"excerpt":{"rendered":"<p>InfoQ reports that Microsoft has detailed a three-layer LLM routing architecture for AI agents on Azure Kubernetes Service, underlining routing&#8217;s growing role in controlling agent costs, latency and output quality.<\/p>","protected":false},"author":1,"featured_media":1794,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[725,925,1031,1030,1032,1029,866],"class_list":["post-1718","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news","tag-ai-agents","tag-ai-infrastructure","tag-aks","tag-azure-kubernetes-service","tag-infoq","tag-llm-routing","tag-microsoft"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1718","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=1718"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1718\/revisions"}],"predecessor-version":[{"id":1720,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1718\/revisions\/1720"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/1794"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=1718"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=1718"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=1718"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}