{"id":1718,"date":"2026-07-29T13:02:55","date_gmt":"2026-07-29T13:02:55","guid":{"rendered":"https:\/\/convly.ai\/?p=1718"},"modified":"2026-07-29T13:02:55","modified_gmt":"2026-07-29T13:02:55","slug":"microsoft-llm-routing-architecture-aks","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/","title":{"rendered":"Arquitetura de roteamento de LLMs da Microsoft para agentes de IA no AKS detalhada"},"content":{"rendered":"<p>Segundo um relat\u00f3rio da InfoQ, a Microsoft detalhou uma arquitetura de roteamento de LLMs em tr\u00eas camadas para agentes de IA executados no Azure Kubernetes Service (AKS). Essa arquitetura de roteamento da Microsoft aborda uma das quest\u00f5es operacionais mais urgentes na \u00e1rea de IA ag\u00eancial atualmente: qual modelo deve responder a cada solicita\u00e7\u00e3o e qual parte da pilha deve tomar essa decis\u00e3o. Embora o t\u00edtulo do artigo da InfoQ contenha poucos detalhes t\u00e9cnicos, essa divulga\u00e7\u00e3o \u00e9 relevante porque o roteamento est\u00e1 rapidamente se tornando o ponto de controle para custo, lat\u00eancia e qualidade em sistemas de agentes em produ\u00e7\u00e3o \u2014 e o fato de um grande provedor de nuvem formaliz\u00e1-lo como um padr\u00e3o arquitetural \u00e9 um sinal que merece aten\u00e7\u00e3o cuidadosa.<\/p>\n<div class=\"convly-tldr\">\n<h3>Principais conclus\u00f5es<\/h3>\n<ul>\n<li>Segundo a InfoQ, a Microsoft detalhou uma arquitetura de roteamento de LLMs em tr\u00eas camadas para agentes de IA executados no Azure Kubernetes Service (AKS).<\/li>\n<li>O roteamento de LLMs decide qual modelo processa cada solicita\u00e7\u00e3o e tornou-se um fator-chave para controlar custo, lat\u00eancia e qualidade da sa\u00edda em sistemas de agentes.<\/li>\n<li>Cargas de trabalho ag\u00eanciais multiplicam as chamadas a modelos por tarefa, transformando o roteamento inteligente de uma simples otimiza\u00e7\u00e3o em uma necessidade econ\u00f4mica.<\/li>\n<li>Construir o roteador no AKS sugere que o roteamento est\u00e1 sendo tratado como infraestrutura de plataforma, e n\u00e3o como c\u00f3digo de aplicativo.<\/li>\n<li>Al\u00e9m do t\u00edtulo, os detalhes t\u00e9cnicos permanecem limitados; a import\u00e2ncia maior reside no fato de um grande provedor de nuvem elevar o roteamento de modelos \u00e0 categoria de padr\u00e3o de projeto de primeira classe.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a705c3ed1d3d\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a705c3ed1d3d\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#What_InfoQ_reports_about_Microsofts_three-layer_routing_design\" >O que a InfoQ relata sobre o projeto de roteamento em tr\u00eas camadas da Microsoft<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#Why_LLM_routing_has_become_critical_for_AI_agents\" >Por que o roteamento de LLMs tornou-se cr\u00edtico para agentes de IA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#Inside_a_layered_routing_stack_what_three_layers_typically_mean\" >Dentro de uma pilha de roteamento em camadas: o que tipicamente significam essas tr\u00eas camadas<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#Why_Azure_Kubernetes_Service_as_the_platform\" >Por que o Azure Kubernetes Service como plataforma<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#The_economics_routing_as_the_new_cost-control_layer\" >A dimens\u00e3o econ\u00f4mica: o roteamento como nova camada de controle de custos<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#What_it_means_for_teams_building_AI_agents\" >O que isso significa para equipes que constroem agentes de IA<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#Frequently_asked_questions\" >Perguntas frequentes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/microsoft-llm-routing-architecture-aks\/#The_bottom_line\" >Resumo final<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_InfoQ_reports_about_Microsofts_three-layer_routing_design\"><\/span>O que a InfoQ relata sobre o projeto de roteamento em tr\u00eas camadas da Microsoft<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A InfoQ, publica\u00e7\u00e3o voltada para arquitetura de software em n\u00edvel pr\u00e1tico, cobriu o que descreve como uma arquitetura de roteamento de LLMs em tr\u00eas camadas da Microsoft para agentes de IA no AKS. O enfoque j\u00e1 \u00e9 not\u00e1vel por si s\u00f3: trata-se de um lan\u00e7amento de produto voltado ao consumidor, mas sim de um relato orientado \u00e0 engenharia sobre como o tr\u00e1fego de agentes pode ser roteado entre modelos de linguagem grandes em infraestrutura gerenciada baseada em Kubernetes. Al\u00e9m do t\u00edtulo, o material dispon\u00edvel n\u00e3o enumera o conte\u00fado de cada camada, n\u00e3o nomeia modelos espec\u00edficos envolvidos nem cita m\u00e9tricas de desempenho; portanto, quaisquer afirma\u00e7\u00f5es detalhadas sobre os componentes internos devem ser tratadas com cautela at\u00e9 que a an\u00e1lise completa seja examinada. O que pode ser afirmado com seguran\u00e7a \u00e9 que a Microsoft est\u00e1 apresentando o roteamento \u2014 a l\u00f3gica que fica entre um agente e um conjunto de modelos \u2014 como um sistema estruturado e em camadas por direito pr\u00f3prio, e que o AKS \u00e9 a plataforma escolhida para descrev\u00ea-lo. Para equipes de infraestrutura, essa combina\u00e7\u00e3o de roteamento e Kubernetes \u00e9 exatamente a hist\u00f3ria central.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Why_LLM_routing_has_become_critical_for_AI_agents\"><\/span>Por que o roteamento de LLMs tornou-se cr\u00edtico para agentes de IA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Para compreender por que isso \u00e9 relevante, considere como os agentes realmente consomem modelos. Uma \u00fanica solicita\u00e7\u00e3o de usu\u00e1rio a um agente raramente resulta em apenas uma chamada ao modelo. O agente pode planejar, decompor a tarefa, selecionar ferramentas, elaborar rascunhos, verificar, resumir e tentar novamente \u2014 cada etapa gerando sua pr\u00f3pria solicita\u00e7\u00e3o de infer\u00eancia. Algumas dessas etapas realmente exigem um modelo de ponta; muitas n\u00e3o exigem. Enviar todas as chamadas ao modelo maior e mais caro inflaciona custos e lat\u00eancia sem ganho de qualidade, enquanto enviar tudo a um modelo pequeno prejudica os resultados nas etapas mais dif\u00edceis.<\/p>\n<p>O roteamento de LLMs \u00e9 a disciplina de associar cada chamada ao modelo mais barato que seja adequado \u00e0 tarefa. Feito corretamente, pode reduzir substancialmente os gastos mantendo a qualidade constante, pois a distribui\u00e7\u00e3o de dificuldade entre as subtarefas de um agente \u00e9 fortemente inclinada para o lado f\u00e1cil. \u00c0 medida que o n\u00famero de modelos vi\u00e1veis cresce \u2014 um cen\u00e1rio que voc\u00ea pode explorar em nosso <a href=\"https:\/\/convly.ai\/pt\/models\/\">Banco de dados de modelos de IA<\/a> \u2014 a decis\u00e3o de roteamento torna-se simultaneamente mais valiosa e mais dif\u00edcil de fazer manualmente. \u00c9 exatamente essa lacuna que uma arquitetura formal de roteamento foi projetada para preencher.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Inside_a_layered_routing_stack_what_three_layers_typically_mean\"><\/span>Dentro de uma pilha de roteamento em camadas: o que tipicamente significam essas tr\u00eas camadas<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>O t\u00edtulo da InfoQ n\u00e3o especifica o conte\u00fado das tr\u00eas camadas da Microsoft, portanto o que segue \u00e9 contexto geral do setor, e n\u00e3o fato reportado. Na pr\u00e1tica, projetos de roteamento em camadas tendem a separar tr\u00eas preocupa\u00e7\u00f5es distintas. A primeira \u00e9 uma camada de gateway ou pol\u00edtica: autentica\u00e7\u00e3o, cotas, isolamento por inquilino, filtragem de seguran\u00e7a e observabilidade \u2014 as salvaguardas pelas quais toda solicita\u00e7\u00e3o passa, independentemente do destino. A segunda \u00e9 a camada de decis\u00e3o: l\u00f3gica que classifica uma solicita\u00e7\u00e3o recebida conforme sua dificuldade, dom\u00ednio ou sensibilidade \u00e0 lat\u00eancia e seleciona, com base nisso, um modelo, uma implanta\u00e7\u00e3o ou uma regi\u00e3o, \u00e0s vezes utilizando um modelo classificador menor para tomar essa decis\u00e3o. A terceira \u00e9 a camada de servi\u00e7o ou backend: os pr\u00f3prios pools de endpoints de modelos, com balanceamento de carga, failover e verifica\u00e7\u00e3o de integridade entre eles.<\/p>\n<p>Separar essas preocupa\u00e7\u00f5es \u00e9 importante porque elas evoluem em ritmos diferentes. As pol\u00edticas s\u00e3o est\u00e1veis; as heur\u00edsticas de roteamento evoluem semanalmente \u00e0 medida que modelos e pre\u00e7os mudam; os pools de backend mudam sempre que uma nova vers\u00e3o de modelo \u00e9 lan\u00e7ada. Uma arquitetura em camadas permite que equipes atualizem um n\u00edvel sem desestabilizar os demais \u2014 o mesmo racioc\u00ednio que levou a infraestrutura web a dividir as camadas de borda, aplica\u00e7\u00e3o e dados h\u00e1 uma gera\u00e7\u00e3o. Se o projeto da Microsoft seguir esse padr\u00e3o amplo, trar\u00e1 uma disciplina operacional familiar a uma parte da pilha de IA que muitas equipes ainda tratam com instru\u00e7\u00f5es condicionais ad hoc.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Why_Azure_Kubernetes_Service_as_the_platform\"><\/span>Por que o Azure Kubernetes Service como plataforma<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Colocar o roteador no AKS, conforme indicado no relat\u00f3rio da InfoQ, \u00e9 uma escolha significativa. O Kubernetes confere \u00e0 infraestrutura de roteamento propriedades que a l\u00f3gica embutida em aplica\u00e7\u00f5es n\u00e3o possui: dimensionamento horizontal autom\u00e1tico sob tr\u00e1fego de agentes vol\u00e1til, isolamento de rede entre inquilinos, implanta\u00e7\u00e3o declarativa de novas regras de roteamento e capacidade de executar servidores de modelos com acelera\u00e7\u00e3o GPU no mesmo cluster que o pr\u00f3prio roteador. Tamb\u00e9m torna a arquitetura, em princ\u00edpio, port\u00e1vel, pois os primitivos do Kubernetes se traduzem entre ambientes.<\/p>\n<p>H\u00e1 tamb\u00e9m uma dimens\u00e3o estrat\u00e9gica. Um roteador nativo do Kubernetes pode ficar \u00e0 frente de um ambiente heterog\u00eaneo: modelos de API hospedados de um lado e modelos de c\u00f3digo aberto auto-hospedados executando no cluster do outro, com a camada de roteamento arbitrando entre eles em cada solicita\u00e7\u00e3o. Para organiza\u00e7\u00f5es avaliando esse compromisso, nossa <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a> quantifica onde se situa o ponto de inflex\u00e3o para uma determinada carga de trabalho. Tratar o roteamento como infraestrutura de cluster, em vez de c\u00f3digo de aplicativo, \u00e9 o que torna tal ambiente h\u00edbrido gerenci\u00e1vel em escala.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_economics_routing_as_the_new_cost-control_layer\"><\/span>A dimens\u00e3o econ\u00f4mica: o roteamento como nova camada de controle de custos<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A l\u00f3gica comercial por tr\u00e1s do roteamento \u00e9 direta. Cargas de trabalho de agentes consomem muitos tokens, e os pre\u00e7os por token variam enormemente entre as camadas de modelos. Um roteador que encaminhe mesmo metade das chamadas de um agente para um modelo dez vezes mais barato \u2014 sem perda percept\u00edvel de qualidade nessas chamadas \u2014 transforma a economia unit\u00e1ria do produto constru\u00eddo sobre ele. \u00c9 por isso que o roteamento migrou de curiosidade acad\u00eamica para necessidade operacional, e por que \u00e9 significativo que provedores de nuvem descrevam arquiteturas de refer\u00eancia para ele \u2014 algo relevante para toda equipe que executa agentes em escala. Voc\u00ea pode modelar o efeito da mudan\u00e7a de tr\u00e1fego entre camadas de modelos com nossa <a href=\"https:\/\/convly.ai\/pt\/ai-api-cost-calculator\/\">Calculadora de custos de API de IA<\/a>e comparar valor entre modelos em nosso <a href=\"https:\/\/convly.ai\/pt\/ai-price-performance-index-2026\/\">\u00cdndice de desempenho-pre\u00e7o de IA<\/a>.<\/p>\n<p>Como contexto geral, as principais abordagens de roteamento se comparam da seguinte forma:<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Abordagem<\/th>\n<th>Como funciona<\/th>\n<th>Pontos fortes<\/th>\n<th>Compromissos<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Um \u00fanico modelo para todas as chamadas<\/td>\n<td>Toda solicita\u00e7\u00e3o vai para um \u00fanico modelo escolhido<\/td>\n<td>Simples; comportamento previs\u00edvel<\/td>\n<td>Suprapagamento em chamadas f\u00e1ceis ou desempenho insuficiente em chamadas dif\u00edceis<\/td>\n<\/tr>\n<tr>\n<td>Roteamento est\u00e1tico baseado em regras<\/td>\n<td>Regras escritas manualmente mapeiam tipos de solicita\u00e7\u00e3o para modelos<\/td>\n<td>Transparente; f\u00e1cil de auditar<\/td>\n<td>Fr\u00e1gil; exige atualiza\u00e7\u00f5es manuais constantes \u00e0 medida que os modelos mudam<\/td>\n<\/tr>\n<tr>\n<td>Roteamento din\u00e2mico em camadas<\/td>\n<td>Camadas dedicadas lidam com pol\u00edtica, sele\u00e7\u00e3o de modelo e servi\u00e7o<\/td>\n<td>Adapta-se por solicita\u00e7\u00e3o; escala operacionalmente; suporta ambientes h\u00edbridos<\/td>\n<td>Exige mais infraestrutura para constru\u00e7\u00e3o, monitoramento e ajuste<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"What_it_means_for_teams_building_AI_agents\"><\/span>O que isso significa para equipes que constroem agentes de IA<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Para desenvolvedores, a conclus\u00e3o pr\u00e1tica \u00e9 que o roteamento merece a mesma aten\u00e7\u00e3o arquitetural que a pr\u00f3pria l\u00f3gica do agente. Equipes que lan\u00e7am agentes \u2014 desde bots de suporte ao cliente at\u00e9 os sistemas voltados a desenvolvedores descritos em nosso guia sobre <a href=\"https:\/\/convly.ai\/pt\/best-ai-coding-agents-2026\/\">agentes de programa\u00e7\u00e3o por IA<\/a> \u2014 increasingly find that model selection per call, not prompt engineering, is the biggest remaining lever on cost and latency. A vendor-published reference architecture, even one whose details are still emerging, gives platform teams something concrete to benchmark their own designs against.<\/p>\n<p>Ela tamb\u00e9m indica para onde o ecossistema est\u00e1 se direcionando: o roteamento como uma capacidade gerenciada pela plataforma em nuvem, em vez de algo que cada equipe precisa reconstruir individualmente. Se a l\u00f3gica de roteamento migrar para a infraestrutura no n\u00edvel do cluster \u2014 por exemplo, em servi\u00e7os como o AKS \u2014, a diferencia\u00e7\u00e3o entre produtos de agentes desloca-se ainda mais para camadas superiores da pilha, concentrando-se no design de tarefas, na integra\u00e7\u00e3o de ferramentas e na avalia\u00e7\u00e3o, enquanto a infraestrutura subjacente se padroniza.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>O que exatamente a Microsoft publicou?<\/strong> Segundo o InfoQ, a Microsoft detalhou uma arquitetura de roteamento de LLM em tr\u00eas camadas para agentes de IA executados no Azure Kubernetes Service (AKS). Os conte\u00fados espec\u00edficos de cada camada e quaisquer dados de desempenho n\u00e3o foram explicitados no material dispon\u00edvel no momento da reda\u00e7\u00e3o deste artigo.<\/p>\n<p><strong>O que \u00e9 roteamento de LLM?<\/strong> \u00c9 a pr\u00e1tica de direcionar cada solicita\u00e7\u00e3o de infer\u00eancia ao modelo mais adequado dentre um conjunto de op\u00e7\u00f5es, equilibrando custo, lat\u00eancia e qualidade esperada \u2014 em vez de enviar todo o tr\u00e1fego a um \u00fanico modelo.<\/p>\n<p><strong>Por que executar um roteador de LLM no Kubernetes?<\/strong> O Kubernetes fornece escalonamento autom\u00e1tico, isolamento, configura\u00e7\u00e3o declarativa e suporte a cargas de trabalho com GPU, permitindo que o roteamento funcione como infraestrutura de plataforma compartilhada, atendendo a diversos agentes e equipes, em vez de ser uma l\u00f3gica duplicada dentro de cada aplicativo.<\/p>\n<p><strong>O roteamento realmente reduz os custos de IA?<\/strong> Em geral, sim: como a maioria das subtarefas executadas por agentes \u00e9 simples, redirecion\u00e1-las para modelos mais econ\u00f4micos pode reduzir significativamente os gastos, reservando modelos premium apenas para as chamadas que realmente exigem seu desempenho. A economia exata depende inteiramente da composi\u00e7\u00e3o da carga de trabalho.<\/p>\n<p><strong>O que ainda \u00e9 desconhecido sobre o projeto da Microsoft?<\/strong> Os modelos envolvidos, a l\u00f3gica de decis\u00e3o na camada de roteamento, os resultados de benchmarks e os detalhes sobre disponibilidade geral n\u00e3o foram confirmados pela cobertura inicial e devem ser verificados diretamente no relat\u00f3rio completo do InfoQ e na documenta\u00e7\u00e3o oficial da Microsoft.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"The_bottom_line\"><\/span>Resumo final<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>A arquitetura de roteamento de LLM em tr\u00eas camadas da Microsoft, divulgada pelo InfoQ, \u00e9 uma revela\u00e7\u00e3o t\u00e9cnica espec\u00edfica com implica\u00e7\u00f5es amplas. Ela confirma que o roteamento de modelos \u2014 ou seja, decidir, para cada solicita\u00e7\u00e3o, qual LLM realizar\u00e1 o trabalho \u2014 evoluiu de uma otimiza\u00e7\u00e3o interna para um padr\u00e3o arquitetural nomeado e estruturado em camadas, adotado abertamente por um grande provedor de nuvem em seu servi\u00e7o gerenciado de Kubernetes. Para quem opera agentes de IA em produ\u00e7\u00e3o, a mensagem \u00e9 clara: o roteador est\u00e1 se tornando o cora\u00e7\u00e3o econ\u00f4mico e operacional da pilha de agentes, merecendo um projeto intencional, em vez de ser herdado acidentalmente. Os detalhes espec\u00edficos da implementa\u00e7\u00e3o da Microsoft merecem an\u00e1lise cuidadosa \u00e0 medida que novas informa\u00e7\u00f5es forem sendo divulgadas.<\/p>\n<p><em>Fontes: news.google.com. Relatado em 29 de julho de 2026.<\/em><\/p>","protected":false},"excerpt":{"rendered":"<p>InfoQ reports that Microsoft has detailed a three-layer LLM routing architecture for AI agents on Azure Kubernetes Service, underlining routing&#8217;s growing role in controlling agent costs, latency and output quality.<\/p>","protected":false},"author":1,"featured_media":1794,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[725,925,1031,1030,1032,1029,866],"class_list":["post-1718","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news","tag-ai-agents","tag-ai-infrastructure","tag-aks","tag-azure-kubernetes-service","tag-infoq","tag-llm-routing","tag-microsoft"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/1718","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=1718"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/1718\/revisions"}],"predecessor-version":[{"id":1720,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/1718\/revisions\/1720"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/1794"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=1718"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=1718"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=1718"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}