{"id":1277,"date":"2026-06-23T14:45:04","date_gmt":"2026-06-23T14:45:04","guid":{"rendered":"https:\/\/convly.ai\/?p=1277"},"modified":"2026-08-26T12:38:32","modified_gmt":"2026-08-26T12:38:32","slug":"llama-4-scout-vs-llama-4-maverick","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/","title":{"rendered":"Llama 4 Scout contre Llama 4 Maverick : sp\u00e9cifications, tarifs et choix (2026)"},"content":{"rendered":"<p>Meta a publi\u00e9 <strong>Llama 4 Scout<\/strong> et <strong>Llama 4 Maverick<\/strong> le m\u00eame jour \u2014 le 5 avril 2025 \u2014 et il est facile de les interpr\u00e9ter comme \u00ab le petit \u00bb et \u00ab le grand \u00bb. Cette lecture est erron\u00e9e sur le point qui compte le plus pour votre facture. Les deux mod\u00e8les activent <strong>exactement 17 milliards de param\u00e8tres par jeton<\/strong>. Ce qui diff\u00e8re, c\u2019est la taille du bassin d\u2019experts dont ces 17 milliards sont tir\u00e9s : 16 experts pour Scout, 128 pour Maverick. Tout le reste \u2014 l\u2019\u00e9cart de prix, l\u2019\u00e9cart mat\u00e9riel, l\u2019\u00e9cart sur les benchmarks \u2014 d\u00e9coule directement de ce seul choix architectural.<\/p>\n<p>Cela signifie \u00e9galement que l\u2019intuition habituelle \u00ab plus grand mod\u00e8le = meilleures r\u00e9ponses \u00bb ne tient plus ici. Maverick compte 3,7 fois plus de param\u00e8tres au total, mais ne fournit pas des performances 3,7 fois sup\u00e9rieures ; sur certains benchmarks, ses performances ne sont m\u00eame pas meilleures. Le tableau comparatif complet ci-dessous repose sur la fiche technique publi\u00e9e par Meta et sur les tarifs en direct des fournisseurs \u2014 y compris la sp\u00e9cification la plus cit\u00e9e, mais pratiquement inaccessible.<\/p>\n<div class=\"convly-tldr\">\n<h3>Points cl\u00e9s<\/h3>\n<ul>\n<li><strong>M\u00eame nombre de param\u00e8tres actifs, bassins d\u2019experts diff\u00e9rents.<\/strong> Scout compte 109 milliards de param\u00e8tres au total \/ 17 milliards actifs r\u00e9partis sur 16 experts. Maverick compte 400 milliards de param\u00e8tres au total \/ 17 milliards actifs r\u00e9partis sur 128 experts. La puissance de calcul n\u00e9cessaire \u00e0 l\u2019inf\u00e9rence par jeton est quasiment identique ; l\u2019empreinte m\u00e9moire, elle, ne l\u2019est pas.<\/li>\n<li><strong>La fen\u00eatre contextuelle de 10 millions de jetons de Scout est bien r\u00e9elle, mais vous ne pourrez presque certainement pas la louer.<\/strong> Meta a entra\u00een\u00e9 Scout pour traiter jusqu\u2019\u00e0 10 millions de jetons. Les fournisseurs h\u00e9berg\u00e9s offrent des plages comprises entre 128 K et environ 1,3 million. Pour exploiter pleinement les 10 millions, un d\u00e9ploiement local est indispensable, ainsi qu\u2019un cache KV extr\u00eamement volumineux.<\/li>\n<li><strong>L\u2019avantage de Maverick se concentre sur le raisonnement et la programmation.<\/strong> GPQA Diamond : +12,6 points, LiveCodeBench : +10,6 points. En compr\u00e9hension documentaire, les deux mod\u00e8les sont \u00e0 \u00e9galit\u00e9 \u2014 DocVQA atteint 94,4 pour les deux.<\/li>\n<li><strong>Scout co\u00fbte environ 2,3 fois moins cher sur une base tarifaire combin\u00e9e<\/strong> (0,15 $ contre 0,35 $ par million de jetons combin\u00e9s, ratio entr\u00e9e\/sortie de 3:1).<\/li>\n<li><strong>C\u2019est sur le mat\u00e9riel local que leurs diff\u00e9rences deviennent r\u00e9ellement marqu\u00e9es.<\/strong> Scout tient sur une seule carte H100 de 80 Go en quantification 4 bits ; Maverick n\u00e9cessite environ 240 Go en 4 bits et un h\u00f4te complet de 8 GPU en FP8.<\/li>\n<li><strong>Consid\u00e9rez comme invalide le score LMArena c\u00e9l\u00e8bre de 1417 attribu\u00e9 \u00e0 Maverick.<\/strong> Ce chiffre provient d\u2019une variante exp\u00e9rimentale de chat non publi\u00e9e, et non des poids t\u00e9l\u00e9chargeables.<\/li>\n<\/ul>\n<\/div>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6ab5976f92de5\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6ab5976f92de5\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#The_30-second_version\" >Version en 30 secondes<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Architecture_one_knob_two_very_different_models\" >Architecture : un seul r\u00e9glage, deux mod\u00e8les tr\u00e8s diff\u00e9rents<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Context_window_10M_on_paper_far_less_in_practice\" >Fen\u00eatre contextuelle : 10 millions sur papier, nettement moins en pratique<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Benchmarks_where_the_extra_291B_parameters_show_up\" >Benchmarks : l\u00e0 o\u00f9 apparaissent les 291 milliards de param\u00e8tres suppl\u00e9mentaires<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Local_hardware_VRAM_at_FP16_FP8_and_4-bit\" >Mat\u00e9riel local : consommation de VRAM en FP16, FP8 et 4 bits<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#API_pricing_across_providers\" >Tarification API selon les fournisseurs<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#What_this_actually_costs\" >Ce que cela co\u00fbte r\u00e9ellement<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Licensing_read_the_EU_clause_before_you_build\" >Licence : lisez attentivement la clause relative \u00e0 l\u2019UE avant de d\u00e9velopper<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Which_should_you_pick\" >Lequel choisir ?<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Frequently_asked_questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Bottom_line\" >Conclusion<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/convly.ai\/fr\/llama-4-scout-vs-llama-4-maverick\/#Related_articles\" >Articles connexes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"The_30-second_version\"><\/span>Version en 30 secondes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Choisissez <strong>Scout<\/strong> si vous traitez de longs documents, effectuez des t\u00e2ches de recherche, de synth\u00e8se, de reconnaissance optique de caract\u00e8res (OCR), ou encore d\u2019extraction de graphiques ou de formulaires, ou si vous traitez des volumes \u00e9lev\u00e9s o\u00f9 le co\u00fbt par jeton s\u2019accumule \u2014 et surtout si vous souhaitez d\u00e9ployer localement sur une seule carte graphique. Choisissez <strong>Maverick<\/strong> si votre charge de travail d\u00e9pend r\u00e9ellement du raisonnement ou de la programmation, l\u00e0 o\u00f9 son avantage \u00e0 deux chiffres sur GPQA Diamond et LiveCodeBench justifie le surco\u00fbt mat\u00e9riel et financier. Pour la plupart des pipelines documentaires et d\u2019extraction, payer 2,3 fois plus pour Maverick ne procure presque aucun gain mesurable.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Architecture_one_knob_two_very_different_models\"><\/span>Architecture : un seul r\u00e9glage, deux mod\u00e8les tr\u00e8s diff\u00e9rents<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les deux mod\u00e8les sont des transformeurs \u00e0 m\u00e9lange d\u2019experts (MoE) utilisant ce que Meta appelle <em>fusion pr\u00e9coce<\/em> pour une multimodalit\u00e9 native \u2014 les jetons image et texte entrent dans le m\u00eame r\u00e9seau de base, plut\u00f4t que d\u2019\u00eatre greff\u00e9s via un adaptateur visuel s\u00e9par\u00e9. Les deux acceptent du texte et des images, et g\u00e9n\u00e8rent du texte. Les deux ont une date de coupure de connaissances en ao\u00fbt 2024.<\/p>\n<p>La divergence r\u00e9side dans le routeur : Scout s\u00e9lectionne parmi 16 experts, Maverick parmi 128. Comme seuls 17 milliards de param\u00e8tres s\u2019activent par jeton, les deux mod\u00e8les co\u00fbtent \u00e0 peu pr\u00e8s autant <em>en calcul<\/em> par jeton \u2014 mais chaque expert doit \u00eatre pr\u00e9sent en m\u00e9moire, qu\u2019il s\u2019active ou non sur un jeton donn\u00e9. C\u2019est pourquoi Maverick occupe 3,7 fois plus de m\u00e9moire que Scout tout en \u00e9tant seulement l\u00e9g\u00e8rement plus lent par jeton, et c\u2019est aussi la raison pour laquelle un mod\u00e8le creux (sparse) de 400 milliards de param\u00e8tres peut \u00eatre servi \u00e0 des tarifs qui seraient impossibles pour un mod\u00e8le dense de 400 milliards de param\u00e8tres.<\/p>\n<p>Une diff\u00e9rence notable : Scout a \u00e9t\u00e9 entra\u00een\u00e9 sur environ 40 billions de jetons, Maverick sur environ 22 billions. Scout a donc vu plus de donn\u00e9es r\u00e9parties sur moins d\u2019experts, tandis que Maverick en a vu moins, r\u00e9parties sur beaucoup plus d\u2019experts. Cela explique pourquoi Scout r\u00e9siste bien sur les t\u00e2ches n\u00e9cessitant une large culture g\u00e9n\u00e9rale ou une bonne compr\u00e9hension documentaire, mais accuse un retard sur les t\u00e2ches complexes de raisonnement.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Context_window_10M_on_paper_far_less_in_practice\"><\/span>Fen\u00eatre contextuelle : 10 millions sur papier, nettement moins en pratique<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Il s\u2019agit du chiffre le plus cit\u00e9 \u2014 et le plus trompeur \u2014 de la sortie de Llama 4. Meta annonce une \u00ab fen\u00eatre contextuelle record de 10 millions de jetons \u00bb pour Scout, obtenue gr\u00e2ce \u00e0 une conception d\u2019attention entrelac\u00e9e sans encodage positionnel. Maverick, lui, est livr\u00e9 avec 1 million.<\/p>\n<p>L\u2019\u00e9l\u00e9ment limitant : <strong>aucun fournisseur h\u00e9berg\u00e9 ne propose r\u00e9ellement 10 millions de jetons.<\/strong> Dans la pratique, les limites observ\u00e9es sont les suivantes : environ 128 K\u2013131 K chez Groq, environ 320 K chez DeepInfra, environ 328 K chez Together, pr\u00e8s de 1 million chez Fireworks, et la fiche Scout sur OpenRouter affichant 1 310 720 jetons avec une limite de compl\u00e9tion \u00e0 16 384 jetons. Pour utiliser effectivement les 10 millions de jetons, vous devez d\u00e9ployer localement, puis faire face \u00e0 la vraie contrainte : le cache KV. \u00c0 des profondeurs de plusieurs millions de jetons, ce cache devient plus volumineux que les poids du mod\u00e8le lui-m\u00eame, ce qui explique pr\u00e9cis\u00e9ment pourquoi les fournisseurs l\u2019imposent comme limite.<\/p>\n<p>Ainsi, la comparaison honn\u00eate n\u2019est pas \u00ab 10 M contre 1 M \u00bb, mais plut\u00f4t <strong>environ 1,3 M contre environ 1 M<\/strong> sur les plateformes que la plupart des utilisateurs emploieront r\u00e9ellement \u2014 un avantage r\u00e9el pour Scout, certes, mais \u00e9troit, et non l\u2019\u00e9cart d\u2019un facteur dix que laisse entendre la fiche technique. Si vous avez r\u00e9ellement besoin de plusieurs millions de jetons, pr\u00e9voyez un budget pour un d\u00e9ploiement local et testez le d\u00e9bit \u00e0 grande profondeur avant de vous engager.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Benchmarks_where_the_extra_291B_parameters_show_up\"><\/span>Benchmarks : l\u00e0 o\u00f9 apparaissent les 291 milliards de param\u00e8tres suppl\u00e9mentaires<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Tous les chiffres ci-dessous proviennent des r\u00e9sultats publi\u00e9s par Meta lui-m\u00eame pour les variantes Instruct. Il s\u2019agit de donn\u00e9es issues directement de Meta, \u00e0 consid\u00e9rer donc comme indicatives plut\u00f4t que d\u00e9finitives.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Benchmark<\/th>\n<th>Llama 4 Scout<\/th>\n<th>Llama 4 Maverick<\/th>\n<th>\u00c9cart<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>MMLU Pro (raisonnement)<\/td>\n<td>74.3<\/td>\n<td class=\"convly-vs-winner\">80.5<\/td>\n<td>+6.2<\/td>\n<\/tr>\n<tr>\n<td>GPQA Diamond (sciences de niveau dipl\u00f4me universitaire)<\/td>\n<td>57.2<\/td>\n<td class=\"convly-vs-winner\">69.8<\/td>\n<td>+12.6<\/td>\n<\/tr>\n<tr>\n<td>LiveCodeBench (programmation)<\/td>\n<td>32.8<\/td>\n<td class=\"convly-vs-winner\">43.4<\/td>\n<td>+10.6<\/td>\n<\/tr>\n<tr>\n<td>MMMU (raisonnement sur images)<\/td>\n<td>69.4<\/td>\n<td class=\"convly-vs-winner\">73.4<\/td>\n<td>+4.0<\/td>\n<\/tr>\n<tr>\n<td>MMMU Pro<\/td>\n<td>52.2<\/td>\n<td class=\"convly-vs-winner\">59.6<\/td>\n<td>+7.4<\/td>\n<\/tr>\n<tr>\n<td>MathVista<\/td>\n<td>70.7<\/td>\n<td class=\"convly-vs-winner\">73.7<\/td>\n<td>+3.0<\/td>\n<\/tr>\n<tr>\n<td>ChartQA<\/td>\n<td>88.8<\/td>\n<td class=\"convly-vs-winner\">90.0<\/td>\n<td>+1.2<\/td>\n<\/tr>\n<tr>\n<td>DocVQA (jeu de test)<\/td>\n<td>94.4<\/td>\n<td>94.4<\/td>\n<td>0.0<\/td>\n<\/tr>\n<tr>\n<td>MGSM (math\u00e9matiques multilingues)<\/td>\n<td>90.6<\/td>\n<td class=\"convly-vs-winner\">92.3<\/td>\n<td>+1.7<\/td>\n<\/tr>\n<tr>\n<td>MTOB, moiti\u00e9 de livre (anglais \u2192 kgv)<\/td>\n<td>42.2<\/td>\n<td class=\"convly-vs-winner\">54.0<\/td>\n<td>+11.8<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>La forme de ce tableau constitue l\u2019argument entier. L\u2019avantage de Maverick r\u00e9side <strong>dans sa sup\u00e9riorit\u00e9 marqu\u00e9e et constante en raisonnement, en sciences et en programmation<\/strong> \u2014 un gain relatif de 22 % sur GPQA Diamond et de 32 % sur LiveCodeBench. En revanche, sur la compr\u00e9hension de documents et de graphiques, ses performances s\u2019effondrent totalement <strong>: seulement 1,2 point sur ChartQA et une \u00e9galit\u00e9 parfaite sur DocVQA.<\/strong>Si votre pipeline traite l\u2019extraction de factures, l\u2019analyse de formulaires, la reconnaissance optique de caract\u00e8res sur des re\u00e7us ou la lecture de graphiques, les chiffres publi\u00e9s par Meta indiquent clairement que Maverick ne lira pas vos documents mieux que Scout \u2014 et vous paierez environ 2,3 fois plus cher par jeton pour atteindre cette \u00e9quivalence. Il s\u2019agit l\u00e0 de la conclusion la plus concr\u00e8te et exploitable de cette analyse.<\/p>\n<p>Si votre pipeline concerne l'extraction de factures, l'analyse de formulaires, la reconnaissance optique de caract\u00e8res (OCR) sur des re\u00e7us ou la lecture de graphiques, les chiffres fournis par Meta indiquent que Maverick ne lira pas vos documents mieux que Scout \u2014 et vous paieriez environ 2,3 fois plus cher par jeton pour obtenir cette \u00e9quivalence. C\u2019est l\u00e0 la conclusion la plus concr\u00e8te et exploitable de cette analyse.<\/p>\n<p>Un benchmark que vous devriez ignorer totalement : celui, largement repris, de Maverick <strong>largement cit\u00e9 pour Maverick. Meta a soumis une \u00ab version exp\u00e9rimentale en mode discussion \u00bb jamais publi\u00e9e ni pour t\u00e9l\u00e9chargement ni pour acc\u00e8s g\u00e9n\u00e9ral via API, et des chercheurs ont constat\u00e9 que ses sorties ne correspondaient pas aux poids publi\u00e9s sur Hugging Face. Le 8 avril 2025, LMArena a r\u00e9vis\u00e9 sa politique afin d\u2019exiger que les soumissions de mod\u00e8les open-weight correspondent exactement aux poids publi\u00e9s, pr\u00e9cisant que l\u2019interpr\u00e9tation des r\u00e8gles par Meta ne co\u00efncidait pas avec les attentes de la plateforme \u00e0 l\u2019\u00e9gard des fournisseurs de mod\u00e8les. Les poids publics non modifi\u00e9s obtiennent un classement nettement inf\u00e9rieur. Quelle que soit la qualit\u00e9 r\u00e9elle des \u00e9changes conversationnels de Maverick, le score de 1417 n\u2019en constitue pas une preuve.<\/strong>La m\u00e9moire n\u00e9cessaire aux poids se calcule simplement comme le produit du nombre de param\u00e8tres par le nombre d\u2019octets par param\u00e8tre, auquel on ajoute environ 15 \u00e0 25 % pour la m\u00e9moire tampon KV (cache KV) et la surcharge li\u00e9e aux activations, dans le cas de longueurs de contexte mod\u00e9r\u00e9es. Des contextes tr\u00e8s longs font consid\u00e9rablement augmenter cette surcharge.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Local_hardware_VRAM_at_FP16_FP8_and_4-bit\"><\/span>Mat\u00e9riel local : consommation de VRAM en FP16, FP8 et 4 bits<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La m\u00e9moire n\u00e9cessaire aux poids correspond simplement au nombre de param\u00e8tres multipli\u00e9 par le nombre d'octets par param\u00e8tre, auquel on ajoute environ 15 \u00e0 25 % pour la m\u00e9moire cache KV et la surcharge li\u00e9e aux activations, pour des longueurs de contexte mod\u00e9r\u00e9es. Des contextes plus longs augmentent consid\u00e9rablement la taille de cette m\u00e9moire cache.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Pr\u00e9cision<\/th>\n<th>Maverick (400 milliards)<\/th>\n<th>Poids en BF16\/FP16<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>~218 Go<\/td>\n<td class=\"convly-vs-winner\">Poids en FP8<\/td>\n<td>~800 Go<\/td>\n<\/tr>\n<tr>\n<td>~109 Go<\/td>\n<td class=\"convly-vs-winner\">Poids en INT4<\/td>\n<td>~400 Go<\/td>\n<\/tr>\n<tr>\n<td>~55 Go<\/td>\n<td class=\"convly-vs-winner\">~200 Go<\/td>\n<td>INT4 pratique (avec surcharge)<\/td>\n<\/tr>\n<tr>\n<td>Configuration mat\u00e9rielle minimale r\u00e9aliste<\/td>\n<td class=\"convly-vs-winner\">~65 Go<\/td>\n<td>~240 Go<\/td>\n<\/tr>\n<tr>\n<td>1 \u00d7 H100 80 Go, ou un Mac dot\u00e9 de 128 Go de m\u00e9moire<\/td>\n<td class=\"convly-vs-winner\">Serveur multi-GPU (4 \u00d7 H100 en quantification 4 bits)<\/td>\n<td>Meta pr\u00e9cise explicitement que Scout \u00ab tient sur une seule GPU NVIDIA H100 \u00bb en quantification INT4, tandis que Maverick \u00ab tient sur un seul h\u00f4te H100 \u00bb \u2014 notez le mot<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Meta affirme explicitement que Scout \u00ab tient sur une seule GPU NVIDIA H100 \u00bb avec une quantification Int4, et que Maverick \u00ab tient sur un seul h\u00f4te H100 \u00bb \u2014 notez le mot <em>qui d\u00e9signe ici un n\u0153ud comportant 8 GPU, et non une seule carte. Un n\u0153ud 8\u00d7H100 offre 640 Go de m\u00e9moire, ce qui permet d\u2019accueillir ais\u00e9ment Maverick en FP8, mais<\/em>en BF16, les seuls poids (800 Go) d\u00e9passent largement la capacit\u00e9 du n\u0153ud. Pour ex\u00e9cuter Maverick en pleine pr\u00e9cision, il faut une m\u00e9moire de type H200 ou deux n\u0153uds. <em>pas<\/em> En pratique : Scout est un mod\u00e8le con\u00e7u pour un seul GPU ou une station de travail unique, et figure parmi les mod\u00e8les les plus performants pouvant tourner sur un Mac Studio dot\u00e9 de 128 Go de m\u00e9moire. Maverick, lui, est strictement r\u00e9serv\u00e9 aux centres de donn\u00e9es. Utilisez le<\/p>\n<p>pour v\u00e9rifier la compatibilit\u00e9 de votre propre configuration et de votre profondeur de contexte. <a href=\"\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> 133 % moins cher<\/p>\n<div class=\"cmp\">\n  <table class=\"cmp-table\">\n    <thead><tr><th>Sp\u00e9cifications<\/th><th><a href=\"https:\/\/convly.ai\/fr\/model\/llama-4-scout\/\">Llama 4 Scout<\/a><\/th><th><a href=\"https:\/\/convly.ai\/fr\/model\/llama-4-maverick\/\">Llama 4 Maverick<\/a><\/th><\/tr><\/thead>\n    <tbody>\n          <tr><td class=\"cmp-spec\">D\u00e9veloppeur<\/td><td class=\"\">Meta<\/td><td class=\"\">Meta<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Type<\/td><td class=\"\">Multimodal (MoE)<\/td><td class=\"\">Multimodal (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Param\u00e8tres<\/td><td class=\"\">109 milliards au total \/ 17 milliards actifs (MoE)<\/td><td class=\"\">400 milliards au total \/ 17 milliards actifs (MoE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Fen\u00eatre de contexte<\/td><td class=\"cmp-win\">10 M<\/td><td class=\"\">1 million<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Modalit\u00e9<\/td><td class=\"\">Texte, image \u2192 texte<\/td><td class=\"\">Texte, image \u2192 texte<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Licence<\/td><td class=\"\">Llama 4 Community (restreint \u00e0 l\u2019UE)<\/td><td class=\"\">Llama 4 Community (restreint \u00e0 l\u2019UE)<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Poids ouverts<\/td><td class=\"\">\u2705 Oui<\/td><td class=\"\">\u2705 Oui<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Co\u00fbt d\u2019entr\u00e9e (en $\/million)<\/td><td class=\"cmp-win\">$0.1<\/td><td class=\"\">$0.2<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Co\u00fbt de sortie (en $\/million)<\/td><td class=\"\">$0.3<\/td><td class=\"\">$0.8<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">VRAM (4 bits)<\/td><td class=\"\">~65 Go<\/td><td class=\"\">~240 Go<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">GPU minimal requis (en local)<\/td><td class=\"\">H100 80 Go \/ Mac 128 Go<\/td><td class=\"\">Serveur multi-GPU<\/td><\/tr>\n          <tr><td class=\"cmp-spec\">Publi\u00e9<\/td><td class=\"\">2025<\/td><td class=\"\">2025<\/td><\/tr>\n        <\/tbody>\n  <\/table>\n\n    <div class=\"cmp-verdict\">\n    <h3>Principales diff\u00e9rences<\/h3>\n    <ul><li><strong>Co\u00fbt :<\/strong> Llama 4 Scout est <strong>Aucun des deux mod\u00e8les n\u2019est co\u00fbteux selon les standards des mod\u00e8les de pointe ; tous deux sont tarif\u00e9s comme des mod\u00e8les open-weight destin\u00e9s \u00e0 l\u2019inf\u00e9rence grand public. Les tarifs ci-dessous sont exprim\u00e9s par million de jetons et varient fr\u00e9quemment.<\/strong> que Llama 4 Maverick sur une base de co\u00fbt moyen par jeton.<\/li><li><strong>Contexte :<\/strong> Llama 4 Scout offre une fen\u00eatre de contexte sup\u00e9rieure (10 M contre 1 M), ce qui le rend mieux adapt\u00e9 aux documents longs, aux grands bases de code et aux entr\u00e9es volumineuses RAG.<\/li><li><strong>Ouverture :<\/strong> les deux mod\u00e8les ont des poids ouverts, ce qui signifie qu\u2019ils peuvent tous deux \u00eatre auto-h\u00e9berg\u00e9s ou affin\u00e9s. Comparez leurs besoins en VRAM ci-dessus pour d\u00e9terminer quel mod\u00e8le votre GPU peut ex\u00e9cuter.<\/li><li><strong>Ex\u00e9cutez Llama 4 Scout localement :<\/strong> ~65 Go en 4 bits (GPU minimal requis : H100 80 Go \/ Mac 128 Go).<\/li><li><strong>Ex\u00e9cutez Llama 4 Maverick localement :<\/strong> ~~240 Go en quantification 4 bits (serveur multi-GPU minimal).<\/li><\/ul>\n  <\/div>\n\n    <div class=\"cmp-rec\">\n    <h3>Lequel choisir ?<\/h3>\n    <p><strong>Choisir Llama 4 Scout<\/strong> si vous recherchez un co\u00fbt inf\u00e9rieur par jeton pour des charges de travail \u00e0 fort volume, ou si vous avez besoin d\u2019une fen\u00eatre de contexte plus grande.<\/p>\n    <p><strong>Choisissez Llama 4 Maverick<\/strong> si celui-ci s\u2019int\u00e8gre bien \u00e0 votre pile technologique existante ou si vous pr\u00e9f\u00e9rez Meta.<\/p>\n    <p class=\"cmp-tools\">\u2192 Estimez les co\u00fbts r\u00e9els avec le <a href=\"\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts d\u2019API<\/a> \u00b7 v\u00e9rifiez la compatibilit\u00e9 de votre mat\u00e9riel local avec le <a href=\"\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> \u00b7 parcourez l\u2019ensemble des <a href=\"\/fr\/models\/\">30+ mod\u00e8les<\/a>.<\/p>\n  <\/div>\n<\/div>\n\n<h2><span class=\"ez-toc-section\" id=\"API_pricing_across_providers\"><\/span>Tarification API selon les fournisseurs<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Aucun des deux mod\u00e8les n\u2019est co\u00fbteux selon les standards des mod\u00e8les de pointe ; tous deux sont tarif\u00e9s comme des mod\u00e8les open-weight destin\u00e9s \u00e0 l\u2019inf\u00e9rence grand public. Les tarifs indiqu\u00e9s ci-dessous correspondent \u00e0 1 million de jetons et \u00e9voluent fr\u00e9quemment.<\/p>\n<table class=\"convly-vs\">\n<thead>\n<tr>\n<th>Fournisseur<\/th>\n<th>Maverick entr\u00e9e \/ sortie<\/th>\n<th>DeepInfra<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Groq<\/td>\n<td class=\"convly-vs-winner\">$0.10 \/ $0.30<\/td>\n<td>$0.20 \/ $0.80<\/td>\n<\/tr>\n<tr>\n<td>DigitalOcean<\/td>\n<td>$0.11 \/ $0.34<\/td>\n<td>\u2014<\/td>\n<\/tr>\n<tr>\n<td>NovitaAI<\/td>\n<td>\u2014<\/td>\n<td>$0.20 \/ $0.696<\/td>\n<\/tr>\n<tr>\n<td>Parasail<\/td>\n<td>$0.18 \/ $0.59<\/td>\n<td>$0.27 \/ $0.85<\/td>\n<\/tr>\n<tr>\n<td>Google Vertex<\/td>\n<td>\u2014<\/td>\n<td>$0.35 \/ $1.00<\/td>\n<\/tr>\n<tr>\n<td>Groq m\u00e9rite une attention particuli\u00e8re pour Scout : il est l\u00e9g\u00e8rement plus cher que DeepInfra, mais propose un cache pour les entr\u00e9es \u00e0 0,055 $ par million de jetons \u2014 un avantage d\u00e9cisif pour les boucles d\u2019agents qui renvoient des milliers de fois le m\u00eame prompt syst\u00e8me. Parasail propose une solution \u00e9quivalente pour Maverick \u00e0 0,17 $.<\/td>\n<td>$0.25 \/ $0.70<\/td>\n<td>$0.35 \/ $1.15<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Supposons une charge de production mod\u00e9r\u00e9e de 100 millions de jetons d\u2019entr\u00e9e et 20 millions de jetons de sortie par mois, au tarif le plus bas disponible sur le march\u00e9 :<\/p>\n<h2><span class=\"ez-toc-section\" id=\"What_this_actually_costs\"><\/span>Ce que cela co\u00fbte r\u00e9ellement<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Supposons une charge de travail mod\u00e9r\u00e9e en production de 100 millions de jetons d\u2019entr\u00e9e et de 20 millions de jetons de sortie par mois, au tarif le moins cher parmi les offres grand public :<\/p>\n<ul>\n<li><strong>(100 \u00d7 0,10 $) + (20 \u00d7 0,30 $) =<\/strong> 16 $\/mois <strong>Maverick :<\/strong><\/li>\n<li><strong>(100 \u00d7 0,20 $) + (20 \u00d7 0,80 $) =<\/strong> 36 $\/mois <strong>\u00c0 dix fois ce volume, l\u2019\u00e9cart passe \u00e0 160 $ contre 360 $ par mois. Ce rapport reste stable autour de 2,25\u20132,3\u00d7 quelle que soit l\u2019\u00e9chelle, ce qui signifie que la d\u00e9cision ne repose pas tant sur le montant absolu d\u00e9pens\u00e9 pour de petits volumes, mais plut\u00f4t sur la question suivante : la sup\u00e9riorit\u00e9 de Maverick en raisonnement et en programmation justifie-t-elle un doublement permanent du co\u00fbt unitaire ? Calculez vos propres co\u00fbts \u00e0 l\u2019aide du<\/strong><\/li>\n<\/ul>\n<p>\u00c0 dix fois ce volume, l\u2019\u00e9cart passe de 160 $ \u00e0 360 $ par mois. Ce rapport reste d\u2019environ 2,25 \u00e0 2,3\u00d7 quel que soit le volume, ce qui signifie que la d\u00e9cision ne repose pas vraiment sur le montant absolu des co\u00fbts pour de petits volumes, mais plut\u00f4t sur la question de savoir si la capacit\u00e9 de raisonnement et de codage de Maverick vaut un doublement permanent du co\u00fbt unitaire. Calculez vos propres chiffres dans le <a href=\"\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts d\u2019API<\/a>.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Licensing_read_the_EU_clause_before_you_build\"><\/span>Licence : lisez attentivement la clause relative \u00e0 l\u2019UE avant de d\u00e9velopper<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Licence communautaire Llama 4 <strong>, qui autorise une utilisation open-weight et commerciale, mais n\u2019est pas une licence open source approuv\u00e9e par l\u2019OSI. Deux restrictions ont une incidence pratique notable. Premi\u00e8rement, les produits d\u00e9passant 700 millions d\u2019utilisateurs actifs mensuels requi\u00e8rent une licence distincte, n\u00e9goci\u00e9e s\u00e9par\u00e9ment avec Meta. Deuxi\u00e8mement \u2014 et cela concernera bien plus probablement votre cas \u2014 la licence restreint l\u2019usage multimodal pour les personnes physiques et morales r\u00e9sidant dans l\u2019<\/strong>, qui est un mod\u00e8le \u00e0 poids ouverts et utilisable \u00e0 des fins commerciales, mais qui n\u2019est pas une licence open source approuv\u00e9e par l\u2019OSI. Deux restrictions ont une incidence pratique. Premi\u00e8rement, les produits d\u00e9passant 700 millions d\u2019utilisateurs actifs par mois n\u00e9cessitent une licence distincte, n\u00e9goci\u00e9e s\u00e9par\u00e9ment avec Meta. Deuxi\u00e8mement \u2014 et cela vous concernera tr\u00e8s probablement davantage \u2014 la licence restreint l\u2019usage multimodal pour les entit\u00e9s et les particuliers r\u00e9sidant dans les <strong>Si vous \u00eates une entreprise europ\u00e9enne envisageant d\u2019utiliser les capacit\u00e9s vision de ces mod\u00e8les, cette question juridique doit \u00eatre tranch\u00e9e avant m\u00eame d\u2019\u00e9crire la moindre ligne de code, et non apr\u00e8s coup. Les \u00e9quipes dans cette situation optent souvent pour<\/strong>.<\/p>\n<p>Si vous \u00eates une entreprise bas\u00e9e dans l\u2019UE et que vous envisagez d\u2019utiliser les fonctionnalit\u00e9s de vision, il s\u2019agit d\u2019une question juridique \u00e0 r\u00e9gler avant d\u2019\u00e9crire du code, et non apr\u00e8s. Les \u00e9quipes dans cette situation optent souvent pour <a href=\"\/fr\/models\/\">dot\u00e9 d\u2019une licence plus permissive, comme Qwen ou GLM, publi\u00e9s sous licence Apache-2.0 ou MIT.<\/a> Choisissez Llama 4 Scout si<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Which_should_you_pick\"><\/span>Lequel choisir ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<div class=\"convly-procons\">\n<div class=\"pros\">\n<h4>Votre charge de travail porte sur des documents, de la reconnaissance optique de caract\u00e8res (OCR), des formulaires, des graphiques ou la recherche d\u2019informations \u2014 domaines o\u00f9 les benchmarks montrent une quasi-parit\u00e9<\/h4>\n<ul>\n<li>Vous souhaitez l\u2019h\u00e9berger vous-m\u00eame sur une seule H100, un Mac de 128 Go ou une configuration GPU modeste<\/li>\n<li>Vous souhaitez auto-h\u00e9berger sur un seul H100, un Mac de 128 Go ou une configuration GPU modeste<\/li>\n<li>Le co\u00fbt par jeton s'accumule avec votre volume, et vous souhaitez b\u00e9n\u00e9ficier d'une \u00e9conomie d'environ 2,3\u00d7<\/li>\n<li>Vous avez besoin de la fen\u00eatre de contexte la plus longue disponible et pouvez travailler dans les limites impos\u00e9es par les fournisseurs<\/li>\n<li>Vous \u00eates en phase de prototypage et recherchez le mod\u00e8le multimodal open-weight le moins co\u00fbteux tout en restant performant<\/li>\n<\/ul>\n<\/div>\n<div class=\"cons\">\n<h4>Choisissez Llama 4 Maverick si<\/h4>\n<ul>\n<li>Votre charge de travail d\u00e9pend r\u00e9ellement du raisonnement \u2014 questions scientifiques, analyse, logique multi-\u00e9tapes<\/li>\n<li>Vous g\u00e9n\u00e9rez ou passez en revue du code, o\u00f9 l'\u00e9cart sur LiveCodeBench atteint 32 % en termes relatifs<\/li>\n<li>Vous disposez d\u00e9j\u00e0 d'une infrastructure multi-GPU, ou vous l'utilisez d\u00e9j\u00e0 via une API<\/li>\n<li>Vous avez besoin de meilleures performances multilingues et de traduction, comme le montrent les r\u00e9sultats sur MGSM et MTOB<\/li>\n<li>La pr\u00e9cision sur les probl\u00e8mes complexes prime sur le fait de doubler votre co\u00fbt par jeton<\/li>\n<\/ul>\n<\/div>\n<\/div>\n<p>La voie pragmatique pour la plupart des \u00e9quipes : <strong>commencez avec Scout, mesurez les performances, puis n'escaladez que les requ\u00eates qui \u00e9chouent.<\/strong> Comme les deux mod\u00e8les acceptent le m\u00eame format de prompt et les m\u00eames entr\u00e9es multimodales, acheminer les requ\u00eates difficiles vers Maverick tout en traitant la majorit\u00e9 avec Scout ne n\u00e9cessite qu'un faible effort d'ing\u00e9nierie et s'av\u00e8re g\u00e9n\u00e9ralement plus efficace que de standardiser sur l'un ou l'autre mod\u00e8le.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_asked_questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Le mod\u00e8le Llama 4 Maverick est-il meilleur que le mod\u00e8le Llama 4 Scout ?<\/h3>\n<p>Sur le raisonnement et la programmation, la r\u00e9ponse est clairement oui \u2014 Maverick devance Scout de 12,6 points sur GPQA Diamond et de 10,6 points sur LiveCodeBench. En revanche, sur la compr\u00e9hension de documents et de graphiques, les deux mod\u00e8les sont pratiquement \u00e0 \u00e9galit\u00e9, obtenant tous deux un score identique de 94,4 sur DocVQA. Ce qui est \u00ab meilleur \u00bb d\u00e9pend enti\u00e8rement du fait que votre charge de travail soit ax\u00e9e sur le raisonnement ou sur l'extraction d'informations.<\/p>\n<h3>Puis-je vraiment exploiter la fen\u00eatre de contexte de 10 millions de jetons de Llama 4 Scout ?<\/h3>\n<p>Pas via une API h\u00e9berg\u00e9e. Meta a entra\u00een\u00e9 Scout pour prendre en charge jusqu\u2019\u00e0 10 millions de jetons, mais les fournisseurs proposent des plages allant de 128 K \u00e0 environ 1,3 million \u2014 Groq plafonne \u00e0 environ 131 K, DeepInfra \u00e0 environ 320 K, et Together \u00e0 environ 328 K. Atteindre les 10 millions n\u00e9cessite un d\u00e9ploiement local (self-hosting), et le cache KV \u00e0 cette profondeur devient plus volumineux que les poids du mod\u00e8le eux-m\u00eames.<\/p>\n<h3>De combien de VRAM ai-je besoin pour ex\u00e9cuter Llama 4 Scout localement ?<\/h3>\n<p>Environ 65 Go en quantification 4 bits, y compris les surco\u00fbts, ce qui tient sur une seule carte H100 de 80 Go \u2014 Meta confirme explicitement cette configuration. En FP8, il faut environ 109 Go, et en BF16 environ 218 Go. Un Mac Studio dot\u00e9 de 128 Go de m\u00e9moire unifi\u00e9e peut ex\u00e9cuter le mod\u00e8le en version quantifi\u00e9e.<\/p>\n<h3>Llama 4 Maverick peut-il fonctionner sur une seule carte graphique ?<\/h3>\n<p>Non. En quantification 4 bits, il n\u00e9cessite environ 240 Go de m\u00e9moire, ce qui implique l'utilisation d\u2019environ quatre cartes H100. L'affirmation de Meta selon laquelle il tient \u00ab sur un seul h\u00f4te H100 \u00bb fait r\u00e9f\u00e9rence \u00e0 un n\u0153ud comportant huit GPU fonctionnant en FP8, et non \u00e0 une seule carte. En BF16, ses poids de 800 Go d\u00e9passent m\u00eame la capacit\u00e9 d\u2019un n\u0153ud \u00e0 huit H100 de 640 Go.<\/p>\n<h3>De combien Scout est-il moins co\u00fbteux que Maverick ?<\/h3>\n<p>Environ 2,3 fois moins cher sur une base tarifaire combin\u00e9e entr\u00e9e\/sortie de 3:1 \u2014 soit environ 0,15 $ par million de jetons combin\u00e9s contre 0,35 $. Pour une charge mensuelle de 100 millions de jetons d\u2019entr\u00e9e et 20 millions de jetons de sortie, cela repr\u00e9sente 16 $ contre 36 $.<\/p>\n<h3>Les mod\u00e8les Llama 4 sont-ils libres d\u2019utilisation commerciale ?<\/h3>\n<p>Pour la plupart. La licence communautaire Llama 4 autorise l\u2019usage commercial, mais les produits d\u00e9passant 700 millions d\u2019utilisateurs actifs mensuels requi\u00e8rent un accord s\u00e9par\u00e9 avec Meta, et l\u2019usage multimodal est restreint pour les entit\u00e9s \u00e9tablies dans l\u2019Union europ\u00e9enne. Il s\u2019agit d\u2019un mod\u00e8le \u00e0 poids ouverts (open-weight), mais pas d\u2019un logiciel libre conforme \u00e0 la d\u00e9finition de l\u2019Open Source Initiative (OSI).<\/p>\n<h3>Pourquoi le score de Llama 4 Maverick sur LMArena a-t-il suscit\u00e9 la controverse ?<\/h3>\n<p>Meta a soumis une \u00ab version exp\u00e9rimentale de discussion \u00bb non publi\u00e9e, qui a obtenu un score ELO de 1417, mais dont les sorties ne correspondaient pas aux poids disponibles publiquement. Le 8 avril 2025, LMArena a modifi\u00e9 sa politique afin d'exiger que les soumissions open-weight correspondent exactement aux poids publi\u00e9s ; le mod\u00e8le non modifi\u00e9 a obtenu un classement nettement inf\u00e9rieur.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Bottom_line\"><\/span>Conclusion<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Scout et Maverick reposent sur le m\u00eame moteur, mais avec des pools d'experts de tailles diff\u00e9rentes, et le choix entre eux est remarquablement clair, car les benchmarks publi\u00e9s par Meta tracent eux-m\u00eames la ligne de d\u00e9marcation. Maverick justifie son surco\u00fbt sur le raisonnement de niveau universitaire et la g\u00e9n\u00e9ration de code, o\u00f9 les \u00e9carts \u00e0 deux chiffres sont trop importants pour \u00eatre contest\u00e9s. En revanche, il n\u2019apporte aucun avantage sur la compr\u00e9hension de documents, domaine o\u00f9 il \u00e9gale Scout tout en co\u00fbtant 2,3 fois plus cher par jeton et en exigeant un rack de centre de donn\u00e9es plut\u00f4t qu\u2019une seule carte GPU.<\/p>\n<p>Deux mises en garde \u00e0 retenir. La fen\u00eatre de contexte de 10 millions de jetons annonc\u00e9e pour Scout n\u2019est pas disponible aujourd\u2019hui en mode location \u2014 pr\u00e9voyez plut\u00f4t environ 1,3 million de jetons, sauf si vous h\u00e9bergez vous-m\u00eame le mod\u00e8le. Par ailleurs, le score de 1417 sur LMArena attribu\u00e9 \u00e0 Maverick doit \u00eatre totalement \u00e9cart\u00e9 de votre \u00e9valuation : il correspond \u00e0 un mod\u00e8le que personne ne peut t\u00e9l\u00e9charger. \u00c9valuez les deux mod\u00e8les \u00e0 partir des benchmarks figurant sur leur fiche technique, et mieux encore, sur votre propre jeu de tests \u2014 l\u2019\u00e9cart entre le marketing des \u00e9diteurs et les poids effectivement livr\u00e9s constitue la le\u00e7on principale de ce lancement.<\/p>\n<p><!--related-block--><\/p>\n<div class=\"convly-related\">\n<h2><span class=\"ez-toc-section\" id=\"Related_articles\"><\/span>Articles connexes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li><a href=\"https:\/\/convly.ai\/fr\/models\/\">Base de donn\u00e9es des mod\u00e8les d\u2019IA : caract\u00e9ristiques techniques, tarifs et consommation de VRAM pour plus de 40 mod\u00e8les<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM pour LLM : quel mod\u00e8le tiendra r\u00e9ellement sur votre GPU<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/fr\/ai-api-cost-calculator\/\">Calculateur de co\u00fbts des API IA : estimez vos d\u00e9penses mensuelles<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/fr\/ai-price-performance-index-2026\/\">Indice AI de rapport prix-performance 2026<\/a><\/li>\n<li><a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">Calculateur auto-h\u00e9bergement vs API<\/a><\/li>\n<\/ul>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>Llama 4 Scout vs Llama 4 Maverick compared: specs, API pricing, context window, VRAM and a clear verdict on which model to choose in 2026.<\/p>","protected":false},"author":1,"featured_media":1906,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[246],"tags":[395,795],"class_list":["post-1277","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-comparisons","tag-ai-model-comparison","tag-llama-4-maverick"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1277","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=1277"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1277\/revisions"}],"predecessor-version":[{"id":2404,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/1277\/revisions\/2404"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/1906"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=1277"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=1277"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=1277"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}