Meta a publié Llama 4 Scout et Llama 4 Maverick le même jour — le 5 avril 2025 — et il est facile de les interpréter comme « le petit » et « le grand ». Cette lecture est erronée sur le point qui compte le plus pour votre facture. Les deux modèles activent exactement 17 milliards de paramètres par jeton. Ce qui diffère, c’est la taille du bassin d’experts dont ces 17 milliards sont tirés : 16 experts pour Scout, 128 pour Maverick. Tout le reste — l’écart de prix, l’écart matériel, l’écart sur les benchmarks — découle directement de ce seul choix architectural.
Cela signifie également que l’intuition habituelle « plus grand modèle = meilleures réponses » ne tient plus ici. Maverick compte 3,7 fois plus de paramètres au total, mais ne fournit pas des performances 3,7 fois supérieures ; sur certains benchmarks, ses performances ne sont même pas meilleures. Le tableau comparatif complet ci-dessous repose sur la fiche technique publiée par Meta et sur les tarifs en direct des fournisseurs — y compris la spécification la plus citée, mais pratiquement inaccessible.
Points clés
- Même nombre de paramètres actifs, bassins d’experts différents. Scout compte 109 milliards de paramètres au total / 17 milliards actifs répartis sur 16 experts. Maverick compte 400 milliards de paramètres au total / 17 milliards actifs répartis sur 128 experts. La puissance de calcul nécessaire à l’inférence par jeton est quasiment identique ; l’empreinte mémoire, elle, ne l’est pas.
- La fenêtre contextuelle de 10 millions de jetons de Scout est bien réelle, mais vous ne pourrez presque certainement pas la louer. Meta a entraîné Scout pour traiter jusqu’à 10 millions de jetons. Les fournisseurs hébergés offrent des plages comprises entre 128 K et environ 1,3 million. Pour exploiter pleinement les 10 millions, un déploiement local est indispensable, ainsi qu’un cache KV extrêmement volumineux.
- L’avantage de Maverick se concentre sur le raisonnement et la programmation. GPQA Diamond : +12,6 points, LiveCodeBench : +10,6 points. En compréhension documentaire, les deux modèles sont à égalité — DocVQA atteint 94,4 pour les deux.
- Scout coûte environ 2,3 fois moins cher sur une base tarifaire combinée (0,15 $ contre 0,35 $ par million de jetons combinés, ratio entrée/sortie de 3:1).
- C’est sur le matériel local que leurs différences deviennent réellement marquées. Scout tient sur une seule carte H100 de 80 Go en quantification 4 bits ; Maverick nécessite environ 240 Go en 4 bits et un hôte complet de 8 GPU en FP8.
- Considérez comme invalide le score LMArena célèbre de 1417 attribué à Maverick. Ce chiffre provient d’une variante expérimentale de chat non publiée, et non des poids téléchargeables.
- Version en 30 secondes
- Architecture : un seul réglage, deux modèles très différents
- Fenêtre contextuelle : 10 millions sur papier, nettement moins en pratique
- Benchmarks : là où apparaissent les 291 milliards de paramètres supplémentaires
- Matériel local : consommation de VRAM en FP16, FP8 et 4 bits
- Tarification API selon les fournisseurs
- Ce que cela coûte réellement
- Licence : lisez attentivement la clause relative à l’UE avant de développer
- Lequel choisir ?
- Questions fréquemment posées
- Conclusion
- Articles connexes
Version en 30 secondes
Choisissez Scout si vous traitez de longs documents, effectuez des tâches de recherche, de synthèse, de reconnaissance optique de caractères (OCR), ou encore d’extraction de graphiques ou de formulaires, ou si vous traitez des volumes élevés où le coût par jeton s’accumule — et surtout si vous souhaitez déployer localement sur une seule carte graphique. Choisissez Maverick si votre charge de travail dépend réellement du raisonnement ou de la programmation, là où son avantage à deux chiffres sur GPQA Diamond et LiveCodeBench justifie le surcoût matériel et financier. Pour la plupart des pipelines documentaires et d’extraction, payer 2,3 fois plus pour Maverick ne procure presque aucun gain mesurable.
Architecture : un seul réglage, deux modèles très différents
Les deux modèles sont des transformeurs à mélange d’experts (MoE) utilisant ce que Meta appelle fusion précoce pour une multimodalité native — les jetons image et texte entrent dans le même réseau de base, plutôt que d’être greffés via un adaptateur visuel séparé. Les deux acceptent du texte et des images, et génèrent du texte. Les deux ont une date de coupure de connaissances en août 2024.
La divergence réside dans le routeur : Scout sélectionne parmi 16 experts, Maverick parmi 128. Comme seuls 17 milliards de paramètres s’activent par jeton, les deux modèles coûtent à peu près autant en calcul par jeton — mais chaque expert doit être présent en mémoire, qu’il s’active ou non sur un jeton donné. C’est pourquoi Maverick occupe 3,7 fois plus de mémoire que Scout tout en étant seulement légèrement plus lent par jeton, et c’est aussi la raison pour laquelle un modèle creux (sparse) de 400 milliards de paramètres peut être servi à des tarifs qui seraient impossibles pour un modèle dense de 400 milliards de paramètres.
Une différence notable : Scout a été entraîné sur environ 40 billions de jetons, Maverick sur environ 22 billions. Scout a donc vu plus de données réparties sur moins d’experts, tandis que Maverick en a vu moins, réparties sur beaucoup plus d’experts. Cela explique pourquoi Scout résiste bien sur les tâches nécessitant une large culture générale ou une bonne compréhension documentaire, mais accuse un retard sur les tâches complexes de raisonnement.
Fenêtre contextuelle : 10 millions sur papier, nettement moins en pratique
Il s’agit du chiffre le plus cité — et le plus trompeur — de la sortie de Llama 4. Meta annonce une « fenêtre contextuelle record de 10 millions de jetons » pour Scout, obtenue grâce à une conception d’attention entrelacée sans encodage positionnel. Maverick, lui, est livré avec 1 million.
L’élément limitant : aucun fournisseur hébergé ne propose réellement 10 millions de jetons. Dans la pratique, les limites observées sont les suivantes : environ 128 K–131 K chez Groq, environ 320 K chez DeepInfra, environ 328 K chez Together, près de 1 million chez Fireworks, et la fiche Scout sur OpenRouter affichant 1 310 720 jetons avec une limite de complétion à 16 384 jetons. Pour utiliser effectivement les 10 millions de jetons, vous devez déployer localement, puis faire face à la vraie contrainte : le cache KV. À des profondeurs de plusieurs millions de jetons, ce cache devient plus volumineux que les poids du modèle lui-même, ce qui explique précisément pourquoi les fournisseurs l’imposent comme limite.
Ainsi, la comparaison honnête n’est pas « 10 M contre 1 M », mais plutôt environ 1,3 M contre environ 1 M sur les plateformes que la plupart des utilisateurs emploieront réellement — un avantage réel pour Scout, certes, mais étroit, et non l’écart d’un facteur dix que laisse entendre la fiche technique. Si vous avez réellement besoin de plusieurs millions de jetons, prévoyez un budget pour un déploiement local et testez le débit à grande profondeur avant de vous engager.
Benchmarks : là où apparaissent les 291 milliards de paramètres supplémentaires
Tous les chiffres ci-dessous proviennent des résultats publiés par Meta lui-même pour les variantes Instruct. Il s’agit de données issues directement de Meta, à considérer donc comme indicatives plutôt que définitives.
| Benchmark | Llama 4 Scout | Llama 4 Maverick | Écart |
|---|---|---|---|
| MMLU Pro (raisonnement) | 74.3 | 80.5 | +6.2 |
| GPQA Diamond (sciences de niveau diplôme universitaire) | 57.2 | 69.8 | +12.6 |
| LiveCodeBench (programmation) | 32.8 | 43.4 | +10.6 |
| MMMU (raisonnement sur images) | 69.4 | 73.4 | +4.0 |
| MMMU Pro | 52.2 | 59.6 | +7.4 |
| MathVista | 70.7 | 73.7 | +3.0 |
| ChartQA | 88.8 | 90.0 | +1.2 |
| DocVQA (jeu de test) | 94.4 | 94.4 | 0.0 |
| MGSM (mathématiques multilingues) | 90.6 | 92.3 | +1.7 |
| MTOB, moitié de livre (anglais → kgv) | 42.2 | 54.0 | +11.8 |
La forme de ce tableau constitue l’argument entier. L’avantage de Maverick réside dans sa supériorité marquée et constante en raisonnement, en sciences et en programmation — un gain relatif de 22 % sur GPQA Diamond et de 32 % sur LiveCodeBench. En revanche, sur la compréhension de documents et de graphiques, ses performances s’effondrent totalement : seulement 1,2 point sur ChartQA et une égalité parfaite sur DocVQA.Si votre pipeline traite l’extraction de factures, l’analyse de formulaires, la reconnaissance optique de caractères sur des reçus ou la lecture de graphiques, les chiffres publiés par Meta indiquent clairement que Maverick ne lira pas vos documents mieux que Scout — et vous paierez environ 2,3 fois plus cher par jeton pour atteindre cette équivalence. Il s’agit là de la conclusion la plus concrète et exploitable de cette analyse.
Si votre pipeline concerne l'extraction de factures, l'analyse de formulaires, la reconnaissance optique de caractères (OCR) sur des reçus ou la lecture de graphiques, les chiffres fournis par Meta indiquent que Maverick ne lira pas vos documents mieux que Scout — et vous paieriez environ 2,3 fois plus cher par jeton pour obtenir cette équivalence. C’est là la conclusion la plus concrète et exploitable de cette analyse.
Un benchmark que vous devriez ignorer totalement : celui, largement repris, de Maverick largement cité pour Maverick. Meta a soumis une « version expérimentale en mode discussion » jamais publiée ni pour téléchargement ni pour accès général via API, et des chercheurs ont constaté que ses sorties ne correspondaient pas aux poids publiés sur Hugging Face. Le 8 avril 2025, LMArena a révisé sa politique afin d’exiger que les soumissions de modèles open-weight correspondent exactement aux poids publiés, précisant que l’interprétation des règles par Meta ne coïncidait pas avec les attentes de la plateforme à l’égard des fournisseurs de modèles. Les poids publics non modifiés obtiennent un classement nettement inférieur. Quelle que soit la qualité réelle des échanges conversationnels de Maverick, le score de 1417 n’en constitue pas une preuve.La mémoire nécessaire aux poids se calcule simplement comme le produit du nombre de paramètres par le nombre d’octets par paramètre, auquel on ajoute environ 15 à 25 % pour la mémoire tampon KV (cache KV) et la surcharge liée aux activations, dans le cas de longueurs de contexte modérées. Des contextes très longs font considérablement augmenter cette surcharge.
Matériel local : consommation de VRAM en FP16, FP8 et 4 bits
La mémoire nécessaire aux poids correspond simplement au nombre de paramètres multiplié par le nombre d'octets par paramètre, auquel on ajoute environ 15 à 25 % pour la mémoire cache KV et la surcharge liée aux activations, pour des longueurs de contexte modérées. Des contextes plus longs augmentent considérablement la taille de cette mémoire cache.
| Précision | Maverick (400 milliards) | Poids en BF16/FP16 |
|---|---|---|
| ~218 Go | Poids en FP8 | ~800 Go |
| ~109 Go | Poids en INT4 | ~400 Go |
| ~55 Go | ~200 Go | INT4 pratique (avec surcharge) |
| Configuration matérielle minimale réaliste | ~65 Go | ~240 Go |
| 1 × H100 80 Go, ou un Mac doté de 128 Go de mémoire | Serveur multi-GPU (4 × H100 en quantification 4 bits) | Meta précise explicitement que Scout « tient sur une seule GPU NVIDIA H100 » en quantification INT4, tandis que Maverick « tient sur un seul hôte H100 » — notez le mot |
Meta affirme explicitement que Scout « tient sur une seule GPU NVIDIA H100 » avec une quantification Int4, et que Maverick « tient sur un seul hôte H100 » — notez le mot qui désigne ici un nœud comportant 8 GPU, et non une seule carte. Un nœud 8×H100 offre 640 Go de mémoire, ce qui permet d’accueillir aisément Maverick en FP8, maisen BF16, les seuls poids (800 Go) dépassent largement la capacité du nœud. Pour exécuter Maverick en pleine précision, il faut une mémoire de type H200 ou deux nœuds. pas En pratique : Scout est un modèle conçu pour un seul GPU ou une station de travail unique, et figure parmi les modèles les plus performants pouvant tourner sur un Mac Studio doté de 128 Go de mémoire. Maverick, lui, est strictement réservé aux centres de données. Utilisez le
pour vérifier la compatibilité de votre propre configuration et de votre profondeur de contexte. Calculateur de VRAM 133 % moins cher
| Spécifications | Llama 4 Scout | Llama 4 Maverick |
|---|---|---|
| Développeur | Meta | Meta |
| Type | Multimodal (MoE) | Multimodal (MoE) |
| Paramètres | 109 milliards au total / 17 milliards actifs (MoE) | 400 milliards au total / 17 milliards actifs (MoE) |
| Fenêtre de contexte | 10 M | 1 million |
| Modalité | Texte, image → texte | Texte, image → texte |
| Licence | Llama 4 Community (restreint à l’UE) | Llama 4 Community (restreint à l’UE) |
| Poids ouverts | ✅ Oui | ✅ Oui |
| Coût d’entrée (en $/million) | $0.1 | $0.2 |
| Coût de sortie (en $/million) | $0.3 | $0.8 |
| VRAM (4 bits) | ~65 Go | ~240 Go |
| GPU minimal requis (en local) | H100 80 Go / Mac 128 Go | Serveur multi-GPU |
| Publié | 2025 | 2025 |
Principales différences
- Coût : Llama 4 Scout est Aucun des deux modèles n’est coûteux selon les standards des modèles de pointe ; tous deux sont tarifés comme des modèles open-weight destinés à l’inférence grand public. Les tarifs ci-dessous sont exprimés par million de jetons et varient fréquemment. que Llama 4 Maverick sur une base de coût moyen par jeton.
- Contexte : Llama 4 Scout offre une fenêtre de contexte supérieure (10 M contre 1 M), ce qui le rend mieux adapté aux documents longs, aux grands bases de code et aux entrées volumineuses RAG.
- Ouverture : les deux modèles ont des poids ouverts, ce qui signifie qu’ils peuvent tous deux être auto-hébergés ou affinés. Comparez leurs besoins en VRAM ci-dessus pour déterminer quel modèle votre GPU peut exécuter.
- Exécutez Llama 4 Scout localement : ~65 Go en 4 bits (GPU minimal requis : H100 80 Go / Mac 128 Go).
- Exécutez Llama 4 Maverick localement : ~~240 Go en quantification 4 bits (serveur multi-GPU minimal).
Lequel choisir ?
Choisir Llama 4 Scout si vous recherchez un coût inférieur par jeton pour des charges de travail à fort volume, ou si vous avez besoin d’une fenêtre de contexte plus grande.
Choisissez Llama 4 Maverick si celui-ci s’intègre bien à votre pile technologique existante ou si vous préférez Meta.
→ Estimez les coûts réels avec le Calculateur de coûts d’API · vérifiez la compatibilité de votre matériel local avec le Calculateur de VRAM · parcourez l’ensemble des 30+ modèles.
Tarification API selon les fournisseurs
Aucun des deux modèles n’est coûteux selon les standards des modèles de pointe ; tous deux sont tarifés comme des modèles open-weight destinés à l’inférence grand public. Les tarifs indiqués ci-dessous correspondent à 1 million de jetons et évoluent fréquemment.
| Fournisseur | Maverick entrée / sortie | DeepInfra |
|---|---|---|
| Groq | $0.10 / $0.30 | $0.20 / $0.80 |
| DigitalOcean | $0.11 / $0.34 | — |
| NovitaAI | — | $0.20 / $0.696 |
| Parasail | $0.18 / $0.59 | $0.27 / $0.85 |
| Google Vertex | — | $0.35 / $1.00 |
| Groq mérite une attention particulière pour Scout : il est légèrement plus cher que DeepInfra, mais propose un cache pour les entrées à 0,055 $ par million de jetons — un avantage décisif pour les boucles d’agents qui renvoient des milliers de fois le même prompt système. Parasail propose une solution équivalente pour Maverick à 0,17 $. | $0.25 / $0.70 | $0.35 / $1.15 |
Supposons une charge de production modérée de 100 millions de jetons d’entrée et 20 millions de jetons de sortie par mois, au tarif le plus bas disponible sur le marché :
Ce que cela coûte réellement
Supposons une charge de travail modérée en production de 100 millions de jetons d’entrée et de 20 millions de jetons de sortie par mois, au tarif le moins cher parmi les offres grand public :
- (100 × 0,10 $) + (20 × 0,30 $) = 16 $/mois Maverick :
- (100 × 0,20 $) + (20 × 0,80 $) = 36 $/mois À dix fois ce volume, l’écart passe à 160 $ contre 360 $ par mois. Ce rapport reste stable autour de 2,25–2,3× quelle que soit l’échelle, ce qui signifie que la décision ne repose pas tant sur le montant absolu dépensé pour de petits volumes, mais plutôt sur la question suivante : la supériorité de Maverick en raisonnement et en programmation justifie-t-elle un doublement permanent du coût unitaire ? Calculez vos propres coûts à l’aide du
À dix fois ce volume, l’écart passe de 160 $ à 360 $ par mois. Ce rapport reste d’environ 2,25 à 2,3× quel que soit le volume, ce qui signifie que la décision ne repose pas vraiment sur le montant absolu des coûts pour de petits volumes, mais plutôt sur la question de savoir si la capacité de raisonnement et de codage de Maverick vaut un doublement permanent du coût unitaire. Calculez vos propres chiffres dans le Calculateur de coûts d’API.
Licence : lisez attentivement la clause relative à l’UE avant de développer
Licence communautaire Llama 4 , qui autorise une utilisation open-weight et commerciale, mais n’est pas une licence open source approuvée par l’OSI. Deux restrictions ont une incidence pratique notable. Premièrement, les produits dépassant 700 millions d’utilisateurs actifs mensuels requièrent une licence distincte, négociée séparément avec Meta. Deuxièmement — et cela concernera bien plus probablement votre cas — la licence restreint l’usage multimodal pour les personnes physiques et morales résidant dans l’, qui est un modèle à poids ouverts et utilisable à des fins commerciales, mais qui n’est pas une licence open source approuvée par l’OSI. Deux restrictions ont une incidence pratique. Premièrement, les produits dépassant 700 millions d’utilisateurs actifs par mois nécessitent une licence distincte, négociée séparément avec Meta. Deuxièmement — et cela vous concernera très probablement davantage — la licence restreint l’usage multimodal pour les entités et les particuliers résidant dans les Si vous êtes une entreprise européenne envisageant d’utiliser les capacités vision de ces modèles, cette question juridique doit être tranchée avant même d’écrire la moindre ligne de code, et non après coup. Les équipes dans cette situation optent souvent pour.
Si vous êtes une entreprise basée dans l’UE et que vous envisagez d’utiliser les fonctionnalités de vision, il s’agit d’une question juridique à régler avant d’écrire du code, et non après. Les équipes dans cette situation optent souvent pour doté d’une licence plus permissive, comme Qwen ou GLM, publiés sous licence Apache-2.0 ou MIT. Choisissez Llama 4 Scout si
Lequel choisir ?
Votre charge de travail porte sur des documents, de la reconnaissance optique de caractères (OCR), des formulaires, des graphiques ou la recherche d’informations — domaines où les benchmarks montrent une quasi-parité
- Vous souhaitez l’héberger vous-même sur une seule H100, un Mac de 128 Go ou une configuration GPU modeste
- Vous souhaitez auto-héberger sur un seul H100, un Mac de 128 Go ou une configuration GPU modeste
- Le coût par jeton s'accumule avec votre volume, et vous souhaitez bénéficier d'une économie d'environ 2,3×
- Vous avez besoin de la fenêtre de contexte la plus longue disponible et pouvez travailler dans les limites imposées par les fournisseurs
- Vous êtes en phase de prototypage et recherchez le modèle multimodal open-weight le moins coûteux tout en restant performant
Choisissez Llama 4 Maverick si
- Votre charge de travail dépend réellement du raisonnement — questions scientifiques, analyse, logique multi-étapes
- Vous générez ou passez en revue du code, où l'écart sur LiveCodeBench atteint 32 % en termes relatifs
- Vous disposez déjà d'une infrastructure multi-GPU, ou vous l'utilisez déjà via une API
- Vous avez besoin de meilleures performances multilingues et de traduction, comme le montrent les résultats sur MGSM et MTOB
- La précision sur les problèmes complexes prime sur le fait de doubler votre coût par jeton
La voie pragmatique pour la plupart des équipes : commencez avec Scout, mesurez les performances, puis n'escaladez que les requêtes qui échouent. Comme les deux modèles acceptent le même format de prompt et les mêmes entrées multimodales, acheminer les requêtes difficiles vers Maverick tout en traitant la majorité avec Scout ne nécessite qu'un faible effort d'ingénierie et s'avère généralement plus efficace que de standardiser sur l'un ou l'autre modèle.
Questions fréquemment posées
Le modèle Llama 4 Maverick est-il meilleur que le modèle Llama 4 Scout ?
Sur le raisonnement et la programmation, la réponse est clairement oui — Maverick devance Scout de 12,6 points sur GPQA Diamond et de 10,6 points sur LiveCodeBench. En revanche, sur la compréhension de documents et de graphiques, les deux modèles sont pratiquement à égalité, obtenant tous deux un score identique de 94,4 sur DocVQA. Ce qui est « meilleur » dépend entièrement du fait que votre charge de travail soit axée sur le raisonnement ou sur l'extraction d'informations.
Puis-je vraiment exploiter la fenêtre de contexte de 10 millions de jetons de Llama 4 Scout ?
Pas via une API hébergée. Meta a entraîné Scout pour prendre en charge jusqu’à 10 millions de jetons, mais les fournisseurs proposent des plages allant de 128 K à environ 1,3 million — Groq plafonne à environ 131 K, DeepInfra à environ 320 K, et Together à environ 328 K. Atteindre les 10 millions nécessite un déploiement local (self-hosting), et le cache KV à cette profondeur devient plus volumineux que les poids du modèle eux-mêmes.
De combien de VRAM ai-je besoin pour exécuter Llama 4 Scout localement ?
Environ 65 Go en quantification 4 bits, y compris les surcoûts, ce qui tient sur une seule carte H100 de 80 Go — Meta confirme explicitement cette configuration. En FP8, il faut environ 109 Go, et en BF16 environ 218 Go. Un Mac Studio doté de 128 Go de mémoire unifiée peut exécuter le modèle en version quantifiée.
Llama 4 Maverick peut-il fonctionner sur une seule carte graphique ?
Non. En quantification 4 bits, il nécessite environ 240 Go de mémoire, ce qui implique l'utilisation d’environ quatre cartes H100. L'affirmation de Meta selon laquelle il tient « sur un seul hôte H100 » fait référence à un nœud comportant huit GPU fonctionnant en FP8, et non à une seule carte. En BF16, ses poids de 800 Go dépassent même la capacité d’un nœud à huit H100 de 640 Go.
De combien Scout est-il moins coûteux que Maverick ?
Environ 2,3 fois moins cher sur une base tarifaire combinée entrée/sortie de 3:1 — soit environ 0,15 $ par million de jetons combinés contre 0,35 $. Pour une charge mensuelle de 100 millions de jetons d’entrée et 20 millions de jetons de sortie, cela représente 16 $ contre 36 $.
Les modèles Llama 4 sont-ils libres d’utilisation commerciale ?
Pour la plupart. La licence communautaire Llama 4 autorise l’usage commercial, mais les produits dépassant 700 millions d’utilisateurs actifs mensuels requièrent un accord séparé avec Meta, et l’usage multimodal est restreint pour les entités établies dans l’Union européenne. Il s’agit d’un modèle à poids ouverts (open-weight), mais pas d’un logiciel libre conforme à la définition de l’Open Source Initiative (OSI).
Pourquoi le score de Llama 4 Maverick sur LMArena a-t-il suscité la controverse ?
Meta a soumis une « version expérimentale de discussion » non publiée, qui a obtenu un score ELO de 1417, mais dont les sorties ne correspondaient pas aux poids disponibles publiquement. Le 8 avril 2025, LMArena a modifié sa politique afin d'exiger que les soumissions open-weight correspondent exactement aux poids publiés ; le modèle non modifié a obtenu un classement nettement inférieur.
Conclusion
Scout et Maverick reposent sur le même moteur, mais avec des pools d'experts de tailles différentes, et le choix entre eux est remarquablement clair, car les benchmarks publiés par Meta tracent eux-mêmes la ligne de démarcation. Maverick justifie son surcoût sur le raisonnement de niveau universitaire et la génération de code, où les écarts à deux chiffres sont trop importants pour être contestés. En revanche, il n’apporte aucun avantage sur la compréhension de documents, domaine où il égale Scout tout en coûtant 2,3 fois plus cher par jeton et en exigeant un rack de centre de données plutôt qu’une seule carte GPU.
Deux mises en garde à retenir. La fenêtre de contexte de 10 millions de jetons annoncée pour Scout n’est pas disponible aujourd’hui en mode location — prévoyez plutôt environ 1,3 million de jetons, sauf si vous hébergez vous-même le modèle. Par ailleurs, le score de 1417 sur LMArena attribué à Maverick doit être totalement écarté de votre évaluation : il correspond à un modèle que personne ne peut télécharger. Évaluez les deux modèles à partir des benchmarks figurant sur leur fiche technique, et mieux encore, sur votre propre jeu de tests — l’écart entre le marketing des éditeurs et les poids effectivement livrés constitue la leçon principale de ce lancement.
