Monday, 3 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

NVIDIA Vera Rubin expliqué : la nouvelle plateforme IA qui réduit les coûts d’inférence de 10× (2026)

Mis à jour · Originally published June 11, 2026

Lors du Computex 2026, NVIDIA a confirmé que Vera Rubin — la successeure de l’architecture Blackwell, qui alimente actuellement l’essor de l’IA — est désormais en production complète. Il s’agit de l’annonce matérielle IA la plus importante de l’année, et le chiffre phare est stupéfiant : NVIDIA affirme que Rubin réduit les coûts d’inférence IA jusqu’à 10 fois. Cela ne concerne pas uniquement les hyperscalers construisant des centres de données — cela influence directement le prix de chaque outil IA que vous utilisez. Voici une analyse claire et professionnelle de ce qu’est réellement Vera Rubin.

Points clés

  • Vera Rubin est la prochaine plateforme IA de NVIDIA, successeure de Blackwell — désormais en production complète (annoncée au Computex 2026).
  • Le chiffre phare : selon les données publiées par NVIDIA jusqu’à 10 fois moins cher par jeton d’inférence et 4 fois moins de GPU nécessaires pour entraîner des modèles MoE (Mixture-of-Experts) comparé à Blackwell.
  • Il s’agit d’une plateforme à six puces, et non d’un simple GPU — le modèle phare Vera Rubin NVL72 intègre 72 GPU Rubin et 36 processeurs Vera.
  • Rubin CPX est un nouveau GPU distinct, conçu spécifiquement pour l’ inférence sur des contextes d’un million de jetons (programmation, vidéo), doté de 128 Go de GDDR7 chacun.
  • Disponibilité : instances cloud à partir de la deuxième moitié de 2026 (AWS, Google Cloud, Azure, OCI, etc.) ; Rubin CPX disponible fin 2026.

Qu’est-ce que NVIDIA Vera Rubin ?

Vera Rubin est la nouvelle plateforme de calcul IA de NVIDIA — l’architecture qui succède à Blackwell (génération GB200/GB300, actuellement au cœur de la plupart des entraînements et inférences IA de pointe). Du nom de l’astronome ayant fourni les premières preuves de la matière noire, Rubin n’est pas une puce unique, mais une plateforme étroitement conçue en coopération, composée de six puces conçu pour fonctionner comme une seule « usine IA ».

L’objectif stratégique est l’efficacité. L’entraînement et le déploiement des modèles les plus volumineux d’aujourd’hui sont extrêmement coûteux, et le poste de dépense le plus important dans l’IA en production est inférence — en réalité, l’exécution du modèle pour les utilisateurs. Rubin est la réponse de NVIDIA à cette courbe des coûts.

PlateformeNVIDIA Vera Rubin (successeur de Blackwell)
AnnoncéComputex 2026 — désormais en production complète
Système phareVera Rubin NVL72 (72 GPU Rubin + 36 CPU Vera)
GPU RubinMoteur Transformer de troisième génération, 50 pétaflops de performances d’inférence en NVFP4
CPU Vera88 cœurs personnalisés Olympus, architecture Armv9.2, NVLink-C2C
Coût d’inférence par rapport à BlackwellJusqu’à 10 fois inférieur (chiffres NVIDIA)
Disponibilité dans le cloudDeuxième semestre 2026

Les chiffres clés — et leur signification

Deux chiffres de NVIDIA définissent pourquoi Rubin est déterminant :

  • Une réduction allant jusqu’à 10 fois du coût d’inférence par jeton par rapport à Blackwell. Le coût d’inférence détermine le prix d’un appel d’API IA. Un gain d’efficacité de 10 fois constitue un changement radical permettant aux fournisseurs de réduire drastiquement leurs prix, d’augmenter leurs limites de débit ou de déployer des modèles nettement plus performants au même coût.
  • Une réduction de 4 fois du nombre de GPU nécessaires à l’entraînement des modèles à mélange d’experts (MoE). Presque tous les modèles de pointe en 2026 — de GPT à Claude, en passant par les grands modèles chinois open source — sont des MoE. Réduire de 4 fois le nombre de GPU requis abaisse directement le seuil d’accès à l’entraînement de modèles à l’échelle frontière.

Comme toujours avec les benchmarks fournis par les fabricants, considérez ces chiffres comme les résultats optimaux annoncés par NVIDIA, en attendant que des laboratoires indépendants les valident. Même une fraction des gains revendiqués transforme profondément l’économie de l’IA. La raison pour laquelle vos outils IA deviennent sans cesse moins chers et plus rapides réside dans des composants matériels tels que celui-ci.

Les six puces composant la plateforme

L’efficacité de Rubin provient de la conception intégrée de l’ensemble du rack, et non pas uniquement du GPU. Cette plateforme repose sur six puces :

  1. CPU Vera — 88 cœurs personnalisés « Olympus » (Armv9.2), optimisés pour le raisonnement agentic et étroitement couplés aux GPU via NVLink-C2C.
  2. GPU Rubin — le moteur de calcul, doté d’un moteur Transformer de troisième génération, d’une compression adaptative accélérée en matériel et de 50 pétaflops de puissance d’inférence en NVFP4 .
  3. Commutateur NVLink 6 — l’interconnexion, offrant 3,6 To/s par GPU et et 260 To/s cumulés au sein d’un seul rack NVL72.
  4. SuperNIC ConnectX-9 — une connectivité réseau haute vitesse intégrée à la conception du NVL72.
  5. DPU BlueField-4 — qui gère le stockage natif IA et permet une réutilisation efficace du cache clé-valeur (KV), accélérant ainsi directement l’inférence sur des contextes longs.
  6. Commutateur Ethernet Spectrum-6 — basé sur des SerDes 200 G avec optique embarquée pour les « usines IA » à grande échelle.

Le système phare, le Vera Rubin NVL72, intègre 72 GPU Rubin et 36 CPU Vera dans un seul rack — et NVIDIA affirme qu’il est jusqu’à 18 fois plus rapide à assembler et à entretenir que Blackwell, ce qui revêt une importance capitale à l’échelle d’un centre de données.

Rubin CPX : un GPU conçu pour les contextes d’un million de jetons

Parallèlement à la plateforme standard, NVIDIA a présenté une catégorie entièrement nouvelle : le Rubin CPX« Rubin CPX », un GPU « spécifiquement conçu pour le traitement de contextes massifs ». Ce composant vise directement l’ère des contextes longs — les charges de travail logicielles de codage ou vidéo générative impliquant un million de jetons, que les modèles actuels exigent de plus en plus.

Chaque Rubin CPX embarque 128 Go de mémoire GDDR7 et jusqu’à et délivre 30 pétaflops de puissance de calcul en NVFP4, tout en intégrant de façon unique, sur une seule puce, le matériel d’encodage/décodage vidéo et les capacités d’inférence sur contextes longs. À l’échelle d’un rack, le Vera Rubin NVL144 CPX offre une puissance de calcul IA revendiquée de 8 exaflops et100 To de mémoire haute vitesse , soit selon NVIDIA 7,5 fois plus de performances IA une attention 3 fois plus rapide. Il devrait être disponible à la fin de 2026.

Pour ceux qui se demandent pourquoi les fenêtres de contexte ne cessent de s’élargir — comme ces fenêtres de 1 million de jetons présentes dans des modèles tels que DeepSeek et les derniers modèles de pointe — le Rubin CPX est le processeur matériel qui rend économiquement viable l’inférence sur des millions de jetons.

Quand pourrez-vous réellement l’utiliser ?

Rubin est une plateforme conçue pour les centres de données : vous ne pourrez pas l’acheter directement, mais vous en ressentirez les effets via les services que vous utilisez :

  • Les instances cloud seront disponibles au second semestre 2026. Parmi les premiers fournisseurs figurent : AWS, Google Cloud, Microsoft Azure et OCI, ainsi que les partenaires cloud NVIDIA CoreWeave, Lambda, Nebius et Nscale. Si vous louez des GPU, consultez notre comparatif des meilleurs fournisseurs cloud de GPU pour l’IA lorsque les instances Rubin seront disponibles.
  • Le Rubin CPX sera lancé à la fin de 2026 pour les charges de travail à long contexte et vidéo.
  • L’angle local : au Computex, NVIDIA a également dévoilé une feuille de route visant à intégrer cette architecture dans les ordinateurs de bureau et portables dotés d’IA locale — sa gamme RTX/DGX Spark, dont une génération basée sur Rubin (utilisant de la mémoire LPDDR6), suivie par les futurs designs « Rosa » et « Feynman ». Ainsi, la technologie qui débute dans les centres de données est destinée à rejoindre votre bureau, tout comme les ordinateurs personnels dotés d’IA.

Rubin contre Blackwell

DimensionVera Rubin (génération suivante)Blackwell (génération actuelle)
Système phareVera Rubin NVL72GB300 NVL72
Coût d’inférence par jetonJusqu’à 10 fois inférieurRéférence
GPU nécessaires pour entraîner un modèle MoE4 fois moins nombreuxRéférence
Assemblage / maintenanceJusqu’à 18 fois plus rapideRéférence
Puce pour contextes étendusRubin CPX (128 Go, fenêtre de 1 million de jetons)
StatutProduction complète ; disponibilité cloud H2 2026Disponible dès maintenant

Pourquoi cela compte — même si vous n’y touchez jamais

Il est tentant de classer les GPU pour centres de données sous la catégorie « pas mon problème ». Pourtant, Rubin affecte tous les utilisateurs d’IA :

  • Des outils IA moins chers et plus performants. Un gain d’efficacité d’inférence de 10× permet aux fournisseurs de continuer à réduire les prix des API et à augmenter les limites d’utilisation. La baisse constante du coût d’utilisation de modèles tels que Claude et GPT est directement liée à ce type d’avancée matérielle.
  • Un contexte plus long, concrètement. Le Rubin CPX rend économiquement viable l’inférence sur un million de jetons, ce qui explique pourquoi les modèles de pointe élargissent sans cesse leurs fenêtres de contexte.
  • La pression sur les GPU grand public. À l’inverse : la demande insatiable d’accélérateurs IA (et de la mémoire qu’ils consomment) contribue en partie à la pénurie et à la hausse des prix des cartes graphiques grand public en 2026. Si vous assemblez un poste local dédié à l’IA, consultez notre meilleurs GPU pour les LLM locaux guide.
  • La diffusion vers le marché grand public. Ce qui est déployé aujourd’hui dans un bâti NVL72 définira ce qui équipera les postes de travail IA de bureau dans quelques années.

FAQ

Qu’est-ce que NVIDIA Vera Rubin ?

Vera Rubin est la prochaine plateforme IA de NVIDIA, succédant à Blackwell, et a été annoncée en production complète au Computex 2026. Il s’agit d’une plateforme co-conçue comprenant six puces (processeur Vera, GPU Rubin, NVLink 6, ConnectX-9, BlueField-4 et Spectrum-6), conçue pour réduire drastiquement le coût de l’entraînement et de l’exécution des modèles IA.

De combien Rubin est-il plus rapide que Blackwell ?

Selon les chiffres fournis par NVIDIA, Rubin permet une réduction allant jusqu’à 10× du coût d’inférence par jeton et nécessite 4× moins de GPU pour entraîner des modèles de type Mixture-of-Experts (MoE) comparé à Blackwell. Son système phare NVL72 est également jusqu’à 18× plus rapide à assembler et à entretenir. Ces performances sont issues de benchmarks internes du fabricant ; une vérification indépendante reste à venir.

Qu’est-ce que le Rubin CPX ?

Le Rubin CPX est une nouvelle catégorie de GPU NVIDIA spécifiquement conçue pour l’inférence à très large contexte — notamment le codage ou la génération vidéo sur des millions de jetons. Chaque unité dispose de 128 Go de mémoire GDDR7 et offre jusqu’à 30 pétaflops de puissance de calcul en NVFP4, avec un encodeur/décodeur vidéo intégré. Il devrait être disponible à la fin de 2026.

Quand le Rubin NVIDIA sera-t-il disponible ?

Rubin est déjà en production complète, avec des instances cloud prévues au second semestre 2026 chez des fournisseurs tels qu’AWS, Google Cloud, Microsoft Azure, OCI, CoreWeave, Lambda, Nebius et Nscale. Le Rubin CPX sera quant à lui lancé à la fin de 2026.

Puis-je acheter un GPU Rubin pour mon PC ?

Non : Rubin est une plateforme destinée aux centres de données, accessible uniquement via des fournisseurs cloud, et non une carte grand public. Toutefois, NVIDIA a présenté une feuille de route visant à décliner progressivement cette architecture dans les ordinateurs de bureau et portables dotés d’IA locale (sa gamme RTX/DGX Spark).

Que signifie Rubin pour les prix de l’IA ?

La réduction du coût d’inférence constitue le principal levier derrière la baisse des prix des API IA et l’augmentation des limites d’utilisation. Si les gains d’efficacité annoncés par NVIDIA se confirment, Rubin devrait contribuer à rendre les outils IA que vous utilisez moins chers, plus rapides et capables de traiter des entrées nettement plus longues.

Conclusion

Vera Rubin constitue le signal le plus clair à ce jour quant à la direction prise par l’IA : non seulement des modèles plus intelligents, mais aussi radicalement moins coûteux à exécuterEn concevant conjointement une plateforme entière de six puces autour de l’efficacité de l’inférence — et en intégrant une puce dédiée capable de traiter un million de jetons dans le Rubin CPX — NVIDIA s’attaque au coût le plus élevé de l’IA en production. Les économies d’inférence annoncées de 10× ne se répercuteront pas intégralement sur votre facture, et les chiffres fournis par le fabricant méritent un examen indépendant. Toutefois, la direction prise est claire : le matériel qui rend aujourd’hui l’IA coûteuse est progressivement remplacé par un matériel qui la rendra abordable demain — c’est pourquoi vos outils d’IA continueront de s’améliorer et de devenir plus accessibles tout au long de l’année 2026 et au-delà.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts des API et l’économie de l’auto-hébergement. Il écrit sur la tarification des modèles, les résultats des benchmarks et le matériel nécessaire pour exécuter localement des modèles IA, privilégiant systématiquement les chiffres mesurés aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That