Monday, 3 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Comment vérifier la VRAM sous Windows, macOS et Linux

  • Windows : appuyez sur Ctrl+Maj+ÉchapPerformancesGPU et lisez Mémoire GPU dédiée. Sur les cartes NVIDIA, exécutez la commande nvidia-smi dans un terminal pour obtenir la valeur exacte ainsi que l’utilisation en temps réel.
  • macOS : Menu Pomme → À propos de ce Mac. Sur les puces Apple Silicon, la valeur indiquée sous « Mémoire » correspond à la mémoire unifiée partagée entre le CPU et le GPU — il n’existe pas de VRAM distincte.
  • Linux : nvidia-smi (NVIDIA), rocm-smi --showmeminfo vram (AMD) ou glxinfo -B sur les pilotes Mesa.
  • Seule la dédiée VRAM détermine quel modèle peut être utilisé. Saisissez votre valeur dans le Calculateur de VRAM pour connaître les modèles compatibles.

Comment vérifier la VRAM, en une ligne par système : sous Windows, appuyez sur Ctrl+Maj+Échapet ouvrez l’onglet Performances Sélectionnez votre GPU, puis lisez Mémoire GPU dédiée; sur macOS, ouvrez le menu Pomme → À propos de ce Mac; sur Linux, exécutez la commande nvidia-smi pour NVIDIA ou rocm-smi pour AMD. Voici ci-dessous chaque méthode détaillée — ainsi que l’explication de ce que signifient concrètement ces chiffres lorsque vous évaluez si une LLM local conviendra à vos besoins.

Comment vérifier la mémoire vidéo (VRAM) sous Windows

Gestionnaire des tâches — la méthode la plus rapide

  1. Appuyez sur Ctrl+Maj+Échap pour ouvrir le Gestionnaire des tâches.
  2. Accédez à l’onglet Performances Performances (sous Windows 10, cliquez d’abord sur Plus de détails
  3. si vous voyez l’affichage compact). Cliquez sur GPU 0 GPU 1 — la carte graphique dédiée est généralement désignée par GPU 1.
  4. Lire Mémoire GPU dédiée dans la zone inférieure droite. Il s’agit de votre VRAM physique, affichée sous la forme « utilisée / totale » (par exemple, 2,1 / 24,0 Go).

Ignorez la ligne Mémoire GPU : elle additionne la mémoire GPU partagée (mémoire vive système que le GPU est autorisé à emprunter) à la mémoire dédiée, ce qui peut faire apparaître une carte de 8 Go comme une carte de 24 Go. Nous revenons plus en détail sur cette distinction ci-dessous.

dxdiag

Appuyez sur Win+R, saisissez dxdiag, appuyez sur Entrée, puis ouvrez l’onglet Affichage Affichage Mémoire d’affichage (VRAM) indique la valeur rapportée par DirectX. Une mise en garde toutefois : selon la version du pilote, dxdiag intègre parfois la mémoire système partagée dans ce chiffre, ce qui peut conduire à une valeur supérieure à la VRAM réelle de la carte. Préférez donc la valeur « dédiée » fournie par le Gestionnaire des tâches ou nvidia-smi comme référence fiable.

Paramètres → Affichage → Affichage avancé

Ouvrir Paramètres → Système → Affichage → Affichage avancé, puis cliquez sur Propriétés de l’adaptateur d’affichage pour l’affichage 1. L’onglet Adaptateur indique la Mémoire vidéo dédiée en mégaoctets (Mo). La formulation exacte varie légèrement entre Windows 10 et Windows 11, mais le chemin d’accès reste identique.

nvidia-smi — la valeur exacte

Si vous disposez d’un GPU NVIDIA, le pilote installe un outil en ligne de commande qui affiche la mémoire en mébioctets (MiB). Ouvrez PowerShell ou l’invite de commandes, puis exécutez la commande suivante :

nvidia-smi

La colonne « Mémoire » affiche l’utilisation actuelle par rapport à la capacité totale réelle — par exemple 3216 MiB / 24564 MiB sur une RTX 4090 — tandis que la liste des processus en bas indique quels programmes occupent cette mémoire. Pour une sortie propre et lisible par machine, utilisez plutôt :

nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csv

Si la commande n’est pas reconnue, les versions récentes des pilotes l’installent dans C:\Windows\System32\nvidia-smi.exe; les versions antérieures utilisaient C:\Program Files\NVIDIA Corporation\NVSMI.

Comment vérifier la mémoire vidéo (VRAM) sous macOS

Cliquez sur le menu Pomme → À propos de ce Mac.

  • Puces Apple Silicon (M1 et ultérieures) : vous verrez un nom de puce suivi d’une valeur telle que 16 Go, 36 Go ou 128 Go. Il s’agit de la Mémoire mémoire unifiée mémoire unifiée — un espace mémoire unique partagé entre le processeur (CPU) et le processeur graphique (GPU). Il n’existe pas de valeur distincte de VRAM, car il n’y a pas de VRAM séparée.
  • Mac Intel : Les GPU discrets sont listés avec une quantité dédiée de mémoire vidéo (VRAM), par exemple « Radeon Pro 5500M 8 Go ».

Pour plus de détails, ouvrez À propos de ce Mac → Plus d’informations → Rapport système et sélectionnez Graphiques/Écrans, ou exécutez ceci dans le Terminal :

system_profiler SPDisplaysDataType

Sur les machines Intel, cela affiche une ligne VRAM (totale) ; sur les puces Apple Silicon, cela liste plutôt la puce et le nombre de cœurs GPU.

Pourquoi la mémoire unifiée change les calculs

Sur les puces Apple Silicon, le GPU peut adresser la majeure partie — mais pas la totalité — de la mémoire système. macOS en réserve une part pour lui-même, et par défaut, la limite de la zone de travail du GPU se situe approximativement aux deux tiers ou trois quarts de la mémoire RAM totale ; cette limite exacte varie selon la capacité de la RAM et la version de macOS. En pratique, un MacBook Pro équipé de 36 Go de RAM peut charger des modèles qui exigeraient une carte graphique discrète de 24 Go sur un PC. Les outils de LLM locaux indiquent directement cette limite utilisable — consultez le guide LM Studio et le Guide Ollama pour savoir comment chacun l’affiche. Le compromis réside dans la bande passante mémoire, qui varie fortement entre les puces de base, Pro, Max et Ultra, et influe directement sur le nombre de jetons par seconde.

Comment vérifier la mémoire vidéo (VRAM) sous Linux

NVIDIA : nvidia-smi

Installé avec le pilote propriétaire. Exécutez nvidia-smi pour une capture instantanée, ou actualisez toutes les secondes pendant le chargement d’un modèle :

nvidia-smi -l 1

AMD : rocm-smi ou sysfs

Avec la pile ROCm installée :

rocm-smi --showmeminfo vram

Sans ROCm, le pilote noyau amdgpu expose directement la mémoire totale (en octets ; votre carte peut être card1 — vérifiez avec ls /sys/class/drm/):

cat /sys/class/drm/card0/device/mem_info_vram_total

Toute carte graphique : glxinfo

Installer mesa-utils (Debian/Ubuntu) ou glx-utils (Fedora), puis :

glxinfo -B | grep -i memory

Les pilotes Mesa affichent une ligne telle que Mémoire vidéo : 8192 Mo; l’intitulé exact varie selon le pilote.

lspci — identifie la carte, pas la VRAM

lspci | grep -iE 'vga|3d'

sudo lspci -v -s affiche ensuite les fenêtres mémoire (apertures) de la carte, mais attention : il s’agit des tailles des BAR PCI, qui ne correspondent à la VRAM totale que si la fonction Resizable BAR est activée. Utilisez lspci pour identifier précisément le modèle de la carte graphique, puis récupérez la valeur de mémoire via les outils ci-dessus ou la fiche technique de la carte.

Mémoire totale vs. mémoire libre vs. mémoire partagée : signification des chiffres affichés

NombreOù vous le voyezCe que cela signifie pour les LLM
VRAM dédiée (totale)Mémoire GPU dédiée dans le Gestionnaire des tâches ; nvidia-smi totalMémoire physique présente sur la carte. Il s’agit du budget maximal strict pour les poids du modèle.
VRAM librenvidia-smi memory.freeCe qui est disponible à l’instant. Le bureau, les onglets du navigateur et d’autres applications occupent généralement entre 0,5 et 2 Go.
mémoire GPU partagéeMémoire GPU partagée dans le Gestionnaire des tâchesMémoire système (jusqu’à environ la moitié) dans laquelle le GPU peut déborder via PCIe. Beaucoup plus lente que la VRAM — ne la comptez pas lors du dimensionnement d’un modèle.
Mémoire unifiée (Apple Silicon)« Mémoire » dans À propos de ce MacUn seul espace mémoire partagé entre CPU et GPU. Le GPU peut en utiliser la majeure partie, ce qui équivaut à disposer d’un vaste pool de VRAM, dont la bande passante dépend toutefois de la puce.

Lors du chargement d’un modèle, ce qui compte, c’est la VRAM libre et non la VRAM totale. Une carte de 12 Go dont 1,5 Go sont déjà consommés par le compositeur et un navigateur ne laisse que 10,5 Go disponibles — ce qui peut suffire à faire échouer le chargement d’un modèle censé « tenir ». Sur NVIDIA, la liste des processus par processus, située en bas de la sortie de nvidia-smi nvidia-smi

De quelle quantité de VRAM avez-vous réellement besoin ?

vous indique précisément quelles applications fermer.

Taille du modèlePoids en 4 bits (approx.)VRAM nécessaire pour une exécution confortable
7–8 milliards4–5 Go6–8 Go
12–14 milliards7–9 Go10–12 Go
24–32 milliards13–19 Go16–24 Go
70 milliards36–42 Go48 Go, ou répartition sur deux GPU

La colonne « confortable » suppose un contexte modéré (4 000 à 8 000 jetons) ; des contextes très longs ajoutent plusieurs gigaoctets supplémentaires au cache KV. Pour des chiffres précis par modèle, consultez le tableau des besoins en VRAM pour chaque grand modèle de langage (LLM) ou parcourez le base de données de modèles. Pour connaître précisément les besoins en VRAM selon votre combinaison spécifique de modèle, de niveau de quantification et de longueur de contexte, utilisez le Calculateur de VRAM. Si votre carte graphique ne suffit pas, le meilleurs GPU pour les LLM locaux guide de mise à niveau classe les options par rapport à la VRAM obtenue pour chaque dollar dépensé — et si l’achat d’un nouveau GPU n’est pas rentable, la calculatrice d’indifférence entre auto-hébergement et API indique à partir de quel seuil il devient moins coûteux de payer par jeton.

Questions fréquemment posées

Puis-je augmenter la VRAM de ma carte graphique ?

Non, sur une carte graphique dédiée — les puces mémoire sont soudées à la carte, donc la seule solution consiste à remplacer la carte elle-même. Les GPU intégrés constituent une exception : certains paramètres du BIOS/UEFI permettent de modifier l’allocation mémoire (souvent intitulée « Taille du tampon image UMA » ou similaire). La mémoire GPU partagée de Windows n’est pas une VRAM supplémentaire et n’affecte pas la quantité de modèle pouvant être chargée à pleine vitesse.

Pourquoi Windows affiche-t-il plus de mémoire GPU que celle dont ma carte est réellement dotée ?

La ligne « Mémoire GPU » du Gestionnaire des tâches correspond à la VRAM dédiée additionnée de la mémoire système partagée, et dxdiag peut gonfler ce chiffre de la même manière. La VRAM physique correspond à la valeur « Mémoire GPU dédiée », ou au total affiché par la commande nvidia-smi . Une carte de 8 Go installée sur un PC disposant de 32 Go de RAM affichera souvent 24 Go de « Mémoire GPU » — dont seuls 8 Go constituent de la vraie VRAM.

La mémoire GPU partagée permet-elle de faire fonctionner des LLM plus volumineux ?

Pas de façon significative. Des environnements d’exécution comme llama.cpp et Ollama peuvent délibérément décharger certaines couches vers la mémoire système, ce qui permet d’exécuter un modèle trop volumineux — mais la vitesse de génération chute typiquement de dizaines à seulement quelques unités de jetons par seconde. Dimensionnez votre modèle en fonction de la VRAM dédiée, et considérez le déchargement vers la RAM comme une solution de repli, non comme une stratégie principale.

De combien de VRAM un modèle de 7 ou 8 milliards de paramètres a-t-il besoin ?

Environ 4–5 Go pour les poids en 4 bits, donc une carte de 6–8 Go permet de faire tourner un tel modèle confortablement, avec une marge suffisante pour le contexte. Une carte de 8 Go gère très bien les modèles de 7–8 milliards de paramètres ; 12 Go permettent d’accéder aux modèles de 12–14 milliards. Le guide des meilleurs modèles locaux pour Ollama associe les modèles populaires aux différentes catégories de VRAM.

La mémoire unifiée sur Mac équivaut-elle à de la VRAM ?

Pour l’exécution des LLM, c’est quasiment identique : le GPU accède à un espace mémoire partagé unique, limité par le système à environ les deux tiers aux trois quarts de la mémoire RAM totale. Ainsi, un Mac équipé de 32 Go de RAM peut exécuter des modèles que ne pourrait pas faire tourner une carte GPU PC de 12 Go. La différence apparaît dans la bande passante mémoire, qui varie de plusieurs ordres de grandeur entre les puces de base et les puces Max/Ultra, et fixe votre plafond en nombre de jetons par seconde.

Comment surveiller l’utilisation de la VRAM pendant l’exécution d’un modèle ?

Sur NVIDIA (sur tout système d’exploitation), exécutez nvidia-smi -l 1 pour une actualisation toutes les secondes. Sous Windows, le volet GPU du Gestionnaire des tâches se met à jour en temps réel. Sur Linux AMD, utilisez watch -n 1 rocm-smi --showmeminfo vram; sur Mac, les poids des modèles apparaissent comme une mémoire processus classique dans l’onglet « Mémoire » du Moniteur d’activité, puisque la mémoire est unifiée.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts des API et l’économie de l’auto-hébergement. Il écrit sur la tarification des modèles, les résultats des benchmarks et le matériel nécessaire pour exécuter localement des modèles IA, privilégiant systématiquement les chiffres mesurés aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That