- Windows : appuyez sur Ctrl+Maj+Échap → Performances → GPU et lisez Mémoire GPU dédiée. Sur les cartes NVIDIA, exécutez la commande
nvidia-smidans un terminal pour obtenir la valeur exacte ainsi que l’utilisation en temps réel. - macOS : Menu Pomme → À propos de ce Mac. Sur les puces Apple Silicon, la valeur indiquée sous « Mémoire » correspond à la mémoire unifiée partagée entre le CPU et le GPU — il n’existe pas de VRAM distincte.
- Linux :
nvidia-smi(NVIDIA),rocm-smi --showmeminfo vram(AMD) ouglxinfo -Bsur les pilotes Mesa. - Seule la dédiée VRAM détermine quel modèle peut être utilisé. Saisissez votre valeur dans le Calculateur de VRAM pour connaître les modèles compatibles.
Comment vérifier la VRAM, en une ligne par système : sous Windows, appuyez sur Ctrl+Maj+Échapet ouvrez l’onglet Performances Sélectionnez votre GPU, puis lisez Mémoire GPU dédiée; sur macOS, ouvrez le menu Pomme → À propos de ce Mac; sur Linux, exécutez la commande nvidia-smi pour NVIDIA ou rocm-smi pour AMD. Voici ci-dessous chaque méthode détaillée — ainsi que l’explication de ce que signifient concrètement ces chiffres lorsque vous évaluez si une LLM local conviendra à vos besoins.
- Comment vérifier la mémoire vidéo (VRAM) sous Windows
- Comment vérifier la mémoire vidéo (VRAM) sous macOS
- Comment vérifier la mémoire vidéo (VRAM) sous Linux
- Mémoire totale vs. mémoire libre vs. mémoire partagée : signification des chiffres affichés
- De quelle quantité de VRAM avez-vous réellement besoin ?
- Questions fréquemment posées
Comment vérifier la mémoire vidéo (VRAM) sous Windows
Gestionnaire des tâches — la méthode la plus rapide
- Appuyez sur Ctrl+Maj+Échap pour ouvrir le Gestionnaire des tâches.
- Accédez à l’onglet Performances Performances (sous Windows 10, cliquez d’abord sur Plus de détails
- si vous voyez l’affichage compact). Cliquez sur GPU 0 GPU 1 — la carte graphique dédiée est généralement désignée par GPU 1.
- Lire Mémoire GPU dédiée dans la zone inférieure droite. Il s’agit de votre VRAM physique, affichée sous la forme « utilisée / totale » (par exemple, 2,1 / 24,0 Go).
Ignorez la ligne Mémoire GPU : elle additionne la mémoire GPU partagée (mémoire vive système que le GPU est autorisé à emprunter) à la mémoire dédiée, ce qui peut faire apparaître une carte de 8 Go comme une carte de 24 Go. Nous revenons plus en détail sur cette distinction ci-dessous.
dxdiag
Appuyez sur Win+R, saisissez dxdiag, appuyez sur Entrée, puis ouvrez l’onglet Affichage Affichage Mémoire d’affichage (VRAM) indique la valeur rapportée par DirectX. Une mise en garde toutefois : selon la version du pilote, dxdiag intègre parfois la mémoire système partagée dans ce chiffre, ce qui peut conduire à une valeur supérieure à la VRAM réelle de la carte. Préférez donc la valeur « dédiée » fournie par le Gestionnaire des tâches ou nvidia-smi comme référence fiable.
Paramètres → Affichage → Affichage avancé
Ouvrir Paramètres → Système → Affichage → Affichage avancé, puis cliquez sur Propriétés de l’adaptateur d’affichage pour l’affichage 1. L’onglet Adaptateur indique la Mémoire vidéo dédiée en mégaoctets (Mo). La formulation exacte varie légèrement entre Windows 10 et Windows 11, mais le chemin d’accès reste identique.
nvidia-smi — la valeur exacte
Si vous disposez d’un GPU NVIDIA, le pilote installe un outil en ligne de commande qui affiche la mémoire en mébioctets (MiB). Ouvrez PowerShell ou l’invite de commandes, puis exécutez la commande suivante :
nvidia-smiLa colonne « Mémoire » affiche l’utilisation actuelle par rapport à la capacité totale réelle — par exemple 3216 MiB / 24564 MiB sur une RTX 4090 — tandis que la liste des processus en bas indique quels programmes occupent cette mémoire. Pour une sortie propre et lisible par machine, utilisez plutôt :
nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csvSi la commande n’est pas reconnue, les versions récentes des pilotes l’installent dans C:\Windows\System32\nvidia-smi.exe; les versions antérieures utilisaient C:\Program Files\NVIDIA Corporation\NVSMI.
Comment vérifier la mémoire vidéo (VRAM) sous macOS
Cliquez sur le menu Pomme → À propos de ce Mac.
- Puces Apple Silicon (M1 et ultérieures) : vous verrez un nom de puce suivi d’une valeur telle que 16 Go, 36 Go ou 128 Go. Il s’agit de la Mémoire mémoire unifiée mémoire unifiée — un espace mémoire unique partagé entre le processeur (CPU) et le processeur graphique (GPU). Il n’existe pas de valeur distincte de VRAM, car il n’y a pas de VRAM séparée.
- Mac Intel : Les GPU discrets sont listés avec une quantité dédiée de mémoire vidéo (VRAM), par exemple « Radeon Pro 5500M 8 Go ».
Pour plus de détails, ouvrez À propos de ce Mac → Plus d’informations → Rapport système et sélectionnez Graphiques/Écrans, ou exécutez ceci dans le Terminal :
system_profiler SPDisplaysDataTypeSur les machines Intel, cela affiche une ligne VRAM (totale) ; sur les puces Apple Silicon, cela liste plutôt la puce et le nombre de cœurs GPU.
Pourquoi la mémoire unifiée change les calculs
Sur les puces Apple Silicon, le GPU peut adresser la majeure partie — mais pas la totalité — de la mémoire système. macOS en réserve une part pour lui-même, et par défaut, la limite de la zone de travail du GPU se situe approximativement aux deux tiers ou trois quarts de la mémoire RAM totale ; cette limite exacte varie selon la capacité de la RAM et la version de macOS. En pratique, un MacBook Pro équipé de 36 Go de RAM peut charger des modèles qui exigeraient une carte graphique discrète de 24 Go sur un PC. Les outils de LLM locaux indiquent directement cette limite utilisable — consultez le guide LM Studio et le Guide Ollama pour savoir comment chacun l’affiche. Le compromis réside dans la bande passante mémoire, qui varie fortement entre les puces de base, Pro, Max et Ultra, et influe directement sur le nombre de jetons par seconde.
Comment vérifier la mémoire vidéo (VRAM) sous Linux
NVIDIA : nvidia-smi
Installé avec le pilote propriétaire. Exécutez nvidia-smi pour une capture instantanée, ou actualisez toutes les secondes pendant le chargement d’un modèle :
nvidia-smi -l 1AMD : rocm-smi ou sysfs
Avec la pile ROCm installée :
rocm-smi --showmeminfo vramSans ROCm, le pilote noyau amdgpu expose directement la mémoire totale (en octets ; votre carte peut être card1 — vérifiez avec ls /sys/class/drm/):
cat /sys/class/drm/card0/device/mem_info_vram_totalToute carte graphique : glxinfo
Installer mesa-utils (Debian/Ubuntu) ou glx-utils (Fedora), puis :
glxinfo -B | grep -i memoryLes pilotes Mesa affichent une ligne telle que Mémoire vidéo : 8192 Mo; l’intitulé exact varie selon le pilote.
lspci — identifie la carte, pas la VRAM
lspci | grep -iE 'vga|3d'sudo lspci -v -s affiche ensuite les fenêtres mémoire (apertures) de la carte, mais attention : il s’agit des tailles des BAR PCI, qui ne correspondent à la VRAM totale que si la fonction Resizable BAR est activée. Utilisez lspci pour identifier précisément le modèle de la carte graphique, puis récupérez la valeur de mémoire via les outils ci-dessus ou la fiche technique de la carte.
Mémoire totale vs. mémoire libre vs. mémoire partagée : signification des chiffres affichés
| Nombre | Où vous le voyez | Ce que cela signifie pour les LLM |
|---|---|---|
| VRAM dédiée (totale) | Mémoire GPU dédiée dans le Gestionnaire des tâches ; nvidia-smi total | Mémoire physique présente sur la carte. Il s’agit du budget maximal strict pour les poids du modèle. |
| VRAM libre | nvidia-smi memory.free | Ce qui est disponible à l’instant. Le bureau, les onglets du navigateur et d’autres applications occupent généralement entre 0,5 et 2 Go. |
| mémoire GPU partagée | Mémoire GPU partagée dans le Gestionnaire des tâches | Mémoire système (jusqu’à environ la moitié) dans laquelle le GPU peut déborder via PCIe. Beaucoup plus lente que la VRAM — ne la comptez pas lors du dimensionnement d’un modèle. |
| Mémoire unifiée (Apple Silicon) | « Mémoire » dans À propos de ce Mac | Un seul espace mémoire partagé entre CPU et GPU. Le GPU peut en utiliser la majeure partie, ce qui équivaut à disposer d’un vaste pool de VRAM, dont la bande passante dépend toutefois de la puce. |
Lors du chargement d’un modèle, ce qui compte, c’est la VRAM libre et non la VRAM totale. Une carte de 12 Go dont 1,5 Go sont déjà consommés par le compositeur et un navigateur ne laisse que 10,5 Go disponibles — ce qui peut suffire à faire échouer le chargement d’un modèle censé « tenir ». Sur NVIDIA, la liste des processus par processus, située en bas de la sortie de nvidia-smi nvidia-smi
De quelle quantité de VRAM avez-vous réellement besoin ?
vous indique précisément quelles applications fermer.
| Taille du modèle | Poids en 4 bits (approx.) | VRAM nécessaire pour une exécution confortable |
|---|---|---|
| 7–8 milliards | 4–5 Go | 6–8 Go |
| 12–14 milliards | 7–9 Go | 10–12 Go |
| 24–32 milliards | 13–19 Go | 16–24 Go |
| 70 milliards | 36–42 Go | 48 Go, ou répartition sur deux GPU |
La colonne « confortable » suppose un contexte modéré (4 000 à 8 000 jetons) ; des contextes très longs ajoutent plusieurs gigaoctets supplémentaires au cache KV. Pour des chiffres précis par modèle, consultez le tableau des besoins en VRAM pour chaque grand modèle de langage (LLM) ou parcourez le base de données de modèles. Pour connaître précisément les besoins en VRAM selon votre combinaison spécifique de modèle, de niveau de quantification et de longueur de contexte, utilisez le Calculateur de VRAM. Si votre carte graphique ne suffit pas, le meilleurs GPU pour les LLM locaux guide de mise à niveau classe les options par rapport à la VRAM obtenue pour chaque dollar dépensé — et si l’achat d’un nouveau GPU n’est pas rentable, la calculatrice d’indifférence entre auto-hébergement et API indique à partir de quel seuil il devient moins coûteux de payer par jeton.
Questions fréquemment posées
Puis-je augmenter la VRAM de ma carte graphique ?
Non, sur une carte graphique dédiée — les puces mémoire sont soudées à la carte, donc la seule solution consiste à remplacer la carte elle-même. Les GPU intégrés constituent une exception : certains paramètres du BIOS/UEFI permettent de modifier l’allocation mémoire (souvent intitulée « Taille du tampon image UMA » ou similaire). La mémoire GPU partagée de Windows n’est pas une VRAM supplémentaire et n’affecte pas la quantité de modèle pouvant être chargée à pleine vitesse.
Pourquoi Windows affiche-t-il plus de mémoire GPU que celle dont ma carte est réellement dotée ?
La ligne « Mémoire GPU » du Gestionnaire des tâches correspond à la VRAM dédiée additionnée de la mémoire système partagée, et dxdiag peut gonfler ce chiffre de la même manière. La VRAM physique correspond à la valeur « Mémoire GPU dédiée », ou au total affiché par la commande nvidia-smi . Une carte de 8 Go installée sur un PC disposant de 32 Go de RAM affichera souvent 24 Go de « Mémoire GPU » — dont seuls 8 Go constituent de la vraie VRAM.
La mémoire GPU partagée permet-elle de faire fonctionner des LLM plus volumineux ?
Pas de façon significative. Des environnements d’exécution comme llama.cpp et Ollama peuvent délibérément décharger certaines couches vers la mémoire système, ce qui permet d’exécuter un modèle trop volumineux — mais la vitesse de génération chute typiquement de dizaines à seulement quelques unités de jetons par seconde. Dimensionnez votre modèle en fonction de la VRAM dédiée, et considérez le déchargement vers la RAM comme une solution de repli, non comme une stratégie principale.
De combien de VRAM un modèle de 7 ou 8 milliards de paramètres a-t-il besoin ?
Environ 4–5 Go pour les poids en 4 bits, donc une carte de 6–8 Go permet de faire tourner un tel modèle confortablement, avec une marge suffisante pour le contexte. Une carte de 8 Go gère très bien les modèles de 7–8 milliards de paramètres ; 12 Go permettent d’accéder aux modèles de 12–14 milliards. Le guide des meilleurs modèles locaux pour Ollama associe les modèles populaires aux différentes catégories de VRAM.
La mémoire unifiée sur Mac équivaut-elle à de la VRAM ?
Pour l’exécution des LLM, c’est quasiment identique : le GPU accède à un espace mémoire partagé unique, limité par le système à environ les deux tiers aux trois quarts de la mémoire RAM totale. Ainsi, un Mac équipé de 32 Go de RAM peut exécuter des modèles que ne pourrait pas faire tourner une carte GPU PC de 12 Go. La différence apparaît dans la bande passante mémoire, qui varie de plusieurs ordres de grandeur entre les puces de base et les puces Max/Ultra, et fixe votre plafond en nombre de jetons par seconde.
Comment surveiller l’utilisation de la VRAM pendant l’exécution d’un modèle ?
Sur NVIDIA (sur tout système d’exploitation), exécutez nvidia-smi -l 1 pour une actualisation toutes les secondes. Sous Windows, le volet GPU du Gestionnaire des tâches se met à jour en temps réel. Sur Linux AMD, utilisez watch -n 1 rocm-smi --showmeminfo vram; sur Mac, les poids des modèles apparaissent comme une mémoire processus classique dans l’onglet « Mémoire » du Moniteur d’activité, puisque la mémoire est unifiée.

