Vous vous demandez si votre GPU est capable d’exécuter localement un grand modèle linguistique donné ? Cette calculatrice gratuite estime la VRAM nécessaire pour chaque modèle, à chaque niveau de quantification — et indique précisément quels modèles sont compatibles avec votre carte graphique.
| Quantification | Qualité | VRAM estimée | Compatible avec votre GPU ? |
|---|
Estimation basée sur le poids du modèle à chaque niveau de quantification, plus une surcharge mémoire d'exécution d'environ 1,5 Go. Les contextes longs ajoutent de la mémoire pour le cache KV (qui augmente avec la longueur de contexte choisie). Pour les modèles à mélange d'experts (mixture-of-experts), tous les paramètres doivent être chargés dans la VRAM, même si seul un sous-ensemble est utilisé pour chaque jeton.
Sélectionnez un modèle parmi notre Base de données des modèles IA (ou saisissez manuellement le nombre de paramètres), choisissez votre GPU, définissez votre longueur de contexte et voyez immédiatement si le modèle s'exécute — et à quelle qualité. Les estimations sont fondées sur le poids des paramètres ; les contextes longs ajoutent de la mémoire pour le cache KV en sus.
Réponse rapide : combien de mémoire VRAM est nécessaire pour exécuter un LLM localement ?
Pour exécuter un modèle de langage volumineux (LLM) localement avec une quantification à 4 bits, comptez environ 0,5 à 0,6 Go de VRAM GPU par milliard de paramètres, plus 1 à 3 Go pour le cache KV sur des longueurs de contexte typiques. En pratique, un modèle de 8 milliards de paramètres (8B) tient dans environ 5 à 6 Go (ce qui convient parfaitement à une carte RTX 3060 de 12 Go ; il fonctionne également sur une RTX 4060 de 8 Go), un modèle de 13 milliards (13B) nécessite environ 8 à 10 Go, un modèle de 32 milliards (32B) requiert une carte de 24 Go comme la RTX 4090 (~20 Go pour les poids), et un modèle de 70 milliards (70B) demande environ 40 à 48 Go — soit une seule carte de 48 Go, soit deux GPU de 24 Go. À 8 bits, ces chiffres doublent approximativement (~1 à 1,2 Go par milliard), et en fp16 ils quadruplent environ (~2 Go par milliard).
Règles empiriques rapides concernant la taille des poids du modèle, avant d’ajouter le contexte :
- 4 bits (Q4) : ~0,5 à 0,6 Go par milliard de paramètres
- 8 bits (Q8) : ~1 à 1,2 Go par milliard de paramètres
- fp16 / bf16 : ~2 Go par milliard de paramètres
- Cache KV (contexte) : ajoutez ~1 à 4 Go pour des contextes de 8K à 32K jetons, davantage pour des contextes très longs ou des modèles plus volumineux
Questions fréquemment posées
De combien de VRAM ai-je besoin pour exécuter un modèle de 70 milliards de paramètres ?
Un modèle de 70 milliards de paramètres nécessite environ 40 à 48 Go de VRAM en quantification à 4 bits — soit environ 0,5 à 0,6 Go par milliard de paramètres pour les poids, plus le cache KV. Cela tient sur une seule carte de 48 Go ou sur deux GPU de 24 Go, comme une paire de RTX 4090. En quantification à 8 bits, ce besoin double approximativement à ~80 Go, et en fp16 il atteint environ 140 Go.
Ma RTX 4060 ou une carte GPU de 12 Go peut-elle exécuter un modèle de 8 milliards ou de 7 milliards de paramètres ?
Oui. Un modèle de 7 à 8 milliards de paramètres (7B–8B) en quantification à 4 bits n’utilise que 4 à 5 Go de VRAM, ce qui permet de l’exécuter confortablement sur une carte de 12 Go comme la RTX 3060, avec une marge suffisante pour le contexte. La RTX 4060 dispose de 8 Go de VRAM et gère tout aussi bien un modèle de 7 à 8 milliards de paramètres — vous avez simplement moins de marge pour des fenêtres de contexte très longues.
De combien de VRAM un modèle de 13 milliards de paramètres a-t-il besoin ?
Un modèle de 13 milliards de paramètres nécessite environ 8 à 10 Go de VRAM en quantification à 4 bits. Il tient sur un GPU de 12 Go pour des contextes courts à modérés, mais une carte de 16 Go est plus sûre dès lors que vous ajoutez une fenêtre de contexte plus longue ainsi que les surcoûts liés au framework.
Une carte GPU de 24 Go comme la RTX 4090 peut-elle exécuter un modèle de 32 milliards ou de 70 milliards de paramètres ?
Une carte GPU de 24 Go exécute très bien un modèle de 32 milliards de paramètres en quantification à 4 bits : les poids occupent environ 20 Go, laissant quelques Go pour le cache KV. Elle ne peut pas accueillir un modèle de 70 milliards de paramètres en quantification à 4 bits — ce dernier nécessite environ 40 à 48 Go — donc vous devriez recourir à un second GPU, à un déchargement vers le CPU ou à une quantification de moindre qualité (2 à 3 bits).
Combien de mémoire GPU un LLM consomme-t-il par milliard de paramètres ?
En règle générale, comptez environ 0,5 à 0,6 Go par milliard de paramètres en quantification à 4 bits, ~1 à 1,2 Go en quantification à 8 bits et ~2 Go en fp16/bf16. Ainsi, un modèle de 30 milliards de paramètres (30B) occupe environ 16 à 18 Go en quantification à 4 bits, ~32 Go en quantification à 8 bits et ~60 Go en fp16, sans compter le cache KV.
Combien de VRAM supplémentaire le contexte (le cache KV) consomme-t-il ?
Le cache KV croît linéairement avec la longueur du contexte et ajoute environ 3 Go sur un modèle de 8 milliards de paramètres (8B) lorsque l’on passe de 8K à 32K jetons (soit environ 1 Go à 8K, puis jusqu’à environ 4 Go à 32K), les modèles plus volumineux et les contextes plus longs consommant davantage. Une quantification à 8 bits du cache KV réduit approximativement de moitié cette surcharge, donc prévoyez toujours une marge de 1 à 4 Go supplémentaires par rapport aux poids du modèle.
Quelle taille de modèle puis-je exécuter avec 8 Go ou 16 Go de VRAM ?
Avec 8 Go de VRAM, vous pouvez exécuter confortablement des modèles de 7 à 8 milliards de paramètres (7B–8B) en quantification à 4 bits ; avec 16 Go, vous pouvez exécuter jusqu’à environ 13 milliards de paramètres (13B) confortablement, voire forcer l’exécution d’un modèle de 20 à 24 milliards de paramètres (20–24B) avec un contexte modéré. Pour un modèle de 32 milliards de paramètres (32B), vous aurez besoin de 24 Go, et pour un modèle de 70 milliards (70B), environ 48 Go.
Plus d’outils gratuits de Convly
VRAM nécessaire pour exécuter localement des modèles open AI (4 bits)
1,4 Go
3 Go
4,5 Go
5 Go
5 Go
7,5 Go
8 Go
9 Go
9 Go
16 Go
18 Go
20 Go
21 Go
40 Go
40 Go
65 Go
140 Go
140 Go
240 Go
370 Go
400 Go
400 Go
500 Go
800 Go
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Aug 31, 2026.
🔍 Intégrez ce graphique sur votre site (gratuit, avec mention de la source)
Obtenez les chiffres avant tout le monde
Un e-mail par semaine : quels modèles d’IA ont changé de prix, ce que les nouveaux benchmarks mesurent réellement, et quel GPU vaut vraiment l’achat. Aucun buzz, aucun remplissage.
Gratuit. Désabonnez-vous en un clic. Nous ne vendons ni ne partageons jamais votre adresse.

