Pour les travaux d’IA locaux, la RTX 3090 a vieilli pour devenir l'une des cartes de meilleure valeur jamais créées : 24 Go de VRAM sur le marché d'occasion pour 700–900 $. La RTX 4090 redouble — les mêmes 24 Go, mais un GPU bien plus rapide à environ 1 200–1 500 $ d'occasion en 2026.
Si les deux cartes disposent de la même quantité de mémoire, la RTX 4090 vaut-elle presque le double ? La réponse honnête est : cela dépend entièrement du fait que votre temps soit ou non le goulot d’étranglement.
Points clés
- Les deux cartes disposent de 24 Go de VRAM — elles conviennent exactement aux mêmes modèles. Aucun modèle ne s'exécute sur l'une et pas sur l'autre.
- La RTX 4090 est ~1,7 fois plus rapide pour l’inférence IA et ~1,8 fois plus rapide pour le réglage fin.
- Pour Stable Diffusion XL, attendez-vous à environ 18 it/s sur la 4090 contre environ 10 it/s sur la 3090.
- La 3090 l’emporte nettement sur le rapport performance/prix et sur les configurations à deux cartes (48 Go pour environ 1 600 $).
- Optez pour la 4090 si la rapidité des itérations est primordiale ; choisissez la 3090 (ou deux exemplaires) si la capacité de VRAM prime sur la vitesse.
En un coup d'œil
| Spécifications | RTX 4090 | RTX 3090 |
|---|---|---|
| Architecture | Ada Lovelace AD102 | Ampere GA102 |
| Cœurs CUDA | 16,384 | 10,496 |
| VRAM | 24 GB GDDR6X | 24 GB GDDR6X |
| Bande passante mémoire | 1 008 GB/s | 936 GB/s |
| Tensor FP16 (dense) | ~330 TFLOPS | ~142 TFLOPS |
| TDP | 450 W | 350 W |
| Prix de lancement | $1,599 | $1,499 |
| Prix occasion (2026) | 1 200–1 500 $ | 700–900 $ |
La mémoire vidéo (VRAM) : un critère décisif
Le paramètre le plus important pour l’IA locale est la VRAM, et sur ce point, les deux cartes sont identiques : 24 GB. Cela signifie que tout modèle pouvant tenir sur l’une tient également sur l’autre :
- Llama 3 8B et Classe 13B les modèles s'exécutent confortablement en précision complète ou quasi complète.
- Llama 3 70B ne s'ajuste qu'avec une quantification agressive 4-bit (Q4_K_M ≈ 40 Go) et un déchargement CPU partiel — douloureux sur l'une ou l'autre carte seule.
- Stable Diffusion XL et Flux les modèles d'images tiennent avec de la place à revendre.
Comme le plafond mémoire est identique, la 4090 ne déverrouille jamais un modèle que la 3090 ne peut pas toucher. L'avantage de la 4090 est purement la vitesse — elle fait le même travail plus rapidement.
Résultats des benchmarks d’inférence
Pour l'inférence LLM, l'écart suit la bande passante mémoire et le débit tensoriel :
| Charge de travail | RTX 4090 | RTX 3090 |
|---|---|---|
| Llama 3 8B Q4_K_M | ~140 tok/s | ~95 tok/s |
| Llama 3 classe 13B Q4 | ~90 tok/s | ~58 tok/s |
| SDXL 1024×1024 (30 étapes) | ~18 it/s | ~10 it/s |
| Flux.1 dev (1024px) | ~2,4 s/image | ~4,6 s/image |
Le motif est constant : la 4090 atteint environ 1,6 à 1,8 fois le débit du 3090. Il s'agit d'une différence réelle et tangible : un lot Stable Diffusion qui prend dix minutes sur le 3090 se termine en environ six minutes sur le 4090.
L'affinage et l'entraînement
Pour L'affinage LoRA d'un modèle de 7 à 8 milliards de paramètres, le débit supérieur des cœurs tensoriels du 4090 et ses chemins FP16/BF16 plus rapides comptent davantage qu'en inférence. Une exécution typique de LoRA qui prend environ cinq heures sur le 3090 se termine en environ deux heures trois quarts sur le 4090 — soit un gain de vitesse proche de 1,8×.
La 3090 a une seule faiblesse discrète ici : elle manque du support FP8 amélioré de la 4090, donc les recettes d'entraînement FP8 émergentes reviennent à BF16 ou ne s'exécutent pas du tout. Si vous envisagez de suivre les techniques d'entraînement de pointe, la 4090 vieillit mieux.
Puissance et chaleur
La 3090 consomme 350 W; la 4090 consomme 450 W et peut même dépasser ce seuil sous une charge IA soutenue. Sur une année d’utilisation intensive, cette différence se traduit par une augmentation mesurable de votre facture d’électricité ; par ailleurs, le 4090 requiert une alimentation plus puissante (minimum 850 W, recommandé 1000 W). Le 3090 chauffe également fortement sur ses modules mémoire GDDR6X — un remplacement des pastilles thermiques est donc conseillé sur les unités d’occasion.
Choisissez la RTX 4090 si
- Vous itérez constamment et valorisez le temps par rapport à l'argent
- Vous voulez le support FP8 et une meilleure pertinence logicielle à long terme
- Vous affinez régulièrement des modèles, pas seulement l'inférence
Choisissez la RTX 3090 si
- Vous voulez le plus de VRAM par dollar au monde
- Vous prévoyez une construction dual-card (48 Go au total pour ~1 600 $)
- Vos charges de travail sont des tâches batch que vous pouvez laisser tourner toute la nuit
Le joker dual-3090
Voici l'argument qui maintient la 3090 en vie en 2026 : deux d'entre elles coûtent à peu près autant qu'une 4090 d'occasion et vous donnent 48 Go de VRAM en pool. Avec le parallélisme tensoriel (vLLM, ExLlamaV2), un rig dual-3090 exécute Llama 3 70B entièrement dans la VRAM — une capacité dont aucune carte grand public unique ne dispose, à l’exception de la RTX 5090.
Vous échangez la vitesse et l'efficacité énergétique contre la capacité. Pour quiconque dont la contrainte réelle est « je dois exécuter des modèles plus grands », deux 3090s battent une 4090.
Quelle carte devriez-vous vraiment acheter ?
Les caractéristiques techniques ne prennent sens qu’une fois confrontées à un budget et à une charge de travail précise. Les deux cartes disposent des mêmes 24 Go de GDDR6X sur un bus de 384 bits, si bien que la décision repose rarement sur la question de savoir si un modèle tient — mais plutôt sur sa vitesse d’exécution et sur le prix que vous êtes prêt à payer pour cette rapidité. Utilisez les catégories ci-dessous comme point de départ, puis adaptez-les aux prix pratiqués sur le marché de l’occasion dans votre région.
| Votre situation | Meilleur choix | Pourquoi |
|---|---|---|
| Budget très serré, inférence uniquement | Un seul 3090 d’occasion | Le meilleur rapport $/VRAM disponible sur le marché grand public pour les modèles inférieurs à 70 milliards de paramètres en quantification Q4–Q5. Son prix est environ la moitié de celui d’un 4090, pour une capacité mémoire identique. |
| Vous effectuez des affinages ou des entraînements, ou vous détestez attendre | RTX 4090 | Une puissance de calcul et un débit tensoriel nettement supérieurs — environ 1,5 à 2 fois plus élevés en pratique — réduisent significativement la durée des entraînements et des lots de diffusion. Ce que vous achetez, c’est du temps. |
| Vous avez besoin de 48 Go pour exécuter un modèle de 70 milliards de paramètres avec son contexte complet | Deux 3090 | Le 3090 est la dernière carte grand public équipée de NVLink, ce qui lui permet d’agréger la VRAM — une fonctionnalité dont le 4090 est dépourvu. (Voir la section « double 3090 » ci-dessus pour les précautions liées à ce type de configuration.) |
| Utilisation interactive sensible à la latence | RTX 4090 | Un débit plus élevé en tokens par seconde sur une seule carte rend les conversations et les boucles d’agents nettement plus réactives. |
Quelques mises en garde honnêtes. Un seul 4090 ne pourra pas pas exécuter un modèle que ne peut pas charger un seul 3090 — ils partagent tous deux la même limite de 24 Go, aussi ne payez pas la prime attendue pour charger des modèles plus volumineux sur une seule carte. Si votre seul objectif est d’exécuter localement un modèle de 70 milliards de paramètres et que vous êtes patient, un 3090 d’occasion (ou une paire de ceux-ci) représente un choix plus judicieux. En revanche, si votre temps a un coût — vous affinez vos LoRAs chaque soir, générez des images en masse ou exécutez un agent qui sollicite intensément le GPU toute la journée — le débit supérieur du 4090 se justifie largement par les heures économisées.
Un facteur non évident : état général et garantie. La plupart des 3090 disponibles sur le marché de l’occasion ont plusieurs années et ont souvent été poussés à fond dans des fermes de minage ou des rigs d’inférence 24/7. Prévoyez un éventuel remplacement des pastilles thermiques, vérifiez la présence d’un fléchissement ou d’une usure des ventilateurs, et privilégiez les vendeurs proposant un droit de retour. Un 4090 acheté d’occasion est plus récent et bénéficie souvent encore d’une garantie, ce qui réduit l’écart de prix réel une fois pris en compte le risque. Définissez d’abord votre charge de travail, fixez un budget strict, et laissez ces deux éléments — et non la fiche technique — guider votre choix.
FAQ
La RTX 4090 vaut-elle le double du prix d'une 3090 pour l'IA ?
Seulement si la vitesse est votre goulot. La 4090 est ~1,7x plus rapide mais ne déverrouille aucun nouveau modèle, puisque les deux ont 24 Go. Si vous exécutez des tâches batch toute la nuit, la valeur de la 3090 est imbattable.
La RTX 3090 peut-elle exécuter Llama 3 70B ?
Pas confortablement seul : un modèle de 70 milliards de paramètres en quantification 4 bits nécessite environ 40 Go. Un seul 3090 doit décharger certaines couches vers la mémoire système, ce qui ralentit fortement les performances. Deux 3090 (48 Go combinés) le font tourner efficacement.
Quelle carte est meilleure pour Stable Diffusion ?
La RTX 4090, clairement — environ 18 it/s sur SDXL contre 10 it/s sur le 3090. En génération d’images, où l’on ajuste constamment les prompts, cet écart de vitesse se fait sentir chaque minute.
La RTX 3090 reçoit-elle toujours un bon support logiciel en 2026 ?
Oui. Ampere est entièrement supportée par CUDA, PyTorch, vLLM et llama.cpp. Son seul manque est le FP8 natif, qui affecte un petit ensemble croissant de recettes d'entraînement.
Quel est le coût électrique d’exploitation de ces cartes ?
Au tarif résidentiel moyen américain de 2026, soit environ 0,18 $/kWh, une carte consommant pleinement ses ~350–450 W absorbe environ 6 à 8 cents par heure sous charge. Faire fonctionner un rig d’inférence huit heures par jour ne coûte ainsi que quelques dollars par mois — l’électricité n’est donc que rarement le critère décisif pour une seule carte. Le 4090 est le plus économe des deux (plus de performances par watt), si bien qu’il coûte souvent moins par tâche malgré une consommation maximale supérieure. À l’inactivité, les deux cartes réduisent fortement leur consommation — le 4090 descend à environ 16 W, le 3090 à un niveau légèrement supérieur — si bien qu’un ordinateur allumé mais inutilisé coûte presque rien.
Devrais-je plutôt acheter une RTX 5090 ?
Uniquement si votre budget le permet et si vous avez besoin de cette marge supplémentaire. La 5090 apporte 32 Go de VRAM et un saut générationnel important en puissance de calcul, mais en 2026, elle se vend encore nettement au-dessus de son prix conseillé de 1 999 $ — couramment entre 2 500 $ et 4 000 $ ou plus — et son approvisionnement reste limité. Pour les modèles qui tiennent dans les 24 Go, un 3090 ou un 4090 offre la majeure partie de la valeur pratique pour une fraction du coût. La 5090 justifie pleinement son prix uniquement lorsque vous avez précisément besoin de ce plafond de 32 Go ou de l’inférence mono-carte la plus rapide disponible.
Quelle carte conserve le mieux sa valeur à la revente ?
Le 4090 a subi une dépréciation inhabituellement lente, car la pénurie de RTX 5090 a maintenu une forte demande, ce qui lui permet de conserver une part plus importante de sa valeur qu’une carte âgée de cinq ans ne le ferait normalement. Le 3090 est moins coûteux à l’achat et à la revente, mais son plancher est soutenu par une caractéristique durable abandonnée par les cartes GeForce plus récentes : NVLink. Tant que les assembleurs auront besoin de configurations à double carte avec VRAM agrégée, la demande — et donc la valeur à la revente — des 3090 d’occasion restera résiliente.
Verdict
Les deux cartes sont d'excellents matériels IA en 2026. La RTX 4090 est la meilleure carte sur chaque métrique brute et le bon choix si vous itérez rapidement et pouvez absorber le prix. La RTX 3090 reste le champion du rapport qualité-prix — et, en configuration double carte, il accomplit quelque chose que le 4090 ne peut tout simplement pas faire : exécuter un modèle de 70 milliards de paramètres entièrement dans la VRAM, et ce pour moins cher. Choisissez la carte en fonction de votre contrainte réelle : la vitesse ou la capacité.
