Per il lavoro locale con l'IA, la RTX 3090 si è evoluta in una delle schede più convenienti mai realizzate: 24 GB di VRAM sul mercato dell’usato a 700–900 USD. La RTX 4090 raddoppia l’impegno — stessi 24 GB di VRAM, ma una GPU molto più veloce, a circa 1.200–1.500 USD usata nel 2026.
Se entrambe le schede dispongono della stessa quantità di memoria, la RTX 4090 vale quasi il doppio? La risposta onesta è: dipende interamente dal fatto che il tempo sia o meno il collo di bottiglia.
Punti chiave
- Entrambe le schede dispongono di 24 GB di VRAM — possono eseguire esattamente gli stessi modelli. Nessun modello gira su una ma non sull’altra.
- La RTX 4090 è ~1,7 volte più veloce per l'inferenza AI e ~1,8 volte più veloce per il fine-tuning.
- Per Stable Diffusion XL, ci si aspetta ~18 it/s sulla 4090 contro ~10 it/s sulla 3090.
- La 3090 vince nettamente in termini di valore per dollaro e nelle configurazioni con due schede (48 GB per circa 1.600 USD).
- Acquista la 4090 se la velocità di iterazione è fondamentale; acquista la 3090 (o due unità) se la capacità di VRAM è più importante della velocità.
A colpo d'occhio
| Specifiche | RTX 4090 | RTX 3090 |
|---|---|---|
| Architettura | Ada Lovelace AD102 | Ampere GA102 |
| Core CUDA | 16,384 | 10,496 |
| VRAM | 24 GB GDDR6X | 24 GB GDDR6X |
| Larghezza di banda della memoria | 1.008 GB/s | 936 GB/s |
| Tensor FP16 (denso) | ~330 TFLOPS | ~142 TFLOPS |
| TDP | 450 W | 350 W |
| Prezzo al lancio | $1,599 | $1,499 |
| Prezzo dell'usato (2026) | 1.200–1.500 USD | 700–900 USD |
VRAM: un fattore decisivo che cambia tutto
Il numero più importante per l’intelligenza artificiale locale è la VRAM, e in questo caso le due schede sono identiche: 24 GB. Ciò significa che qualsiasi modello che funziona su una funziona anche sull’altra:
- Llama 3 8B e Classe 13B i modelli vengono eseguiti comodamente a precisione completa o quasi completa.
- Llama 3 70B può essere caricato solo con una forte quantizzazione a 4 bit (Q4_K_M ≈ 40 GB) e un parziale offload sulla CPU — un’operazione estremamente onerosa su entrambe le schede singolarmente.
- Stable Diffusion XL e Flux i modelli per la generazione di immagini trovano ampio spazio disponibile.
velocità velocità — esegue lo stesso compito più velocemente.
Benchmark per l'inferenza
Per Inferenza su LLM, il divario riflette la larghezza di banda della memoria e il throughput tensoriale:
| Carico di lavoro | RTX 4090 | RTX 3090 |
|---|---|---|
| Llama 3 8B Q4_K_M | ~140 tok/s | ~95 tok/s |
| Llama 3 classe 13B Q4 | ~90 tok/s | ~58 tok/s |
| SDXL 1024×1024 (30 passaggi) | ~18 it/s | ~10 it/s |
| Flux.1 dev (1024 px) | ~2,4 s/immagine | ~4,6 s/immagine |
Il pattern è coerente: la 4090 si attesta intorno al 1,6–1,8 volte la velocità di elaborazione della 3090. Si tratta di una differenza reale e percepibile: un batch di Stable Diffusion che richiede dieci minuti sulla 3090 si conclude in circa sei minuti sulla 4090.
Affinamento e addestramento
Per Affinamento LoRA di un modello da 7B a 8B, la maggiore velocità di elaborazione dei tensor core e i percorsi FP16/BF16 più veloci della 4090 contano di più rispetto all’inferenza. Un tipico training LoRA che richiede circa cinque ore sulla 3090 si completa in circa due ore e tre quarti sulla 4090 — quasi un miglioramento prestazionale di 1,8x.
La 3090 presenta un’unica debolezza silenziosa: non dispone del migliorato supporto FP8 della 4090, quindi le nuove tecniche di addestramento basate su FP8 o ricadono in BF16 oppure non vengono eseguite affatto. Se intendi seguire le tecniche di addestramento più avanzate, la 4090 mantiene un valore più duraturo.
Alimentazione e dissipazione termica
La 3090 assorbe 350 W; la 4090 assorbe 450 W e può salire ulteriormente sotto carichi AI prolungati. Dopo un anno di utilizzo intensivo, questa differenza si riflette in modo misurabile sulla bolletta elettrica; inoltre, la 4090 richiede un’alimentatore più potente (minimo 850 W, consigliati 1000 W). Anche la 3090 raggiunge temperature elevate sui moduli di memoria GDDR6X — su unità usate è consigliabile sostituire le paste termiche con pad termici.
Scegli la RTX 4090 se
- Esegui iterazioni costanti e dai più valore al tempo che al denaro
- Desideri il supporto FP8 e una maggiore rilevanza software a lungo termine
- Affini regolarmente modelli, non ti limiti all’inferenza
Scegli la RTX 3090 se
- Vuoi la massima quantità di VRAM per dollaro disponibile al mondo
- Pianifichi una configurazione con due schede (48 GB totali per circa 1.600 USD)
- I tuoi carichi di lavoro consistono in operazioni batch che puoi lasciar girare durante la notte
La carta jolly delle due 3090
Questo è l’argomento che mantiene ancora in vita la 3090 nel 2026: due unità costano circa quanto una 4090 usata e ti forniscono 48 GB di VRAM condivisa. Con il parallelismo tensoriale (vLLM, ExLlamaV2), un sistema con due 3090 esegue Llama 3 70B interamente nella VRAM — una caratteristica possibile su una singola scheda consumer soltanto con la RTX 5090.
Si sacrifica velocità ed efficienza energetica in cambio di capacità. Per chiunque abbia come vincolo principale «ho bisogno di eseguire modelli più grandi», due 3090 battono una 4090.
Quale scheda dovresti acquistare effettivamente?
Le specifiche contano solo dopo averle correlate a un budget e a un determinato carico di lavoro. Entrambe le schede dispongono degli stessi 24 GB di GDDR6X su un bus da 384 bit, quindi la scelta raramente dipende dal fatto che un modello entri — bensì da quanto velocemente viene eseguito e da quanto sei disposto a pagare per quella velocità. Usa le categorie riportate di seguito come punto di partenza, quindi adattale ai prezzi del mercato dell’usato nella tua zona.
| La tua situazione | Scelta migliore | Perché |
|---|---|---|
| Budget estremamente limitato, solo inferenza | Singola 3090 usata | Il miglior rapporto $/VRAM sul mercato consumer per modelli inferiori ai 70B alla quantizzazione Q4–Q5. Costa circa la metà di una 4090 pur offrendo lo stesso limite di memoria. |
| Esegui fine-tuning o training, oppure detesti aspettare | RTX 4090 | Un calcolo e un throughput tensoriale molto superiori — circa 1,5–2x nella pratica — riducono in modo significativo la durata dei training e dei batch di diffusione. Ciò che stai realmente acquistando è il tempo. |
| Hai bisogno di 48 GB per far girare un modello da 70B con contesto completo | Due 3090 | La 3090 è l’ultima scheda consumer dotata di NVLink, quindi consente di aggregare la VRAM in modo impossibile per la 4090. (Vedi la sezione precedente sulle configurazioni dual-3090 per i caveat relativi all’assemblaggio.) |
| Utilizzo interattivo sensibile alla latenza | RTX 4090 | Un numero superiore di token al secondo su una singola scheda rende conversazioni e loop agentic percepibilmente più reattivi. |
Alcune oneste considerazioni. Una singola 4090 non eseguirà un modello che una singola 3090 non riesce a caricare — entrambe condividono lo stesso limite di 24 GB, quindi non pagare il sovrapprezzo aspettandoti di caricare modelli più grandi su una sola scheda. Se il tuo unico obiettivo è eseguire localmente un modello da 70B e hai pazienza, una 3090 usata (o una coppia di esse) rappresenta una scelta finanziariamente più intelligente. Se invece il tuo tempo ha un valore — ad esempio, fai iterazioni notturne su LoRA, generi immagini in massa o esegui un agente che sfrutta la GPU per tutto il giorno — il throughput della 4090 si ripaga in poche ore risparmiate.
Un fattore non immediatamente evidente: stato e garanzia. La maggior parte delle 3090 presenti sul mercato dell’usato ha diversi anni e molte sono state sottoposte a carichi intensi in attività di mining o in sistemi di inferenza attivi 24/7. Prevedi un eventuale costo per la sostituzione dei pad termici, ispeziona attentamente eventuali deformazioni o usura delle ventole e preferisci venditori che offrono il diritto di recesso. Una 4090 acquistata usata è più recente e spesso ancora coperta da garanzia, il che riduce il gap di prezzo reale una volta considerato il rischio. Decidi prima il carico di lavoro, stabilisci un budget rigido e lascia che questi due numeri — non la scheda tecnica — scelgano per te la scheda.
Domande frequenti
Vale la pena pagare il doppio per una RTX 4090 rispetto a una 3090 nell’ambito dell’IA?
Solo se la velocità è il tuo collo di bottiglia. La 4090 è circa 1,7 volte più veloce, ma non consente di eseguire nuovi modelli, dato che entrambe dispongono di 24 GB di VRAM. Se esegui lavori batch durante la notte, il rapporto qualità-prezzo della 3090 è imbattibile.
La RTX 3090 riesce a eseguire Llama 3 70B?
Non comodamente da sola: un modello da 70B a 4 bit richiede circa 40 GB. Una singola 3090 deve scaricare alcuni layer nella RAM di sistema, operazione lenta. Due 3090 (48 GB aggregati) lo eseguono bene.
Quale scheda è migliore per Stable Diffusion?
Chiaramente la RTX 4090 — circa 18 it/s su SDXL contro 10 it/s sulla 3090. Per la generazione di immagini, dove si iterano continuamente i prompt, questo divario di velocità si avverte ogni minuto.
La RTX 3090 gode ancora di un buon supporto software nel 2026?
Sì. L’architettura Ampere è pienamente supportata da CUDA, PyTorch, vLLM e llama.cpp. L’unica lacuna è il mancato supporto nativo FP8, che influisce su un numero ridotto ma in crescita di ricette di addestramento.
Quanto costa alimentare queste schede elettricamente?
Alla tariffa residenziale media statunitense del 2026 di circa 0,18 $/kWh, una scheda che assorbe i suoi circa 350–450 W nominali consuma circa 6–8 centesimi di dollaro all’ora sotto carico. Far funzionare un sistema di inferenza otto ore al giorno comporta una spesa mensile di pochi dollari — l’elettricità raramente è il fattore determinante per una singola scheda. La 4090 è la più efficiente delle due (maggiore prestazione per watt), quindi spesso costa meno per singolo task nonostante un assorbimento massimo superiore. A riposo entrambe le schede riducono drasticamente il consumo: la 4090 scende a circa 16 W, mentre la 3090 resta leggermente più alta — pertanto un sistema lasciato acceso ma inutilizzato ha un costo pressoché nullo.
Dovrei semplicemente acquistare una RTX 5090?
Solo se il tuo budget lo permette e hai davvero bisogno di ulteriore margine. La 5090 offre 32 GB di VRAM e un salto generazionale significativo nelle prestazioni di calcolo, ma nel 2026 mantiene ancora un prezzo ben al di sopra del suo MSRP di 1.999 $ — comunemente tra 2.500 $ e 4.000 $ o più — e l’offerta rimane limitata. Per i modelli che rientrano nei 24 GB, una 3090 o una 4090 fornisce gran parte del valore pratico a una frazione della spesa. La 5090 giustifica il suo prezzo solo quando hai effettivamente bisogno di quel tetto di 32 GB o della massima velocità di inferenza su singola scheda disponibile.
Quale scheda mantiene meglio il proprio valore di rivendita?
La 4090 ha subito un deprezzamento insolitamente lento, poiché la scarsità della RTX 5090 ha mantenuto alta la domanda, consentendole di conservare una percentuale maggiore del proprio valore rispetto a quanto ci si aspetterebbe normalmente da una scheda di cinque anni. La 3090 è più economica da acquistare e da dismettere, ma il suo valore minimo è sostenuto da una caratteristica durevole che le nuove GeForce hanno abbandonato: NVLink. Finché i costruttori di sistemi avranno interesse per configurazioni dual-card con VRAM aggregata, la domanda — e quindi il valore di rivendita — delle 3090 usate resterà resiliente.
Verdetto
Entrambe le schede rappresentano un’ottima scelta hardware per l’IA nel 2026. La RTX 4090 è la scheda migliore in ogni parametro grezzo ed è l’acquisto ideale se lavori in modo iterativo e rapido e puoi permetterti il prezzo. La RTX 3090 rimane il campione del rapporto qualità-prezzo — e in configurazione dual-card fa qualcosa che la 4090 semplicemente non può fare: eseguire un modello da 70B interamente nella VRAM a un costo inferiore. Scegli la scheda in base al tuo vero vincolo: velocità o capacità.

