Convly è il miglior posto per confrontare modelli IA insieme alle GPU che li eseguono. Il nostro database di modelli elenca parametri, contesto e prezzi API in tempo reale affiancati, mentre tre calcolatori gratuiti stimano la VRAM di cui ogni modello ha bisogno, il costo API al mese e se l'auto-hosting batte il pagamento per token — la vista modello-più-hardware che nessuno strumento ha mai offerto prima.
La maggior parte dei siti di confronto rispondono solo a metà della domanda. Le classifiche di benchmark classificano i modelli ma non ti dicono mai quale GPU hanno bisogno; i siti di hardware elencano le GPU ma non le mappano mai a un modello specifico a una quantizzazione specifica. Questa pagina mette entrambi in una tabella, poi ti consegna gli strumenti per inserire i tuoi numeri.
Modelli IA abbinati alla GPU per eseguirli
La tabella sottostante abbina circa 12 modelli popolari al loro numero approssimativo di parametri, la VRAM minima per eseguirli a quantizzazione a 4 bit, una GPU consumer consigliata e un rango di prezzo API approssimativo. Le cifre VRAM seguono la regola empirica di circa 0,5–0,6 GB per miliardo di parametri a 4 bit, più 1–3 GB per la cache KV. Un trattino (—) significa che il modello è solo API o troppo grande per eseguirsi praticamente su hardware consumer. Tutti i prezzi sono estratti dal nostro database dei modelli AI.
| Modello | Parametri approssimativi | VRAM minima (4 bit) | GPU consumer consigliata | Fascia di prezzo API ($/1M in→out) |
|---|---|---|---|---|
| Mistral 7B | 7B | ~4–5 GB | RTX 4060 (8 GB) | Ultra-bassa ($0,02 → $0,03) |
| Llama 3.1 8B | 8B | ~5 GB | RTX 4060 (8 GB) | Ultra-bassa ($0,02 → $0,03) |
| Qwen3 14B | 14B | ~8–10 GB | RTX 3060 (12 GB) | Bassa ($0,12 → $0,24) |
| Gemma 3 27B | 27B | ~16–18 GB | RTX 4090 (24 GB) | Ultra-bassa ($0,08 → $0,16) |
| Qwen3 32B | 32 miliardi | ~20 GB | RTX 4090 (24 GB) | Bassa ($0,08 → $0,28) |
| Llama 3.3 70B | 70B | ~40–48 GB | RTX 6000 Ada (48 GB) o 2× RTX 4090 | Bassa ($0,10 → $0,32) |
| DeepSeek R1 Distill Llama 70B | 70B | ~40–48 GB | RTX 6000 Ada (48 GB) | Bassa-media ($0,80 → $0,80) |
| DeepSeek V4-Flash | — (MoE grande) | — | — (solo API in pratica) | Ultra-bassa ($0,14 → $0,28) |
| Claude Haiku 4.5 | — | — | — (cloud) | Media ($1,00 → $5,00) |
| Gemini 3.1 Pro | — | — | — (cloud) | Media ($2,00 → $12,00) |
| Claude Opus 4.8 | — | — | — (cloud) | Premium ($5,00 → $25,00) |
| GPT-5.5 | — | — | — (cloud) | Premium ($5,00 → $30,00) |
Emergono due pattern. Primo, i modelli open-weight scalano verso il basso verso hardware che la maggior parte delle persone già possiede — un modello 7–8B si adatta a una scheda da 8 GB, mentre un modello 32B ha bisogno di un singolo RTX 4090 da 24 GB. Secondo, i modelli frontier closed possono essere noleggiati solo per token, e il divario di prezzo è enorme: il nostro Indice prezzo-prestazioni per l'IA ha misurato uno spread di costo blended di 114× in tutto il campo, da circa $0,18 a $20 per 1M token.
Tre strumenti gratuiti per eseguire i tuoi numeri
La tabella ti dà la forma del compromesso. Questi tre calcolatori ti permettono di individuare la risposta esatta per il tuo modello, il tuo hardware e il tuo volume.
1. Calcolatore VRAM LLM
Scegli una dimensione del modello (o inserisci un numero di parametri personalizzato), un livello di quantizzazione e una lunghezza di contesto, e il Calcolatore VRAM per LLM ti dice quanta memoria GPU il modello ha bisogno e se si adatta a una scheda specifica. È il modo più veloce per verificare «un modello 32B funzionerà sul mio RTX 4090?» prima di scaricare 20 GB di pesi.
2. Calcolatore costo API IA
Se preferisci noleggiare piuttosto che possedere, inserisci il tuo volume mensile di token in ingresso e uscita nel Calcolatore dei costi delle API per l'IA e stima la bolletta mensile per ogni modello, usando i prezzi estratti in tempo reale dal nostro database di modelli. È il modo più veloce per vedere quanto risparmi passando da un modello premium come GPT-5.5 a un tier ultra-basso come DeepSeek V4-Flash.
3. Calcolatore auto-hosting vs API
La decisione acquista-o-noleggia si riduce al volume. Il calcolatore self-hosting vs API prende il tuo volume di token, il prezzo di acquisto della GPU, il periodo di ammortamento, la tariffa dell'elettricità e le ore di utilizzo, poi mostra il punto di pareggio dove possedere una GPU batte il pagamento per token. Al di sotto di circa 50M token al mese, il prezzo per token di solito vince; una GPU posseduta e ben utilizzata tira avanti solo a volume alto e costante.
Domande frequenti
Quanta VRAM serve per eseguire un modello da 70B?
A quantizzazione a 4 bit un modello 70B ha bisogno di circa 40–48 GB di VRAM per i pesi, più altri 1–3 GB per la cache KV. In pratica ciò significa una singola scheda da 48 GB come un RTX 6000 Ada, o due RTX 4090 da 24 GB in parallelo. L'esecuzione a 8 bit raddoppia approssimativamente il requisito. Usa il Calcolatore VRAM per verificare la tua lunghezza di contesto esatta.
È più economico eseguire in auto-hosting oppure utilizzare un’API?
Al di sotto di circa 50 milioni di token al mese, il prezzo API per token quasi sempre vince. Una GPU da $2.000–$2.500 ammortizzata su tre anni, con elettricità, costa circa $85–$130 al mese tutto compreso, quindi paga solo con volume alto e costante — dove una GPU posseduta e ben utilizzata può ridurre il costo di inferenza fino a circa 5×. Esegui il tuo volume attraverso il calcolatore self-hosting vs API per trovare il tuo punto di pareggio.
Quale GPU è la migliore per LLM locali nel 2026?
Per la maggior parte delle persone l'RTX 4090 (24 GB) è il punto ideale — esegue modelli 32B a 4 bit comodamente e gestisce contesti lunghi. Un RTX 4060 da 8 GB copre modelli 7–8B, un RTX 3060 da 12 GB esegue modelli 8B con spazio di manovra, e salire a un modello 70B richiede una scheda da 48 GB. Abbina il tuo modello target a una scheda con il Calcolatore VRAM.
Qual è il modello IA più economico per token?
DeepSeek V4-Flash è il più economico nel nostro database a $0,14 in ingresso e $0,28 in uscita per 1M token (circa $0,18 blended) — circa 114× più economico del modello frontier più costoso e circa 37× più intelligenza per dollaro di Claude Opus 4.8. Vedi la classifica completa nel Indice prezzo-prestazioni per l'IA.
Altri strumenti gratuiti di Convly
Finestre di contesto del modello IA confrontate
10 milioni
1,05 milioni
1,05 milioni
1,05 milioni
1,05 milioni
1,05 milioni
1,05 milioni
1 milione
1 milione
1 milione
1 milione
1 milione
Lunghezza massima del contesto in token, scala logaritmica · top 12 modelli · Verde = più grande. Aggiornato 05 ott 2026.
