L'IA con pesi aperti è effettivamente più economica rispetto alle principali API proprietarie — e di quanto? Abbiamo preso i prezzi pubblicati delle API per tutti e 29 i modelli presenti nel nostro Database di modelli, li abbiamo normalizzati a un singolo costo combinato per milione di token e li abbiamo suddivisi in categorie «pesi aperti» e «proprietari». Il divario è più ampio — e molto più coerente — di quanto la maggior parte delle persone supponga.
Punti chiave
- I 5 modelli meno costosi del 2026 sono tutti a pesi aperti. I 5 più costosi sono tutti proprietari.
- Il il costo tipico (mediano) di un modello open è di circa $0,15 per 1 milione di token combinati; il costo tipico di un modello proprietario è di circa $6,00 — un divario di 39 volte.
- In media, i modelli proprietari costano circa 16 volte di più rispetto a quelli open.
- Tra tutti i 29 modelli, l’intera gamma di prezzi è di circa 890 volte — da circa $0,02 a $20 per 1 milione di token combinati.
- E questo non tiene conto dell’auto-hosting, che elimina completamente il costo per token nei casi di pesi aperti. per i modelli a pesi aperti.
Come lo abbiamo misurato
- Ambito — tutti e 29 i modelli presenti nel database Convly con prezzi API pubblicamente disponibili.
- Costo combinato —
(3 × input + output) / 4, un rapporto input/output di 3:1 tipico del traffico reale su API, in modo che modelli con input economici ma output costosi possano essere confrontati direttamente. - Classificazione — «pesi aperti» = pesi scaricabili che è possibile auto-hostare (22 modelli); «proprietari» = accessibili esclusivamente tramite API (7 modelli).
- Fonti — prezzi API pubblicati su OpenRouter e DeepInfra, giugno 2026.
Il divario, riassunto in una tabella
| Metrica (costo combinato per 1 milione di token, in USD) | Pesi aperti (22) | Proprietari (7) | Differenza |
|---|---|---|---|
| Media | $0.50 | $8.16 | 16× |
| Mediana (modello tipico) | $0.15 | $6.00 | 39× |
| Più economico del gruppo | $0,02 (Llama 3.1 8B) | $2,00 (Claude Haiku 4.5) | — |
| Più costoso del gruppo | $3,00 (Mistral Large 3) | $20,00 (Claude Fable 5) | — |
Gli estremi raccontano la storia
Ordinando tutti e 29 i modelli in base al costo combinato, il pattern è evidente: i modelli open-weight dominano la fascia più bassa, mentre quelli proprietari occupano la fascia più alta:
| 5 modelli più economici (tutti open-weight) | Costo combinato ($/1 milione) | 5 modelli più costosi (tutti proprietari) | Costo combinato ($/1 milione) |
|---|---|---|---|
| Llama 3.1 8B | $0.02 | Claude Fable 5 | $20.00 |
| Mistral 7B | $0.02 | GPT-5.5 | $11.25 |
| Mistral NeMo 12B | $0.03 | Claude Opus 4.8 | $10.00 |
| Gemma 3 4B | $0.06 | Claude Sonnet 4.6 | $6.00 |
| Qwen3 8B | $0.07 | Gemini 3.1 Pro | $4.50 |
There is no proprietary model in the cheapest third of the market, and no open-weight model in the most expensive third. The lone overlap zone is narrow: the cheapest proprietary model (Claude Haiku 4.5, $2.00) sits just below the most expensive open one (Mistral Large 3, $3.00).
Nota importante: si tratta di costo, non di capacità
I modelli più costosi mantengono comunque il primato nelle attività di ragionamento e agenziale più complesse. Nel nostro correlato Indice AI Prezzo-Performance abbiamo riscontrato che il premium dei modelli di frontiera acquista gli ultimi punti di intelligenza, non un valore proporzionale. Tuttavia, per la maggior parte dei carichi di lavoro produttivi — classificazione, estrazione, RAG, riassunto, chat — il divario di capacità tra un buon modello open e un modello di frontiera è molto più contenuto rispetto al divario di prezzo di 39×. Spesso si paga 39× per l’ultimo 10–20% di capacità che potrebbe non essere necessario.
Perché il divario è strutturale
Questo non è un semplice scontro temporaneo sui prezzi. Una concorrenza intensa tra modelli open-weight — Qwen, Llama, Gemma e DeepSeek Mistral, tutti con modelli performanti rilasciati sotto licenze permissive — ha spinto il prezzo minimo verso lo zero. Al contempo, i laboratori di frontiera fissano i prezzi in base alla massima capacità e alla disponibilità delle aziende a pagare. Il risultato è un mercato in fase di biforcazione: un pavimento in caduta libera verso lo zero e un tetto premium, con un divario sempre più ampio tra i due.
Conclusione
Per applicazioni produttive sensibili ai costi, un modello open o di fascia media è la scelta razionale predefinita nel 2026 — e l’auto-hosting elimina completamente il costo per token (verifica quali modelli può eseguire la tua GPU con il nostro Calcolatore VRAM). Riserva i modelli proprietari di frontiera solo per i compiti effettivamente più impegnativi. Calcola il tuo utilizzo specifico tramite il Calcolatore costi API per ottenere i tuoi dati esatti.
Data: Convly Database di modelli IA (API pricing via OpenRouter and DeepInfra). Blended cost uses a 3:1 input:output ratio. Figures current as of June 2026.

