Kimi K3 — Specifiche
Compiled by Mustafa Ihsan from the vendor’s published documentation · Last updated
| Sviluppatore | Moonshot AI |
|---|---|
| Tipo | LLM (architettura MoE, ragionamento, multimodale) |
| Modalità | Testo, visione → testo |
| Parametri | 2,8 trilioni di parametri totali / 16 esperti attivi su 896 (MoE) |
| Finestra contestuale | 1 milione |
| Licenza | Pesi aperti (previsti per il 27 luglio 2026) |
| Pesi aperti | Sì |
| Pubblicato | 2026-07 |
| Prezzo dell’input | $3.00 /1M |
| Prezzo dell’output | $15.00 /1M |
| Provider API | Moonshot (Kimi), OpenRouter |
Esegui localmente
| VRAM (4-bit) | ~1,4 TB |
|---|---|
| GPU minima | Cluster multi-nodo (es. 2× nodi H200 da 8 GPU ciascuno, 141 GB di VRAM) |
Che cos'è Kimi K3?
Kimi K3 è il modello aperto di nuova generazione da 2,8 trilioni di parametri di Moonshot AI — un modello misto di esperti
che attiva soltanto 16 dei 896 esperti per token, con una finestra contestuale di 1 milione di token, visione nativa
e ragionamento continuo. Ottiene un punteggio di 57 sull’Artificial Analysis Intelligence Index,
superando di poco Claude Opus 4.8 (56) e rimanendo alle spalle soltanto GPT-5.6 Sol (59) e Claude Fable 5 (60),
— il risultato migliore mai registrato finora per un modello open-weight. I pesi erano previsti per il 27 luglio 2026.
Il significato risiede nel divario, o meglio nella sua assenza. Un modello open-weight posizionato
a soli tre punti dal miglior modello closed disponibile sul mercato elimina l’ultimo comodo
argomento a favore del pagamento di prezzi da frontiera esclusivamente sulla base delle capacità. A 3 dollari in ingresso / 15 dollari in uscita per
milioni di token K3 ha anche un costo combinato pari alla metà di quello di GPT-5.5, pur ottenendo un punteggio più alto. L'inghippo è
operativo: circa 1,4 TB di VRAM a 4 bit significa un cluster multi-nodo — due H200 da 8 GPU
nodi da 141 GB o equivalenti — quindi «aperto» qui significa controllabile e trasferibile tra diversi fornitori, non
eseguibile nel vostro server room. Per quasi tutti, K3 è una decisione relativa a un'API che per caso si presenta
operativo: circa 1,4 TB di VRAM a 4-bit significa un cluster multi-nodo — due nodi da 8 GPU H200 da 141 GB o equivalente — quindi «open» qui significa verificabile e portabile tra diversi provider, non eseguibile nel proprio server room. Per quasi tutti, K3 rappresenta una scelta API che offre tuttavia una via d’uscita.
Prezzi di Kimi K3: costo API per 1 milione di token
| Input (per ogni milione di token) | $3.00 |
|---|---|
| Output (per ogni milione di token) | $15.00 |
| Rapporto output/input | 5× |
| Combinato (4:1 in:out) | $5.40 per 1 milione di token |
Quanto costa Kimi K3 al mese
Spesa mensile reale con un mix input-to-output 4:1 — il rapporto effettivamente prodotto da un tipico carico di lavoro basato su chat o RAG.
| Carico di lavoro | Token/mese | Costo/mese |
|---|---|---|
| Progetto secondario | 1 milione in ingresso / 0,25 milioni in uscita | $6.75 |
| Piccolo team | 20 milioni in ingresso / 5 milioni in uscita | $135 |
| Produzione | 200 milioni in ingresso / 50 milioni in uscita | $1,350 |
Calcola i tuoi numeri personalizzati nel Calcolatore dei costi delle API per l'IA.
Alternative più economiche a Kimi K3
| Modello | Costo combinato ($/1 milione) | Risparmi |
|---|---|---|
| GLM 5.2 aperta | $2.00 | 63% più economico |
| Gemini 3.5 Flash | $3.00 | 44% più economico |
| Gemini 3.1 Pro | $4.00 | 26% più economico |
Eseguirlo in autonomia o pagare l’API?
Kimi K3 è open-weight, quindi puoi eseguirlo autonomamente. Richiede ~1,4 TB di VRAM a 4-bit (cluster multi-nodo, ad es. due nodi da 8 GPU H200 da 141 GB). L’esecuzione in autonomia risulta conveniente rispetto all’API solo quando il tuo volume è sufficientemente elevato da mantenere tale hardware costantemente occupato — il calcolatore self-hosting vs API calcola il punto di pareggio in base al tuo volume di token.
Domande frequenti
Quanto costa Kimi K3 per 1 milione di token?
Kimi K3 costa 3,00 dollari per 1 milione di token in input e 15,00 dollari per 1 milione di token in output. Con un rapporto tipico input/output di 4:1, il costo combinato si attesta intorno ai 5,40 dollari per 1 milione di token.
Quanto costa Kimi K3 al mese?
Un carico di lavoro mensile per un piccolo team di 20 milioni di token in input e 5 milioni di token in output costa circa 135 dollari su Kimi K3. Un progetto secondario (1 milione in input / 0,25 milioni in output) costa circa 6,75 dollari.
Qual è un’alternativa più economica a Kimi K3?
GLM 5.2 è l’opzione più economica e performante presente nel nostro database, a 2,00 dollari per 1 milione di token combinati — circa il 63% in meno rispetto a Kimi K3. È inoltre open-weight, quindi è possibile eseguirlo in autonomia.
Posso eseguire Kimi K3 localmente?
Sì. Kimi K3 è open-weight e richiede circa 1,4 TB di VRAM con quantizzazione a 4 bit (cluster multi-nodo, ad es. due nodi da 8 GPU H200 da 141 GB).
Perché Kimi K3 applica un prezzo più alto per i token in output rispetto a quelli in input?
I token in output vengono generati uno alla volta e non possono essere elaborati in batch come invece avviene per i prompt, pertanto il loro servizio comporta un costo maggiore per il fornitore. Kimi K3 applica un prezzo per i token in output pari a 5 volte quello dei token in input, motivo per cui i carichi di lavoro incentrati sui prompt sono molto più economici da eseguire rispetto a quelli incentrati sulla generazione.
I prezzi indicati sono le tariffe ufficiali pubblicate per l'API principale del modello e vengono aggiornati man mano che i fornitori li modificano. Sconti per volumi elevati, elaborazione batch e input memorizzati nella cache non sono inclusi. Confronta tutti i modelli fianco a fianco nel Database di modelli IA o il Classifica LLM.

