Kimi K3 — Spezifikationen
Compiled by Mustafa Ihsan from the vendor’s published documentation · Last updated
| Entwickler | Moonshot AI |
|---|---|
| Typ | LLM (MoE, Reasoning, multimodal) |
| Modality | Text, Vision → Text |
| Parameter | 2,8 Bio. insgesamt / 16 von 896 Experten aktiv (MoE) |
| Kontextfenster | 1 Mio. |
| Lizenz | Offene Gewichte (geplant für den 27. Juli 2026) |
| Offene Gewichte | Ja |
| Veröffentlicht | 2026-07 |
| Eingabepreis | $3.00 /1M |
| Ausgabepreis | $15.00 /1M |
| API-Anbieter | Moonshot (Kimi), OpenRouter |
Lokal ausführen
| VRAM (4-Bit) | ca. 1,4 TB |
|---|---|
| Mindest-GPU | Mehrknoten-Cluster (z. B. 2 × 8-GPU-H200-Knoten mit je 141 GB) |
Was ist Kimi K3?
Kimi K3 ist Moonshot AIs offenes Frontier-Modell mit 2,8 Billionen Parametern – ein Mixture-of-Experts-Modell
das pro Token nur 16 von insgesamt 896 Experts aktiviert, über ein Kontextfenster von einer Million Tokens verfügt, native
Vision und ständiges Reasoning unterstützt. Im Artificial Analysis Intelligence Index erzielt es 57 Punkte,
damit knapp mehr als Claude Opus 4.8 mit 56 Punkten und weniger als GPT-5.6 Sol (59) und Claude Fable 5 (60).
– das bislang stärkste Ergebnis eines offengewichteten Modells. Die Gewichte sollten am 27. Juli 2026 veröffentlicht werden.
Die Bedeutung liegt in der Lücke – oder vielmehr in deren Fehlen. Ein offengewichtetes Modell, das sich
nur drei Punkte hinter dem besten geschlossenen Modell auf dem Markt platziert, beseitigt das letzte tröstliche
Argument dafür, Spitzenpreise rein aufgrund der Leistungsfähigkeit zu zahlen. Bei 3 USD pro Eingabe / 15 USD pro Ausgabe
Millionen Tokens. K3 ist außerdem halb so teuer wie GPT-5.5 im Durchschnitt, erzielt dabei aber bessere Ergebnisse. Der Haken ist
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.
„offen“ hier bedeutet, dass das Modell auditierbar und zwischen verschiedenen Anbietern portabel ist, nicht aber
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.
Kimi K3 Preisgestaltung: API-Kosten pro 1 Mio. Tokens
| Eingabe (pro 1 Mio. Token) | $3.00 |
|---|---|
| Ausgabe (pro 1 Mio. Token) | $15.00 |
| Verhältnis Output/Input | 5× |
| Gemischt (4:1 Input:Output) | $5.40 pro 1 Mio. Tokens |
Was kostet Kimi K3 pro Monat?
Tatsächliche monatliche Ausgaben bei einem 4:1-Input-zu-Output-Mix – dem Verhältnis, das typische Chat- oder RAG-Arbeitslasten tatsächlich erzeugen.
| Workload | Tokens/Monat | Kosten pro Monat |
|---|---|---|
| Nebenprojekt | 1 Mio. Eingabe / 0,25 Mio. Ausgabe | $6.75 |
| Kleines Team | 20 Mio. Eingabe / 5 Mio. Ausgabe | $135 |
| Produktion | 200 Mio. Eingabe / 50 Mio. Ausgabe | $1,350 |
Stellen Sie Ihre eigenen Berechnungen im KI-API-Kostenrechner.
Günstigere Alternativen zu Kimi K3
| Modell | Gewichteter Preis pro Million US-Dollar | Sie sparen |
|---|---|---|
| GLM 5.2 offenere | $2.00 | 63 % günstiger |
| Gemini 3.5 Flash | $3.00 | 44 % günstiger |
| Gemini 3.1 Pro | $4.00 | 26 % günstiger |
Selbst hosten oder die API nutzen?
Kimi K3 ist offengewichtet, sodass Sie es selbst betreiben können. Es benötigt ca. 1,4 TB VRAM bei 4-Bit-Quantisierung (Multi-Node-Cluster, z. B. zwei 8-GPU-H200-Knoten mit je 141 GB). Das Selbsthosting lohnt sich nur dann gegenüber der API-Nutzung, wenn Ihr Volumen hoch genug ist, um diese Hardware auszulasten – der Selbsthosting vs. API-Rechner berechnet den Break-even-Punkt für Ihr Token-Volumen.
Häufig gestellte Fragen
Wie viel kostet Kimi K3 pro 1 Mio. Tokens?
Kimi K3 kostet $3,00 pro 1 Mio. Input-Tokens und $15,00 pro 1 Mio. Output-Tokens. Bei einer typischen Input-zu-Output-Mischung von 4:1 ergibt sich ein Durchschnittspreis von rund $5,40 pro 1 Mio. Tokens.
Wie viel kostet Kimi K3 pro Monat?
Eine Arbeitslast eines kleinen Teams mit 20 Mio. Input- und 5 Mio. Output-Tokens pro Monat kostet bei Kimi K3 etwa $135. Ein Nebenprojekt (1 Mio. Input / 0,25 Mio. Output) kostet ungefähr $6,75.
Was ist eine günstigere Alternative zu Kimi K3?
GLM 5.2 ist die leistungsstärkste günstigere Option in unserer Datenbank mit $2,00 pro 1 Mio. durchschnittlicher Kosten – also etwa 63 % weniger als Kimi K3. Es ist ebenfalls offengewichtet, sodass auch hier das Selbsthosting möglich ist.
Kann ich Kimi K3 lokal betreiben?
Ja. Kimi K3 ist offengewichtet und benötigt bei 4-Bit-Quantisierung etwa ~1,4 TB VRAM (Multi-Node-Cluster, z. B. zwei 8-GPU-H200-Knoten mit je 141 GB).
Warum berechnet Kimi K3 für Output-Tokens höhere Kosten als für Input-Tokens?
Output-Tokens werden einzeln generiert und können nicht wie ein Prompt gebündelt werden, weshalb sie für den Anbieter teurer sind. Kimi K3 berechnet für Output-Tokens das Fünffache – deshalb sind promptintensive Workloads deutlich günstiger als solche mit hohem Generierungsaufwand.
Die Preise entsprechen den offiziell veröffentlichten Listenpreisen für die primäre API des jeweiligen Modells und werden regelmäßig aktualisiert, sobald Anbieter diese ändern. Volumen-, Batch- und Cached-Input-Rabatte sind nicht enthalten. Vergleichen Sie alle Modelle nebeneinander im Datenbank für KI-Modelle oder das LLM-Leaderboard.

