Monday, 31 August 2026 | Updating Daily AI insight, written for builders

Kimi K3

Kimi K3 — Spezifikationen

Compiled by Mustafa Ihsan from the vendor’s published documentation · Last updated

Entwickler Moonshot AI
Typ LLM (MoE, Reasoning, multimodal)
Modality Text, Vision → Text
Parameter 2,8 Bio. insgesamt / 16 von 896 Experten aktiv (MoE)
Kontextfenster 1 Mio.
Lizenz Offene Gewichte (geplant für den 27. Juli 2026)
Offene Gewichte Ja
Veröffentlicht 2026-07
Eingabepreis $3.00 /1M
Ausgabepreis $15.00 /1M
API-Anbieter Moonshot (Kimi), OpenRouter

Lokal ausführen

VRAM (4-Bit) ca. 1,4 TB
Mindest-GPU Mehrknoten-Cluster (z. B. 2 × 8-GPU-H200-Knoten mit je 141 GB)

Offizielle Seite →

Was ist Kimi K3?

Kimi K3 ist Moonshot AIs offenes Frontier-Modell mit 2,8 Billionen Parametern – ein Mixture-of-Experts-Modell
das pro Token nur 16 von insgesamt 896 Experts aktiviert, über ein Kontextfenster von einer Million Tokens verfügt, native
Vision und ständiges Reasoning unterstützt. Im Artificial Analysis Intelligence Index erzielt es 57 Punkte,
damit knapp mehr als Claude Opus 4.8 mit 56 Punkten und weniger als GPT-5.6 Sol (59) und Claude Fable 5 (60).
– das bislang stärkste Ergebnis eines offengewichteten Modells. Die Gewichte sollten am 27. Juli 2026 veröffentlicht werden.

Die Bedeutung liegt in der Lücke – oder vielmehr in deren Fehlen. Ein offengewichtetes Modell, das sich
nur drei Punkte hinter dem besten geschlossenen Modell auf dem Markt platziert, beseitigt das letzte tröstliche
Argument dafür, Spitzenpreise rein aufgrund der Leistungsfähigkeit zu zahlen. Bei 3 USD pro Eingabe / 15 USD pro Ausgabe
Millionen Tokens. K3 ist außerdem halb so teuer wie GPT-5.5 im Durchschnitt, erzielt dabei aber bessere Ergebnisse. Der Haken ist
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.
„offen“ hier bedeutet, dass das Modell auditierbar und zwischen verschiedenen Anbietern portabel ist, nicht aber
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.
dass es in Ihrem eigenen Serverraum betrieben werden kann. Für nahezu alle Nutzer stellt Kimi K3 daher eine API-Entscheidung dar, die zufälligerweise einen Ausstiegsweg bietet.

Kimi K3 Preisgestaltung: API-Kosten pro 1 Mio. Tokens

Eingabe (pro 1 Mio. Token)$3.00
Ausgabe (pro 1 Mio. Token)$15.00
Verhältnis Output/Input
Gemischt (4:1 Input:Output)$5.40 pro 1 Mio. Tokens

Was kostet Kimi K3 pro Monat?

Tatsächliche monatliche Ausgaben bei einem 4:1-Input-zu-Output-Mix – dem Verhältnis, das typische Chat- oder RAG-Arbeitslasten tatsächlich erzeugen.

WorkloadTokens/MonatKosten pro Monat
Nebenprojekt 1 Mio. Eingabe / 0,25 Mio. Ausgabe $6.75
Kleines Team 20 Mio. Eingabe / 5 Mio. Ausgabe $135
Produktion 200 Mio. Eingabe / 50 Mio. Ausgabe $1,350

Stellen Sie Ihre eigenen Berechnungen im KI-API-Kostenrechner.

Günstigere Alternativen zu Kimi K3

ModellGewichteter Preis pro Million US-DollarSie sparen
GLM 5.2 offenere $2.00 63 % günstiger
Gemini 3.5 Flash $3.00 44 % günstiger
Gemini 3.1 Pro $4.00 26 % günstiger

Selbst hosten oder die API nutzen?

Kimi K3 ist offengewichtet, sodass Sie es selbst betreiben können. Es benötigt ca. 1,4 TB VRAM bei 4-Bit-Quantisierung (Multi-Node-Cluster, z. B. zwei 8-GPU-H200-Knoten mit je 141 GB). Das Selbsthosting lohnt sich nur dann gegenüber der API-Nutzung, wenn Ihr Volumen hoch genug ist, um diese Hardware auszulasten – der Selbsthosting vs. API-Rechner berechnet den Break-even-Punkt für Ihr Token-Volumen.

Häufig gestellte Fragen

Wie viel kostet Kimi K3 pro 1 Mio. Tokens?

Kimi K3 kostet $3,00 pro 1 Mio. Input-Tokens und $15,00 pro 1 Mio. Output-Tokens. Bei einer typischen Input-zu-Output-Mischung von 4:1 ergibt sich ein Durchschnittspreis von rund $5,40 pro 1 Mio. Tokens.

Wie viel kostet Kimi K3 pro Monat?

Eine Arbeitslast eines kleinen Teams mit 20 Mio. Input- und 5 Mio. Output-Tokens pro Monat kostet bei Kimi K3 etwa $135. Ein Nebenprojekt (1 Mio. Input / 0,25 Mio. Output) kostet ungefähr $6,75.

Was ist eine günstigere Alternative zu Kimi K3?

GLM 5.2 ist die leistungsstärkste günstigere Option in unserer Datenbank mit $2,00 pro 1 Mio. durchschnittlicher Kosten – also etwa 63 % weniger als Kimi K3. Es ist ebenfalls offengewichtet, sodass auch hier das Selbsthosting möglich ist.

Kann ich Kimi K3 lokal betreiben?

Ja. Kimi K3 ist offengewichtet und benötigt bei 4-Bit-Quantisierung etwa ~1,4 TB VRAM (Multi-Node-Cluster, z. B. zwei 8-GPU-H200-Knoten mit je 141 GB).

Warum berechnet Kimi K3 für Output-Tokens höhere Kosten als für Input-Tokens?

Output-Tokens werden einzeln generiert und können nicht wie ein Prompt gebündelt werden, weshalb sie für den Anbieter teurer sind. Kimi K3 berechnet für Output-Tokens das Fünffache – deshalb sind promptintensive Workloads deutlich günstiger als solche mit hohem Generierungsaufwand.

Die Preise entsprechen den offiziell veröffentlichten Listenpreisen für die primäre API des jeweiligen Modells und werden regelmäßig aktualisiert, sobald Anbieter diese ändern. Volumen-, Batch- und Cached-Input-Rabatte sind nicht enthalten. Vergleichen Sie alle Modelle nebeneinander im Datenbank für KI-Modelle oder das LLM-Leaderboard.

Scroll to Top
Featured on There's An AI For That