Wie viel werden die OpenAI-, Anthropic- oder DeepSeek-API Ihnen tatsächlich monatlich kosten? Google Geben Sie Ihre Nutzung ein und vergleichen Sie alle Modelle direkt nebeneinander – die Preise werden live von unserer Seite abgerufen. Datenbank für KI-Modelle.
| Modell | Entwickler | $/1 Mio. Eingabetokens | $/1 Mio. Ausgabetokens | Geschätzte monatliche Kosten |
|---|
Schätzung = (Eingabe-Mio. × Eingabepreis) + (Ausgabe-Mio. × Ausgabepreis). Tatsächliche Rechnungsbeträge können aufgrund von Caching, Mengenrabatten und Zusatzgebühren für lange Kontexte variieren. Open-Weight-Modelle, die Sie selbst hosten, sind hier nicht aufgeführt (ihre Kosten bestehen aus Hardware- und Stromkosten, nicht aus Token-basierten Gebühren).
Das günstigste Modell ist nicht immer die beste Wahl – prüfen Sie vor dem Wechsel auf jeder Modellseite dessen Kontextfenstergröße, Benchmark-Ergebnisse und Funktionalitäten. Denken Sie außerdem daran: Open-Weight-Modelle, die Sie selbst hosten, verursachen keinerlei Kosten pro Token.
Wie hoch sind die Kosten für eine LLM-API, und wie berechnet man sie?
Die Preisgestaltung für KI-APIs erfolgt pro Token und wird getrennt für Eingabe (Ihre Anfrage sowie jeglichen von Ihnen übermittelten Kontext) und Ausgabe (die Antwort des Modells) abgerechnet; die Preise werden jeweils pro Million Tokens angegeben. Um eine monatliche Rechnung abzuschätzen, multiplizieren Sie Ihre Eingabetokens mit dem Eingabepreis, addieren die mit dem Ausgabepreis multiplizierten Ausgabetokens und skalieren das Ergebnis entsprechend der Anzahl Ihrer monatlichen Anfragen. Im Jahr 2026 liegen die Eingabepreise grob bei 0,10–5 US-Dollar pro Million Tokens, die Ausgabepreise bei etwa 0,30–30 US-Dollar pro Million Tokens; die Ausgabe ist nahezu immer teurer als die Eingabe – typischerweise um den Faktor 2–5 (Median etwa 4×).
- Die Formel: monatliche Kosten ≈ (Anfragen/Monat × durchschn. Eingabetokens × Eingabepreis ÷ 1.000.000) + (Anfragen/Monat × durchschn. Ausgabetokens × Ausgabepreis ÷ 1.000.000).
- Token-zu-Wort-Regel: ca. 1,3 Tokens pro englischem Wort, also entsprechen 1.000 Tokens etwa 750 Wörtern und 1 Million Tokens etwa 750.000 Wörtern.
- Preisspanne: Budget- bzw. „Lite“-Modelle liegen bei etwa 0,10–0,15 US-Dollar pro Million Eingabetokens; Spitzenmodelle der neuesten Generation erreichen etwa 5 US-Dollar für die Eingabe und 25–30 US-Dollar für die Ausgabe.
- Bei selbstgehosteten Open-Weight-Modellen fallen keine Gebühren pro Token an — stattdessen zahlen Sie für die GPU, den Stromverbrauch und das Hosting.
Häufig gestellte Fragen
Wie berechne ich die monatlichen Kosten einer KI-API?
Nehmen Sie Ihre durchschnittliche Anzahl an Eingabe- und Ausgabetokens pro Anfrage, multiplizieren Sie jeweils mit dem pro-Million-Preis dieses Modells (Eingabe- und Ausgabepreis sind separat angegeben), addieren Sie beide Beträge für die Kosten pro Anfrage und multiplizieren Sie schließlich mit Ihrer monatlichen Anfrageanzahl. Beispiel: 100.000 Anfragen pro Monat mit jeweils 1.000 Eingabe- und 500 Ausgabetokens ergeben 100 Millionen Eingabe- und 50 Millionen Ausgabetokens; bei 1 US-Dollar pro Million Eingabetokens und 4 US-Dollar pro Million Ausgabetokens ergibt das 100 US-Dollar + 200 US-Dollar = 300 US-Dollar pro Monat.
Warum kosten Ausgabetokens mehr als Eingabetokens?
Eingabetokens werden in einem einzigen parallelen Durchlauf verarbeitet, während jedes Ausgabetoken einen eigenen vollständigen Vorwärtsdurchlauf durch das Modell erfordert – die Generierung von Text ist daher deutlich rechenintensiver als das Lesen von Text. Deshalb wird die Ausgabe üblicherweise 2–5× teurer als die Eingabe berechnet, wobei das typische Verhältnis bei etwa 4× liegt. Bei der Rechnungsabschätzung sollten Sie Ausgabetokens entsprechend stärker gewichten, statt davon auszugehen, dass Eingabe und Ausgabe gleich viel kosten.
Was bedeutet „Kosten pro 1 Mio. Tokens“ genau?
Anbieter nennen Preise pro eine Million Tokens statt pro Anfrage, weil die Tokenanzahl zwischen einzelnen Aufrufen stark variiert. Ein Token entspricht grob drei Vierteln eines englischen Wortes, sodass eine Million Tokens etwa 750.000 Wörter entspricht – die Länge eines umfangreichen Buches. Um Ihre tatsächlichen Kosten zu ermitteln, teilen Sie den angegebenen Preis pro Million durch 1.000.000 und multiplizieren das Ergebnis mit der exakten Anzahl der von Ihnen gesendeten und empfangenen Tokens.
Welche LLM-API ist 2026 die günstigste?
Die kostengünstigsten Optionen sind die „Flash“-, „Lite“- und Open-Model-APIs mit Preisen von rund 0,10–0,15 US-Dollar pro Million Eingabetokens und etwa 0,30–0,60 US-Dollar pro Million Ausgabetokens – oft 30–50× günstiger als Spitzenmodelle der neuesten Generation mit ca. 5 US-Dollar für die Eingabe und 25–30 US-Dollar für die Ausgabe. Der beste Wert ergibt sich meist mit dem günstigsten Modell, das noch Ihre Qualitätsanforderungen erfüllt; wählen Sie daher das Modell gezielt nach der Aufgabe aus, statt standardmäßig das teuerste zu nutzen. Da sich die Preise vierteljährlich ändern, verwenden Sie vor einer Volumenbindung bitte die aktuellen Werte im obigen Rechner.
Haben Open-Source- oder Open-Weight-Modelle eine Gebühr pro Token für die API-Nutzung?
Nein – wenn Sie ein Open-Weight-Modell (wie Llama, Qwen, DeepSeek oder Varianten von Mistral) selbst hosten, fallen keinerlei Gebühren pro Token an; Sie zahlen lediglich für die GPU oder den Server, den Stromverbrauch und die Wartung. Dadurch verschiebt sich die Kostenstruktur: Das Self-Hosting verursacht feste stündliche Kosten unabhängig vom Nutzungsgrad, weshalb es nur bei hohem und konstantem Volumen günstiger ist als die Abrechnung pro Token. Bei niedrigem oder schwankendem Volumen ist eine gehostete API nahezu immer kostengünstiger, da Sie exakt für die genutzten Tokens bezahlen.
Wie viel VRAM benötige ich, um ein Modell selbst zu hosten, anstatt pro Token zu zahlen?
Bei einer 4-Bit-Quantisierung benötigt ein Modell etwa 0,5–0,6 GB VRAM pro Milliarde Parameter zuzüglich zusätzlichen Speicherplatzes für den KV-Cache, dessen Größe mit der Kontextlänge zunimmt. Ein 8B-Modell benötigt daher etwa 5–6 GB und passt auf eine Consumer-GPU, ein 70B-Modell etwa 40–48 GB (eine Data-Center-GPU oder zwei 24-GB-Karten); zusätzlich sollten Sie für KV-Cache und Overhead etwa 15–20 % Puffer einplanen – dies ist eine bewährte Faustregel. Größere Kontextfenster und höhere Batch-Größen erhöhen den KV-Cache-Bedarf; dimensionieren Sie daher nach Ihren realen Prompt-Längen, nicht nur nach der Größe der Gewichte.
Wie kann ich meine KI-API-Rechnung senken?
Die größten Hebel sind die Reduzierung der gesendeten Tokenanzahl und die Wahl einer günstigeren Modellstufe für einfache Aufgaben. Prompt-Caching kann die Kosten für wiederholte System-Prompts oder Kontexte um bis zu ~90 % senken, und Batch- bzw. asynchrone Endpunkte bieten häufig einen Rabatt von etwa 50 % für nicht dringliche Aufgaben. Das Entfernen unnötig langer Kontexte, das Festlegen einer maximalen Ausgabelänge sowie das Routen einfacher Anfragen an ein Lite-Modell – während Spitzenmodelle nur für anspruchsvolle Aufgaben reserviert bleiben – senken die Rechnung typischerweise um einen erheblichen Faktor.
Weitere kostenlose Tools von Convly
Durchschnittliche API-Kosten pro 1 Mio. Tokens – was KI-Modelle wirklich kosten
$0.02
$0.02
$0.03
$0.06
$0.07
$0.07
$0.09
$0.10
$0.13
$0.15
$10.00
$10.00
$11.25
$11.25
$20.00
$20.00
Blended cost = (3 × input + output) ÷ 4 · 10 cheapest + 6 priciest of 37 tracked, log scale · full spread 909× · Green = best value, orange = highest. Updated Sep 21, 2026.
🔍 Diese Grafik kostenlos auf Ihrer Website einbetten (mit Quellenangabe)
Erhalten Sie die Zahlen, bevor alle anderen sie kennen
Einmal wöchentlich per E-Mail: Welche KI-Modelle haben ihren Preis geändert, was die neuen Benchmarks tatsächlich gemessen haben und welche GPU sich lohnt. Kein Hype, keine Füllwörter.
Kostenlos. Mit einem Klick abmelden. Wir verkaufen oder teilen Ihre Adresse niemals.
