Saturday, 26 September 2026 | Updating Daily AI insight, written for builders

Selbsthosting vs. API: Break-Even-Rechner für LLM-Kosten

Sollten Sie eine GPU kaufen und ein offenes LLM selbst hosten oder weiterhin pro Token für eine API bezahlen? Entscheidend ist das Nutzungsvolumen. Geben Sie Ihren monatlichen Verbrauch und Ihre Hardware an – dieser Rechner zeigt den Break-Even-Punkt an, also den Zeitpunkt, ab dem der Besitz einer GPU günstiger ist als die API-Gebühren.

Ihre Nutzung

Ihr Selbsthosting-System

API-Kosten (bei Ihrem Volumen)—
Selbsthosting-Kosten (GPU abgeschrieben)—
Selbsthosting-Kosten (Strom)—
Gesamtkosten für Selbsthosting pro Monat—

Selbsthosting-Läufe Open-Weight-Modelle (kostenlose Gewichte), sodass hier die pro-Token-API-Gebühr mit den Kosten für den Hardwarebesitz verglichen wird. Es wird davon ausgegangen, dass Ihre GPU mit dem gewünschten Volumen mithalten kann (eine einzelne GPU hat eine Obergrenze für Tokens/Sekunde) und dass Aufbau- und Wartungszeit unberücksichtigt bleiben. Prüfen Sie, welche Modelle eine GPU tatsächlich ausführen kann, in unserem VRAM-Rechner, sowie aktuelle API-Preise in den Kostenrechner.

Denken Sie daran: Bei Self-Hosting erfolgen die Ausführungen lokal Open-Weight-Modelle, berücksichtigen Sie daher den Qualitätsunterschied gegenüber einer State-of-the-Art-API – und nutzen Sie unseren VRAM-Rechner um zu überprüfen, ob Ihre GPU das gewünschte Modell tatsächlich ausführen kann.

Schnelle Antwort: Ist es günstiger, ein LLM selbst zu hosten oder eine API zu nutzen?

Das hängt nahezu ausschließlich von Ihrem durchschnittlichen monatlichen Token-Volumen ab. Für die meisten Nutzer ist eine gehostete API günstiger: Unterhalb von etwa 50 Millionen Tokens pro Monat schlägt die Preisgestaltung pro Token die Kosten für den Kauf und Betrieb einer GPU. Selbsthosting lohnt sich erst bei hohem, konstantem Volumen – typischerweise zehn bis hundert Millionen Tokens pro Monat für Agenten, Batch-Jobs oder ein gesamtes Team – wobei eine eigene, stets ausgelastete GPU ihre Anschaffungskosten über nahezu unbegrenzte Inferenzvorgänge amortisiert. Der Break-even-Punkt ist kein fester Wert, sondern ein Bereich, der sich mit Modellgröße, GPU-Klasse, Strompreis und vor allem mit der Auslastung der Karte verschiebt.

  • Niedriges Volumen (unter ca. 50 Mio. Tokens/Monat): Die API gewinnt nahezu immer.
  • Entscheidungszone (ca. 50–500 Mio. Tokens/Monat): Ein echtes Kopf-an-Kopf-Rennen – doch Selbsthosting lohnt sich nur, wenn Sie dedizierte Engineering-Ressourcen haben, um es zu betreiben.
  • Hohes, konstantes Volumen (Agenten, Batch-Verarbeitung oder ein gesamtes Team, 500 Mio. + Tokens/Monat): Eine gut ausgelastete eigene GPU kann die Inferenzkosten um bis zu ~5× senken.
  • Eine GPU amortisiert sich nur, wenn sie ständig ausgelastet ist – eine ungenutzte Karte verursacht trotzdem ihre volle Anschaffungskosten und Stromkosten.
  • Budget-„Flash“-APIs oder APIs für kleinere Modelle sind so preiswert, dass Selbsthosting bei keinem Volumen gerechtfertigt ist.

Häufig gestellte Fragen

Wann rentiert sich eine lokale GPU?

Eine GPU rentiert sich, sobald Ihre durchschnittlichen monatlichen API-Ausgaben für ein vergleichbares Open-Source-Modell regelmäßig die Gesamtkosten des Eigentums überschreiten. Eine Consumer-GPU im Preisbereich von rund 2.000–2.500 US-Dollar, verteilt über drei Jahre, beläuft sich auf etwa 55–70 US-Dollar pro Monat, zuzüglich 30–60 US-Dollar für Strom – das heißt, der Gesamtpreis für den Eigenbetrieb liegt bei rund 85–130 US-Dollar pro Monat. Bleiben Ihre vergleichbaren API-Ausgaben darunter, ist die API günstiger; sobald sie deutlich darüber liegen – im Bereich von mehreren hundert US-Dollar pro Monat – amortisiert sich die Karte mit ihren 2.000–2.500 US-Dollar Anschaffungskosten innerhalb eines Jahres und spart danach Geld.

Wie viel VRAM benötige ich, um ein LLM lokal auszuführen?

Bei 4-Bit-Quantisierung rechnen Sie grob mit 0,5–0,6 GB VRAM pro Milliarde Parameter, plus zusätzlichem Speicher für den KV-Cache, der mit der Kontextlänge wächst. Praktisch benötigt ein 7B-Modell etwa 8 GB, ein 13B-Modell 12–16 GB und ein 4-Bit-70B-Modell rund 40–48 GB. Das bedeutet, dass ein 7–13B-Modell problemlos auf einer einzelnen 8–16-GB-Karte läuft, während ein 4-Bit-70B-Modell zu groß für jede einzelne Consumer-GPU ist – selbst eine 32-GB-Karte reicht nicht aus; stattdessen benötigen Sie zwei 24-GB-Karten, eine 48-GB-Workstation-GPU oder ein kleineres, stärker quantisiertes Modell.

Welche versteckten Kosten entstehen beim Selbsthosting eines LLM?

Der GPU-Preis ist nur ein Teil davon – sobald Sie Strom, Kühlung und vor allem Engineering-Zeit hinzurechnen, kostet Selbsthosting typischerweise das 3- bis 5-Fache des reinen GPU-Mietpreises. Rechnen Sie mit 10–20 Stunden pro Monat für Einrichtung, Überwachung und Wartung; diese Arbeitszeit sowie die Kosten für eine zwischen Aufträgen ungenutzte Karte sind es, die die meisten simplen Break-even-Berechnungen zunichtemachen.

Ändert die Modellgröße den Break-even-Punkt?

Ja. Größere Modelle erfordern mehr oder teurere GPUs, was die zu amortisierenden Kapitalausgaben erhöht, aber sie weisen auch die höchsten API-Preise pro Token auf, was den Break-even-Punkt in Bezug auf das erforderliche Volumen nach unten verschiebt. Ein kleines 7–13B-Modell ist günstig im Eigenbetrieb, aber auch über die API sehr preiswert – daher gewinnen APIs meistens; ein 70B+-Open-Source-Modell ist dagegen der Bereich, in dem eine stark ausgelastete eigene GPU die größten Einsparungen bringt.

Macht Strom den Eigenbetrieb zu teuer?

Normalerweise nicht – Strom ist eine Nebenposition im Vergleich zur Hardware. Eine einzelne Desktop-GPU im Dauerbetrieb zieht etwa 400–600 W, was bei typischen Stromtarifen bei kontinuierlichem Betrieb lediglich rund 30–60 US-Dollar pro Monat ausmacht. Die dominierende Kostenposition beim Selbsthosting ist die Anschaffung der Hardware und die Engineering-Zeit für ihren Betrieb – nicht der Strom.

Sollte ein kleines Team oder ein Startup selbst hosten oder eine API nutzen?

Beginnen Sie mit einer API. Solange Sie kein hohes, vorhersehbares Volumen haben und niemanden für den Infrastrukturbetrieb zur Verfügung steht, ist die Preisgestaltung pro Token günstiger, schneller implementiert und birgt kein finanzielles Risiko. Selbsthosting lohnt sich erst dann wieder, wenn Ihre monatliche Rechnung hoch und stabil ist – typischerweise ab einem durchschnittlichen Volumen von mehreren zehn Millionen Tokens pro Monat für ein vergleichbares Open-Source-Modell.


Erhalten Sie die Zahlen, bevor alle anderen sie kennen

Einmal wöchentlich per E-Mail: Welche KI-Modelle haben ihren Preis geändert, was die neuen Benchmarks tatsächlich gemessen haben und welche GPU sich lohnt. Kein Hype, keine Füllwörter.

Kostenlos. Mit einem Klick abmelden. Wir verkaufen oder teilen Ihre Adresse niemals.

Scroll to Top