Thursday, 13 August 2026 | Updating Daily AI insight, written for builders

Hugging Face Inference API: Funktionsweise, Kosten und Einsatzszenarien

  • Die Hugging Face Inference API – jetzt offiziell benannt als Inference Providers – leitet Anfragen über ein einzelnes HF-Token an Groq, Together AI, Fireworks, Cerebras und andere Anbieter weiter unter https://router.huggingface.co/v1.
  • Kostenlose Stufe: 0,10 $/Monat an Guthaben für kostenlose Konten,2,00 $/Monat für PRO-Nutzer. Hugging Face berechnet die Preise der Anbieter unverändert weiter – ohne Aufschlag.
  • Der veraltete hf-inference -Anbieter (die ursprüngliche serverlose API) konzentriert sich nun auf CPU-basierte Inferenz; GPU-Modelle werden an externe Anbieter mit vorgewärmter Kapazität weitergeleitet.
  • Nutzen Sie dedizierte Inference Endpoints , wenn Sie ein privates oder feinjustiertes Modell benötigen, garantierte GPU-Kapazität oder konsistente Latenz – ab 0,50 $/Stunde für eine NVIDIA T4 auf AWS.

Die Hugging Face Inference API bietet Entwicklern REST-Zugriff auf Hunderte Open-Weights-Modelle – darunter Sprachmodelle (LLMs), Embedding-Modelle, Bildgeneratoren, Sprachverarbeitungsmodelle und Klassifikatoren – ohne dass Infrastruktur bereitgestellt werden muss. Sie authentifizieren sich mit einem einzigen HF-Token, senden Anfragen an die Routing-Schicht von Hugging Face, und diese leitet sie an den jeweiligen Anbieter weiter, bei dem das gewünschte Modell bereits vorgewärmt und einsatzbereit ist. Ab 2025 heißt dieser Dienst offiziell Inference Providers, doch der Token-Flow, die Basis-URL und das grundlegende Nutzungsmuster bleiben identisch mit der ursprünglichen Inference API.

Was ist die Hugging Face Inference API (und was hat sich geändert?)

Ursprünglich bezeichnete die „Inference API“ einen serverlosen, von Hugging Face gehosteten Dienst unter api-inference.huggingface.co , der Modelle bei Bedarf lädt. Dieser Dienst existiert weiterhin als hf-inference -Anbieter, konzentriert sich aber seit Juli 2025 auf CPU-basierte Inferenz: Embeddings, Textklassifikation, Named Entity Recognition (NER), Zusammenfassung sowie kleinere, historisch bedeutende Modelle wie BERT oder GPT-2.

Für GPU-beschleunigte Inferenz – große Sprachmodelle (LLMs), Bildgenerierung, Sprachverarbeitung – leitet Hugging Face Anfragen nun an Partneranbieter weiter: Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI und andere. Die Schnittstelle bleibt unverändert: ein einziges Token, eine einzige Basis-URL und ein OpenAI-kompatibles Anfrageformat. Die Router-URL lautet https://router.huggingface.co/v1. Die alte api-inference.huggingface.co -URL verarbeitet weiterhin veraltete Aufrufe an hf-inference, neue Integrationen sollten jedoch gezielt den Router ansprechen.

So funktioniert der Router

Wenn Sie eine Anfrage an router.huggingface.cosenden, wählt Hugging Face einen Anbieter basierend auf einer Richtlinie aus, die Sie an die Modell-ID anhängen:

Richtlinien-SuffixVerhalten
:fastest (Standard)Anbieter mit derzeit höchster Durchsatzrate
:cheapestGeringster Preis pro Ausgabetoken
:preferredIhre priorisierte Anbieterliste aus den HF-Einstellungen
:groq, :together, usw.Erzwingen eines bestimmten benannten Anbieters

Hängen Sie die Richtlinie direkt an die Modell-ID an: "deepseek-ai/DeepSeek-R1:cheapest". Wird kein Suffix angegeben, wird standardmäßig :fastestverwendet. Ein automatischer Failover ist integriert – falls der ausgewählte Anbieter als nicht verfügbar markiert ist, leitet der Router die Anfrage an einen alternativen Anbieter um.

Authentifizierung und Ihre erste Anfrage

Gehe zu huggingface.co/settings/tokenserstellen Sie ein feingranulares Token und aktivieren Sie die Berechtigung Aufrufe an Inference Providers durchführen . Legen Sie es als HF_TOKEN in Ihrer Umgebung.

Python – huggingface_hub

pip install huggingface_hub
import os
from huggingface_hub import InferenceClient

client = InferenceClient()  # liest HF_TOKEN aus der Umgebung aus

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}],
)
print(completion.choices[0].message.content)

Python – OpenAI-Kompatibilität (Drop-in-Ersatz)

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://router.huggingface.co/v1",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324:fastest",
    messages=[{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}],
)
print(completion.choices[0].message.content)

cURL

curl https://router.huggingface.co/v1/chat/completions 
  -H "Authorization: Bearer $HF_TOKEN" 
  -H "Content-Type: application/json" 
  -d '{
    "model": "deepseek-ai/DeepSeek-V3-0324:fastest",
    "messages": [{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}]
  }'

Der OpenAI-kompatible Endpunkt unterstützt ausschließlich Chat-Vervollständigungen. Für andere Aufgaben – etwa Text-zu-Bild, Embeddings oder Sprach-zu-Text – verwenden Sie die huggingface_hub Python-Bibliothek oder das @huggingface/inference JS-SDK, die die anbieterspezifische Anfrageformatierung automatisch übernehmen.

Kostenlose Stufe, Guthaben und was danach passiert

Jeder Hugging-Face-Account erhält monatlich ein Guthaben, das automatisch auf geroutete Anfragen angerechnet wird:

Account-TypMonatliches GuthabenKostenpflichtige Nutzung nach Verbrauch?
Kostenlos0,10 $ (vorbehaltlich Änderungen)Ja – erfordert den Kauf zusätzlicher Guthaben
PRO$2.00Ja
Team / Enterprise2,00 $ pro Nutzer, gemeinsam genutztJa

Sobald Ihr Guthaben aufgebraucht ist, bleibt der Zugriff nicht gesperrt – Sie können weitere Guthaben kaufen, um fortzufahren. Hugging Face berechnet Ihnen denselben Preis, den der jeweilige Anbieter verlangt, ohne Aufschlag. Die Kosten einer einzelnen Anfrage hängen vom Modell und vom Anbieter ab; Ihre Ausgaben pro Modell und pro Anbieter können Sie unter huggingface.co/settings/inference-providers/overview.

Falls Sie bereits Konten bei einem bestimmten Anbieter besitzen, können Sie in den HF-Einstellungen einen benutzerdefinierten Anbieterschlüssel festlegen. Die Anfragen werden weiterhin über HF geroutet, doch der Anbieter stellt Ihnen die Rechnung direkt – Ihr monatliches HF-Guthaben wird in diesem Fall nicht angerechnet. Bevor Sie sich für ein bestimmtes Volumen entscheiden, nutzen Sie den API-Kostenrechner Kostenrechner

Kaltstarts und der hf-inference-Anbieter

Der veraltete hf-inference Anbieter laden Modelle bedarfsgesteuert. Wenn ein Modell kürzlich nicht aufgerufen wurde und in den Leerlauf wechselt, löst die erste neue Anfrage zunächst das Laden des Modells aus, bevor die Antwort generiert werden kann – dies ist ein sogenannter „Cold Start“. Dadurch entsteht bei diesem ersten Aufruf eine spürbare Latenz.

Stand Juli 2025 konzentriert sich hf-inference auf CPU-basierte Inferenz: Embedding-Modelle, Klassifikatoren, Named Entity Recognition (NER) sowie kleinere Textmodelle. Cold Starts sind in diesem Kontext besonders relevant.

Für GPU-beschleunigte Workloads – etwa große Sprachmodelle (LLMs) oder Bildgenerierung – leitet der Router Anfragen an externe Anbieter wie Groq oder Together AI weiter, die warme, geteilte GPU-Ressourcen betreiben. Für diese Anbieter spielen Cold Starts keine Rolle im herkömmlichen Sinne; allerdings teilen Sie sich die Ressourcen, sodass während Lastspitzen keine Durchsatzgarantie besteht.

Falls Cold-Start-Latenz oder Schwankungen beim Durchsatz unakzeptabel sind – beispielsweise für einen latenzkritischen Produktionsendpunkt – ist eine dedizierte Inference Endpoint die richtige Lösung.

Inference API vs. Inference Endpoints

Die Hugging-Face-Plattform bietet zwei unterschiedliche Produkte für Inferenz. Beide nutzen dasselbe Token-System und denselben Modell-Hub, unterscheiden sich jedoch stark in ihrer Funktionsweise:

Inference Providers (API)Inference Endpoints (Dediziert)
InfrastrukturGeteilt, verwaltet von PartneranbieternDedizierte GPU-Instanz in Ihrer gewählten Region
PreismodellKosten pro Anfrage zum Tarif des AnbietersAbrechnung pro Minute während des Betriebs oder der Initialisierung
Cold StartsMöglich bei CPU-Modellen von hf-inferenceKeine, solange die Endpoint läuft
Private ModelleNein – ausschließlich öffentliche Hub-ModelleJa – private Repositories und feinjustierte Modelle
Hardware-KontrolleKeinesWahl zwischen GPU-Typ, Anzahl und Region
Mindestkosten0 $ (innerhalb des kostenlosen Guthabens)ca. 0,50 $/Stunde im Betrieb (AWS NVIDIA T4)

Inference Endpoints werden nur pro Minute abgerechnet, solange sie sich im Zustand laufend oder initialisierend befinden – pausierte Endpoints verursachen keine Kosten. Zu den AWS-GPU-Optionen zählen die T4 für 0,50 $/Stunde (14 GB VRAM) bis hin zur H200 für 5,00 $/Stunde pro Karte (141 GB VRAM). Bei GCP stehen unter anderem die H100 für 10,00 $/Stunde pro Karte (80 GB VRAM) zur Verfügung. Bevor Sie eine Leistungsstufe wählen, nutzen Sie den VRAM-Rechner Modellkompatibilitätsprüfer

Wie sich die Preise mit anderen Anbietern vergleichen

Da Hugging Face dieselben zugrundeliegenden Anbieter – Together AI, Fireworks, DeepInfra, Groq – nutzt, die Sie auch direkt oder über OpenRouter erreichen können, sind die Kosten pro Token für ein gegebenes Modell in der Regel identisch. Hugging Face berechnet keinen Aufschlag.

Praktische Unterschiede:

  • Kostenlose Guthaben: HF gewährt automatisch monatlich kostenlose Nutzungsguthaben im Wert von 0,10–2,00 USD. OpenRouter und direkte Anbieter bieten keine vergleichbare monatliche Freigrenze.
  • Modellvielfalt: HF Inference Providers konzentriert sich auf Modelle mit offenen Gewichten aus dem Hub. OpenRouter umfasst zudem geschlossene Modelle (z. B. GPT-4o, Claude, Gemini). Falls Sie sowohl offene als auch proprietäre Modelle über einen einzigen Router nutzen möchten, deckt OpenRouter ein breiteres Spektrum ab.
  • Nicht-Chat-Aufgaben: Embeddings, Bildgenerierung und Sprachverarbeitung sind über das SDK von HF verfügbar. Die meisten konkurrierenden Router unterstützen ausschließlich Chat-Vervollständigungen.
  • Zentralisierte Abrechnung: Ein einziges HF-Konto deckt alle Anbieter ab und bietet ein einheitliches Nutzungs-Dashboard. Bei direkten Anbieterkonten müssen für jeden Anbieter separate Abrechnungsbeziehungen geführt werden.

Für einen umfassenden Modellvergleich nach Preis und Leistungsfähigkeit siehe die Datenbank für KI-Modelle mit technischen Spezifikationen und Preisen für führende Modelle.

Wann dedizierte Endpunkte oder Self-Hosting die bessere Wahl sind

Nutzen Sie Inference Providers, wenn Sie Prototypen entwickeln, eine variable oder unvorhersehbare Last haben und Zugriff auf einen breiten Katalog öffentlicher Modelle benötigen – ohne Server selbst verwalten zu müssen.

Wechseln Sie zu einem dedizierten Inference Endpoint, wenn:

  • Sie ein feinjustiertes oder privates Modell bereitstellen müssen, das nicht im öffentlichen Hub verfügbar ist.
  • Konsistente Latenz erforderlich ist – bei gemeinsam genutzten Providern können Antwortzeiten unter Last schwanken.
  • Sie garantierten Durchsatz für ein Produktions-SLA benötigen.

Erwägen Sie Self-Hosting, wenn Ihr Aufrufvolumen so hoch ist, dass die Kosten pro Token die amortisierten Hardwarekosten übersteigen, oder wenn Datenschutzanforderungen das Senden von Eingaben an externe APIs verbieten. DerSelbsthosting- versus-API-Kosten-Grenzwert-Rechner bietet einen konkreten Kostenvergleich basierend auf Ihrem Anfragevolumen und der Modellgröße. Für Hardware-Empfehlungen, falls Sie diesen Weg einschlagen, siehe die besten GPUs für lokales LLM-Hosting.

Häufig gestellte Fragen

Was ist der Unterschied zwischen der Inference API und Inference Endpoints?

Die Inference API (jetzt Inference Providers) ist ein gemeinsam genutzter, nutzungsabhängiger Dienst, der Anfragen an Partner-GPU-Anbieter sowie an die eigenen CPU-Infrastrukturen von HF weiterleitet. Inference Endpoints hingegen sind dedizierte GPU-Instanzen, die Sie in einer Cloud-Region bereitstellen; sie führen kontinuierlich ein einzelnes Modell aus und werden pro Minute Betriebszeit abgerechnet. Nutzen Sie die API für Prototyping und variable Workloads; verwenden Sie Endpoints für Produktionsumgebungen mit strengen Latenzanforderungen sowie für private oder feinjustierte Modelle.

Benötige ich ein PRO-Abonnement, um die Inference API zu nutzen?

Nein. Ein kostenloses Konto erhält monatlich 0,10 USD Guthaben – ausreichend für erste Experimente. PRO-Abonnenten erhalten 2,00 USD monatlich. Beide Tarife unterstützen darüber hinaus den nachträglichen Kauf zusätzlicher Guthaben nach Verbrauch der monatlichen Freigrenze. Der wesentliche Vorteil des PRO-Tarifs liegt ausschließlich in der höheren monatlichen Guthabengrenze, nicht in eingeschränktem Zugriff auf Modelle oder Anbieter.

Warum ist meine erste Anfrage deutlich langsamer als die folgenden?

Wenn Sie an den hf-inference -Anbieter weiterleiten, werden Modelle bedarfsgesteuert geladen. Ein Modell, das in den Leerlauf wechselt, muss vor Ihrer Anfrage erneut in den Arbeitsspeicher geladen werden, was die Latenz beim ersten Aufruf erhöht. Dies gilt nicht für GPU-Anbieter wie Groq oder Together AI, die stets betriebsbereite, gemeinsam genutzte Infrastruktur bereitstellen. Durch Angabe von :fastest oder eines benannten GPU-Anbieters in der Modell-ID wird diese Verzögerung vollständig vermieden.

Ist die HF-Inference-API mit dem OpenAI-Python-SDK kompatibel?

Ja, für Chat-Vervollständigungen. Legen Sie base_url="https://router.huggingface.co/v1" fest und übergeben Sie Ihr HF-Token als api_key. Der /v1/chat/completions und /v1/models -Endpunkte sind OpenAI-kompatibel. Für andere Aufgabentypen – Embeddings, Bildgenerierung, Sprachverarbeitung – benötigen Sie das huggingface_hub Python-Bibliothek oder das @huggingface/inference JS-SDK; diese Funktionen werden vom OpenAI-kompatiblen Endpunkt nicht abgedeckt.

Kann ich ein feinjustiertes Modell über die Inference API bereitstellen?

Nein, nicht über Inference Providers – dieser Dienst stellt ausschließlich Modelle bereit, die im öffentlichen Hub-Katalog verfügbar sind und von einem Partneranbieter unterstützt werden. Für ein privates oder feinjustiertes Modell stellen Sie stattdessen einen dedizierten Inference Endpoint bereit, der private Hub-Repositories unterstützt und Ihnen ermöglicht, eigene Modellgewichte auf einer von Ihnen kontrollierten GPU-Instanz einzusetzen.

Wie kann ich Kosten verfolgen und steuern?

Ihre detaillierte Nutzungsaufschlüsselung nach Modell und Anbieter finden Sie unter huggingface.co/settings/inference-providers/overview. Team- und Enterprise-Administratoren können Ausgabenobergrenzen festlegen und bestimmte Anbieter über die Organisations-Einstellungsseite deaktivieren. Für vorausschauende Kostenabschätzungen vor Projektbeginn nutzen Sie den API-Kostenrechner.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That