- Die Hugging Face Inference API – jetzt offiziell benannt als Inference Providers – leitet Anfragen über ein einzelnes HF-Token an Groq, Together AI, Fireworks, Cerebras und andere Anbieter weiter unter
https://router.huggingface.co/v1. - Kostenlose Stufe: 0,10 $/Monat an Guthaben für kostenlose Konten,2,00 $/Monat für PRO-Nutzer. Hugging Face berechnet die Preise der Anbieter unverändert weiter – ohne Aufschlag.
- Der veraltete
hf-inference-Anbieter (die ursprüngliche serverlose API) konzentriert sich nun auf CPU-basierte Inferenz; GPU-Modelle werden an externe Anbieter mit vorgewärmter Kapazität weitergeleitet. - Nutzen Sie dedizierte Inference Endpoints , wenn Sie ein privates oder feinjustiertes Modell benötigen, garantierte GPU-Kapazität oder konsistente Latenz – ab 0,50 $/Stunde für eine NVIDIA T4 auf AWS.
Die Hugging Face Inference API bietet Entwicklern REST-Zugriff auf Hunderte Open-Weights-Modelle – darunter Sprachmodelle (LLMs), Embedding-Modelle, Bildgeneratoren, Sprachverarbeitungsmodelle und Klassifikatoren – ohne dass Infrastruktur bereitgestellt werden muss. Sie authentifizieren sich mit einem einzigen HF-Token, senden Anfragen an die Routing-Schicht von Hugging Face, und diese leitet sie an den jeweiligen Anbieter weiter, bei dem das gewünschte Modell bereits vorgewärmt und einsatzbereit ist. Ab 2025 heißt dieser Dienst offiziell Inference Providers, doch der Token-Flow, die Basis-URL und das grundlegende Nutzungsmuster bleiben identisch mit der ursprünglichen Inference API.
- Was ist die Hugging Face Inference API (und was hat sich geändert?)
- So funktioniert der Router
- Authentifizierung und Ihre erste Anfrage
- Kostenlose Stufe, Guthaben und was danach passiert
- Kaltstarts und der hf-inference-Anbieter
- Inference API vs. Inference Endpoints
- Wie sich die Preise mit anderen Anbietern vergleichen
- Wann dedizierte Endpunkte oder Self-Hosting die bessere Wahl sind
- Häufig gestellte Fragen
Was ist die Hugging Face Inference API (und was hat sich geändert?)
Ursprünglich bezeichnete die „Inference API“ einen serverlosen, von Hugging Face gehosteten Dienst unter api-inference.huggingface.co , der Modelle bei Bedarf lädt. Dieser Dienst existiert weiterhin als hf-inference -Anbieter, konzentriert sich aber seit Juli 2025 auf CPU-basierte Inferenz: Embeddings, Textklassifikation, Named Entity Recognition (NER), Zusammenfassung sowie kleinere, historisch bedeutende Modelle wie BERT oder GPT-2.
Für GPU-beschleunigte Inferenz – große Sprachmodelle (LLMs), Bildgenerierung, Sprachverarbeitung – leitet Hugging Face Anfragen nun an Partneranbieter weiter: Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI und andere. Die Schnittstelle bleibt unverändert: ein einziges Token, eine einzige Basis-URL und ein OpenAI-kompatibles Anfrageformat. Die Router-URL lautet https://router.huggingface.co/v1. Die alte api-inference.huggingface.co -URL verarbeitet weiterhin veraltete Aufrufe an hf-inference, neue Integrationen sollten jedoch gezielt den Router ansprechen.
So funktioniert der Router
Wenn Sie eine Anfrage an router.huggingface.cosenden, wählt Hugging Face einen Anbieter basierend auf einer Richtlinie aus, die Sie an die Modell-ID anhängen:
| Richtlinien-Suffix | Verhalten |
|---|---|
:fastest (Standard) | Anbieter mit derzeit höchster Durchsatzrate |
:cheapest | Geringster Preis pro Ausgabetoken |
:preferred | Ihre priorisierte Anbieterliste aus den HF-Einstellungen |
:groq, :together, usw. | Erzwingen eines bestimmten benannten Anbieters |
Hängen Sie die Richtlinie direkt an die Modell-ID an: "deepseek-ai/DeepSeek-R1:cheapest". Wird kein Suffix angegeben, wird standardmäßig :fastestverwendet. Ein automatischer Failover ist integriert – falls der ausgewählte Anbieter als nicht verfügbar markiert ist, leitet der Router die Anfrage an einen alternativen Anbieter um.
Authentifizierung und Ihre erste Anfrage
Gehe zu huggingface.co/settings/tokenserstellen Sie ein feingranulares Token und aktivieren Sie die Berechtigung Aufrufe an Inference Providers durchführen . Legen Sie es als HF_TOKEN in Ihrer Umgebung.
Python – huggingface_hub
pip install huggingface_hubimport os
from huggingface_hub import InferenceClient
client = InferenceClient() # liest HF_TOKEN aus der Umgebung aus
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}],
)
print(completion.choices[0].message.content)Python – OpenAI-Kompatibilität (Drop-in-Ersatz)
from openai import OpenAI
import os
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324:fastest",
messages=[{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}],
)
print(completion.choices[0].message.content)cURL
curl https://router.huggingface.co/v1/chat/completions
-H "Authorization: Bearer $HF_TOKEN"
-H "Content-Type: application/json"
-d '{
"model": "deepseek-ai/DeepSeek-V3-0324:fastest",
"messages": [{"role": "user", "content": "Erklären Sie Tokenisierung in zwei Sätzen."}]
}'Der OpenAI-kompatible Endpunkt unterstützt ausschließlich Chat-Vervollständigungen. Für andere Aufgaben – etwa Text-zu-Bild, Embeddings oder Sprach-zu-Text – verwenden Sie die huggingface_hub Python-Bibliothek oder das @huggingface/inference JS-SDK, die die anbieterspezifische Anfrageformatierung automatisch übernehmen.
Kostenlose Stufe, Guthaben und was danach passiert
Jeder Hugging-Face-Account erhält monatlich ein Guthaben, das automatisch auf geroutete Anfragen angerechnet wird:
| Account-Typ | Monatliches Guthaben | Kostenpflichtige Nutzung nach Verbrauch? |
|---|---|---|
| Kostenlos | 0,10 $ (vorbehaltlich Änderungen) | Ja – erfordert den Kauf zusätzlicher Guthaben |
| PRO | $2.00 | Ja |
| Team / Enterprise | 2,00 $ pro Nutzer, gemeinsam genutzt | Ja |
Sobald Ihr Guthaben aufgebraucht ist, bleibt der Zugriff nicht gesperrt – Sie können weitere Guthaben kaufen, um fortzufahren. Hugging Face berechnet Ihnen denselben Preis, den der jeweilige Anbieter verlangt, ohne Aufschlag. Die Kosten einer einzelnen Anfrage hängen vom Modell und vom Anbieter ab; Ihre Ausgaben pro Modell und pro Anbieter können Sie unter huggingface.co/settings/inference-providers/overview.
Falls Sie bereits Konten bei einem bestimmten Anbieter besitzen, können Sie in den HF-Einstellungen einen benutzerdefinierten Anbieterschlüssel festlegen. Die Anfragen werden weiterhin über HF geroutet, doch der Anbieter stellt Ihnen die Rechnung direkt – Ihr monatliches HF-Guthaben wird in diesem Fall nicht angerechnet. Bevor Sie sich für ein bestimmtes Volumen entscheiden, nutzen Sie den API-Kostenrechner Kostenrechner
Kaltstarts und der hf-inference-Anbieter
Der veraltete hf-inference Anbieter laden Modelle bedarfsgesteuert. Wenn ein Modell kürzlich nicht aufgerufen wurde und in den Leerlauf wechselt, löst die erste neue Anfrage zunächst das Laden des Modells aus, bevor die Antwort generiert werden kann – dies ist ein sogenannter „Cold Start“. Dadurch entsteht bei diesem ersten Aufruf eine spürbare Latenz.
Stand Juli 2025 konzentriert sich hf-inference auf CPU-basierte Inferenz: Embedding-Modelle, Klassifikatoren, Named Entity Recognition (NER) sowie kleinere Textmodelle. Cold Starts sind in diesem Kontext besonders relevant.
Für GPU-beschleunigte Workloads – etwa große Sprachmodelle (LLMs) oder Bildgenerierung – leitet der Router Anfragen an externe Anbieter wie Groq oder Together AI weiter, die warme, geteilte GPU-Ressourcen betreiben. Für diese Anbieter spielen Cold Starts keine Rolle im herkömmlichen Sinne; allerdings teilen Sie sich die Ressourcen, sodass während Lastspitzen keine Durchsatzgarantie besteht.
Falls Cold-Start-Latenz oder Schwankungen beim Durchsatz unakzeptabel sind – beispielsweise für einen latenzkritischen Produktionsendpunkt – ist eine dedizierte Inference Endpoint die richtige Lösung.
Inference API vs. Inference Endpoints
Die Hugging-Face-Plattform bietet zwei unterschiedliche Produkte für Inferenz. Beide nutzen dasselbe Token-System und denselben Modell-Hub, unterscheiden sich jedoch stark in ihrer Funktionsweise:
| Inference Providers (API) | Inference Endpoints (Dediziert) | |
|---|---|---|
| Infrastruktur | Geteilt, verwaltet von Partneranbietern | Dedizierte GPU-Instanz in Ihrer gewählten Region |
| Preismodell | Kosten pro Anfrage zum Tarif des Anbieters | Abrechnung pro Minute während des Betriebs oder der Initialisierung |
| Cold Starts | Möglich bei CPU-Modellen von hf-inference | Keine, solange die Endpoint läuft |
| Private Modelle | Nein – ausschließlich öffentliche Hub-Modelle | Ja – private Repositories und feinjustierte Modelle |
| Hardware-Kontrolle | Keines | Wahl zwischen GPU-Typ, Anzahl und Region |
| Mindestkosten | 0 $ (innerhalb des kostenlosen Guthabens) | ca. 0,50 $/Stunde im Betrieb (AWS NVIDIA T4) |
Inference Endpoints werden nur pro Minute abgerechnet, solange sie sich im Zustand laufend oder initialisierend befinden – pausierte Endpoints verursachen keine Kosten. Zu den AWS-GPU-Optionen zählen die T4 für 0,50 $/Stunde (14 GB VRAM) bis hin zur H200 für 5,00 $/Stunde pro Karte (141 GB VRAM). Bei GCP stehen unter anderem die H100 für 10,00 $/Stunde pro Karte (80 GB VRAM) zur Verfügung. Bevor Sie eine Leistungsstufe wählen, nutzen Sie den VRAM-Rechner Modellkompatibilitätsprüfer
Wie sich die Preise mit anderen Anbietern vergleichen
Da Hugging Face dieselben zugrundeliegenden Anbieter – Together AI, Fireworks, DeepInfra, Groq – nutzt, die Sie auch direkt oder über OpenRouter erreichen können, sind die Kosten pro Token für ein gegebenes Modell in der Regel identisch. Hugging Face berechnet keinen Aufschlag.
Praktische Unterschiede:
- Kostenlose Guthaben: HF gewährt automatisch monatlich kostenlose Nutzungsguthaben im Wert von 0,10–2,00 USD. OpenRouter und direkte Anbieter bieten keine vergleichbare monatliche Freigrenze.
- Modellvielfalt: HF Inference Providers konzentriert sich auf Modelle mit offenen Gewichten aus dem Hub. OpenRouter umfasst zudem geschlossene Modelle (z. B. GPT-4o, Claude, Gemini). Falls Sie sowohl offene als auch proprietäre Modelle über einen einzigen Router nutzen möchten, deckt OpenRouter ein breiteres Spektrum ab.
- Nicht-Chat-Aufgaben: Embeddings, Bildgenerierung und Sprachverarbeitung sind über das SDK von HF verfügbar. Die meisten konkurrierenden Router unterstützen ausschließlich Chat-Vervollständigungen.
- Zentralisierte Abrechnung: Ein einziges HF-Konto deckt alle Anbieter ab und bietet ein einheitliches Nutzungs-Dashboard. Bei direkten Anbieterkonten müssen für jeden Anbieter separate Abrechnungsbeziehungen geführt werden.
Für einen umfassenden Modellvergleich nach Preis und Leistungsfähigkeit siehe die Datenbank für KI-Modelle mit technischen Spezifikationen und Preisen für führende Modelle.
Wann dedizierte Endpunkte oder Self-Hosting die bessere Wahl sind
Nutzen Sie Inference Providers, wenn Sie Prototypen entwickeln, eine variable oder unvorhersehbare Last haben und Zugriff auf einen breiten Katalog öffentlicher Modelle benötigen – ohne Server selbst verwalten zu müssen.
Wechseln Sie zu einem dedizierten Inference Endpoint, wenn:
- Sie ein feinjustiertes oder privates Modell bereitstellen müssen, das nicht im öffentlichen Hub verfügbar ist.
- Konsistente Latenz erforderlich ist – bei gemeinsam genutzten Providern können Antwortzeiten unter Last schwanken.
- Sie garantierten Durchsatz für ein Produktions-SLA benötigen.
Erwägen Sie Self-Hosting, wenn Ihr Aufrufvolumen so hoch ist, dass die Kosten pro Token die amortisierten Hardwarekosten übersteigen, oder wenn Datenschutzanforderungen das Senden von Eingaben an externe APIs verbieten. DerSelbsthosting- versus-API-Kosten-Grenzwert-Rechner bietet einen konkreten Kostenvergleich basierend auf Ihrem Anfragevolumen und der Modellgröße. Für Hardware-Empfehlungen, falls Sie diesen Weg einschlagen, siehe die besten GPUs für lokales LLM-Hosting.
Häufig gestellte Fragen
Was ist der Unterschied zwischen der Inference API und Inference Endpoints?
Die Inference API (jetzt Inference Providers) ist ein gemeinsam genutzter, nutzungsabhängiger Dienst, der Anfragen an Partner-GPU-Anbieter sowie an die eigenen CPU-Infrastrukturen von HF weiterleitet. Inference Endpoints hingegen sind dedizierte GPU-Instanzen, die Sie in einer Cloud-Region bereitstellen; sie führen kontinuierlich ein einzelnes Modell aus und werden pro Minute Betriebszeit abgerechnet. Nutzen Sie die API für Prototyping und variable Workloads; verwenden Sie Endpoints für Produktionsumgebungen mit strengen Latenzanforderungen sowie für private oder feinjustierte Modelle.
Benötige ich ein PRO-Abonnement, um die Inference API zu nutzen?
Nein. Ein kostenloses Konto erhält monatlich 0,10 USD Guthaben – ausreichend für erste Experimente. PRO-Abonnenten erhalten 2,00 USD monatlich. Beide Tarife unterstützen darüber hinaus den nachträglichen Kauf zusätzlicher Guthaben nach Verbrauch der monatlichen Freigrenze. Der wesentliche Vorteil des PRO-Tarifs liegt ausschließlich in der höheren monatlichen Guthabengrenze, nicht in eingeschränktem Zugriff auf Modelle oder Anbieter.
Warum ist meine erste Anfrage deutlich langsamer als die folgenden?
Wenn Sie an den hf-inference -Anbieter weiterleiten, werden Modelle bedarfsgesteuert geladen. Ein Modell, das in den Leerlauf wechselt, muss vor Ihrer Anfrage erneut in den Arbeitsspeicher geladen werden, was die Latenz beim ersten Aufruf erhöht. Dies gilt nicht für GPU-Anbieter wie Groq oder Together AI, die stets betriebsbereite, gemeinsam genutzte Infrastruktur bereitstellen. Durch Angabe von :fastest oder eines benannten GPU-Anbieters in der Modell-ID wird diese Verzögerung vollständig vermieden.
Ist die HF-Inference-API mit dem OpenAI-Python-SDK kompatibel?
Ja, für Chat-Vervollständigungen. Legen Sie base_url="https://router.huggingface.co/v1" fest und übergeben Sie Ihr HF-Token als api_key. Der /v1/chat/completions und /v1/models -Endpunkte sind OpenAI-kompatibel. Für andere Aufgabentypen – Embeddings, Bildgenerierung, Sprachverarbeitung – benötigen Sie das huggingface_hub Python-Bibliothek oder das @huggingface/inference JS-SDK; diese Funktionen werden vom OpenAI-kompatiblen Endpunkt nicht abgedeckt.
Kann ich ein feinjustiertes Modell über die Inference API bereitstellen?
Nein, nicht über Inference Providers – dieser Dienst stellt ausschließlich Modelle bereit, die im öffentlichen Hub-Katalog verfügbar sind und von einem Partneranbieter unterstützt werden. Für ein privates oder feinjustiertes Modell stellen Sie stattdessen einen dedizierten Inference Endpoint bereit, der private Hub-Repositories unterstützt und Ihnen ermöglicht, eigene Modellgewichte auf einer von Ihnen kontrollierten GPU-Instanz einzusetzen.
Wie kann ich Kosten verfolgen und steuern?
Ihre detaillierte Nutzungsaufschlüsselung nach Modell und Anbieter finden Sie unter huggingface.co/settings/inference-providers/overview. Team- und Enterprise-Administratoren können Ausgabenobergrenzen festlegen und bestimmte Anbieter über die Organisations-Einstellungsseite deaktivieren. Für vorausschauende Kostenabschätzungen vor Projektbeginn nutzen Sie den API-Kostenrechner.

