- L’API d’inférence Hugging Face — désormais officiellement dénommée Fournisseurs d’inférence — achemine les requêtes vers Groq, Together AI, Fireworks, Cerebras et d’autres prestataires via un seul jeton HF à l’adresse
https://router.huggingface.co/v1. - Niveau gratuit : 0,10 $/mois en crédits pour les comptes gratuits,2,00 $/mois pour les utilisateurs PRO. Hugging Face applique les tarifs des fournisseurs sans majoration.
- L’ancien fournisseur
hf-inference(l’API serverless initiale) se concentre désormais sur l’inférence basée sur CPU ; les modèles nécessitant un GPU sont routés vers des fournisseurs tiers disposant de capacités « chaudes » (warm capacity). - Utilisez des Points de terminaison d’inférence dédiés lorsque vous avez besoin d’un modèle privé ou affiné, d’une capacité GPU garantie ou d’une latence constante — à partir de 0,50 $/heure pour une NVIDIA T4 sur AWS.
L’API d’inférence Hugging Face offre aux développeurs un accès REST à des centaines de modèles open-weight — LLM, modèles d’incorporation (embedding), générateurs d’images, modèles vocaux et classificateurs — sans qu’aucune infrastructure ne doive être provisionnée. Vous vous authentifiez avec un seul jeton HF, envoyez vos requêtes à la couche de routage d’Hugging Face, qui les transmet ensuite au fournisseur sous-jacent disposant du modèle déjà chargé et prêt à l’emploi. À compter de 2025, ce service porte officiellement le nom de Fournisseurs d’inférence, mais le flux d’authentification par jeton, l’URL de base et le mode d’utilisation fondamental restent identiques à ceux de l’API d’inférence initiale.
- Qu’est-ce que l’API d’inférence Hugging Face (et quels changements ont été apportés ?)
- Fonctionnement du routeur
- Authentification et première requête
- Niveau gratuit, crédits et suite à donner
- Démarrages à froid et le fournisseur hf-inference
- API d’inférence vs Points de terminaison d’inférence
- Comparaison des prix avec d’autres fournisseurs
- Cas où les points de terminaison dédiés ou l’hébergement en interne s’avèrent plus pertinents
- Questions fréquemment posées
Qu’est-ce que l’API d’inférence Hugging Face (et quels changements ont été apportés ?)
Initialement, l’« API d’inférence » désignait un service serverless hébergé par Hugging Face à l’adresse api-inference.huggingface.co et qui chargeait les modèles à la demande. Ce service existe toujours sous la forme du fournisseur hf-inference hf-inference
Pour l’inférence accélérée par GPU — grands LLM, génération d’images, reconnaissance vocale — Hugging Face a désormais recours à des fournisseurs partenaires : Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI, et d’autres. L’interface reste inchangée : un seul jeton, une seule URL de base, un format de requête compatible avec OpenAI. L’URL du routeur est https://router.huggingface.co/v1. L’ancienne URL api-inference.huggingface.co continue de traiter les appels hérités vers hf-inference, mais les nouvelles intégrations doivent cibler le routeur.
Fonctionnement du routeur
Lorsque vous envoyez une requête à router.huggingface.co, Hugging Face sélectionne un fournisseur selon une stratégie que vous ajoutez directement à l’identifiant du modèle :
| Suffixe de stratégie | Comportement |
|---|---|
:fastest (par défaut) | Fournisseur offrant le débit maximal actuellement disponible |
:cheapest | Prix le plus bas par jeton généré |
:preferred | Liste hiérarchisée de vos préférences, définie dans les paramètres HF |
:groq, :together, etc. | Force l’utilisation d’un fournisseur spécifique nommé |
Ajoutez la stratégie directement à la chaîne d’identifiant du modèle : "deepseek-ai/DeepSeek-R1:cheapest". L’absence de suffixe équivaut à utiliser la stratégie par défaut :fastest:fastest
Authentification et première requête
Aller à huggingface.co/settings/tokens, créez un jeton à granularité fine et activez la permission Effectuer des appels aux fournisseurs d’inférence . HF_TOKEN dans votre environnement.
Python — huggingface_hub
pip install huggingface_hubimport os
from huggingface_hub import InferenceClient
client = InferenceClient() # lit HF_TOKEN depuis l'environnement
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": "Expliquez la tokenisation en deux phrases."}],
)
print(completion.choices[0].message.content)Python — remplacement OpenAI
from openai import OpenAI
import os
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324:fastest",
messages=[{"role": "user", "content": "Expliquez la tokenisation en deux phrases."}],
)
print(completion.choices[0].message.content)cURL
curl https://router.huggingface.co/v1/chat/completions
-H "Authorization: Bearer $HF_TOKEN"
-H "Content-Type: application/json"
-d '{
"model": "deepseek-ai/DeepSeek-V3-0324:fastest",
"messages": [{"role": "user", "content": "Expliquez la tokenisation en deux phrases."}]
}'Le point de terminaison compatible avec OpenAI couvre uniquement les complétions conversationnelles. Pour d'autres tâches — génération d'images à partir de texte, calcul d'embeddings, reconnaissance vocale — utilisez la bibliothèque huggingface_hub en Python ou le SDK JavaScript @huggingface/inference qui gèrent automatiquement le formatage des requêtes spécifique à chaque fournisseur.
Niveau gratuit, crédits et suite à donner
Chaque compte Hugging Face bénéficie d'une allocation mensuelle de crédits, appliquée automatiquement aux requêtes acheminées via le routeur :
| Type de compte | Crédits mensuels | Facturation à l’usage après épuisement ? |
|---|---|---|
| Gratuit | 0,10 $ (sous réserve de modification) | Oui — nécessite l’achat de crédits supplémentaires |
| PRO | $2.00 | Oui |
| Équipe / Entreprise | 2,00 $ par utilisateur, mutualisés | Oui |
Une fois vos crédits épuisés, l’accès n’est pas interrompu — vous pouvez acheter des crédits supplémentaires pour continuer. Hugging Face vous facture au même tarif que le fournisseur, sans frais supplémentaires. Le coût d’une requête donnée dépend du modèle et du fournisseur ; vous pouvez suivre vos dépenses par modèle et par fournisseur sur huggingface.co/settings/inference-providers/overview.
Si vous possédez déjà un compte auprès d’un fournisseur spécifique, vous pouvez définir une clé de fournisseur personnalisée dans les paramètres de votre compte Hugging Face. Les requêtes passent toutefois toujours par le routeur HF, mais le fournisseur vous facture directement et vos crédits mensuels HF ne s’appliquent pas. Avant de vous engager sur un volume important, utilisez le Calculateur de coûts d’API pour estimer vos dépenses mensuelles en fonction du modèle et du volume de requêtes.
Démarrages à froid et le fournisseur hf-inference
L’ancien fournisseur hf-inference Les fournisseurs chargent les modèles à la demande. Lorsqu’un modèle n’a pas été sollicité récemment et qu’il est passé en mode inactif, la première requête déclenche son chargement avant que la réponse puisse commencer — c’est ce qu’on appelle un démarrage à froid (« cold start »). Cela ajoute une latence notable à ce premier appel.
À compter de juillet 2025, hf-inference se concentre sur l’inférence CPU : modèles d’embeddings, classificateurs, reconnaissance d’entités nommées (NER), petits modèles de langage. Les démarrages à froid sont particulièrement pertinents dans ce contexte.
Pour les charges de travail accélérées par GPU — grands modèles de langage (LLM), génération d’images — le routeur redirige vers des fournisseurs tiers comme Groq ou Together AI, qui exploitent des ressources GPU partagées préchargées (« warm »). Les démarrages à froid ne constituent pas un problème pour ces fournisseurs de la même manière, bien que vous partagiez la capacité disponible et que vous ne disposiez d’aucune garantie de débit lors des pics de trafic.
Si la latence liée au démarrage à froid ou la variabilité du débit sont inacceptables — par exemple pour un point de terminaison de production sensible à la latence — une instance dédiée « Inference Endpoint » constitue la solution adaptée.
API d’inférence vs Points de terminaison d’inférence
La plateforme Hugging Face propose deux produits distincts pour l’inférence. Ils partagent le même système de jetons et le même Model Hub, mais fonctionnent de façon très différente :
| Fournisseurs d’inférence (API) | Points de terminaison d’inférence (dédiés) | |
|---|---|---|
| Infrastructure | Partagée, gérée par des fournisseurs partenaires | Instance GPU dédiée dans la région de votre choix |
| Modèle de tarification | Facturation à l’appel, aux tarifs du fournisseur | Facturation à la minute tant que l’instance est en cours d’exécution ou d’initialisation |
| Démarrages à froid | Possibles pour les modèles CPU hf-inference | Aucun tant que le point de terminaison est actif |
| Modèles privés | Non — uniquement les modèles publics du Hub | Oui — dépôts privés et modèles affinés |
| Contrôle du matériel | Aucune | Choix du type et du nombre de GPU, ainsi que de la région |
| Coût minimal | 0 $ (dans la limite des crédits gratuits) | ~0,50 $/heure en fonctionnement (GPU NVIDIA T4 d’AWS) |
Les points de terminaison d’inférence sont facturés à la minute uniquement lorsqu’ils sont en état de fonctionnement ou ou d’initialisation — un point de terminaison en pause ne coûte rien. Les options GPU d’AWS vont d’un T4 à 0,50 $/heure (14 Go de VRAM) à un H200 à 5,00 $/heure par carte (141 Go de VRAM). Sur GCP, on trouve notamment le H100 à 10,00 $/heure par carte (80 Go de VRAM). Avant de choisir un niveau, utilisez le Calculateur de VRAM pour vérifier que votre modèle est compatible avec le GPU cible.
Comparaison des prix avec d’autres fournisseurs
Comme Hugging Face achemine les requêtes vers les mêmes fournisseurs sous-jacents — Together AI, Fireworks, DeepInfra, Groq — que vous pouvez également contacter directement ou via OpenRouter, les tarifs par jeton pour un modèle donné sont généralement identiques. Hugging Face n’applique aucun supplément.
Les différences pratiques :
- Crédits gratuits: Hugging Face accorde automatiquement 0,10 à 2,00 $ par mois sous forme de crédits utilisables gratuitement. Ni OpenRouter ni les fournisseurs directs n’offrent d’allocation mensuelle équivalente.
- Éventail de modèles: Les fournisseurs d’inférence de Hugging Face se concentrent sur les modèles à poids ouverts provenant du Hub. OpenRouter couvre également des modèles propriétaires (GPT-4o, Claude, Gemini). Si vous avez besoin d’un routeur prenant en charge à la fois des modèles ouverts et des modèles propriétaires, OpenRouter offre une couverture plus étendue.
- Tâches autres que le chat: Les embeddings, la génération d’images et la synthèse vocale sont disponibles via le SDK de Hugging Face. La plupart des routeurs concurrents ne prennent en charge que les complétions de chat.
- Regroupement facturation: Un seul compte Hugging Face couvre l’ensemble des fournisseurs, avec un tableau de bord unique pour suivre votre consommation. Les comptes fournis directement par chaque fournisseur nécessitent des relations de facturation distinctes.
Pour une comparaison complète des modèles en fonction de leur prix et de leurs capacités, consultez le Base de données des modèles IA qui recense les caractéristiques techniques et les tarifs des principaux modèles.
Cas où les points de terminaison dédiés ou l’hébergement en interne s’avèrent plus pertinents
Utilisez les fournisseurs d’inférence lorsque vous développez un prototype, que votre charge est variable ou imprévisible, et que vous avez besoin d’accéder à un vaste catalogue de modèles publics sans gérer d’infrastructures serveur.
Passez à un point de terminaison d’inférence dédié lorsque :
- Vous devez déployer un modèle affiné ou privé non disponible dans le catalogue public du Hub.
- Une latence constante est requise — les fournisseurs partagés peuvent présenter des temps de réponse variables sous charge.
- Vous avez besoin d’un débit garanti pour respecter un accord de niveau de service (SLA) en production.
Envisagez l’auto-hébergement lorsque votre volume d’appels est suffisamment élevé pour que le coût par jeton dépasse le coût amorti de l’achat de matériel, ou lorsque vos exigences en matière de confidentialité des données interdisent l’envoi d’entrées vers des API tierces. LeCalculateur de seuil de rentabilité entre hébergement local et utilisation d’une API fournit une comparaison concrète des coûts, basée sur votre volume de requêtes et la taille du modèle. Pour des recommandations matérielles si vous choisissez cette voie, consultez le meilleurs GPU pour exécuter localement des LLM.
Questions fréquemment posées
Quelle est la différence entre l’API d’inférence et les points de terminaison d’inférence ?
L’API d’inférence (désormais appelée « Fournisseurs d’inférence ») est un service partagé, facturé à l’utilisation, qui achemine les requêtes vers des fournisseurs tiers de GPU ainsi que vers l’infrastructure CPU propre à Hugging Face. Les points de terminaison d’inférence sont des instances GPU dédiées que vous provisionnez dans une région cloud ; elles exécutent en continu un seul modèle et sont facturées à la minute de disponibilité. Utilisez l’API pour les prototypes et les charges de travail variables ; utilisez les points de terminaison pour garantir une latence en production et pour déployer des modèles privés ou affinés.
Ai-je besoin d’un abonnement Pro pour utiliser l’API d’inférence ?
Non. Un compte gratuit vous donne droit à 0,10 $ de crédits par mois, ce qui suffit pour des expérimentations légères. Les abonnés Pro reçoivent 2,00 $ par mois. Les deux niveaux permettent d’acheter des crédits à l’unité dès que l’allocation mensuelle est épuisée. L’avantage principal de l’abonnement Pro en matière d’inférence réside dans le montant plus élevé de l’allocation mensuelle, et non dans un accès restreint aux modèles ou aux fournisseurs.
Pourquoi ma première requête est-elle nettement plus lente que les suivantes ?
Si vous acheminez vos requêtes vers le fournisseur hf-inference , les modèles sont chargés à la demande. Lorsqu’un modèle est resté inactif, il doit être chargé en mémoire avant que votre requête puisse aboutir, ce qui ajoute une latence à ce premier appel. Ce phénomène ne concerne pas les fournisseurs GPU tels que Groq ou Together AI, qui exploitent des infrastructures partagées toujours prêtes à l’emploi. Préciser :fastest ou un fournisseur GPU nommé dans l’identifiant du modèle permet d’éviter entièrement ce délai.
L’API d’inférence de Hugging Face est-elle compatible avec le SDK Python OpenAI ?
Oui, pour les complétions de chat. Définissez base_url="https://router.huggingface.co/v1" et transmettez votre jeton HF comme api_key. Le bloc /v1/chat/completions et /v1/models sont compatibles avec OpenAI. Pour les autres types de tâches — embeddings, génération d’images, synthèse vocale — vous devez utiliser le huggingface_hub en Python ou le SDK JavaScript @huggingface/inference SDK JavaScript ; ces fonctionnalités ne sont pas prises en charge par le point de terminaison compatible OpenAI.
Puis-je déployer un modèle affiné via l’API d’inférence ?
Non, pas via les fournisseurs d’inférence — ceux-ci ne servent que les modèles disponibles dans le catalogue public du Hub et pris en charge par un fournisseur partenaire. Pour un modèle privé ou affiné, déployez un point de terminaison d’inférence dédié, qui prend en charge les dépôts privés du Hub et vous permet d’utiliser vos propres poids de modèle sur une instance GPU que vous gérez.
Comment suivre et maîtriser mes coûts ?
Votre répartition détaillée de la consommation, par modèle et par fournisseur, est disponible à l’adresse huggingface.co/settings/inference-providers/overview. Les administrateurs d’équipes et d’entreprises peuvent définir des limites de dépense et désactiver certains fournisseurs depuis la page des paramètres organisationnels. Pour obtenir des estimations prospectives des coûts avant de commencer le développement, utilisez le Calculateur de coûts d’API.

