Thursday, 13 August 2026 | Updating Daily AI insight, written for builders

API di inferenza di Hugging Face: come funziona, quanto costa e quando utilizzarla

  • L'API di inferenza di Hugging Face — ora ufficialmente denominata Provider di inferenza — instrada le richieste a Groq, Together AI, Fireworks, Cerebras e altri tramite un singolo token HF all’indirizzo https://router.huggingface.co/v1.
  • Livello gratuito: $0,10/mese in crediti per gli account gratuiti,$2,00/mese per gli utenti PRO. Hugging Face applica le tariffe dei provider senza alcun sovrapprezzo.
  • Il legacy hf-inference (l’originale API serverless) si concentra ora sull’inferenza su CPU; i modelli GPU vengono instradati verso provider di terze parti con capacità già pronta (warm capacity).
  • Utilizza dedicati Endpoint di inferenza quando hai bisogno di un modello privato o fine-tuned, di capacità GPU garantita o di latenza costante — a partire da $0,50/ora per una NVIDIA T4 su AWS.

L’API di inferenza di Hugging Face offre agli sviluppatori accesso REST a centinaia di modelli open-weight — LLM, modelli di embedding, generatori di immagini, modelli vocali e classificatori — senza dover provisionare alcuna infrastruttura. Ti autentichi con un singolo token HF, invii le richieste al livello di routing di Hugging Face e quest’ultimo le instrada al provider sottostante che ha il modello già caricato e pronto all’uso. A partire dal 2025, questo servizio è ufficialmente denominato Provider di inferenza, ma il flusso del token, l’URL base e il modello fondamentale di utilizzo rimangono identici rispetto all’originale API di inferenza.

Che cos’è l’API di inferenza di Hugging Face (e cosa è cambiato)

In origine, l’«API di inferenza» indicava un servizio serverless ospitato da Hugging Face all’indirizzo api-inference.huggingface.co che caricava i modelli su richiesta. Questo servizio esiste ancora come provider hf-inference ma, a partire da luglio 2025, si concentra sull’inferenza su CPU: embedding, classificazione testuale, riconoscimento delle entità nominate (NER), summarization e modelli storici più piccoli come BERT o GPT-2.

Per l’inferenza accelerata su GPU — LLM di grandi dimensioni, generazione di immagini, elaborazione vocale — Hugging Face instrada ora le richieste attraverso provider partner: Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI e altri. L’interfaccia non cambia: un unico token, un unico URL base e un formato di richiesta compatibile con OpenAI. L’URL del router è https://router.huggingface.co/v1. Il vecchio URL api-inference.huggingface.co gestisce ancora le chiamate legacy a hf-inference, ma le nuove integrazioni devono puntare al router.

Come funziona il router

Quando invii una richiesta a router.huggingface.co, Hugging Face seleziona un provider in base a una politica che aggiungi direttamente all’ID del modello:

Suffisso della politicaComportamento
:fastest (predefinito)Provider con la maggiore velocità di elaborazione attualmente disponibile
:cheapestPrezzo più basso per token di output
:preferredElenco ordinato delle tue preferenze impostato nelle impostazioni di HF
:groq, :together, ecc.Forza un provider specifico nominato

Aggiungi la politica direttamente alla stringa dell’ID del modello: "deepseek-ai/DeepSeek-R1:cheapest". Se non specifichi alcun suffisso, viene applicata automaticamente la politica :fastest. È previsto il failover automatico: se il provider selezionato viene segnalato come non disponibile, il router lo sostituisce con un’alternativa.

Autenticazione e prima richiesta

Vai a huggingface.co/settings/tokens, crea un token granulare e abilita l’autorizzazione Effettua chiamate ai provider di inferenza . Impostalo come HF_TOKEN nel tuo ambiente.

Python — huggingface_hub

pip install huggingface_hub
import os
from huggingface_hub import InferenceClient

client = InferenceClient()  # legge HF_TOKEN dall'ambiente

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": "Spiega la tokenizzazione in due frasi."}],
)
print(completion.choices[0].message.content)

Python — sostituto OpenAI

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://router.huggingface.co/v1",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324:fastest",
    messages=[{"role": "user", "content": "Spiega la tokenizzazione in due frasi."}],
)
print(completion.choices[0].message.content)

cURL

curl https://router.huggingface.co/v1/chat/completions 
  -H "Authorization: Bearer $HF_TOKEN" 
  -H "Content-Type: application/json" 
  -d '{
    "model": "deepseek-ai/DeepSeek-V3-0324:fastest",
    "messages": [{"role": "user", "content": "Spiega la tokenizzazione in due frasi."}]
  }'

L’endpoint compatibile con OpenAI supporta esclusivamente le chat completion. Per altre attività — generazione di immagini da testo, embedding, riconoscimento vocale — utilizza la libreria huggingface_hub per Python oppure @huggingface/inference SDK JavaScript, che gestiscono automaticamente la formattazione delle richieste specifica per ciascun fornitore.

Livello gratuito, crediti e cosa succede successivamente

Ogni account Hugging Face riceve un credito mensile che viene applicato automaticamente alle richieste instradate:

Tipo di accountCredito mensileCosti aggiuntivi a consumo dopo l’esaurimento?
Gratuito0,10 USD (soggetto a modifiche)Sì — richiede l’acquisto di crediti aggiuntivi
PRO$2.00
Team / Enterprise2,00 USD per utente, condiviso tra i membri del team

Una volta esauriti i crediti, l’accesso non viene interrotto: puoi acquistare ulteriori crediti per continuare. Hugging Face ti addebita esattamente la stessa tariffa applicata dal fornitore, senza alcun sovrapprezzo. Il costo di una singola richiesta dipende dal modello e dal fornitore; puoi monitorare le spese dettagliate per modello e fornitore su huggingface.co/settings/inference-providers/overview.

Se possiedi già account presso un fornitore specifico, puoi impostare una chiave personalizzata del fornitore nelle impostazioni di HF. Le richieste vengono comunque instradate tramite HF, ma il fornitore ti fatturerà direttamente e i tuoi crediti mensili HF non verranno applicati. Prima di impegnarti su volumi elevati, utilizza il Calcolatore dei costi API calcolatore di spesa mensile

Avvii a freddo (cold starts) e il provider hf-inference

Il legacy hf-inference I fornitori caricano i modelli su richiesta. Quando un modello non è stato chiamato di recente ed è entrato in uno stato di inattività, la prima richiesta ne attiva il caricamento prima che possa iniziare la risposta — si tratta di un avvio a freddo (cold start). Ciò comporta un aumento percettibile della latenza per tale prima chiamata.

A partire da luglio 2025, hf-inference si concentra sull’inferenza su CPU: modelli di embedding, classificatori, estrazione di entità nominate (NER) e modelli testuali più piccoli. Gli avvii a freddo sono particolarmente rilevanti in questo contesto.

Per carichi di lavoro accelerati da GPU — grandi modelli linguistici (LLM), generazione di immagini — il router instrada le richieste verso fornitori di terze parti come Groq o Together AI, che gestiscono GPU condivise sempre pronte all’uso (warm). In questi casi gli avvii a freddo non rappresentano un problema, sebbene la capacità sia condivisa e non vi sia alcuna garanzia di throughput durante i picchi di traffico.

Se la latenza dovuta agli avvii a freddo o la variabilità del throughput sono inaccettabili — ad esempio per un endpoint di produzione sensibile alla latenza — la soluzione ideale è un Inference Endpoint dedicato.

API di inferenza vs Endpoint di inferenza

La piattaforma Hugging Face offre due prodotti distinti per l’inferenza. Condividono lo stesso sistema di token e il Model Hub, ma operano in modo molto diverso:

Inference Providers (API)Inference Endpoints (Dedicati)
InfrastrutturaCondivisa, gestita da fornitori partnerIstanza GPU dedicata nella regione da te scelta
Modello di pricingA pagamento per richiesta, ai prezzi dei fornitoriFatturazione al minuto mentre l’endpoint è in esecuzione o in fase di inizializzazione
Avvii a freddoPossibili sui modelli CPU hf-inferenceAssenti finché l’endpoint è in esecuzione
Modelli privatiNo — solo modelli pubblici del HubSì — repository privati e modelli fine-tuned
Controllo dell’hardwareNessunoScelta del tipo e del numero di GPU, nonché della regione
Costo minimo0 USD (entro i crediti gratuiti)~0,50 USD/ora in esecuzione (GPU NVIDIA T4 di AWS)

Gli Inference Endpoints vengono fatturati al minuto solo quando si trovano nello stato di esecuzione o inizializzazione — gli endpoint in pausa non generano alcun costo. Le opzioni GPU di AWS vanno dalla T4 a 0,50 USD/ora (14 GB di VRAM) fino all’H200 a 5,00 USD/ora per scheda (141 GB di VRAM). Su GCP sono disponibili le H100 a 10,00 USD/ora per scheda (80 GB di VRAM). Prima di scegliere una fascia, utilizza il Calcolatore VRAM verificatore di compatibilità GPU

Confronto dei prezzi con altri provider

Poiché Hugging Face instrada le richieste verso gli stessi fornitori sottostanti — Together AI, Fireworks, DeepInfra, Groq — che puoi contattare anche direttamente o tramite OpenRouter, le tariffe per token di un dato modello sono generalmente identiche. Hugging Face non applica alcun markup.

Le differenze pratiche:

  • Crediti gratuiti: Hugging Face offre automaticamente $0,10–$2,00/mese di utilizzo gratuito. OpenRouter e i provider diretti non prevedono alcun equivalente credito mensile.
  • Ampiezza dei modelli: I provider di inferenza di Hugging Face si concentrano sui modelli a pesi aperti disponibili sull’Hugging Face Hub. OpenRouter copre invece anche modelli proprietari (GPT-4o, Claude, Gemini). Se hai bisogno di un router che supporti sia modelli open source che proprietari, OpenRouter offre una copertura più ampia.
  • Attività non conversazionali: Embedding, generazione di immagini e sintesi vocale sono disponibili tramite l’SDK di Hugging Face. La maggior parte degli altri router supporta esclusivamente il completamento di chat.
  • Consolidamento della fatturazione: Un singolo account Hugging Face copre tutti i provider, con un’unica dashboard per il monitoraggio dell’utilizzo. Gli account presso i provider diretti richiedono invece relazioni di fatturazione separate per ciascuno di essi.

Per un confronto completo dei modelli in termini di prezzo e capacità, consulta la Database di modelli IA che illustra specifiche e prezzi relativi ai principali modelli.

Quando conviene optare per endpoint dedicati o self-hosting

Utilizza i provider di inferenza quando stai effettuando prototipi, hai carichi variabili o imprevedibili e hai bisogno di accedere a un ampio catalogo di modelli pubblici senza dover gestire server.

Passa a un endpoint di inferenza dedicato quando:

  • Devi distribuire un modello fine-tuned o privato non disponibile sul Hub pubblico.
  • La coerenza della latenza è un requisito fondamentale: i provider condivisi possono presentare tempi di risposta variabili in condizioni di carico elevato.
  • Hai bisogno di throughput garantito per soddisfare un accordo di livello di servizio (SLA) in produzione.

Valuta l’auto-hosting quando il volume delle tue chiamate è tale che il costo per token supera il costo ammortizzato dell’acquisto dell’hardware, oppure quando i requisiti di privacy dei dati impediscono di inviare gli input ad API di terze parti. IlCalcolatore del punto di pareggio tra auto-hosting e utilizzo di API fornisce un confronto di costi concreto basato sul tuo volume di richieste e sulla dimensione del modello. Per raccomandazioni hardware, nel caso tu scelga questa strada, consulta la migliori GPU per eseguire LLM localmente.

Domande frequenti

Qual è la differenza tra l’API di inferenza e gli endpoint di inferenza?

L’API di inferenza (ora denominata Inference Providers) è un servizio condiviso a pagamento per ogni richiesta, che instrada le chiamate verso provider GPU partner e l’infrastruttura CPU di Hugging Face. Gli endpoint di inferenza sono invece istanze GPU dedicate che provisioni in una regione cloud; eseguono continuativamente un singolo modello ed sono fatturati al minuto di uptime. Utilizza l’API per prototipi e carichi di lavoro variabili; usa gli endpoint per garanzie di latenza in produzione e per modelli privati o fine-tuned.

È necessario un abbonamento Pro per utilizzare l’API di inferenza?

No. Un account gratuito include $0,10/mese di crediti, sufficienti per sperimentazioni leggere. Gli abbonati PRO ricevono $2,00/mese. Entrambi i piani consentono acquisti aggiuntivi di crediti a consumo una volta esaurito il credito mensile. Il principale vantaggio dell’abbonamento PRO in termini di inferenza è l’importo maggiore del credito mensile, non l’accesso esclusivo a modelli o provider.

Perché la mia prima richiesta è molto più lenta delle successive?

Se stai instradando la richiesta al provider hf-inference , i modelli vengono caricati su richiesta. Un modello rimasto inattivo deve essere caricato in memoria prima che la tua richiesta possa essere completata, causando un ritardo nella prima chiamata. Questo non si verifica con provider GPU come Groq o Together AI, che utilizzano infrastrutture condivise sempre attive (‘warm’). Specificare :fastest oppure un provider GPU nominato nell’ID del modello elimina completamente questo ritardo.

L’API di inferenza di Hugging Face è compatibile con l’SDK Python di OpenAI?

Sì, per i completamenti di chat. Imposta base_url="https://router.huggingface.co/v1" e passa il tuo token HF come api_key. Il blocco /v1/chat/completions e /v1/models gli endpoint sono compatibili con OpenAI. Per gli altri tipi di attività — embedding, generazione di immagini, sintesi vocale — devi utilizzare l’ huggingface_hub per Python oppure @huggingface/inference SDK JavaScript; queste funzionalità non sono supportate dall’endpoint compatibile con OpenAI.

Posso distribuire un modello fine-tuned tramite l’API di inferenza?

No, non tramite Inference Providers: questo servizio supporta esclusivamente i modelli disponibili nel catalogo pubblico dell’Hub e compatibili con un provider partner. Per un modello privato o fine-tuned, distribuisci un endpoint di inferenza dedicato, che supporta repository privati sull’Hub e ti consente di utilizzare i tuoi pesi di modello su un’istanza GPU sotto il tuo controllo.

Come posso monitorare e controllare i costi?

Il dettaglio del tuo utilizzo suddiviso per modello e provider è disponibile su huggingface.co/settings/inference-providers/overview. Gli amministratori di team ed Enterprise possono impostare limiti di spesa e disabilitare provider specifici dalla pagina delle impostazioni dell’organizzazione. Per stime preventive dei costi prima di iniziare lo sviluppo, utilizza il Calcolatore dei costi API.

Scritto da Mustafa Ihsan

Mustafa Ihsan è il fondatore e redattore di Convly.ai. Ha creato e gestisce il database in tempo reale dei modelli IA del sito, il suo indice prezzo-prestazioni e i suoi calcolatori gratuiti per i requisiti di VRAM, i costi delle API e l'economia dell'auto-hosting. Scrive di prezzi dei modelli, risultati di benchmark e dell'hardware necessario per eseguire modelli IA in locale, privilegiando sempre dati misurati rispetto alle affermazioni dei produttori.

Scroll to Top
Featured on There's An AI For That