- La API de inferencia de Hugging Face —ahora oficialmente denominada Proveedores de inferencia — enruta las solicitudes a Groq, Together AI, Fireworks, Cerebras y otros mediante un único token de HF en
https://router.huggingface.co/v1. - Nivel gratuito: 10 centavos de dólar/mes en créditos para cuentas gratuitas,2,00 dólares/mes para usuarios PRO. Hugging Face transmite las tarifas de los proveedores sin recargo adicional.
- El proveedor heredado
hf-inference(la API serverless original) ahora se centra exclusivamente en inferencia basada en CPU; los modelos que requieren GPU se enrutan a proveedores externos con capacidad precalentada. - Utilice Puntos de conexión de inferencia dedicados cuando necesite un modelo privado o ajustado finamente, capacidad garantizada de GPU o latencia consistente —desde 0,50 USD/hora para una GPU NVIDIA T4 en AWS.
La API de inferencia de Hugging Face brinda a los desarrolladores acceso REST a cientos de modelos de código abierto —modelos de lenguaje de gran tamaño (LLM), modelos de incrustaciones (embeddings), generadores de imágenes, modelos de voz y clasificadores— sin necesidad de aprovisionar infraestructura alguna. Usted se autentica con un único token de HF, envía solicitudes a la capa de enrutamiento de Hugging Face y esta las redirige al proveedor subyacente que tenga el modelo ya cargado y listo para su uso. A partir de 2025, este servicio se denomina oficialmente Proveedores de inferencia, aunque el flujo de tokens, la URL base y el patrón fundamental de uso siguen siendo idénticos a los de la API de inferencia original.
- ¿Qué es la API de inferencia de Hugging Face (y qué ha cambiado?)
- Cómo funciona el enrutador
- Autenticación y su primera solicitud
- Nivel gratuito, créditos y qué ocurre a continuación
- Arranques en frío y el proveedor hf-inference
- API de inferencia frente a Puntos de conexión de inferencia
- Comparativa de precios con otros proveedores
- Cuándo resultan más ventajosos los puntos de conexión dedicados o el alojamiento propio
- Preguntas frecuentes
¿Qué es la API de inferencia de Hugging Face (y qué ha cambiado?)
Originalmente, la «API de inferencia» hacía referencia a un servicio serverless alojado por Hugging Face en api-inference.huggingface.co que cargaba los modelos bajo demanda. Ese servicio sigue existiendo como el proveedor hf-inference hf-inference
Para inferencia acelerada mediante GPU —LLMs grandes, generación de imágenes, procesamiento del habla— Hugging Face ahora enruta las solicitudes a través de proveedores asociados: Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI y otros. La interfaz permanece inalterada: un único token, una única URL base y un formato de solicitud compatible con OpenAI. La URL del enrutador es https://router.huggingface.co/v1. La antigua URL api-inference.huggingface.co sigue atendiendo llamadas heredadas a hf-inferencehf-inference
Cómo funciona el enrutador
Cuando usted envía una solicitud a router.huggingface.co, Hugging Face selecciona un proveedor según una política que usted adjunta al identificador del modelo:
| Sufijo de política | Comportamiento |
|---|---|
:fastest (predeterminado) | Proveedor con mayor rendimiento disponible actualmente |
:cheapest | Menor precio por token de salida |
:preferred | Lista de preferencias ordenadas desde la configuración de HF |
:groq, :together, etc. | Forzar un proveedor específico por nombre |
Adjunte directamente la política a la cadena de identificación del modelo: "deepseek-ai/DeepSeek-R1:cheapest". Si omite el sufijo, se aplica automáticamente la política :fastest:fastest
Autenticación y su primera solicitud
Ir a huggingface.co/settings/tokens, cree un token granular y habilite el permiso Realizar llamadas a proveedores de inferencia . Establezca dicho token como HF_TOKEN en su entorno.
Python — huggingface_hub
pip install huggingface_hubimport os
from huggingface_hub import InferenceClient
client = InferenceClient() # lee HF_TOKEN desde el entorno
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": "Explica la tokenización en dos frases."}],
)
print(completion.choices[0].message.content)Python — sustitución directa de OpenAI
from openai import OpenAI
import os
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324:fastest",
messages=[{"role": "user", "content": "Explica la tokenización en dos frases."}],
)
print(completion.choices[0].message.content)cURL
curl https://router.huggingface.co/v1/chat/completions
-H "Authorization: Bearer $HF_TOKEN"
-H "Content-Type: application/json"
-d '{
"model": "deepseek-ai/DeepSeek-V3-0324:fastest",
"messages": [{"role": "user", "content": "Explica la tokenización en dos frases."}]
}'El punto de conexión compatible con OpenAI cubre únicamente las finalizaciones de chat. Para otras tareas — como generación de imágenes a partir de texto, incrustaciones (embeddings) y conversión de voz a texto — utilice la biblioteca huggingface_hub de Python o el SDK de JavaScript @huggingface/inference , que gestionan automáticamente el formato específico de las solicitudes según el proveedor.
Nivel gratuito, créditos y qué ocurre a continuación
Cada cuenta de Hugging Face recibe una asignación mensual de créditos que se aplica automáticamente a las solicitudes enrutadas:
| Tipo de cuenta | Créditos mensuales | ¿Pago por uso tras agotarse los créditos? |
|---|---|---|
| Gratis | 0,10 USD (sujeto a cambios) | Sí — requiere la compra de créditos adicionales |
| PRO | $2.00 | Sí |
| Equipo / Empresa | 2,00 USD por usuario, compartidos en un grupo | Sí |
Una vez que se agoten sus créditos, el acceso no se interrumpe: puede comprar créditos adicionales para continuar. Hugging Face le cobra exactamente la misma tarifa que el proveedor le cobra a él, sin ningún cargo adicional. El costo de una solicitud determinada depende del modelo y del proveedor; puede hacer un seguimiento de los gastos por modelo y por proveedor en huggingface.co/settings/inference-providers/overview.
Si ya tiene cuentas con un proveedor específico, puede configurar una clave personalizada de proveedor en la configuración de Hugging Face. Las solicitudes siguen pasando por Hugging Face, pero el proveedor le facturará directamente y sus créditos mensuales de Hugging Face no serán aplicables. Antes de comprometerse con un volumen determinado, utilice la Calculadora de costos de API calculadora de costos
Arranques en frío y el proveedor hf-inference
El proveedor heredado hf-inference Los proveedores cargan los modelos bajo demanda. Cuando un modelo no ha sido invocado recientemente y ha entrado en estado inactivo, la primera solicitud desencadena la carga del modelo antes de que pueda comenzar a generar la respuesta: es lo que se conoce como arranque en frío (cold start). Esto añade una latencia notable a esa primera llamada.
A partir de julio de 2025, hf-inference Hugging Face se centra en la inferencia en CPU: modelos de incrustaciones (embeddings), clasificadores, reconocimiento de entidades nombradas (NER) y modelos de texto más pequeños. Los arranques en frío son especialmente relevantes en este contexto.
Para cargas de trabajo aceleradas por GPU — como grandes modelos de lenguaje (LLM) o generación de imágenes — el enrutador envía las solicitudes a proveedores externos como Groq o Together AI, que operan GPU compartidas y siempre listas («calientes»). En estos casos, los arranques en frío no constituyen un problema, aunque sí comparte la capacidad con otros usuarios y no hay garantía de rendimiento durante picos de tráfico.
Si la latencia derivada del arranque en frío o la variabilidad del rendimiento resultan inaceptables —por ejemplo, para un punto de conexión de producción sensible a la latencia—, la solución es utilizar un Punto de conexión de inferencia dedicado (Inference Endpoint).
API de inferencia frente a Puntos de conexión de inferencia
La plataforma de Hugging Face ofrece dos productos distintos para inferencia. Comparten el mismo sistema de tokens y el mismo repositorio de modelos (Model Hub), pero funcionan de forma muy diferente:
| Proveedores de inferencia (API) | Puntos de conexión de inferencia (dedicados) | |
|---|---|---|
| Infraestructura | Compartida, gestionada por proveedores asociados | Instancia dedicada de GPU en la región de su elección |
| Modelo de precios | Pago por solicitud, según las tarifas del proveedor | Facturación por minuto mientras el punto de conexión esté en ejecución o inicializándose |
| Arranques en frío | Posibles en los modelos de CPU de hf-inference | Ninguno mientras el punto de conexión esté en ejecución |
| Modelos privados | No — solo modelos públicos del Hub | Sí — repositorios privados y modelos ajustados (fine-tuned) |
| Control del hardware | Ninguna | Elija tipo y cantidad de GPU, así como la región |
| Costo mínimo | 0 USD (dentro de los créditos gratuitos) | ~0,50 USD/hora en ejecución (GPU NVIDIA T4 de AWS) |
Los Puntos de conexión de inferencia se facturan por minuto únicamente mientras estén en estado de ejecución o o inicialización — los puntos de conexión en pausa no generan ningún costo. Las opciones de GPU de AWS van desde una T4 a 0,50 USD/hora (14 GB de VRAM) hasta una H200 a 5,00 USD/hora por tarjeta (141 GB de VRAM). En GCP están disponibles las H100 a 10,00 USD/hora por tarjeta (80 GB de VRAM). Antes de seleccionar una categoría, utilice la Calculadora de VRAM calculadora de compatibilidad de hardware
Comparativa de precios con otros proveedores
Dado que Hugging Face enruta las solicitudes a los mismos proveedores subyacentes —Together AI, Fireworks, DeepInfra y Groq— a los que también puede acceder directamente o mediante OpenRouter, las tarifas por token para un modelo determinado suelen ser idénticas. Hugging Face no aplica ningún recargo adicional.
Diferencias prácticas:
- Créditos gratuitos: Hugging Face otorga automáticamente créditos gratuitos por valor de 0,10–2,00 USD/mes. OpenRouter y los proveedores directos no ofrecen una asignación mensual equivalente.
- Amplitud de modelos: Los Proveedores de inferencia de HF se centran en modelos de pesos abiertos procedentes del Hub. OpenRouter también incluye modelos de código cerrado (GPT-4o, Claude, Gemini). Si necesita tanto modelos abiertos como propietarios en un único enrutador, OpenRouter ofrece una cobertura más amplia.
- Tareas distintas de chat: Las incrustaciones (embeddings), la generación de imágenes y el procesamiento del habla están disponibles mediante el SDK de HF. La mayoría de los enrutadores competidores solo admiten finalizaciones de chat.
- Consolidación de facturación: Una sola cuenta de HF cubre todos los proveedores, con un panel unificado de uso. Las cuentas de proveedores directos requieren relaciones de facturación independientes para cada uno.
Para una comparación completa de modelos según precio y funcionalidad, consulte la Base de datos de modelos de IA que detalla las especificaciones y precios de los principales modelos.
Cuándo resultan más ventajosos los puntos de conexión dedicados o el alojamiento propio
Utilice los Proveedores de inferencia cuando esté realizando prototipos, tenga cargas variables o impredecibles y necesite acceder a un amplio catálogo público de modelos sin gestionar servidores.
Cambie a un Punto de conexión de inferencia dedicado cuando:
- Necesite desplegar un modelo ajustado o privado que no esté disponible en el Hub público.
- La consistencia de la latencia sea un requisito: los proveedores compartidos pueden presentar tiempos de respuesta variables bajo carga.
- Necesite un rendimiento garantizado para cumplir con un acuerdo de nivel de servicio (SLA) en producción.
Considere el autohospedaje cuando su volumen de llamadas sea lo suficientemente alto como para que el costo por token supere el costo amortizado de poseer hardware propio, o cuando los requisitos de privacidad de los datos impidan enviar entradas a APIs de terceros. Lacalculadora de punto de equilibrio entre alojamiento local y uso de API ofrece una comparación de costos concretos basada en su volumen de solicitudes y el tamaño del modelo. Para recomendaciones de hardware si decide seguir este camino, consulte la mejores GPUs para ejecutar LLMs localmente.
Preguntas frecuentes
¿Cuál es la diferencia entre la API de inferencia y los puntos de conexión de inferencia?
La API de inferencia (ahora denominada Proveedores de inferencia) es un servicio compartido de pago por solicitud que enruta las peticiones a proveedores externos de GPUs y a la infraestructura propia de CPUs de HF. Los puntos de conexión de inferencia son instancias dedicadas de GPU que usted aprovisiona en una región de nube; ejecutan continuamente un único modelo y se facturan por minuto de tiempo activo. Utilice la API para prototipos y cargas de trabajo variables; utilice los puntos de conexión para garantías de latencia en producción y para modelos privados o ajustados.
¿Necesito una suscripción Pro para usar la API de inferencia?
No. Una cuenta gratuita incluye créditos por valor de 0,10 USD/mes, suficientes para experimentación ligera. Los suscriptores PRO reciben 2,00 USD/mes. Ambos niveles permiten comprar créditos adicionales bajo demanda una vez agotada la asignación mensual. La principal ventaja de la suscripción PRO en cuanto a inferencia es la mayor cantidad mensual de créditos, no un acceso restringido a modelos o proveedores.
¿Por qué mi primera solicitud es mucho más lenta que las posteriores?
Si está redirigiendo a un proveedor de hf-inference este carga los modelos bajo demanda. Un modelo que ha estado inactivo debe cargarse en memoria antes de que su solicitud pueda completarse, lo que añade latencia a esa primera llamada. Esto no aplica a proveedores GPU como Groq o Together AI, que operan infraestructuras compartidas siempre activas («warm»). Especificar :fastest o un proveedor GPU con nombre en el identificador del modelo evitará completamente este retraso.
¿Es compatible la API de inferencia de HF con el SDK de Python de OpenAI?
Sí, para finalizaciones de chat. Establezca base_url="https://router.huggingface.co/v1" y pase su token de HF como api_key. El bloque /v1/chat/completions y /v1/models Los puntos de conexión son compatibles con OpenAI. Para otros tipos de tareas —incrustaciones (embeddings), generación de imágenes y síntesis de voz— debe utilizar el huggingface_hub de Python o el SDK de JavaScript @huggingface/inference SDK de JavaScript; estas tareas no están cubiertas por el punto de conexión compatible con OpenAI.
¿Puedo desplegar un modelo ajustado mediante la API de inferencia?
No mediante los Proveedores de inferencia: estos únicamente sirven modelos disponibles en el catálogo público del Hub y compatibles con un proveedor asociado. Para un modelo privado o ajustado, implemente un punto de conexión de inferencia dedicado, que admite repositorios privados del Hub y le permite llevar sus propios pesos de modelo a una instancia GPU bajo su control.
¿Cómo hago un seguimiento y controlo los costos?
Su desglose de uso por modelo y proveedor se encuentra en huggingface.co/settings/inference-providers/overview. Los administradores de equipos y empresas pueden establecer límites de gasto y desactivar proveedores específicos desde la página de configuración de la organización. Para estimaciones anticipadas de costos antes de comenzar a desarrollar, utilice la Calculadora de costos de API.

