Thursday, 13 August 2026 | Updating Daily AI insight, written for builders

API de inferencia de Hugging Face: cómo funciona, cuánto cuesta y cuándo usarla

  • La API de inferencia de Hugging Face —ahora oficialmente denominada Proveedores de inferencia — enruta las solicitudes a Groq, Together AI, Fireworks, Cerebras y otros mediante un único token de HF en https://router.huggingface.co/v1.
  • Nivel gratuito: 10 centavos de dólar/mes en créditos para cuentas gratuitas,2,00 dólares/mes para usuarios PRO. Hugging Face transmite las tarifas de los proveedores sin recargo adicional.
  • El proveedor heredado hf-inference (la API serverless original) ahora se centra exclusivamente en inferencia basada en CPU; los modelos que requieren GPU se enrutan a proveedores externos con capacidad precalentada.
  • Utilice Puntos de conexión de inferencia dedicados cuando necesite un modelo privado o ajustado finamente, capacidad garantizada de GPU o latencia consistente —desde 0,50 USD/hora para una GPU NVIDIA T4 en AWS.

La API de inferencia de Hugging Face brinda a los desarrolladores acceso REST a cientos de modelos de código abierto —modelos de lenguaje de gran tamaño (LLM), modelos de incrustaciones (embeddings), generadores de imágenes, modelos de voz y clasificadores— sin necesidad de aprovisionar infraestructura alguna. Usted se autentica con un único token de HF, envía solicitudes a la capa de enrutamiento de Hugging Face y esta las redirige al proveedor subyacente que tenga el modelo ya cargado y listo para su uso. A partir de 2025, este servicio se denomina oficialmente Proveedores de inferencia, aunque el flujo de tokens, la URL base y el patrón fundamental de uso siguen siendo idénticos a los de la API de inferencia original.

¿Qué es la API de inferencia de Hugging Face (y qué ha cambiado?)

Originalmente, la «API de inferencia» hacía referencia a un servicio serverless alojado por Hugging Face en api-inference.huggingface.co que cargaba los modelos bajo demanda. Ese servicio sigue existiendo como el proveedor hf-inference hf-inference

Para inferencia acelerada mediante GPU —LLMs grandes, generación de imágenes, procesamiento del habla— Hugging Face ahora enruta las solicitudes a través de proveedores asociados: Groq, Together AI, Fireworks, Cerebras, DeepInfra, Replicate, Fal AI y otros. La interfaz permanece inalterada: un único token, una única URL base y un formato de solicitud compatible con OpenAI. La URL del enrutador es https://router.huggingface.co/v1. La antigua URL api-inference.huggingface.co sigue atendiendo llamadas heredadas a hf-inferencehf-inference

Cómo funciona el enrutador

Cuando usted envía una solicitud a router.huggingface.co, Hugging Face selecciona un proveedor según una política que usted adjunta al identificador del modelo:

Sufijo de políticaComportamiento
:fastest (predeterminado)Proveedor con mayor rendimiento disponible actualmente
:cheapestMenor precio por token de salida
:preferredLista de preferencias ordenadas desde la configuración de HF
:groq, :together, etc.Forzar un proveedor específico por nombre

Adjunte directamente la política a la cadena de identificación del modelo: "deepseek-ai/DeepSeek-R1:cheapest". Si omite el sufijo, se aplica automáticamente la política :fastest:fastest

Autenticación y su primera solicitud

Ir a huggingface.co/settings/tokens, cree un token granular y habilite el permiso Realizar llamadas a proveedores de inferencia . Establezca dicho token como HF_TOKEN en su entorno.

Python — huggingface_hub

pip install huggingface_hub
import os
from huggingface_hub import InferenceClient

client = InferenceClient()  # lee HF_TOKEN desde el entorno

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": "Explica la tokenización en dos frases."}],
)
print(completion.choices[0].message.content)

Python — sustitución directa de OpenAI

from openai import OpenAI
import os

client = OpenAI(
    base_url="https://router.huggingface.co/v1",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324:fastest",
    messages=[{"role": "user", "content": "Explica la tokenización en dos frases."}],
)
print(completion.choices[0].message.content)

cURL

curl https://router.huggingface.co/v1/chat/completions 
  -H "Authorization: Bearer $HF_TOKEN" 
  -H "Content-Type: application/json" 
  -d '{
    "model": "deepseek-ai/DeepSeek-V3-0324:fastest",
    "messages": [{"role": "user", "content": "Explica la tokenización en dos frases."}]
  }'

El punto de conexión compatible con OpenAI cubre únicamente las finalizaciones de chat. Para otras tareas — como generación de imágenes a partir de texto, incrustaciones (embeddings) y conversión de voz a texto — utilice la biblioteca huggingface_hub de Python o el SDK de JavaScript @huggingface/inference , que gestionan automáticamente el formato específico de las solicitudes según el proveedor.

Nivel gratuito, créditos y qué ocurre a continuación

Cada cuenta de Hugging Face recibe una asignación mensual de créditos que se aplica automáticamente a las solicitudes enrutadas:

Tipo de cuentaCréditos mensuales¿Pago por uso tras agotarse los créditos?
Gratis0,10 USD (sujeto a cambios)Sí — requiere la compra de créditos adicionales
PRO$2.00
Equipo / Empresa2,00 USD por usuario, compartidos en un grupo

Una vez que se agoten sus créditos, el acceso no se interrumpe: puede comprar créditos adicionales para continuar. Hugging Face le cobra exactamente la misma tarifa que el proveedor le cobra a él, sin ningún cargo adicional. El costo de una solicitud determinada depende del modelo y del proveedor; puede hacer un seguimiento de los gastos por modelo y por proveedor en huggingface.co/settings/inference-providers/overview.

Si ya tiene cuentas con un proveedor específico, puede configurar una clave personalizada de proveedor en la configuración de Hugging Face. Las solicitudes siguen pasando por Hugging Face, pero el proveedor le facturará directamente y sus créditos mensuales de Hugging Face no serán aplicables. Antes de comprometerse con un volumen determinado, utilice la Calculadora de costos de API calculadora de costos

Arranques en frío y el proveedor hf-inference

El proveedor heredado hf-inference Los proveedores cargan los modelos bajo demanda. Cuando un modelo no ha sido invocado recientemente y ha entrado en estado inactivo, la primera solicitud desencadena la carga del modelo antes de que pueda comenzar a generar la respuesta: es lo que se conoce como arranque en frío (cold start). Esto añade una latencia notable a esa primera llamada.

A partir de julio de 2025, hf-inference Hugging Face se centra en la inferencia en CPU: modelos de incrustaciones (embeddings), clasificadores, reconocimiento de entidades nombradas (NER) y modelos de texto más pequeños. Los arranques en frío son especialmente relevantes en este contexto.

Para cargas de trabajo aceleradas por GPU — como grandes modelos de lenguaje (LLM) o generación de imágenes — el enrutador envía las solicitudes a proveedores externos como Groq o Together AI, que operan GPU compartidas y siempre listas («calientes»). En estos casos, los arranques en frío no constituyen un problema, aunque sí comparte la capacidad con otros usuarios y no hay garantía de rendimiento durante picos de tráfico.

Si la latencia derivada del arranque en frío o la variabilidad del rendimiento resultan inaceptables —por ejemplo, para un punto de conexión de producción sensible a la latencia—, la solución es utilizar un Punto de conexión de inferencia dedicado (Inference Endpoint).

API de inferencia frente a Puntos de conexión de inferencia

La plataforma de Hugging Face ofrece dos productos distintos para inferencia. Comparten el mismo sistema de tokens y el mismo repositorio de modelos (Model Hub), pero funcionan de forma muy diferente:

Proveedores de inferencia (API)Puntos de conexión de inferencia (dedicados)
InfraestructuraCompartida, gestionada por proveedores asociadosInstancia dedicada de GPU en la región de su elección
Modelo de preciosPago por solicitud, según las tarifas del proveedorFacturación por minuto mientras el punto de conexión esté en ejecución o inicializándose
Arranques en fríoPosibles en los modelos de CPU de hf-inferenceNinguno mientras el punto de conexión esté en ejecución
Modelos privadosNo — solo modelos públicos del HubSí — repositorios privados y modelos ajustados (fine-tuned)
Control del hardwareNingunaElija tipo y cantidad de GPU, así como la región
Costo mínimo0 USD (dentro de los créditos gratuitos)~0,50 USD/hora en ejecución (GPU NVIDIA T4 de AWS)

Los Puntos de conexión de inferencia se facturan por minuto únicamente mientras estén en estado de ejecución o o inicialización — los puntos de conexión en pausa no generan ningún costo. Las opciones de GPU de AWS van desde una T4 a 0,50 USD/hora (14 GB de VRAM) hasta una H200 a 5,00 USD/hora por tarjeta (141 GB de VRAM). En GCP están disponibles las H100 a 10,00 USD/hora por tarjeta (80 GB de VRAM). Antes de seleccionar una categoría, utilice la Calculadora de VRAM calculadora de compatibilidad de hardware

Comparativa de precios con otros proveedores

Dado que Hugging Face enruta las solicitudes a los mismos proveedores subyacentes —Together AI, Fireworks, DeepInfra y Groq— a los que también puede acceder directamente o mediante OpenRouter, las tarifas por token para un modelo determinado suelen ser idénticas. Hugging Face no aplica ningún recargo adicional.

Diferencias prácticas:

  • Créditos gratuitos: Hugging Face otorga automáticamente créditos gratuitos por valor de 0,10–2,00 USD/mes. OpenRouter y los proveedores directos no ofrecen una asignación mensual equivalente.
  • Amplitud de modelos: Los Proveedores de inferencia de HF se centran en modelos de pesos abiertos procedentes del Hub. OpenRouter también incluye modelos de código cerrado (GPT-4o, Claude, Gemini). Si necesita tanto modelos abiertos como propietarios en un único enrutador, OpenRouter ofrece una cobertura más amplia.
  • Tareas distintas de chat: Las incrustaciones (embeddings), la generación de imágenes y el procesamiento del habla están disponibles mediante el SDK de HF. La mayoría de los enrutadores competidores solo admiten finalizaciones de chat.
  • Consolidación de facturación: Una sola cuenta de HF cubre todos los proveedores, con un panel unificado de uso. Las cuentas de proveedores directos requieren relaciones de facturación independientes para cada uno.

Para una comparación completa de modelos según precio y funcionalidad, consulte la Base de datos de modelos de IA que detalla las especificaciones y precios de los principales modelos.

Cuándo resultan más ventajosos los puntos de conexión dedicados o el alojamiento propio

Utilice los Proveedores de inferencia cuando esté realizando prototipos, tenga cargas variables o impredecibles y necesite acceder a un amplio catálogo público de modelos sin gestionar servidores.

Cambie a un Punto de conexión de inferencia dedicado cuando:

  • Necesite desplegar un modelo ajustado o privado que no esté disponible en el Hub público.
  • La consistencia de la latencia sea un requisito: los proveedores compartidos pueden presentar tiempos de respuesta variables bajo carga.
  • Necesite un rendimiento garantizado para cumplir con un acuerdo de nivel de servicio (SLA) en producción.

Considere el autohospedaje cuando su volumen de llamadas sea lo suficientemente alto como para que el costo por token supere el costo amortizado de poseer hardware propio, o cuando los requisitos de privacidad de los datos impidan enviar entradas a APIs de terceros. Lacalculadora de punto de equilibrio entre alojamiento local y uso de API ofrece una comparación de costos concretos basada en su volumen de solicitudes y el tamaño del modelo. Para recomendaciones de hardware si decide seguir este camino, consulte la mejores GPUs para ejecutar LLMs localmente.

Preguntas frecuentes

¿Cuál es la diferencia entre la API de inferencia y los puntos de conexión de inferencia?

La API de inferencia (ahora denominada Proveedores de inferencia) es un servicio compartido de pago por solicitud que enruta las peticiones a proveedores externos de GPUs y a la infraestructura propia de CPUs de HF. Los puntos de conexión de inferencia son instancias dedicadas de GPU que usted aprovisiona en una región de nube; ejecutan continuamente un único modelo y se facturan por minuto de tiempo activo. Utilice la API para prototipos y cargas de trabajo variables; utilice los puntos de conexión para garantías de latencia en producción y para modelos privados o ajustados.

¿Necesito una suscripción Pro para usar la API de inferencia?

No. Una cuenta gratuita incluye créditos por valor de 0,10 USD/mes, suficientes para experimentación ligera. Los suscriptores PRO reciben 2,00 USD/mes. Ambos niveles permiten comprar créditos adicionales bajo demanda una vez agotada la asignación mensual. La principal ventaja de la suscripción PRO en cuanto a inferencia es la mayor cantidad mensual de créditos, no un acceso restringido a modelos o proveedores.

¿Por qué mi primera solicitud es mucho más lenta que las posteriores?

Si está redirigiendo a un proveedor de hf-inference este carga los modelos bajo demanda. Un modelo que ha estado inactivo debe cargarse en memoria antes de que su solicitud pueda completarse, lo que añade latencia a esa primera llamada. Esto no aplica a proveedores GPU como Groq o Together AI, que operan infraestructuras compartidas siempre activas («warm»). Especificar :fastest o un proveedor GPU con nombre en el identificador del modelo evitará completamente este retraso.

¿Es compatible la API de inferencia de HF con el SDK de Python de OpenAI?

Sí, para finalizaciones de chat. Establezca base_url="https://router.huggingface.co/v1" y pase su token de HF como api_key. El bloque /v1/chat/completions y /v1/models Los puntos de conexión son compatibles con OpenAI. Para otros tipos de tareas —incrustaciones (embeddings), generación de imágenes y síntesis de voz— debe utilizar el huggingface_hub de Python o el SDK de JavaScript @huggingface/inference SDK de JavaScript; estas tareas no están cubiertas por el punto de conexión compatible con OpenAI.

¿Puedo desplegar un modelo ajustado mediante la API de inferencia?

No mediante los Proveedores de inferencia: estos únicamente sirven modelos disponibles en el catálogo público del Hub y compatibles con un proveedor asociado. Para un modelo privado o ajustado, implemente un punto de conexión de inferencia dedicado, que admite repositorios privados del Hub y le permite llevar sus propios pesos de modelo a una instancia GPU bajo su control.

¿Cómo hago un seguimiento y controlo los costos?

Su desglose de uso por modelo y proveedor se encuentra en huggingface.co/settings/inference-providers/overview. Los administradores de equipos y empresas pueden establecer límites de gasto y desactivar proveedores específicos desde la página de configuración de la organización. Para estimaciones anticipadas de costos antes de comenzar a desarrollar, utilice la Calculadora de costos de API.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That