¿Cuánto le costarán realmente cada mes las API de OpenAI, Anthropic o DeepSeek? Google Introduzca su volumen de uso y compare todos los modelos uno al lado del otro: los precios se obtienen en tiempo real desde nuestra Base de datos de modelos de IA.
| Modelo | Desarrollador | USD por cada millón de tokens de entrada | USD por cada millón de tokens de salida | Coste estimado mensual |
|---|
Estimación = (millones de tokens de entrada × precio por millón de tokens de entrada) + (millones de tokens de salida × precio por millón de tokens de salida). Las facturas reales pueden variar debido a la caché, descuentos por lotes y cargos adicionales por contextos largos. Los modelos de código abierto que usted aloja localmente no aparecen listados aquí (su coste corresponde al hardware y electricidad empleados, no a un coste por token).
El modelo más económico no siempre es la mejor opción: revise la página de cada modelo para conocer su ventana de contexto, sus resultados en pruebas de referencia y sus capacidades antes de cambiar. Y recuerde: los modelos de código abierto que usted aloja localmente no tienen ningún coste por token.
¿Cuánto cuesta una API de un modelo de lenguaje grande (LLM) y cómo se calcula?
Los precios de las APIs de IA se cobran por token, facturándose por separado los tokens de entrada (su indicación más cualquier contexto que envíe) y los de salida (la respuesta del modelo), y se cotizan por cada millón de tokens. Para estimar una factura, multiplique sus tokens de entrada por el precio de entrada, sume los tokens de salida multiplicados por el precio de salida, y luego ajuste el resultado según la cantidad de solicitudes que realice al mes. En 2026, los precios de entrada oscilan aproximadamente entre 0,10 y 5 USD por millón de tokens, mientras que los de salida van de 0,30 a 30 USD por millón; los tokens de salida casi siempre cuestan más que los de entrada, típicamente entre 2 y 5 veces más (una mediana de aproximadamente 4 veces).
- La fórmula: coste mensual ≈ (solicitudes/mes × tokens de entrada promedio × precio de entrada ÷ 1 000 000) + (solicitudes/mes × tokens de salida promedio × precio de salida ÷ 1 000 000).
- Regla tokens-palabra: aproximadamente 1,3 tokens por palabra en inglés, por lo que 1 000 tokens equivalen a unos 750 palabras y 1 millón de tokens a unos 750 000 palabras.
- Margen de precios: los modelos económicos o «lite» se sitúan cerca de 0,10–0,15 USD por millón de tokens de entrada; los modelos punteros de última generación alcanzan unos 5 USD por millón de tokens de entrada y 25–30 USD por millón de tokens de salida.
- Los modelos de código abierto autoalojados no tienen tarifa por token —usted paga por la GPU, la energía eléctrica y el alojamiento en su lugar.
Preguntas frecuentes
¿Cómo calculo el coste mensual de una API de IA?
Tome sus tokens de entrada y salida promedio por solicitud, multiplique cada uno por el precio por millón correspondiente al modelo (el precio de entrada y el de salida son distintos), súmelos para obtener el coste por solicitud y luego multiplíquelo por el volumen mensual de solicitudes. Por ejemplo, 100 000 solicitudes al mes con 1 000 tokens de entrada y 500 de salida cada una suponen 100 millones de tokens de entrada y 50 millones de tokens de salida; a 1 USD por millón de tokens de entrada y 4 USD por millón de tokens de salida, el coste sería de 100 USD + 200 USD = 300 USD al mes.
¿Por qué los tokens de salida cuestan más que los de entrada?
Los tokens de entrada se procesan en un único paso paralelo, mientras que cada token de salida requiere su propio paso completo hacia adelante (forward pass) a través del modelo, por lo que generar texto es mucho más intensivo en recursos computacionales que leerlo. Por eso los tokens de salida suelen tener un precio 2–5 veces superior al de los de entrada, con una relación típica de alrededor de 4:1. Al estimar una factura, tenga en cuenta este mayor peso de los tokens de salida, en lugar de asumir que entrada y salida tienen el mismo coste.
¿Qué significa realmente «coste por 1 millón de tokens»?
Los proveedores cotizan los precios por cada millón de tokens, en lugar de por solicitud, porque la cantidad de tokens varía enormemente entre llamadas. Un token equivale aproximadamente a tres cuartos de una palabra en inglés, así que un millón de tokens corresponde a unas 750 000 palabras —la longitud de un libro extenso—. Para calcular su coste real, divida el precio cotizado por millón entre 1 000 000 y multiplíquelo por el número exacto de tokens enviados y recibidos.
¿Cuál es la API de LLM más económica en 2026?
Las opciones de menor coste son las APIs «flash», «lite» y de modelos abiertos, que se sitúan alrededor de 0,10–0,15 USD por millón de tokens de entrada y aproximadamente 0,30–0,60 USD por millón de tokens de salida —a menudo 30–50 veces más baratas que los modelos punteros de última generación, cuyos precios rondan los 5 USD por millón de tokens de entrada y 25–30 USD por millón de tokens de salida—. El mejor valor suele ser el modelo más económico que aún cumpla con su umbral de calidad, por lo que debe elegir el modelo adecuado para la tarea específica, en lugar de recurrir por defecto al más caro. Dado que los precios cambian con frecuencia cada trimestre, utilice las cifras actualizadas en la calculadora anterior antes de comprometerse con volúmenes elevados.
¿Tienen los modelos de código abierto o de pesos abiertos un coste por token en la API?
No: si autoaloja un modelo de pesos abiertos (como Llama, Qwen, DeepSeek o variantes de Mistral), no hay ningún cargo por token en la API; solo paga por la GPU o servidor, la electricidad y el mantenimiento. Esto invierte la ecuación económica: el autoalojamiento implica un coste fijo por hora, independientemente del uso, por lo que solo resulta más rentable que el pago por token cuando el volumen es alto y constante. Con volúmenes bajos o intermitentes, una API alojada casi siempre resulta más económica, ya que paga únicamente por los tokens que utiliza.
¿Cuánta VRAM necesito para autoalojar un modelo en lugar de pagar por token?
Con una cuantización de 4 bits, un modelo necesita aproximadamente 0,5–0,6 GB de VRAM por cada mil millones de parámetros, además de espacio adicional para la caché KV, cuyo tamaño aumenta con la longitud del contexto. Así, un modelo de 8B requiere unos 5–6 GB y cabe en una GPU de consumo; un modelo de 70B necesita unos 40–48 GB (una tarjeta de centro de datos o dos tarjetas de 24 GB); añadir un margen de seguridad del 15–20 % para la caché KV y otras sobrecargas es una regla práctica recomendable. Ventanas de contexto más largas y tamaños de lote mayores incrementan los requisitos de la caché KV, así que dimensione su sistema según las longitudes reales de sus indicaciones, no solo según los pesos del modelo.
¿Cómo puedo reducir mi factura de la API de IA?
Los factores más determinantes son enviar menos tokens y elegir una versión más económica del modelo para tareas sencillas. La memoria caché de indicaciones puede reducir hasta un ~90 % el coste de indicaciones del sistema o contextos repetidos, y los puntos finales por lotes o asíncronos suelen ofrecer descuentos del orden del 50 % para trabajos no urgentes. Acortar contextos largos, limitar la longitud máxima de salida y dirigir las solicitudes sencillas a un modelo «lite», reservando los modelos punteros para tareas complejas, suele reducir la factura en un múltiplo considerable.
Más herramientas gratuitas de Convly
Coste combinado de la API por cada 1 millón de tokens: el coste real de los modelos de IA
$0.02
$0.02
$0.03
$0.06
$0.07
$0.07
$0.09
$0.10
$0.13
$0.15
$10.00
$10.00
$11.25
$11.25
$20.00
$20.00
Blended cost = (3 × input + output) ÷ 4 · 10 cheapest + 6 priciest of 37 tracked, log scale · full spread 909× · Green = best value, orange = highest. Updated Sep 21, 2026.
🔍 Incruste este gráfico en su sitio web (gratis, con atribución)
Obtén los datos antes que nadie
Un correo electrónico semanal: qué modelos de IA cambiaron de precio, qué midieron realmente las nuevas pruebas de rendimiento y qué GPU vale la pena comprar. Sin sensacionalismo, sin relleno.
Gratis. Cancela tu suscripción con un solo clic. Nunca vendemos ni compartimos tu dirección.
