Friday, 7 August 2026 | Updating Daily AI insight, written for builders

Precios de la API de Gemini (2026): Coste por cada millón de tokens para todos los modelos

Los precios de la API de Gemini comienzan en 1,25 USD por cada millón de tokens de entrada en Gemini 2.5 Pro y alcanzan
2 USD en Gemini 3.1 Pro, con precios de salida entre 7,50 y 12 USD.
Las tarifas anunciadas son
competitivas, pero la política de precios de Gemini tiene una característica que ninguno de sus competidores comparte en igual medida:
los prompts superiores a aproximadamente 200 000 tokens se facturan a una tarifa más alta en varios modelos. Para una familia
que hace hincapié en su contexto de un millón de tokens, ese umbral de 200 000 es el número que determina su factura real.

Precios de la API de Gemini: todos los modelos, por cada millón de tokens

ModelosEntrada: $/1 millónSalida: $/1 millónDólares por millón combinadosContexto
Gemini 3.6 Flash$1.50$7.50$2.701 millón
Gemini 2.5 Pro$1.25$10.00$3.001 millón (1 048 576 tokens)
Gemini 3.5 Flash$1.50$9.00$3.001 millón
Gemini 3.1 Pro$2.00$12.00$4.001,05 millones

«Combinado» es la tarifa efectiva para una proporción entrada/salida de 4:1, que es la que realmente genera una carga de trabajo típica de chat o recuperación de información. Es el valor que debe compararse entre proveedores; un precio publicitario solo para la entrada oculta el coste real del lado de la salida.

Cuánto cuesta Gemini al mes

Carga de trabajoTokens/mesGemini 3.6 Flash
más económico
Gemini 3.1 Pro
nivel más potente
Proyecto secundario1 millón de tokens de entrada / 0,25 millones de tokens de salida$3.38$5.00
Pequeño equipo20 millones de tokens de entrada / 5 millones de tokens de salida$68$100
Producción200 millones de tokens de entrada / 50 millones de tokens de salida$675$1,000

Modele sus propios volúmenes en la Calculadora de costos de API de IA.

Cómo se compara Gemini con otros proveedores

El modelo más económico de cada proveedor, de modo que la comparación sea homogénea desde el punto de vista del coste de entrada.

ProveedorModelo más económicoDólares por millón combinados
Mistral AIMistral 7B$0.0220
MetaLlama 3.1 8B$0.0220
AlibabaQwen3 8B$0.0600
Google esta páginaGemma 3 4B$0.0600
MicrosoftPhi-4$0.0840
DeepSeekDeepSeek V4-Flash$0.168
Moonshot AIKimi K2.7 Code$0.980
AnthropicClaude Haiku 4.5$1.80
Zhipu AIGLM 5.2$2.00
xAIGrok 4$5.40
OpenAIGPT-5.6 Sol$10.00

Lo más económico no equivale necesariamente al mejor valor; compruebe también las capacidades junto con el precio en la Clasificación de modelos de lenguaje grande (LLM), o explore todos los modelos disponibles en la Base de datos de modelos de IA.

¿Qué modelo de Gemini debería usar?

Lo interesante de la línea actual de Google es que, con frecuencia, la opción más económica es también la
mejor.

Gemini 3.5 Flash supera a Gemini 3.1 Pro en pruebas de programación y agentes
mientras opera aproximadamente cuatro veces más rápido y con un costo unos veinticinco por ciento menor, manteniendo el mismo
contexto de un millón de tokens. Cuando un modelo más rápido y más barato también obtiene mejores resultados, la versión Pro deja de ser la opción predeterminada y pasa a ser una alternativa especializada. Para asistentes de programación, bucles de agentes y cualquier caso en el que el usuario espere una respuesta, Flash gana en todos los aspectos simultáneamente —una situación poco común en la selección de modelos, donde normalmente velocidad, costo y calidad entran en conflicto entre sí.
la opción predeterminada y se convierte en una elección especializada. Para asistentes de programación, bucles de agentes y cualquier caso
en el que un usuario espera una respuesta, Flash destaca en todos los aspectos a la vez —lo cual es poco común en
la selección de modelos, donde normalmente velocidad, costo y calidad se compensan entre sí.

Gemini 3.6 Flash, lanzado el 21 de julio de 2026, es el más reciente de la serie. Su
tarifa de entrada permanece sin cambios en 1,50 USD, mientras que la de salida baja de 9 a 7,50 USD —una reducción del 17 % en el lado de la factura que habitualmente representa la mayor parte del costo. Para cargas de trabajo intensivas en generación, esto supone un ahorro directo sin comprometer ninguna capacidad, según indica su precio, lo que lo convierte en la opción predeterminada dentro de la categoría Flash para nuevos proyectos. En cargas de trabajo centradas en prompts, como la recuperación, ambos modelos tienen el mismo costo, ya que sus tarifas de entrada coinciden. Para aclarar una duda frecuente: no existe ningún Gemini 4 hasta julio de 2026.
la factura que suele predominar. Para cargas de trabajo intensivas en generación, esto representa un ahorro directo
sin comprometer capacidades, tal como lo indica su precio, lo que lo convierte en la opción predeterminada
dentro de la categoría Flash para nuevos trabajos. En cargas de trabajo basadas principalmente en indicaciones (prompts) y recuperación de información, ambos modelos
son intercambiables desde el punto de vista de coste, ya que la entrada es idéntica. Para aclarar una duda frecuente: no existe
Gemini 4 hasta julio de 2026.

Gemini 3.1 Pro merece elegirse por su profundidad multimodal más que por defecto, dado que Flash lo supera en programación a un precio inferior.
predeterminada, dado que Flash supera a esta última en tareas de programación y con un precio inferior.

Gemini 2.5 Pro sigue ampliamente desplegado y bien soportado. Alcanzó disponibilidad general el 17 de junio de 2025 y fue líder de referencia en programación, matemáticas y razonamiento con contextos largos, con un contexto nativo de 1 048 576 tokens y entrada completamente multimodal —texto, imágenes, audio, vídeo y PDF—. Los modelos más recientes de la serie 3.x lo han sustituido, pero con una tarifa de entrada de 1,25 USD sigue siendo una de las opciones con mejor relación calidad-precio entre los modelos punteros de razonamiento.
disponibilidad general el 17 de junio de 2025 y fue líder de referencia en programación, matemáticas y
razonamiento con contextos largos, con un contexto nativo de 1 048 576 tokens y soporte completo para entradas multimodales: texto,
imágenes, audio, video y archivos PDF. Modelos más recientes de la serie 3.x lo han sustituido, pero con un costo de entrada de 1,25 USD sigue siendo
una de las mejores opciones en relación calidad-precio entre los modelos fronterizos de razonamiento.

El umbral de 200 000 tokens es el factor clave a tener en cuenta

La facturación por contextos largos de Gemini es donde se desbordan los presupuestos. Gemini 3.1 Pro factura los prompts superiores a
200 000 tokens a una tarifa de entrada aproximadamente doble. Gemini 2.5 Pro está explícitamente segmentado: 1,25 USD por cada millón de tokens de entrada hasta los 200 000, aumentando a 2,50 USD por encima de ese umbral, mientras que la tarifa de salida sube de 10 a 15 USD.
1 millón de tokens de entrada hasta 200 000, aumentando a 2,50 dólares por encima de ese umbral, mientras que el costo por salida pasa de 10 a 15 dólares.

La consecuencia práctica es que una funcionalidad que cuesta una cantidad determinada durante las pruebas puede costar el doble en producción, porque dicho umbral se aplica por solicitud y depende enteramente de la cantidad de texto que el usuario haya pegado. Presupuestar una función con contexto largo basándose únicamente en la tarifa anunciada subestimará considerablemente la factura una vez que comiencen a llegar los prompts reales.
que en producción, porque el umbral se supera por solicitud y depende completamente de cuánto
haya pegado el usuario. Presupuestar una función de contexto largo basándose únicamente en la cifra destacada subestimará
sustancialmente la factura una vez que comiencen a llegar solicitudes reales.

Existen dos respuestas razonables. Diseñar la solución evitando dicho umbral mediante técnicas agresivas de recuperación y reordenamiento (reranking), para mantener los prompts por debajo de él —lo cual, además, suele mejorar la calidad de las respuestas, ya que la atención sobre contextos extremadamente largos no es uniforme. O compararlo con un modelo que aplique una tarifa plana única para toda su ventana de contexto;
volver a ordenar para que los prompts se mantengan por debajo de dicho umbral —lo cual normalmente mejora también la calidad de las respuestas, ya que
la atención sobre contextos muy largos no es uniforme. O bien compararlo con un modelo que cobra una tarifa fija para toda su ventana de contexto;
tarifa plana en toda su ventana; Claude Opus
4.8 no aplica ningún recargo adicional por contextos largos
, lo cual, en cargas de trabajo genuinamente centradas en recuperación, puede resultar más económico pese a tener un precio nominal más alto.
resultará más económico a pesar de tener un precio de etiqueta más alto.

Los modelos abiertos de Google tienen precios independientes

Gemma 3 es la familia de modelos de código abierto de Google y queda fuera de esta tabla porque representa una propuesta distinta: modelos de 4 000 millones, 12 000 millones y 27 000 millones de parámetros bajo licencia abierta, multimodales (texto e imágenes), con un contexto de 128 000 tokens y tan económicos en APIs alojadas (de 0,05 a 0,16 USD por millón de tokens) que la verdadera decisión radica en si conviene ejecutarlos localmente. Gemma 3 de 27 000 millones requiere aproximadamente 16 GB de VRAM en cuantización de 4 bits, lo que permite ejecutarlo en una sola tarjeta gráfica de consumo. Dimensione su uso en la
propuesta: modelos de 4 000 millones, 12 000 millones y 27 000 millones de parámetros bajo licencia abierta, multimodales (texto e imágenes),
con contexto de 128 K y suficientemente económicos en APIs alojadas (de 0,05 a 0,16 dólares por cada millón de tokens), de modo que la verdadera decisión sea
si ejecutarlos localmente o no. Gemma 3 de 27B requiere aproximadamente 16 GB de VRAM en cuantización de 4 bits, lo que permite ejecutarlo en
una única tarjeta para consumidores. Dimensione esta en la
Calculadora de VRAM, o evalúe si
alojarlo usted mismo resulta más económico que usar la API, según su volumen, con la ayuda de la
autohospedaje frente a API
calculadora
.

Preguntas frecuentes

¿Cuánto cuesta la API de Gemini?

Los precios de la API de Gemini oscilan entre 2,70 USD por cada millón de tokens combinados (blended) en Gemini 3.6 Flash y 4,00 USD en Gemini 3.1 Pro. La tarifa combinada asume una proporción de entrada a salida de 4:1. Entrada y salida se facturan por separado, y la salida siempre es la más cara.

¿Cuál es el modelo Gemini más económico?

Gemini 3.6 Flash, a 1,50 USD por cada millón de tokens de entrada y 7,50 USD por cada millón de tokens de salida. Una carga de trabajo mensual para un pequeño equipo de 20 millones de tokens de entrada y 5 millones de tokens de salida cuesta aproximadamente 68 USD.

¿Cuánto cuesta Gemini al mes?

Con 20 millones de tokens de entrada y 5 millones de tokens de salida al mes, Gemini 3.6 Flash cuesta aproximadamente 68 USD y Gemini 3.1 Pro unos 100 USD. Un proyecto secundario con 1 millón de tokens de entrada y 0,25 millones de tokens de salida cuesta una fracción muy pequeña de esa cantidad. Utilice la calculadora de costos de la API de IA para estimar sus propios volúmenes.

¿Es Gemini más barato que Mistral AI?

En los precios de nivel de entrada, Gemini comienza en 2,70 USD por cada millón de tokens combinados (entrada + salida), mientras que Mistral AI comienza en 0,0220 USD por cada millón de tokens en Mistral 7B. Mistral AI representa el punto de entrada más económico, aunque las capacidades difieren: compárelos ambos en el leaderboard antes de cambiar.

¿Por qué Gemini cobra más por los tokens de salida que por los de entrada?

Los tokens de salida se generan uno a uno y no pueden agruparse (batched) como sí puede hacerse con un prompt, por lo que su procesamiento resulta más costoso. Por eso, las cargas de trabajo intensivas en prompts —como la recuperación de información o la clasificación— son mucho más económicas que las centradas en la generación, y por eso el precio combinado resulta más relevante que el precio publicitario de entrada.

Los precios indicados corresponden a las tarifas oficiales publicadas para la API principal de cada modelo y se actualizan conforme los proveedores las modifiquen. No incluyen descuentos por volumen, procesamiento por lotes (batch) ni caché de entradas. Última revisión: agosto de 2026.

Scroll to Top
Featured on There's An AI For That