¿Te preguntas si tu GPU puede ejecutar localmente un determinado modelo de lenguaje grande? Esta calculadora gratuita estima la VRAM necesaria para cada modelo en todos los niveles de cuantización y te indica exactamente qué modelos caben en tu tarjeta.
| Cuantización | Calidad | VRAM estimada | ¿Cabe en tu GPU? |
|---|
Estimación basada en los pesos del modelo en cada nivel de cuantización más un sobrecoste de ejecución de ~1,5 GB. Los contextos largos añaden memoria para la caché KV (que aumenta con la longitud del contexto que elijas). En los modelos de mezcla de expertos, todos los parámetros deben cargarse en la VRAM, aunque solo un subconjunto participe en el cálculo por token.
Selecciona un modelo de nuestra Base de datos de modelos de IA (o introduce manualmente una cantidad personalizada de parámetros), elige tu GPU, establece la longitud de contexto y comprueba al instante si se ejecuta —y a qué calidad—. Las estimaciones se basan únicamente en los pesos del modelo; los contextos largos añaden memoria adicional para la caché KV.
Respuesta rápida: ¿cuánta VRAM necesitas para ejecutar un LLM localmente?
Para ejecutar un modelo de lenguaje grande localmente con cuantización de 4 bits, calcula aproximadamente 0,5–0,6 GB de VRAM de GPU por mil millones de parámetros, más 1–3 GB para la caché KV en longitudes de contexto típicas. En la práctica, un modelo de 8B cabe en unos 5–6 GB (cómodamente en una RTX 3060 de 12 GB; también funciona en una RTX 4060 de 8 GB), un modelo de 13B necesita unos ~8–10 GB, un modelo de 32B requiere una tarjeta de 24 GB como la RTX 4090 (~20 GB para los pesos) y un modelo de 70B necesita unos 40–48 GB: una sola tarjeta de 48 GB o dos GPUs de 24 GB.
Reglas prácticas rápidas para los pesos del modelo, antes de añadir el contexto:
- 4 bits (Q4): ~0,5–0,6 GB por mil millones de parámetros
- 8 bits (Q8): ~1–1,2 GB por mil millones de parámetros
- fp16 / bf16: ~2 GB por mil millones de parámetros
- Caché KV (contexto): añade ~1–4 GB para contextos de 8K–32K tokens; más para contextos muy largos o modelos más grandes
Preguntas frecuentes
¿Cuánta VRAM necesito para ejecutar un modelo de 70B?
Un modelo de 70B necesita aproximadamente 40–48 GB de VRAM con cuantización de 4 bits: unos 0,5–0,6 GB por mil millones de parámetros para los pesos, más la caché KV. Esto cabe en una sola tarjeta de 48 GB o en dos GPUs de 24 GB, como un par de RTX 4090. Con cuantización de 8 bits se duplica aproximadamente a ~80 GB, y con fp16 se necesitan alrededor de 140 GB.
¿Puede mi RTX 4060 o una GPU de 12 GB ejecutar un modelo de 8B o 7B?
Sí. Un modelo de 7B–8B con cuantización de 4 bits utiliza solo unos 4–5 GB de VRAM, por lo que funciona cómodamente en una tarjeta de 12 GB como la RTX 3060, dejando mucho margen para el contexto. La RTX 4060 tiene 8 GB y aún así maneja bien un modelo de 7–8B, aunque tendrás menos espacio disponible para ventanas de contexto largas.
¿Cuánta VRAM necesita un modelo de 13B?
Un modelo de 13B necesita unos 8–10 GB de VRAM con cuantización de 4 bits. Cabe en una GPU de 12 GB para contextos cortos o moderados, pero una tarjeta de 16 GB es más segura si añades una ventana de contexto más larga y la sobrecarga del entorno de ejecución.
¿Puede una GPU de 24 GB como la RTX 4090 ejecutar un modelo de 32B o 70B?
Una GPU de 24 GB ejecuta bien un modelo de 32B con cuantización de 4 bits: los pesos ocupan unos 20 GB, dejando varios GB para la caché KV. No puede alojar un modelo de 70B con cuantización de 4 bits —eso requiere ~40–48 GB—, por lo que necesitarías una segunda GPU, descarga a la CPU o una cuantización de menor calidad (2–3 bits).
¿Cuánta memoria GPU consume un LLM por mil millones de parámetros?
Como regla general, calcula ~0,5–0,6 GB por mil millones de parámetros con cuantización de 4 bits, ~1–1,2 GB con 8 bits y ~2 GB con fp16/bf16. Así, un modelo de 30B ocupa aproximadamente 16–18 GB con cuantización de 4 bits, ~32 GB con 8 bits y ~60 GB con fp16, sin contar aún la caché KV.
¿Cuánta VRAM adicional consume la longitud del contexto (la caché KV)?
La caché KV crece linealmente con la longitud del contexto y añade unos 3 GB en un modelo de 8B al pasar de 8K a 32K tokens (aproximadamente 1 GB a 8K y unos 4 GB a 32K), aumentando aún más con modelos mayores o contextos más largos. Cuantizar la caché KV a 8 bits reduce aproximadamente a la mitad esta penalización, por lo que siempre debes dejar un margen de 1–4 GB sobre los pesos del modelo.
¿Qué tamaño de modelo puedo ejecutar con 8 GB o 16 GB de VRAM?
Con 8 GB de VRAM puedes ejecutar cómodamente modelos de 7–8B con cuantización de 4 bits; con 16 GB puedes ejecutar hasta ~13B cómodamente y apretar un modelo de 20–24B con un contexto moderado. Para un modelo de 32B necesitas 24 GB y para uno de 70B alrededor de 48 GB.
Más herramientas gratuitas de Convly
VRAM necesaria para ejecutar modelos abiertos de IA localmente (4 bits)
1,4 GB
3 GB
4,5 GB
5 GB
5 GB
7,5 GB
8 GB
9 GB
9 GB
16 GB
18 GB
20 GB
21 GB
40 GB
40 GB
65 GB
140 GB
140 GB
240 GB
370 GB
400 GB
400 GB
500 GB
800 GB
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Sep 14, 2026.
🔍 Incruste este gráfico en su sitio web (gratis, con atribución)
Obtén los datos antes que nadie
Un correo electrónico semanal: qué modelos de IA cambiaron de precio, qué midieron realmente las nuevas pruebas de rendimiento y qué GPU vale la pena comprar. Sin sensacionalismo, sin relleno.
Gratis. Cancela tu suscripción con un solo clic. Nunca vendemos ni compartimos tu dirección.
