- Windows: pulse Ctrl+Mayús+Esc → Rendimiento → GPU y lea Memoria GPU dedicada. En tarjetas NVIDIA, ejecute
nvidia-smien una terminal para obtener la cifra exacta, además del uso en tiempo real. - macOS: Menú Apple → Acerca de este Mac. En los chips Apple Silicon, la cifra «Memoria» corresponde a la memoria unificada compartida entre la CPU y la GPU; no existe una VRAM separada.
- Linux:
nvidia-smi(NVIDIA),rocm-smi --showmeminfo vram(AMD) oglxinfo -Ben controladores Mesa. - Solo la dedicada VRAM determina qué modelo puede ejecutarse. Ingrese su cifra en la calculadora de VRAM para ver qué modelos puede ejecutar.
Cómo comprobar la VRAM, en una línea por plataforma: en Windows, pulse Ctrl+Mayús+Esc, abra la pestaña Rendimiento y seleccione su GPU, luego lea Memoria GPU dedicada; en macOS, abra el menú Apple → Acerca de este Mac; en Linux, ejecute nvidia-smi para NVIDIA o rocm-smi para AMD. A continuación se detallan cada uno de estos métodos, además de qué significan realmente los números cuando está evaluando si una LLM local cabe en su sistema.
Cómo comprobar la VRAM en Windows
Administrador de tareas: el método más rápido
- Presione Ctrl+Mayús+Esc para abrir el Administrador de tareas.
- Vaya a la pestaña Rendimiento Rendimiento Más detalles primero si ve la vista compacta).
- Haga clic en GPU 0 en la barra lateral izquierda. En los portátiles con GPU integrada y dedicada también aparecerá GPU 1 — normalmente la tarjeta discreta es la GPU 1.
- Leer Memoria GPU dedicada en la zona inferior derecha. Esa es su VRAM física, mostrada como usada / total (por ejemplo, 2,1/24,0 GB).
Ignore la línea de Memoria de GPU : suma la Memoria de GPU compartida (memoria RAM del sistema que la GPU puede utilizar temporalmente) a la cifra dedicada, lo que hace que una tarjeta de 8 GB parezca tener 24 GB. Más adelante explicamos esta diferencia.
dxdiag
Presione Win+R, escriba dxdiag, presione Entrar y luego abra la pestaña Pantalla Pantalla Memoria de pantalla (VRAM) muestra lo que DirectX informa. Una advertencia: según el controlador, dxdiag a veces incluye en este valor la memoria RAM compartida del sistema, por lo que puede mostrar un número mayor que la VRAM real de la tarjeta. Confíe en la cifra «dedicada» del Administrador de tareas o en nvidia-smi nvidia-smi
Ajustes → Pantalla → Pantalla avanzada
Abrir Ajustes → Sistema → Pantalla → Pantalla avanzada, luego haga clic en Propiedades del adaptador de pantalla para Pantalla 1. La pestaña Adaptador muestra la Memoria de vídeo dedicada en MB. La redacción exacta varía ligeramente entre Windows 10 y Windows 11, pero la ruta es la misma.
nvidia-smi: la cifra exacta
Si tiene una GPU NVIDIA, el controlador instala una herramienta de línea de comandos que informa la memoria en mebibytes. Abra PowerShell o el símbolo del sistema y ejecute:
nvidia-smiLa columna de memoria muestra el uso actual respecto al total real —por ejemplo, 3216 MiB / 24564 MiB en una RTX 4090— y la lista de procesos en la parte inferior indica qué programas están ocupando memoria. Para obtener una salida limpia y legible por máquina:
nvidia-smi --query-gpu=memory.total,memory.used,memory.free --format=csvSi el comando no se encuentra, las versiones recientes de los controladores lo ubican en C:\Windows\System32\nvidia-smi.exe; las versiones antiguas de los controladores lo ubicaban en C:\Program Files\NVIDIA Corporation\NVSMI.
Cómo comprobar la VRAM en macOS
Haga clic en el menú Apple → Acerca de este Mac.
- Apple Silicon (M1 y posteriores): verá un nombre de chip y una cifra como 16 GB, 36 GB o 128 GB. Esto es Memoria memoria unificada memoria unificada — un único grupo compartido por la CPU y la GPU. No hay un valor separado para VRAM porque no existe una VRAM independiente.
- Mac con procesador Intel: Las GPU discretas se enumeran con una cifra específica de VRAM, por ejemplo «Radeon Pro 5500M 8 GB».
Para más detalles, abra Acerca de este Mac → Más información → Informe del sistema y seleccione Gráficos/Pantallas, o ejecute esto en la Terminal:
system_profiler SPDisplaysDataTypeEn equipos Intel, esto imprime una línea «VRAM (total)»; en equipos Apple Silicon, en cambio, enumera el chip y el número de núcleos de la GPU. VRAM (Total) En los equipos Apple Silicon, la GPU puede acceder a la mayor parte —pero no a la totalidad— de la memoria del sistema. macOS reserva una porción para sí misma, y, de forma predeterminada, el límite del conjunto de trabajo de la GPU se sitúa aproximadamente entre las dos terceras partes y las tres cuartas partes de la RAM total; el límite exacto varía según la capacidad de RAM y la versión de macOS. En la práctica, un MacBook Pro con 36 GB de RAM puede cargar modelos que requerirían una GPU discreta de 24 GB en un equipo PC. Las herramientas de LLM locales le muestran directamente este límite utilizable; consulte la
Por qué la memoria unificada cambia los cálculos
guía de LM Studio para ver cómo cada una lo reporta. La contrapartida es el ancho de banda de memoria, que varía ampliamente entre los chips base, Pro, Max y Ultra, y afecta directamente a los tokens por segundo. y la Guía de Ollama NVIDIA: nvidia-smi
Cómo comprobar la VRAM en Linux
Instalado junto con el controlador propietario. Ejecute
para obtener una instantánea, o actualice cada segundo mientras se carga un modelo: nvidia-smi nvidia-smi -l 1
AMD: rocm-smi o sysfsCon la pila ROCm instalada:
Sin ROCm, el controlador del kernel
rocm-smi --showmeminfo vramamdgpu expone directamente la memoria total (en bytes; su tarjeta podría ser card1 — compruebe con ls /sys/class/drm/ cat /sys/class/drm/card0/device/mem_info_vram_total):
Cualquier GPU: glxinfomesa-utils
Instalar (Debian/Ubuntu) o glx-utils (Fedora), y luego ejecute: glxinfo -B | grep -i memory
Los controladores Mesa imprimen una línea comoMemoria de vídeo: 8192 MB ; la etiqueta exacta varía según el controlador.lspci — identifica la tarjeta, no la VRAM
lspci | grep -iE 'vga|3d'
sudo lspci -v -s <ranura>mostrará entonces las aperturas de memoria de la tarjeta, pero tenga cuidado: estas son las dimensiones de los BAR PCI, que solo coinciden con la VRAM total cuando está habilitado Resizable BAR. Use lspci para identificar con precisión el modelo exacto de GPU y, a continuación, obtenga la cifra de memoria mediante las herramientas anteriores o la hoja de especificaciones de la tarjeta. Número
Total frente a libre frente a compartida: qué significan los números
| Donde lo ve | Qué significa para los LLM | VRAM dedicada (total) |
|---|---|---|
| «Memoria de GPU dedicada» en el Administrador de tareas; | Memoria física ubicada en la tarjeta. Este es el presupuesto fijo disponible para los pesos del modelo. nvidia-smi total | VRAM libre |
| memory.free | nvidia-smi Lo que está disponible en este momento. El entorno de escritorio, las pestañas del navegador y otras aplicaciones suelen ocupar entre 0,5 y 2 GB. | «Memoria de GPU compartida» en el Administrador de tareas |
| Memoria de GPU compartida | RAM del sistema (hasta aproximadamente la mitad de ella) a la que la GPU puede recurrir mediante PCIe. Es mucho más lenta que la VRAM; no la considere al dimensionar un modelo. | Memoria unificada (Apple Silicon) |
| «Memoria» en Acerca de este Mac | Un único grupo compartido por CPU y GPU. La GPU puede utilizar la mayor parte de esta memoria, por lo que se comporta como un gran grupo de VRAM con un ancho de banda dependiente del chip. | Al cargar un modelo, lo que importa es la VRAM |
libre y no la total. Una tarjeta de 12 GB con 1,5 GB ya consumidos por el compositor y un navegador dispone de unos 10,5 GB disponibles; esto puede hacer que un modelo que «debería caber» falle al cargarse. En NVIDIA, la lista por proceso que aparece en la parte inferior de la salida de nvidia-smi nvidia-smi le indica exactamente qué procesos debe cerrar.
¿Cuánta VRAM necesita realmente?
La pregunta detrás de la pregunta. En la cuantización de 4 bits —el estándar para la inferencia local—, los pesos del modelo ocupan aproximadamente 0,5–0,6 GB por cada mil millones de parámetros, además de una caché KV que crece con la longitud del contexto. Guía aproximada:
| Tamaño del modelo | Pesos de 4 bits (aprox.) | VRAM necesaria para ejecutar cómodamente |
|---|---|---|
| 7–8B | 4–5 GB | 6–8 GB |
| 12–14B | 7–9 GB | 10–12 GB |
| 24–32B | 13–19 GB | 16–24 GB |
| 70B | 36–42 GB | 48 GB, o dividida entre dos GPU |
La columna «cómoda» supone un contexto moderado (4k–8k tokens); contextos muy largos añaden varios gigabytes adicionales de caché KV. Para cifras específicas por modelo, consulte la tabla de requisitos de VRAM para cada LLM importante o explore la base de datos de modelos. Para su combinación exacta de modelo, cuantización y longitud de contexto, utilice la calculadora de VRAM. Si su tarjeta no cumple los requisitos, la mejores GPUs para LLM locales guía de actualizaciones clasifica las opciones según la VRAM por dólar; y si una nueva GPU no resulta rentable, la calculadora de punto de equilibrio entre autohospedaje y API muestra a partir de qué momento resulta más económico pagar por token.
Preguntas frecuentes
¿Puedo aumentar la VRAM de mi tarjeta gráfica?
No en una GPU discreta: los chips de memoria están soldados a la placa, por lo que la única opción de actualización es cambiar de tarjeta. Las GPU integradas son la excepción: algunas configuraciones de BIOS/UEFI permiten modificar la asignación de RAM (a menudo etiquetada como «Tamaño del búfer de fotogramas UMA» o similar). La memoria GPU compartida de Windows no constituye VRAM adicional y no afecta a la cantidad de modelo que puede ejecutarse a velocidad máxima.
¿Por qué Windows informa de más memoria GPU de la que tiene mi tarjeta?
La línea «Memoria GPU» del Administrador de tareas incluye tanto la VRAM dedicada como la memoria del sistema compartida, y dxdiag puede inflar esta cifra del mismo modo. La VRAM física corresponde al valor «Memoria GPU dedicada», o al total que muestra nvidia-smi . Una tarjeta de 8 GB en un PC con 32 GB de RAM suele mostrar 24 GB de «Memoria GPU»: solo 8 GB corresponden a VRAM real.
¿Ayuda la memoria GPU compartida a ejecutar modelos LLM más grandes?
No de forma significativa. Entornos de ejecución como llama.cpp y Ollama pueden descargar deliberadamente capas a la memoria RAM del sistema, lo que permite ejecutar modelos demasiado grandes —pero la velocidad de generación suele caer de decenas de tokens por segundo a apenas uno o pocos tokens por segundo. Ajuste el tamaño del modelo a la VRAM dedicada y considere la descarga a RAM como una alternativa de respaldo, no como estrategia principal.
¿Cuánta VRAM necesita un modelo de 7B o 8B?
Aproximadamente 4–5 GB para los pesos en cuantización de 4 bits, por lo que una tarjeta de 6–8 GB permite ejecutar uno cómodamente, dejando margen para el contexto. Una GPU de 8 GB maneja bien los modelos de 7–8B; con 12 GB se pueden ejecutar modelos de 12–14B. La guía de mejores modelos locales para Ollama relaciona los modelos populares con sus respectivos niveles de VRAM.
¿Es la memoria unificada de Mac lo mismo que la VRAM?
Para ejecutar LLM, prácticamente sí: la GPU accede a un único grupo de memoria compartida, limitado por el sistema a aproximadamente dos tercios o tres cuartos de la RAM total. Esto significa que un Mac con 32 GB puede ejecutar modelos que una GPU de PC de 12 GB no podría manejar. La diferencia radica en el ancho de banda de memoria, que varía varias veces entre los chips base y los modelos Max/Ultra, y determina su límite máximo de tokens por segundo.
¿Cómo monitorizo el uso de VRAM mientras se ejecuta un modelo?
En NVIDIA (cualquier sistema operativo), ejecute AMD: rocm-smi o sysfs para una actualización cada segundo. En Windows, el panel GPU del Administrador de tareas se actualiza en tiempo real. En Linux AMD, use watch -n 1 rocm-smi --showmeminfo vram; en Mac, los pesos del modelo aparecen como memoria de proceso habitual en la pestaña «Memoria» del Monitor de actividad, ya que la memoria es unificada.

