- Ejecutar
ollama psmientras se carga un modelo: la columna PROCESADOR indica si Ollama está utilizando la GPU o la CPU. - La solución más habitual en sistemas NVIDIA consiste en instalar o actualizar el controlador del sistema anfitrión para que
nvidia-smidetecte la tarjeta gráfica y, a continuación, reiniciar el servicio de Ollama. - Si el modelo es más grande que su VRAM, Ollama descarga capas a la CPU; utilice la Calculadora de VRAM para comprobar si su modelo cabe antes de descargarlo.
- AMD, Docker y WSL2 requieren pasos específicos para cada plataforma, explicados a continuación.
Cuando Ollama no utiliza su GPU, la causa más frecuente es un controlador ausente o incompatible. Ejecute ollama ps —si la columna PROCESADOR muestra 100 % CPU, Ollama ha pasado completamente a la CPU. La solución depende de su plataforma: NVIDIA necesita el entorno de ejecución CUDA adecuado, AMD requiere ROCm y Docker necesita banderas explícitas de paso de GPU.
- Paso 1: Confirmar si Ollama está utilizando la GPU
- Paso 2: NVIDIA — Controladores y entorno de ejecución CUDA
- Paso 3: Modelo demasiado grande para la VRAM
- Paso 4: GPU AMD y ROCm
- Paso 5: Docker — Falta el paso de GPU
- Paso 6: WSL2 en Windows
- macOS — Metal (Apple Silicon y AMD)
- Verificación de la solución y rendimiento esperado
- Preguntas frecuentes
Paso 1: Confirmar si Ollama está utilizando la GPU
Antes de realizar cualquier cambio, verifique lo que Ollama está haciendo realmente. Cargue un modelo y, mientras se esté ejecutando, abra una segunda terminal:
ollama psSalida de ejemplo:
NOMBRE ID TAMAÑO PROCESADOR HASTA
llama3.2:8b abc123def456 5,0 GB 100 % GPU dentro de 4 minutosLa columna PROCESADOR es la señal definitiva:
| Valor de PROCESADOR | Significado |
|---|---|
| 100 % GPU | Todas las capas en la GPU — comportamiento esperado y correcto |
| XX % GPU / YY % CPU | El modelo cabe parcialmente en la VRAM; las capas restantes se ejecutan en la CPU |
| 100 % CPU | Uso forzado completo de la CPU — la GPU no se utiliza en absoluto |
En sistemas NVIDIA, compruebe también con nvidia-smi mientras se realiza la inferencia. La columna Uso de memoria debería aumentar conforme se carga el modelo. Si permanece constante, la GPU está inactiva, independientemente de lo que indiquen otras herramientas.
Paso 2: NVIDIA — Controladores y entorno de ejecución CUDA
La ausencia o desactualización del controlador NVIDIA es la causa más común de uso forzado completo de la CPU. Aunque Ollama incluye sus propias bibliotecas CUDA, sigue requiriendo un controlador del sistema anfitrión compatible con CUDA 11.3 o posterior.
Compruebe primero el controlador
nvidia-smiSi el comando no se encuentra, no hay ningún controlador instalado. Si se ejecuta, anote la versión del controlador y la versión de CUDA que aparecen en el encabezado. La versión de CUDA mostrada corresponde a la versión máxima que soporta dicho controlador —no implica que se haya instalado por separado el kit de herramientas CUDA, y Ollama no lo requiere.
| Plataforma | Versión mínima del controlador |
|---|---|
| Linux | 525.xx (compatible con CUDA 12.0) |
| Windows nativo | 527.xx (compatible con CUDA 12.0) |
| WSL2 (anfitrión Windows) | 525.xx en el lado de Windows — no instale el controlador NVIDIA para Linux dentro de WSL2 |
Instale o actualice el controlador
Ubuntu / Debian:
sudo apt install nvidia-driver-550
sudo rebootWindows: Descárguelo desde nvidia.com/Download o use GeForce Experience, y luego reinicie el sistema. Tras instalar o actualizar el controlador, es obligatorio reiniciar completamente el sistema —no basta con reiniciar únicamente el servicio.
Tras el reinicio, confirme que nvidia-smi muestra su tarjeta gráfica y reinicie Ollama:
# Linux (systemd)
sudo systemctl restart ollama
# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama
# Windows — reinicie la aplicación de Ollama en la bandeja del sistema o reinicie el equipoEjecute un modelo y vuelva a comprobar ollama ps . Si la columna PROCESADOR sigue mostrando 100 % CPU, continúe con los siguientes pasos.
Paso 3: Modelo demasiado grande para la VRAM
Cuando los pesos de un modelo superan la VRAM disponible, Ollama no rechaza su ejecución, sino que divide la inferencia. Se asignan tantas capas del transformador como sea posible a la GPU; el resto se ejecuta en la CPU. Esto aparece como un porcentaje dividido en ollama ps y constituye un comportamiento intencional, no un error.
Un modelo de 70 mil millones de parámetros con cuantización Q4_K_M suele requerir aproximadamente 40 GB de VRAM, lo cual supera la capacidad de cualquier GPU de consumo individual. Antes de descargar un modelo grande, compruebe si cabe mediante la Calculadora de VRAM. Para conocer los requisitos de VRAM por modelo entre los LLM más populares, consulte Requisitos de VRAM para cada LLM importante.
Si el modelo no cabe en su VRAM, tiene las siguientes opciones:
- Utilice una cuantización inferior (por ejemplo, Q2_K o Q3_K_S), lo que reduce el uso de VRAM con una ligera pérdida de calidad.
- Cambie a una variante de modelo más pequeña (por ejemplo, 8B en lugar de 70B). La página mejores modelos locales para Ollama explica qué modelos funcionan bien en hardware de consumo.
- Acepte la descarga parcial —el rendimiento estará entre los valores correspondientes al uso exclusivo de GPU y al uso exclusivo de CPU.
- Actualice su GPU. La mejoras GPUs para modelos de lenguaje local esta guía compara las opciones actuales según la cantidad de VRAM y el precio.
Paso 4: GPU AMD y ROCm
El soporte para AMD en Ollama se basa en ROCm, la plataforma de cómputo GPU de AMD. Ollama admite oficialmente las tarjetas RDNA 2 (serie RX 6000) y RDNA 3 (serie RX 7000) en Linux. El soporte para AMD en Windows es limitado: consulte las notas de la versión de Ollama instalada antes de esperar que funcione en Windows.
Verifique que ROCm detecte la tarjeta
rocm-smiSi rocm-smi no se encuentra, la pila ROCm no está instalada. Consulte amd.com/es/developer/rocm para obtener las instrucciones de instalación actuales para su distribución, ya que los nombres de los paquetes y los requisitos de versión cambian entre versiones de ROCm.
Si la tarjeta no aparece en la salida de rocm-smi después de la instalación:
sudo usermod -aG render,video $USER
# Cierre y vuelva a iniciar sesión para que el cambio de grupo surta efectoPara dirigirse a una GPU específica cuando hay varias presentes:
HIP_VISIBLE_DEVICES=0 ollama servePaso 5: Docker — Falta el paso de GPU
Los contenedores Docker no tienen acceso a la GPU a menos que se le pase explícitamente el dispositivo. Esta es la causa más común por la que Ollama recurre a la CPU en despliegues con contenedores: la GPU del host funciona correctamente, pero el contenedor no puede verla.
NVIDIA en Docker
Instale la herramienta NVIDIA Container Toolkit en el host:
sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart dockerLuego pase la GPU al iniciar el contenedor:
docker run -d --gpus all
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollamaSin la opción --gpus all (o --gpus device=0 (para especificar una tarjeta concreta), el contenedor no tendrá acceso a la GPU, independientemente de la configuración del host.
AMD en Docker
docker run -d
--device /dev/kfd --device /dev/dri
-v ollama:/root/.ollama
-p 11434:11434
ollama/ollama:rocmEl :rocm la etiqueta de imagen es obligatoria. La imagen predeterminada ollama/ollama no incluye ROCm y recurrirá a la CPU en hardware AMD.
Paso 6: WSL2 en Windows
WSL2 puede compartir la GPU NVIDIA con el host Windows, pero existe una regla absoluta: el controlador NVIDIA debe instalarse en WindowsWindows
- Instale o actualice el controlador NVIDIA en Windows y reinicie el sistema.
- WSL2 requiere un kernel 5.10.43 o posterior. Compruébelo ejecutando
uname -rdentro de WSL2; actualícelo mediantewsl --updateen una terminal de Windows. - El kit de herramientas CUDA se puede instalar dentro de WSL2 si su flujo de trabajo lo requiere; esto es independiente del controlador y no entra en conflicto con él.
Verifique la visibilidad de la GPU desde dentro de WSL2:
nvidia-smiSi esto muestra su tarjeta, Ollama, al ejecutarse dentro de WSL2, la utilizará automáticamente. Si falla, actualice el controlador del lado de Windows y vuelva a ejecutar wsl --update.
macOS — Metal (Apple Silicon y AMD)
En macOS, Ollama utiliza Apple Metal para la aceleración por GPU: no es necesario instalar controladores ni establecer variables de entorno. Si usa un Mac con chip Apple Silicon y Ollama se ejecuta lentamente, asegúrese de haber instalado la versión nativa ARM desde ollama.com y no la versión x86 ejecutándose bajo Rosetta. Los Mac con Apple Silicon utilizan memoria unificada, por lo que toda la RAM del sistema está disponible para los modelos: ingrese su RAM total como límite de VRAM al usar la opción Calculadora de VRAM.
Verificación de la solución y rendimiento esperado
Tras realizar los cambios, ejecute un modelo y compruebe simultáneamente dos indicadores:
# Terminal 1 — inicie una generación
ollama run llama3.2:8b "¿Cuál es la capital de Francia?"
# Terminal 2 — mientras se genera
ollama ps
# NVIDIA: también supervise la utilización de la GPU por segundo
nvidia-smi dmon -s uRendimiento de referencia (aproximado — varía según la cuantización, la versión del controlador y el ancho de banda PCIe):
| Hardware | Modelo | ~tok/s |
|---|---|---|
| RTX 4090 (24 GB) | Llama 3.1 8B Q4 | 120–160 |
| RTX 3080 (10 GB) | Llama 3.1 8B Q4 | 60–80 |
| Apple M3 Pro (memoria unificada) | Llama 3.1 8B Q4 | 40–60 |
| Solo CPU (Ryzen 9 7950X) | Llama 3.1 8B Q4 | 5–15 |
Un rendimiento de unos pocos tokens por segundo con una GPU capaz presente es la señal más clara de que la solución no ha surtido efecto.
Preguntas frecuentes
¿Por qué ollama ps muestra una división GPU/CPU en lugar de un 100 % en GPU?
El modelo es más grande que la VRAM disponible. Ollama coloca tantas capas como sea posible en la GPU y ejecuta el resto en la CPU. El resultado es más rápido que usar únicamente la CPU, pero más lento que usar únicamente la GPU. Cargue un modelo más pequeño o cambie a una cuantización inferior para trasladar más capas a la GPU.
Ollama estaba usando la GPU anteriormente y de repente dejó de hacerlo: ¿qué cambió?
Una actualización del controlador, del sistema operativo o de la versión de Ollama puede interrumpir la detección de la GPU. Verifique que nvidia-smi sigue mostrando la tarjeta y luego reinicie completamente el servicio. Si actualizó recientemente el controlador NVIDIA, a veces es necesario reiniciar completamente el sistema, no solo reiniciar el servicio.
¿Puede Ollama utilizar varias GPUs simultáneamente?
Sí. Ollama distribuye automáticamente las capas del modelo entre todas las GPUs visibles cuando hay más de una presente. Para restringir qué GPUs utiliza Ollama, establezca CUDA_VISIBLE_DEVICES (NVIDIA) o HIP_VISIBLE_DEVICES (AMD) antes de iniciar ollama serve.
¿Funciona Ollama con tarjetas gráficas GeForce de consumo, o necesito una GPU para centros de datos?
Las tarjetas GeForce GTX 10xx y posteriores están completamente compatibles: no se requiere ninguna GPU para centros de datos. El límite práctico para la mayoría de los usuarios es la VRAM: una tarjeta de 8 GB ejecuta cómodamente modelos de 7–8 mil millones de parámetros en cuantización Q4. Utilice el Calculadora de VRAM para verificar que un modelo específico quepa en su hardware antes de descargarlo.
Mi GPU tiene suficiente VRAM, pero Ollama sigue utilizando la CPU. ¿Por qué?
Otro proceso podría estar ocupando la VRAM; compruebe nvidia-smi para detectar otros consumidores, como un navegador con aceleración por hardware o cualquier otro modelo en ejecución. Es posible también que el modelo se haya cargado antes de que el controlador de la GPU estuviera listo. Detenga el modelo cargado mediante ollama stop <nombre>, libere la VRAM en otras aplicaciones y vuelva a cargar el modelo.
¿Dónde puedo obtener más información sobre la configuración de Ollama y la selección de modelos?
El Guía completa de Ollama cubre en profundidad las variables de entorno, la gestión de modelos y el uso de la API. Para elegir qué modelo ejecutar en su hardware específico, consulte la mejores modelos locales para Ollama.

