Friday, 14 August 2026 | Updating Daily AI insight, written for builders

Ollama no utiliza la GPU: diagnóstico y solución del uso forzado de la CPU

  • Ejecutar ollama ps mientras se carga un modelo: la columna PROCESADOR indica si Ollama está utilizando la GPU o la CPU.
  • La solución más habitual en sistemas NVIDIA consiste en instalar o actualizar el controlador del sistema anfitrión para que nvidia-smi detecte la tarjeta gráfica y, a continuación, reiniciar el servicio de Ollama.
  • Si el modelo es más grande que su VRAM, Ollama descarga capas a la CPU; utilice la Calculadora de VRAM para comprobar si su modelo cabe antes de descargarlo.
  • AMD, Docker y WSL2 requieren pasos específicos para cada plataforma, explicados a continuación.

Cuando Ollama no utiliza su GPU, la causa más frecuente es un controlador ausente o incompatible. Ejecute ollama ps —si la columna PROCESADOR muestra 100 % CPU, Ollama ha pasado completamente a la CPU. La solución depende de su plataforma: NVIDIA necesita el entorno de ejecución CUDA adecuado, AMD requiere ROCm y Docker necesita banderas explícitas de paso de GPU.

Paso 1: Confirmar si Ollama está utilizando la GPU

Antes de realizar cualquier cambio, verifique lo que Ollama está haciendo realmente. Cargue un modelo y, mientras se esté ejecutando, abra una segunda terminal:

ollama ps

Salida de ejemplo:

NOMBRE              ID              TAMAÑO      PROCESADOR    HASTA
llama3.2:8b       abc123def456    5,0 GB      100 % GPU     dentro de 4 minutos

La columna PROCESADOR es la señal definitiva:

Valor de PROCESADORSignificado
100 % GPUTodas las capas en la GPU — comportamiento esperado y correcto
XX % GPU / YY % CPUEl modelo cabe parcialmente en la VRAM; las capas restantes se ejecutan en la CPU
100 % CPUUso forzado completo de la CPU — la GPU no se utiliza en absoluto

En sistemas NVIDIA, compruebe también con nvidia-smi mientras se realiza la inferencia. La columna Uso de memoria debería aumentar conforme se carga el modelo. Si permanece constante, la GPU está inactiva, independientemente de lo que indiquen otras herramientas.

Paso 2: NVIDIA — Controladores y entorno de ejecución CUDA

La ausencia o desactualización del controlador NVIDIA es la causa más común de uso forzado completo de la CPU. Aunque Ollama incluye sus propias bibliotecas CUDA, sigue requiriendo un controlador del sistema anfitrión compatible con CUDA 11.3 o posterior.

Compruebe primero el controlador

nvidia-smi

Si el comando no se encuentra, no hay ningún controlador instalado. Si se ejecuta, anote la versión del controlador y la versión de CUDA que aparecen en el encabezado. La versión de CUDA mostrada corresponde a la versión máxima que soporta dicho controlador —no implica que se haya instalado por separado el kit de herramientas CUDA, y Ollama no lo requiere.

PlataformaVersión mínima del controlador
Linux525.xx (compatible con CUDA 12.0)
Windows nativo527.xx (compatible con CUDA 12.0)
WSL2 (anfitrión Windows)525.xx en el lado de Windows — no instale el controlador NVIDIA para Linux dentro de WSL2

Instale o actualice el controlador

Ubuntu / Debian:

sudo apt install nvidia-driver-550
sudo reboot

Windows: Descárguelo desde nvidia.com/Download o use GeForce Experience, y luego reinicie el sistema. Tras instalar o actualizar el controlador, es obligatorio reiniciar completamente el sistema —no basta con reiniciar únicamente el servicio.

Tras el reinicio, confirme que nvidia-smi muestra su tarjeta gráfica y reinicie Ollama:

# Linux (systemd)
sudo systemctl restart ollama

# macOS
launchctl kickstart -k gui/$(id -u)/com.ollama.ollama

# Windows — reinicie la aplicación de Ollama en la bandeja del sistema o reinicie el equipo

Ejecute un modelo y vuelva a comprobar ollama ps . Si la columna PROCESADOR sigue mostrando 100 % CPU, continúe con los siguientes pasos.

Paso 3: Modelo demasiado grande para la VRAM

Cuando los pesos de un modelo superan la VRAM disponible, Ollama no rechaza su ejecución, sino que divide la inferencia. Se asignan tantas capas del transformador como sea posible a la GPU; el resto se ejecuta en la CPU. Esto aparece como un porcentaje dividido en ollama ps y constituye un comportamiento intencional, no un error.

Un modelo de 70 mil millones de parámetros con cuantización Q4_K_M suele requerir aproximadamente 40 GB de VRAM, lo cual supera la capacidad de cualquier GPU de consumo individual. Antes de descargar un modelo grande, compruebe si cabe mediante la Calculadora de VRAM. Para conocer los requisitos de VRAM por modelo entre los LLM más populares, consulte Requisitos de VRAM para cada LLM importante.

Si el modelo no cabe en su VRAM, tiene las siguientes opciones:

  • Utilice una cuantización inferior (por ejemplo, Q2_K o Q3_K_S), lo que reduce el uso de VRAM con una ligera pérdida de calidad.
  • Cambie a una variante de modelo más pequeña (por ejemplo, 8B en lugar de 70B). La página mejores modelos locales para Ollama explica qué modelos funcionan bien en hardware de consumo.
  • Acepte la descarga parcial —el rendimiento estará entre los valores correspondientes al uso exclusivo de GPU y al uso exclusivo de CPU.
  • Actualice su GPU. La mejoras GPUs para modelos de lenguaje local esta guía compara las opciones actuales según la cantidad de VRAM y el precio.

Paso 4: GPU AMD y ROCm

El soporte para AMD en Ollama se basa en ROCm, la plataforma de cómputo GPU de AMD. Ollama admite oficialmente las tarjetas RDNA 2 (serie RX 6000) y RDNA 3 (serie RX 7000) en Linux. El soporte para AMD en Windows es limitado: consulte las notas de la versión de Ollama instalada antes de esperar que funcione en Windows.

Verifique que ROCm detecte la tarjeta

rocm-smi

Si rocm-smi no se encuentra, la pila ROCm no está instalada. Consulte amd.com/es/developer/rocm para obtener las instrucciones de instalación actuales para su distribución, ya que los nombres de los paquetes y los requisitos de versión cambian entre versiones de ROCm.

Si la tarjeta no aparece en la salida de rocm-smi después de la instalación:

sudo usermod -aG render,video $USER
# Cierre y vuelva a iniciar sesión para que el cambio de grupo surta efecto

Para dirigirse a una GPU específica cuando hay varias presentes:

HIP_VISIBLE_DEVICES=0 ollama serve

Paso 5: Docker — Falta el paso de GPU

Los contenedores Docker no tienen acceso a la GPU a menos que se le pase explícitamente el dispositivo. Esta es la causa más común por la que Ollama recurre a la CPU en despliegues con contenedores: la GPU del host funciona correctamente, pero el contenedor no puede verla.

NVIDIA en Docker

Instale la herramienta NVIDIA Container Toolkit en el host:

sudo apt install nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Luego pase la GPU al iniciar el contenedor:

docker run -d --gpus all 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama

Sin la opción --gpus all (o --gpus device=0 (para especificar una tarjeta concreta), el contenedor no tendrá acceso a la GPU, independientemente de la configuración del host.

AMD en Docker

docker run -d 
  --device /dev/kfd --device /dev/dri 
  -v ollama:/root/.ollama 
  -p 11434:11434 
  ollama/ollama:rocm

El :rocm la etiqueta de imagen es obligatoria. La imagen predeterminada ollama/ollama no incluye ROCm y recurrirá a la CPU en hardware AMD.

Paso 6: WSL2 en Windows

WSL2 puede compartir la GPU NVIDIA con el host Windows, pero existe una regla absoluta: el controlador NVIDIA debe instalarse en WindowsWindows

  • Instale o actualice el controlador NVIDIA en Windows y reinicie el sistema.
  • WSL2 requiere un kernel 5.10.43 o posterior. Compruébelo ejecutando uname -r dentro de WSL2; actualícelo mediante wsl --update en una terminal de Windows.
  • El kit de herramientas CUDA se puede instalar dentro de WSL2 si su flujo de trabajo lo requiere; esto es independiente del controlador y no entra en conflicto con él.

Verifique la visibilidad de la GPU desde dentro de WSL2:

nvidia-smi

Si esto muestra su tarjeta, Ollama, al ejecutarse dentro de WSL2, la utilizará automáticamente. Si falla, actualice el controlador del lado de Windows y vuelva a ejecutar wsl --update.

macOS — Metal (Apple Silicon y AMD)

En macOS, Ollama utiliza Apple Metal para la aceleración por GPU: no es necesario instalar controladores ni establecer variables de entorno. Si usa un Mac con chip Apple Silicon y Ollama se ejecuta lentamente, asegúrese de haber instalado la versión nativa ARM desde ollama.com y no la versión x86 ejecutándose bajo Rosetta. Los Mac con Apple Silicon utilizan memoria unificada, por lo que toda la RAM del sistema está disponible para los modelos: ingrese su RAM total como límite de VRAM al usar la opción Calculadora de VRAM.

Verificación de la solución y rendimiento esperado

Tras realizar los cambios, ejecute un modelo y compruebe simultáneamente dos indicadores:

# Terminal 1 — inicie una generación
ollama run llama3.2:8b "¿Cuál es la capital de Francia?"

# Terminal 2 — mientras se genera
ollama ps

# NVIDIA: también supervise la utilización de la GPU por segundo
nvidia-smi dmon -s u

Rendimiento de referencia (aproximado — varía según la cuantización, la versión del controlador y el ancho de banda PCIe):

HardwareModelo~tok/s
RTX 4090 (24 GB)Llama 3.1 8B Q4120–160
RTX 3080 (10 GB)Llama 3.1 8B Q460–80
Apple M3 Pro (memoria unificada)Llama 3.1 8B Q440–60
Solo CPU (Ryzen 9 7950X)Llama 3.1 8B Q45–15

Un rendimiento de unos pocos tokens por segundo con una GPU capaz presente es la señal más clara de que la solución no ha surtido efecto.

Preguntas frecuentes

¿Por qué ollama ps muestra una división GPU/CPU en lugar de un 100 % en GPU?

El modelo es más grande que la VRAM disponible. Ollama coloca tantas capas como sea posible en la GPU y ejecuta el resto en la CPU. El resultado es más rápido que usar únicamente la CPU, pero más lento que usar únicamente la GPU. Cargue un modelo más pequeño o cambie a una cuantización inferior para trasladar más capas a la GPU.

Ollama estaba usando la GPU anteriormente y de repente dejó de hacerlo: ¿qué cambió?

Una actualización del controlador, del sistema operativo o de la versión de Ollama puede interrumpir la detección de la GPU. Verifique que nvidia-smi sigue mostrando la tarjeta y luego reinicie completamente el servicio. Si actualizó recientemente el controlador NVIDIA, a veces es necesario reiniciar completamente el sistema, no solo reiniciar el servicio.

¿Puede Ollama utilizar varias GPUs simultáneamente?

Sí. Ollama distribuye automáticamente las capas del modelo entre todas las GPUs visibles cuando hay más de una presente. Para restringir qué GPUs utiliza Ollama, establezca CUDA_VISIBLE_DEVICES (NVIDIA) o HIP_VISIBLE_DEVICES (AMD) antes de iniciar ollama serve.

¿Funciona Ollama con tarjetas gráficas GeForce de consumo, o necesito una GPU para centros de datos?

Las tarjetas GeForce GTX 10xx y posteriores están completamente compatibles: no se requiere ninguna GPU para centros de datos. El límite práctico para la mayoría de los usuarios es la VRAM: una tarjeta de 8 GB ejecuta cómodamente modelos de 7–8 mil millones de parámetros en cuantización Q4. Utilice el Calculadora de VRAM para verificar que un modelo específico quepa en su hardware antes de descargarlo.

Mi GPU tiene suficiente VRAM, pero Ollama sigue utilizando la CPU. ¿Por qué?

Otro proceso podría estar ocupando la VRAM; compruebe nvidia-smi para detectar otros consumidores, como un navegador con aceleración por hardware o cualquier otro modelo en ejecución. Es posible también que el modelo se haya cargado antes de que el controlador de la GPU estuviera listo. Detenga el modelo cargado mediante ollama stop <nombre>, libere la VRAM en otras aplicaciones y vuelva a cargar el modelo.

¿Dónde puedo obtener más información sobre la configuración de Ollama y la selección de modelos?

El Guía completa de Ollama cubre en profundidad las variables de entorno, la gestión de modelos y el uso de la API. Para elegir qué modelo ejecutar en su hardware específico, consulte la mejores modelos locales para Ollama.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That