Monday, 3 August 2026 | Updating Daily AI insight, written for builders

Guía de Docker para Ollama (2026): Ejecuta Ollama en un contenedor con GPU

Ejecutando Ollama en Docker es la forma más limpia de mantener un servidor local de modelos reproducible: el mismo comando funciona en una laptop, un servidor doméstico y un servidor con GPU alquilado, sin que nada se «filtre» al sistema anfitrión. La configuración es breve, pero dos detalles —la transmisión de la GPU y la persistencia de volúmenes— suelen causar la mayor parte del tiempo perdido.

Quick answer

Descarga y ejecuta la imagen oficial con un volumen con nombre para que los modelos sobrevivan a los reinicios: docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama. Para una GPU NVIDIA, instala el «NVIDIA Container Toolkit» en el sistema anfitrión y añade --gpus=all. Luego descarga modelos dentro del contenedor con docker exec -it ollama ollama pull llama3.1. La API está disponible en el puerto 11434 exactamente igual que en una instalación nativa.

Los tres comandos clave

ObjetivoComando
Solo CPUdocker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Con GPU NVIDIAdocker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Descargar un modelodocker exec -it ollama ollama pull llama3.1

Transmisión de GPU: la parte que suele fallar

De forma predeterminada, un contenedor no puede ver tu GPU. En Linux, debes instalar el NVIDIA Container Toolkit en el sistema anfitrión, reiniciar Docker y añadir --gpus=all. Verifica que funcione desde dentro del contenedor con docker exec -it ollama nvidia-smi — si ese comando falla, Ollama se ejecutará, pero silenciosamente en la CPU, y concluirás erróneamente que tu GPU es lenta cuando en realidad simplemente no se está utilizando. En Windows, el camino correcto es usar Docker Desktop con el backend WSL2 y controladores NVIDIA actualizados. Los usuarios de AMD necesitan la imagen etiquetada como ROCm en lugar de la imagen predeterminada, y las GPUs de Apple Silicon no pueden pasarse a Docker en absoluto; en una Mac, ejecuta Ollama de forma nativa.

Conserva tus modelos entre reinicios

Los archivos de los modelos son grandes y lentos de volver a descargar, y un contenedor sin un volumen los descarta inmediatamente al eliminarse. La bandera -v ollama:/root/.ollama en todos los comandos anteriores crea un volumen con nombre que persiste entre reinicios, actualizaciones y cambios de imagen. Si prefieres almacenar los archivos en una ubicación accesible, monta un directorio del sistema anfitrión en lugar de usar un volumen: -v /srv/ollama:/root/.ollama.

docker compose, para una configuración que conserves

Para cualquier implementación permanente, un archivo docker-compose supera a un comando largo de ejecución: registra la reserva de GPU, el volumen y el puerto en un solo lugar, reinicia automáticamente el servicio y te permite añadir una interfaz web junto con él más adelante. El contenedor expone el mismo punto final compatible con OpenAI en http://localhost:11434, por lo que las aplicaciones no pueden distinguir entre una instalación contenerizada y una nativa.

Convly’s take

Conteneriza Ollama cuando la máquina es un servidor, y omite Docker cuando la máquina es tu laptop. En un servidor doméstico o un servidor con GPU alquilado, la combinación de volumen y docker-compose es realmente superior: reproducible, actualizable y fácil de trasladar. En una computadora personal —especialmente una Mac, donde la transmisión de GPU es imposible— Docker añade una capa que reduce el rendimiento y apenas aporta beneficios. El problema más común que observamos es un contenedor ejecutándose silenciosamente en la CPU porque nunca se instaló el toolkit; ejecuta «nvidia-smi» dentro del contenedor antes de realizar cualquier prueba de rendimiento.

Preguntas frecuentes

¿Soporta Ollama en Docker las GPUs?

Sí, con NVIDIA mediante el «NVIDIA Container Toolkit» y --gpus=all, y con AMD usando la imagen ROCm. Las GPUs de Apple Silicon no pueden exponerse a Docker: ejecuta Ollama de forma nativa en macOS.

¿Dónde se almacenan los modelos en la configuración con Docker?

Dentro del contenedor, en /root/.ollama. Asigna esa ruta a un volumen con nombre o a un directorio del sistema anfitrión; de lo contrario, los modelos desaparecerán al eliminar el contenedor.

¿Es más lento Ollama en Docker?

De forma insignificante en Linux con una transmisión adecuada de la GPU. La lentitud percibida casi siempre significa que el contenedor se está ejecutando en la CPU porque la GPU no se transmitió correctamente.

¿Puedo ejecutar varios modelos en un solo contenedor?

Sí: descarga tantos como desees; Ollama los carga bajo demanda. El límite es la memoria: solo los modelos cargados activamente consumen RAM o VRAM.

¿Eres nuevo en esta herramienta? Comienza con la Guía de instalación de Ollama, y consulta los requisitos de hardware en requisitos del sistema para Ollama, o ajustar el tamaño de un modelo con el calculadora de VRAM.

Escrito por Mustafa Ihsan

Mustafa Ihsan es fundador y editor de Convly.ai. Él creó y mantiene la base de datos en tiempo real de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para requisitos de VRAM, costos de API y economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas de rendimiento y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente cifras medibles a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That