Tuesday, 1 September 2026 | Updating Daily AI insight, written for builders

Ollama para Windows: guía de instalación y configuración

En resumen:

  • Descarga el instalador oficial desde ollama.com/download, ejecútalo y Ollama se instalará como un servicio en segundo plano
  • Requiere Windows 10 o posterior y al menos 8 GB de RAM; las GPUs NVIDIA/AMD se detectan automáticamente para aceleración
  • Ejecuta modelos con ollama run <modelo> desde el símbolo del sistema o PowerShell: no se requiere configuración adicional
  • Los modelos se instalan de forma predeterminada en %USERPROFILE%\.ollama\models ; puedes cambiar esta ubicación mediante la variable de entorno OLLAMA_MODELS Ollama en Windows es una aplicación nativa que ejecuta modelos de lenguaje grande localmente sin necesidad de Docker ni WSL2. El instalador para Windows configura Ollama como un servicio del sistema que se inicia automáticamente y proporciona aceleración por GPU mediante DirectML y CUDA. La instalación tarda menos de dos minutos y puedes ejecutar modelos como

Ollama en Windows es una aplicación nativa que ejecuta modelos de lenguaje grandes localmente sin necesidad de Docker ni WSL2. El instalador para Windows configura Ollama como un servicio del sistema que se inicia automáticamente y ofrece aceleración GPU mediante DirectML y CUDA. La instalación tarda menos de dos minutos y puedes ejecutar modelos como Llama 3.3 70B o Mistral 7B Requisitos del sistema para Ollama en Windows

Instalación de Ollama en Windows

Ollama requiere Windows 10 (compilación 1903 o posterior) o Windows 11. Las especificaciones mínimas de hardware son:

Componente Mínimo Recomendado
Windows 10 (1903+) Windows 11 16 GB o más
RAM 8 GB 50+ GB para varios modelos
Espacio en disco 10 GB libres GPU (opcional)
NVIDIA GTX 1050 o equivalente AMD NVIDIA RTX 3060 de 12 GB o superior La aceleración por GPU funciona con GPUs NVIDIA (CUDA 11.8 o posterior) y GPUs AMD recientes (mediante ROCm en Windows). El instalador incluye las bibliotecas GPU necesarias; no es necesario instalar CUDA por separado. Sin GPU, Ollama recurre a la inferencia en CPU, que es 5–10 veces más lenta, pero funcional para modelos pequeños.

La aceleración mediante GPU funciona con GPUs NVIDIA (CUDA 11.8 o posterior) y GPUs AMD recientes (mediante ROCm en Windows). El instalador incluye las bibliotecas necesarias para GPU; no es necesario instalar CUDA por separado. Sin una GPU, Ollama recurre a la inferencia en CPU, que es de 5 a 10 veces más lenta, pero funcional para modelos más pequeños.

requiere aproximadamente 4,5 GB de VRAM en cuantización de 4 bits, mientras que Llama 3.3 70B necesita unos 40 GB. Consulta la Mistral 7B para estimar los requisitos de cualquier modelo antes de descargarlo. Calculadora de VRAM El instalador oficial para Windows es un único ejecutable que gestiona todas las dependencias:

Compatibilidad y detección de GPU

Ejecuta el instalador —se requieren privilegios de administrador

  1. Descargar OllamaSetup.exe desde ollama.com/download
  2. Acepta la licencia y haz clic en Instalar (la ubicación predeterminada es
  3. C:\Program Files\Ollama El instalador finaliza en 30–60 segundos e inicia automáticamente el servicio de Ollama)
  4. Tras la instalación, abre el símbolo del sistema o PowerShell y verifica su correcto funcionamiento con:

Deberías ver una salida como

ollama --version

ollama version 0.x.x . El servicio de Ollama se ejecuta en segundo plano: verás un icono de Ollama en la bandeja del sistema cuando esté activo.Ollama detecta y utiliza automáticamente las GPUs disponibles en Windows. Para confirmar que la aceleración por GPU está funcionando:

Configuración y variables de entorno

Ollama detecta y utiliza automáticamente las GPU disponibles en Windows. Para confirmar que la aceleración por GPU está funcionando:

Mientras se carga el modelo, observa el Administrador de tareas (pestaña Rendimiento). Si aparece uso de GPU bajo «GPU 0» o «GPU 1», la aceleración está activa. En la primera ejecución, el modelo se descarga (entre 5 y 40 GB, según su tamaño) a

Mientras se carga el modelo, observe el Administrador de tareas (pestaña Rendimiento). Si aparece la utilización de la GPU bajo GPU 0 o GPU 1, la aceleración está activa. En la primera ejecución se descarga el modelo (de 5 a 40 GB, según su tamaño) a %USERPROFILE%\.ollama\modelsLos usuarios de NVIDIA con GPUs RTX 3060 o posteriores obtienen el mejor rendimiento gracias a sus 12+ GB de VRAM y las optimizaciones de las arquitecturas Ampere/Ada. El soporte para GPUs AMD en Windows está mejorando, pero aún queda atrás respecto a NVIDIA: espera una inferencia un 20–30 % más lenta en hardware AMD equivalente. Las GPUs Intel Arc no están oficialmente soportadas a septiembre de 2026.

Si Ollama no detecta tu GPU, comprueba que los controladores estén actualizados (NVIDIA: 537.13 o posterior; AMD: Adrenalin 23.11 o posterior). Normalmente, los mensajes de error de Ollama indican si la GPU fue omitida por falta de VRAM o por controladores ausentes.

Si Ollama no detecta su GPU, compruebe que los controladores de su GPU estén actualizados (NVIDIA: 537.13 o posterior, AMD: Adrenalin 23.11 o posterior). Normalmente, los mensajes de error de Ollama indican si la GPU se omitió debido a una cantidad insuficiente de VRAM o a la falta de controladores.

Ejecutando tu primer modelo

El ollama run descarga, carga e inicia una sesión interactiva con un modelo:

ollama run phi4

Esto descarga el modelo Phi-4 de Microsoft (aproximadamente 9 GB de VRAM en cuantización de 4 bits) y abre un prompt interactivo de chat. Escribe tu pregunta, pulsa Intro y el modelo responderá localmente. Sal con /adios o Ctrl+C.

Modelos comunes para probar en hardware Windows:

Modelo VRAM (4 bits) Ideal para
Mistral 7B ~4,5 GB Tareas generales, respuestas rápidas
Llama 3.1 8B ~5 GB Calidad y velocidad equilibradas
Phi-4 ~9 GB Razonamiento, tamaño compacto
Llama 3.3 70B ~40 GB GPU de gama alta, máxima calidad

Explora los modelos disponibles en Lista de modelos de Ollama o busca en la biblioteca con ollama list después de descargar al menos un modelo.

Ajuste del rendimiento

Ollama lee la configuración desde las variables de entorno de Windows. Establécelas en Propiedades del sistema → Variables de entorno o en PowerShell con $env:VARIABLE_NAME.

Variables clave:

  • OLLAMA_MODELS: Directorio para el almacenamiento de modelos (predeterminado: %USERPROFILE%\.ollama\models). Cámbialo si tu unidad C: tiene espacio limitado.
  • OLLAMA_HOST: Dirección del servidor (predeterminada: 127.0.0.1:11434). Establécela en 0.0.0.0:11434 para aceptar conexiones de red.
  • OLLAMA_NUM_PARALLEL: Número de solicitudes simultáneas (predeterminado: 1). Auméntala si atiendes a varios clientes.
  • OLLAMA_MAX_LOADED_MODELS: Modelos mantenidos en VRAM (predeterminado: 1). Establécela en 2 o más si dispones de 24 GB o más de VRAM y deseas cambiar entre modelos al instante.

Tras modificar las variables de entorno, reinicia el servicio Ollama desde Servicios (Win+R, escribe services.msc, busca Ollama, haz clic derecho y selecciona Reiniciar) o reinicia el equipo.

Para mover los modelos a otra unidad, configura OLLAMA_MODELS y luego reinicia el servicio. Los modelos existentes deben descargarse nuevamente; Ollama no los migra automáticamente.

Integración con aplicaciones

La velocidad de inferencia depende de la VRAM, el tamaño del modelo y el nivel de cuantización. Un modelo de 7 mil millones de parámetros con cuantización de 4 bits genera entre 30 y 60 tokens por segundo en una RTX 3060, mientras que los modelos de 70 mil millones de parámetros bajan a 3–8 tokens por segundo, a menos que dispongas de 48 GB o más de VRAM distribuidos entre varias GPU.

Las configuraciones multi-GPU funcionan automáticamente: Ollama distribuye las capas del modelo entre las GPU detectadas. Por ejemplo, dos RTX 3090 (24 GB cada una) pueden ejecutar Llama 3.3 70B a una velocidad aceptable, mientras que una sola RTX 3090 tendría que descargar capas a la memoria RAM del sistema y su rendimiento se vería muy afectado.

Si el rendimiento es más lento de lo esperado:

  • Revisa el Administrador de tareas durante la inferencia: un uso de CPU superior al 30 % indica que parte del modelo está en la memoria RAM del sistema debido a insuficiente VRAM
  • Prueba una cuantización menor (por ejemplo, ollama pull mistral:7b-instruct-q4_K_M en lugar de la predeterminada Q8)
  • Cierra otras aplicaciones que usen la GPU (navegadores con aceleración por hardware, juegos, editores de video)
  • Actualiza los controladores de tu GPU: los controladores NVIDIA más recientes mejoran la velocidad de inferencia un 5–10 % respecto a versiones antiguas de hace seis meses

Para actualizaciones de hardware, consulta la mejoras GPUs para modelos de lenguaje local guía de comparación de relación precio-rendimiento entre opciones de NVIDIA y AMD.

Pasos siguientes

Ollama expone una API REST en localhost:11434 compatible con la estructura de la API de OpenAI. Las aplicaciones que admiten puntos finales compatibles con OpenAI pueden apuntar a Ollama con cambios mínimos.

Ejemplo de comando curl para generar texto:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "Explica Docker en una frase"
}'

Algunas integraciones populares incluyen Open WebUI (interfaz web), Continue.dev (extensión para VS Code) y LangChain (Python). El servicio Ollama debe estar en ejecución para que funcionen las llamadas a la API; por defecto se inicia automáticamente al arrancar el sistema.

Preguntas frecuentes

¿Requiere Ollama WSL2 o Docker en Windows?

No. El instalador para Windows es una aplicación nativa que ejecuta Ollama como un servicio de Windows sin virtualización ni contenedores. Las versiones anteriores requerían Docker, pero la versión nativa para Windows eliminó esa dependencia a finales de 2024. Si instalaste Ollama antes de noviembre de 2024, desinstala la versión basada en Docker y descarga el instalador nativo actual.

¿Puedo usar Ollama sin conexión tras descargar los modelos?

Sí. Una vez que un modelo se ha descargado con ollama pull <modelo>, se almacena localmente y se ejecuta sin conexión a Internet. El único requisito de red es la descarga inicial: los modelos van desde 2 GB (modelos pequeños de 7B) hasta más de 80 GB (modelos grandes de 70B o superiores). Tras la descarga, puedes desconectarte de la red y Ollama seguirá funcionando normalmente.

¿Cuál es el costo de ejecutar modelos de Ollama comparado con las APIs?

Ollama es gratuito: solo pagas por el hardware y la electricidad. Compara esto con los costos de las API: Claude Sonnet 5 cobra $2,00 por cada millón de tokens de entrada, así que 10 millones de tokens (aproximadamente 7,5 millones de palabras) cuestan $20. Una configuración autoalojada alcanza el punto de equilibrio rápidamente si procesas volúmenes significativos. Usa la calculadora de autohospedaje frente a API calculadora de punto de equilibrio para estimar cuándo te compensa según tu volumen previsto de uso.

¿Qué modelos funcionan mejor en GPUs de consumo?

Para GPU con 8–12 GB de VRAM (RTX 3060, 4060 Ti), Mistral 7B (~4,5 GB en cuantización de 4 bits), Llama 3.1 8B (~5 GB) y Phi-4 (~9 GB) ofrecen excelentes relaciones calidad-rendimiento. Si dispones de 16–24 GB (RTX 3090, 4090), Mistral NeMo 12B (~7,5 GB) e incluso Llama 3.3 70B (~40 GB con cuantización agresiva u offloading) se vuelven viables. Consulta la Requisitos de VRAM por modelo lista completa.

¿Puede Ollama utilizar simultáneamente GPUs NVIDIA y AMD?

No. Ollama utiliza CUDA (para NVIDIA) o ROCm (para AMD), según lo que detecte primero, pero no puede mezclar backends de GPU en una misma sesión. Si tienes tanto GPUs NVIDIA como AMD, Ollama prioriza NVIDIA. El soporte multi-GPU funciona únicamente cuando todas las GPUs usan la misma pila de controladores: dos tarjetas NVIDIA o dos tarjetas AMD, pero no una de cada tipo.

¿Cómo puedo desinstalar Ollama en Windows?

Abre Configuración → Aplicaciones → Aplicaciones instaladas, busca Ollama y haz clic en Desinstalar. Esto elimina la aplicación y el servicio, pero deja los modelos en %USERPROFILE%.ollama. Elimina manualmente esa carpeta para recuperar espacio en disco. Si el servicio no se detiene durante la desinstalación, abre el Administrador de tareas, busca OllamaService.exe en Procesos en segundo plano y finalízalo antes de intentarlo de nuevo.

Ollama requiere Windows 10 (compilación 1903 o posterior) o Windows 11. Las especificaciones mínimas de hardware son:

Tras instalar Ollama en Windows, explora la biblioteca completa de modelos en Guía completa de Ollama para comprender cómo la selección de modelos, la cuantización y las ventanas de contexto afectan la calidad. Para cargas de trabajo en producción, calcula los costos continuos de la API frente al autoalojamiento mediante la Calculadora de costos de API calculadora de punto de equilibrio para determinar si la inferencia local o las API en la nube se ajustan mejor a tu presupuesto y necesidades de escala.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top