Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Cómo instalar Ollama en 2026: Mac, Windows y Linux (paso a paso)

Actualizado · Publicado originalmente el 6 de junio de 2026

Instalar Ollama es realmente una tarea de dos minutos en todos los sistemas operativos principales. Esta guía te proporciona los pasos exactos para Mac, Windows y Linux, te muestra cómo ejecutar tu primer modelo y aborda los pocos errores con los que realmente se encuentran los usuarios.

¿Eres nuevo en esta herramienta? Comienza con qué es Ollama y cómo funciona, luego regresa aquí para instalarlo.

Quick answer: How do you install Ollama?

Installing Ollama is a download-and-run process that takes around two minutes on every major operating system. On macOS, download the app from ollama.com or run brew install ollama; on Windows, run the official installer, which is native and needs no WSL; on Linux, run the one-liner curl -fsSL https://ollama.com/install.sh | sh. Then pull and run your first model with ollama run gemma4, and confirm it works when the local API answers at http://localhost:11434.

  • macOS: download the app from ollama.com or run brew install ollama.
  • Windows: run the official .exe installer — native, no WSL required — then check ollama --version.
  • Linux: un solo comando: curl -fsSL https://ollama.com/install.sh | sh.
  • First model to run: ollama run gemma4 downloads and runs a strong all-rounder in a single command.
  • RAM you need: roughly as much free RAM (or VRAM) as the quantized model size — around 4–5 GB for a 7B model and about 8 GB for a 13B model.

Conclusiones clave

  • Mac: descarga la aplicación desde ollama.com o brew install ollama.
  • Windows: descarga y ejecuta el instalador oficial: nativo, sin necesidad de WSL.
  • Linux: un solo comando: curl -fsSL https://ollama.com/install.sh | sh.
  • Primer modelo: ollama run gemma4 descarga y ejecuta un modelo equilibrado y potente.
  • Verifica que funcione: la API responde en http://localhost:11434.

Antes de instalar: ¿puede tu equipo ejecutarlo?

Ollama en sí es muy ligero, pero los modelos modelos no lo son. Una regla práctica rápida: necesitas aproximadamente tanta memoria RAM libre (o VRAM) como el tamaño del modelo cuantizado —unos 4–5 GB para un modelo de 7B, 8 GB para un modelo de 13B y mucho más para los modelos grandes. Si no estás seguro de qué puede manejar tu hardware, consulta nuestra guía de requisitos del sistema para Ollama primero, para elegir un modelo que realmente se ajuste a tus capacidades.

Instalar en macOS

La ruta más sencilla es la aplicación nativa:

  1. Ve a ollama.com/download y descarga la aplicación para macOS.
  2. Abre el archivo .dmg y arrastra Ollama a la carpeta Aplicaciones.
  3. Inícialo: Ollama se ejecuta en segundo plano y el comando ollama queda disponible en tu terminal.

¿Prefieres la línea de comandos? Usa Homebrew:

brew install ollama

En equipos con chips Apple Silicon (M1–M5), Ollama utiliza automáticamente la GPU mediante el backend MLX de Apple (desde la versión v0.19), por lo que obtienes inferencia rápida sin necesidad de configuración adicional.

Instalar en Windows

Ollama se ejecuta de forma nativa en Windows: ya no necesitas WSL:

  1. Descarga el instalador para Windows desde ollama.com/download.
  2. Ejecuta el archivo .exe y sigue las instrucciones.
  3. Abrir PowerShell o Símbolo del sistema y escribe ollama --version para confirmar que se ha instalado correctamente.

Si tienes una GPU NVIDIA, Ollama la detecta automáticamente y utiliza CUDA. No se requieren ajustes complejos de los controladores, siempre que tus controladores de GPU estén actualizados.

Instalar en Linux

Un solo comando lo hace todo:

curl -fsSL https://ollama.com/install.sh | sh

Esto instala Ollama y lo configura como un servicio systemd que se inicia automáticamente al arrancar. Para confirmar que está en ejecución:

systemctl status ollama

En Ubuntu y la mayoría de las distribuciones, el instalador detecta automáticamente las GPUs NVIDIA y AMD y configura el backend adecuado. En el caso específico de tarjetas AMD, asegúrate de tener instalado ROCm; consulta nuestro análisis detallado sobre ROCm frente a CUDA para conocer el estado del soporte de AMD en 2026.

Ejecuta tu primer modelo

Una vez instalado Ollama, puedes descargar y ejecutar un modelo con un solo comando:

ollama run gemma4

En la primera ejecución se descarga el modelo (varios gigabytes) y luego se abre un prompt interactivo de chat. Escribe una pregunta y obtén una respuesta —todo localmente, en tu propia máquina. Algunos comandos útiles son:

  • ollama list — muestra los modelos que ya has descargado.
  • ollama pull qwen3 — descarga un modelo sin ejecutarlo.
  • ollama rm gemma4 — elimina un modelo para recuperar espacio en disco.
  • ollama ps — muestra qué modelos están actualmente cargados en memoria.

¿No estás seguro de qué modelo elegir para empezar? Nuestra guía sobre los mejores LLM locales en Ollama relaciona modelos con casos de uso y hardware específicos.

Verifica que la API se esté ejecutando

Ollama expone una API REST en el puerto 11434. Para confirmar que está activa, ejecuta:

curl http://localhost:11434/api/tags

Una respuesta JSON que enumera tus modelos significa que todo funciona correctamente. Este punto final es con el que se comunicarán tus propias aplicaciones; además, como Ollama ofrece una API compatible con OpenAI, gran parte del código existente funcionará simplemente cambiando la URL base.

Problemas comunes durante la instalación y sus soluciones

  • «ollama: comando no encontrado» (Mac/Linux): la aplicación se ha instalado, pero no está en tu variable de entorno PATH. En Mac, asegúrate de haber iniciado la aplicación al menos una vez; en Linux, abre una nueva terminal tras la instalación.
  • Las descargas de modelos son lentas o se interrumpen: Ollama descarga archivos grandes; una descarga interrumpida suele resolverse ejecutando nuevamente ollama pull <modelo> —el proceso se reanuda desde donde se quedó, sin reiniciar desde cero.
  • La GPU no se está utilizando: comprueba ollama ps —si muestra un uso del 100 % de la CPU, es posible que tus controladores de GPU estén desactualizados o que el modelo sea demasiado grande para caber en la VRAM, por lo que se ha trasladado parcialmente a la CPU. Prueba con un modelo más pequeño o más cuantizado.
  • Errores de «memoria insuficiente»: el modelo es más grande que la RAM/VRAM disponible. Descarga una versión con menor cuantización (busca variantes etiquetadas como q4 ), o bien un modelo de tamaño reducido. Nuestra guía de requisitos del sistema guía de compatibilidad de modelos
  • indica qué modelos caben en cada tipo de hardware. El puerto 11434 ya está en uso:ollama ps hay otra instancia de Ollama en ejecución. Deténla (

Configurar Ollama tras la instalación: almacenamiento, memoria e interfaz gráfica

Instalar Ollama es la parte más sencilla. Unos pocos ajustes determinan si pasa desapercibido o, en cambio, consume silenciosamente su disco duro y su memoria RAM. Todos ellos son variables de entorno, y su ubicación depende del sistema operativo: en macOS use launchctl setenv, en Linux edite el servicio mediante systemctl edit ollama.service y agregue una línea Environment= ; en Windows, añada una variable de entorno de usuario desde Configuración. Reinicie Ollama tras cualquier cambio para que este surta efecto.

Las cuatro variables más importantes son:

  • OLLAMA_MODELS — cambia la ubicación donde se almacenan los modelos. Estos suelen ser muy grandes, y la ubicación predeterminada está en la unidad del sistema (~/.ollama/models en macOS, /usr/share/ollama/.ollama/models en Linux, C:\Users\<usuario>\.ollama\models en Windows). Apunte esta variable hacia una unidad más grande o más rápida antes de descargar varios modelos. En Linux, asegúrese de que el usuario tenga permisos de lectura y escritura sobre el nuevo directorio. ollama user puede leer y escribir el nuevo directorio.
  • OLLAMA_KEEP_ALIVE — tiempo que un modelo permanece en memoria tras una solicitud. El valor predeterminado es 5 minutos. Establézcalo en -1 para mantener el modelo cargado en memoria y evitar retrasos en la primera solicitud, o en 0 para descargarlo inmediatamente y liberar la VRAM en cuanto finalice su uso.
  • OLLAMA_CONTEXT_LENGTH — tamaño de la ventana de contexto. Ollama usa por defecto un valor conservador de 4096 tokens, por lo que los documentos largos se truncan silenciosamente. Auméntelo (por ejemplo, a 8192 o más) si su modelo lo soporta, y combínelo con OLLAMA_FLASH_ATTENTION=1 para reducir el costo adicional de memoria.
  • OLLAMA_HOST — dirección a la que se enlaza el servidor. Por defecto, Ollama solo escucha en 127.0.0.1:11434, por lo que ningún otro dispositivo de su red puede acceder a él. Establézcalo en 0.0.0.0:11434 para usar Ollama desde otra máquina, un teléfono o un contenedor Docker.

Una advertencia importante sobre esta última opción: la API de Ollama no incluye autenticación integrada. Enlazado a 0.0.0.0 significa que cualquiera capaz de acceder al puerto 11434 podrá ejecutar modelos en su hardware. Hágalo únicamente en una LAN de confianza y coloque el servicio detrás de un proxy inverso o una regla de firewall si la máquina está expuesta.

Por último, la línea de comandos es adecuada para pruebas, pero resulta tediosa para el uso diario. La solución habitual es Open WebUI, una interfaz autohospedada estilo ChatGPT que se comunica con su instancia local de Ollama. La forma más rápida es mediante Docker: el contenedor escucha internamente en el puerto 8080, así que asigne ese puerto a uno del host usando -p 3000:8080 y abra http://localhost:3000, luego configúrelo para que apunte a su instancia de Ollama. Obtendrá historial de conversaciones, cambio entre modelos y carga de documentos, todo ejecutándose íntegramente en su propia máquina.

Preguntas frecuentes

¿Cómo instalo Ollama en Windows?

Descarga el instalador nativo desde ollama.com/download y ejecuta el archivo .exe. Ollama se ejecuta de forma nativa en Windows sin necesidad de WSL, y utiliza automáticamente una GPU NVIDIA mediante CUDA si dispones de una. Confirma la instalación ejecutando ollama --version en PowerShell.

¿Cómo instalo Ollama en Linux?

Ejecutar curl -fsSL https://ollama.com/install.sh | sh. Esto instala Ollama y lo registra como un servicio systemd. Verifíquelo con systemctl status ollama. El instalador detecta automáticamente las GPU de NVIDIA y AMD.

¿Puedo instalar Ollama con Homebrew?

Sí: brew install ollama funciona en macOS. La aplicación nativa de ollama.com es igualmente buena e incluye una presencia en la barra de menú; la opción de Homebrew resulta práctica si gestionas todo desde la línea de comandos.

¿Dónde almacena Ollama los modelos?

De forma predeterminada, en Mac y Linux en ~/.ollama/models, y en Windows dentro del perfil de usuario. Los modelos pueden ocupar varios gigabytes cada uno, así que use ollama list para supervisar qué ha descargado y ollama rm <modelo> para limpiarlos.

¿Es seguro instalar Ollama?

Sí. Ollama es de código abierto (licencia MIT) y está ampliamente adoptado. Se aplica la precaución habitual respecto al instalador de una sola línea para Linux: es el script oficial del proyecto, pero, si lo prefiere, puede descargar e inspeccionar install.sh antes de ejecutarlo.

¿Por qué Ollama sigue cortando los prompts o documentos largos?

Ollama utiliza de forma predeterminada una ventana de contexto de 4096 tokens, independientemente de la capacidad real del modelo, por lo que las entradas más largas se truncan sin advertencia. Auméntela iniciando el servidor con OLLAMA_CONTEXT_LENGTH un valor mayor (por ejemplo, 8192 o más), hasta el límite admitido por el modelo. Un contexto más amplio consume más memoria, así que active OLLAMA_FLASH_ATTENTION=1 para compensar ese costo y supervise su margen disponible de RAM o VRAM.

¿Cómo accedo a Ollama desde otro equipo de mi red?

De forma predeterminada, Ollama solo escucha en localhost, por lo que es invisible para otros dispositivos. Establezca OLLAMA_HOST=0.0.0.0:11434 y reinícielo; luego, conéctese utilizando la dirección IP local (LAN) de la máquina anfitriona en el puerto 11434. Tenga en cuenta que la API no dispone de autenticación, así que expóngala únicamente en una red de confianza y utilice una regla de firewall o un proxy inverso si la máquina es accesible desde fuera de su hogar u oficina.

¿Cómo evito que Ollama recargue el modelo en cada solicitud?

Ese retraso se debe a que el modelo se descarga de la memoria entre usos. Por defecto, Ollama mantiene cargado un modelo durante 5 minutos; establezca OLLAMA_KEEP_ALIVE=-1 para mantenerlo cargado indefinidamente y lograr respuestas instantáneas a los prompts. La contrapartida es que el modelo ocupará su RAM o VRAM en todo momento, así que use 0 si prefiere liberar esa memoria inmediatamente al finalizar cada solicitud.

Conclusión

En cualquier sistema operativo, instalar Ollama consiste simplemente en descargarlo y ejecutarlo, lo que lleva aproximadamente dos minutos, y su primer modelo local está a un solo comando de distancia. Elija un modelo compatible con su hardware, confirme que la API responde en el puerto 11434, y ya tendrá un modelo de lenguaje grande (LLM) privado y gratuito funcionando en su propia máquina. A partir de aquí, explore qué modelos ejecutar y cuántos recursos de hardware requiere cada uno.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Él creó y mantiene la base de datos en tiempo real de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para requisitos de VRAM, costos de API y economía del autohospedaje. Escribe sobre precios de modelos, resultados de benchmarks y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos cuantificables a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That