- Ollama Cloud se refiere a ejecutar Ollama en infraestructura en la nube (AWS, GCP, Azure) en lugar de en hardware local: misma CLI y misma API, pero ejecución remota.
- Todos los modelos de la biblioteca de Ollama funcionan en instancias en la nube; usted paga por hora por la potencia computacional de la GPU en lugar de comprar hardware.
- El punto de equilibrio varía según el uso: la calculadora de autohospedaje frente a API muestra cuándo las GPUs en la nube resultan más económicas que la compra de hardware local.
- Compromiso de privacidad: alojar en la nube implica que sus indicaciones (prompts) y respuestas transitan por la red y pasan por la infraestructura del proveedor, a diferencia de la inferencia completamente local.
Las implementaciones en la nube de Ollama ejecutan el mismo servidor de Ollama que instalaría localmente, pero en instancias de GPU alquiladas de AWS, Google Cloud, Azure u otros proveedores. Obtiene la misma biblioteca de modelos, los mismos ollama run comandos y la misma API REST, pero la inferencia se lleva a cabo en hardware remoto por el cual paga por hora, en lugar de en hardware que usted posee. Esta guía explica cuándo tiene sentido optar por el alojamiento en la nube, cómo se comparan los precios con las GPUs locales y qué sacrifica en términos de privacidad y control.
- Qué significa Ollama Cloud
- Cómo difiere Ollama en la nube de Ollama local
- Compatibilidad de CLI y API
- Qué modelos están disponibles
- Precios: nube frente a local frente a servicios de API
- Privacidad y control de los datos
- Cuándo elegir la nube en lugar de hardware local
- Configuración de Ollama en una instancia en la nube
- Consideraciones de rendimiento
- Preguntas frecuentes
Qué significa Ollama Cloud
No existe un producto independiente denominado «Ollama Cloud» a principios de 2026. Cuando los desarrolladores hablan de «Ollama en la nube», se refieren a una de estas dos opciones:
- Ollama autohospedado en máquinas virtuales en la nube: Alquila una máquina virtual con GPU de AWS EC2, Google Compute Engine, Azure, Lambda Labs o RunPod, instala Ollama usted mismo y ejecuta modelos allí. Usted gestiona la instancia, pero no adquiere hardware físico.
- Servicios gestionados de Ollama: Plataformas de terceros que instalan previamente Ollama, gestionan la escalabilidad y le facturan por solicitud o por minuto. Son menos comunes y suelen basarse en el enfoque número 1.
Ambos contrastan con la ejecución de Ollama localmente en su propio equipo de escritorio o servidor. El binario de Ollama, la biblioteca de modelos, la interfaz de línea de comandos (CLI) y la API siguen siendo idénticos; únicamente cambia la ubicación de ejecución.
Cómo difiere Ollama en la nube de Ollama local
| Dimensión | Ollama local | Ollama en la nube |
|---|---|---|
| Coste del hardware | Compra inicial de GPU (500–2500 USD) | Alquiler por hora (0,50–5 USD/hora, según la GPU) |
| Velocidad de inferencia | Depende de su GPU; sin latencia de red | Depende de la GPU alquilada; añade un tiempo de ida y vuelta por red de 20–100 ms |
| Privacidad | Los prompts nunca salen de su equipo | Los prompts y las respuestas viajan por la red; el proveedor en la nube ve los metadatos del tráfico |
| Escalabilidad | Fija según su hardware | Puede iniciar instancias más grandes o adicionales bajo demanda |
| Mantenimiento | Usted gestiona el sistema operativo, los controladores y las actualizaciones de Ollama | Usted gestiona la máquina virtual (si la hospeda usted mismo) o la plataforma lo hace por usted (en servicios gestionados) |
| Disponibilidad | Depende del tiempo de actividad de su equipo | Si mantiene la instancia en ejecución, estará siempre disponible; paga también por el tiempo de inactividad |
La experiencia funcional es idéntica. Un script que llama a curl http://localhost:11434/api/generate funciona sin cambios si sustituye localhost por la dirección IP pública de su instancia en la nube.
Compatibilidad de CLI y API
La CLI y la API REST de Ollama son independientes del transporte. Para configurar la CLI para que apunte a una instancia en la nube en lugar de a un servidor local:
export OLLAMA_HOST=http://203.0.113.42:11434
ollama run llama3.1:8bSustituya 203.0.113.42 por la dirección IP pública de su máquina virtual en la nube. El modelo se descarga a la instancia en la nube y la inferencia se ejecuta allí. Su terminal recibe las respuestas mediante transmisión por red.
Para clientes de la API, cambie la URL base:
curl http://203.0.113.42:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Explica las redes neuronales en una sola oración."
}'Todos los puntos finales (/api/generate, /api/chat, /api/embeddings) se comportan de forma idéntica. Las bibliotecas cliente (Python, JavaScript, Go) aceptan un parámetro personalizado de host:
import ollama
client = ollama.Client(host='http://203.0.113.42:11434')
response = client.chat(model='llama3.1:8b', messages=[...])No se requieren cambios en el código más allá de la URL del punto final.
Qué modelos están disponibles
Cada modelo de la biblioteca de Ollama funciona en instancias en la nube. La Lista de modelos de Ollama incluye Llama 3.1, Mistral, Gemma 2, Qwen, Phi, DeepSeek, y docenas de otros. La disponibilidad de modelos no está restringida por la ubicación donde se ejecute Ollama.
La limitación radica en la VRAM de la GPU. Una instancia en la nube con una NVIDIA L4 (24 GB de VRAM) puede ejecutar los mismos modelos cuantizados que una RTX 4090 local. Una instancia más pequeña con 16 GB de VRAM queda limitada a modelos más pequeños o a una cuantización más agresiva, tal como ocurre con el hardware local. Utilice la Calculadora de VRAM para determinar qué tipo de instancia necesita para un modelo y nivel de cuantización determinados.
Precios: nube frente a local frente a servicios de API
Los precios de las GPU en la nube varían según el proveedor y el tipo de GPU. Tasas horarias representativas a principios de 2026:
| Proveedor | GPU | VRAM | Coste por hora | Adecuado para |
|---|---|---|---|---|
| AWS EC2 g5.xlarge | NVIDIA A10G | 24 GB | ~$1.00 | Llama 3.1 de 8B, Mistral de 7B |
| GCP n1 + T4 | NVIDIA T4 | 16 GB | ~$0.50 | Modelos más pequeños, versiones cuantizadas de 7B |
| Lambda Labs A10 | NVIDIA A10 | 24 GB | ~$0.60 | Llama 3.1 de 8B, Mistral de 7B |
| RunPod RTX 4090 | RTX 4090 | 24 GB | ~$0.69 | Llama 3.1 de 8B, Mistral de 7B |
| Azure NC6s v3 | NVIDIA V100 | 16 GB | ~$3.00 | Opción heredada; con frecuencia existen alternativas más económicas |
Si ejecuta una instancia en la nube las 24 horas del día, una instancia de $0,60/hora cuesta $432/mes o $5.184/año. Una RTX 4090 local (aproximadamente $1.600) se amortiza en menos de cuatro meses de uso continuo. El calculadora de autohospedaje frente a API analiza esto para distintos patrones de uso.
El punto de equilibrio varía según el nivel de utilización:
- Uso intensivo (8+ horas/día): El hardware local se paga a sí mismo en cuestión de meses.
- Uso intermitente (unas pocas horas/semana): Las instancias en la nube resultan más ventajosas: solo paga por las horas activas.
- Cargas de trabajo puntuales (burst): En la nube puede alquilar una GPU de gama alta para una tarea breve sin necesidad de adquirirla.
Compare esto con servicios API alojados como OpenAI, Anthropic o Groq, que cobran por token. Para Llama 3.1 8B mediante una API alojada, los precios típicos oscilan entre $0,10 y $0,30 por millón de tokens de entrada, y entre $0,30 y $0,60 por millón de tokens de salida. Si esta opción resulta más económica que Ollama en la nube depende del volumen de solicitudes y de la longitud media de las respuestas. El Calculadora de costos de API detalla estos costos según el modelo y el uso mensual.
Privacidad y control de los datos
Ejecutar Ollama localmente implica que sus indicaciones (prompts), las salidas de los modelos y cualquier documento que procese nunca abandonan su equipo. Esto es fundamental en sectores regulados (sanidad, legal, finanzas) o cuando se trabaja con datos propietarios.
Ejecutar Ollama en una máquina virtual (VM) en la nube introduce los siguientes riesgos:
- Tránsito por red: Las indicaciones y respuestas viajan entre su cliente y la instancia en la nube, posiblemente a través de Internet público, a menos que utilice una VPN o una red privada.
- Acceso del proveedor en la nube: AWS, Google y Azure tienen acceso técnico a la memoria y al disco de su VM. Aunque contractualmente se comprometen a no inspeccionar los datos de los clientes, dicha posibilidad sigue existiendo.
- Registros (logs) y metadatos: Los proveedores en la nube registran conexiones de red, llamadas a sus APIs de gestión y eventos de facturación. Estos registros revelan cuándo está realizando inferencias y cuánta potencia computacional está utilizando, incluso si no acceden al contenido de las indicaciones.
- Residencia de los datos: Su VM se ejecuta en una región específica de AWS o en una zona de GCP. Si su marco normativo restringe la ubicación de los datos, deberá elegir una región acorde.
Si su modelo de amenazas incluye actores estatales o citaciones judiciales dirigidas al proveedor en la nube, la inferencia local es la única opción viable. Si, por el contrario, prioriza el costo y la conveniencia y sus datos no son sensibles, alojar Ollama en la nube es una alternativa válida.
Cuándo elegir la nube en lugar de hardware local
Elegir Ollama en la nube cuando:
- Necesita acceder a modelos de lenguaje de gran tamaño (LLM), pero no dispone de una GPU ni puede justificar el costo inicial de adquirir una GPU capaz ($800+).
- Su uso es intermitente —unas pocas horas por semana o por mes— y prefiere pagar por la potencia computacional únicamente mientras la utiliza.
- Necesita escalar temporalmente para una tarea masiva y luego reducir la capacidad nuevamente.
- Está realizando pruebas preliminares y desea probar distintos tipos de GPU (16 GB, 24 GB, 40 GB) antes de comprometerse con una compra de hardware.
- Está desarrollando un servicio que requiere disponibilidad continua (24/7) y redundancia, y gestionar su propio hardware de servidor no es factible.
Elegir Ollama local cuando:
- Ya posee una GPU con 12 GB o más de VRAM, o está dispuesto a adquirirla.
- Ejecuta inferencias diariamente durante varias horas; el hardware se amortiza rápidamente.
- La privacidad es un requisito ineludible: sus datos no pueden salir de sus instalaciones.
- Desea eliminar por completo los costos por solicitud y contar con gastos predecibles.
- Se encuentra desconectado o en una red con restricciones de acceso saliente.
El calculadora de autohospedaje frente a API le permite introducir su uso mensual previsto (horas de inferencia, número de solicitudes, tokens promedio por solicitud) y comparar el costo de comprar una GPU, alquilar una instancia en la nube o utilizar un servicio API alojado. Para la mayoría de los desarrolladores que ejecutan modelos unas pocas horas al día, el hardware local resulta más económico tras 3–6 meses.
Configuración de Ollama en una instancia en la nube
El procedimiento es idéntico en todos los proveedores: inicie una instancia con GPU, acceda mediante SSH, instale Ollama y exponga el puerto 11434.
AWS EC2
- Inicie una
g5.xlargeog5.2xlargeinstancia (Ubuntu 22.04 LTS, GPU NVIDIA A10G). - Acceda mediante SSH a la instancia:
ssh -i su-clave.pem ubuntu@<dirección-ip-de-la-instancia> - Instale Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Inicie Ollama:
ollama serve(o configúrelo como un servicio systemd). - Descargue un modelo:
ollama pull llama3.1:8b - Configure el grupo de seguridad para permitir tráfico TCP entrante en el puerto 11434 desde su dirección IP.
Google Cloud Platform
- Cree una VM de Compute Engine con GPU T4 o A100 (seleccione una familia de máquinas compatibles con GPU).
- Acceda mediante SSH desde la consola de GCP o
gcloud compute ssh. - Instale Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Inicie Ollama:
ollama serve - Actualice las reglas del cortafuegos para permitir TCP 11434 desde su rango de direcciones IP.
Lambda Labs o RunPod
- Alquile una instancia con una GPU RTX 4090 o A10.
- Conéctese mediante SSH usando las credenciales proporcionadas.
- Instale Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Inicie Ollama y descargue los modelos como se indicó anteriormente.
Para uso en producción, ejecute Ollama como un servicio systemd para que se reinicie automáticamente tras un reinicio, y utilice un proxy inverso (Nginx o Caddy) con TLS si lo expone a Internet público.
Consideraciones de rendimiento
Las instancias en la nube añaden latencia de red. Un servidor local de Ollama responde en menos de 5 ms para el primer token (tras cargar el modelo). Una instancia en la nube añade el tiempo de ida y vuelta entre su equipo y el centro de datos: típicamente entre 20 y 50 ms dentro de la misma región, y entre 80 y 150 ms entre continentes. En conversaciones interactivas, esta latencia es perceptible, aunque no incapacitante; en cargas de trabajo por lotes, es despreciable.
La velocidad de generación de tokens depende de la GPU, no de su ubicación. Una GPU A10G en AWS genera tokens a la misma velocidad que una A10G en su escritorio. Sin embargo, las instancias en la nube pueden verse afectadas por el «efecto vecino ruidoso»: otras máquinas virtuales en el mismo host físico pueden degradar el rendimiento. Las instancias dedicadas o el alquiler de GPUs bare-metal eliminan este problema, pero tienen un coste mayor.
Preguntas frecuentes
¿Existe un servicio oficial de Ollama Cloud?
A principios de 2026, Ollama no ofrece un servicio gestionado en la nube. El término «Ollama Cloud» hace referencia a ejecutar el servidor de código abierto de Ollama sobre infraestructura en la nube que usted alquila y gestiona personalmente, o bien utilizar una plataforma de terceros que hospeda Ollama por usted. El proyecto Ollama proporciona el software; usted o su proveedor de alojamiento suministran la capacidad computacional.
¿Puedo usar Ollama Cloud con los mismos modelos que ejecuto localmente?
Sí. La biblioteca de modelos es idéntica. Cualquier modelo que descargue con ollama pull localmente funcionará también en una instancia en la nube. La única restricción es la VRAM: asegúrese de que la GPU en la nube tenga suficiente memoria para el modelo y el nivel de cuantización que desea. Consulte Requisitos de VRAM por modelo para asociar modelos con tipos de instancias.
¿Cómo protejo Ollama cuando se ejecuta en una instancia en la nube?
De forma predeterminada, Ollama escucha en 127.0.0.1:11434, lo cual no es accesible desde fuera de la máquina virtual. Para exponerlo, establezca OLLAMA_HOST=0.0.0.0:11434 antes de iniciar el servidor. Luego restrinja el acceso mediante las reglas del cortafuegos de la nube (grupos de seguridad de AWS, reglas de cortafuegos de GCP) para permitir únicamente su dirección IP o su VPN. Para entornos de producción, coloque Ollama detrás de un proxy inverso con TLS y autenticación (autenticación HTTP básica, claves API u OAuth). Nunca exponga un servidor Ollama sin autenticación a Internet público: esto permitiría a cualquier persona ejecutar modelos arbitrarios a su costa.
¿Qué resulta más económico: usar Ollama en una GPU en la nube o la API de OpenAI?
Depende del volumen de uso. Para un modelo de 7 mil millones de parámetros, una GPU en la nube cuesta aproximadamente 0,50–1,00 USD/hora. Si genera 10 millones de tokens por hora, el costo equivale a 0,05–0,10 USD por millón de tokens, lo cual es más económico que la mayoría de las APIs alojadas para modelos de tamaño equivalente. Sin embargo, si solo genera 1 millón de tokens por hora, pagará 0,50–1,00 USD por millón de tokens, lo cual resulta más caro que los servicios basados en API. Además, las APIs alojadas gestionan automáticamente la escalabilidad, la disponibilidad y las actualizaciones de modelos. Utilice la calculadora de autohospedaje frente a API para modelar su carga de trabajo específica.
¿Hace que ejecutar Ollama en la nube reduzca la privacidad de mis datos?
Sí, comparado con la inferencia completamente local. Sus prompts y las salidas del modelo viajan por la red y se almacenan en una máquina virtual a la que el proveedor de servicios en la nube tiene acceso de administrador (root). Si la privacidad es crítica —por ejemplo, al manejar datos médicos protegidos por HIPAA, documentos legales amparados por el privilegio abogado-cliente o código propietario—, ejecute Ollama localmente. Si sus datos no son sensibles o confía en los compromisos contractuales de su proveedor en la nube, alojar Ollama en la nube representa un equilibrio razonable entre costo y comodidad.
¿Puedo ejecutar varios modelos en una sola instancia en la nube?
Sí, siempre que la instancia tenga suficiente VRAM para mantener todos los modelos simultáneamente en memoria. Ollama carga los modelos bajo demanda y los mantiene en la VRAM hasta que la presión de memoria los expulsa. Una instancia de 24 GB puede alojar simultáneamente Llama 3.1 8B (aproximadamente 8 GB con cuantización Q8) y Mistral 7B (de tamaño similar). Cambiar entre modelos ya cargados es instantáneo; cargar un nuevo modelo desde el disco tarda unos segundos.

