Monday, 31 August 2026 | Updating Daily AI insight, written for builders

Modelos en la nube de Ollama: Ejecutar Ollama en infraestructura en la nube

  • Ollama no ofrece modelos alojados en la nube como servicio API: es un motor de inferencia local que usted ejecuta en su propio hardware.
  • Puede implementar Ollama en máquinas virtuales en la nube (AWS EC2, Compute Engine de GCP, máquinas virtuales de Azure) para combinar la facilidad de uso de Ollama con la escalabilidad de la nube.
  • Proveedores en la nube especializados en GPU, como Lambda Labs, Vast.ai y RunPod, ofrecen instancias GPU más rentables que las grandes nubes para ejecutar Ollama.
  • Los costos de Ollama en la nube oscilan entre 0,50 y 3 USD/hora para instancias con GPU, frente a 0,50–5 USD por millón de tokens en APIs comerciales; el punto de equilibrio depende del volumen de uso.

Ollama no proporciona modelos alojados en la nube como servicio API gestionado. Ollama es un motor de inferencia local que ejecuta modelos de código abierto en su propio hardware. Sin embargo, puede implementar Ollama en infraestructura en la nube —por ejemplo, en instancias EC2 de AWS, Google Cloud, máquinas virtuales de Azure o proveedores especializados en GPU— para aprovechar la potencia computacional de la nube manteniendo la interfaz sencilla de Ollama. Este enfoque le otorga control sobre el entorno de ejecución y puede resultar más rentable que las APIs comerciales cuando el volumen de uso es elevado.

Qué es Ollama (y qué no es)

Ollama es un motor de inferencia de código abierto que ejecuta modelos de lenguaje grande localmente. Se encarga de descargar modelos, aplicarles cuantización e inferir mediante una CLI sencilla y una API REST. Según el repositorio oficial de Ollama, admite modelos de las familias Llama, Mistral, Gemma, Qwen y DeepSeek entre otras.

Ollama no opera como un proveedor en la nube. No aloja modelos en sus propios servidores ni cobra por token. Cuando ejecuta ollama run llama3.3, el modelo se ejecuta en cualquier máquina que ejecute el comando: su portátil, un servidor de centro de datos o una máquina virtual en la nube por la que usted paga por separado.

El término «ollama cloud models» suele referirse a uno de tres patrones de implementación:

  • Ejecutar Ollama en una máquina virtual en la nube con aceleración GPU
  • Implementar Ollama en una plataforma de orquestación de contenedores (Kubernetes, ECS)
  • Usar Ollama en una instancia dedicada de GPU en la nube para escalado bajo demanda

Ejecutar Ollama en grandes proveedores en la nube

Instancias GPU de AWS EC2

AWS ofrece instancias EC2 con GPU en las familias G, P e Inf. Para cargas de trabajo de Ollama, la instancia g5.xlarge (1× NVIDIA A10G, 24 GB de VRAM) comienza en aproximadamente 1,01 USD/hora bajo demanda en la región us-east-1, mientras que la g5.12xlarge (4× A10G, 96 GB de VRAM) cuesta alrededor de 5,67 USD/hora.

Para implementar Ollama en EC2:

# Iniciar una instancia Ubuntu 22.04 g5.xlarge con AMI para aprendizaje profundo
# Conectarse mediante SSH a la instancia
sudo apt update
curl -fsSL https://ollama.com/install.sh | sh

# Verificar que la GPU esté detectada
nvidia-smi

# Ejecutar un modelo
ollama run llama3.3:70b

A Llama 3.3 70B requiere aproximadamente 40 GB de VRAM en cuantización de 4 bits, por lo que necesitaría una g5.12xlarge o superior. Llama 3.1 8B necesita alrededor de 5 GB de VRAM en cuantización de 4 bits, lo que cabe cómodamente en una g5.xlarge.

Google Cloud Platform

GCP ofrece instancias con GPU mediante las familias de máquinas N1 y A2 de Compute Engine. Una n1-standard-4 con 1× NVIDIA T4 (16 GB de VRAM) cuesta aproximadamente 0,62 USD/hora, mientras que una a2-highgpu-1g con 1× A100 (40 GB de VRAM) cuesta alrededor de 3,67 USD/hora en la región us-central1.

# Crear una instancia con GPU
gcloud compute instances create ollama-instance 
  --zone=us-central1-a 
  --machine-type=n1-standard-4 
  --accelerator=type=nvidia-tesla-t4,count=1 
  --image-family=ubuntu-2204-lts 
  --image-project=ubuntu-os-cloud 
  --maintenance-policy=TERMINATE

# Conectarse mediante SSH e instalar
gcloud compute ssh ollama-instance --zone=us-central1-a
curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral:7b

Microsoft Azure

Las máquinas virtuales de la serie NC de Azure ofrecen GPUs NVIDIA para cargas de trabajo de inferencia. Una NC6s_v3 (1× V100, 16 GB de VRAM) cuesta aproximadamente 3,06 USD/hora, mientras que una NC24ads_A100_v4 (1× A100, 80 GB de VRAM) cuesta alrededor de 3,67 USD/hora en la región East US.

La instalación sigue el mismo patrón: aprovisionar una máquina virtual Ubuntu con GPU, instalar los controladores NVIDIA si no se usa una imagen preconfigurada y ejecutar el script Instalación de Ollama .

Proveedores en la nube centrados en GPU

Los proveedores especializados en GPU en la nube suelen ofrecer una mejor relación precio-rendimiento que las grandes nubes para implementaciones de Ollama:

Proveedor GPU VRAM Costo por hora Adecuado para
Lambda Labs A100 40 GB $1.10 DeepSeek R1 Distill Llama 70B, Llama 3.3 70B
Vast.ai RTX 4090 24 GB $0.34-$0.54 Mistral 7B, Llama 3.1 8B, Phi-4
RunPod A40 48 GB $0.79 Mistral Large 3 (instancia única), Llama 3.3 70B
Paperspace A4000 16 GB $0.76 Modelos pequeños hasta ~14 mil millones de parámetros

Lambda Labs ofrece la configuración más sencilla: las instancias incluyen controladores NVIDIA y CUDA preinstalados. Tras iniciar una instancia desde su panel de control:

ssh ubuntu@<ip-de-la-instancia>
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:32b

Vast.ai funciona como un mercado para capacidad GPU no utilizada, ofreciendo los precios más bajos, aunque con disponibilidad variable. Usted puja o alquila instancias mediante su interfaz web y luego se conecta mediante SSH para instalar Ollama.

Comparación de costos: Ollama en la nube frente a servicios API

Si implementar Ollama en la nube resulta económicamente viable depende de su volumen de uso. Utilice la calculadora de autohospedaje frente a API para encontrar su punto de equilibrio.

Modelo API Cost (per 1M tokens) GPU en la nube Coste de la instancia por hora Tokens por hora en el punto de equilibrio
Llama 3.3 70B $0,10 de entrada / $0,32 de salida Lambda A100 40 GB $1.10 ~3,4 millones de tokens de salida
Mistral Large 3 $2,00 de entrada / $6,00 de salida RunPod 4×A40 $3.16 ~530 000 tokens de salida
Qwen3 32B $0,08 de entrada / $0,28 de salida Vast.ai RTX 4090 $0.54 ~1,9 millones de tokens de salida
DeepSeek R1 $0,50 de entrada / $2,15 de salida Lambda 4×A100 $4.40 ~2 millones de tokens de salida

Si procesa más tokens por hora que el volumen de equilibrio, Ollama en la nube resulta más económico. Para cargas de trabajo intermitentes o volúmenes bajos, las API como Claude Sonnet 5 ($2,00 de entrada / $10,00 de salida por cada millón de tokens) o Gemini 3.6 Flash ($1,50 de entrada / $7,50 de salida por cada millón de tokens) ofrecen una mejor relación coste-beneficio sin costes por tiempo inactivo.

Patrones de implementación

Instancias bajo demanda

Inicie una instancia con GPU cuando la necesite, ejecute su carga de trabajo y luego finalícela. Esto funciona bien para procesamiento por lotes, desarrollo o inferencia esporádica. Todos los principales proveedores de nube y de GPU ofrecen precios bajo demanda.

Instancias Spot/preemptibles

Las instancias Spot de AWS, las máquinas virtuales preemptibles de GCP y las máquinas virtuales Spot de Azure ofrecen descuentos del 60 al 90 %, pero pueden finalizarse con un aviso previo de 30 segundos a 2 minutos. Son adecuadas para cargas de trabajo por lotes tolerantes a fallos, donde puede guardar puntos de control del progreso.

En Vast.ai, las instancias interrumpibles se ejecutan a precios de mercado sin garantía de no finalización, ofreciendo los precios más bajos, pero requieren una gestión robusta de errores.

Orquestación de contenedores

Para despliegues en producción, ejecute Ollama en Kubernetes con grupos de nodos con GPU. Esto permite escalado automático, equilibrio de carga y alta disponibilidad. Use la imagen oficial de Docker de Ollama :

docker pull ollama/ollama
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama

Luego despliegue en su clúster especificando las solicitudes de recursos GPU en la especificación de su pod.

Selección de modelos para implementaciones en la nube

Elija modelos según su presupuesto de VRAM de GPU. Utilice la Calculadora de VRAM para estimar los requisitos:

  • VRAM de 16 a 24 GB (T4, RTX 4090, A10G): Mistral 7B (~4,5 GB en cuantización de 4 bits), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)
  • VRAM de 40 a 48 GB (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B con espacio suficiente para contextos más amplios
  • VRAM de 80 GB o más (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, requiere 4×A100 o equivalente), Mistral Large 3 (~400 GB)

Los modelos que requieren más de 80 GB de VRAM necesitan configuraciones multi-GPU o paralelismo de tensores, funcionalidad que Ollama no admite de forma nativa hasta la versión 0,3. Para esos modelos, considere frameworks como vLLM o TGI, o utilice API comerciales en su lugar.

Optimización del rendimiento

Varias opciones afectan la velocidad de inferencia de Ollama en GPUs en la nube:

  • Cuantización: Por defecto, Ollama usa cuantización de 4 bits (Q4_0). Use ollama pull model:q8_0 para cuantización de 8 bits (mejor calidad, el doble de VRAM) o model:q2_K para cuantización de 2 bits (más rápido, menor calidad).
  • Ventana de contexto: Se establece mediante el parámetro num_ctx . Contextos más amplios consumen más VRAM: un contexto de 32 K utiliza significativamente más memoria que uno de 4 K para el mismo modelo.
  • Tamaño del lote: Aumente el parámetro num_batch para cargas de trabajo orientadas al rendimiento, donde la latencia importa menos que los tokens por segundo.
  • Capas en GPU: Ollama traslada automáticamente todas las capas a la GPU. En instancias con VRAM limitada, recurrirá a la CPU para las capas que no quepan, reduciendo drásticamente la velocidad.

Preguntas frecuentes

¿Ofrece Ollama su propio alojamiento en la nube?

No. Ollama es un software autoalojado que ejecuta modelos en su propia infraestructura. No existe ningún servicio oficial de Ollama en la nube ni ninguna API gestionada. Cuando las personas hablan de «modelos de Ollama en la nube», se refieren a ejecutar el software Ollama en infraestructura en la nube que ellos mismos provisionan a través de AWS, GCP, Azure o proveedores especializados de GPU.

¿Puedo usar el formato de API de Ollama con modelos en la nube?

Sí. Una vez que Ollama se está ejecutando en una máquina virtual en la nube, expone una API REST en el puerto 11434 compatible con el formato de API de OpenAI. Puede apuntar cualquier cliente compatible con OpenAI a la dirección IP y puerto de su instancia en la nube. Esto le permite usar modelos alojados con Ollama como sustitutos directos de las API comerciales en muchas aplicaciones, aunque usted es responsable de gestionar la disponibilidad, el escalado y la seguridad.

¿Qué proveedor en la nube es el más económico para ejecutar Ollama?

Proveedores centrados en GPU, como Lambda Labs (1,10 USD/hora para A100 de 40 GB) y Vast.ai (0,34–0,54 USD/hora para RTX 4090), ofrecen precios significativamente inferiores a los de AWS, GCP y Azure para cantidades equivalentes de memoria GPU. Lambda ofrece mayor fiabilidad y soporte; Vast.ai ofrece los precios más bajos, pero con disponibilidad variable. Para cargas de trabajo de producción que requieren acuerdos de nivel de servicio (SLA), las grandes nubes brindan garantías superiores a un costo mayor.

¿Cuánto cuesta ejecutar Llama 3.3 70B en la nube frente a las APIs?

Llama 3.3 70B necesita aproximadamente 40 GB de VRAM con cuantización de 4 bits. Una instancia Lambda Labs A100 de 40 GB cuesta $1,10 por hora. Si genera 3,4 millones de tokens de salida por hora (~945 tokens por segundo de forma sostenida), alcanza el punto de equilibrio con la tarifa de API de $0,32 por millón de tokens. Por debajo de ese umbral, las API son más económicas; por encima, la instancia en la nube resulta más rentable. La mayoría de las cargas de trabajo reales son intermitentes, no sostenidas, lo que favorece los precios por API, salvo que ejecute trabajos de procesamiento por lotes de forma continua.

¿Puede Ollama escalar a través de múltiples GPU en la nube?

Ollama detecta y utiliza automáticamente múltiples GPUs en una única instancia, pero ejecuta un modelo por GPU, en lugar de distribuir un único modelo entre varias GPUs (paralelismo de tensores). Esto significa que una instancia con 4×A100 puede ejecutar cuatro instancias independientes de modelos o manejar eficientemente cuatro solicitudes simultáneas, pero no puede cargar un único modelo de 400 GB como Mistral Large 3, que supera la capacidad de una sola GPU. Para paralelismo de modelos multi-GPU, use vLLM, TensorRT-LLM o Text Generation Inference.

¿Es seguro ejecutar Ollama en la nube?

De forma predeterminada, Ollama se enlaza a 0.0.0.0:11434, exponiendo su API a cualquier cliente de red. En instancias en la nube con direcciones IP públicas, esto implica que su punto final de inferencia es accesible públicamente, a menos que configure reglas de firewall, grupos de seguridad o acceso VPN. Establezca OLLAMA_HOST=127.0.0.1:11434 para restringir el acceso al host local y, a continuación, utilizar el tunelado SSH, un proxy inverso con autenticación o una VPN para proteger el acceso remoto. Las implementaciones en la nube también deben incluir registro de solicitudes, limitación de frecuencia y validación de entradas para prevenir el uso abusivo.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top
Featured on There's An AI For That