Monday, 31 August 2026 | Updating Daily AI insight, written for builders

Modelos da Nuvem Ollama: Executando Ollama em Infraestrutura de Nuvem

  • O Ollama não oferece modelos hospedados em nuvem como serviço de API — é um mecanismo de inferência local que você executa em seu próprio hardware.
  • Você pode implantar o Ollama em máquinas virtuais na nuvem (AWS EC2, Google Cloud Compute Engine, Azure) para combinar a facilidade de uso do Ollama com a escalabilidade da nuvem.
  • Provedores de nuvem especializados em GPU, como Lambda Labs, Vast.ai e RunPod, oferecem instâncias de GPU mais econômicas do que as grandes nuvens para executar Ollama.
  • Os custos do Ollama na nuvem variam entre US$ 0,50 e US$ 3 por hora para instâncias com GPU, contra US$ 0,50 a US$ 5 por milhão de tokens para APIs comerciais — o ponto de equilíbrio depende do volume de uso.

O Ollama não fornece modelos hospedados em nuvem como serviço de API gerenciado. Ollama é um mecanismo de inferência local que executa modelos de código aberto em seu próprio hardware. No entanto, você pode implantar o Ollama em infraestrutura de nuvem — como instâncias da AWS EC2, Google Cloud, máquinas virtuais do Azure ou provedores especializados em GPU — para obter poder computacional em nuvem mantendo a interface simples do Ollama. Essa abordagem lhe dá controle sobre o ambiente de execução e pode ser mais econômica do que APIs comerciais em volumes elevados de uso.

O Que É o Ollama (e o Que Ele Não É)

Ollama é um mecanismo de inferência de código aberto que executa modelos de linguagem grandes localmente. Ele gerencia downloads de modelos, quantização e inferência por meio de uma CLI e de uma API REST simples. De acordo com o repositório oficial do Ollama, ele suporta modelos das famílias Llama, Mistral, Gemma, Qwen e DeepSeek entre outras.

O Ollama não opera como provedor de nuvem. Ele não hospeda modelos em seus próprios servidores nem cobra por token. Quando você executa ollama run llama3.3, o modelo é executado na máquina que executou o comando — seu laptop, um servidor de data center ou uma máquina virtual em nuvem pela qual você paga separadamente.

O termo "ollama cloud models" normalmente se refere a um dos três padrões de implantação:

  • Executar Ollama em uma máquina virtual na nuvem com aceleração por GPU
  • Implantar Ollama em uma plataforma de orquestração de contêineres (Kubernetes, ECS)
  • Usar Ollama em uma instância dedicada de GPU na nuvem para dimensionamento sob demanda

Executando Ollama nos Principais Provedores de Nuvem

Instâncias GPU da AWS EC2

A AWS oferece instâncias EC2 habilitadas para GPU nas famílias G, P e Inf. Para cargas de trabalho do Ollama, a instância g5.xlarge (1× NVIDIA A10G, 24 GB de VRAM) começa em aproximadamente US$ 1,01/hora sob demanda na região us-east-1, enquanto a g5.12xlarge (4× A10G, 96 GB de VRAM) custa cerca de US$ 5,67/hora.

Para implantar o Ollama na EC2:

# Inicie uma instância Ubuntu 22.04 g5.xlarge com AMI para Deep Learning
# Conecte-se à instância via SSH
sudo apt update
curl -fsSL https://ollama.com/install.sh | sh

# Verifique se a GPU foi detectada
nvidia-smi

# Execute um modelo
ollama run llama3.3:70b

A Llama 3.3 70B O modelo requer aproximadamente 40 GB de VRAM em quantização de 4 bits, portanto seria necessário usar uma instância g5.12xlarge ou superior. Llama 3.1 8B precisa de cerca de 5 GB de VRAM em quantização de 4 bits, cabendo confortavelmente em uma g5.xlarge.

Google Cloud Platform

O GCP fornece instâncias com GPU por meio das famílias de máquinas N1 e A2 do Compute Engine. Uma n1-standard-4 com 1× NVIDIA T4 (16 GB de VRAM) custa aproximadamente US$ 0,62/hora, enquanto uma a2-highgpu-1g com 1× A100 (40 GB de VRAM) custa cerca de US$ 3,67/hora na região us-central1.

# Crie uma instância com GPU
gcloud compute instances create ollama-instance 
  --zone=us-central1-a 
  --machine-type=n1-standard-4 
  --accelerator=type=nvidia-tesla-t4,count=1 
  --image-family=ubuntu-2204-lts 
  --image-project=ubuntu-os-cloud 
  --maintenance-policy=TERMINATE

# Conecte-se via SSH e instale
gcloud compute ssh ollama-instance --zone=us-central1-a
curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral:7b

Microsoft Azure

As VMs da série NC do Azure fornecem GPUs da NVIDIA para cargas de trabalho de inferência. Uma NC6s_v3 (1× V100, 16 GB de VRAM) custa aproximadamente US$ 3,06/hora, enquanto uma NC24ads_A100_v4 (1× A100, 80 GB de VRAM) custa cerca de US$ 3,67/hora na região Leste dos EUA.

A instalação segue o mesmo padrão: provisione uma VM Ubuntu com GPU, instale os drivers NVIDIA caso não esteja usando uma imagem pré-configurada e execute o Instalação do Ollama script.

Provedores de Nuvem Especializados em GPU

Provedores especializados em GPU na nuvem frequentemente oferecem melhor relação custo-desempenho do que as grandes nuvens para implantações do Ollama:

Provedor GPU VRAM Custo/Hora Indicado Para
Lambda Labs A100 40 GB $1.10 DeepSeek R1 Distill Llama 70B, Llama 3.3 70B
Vast.ai RTX 4090 24 GB $0.34-$0.54 Mistral 7B, Llama 3.1 8B, Phi-4
RunPod A40 48 GB $0.79 Mistral Large 3 (instância única), Llama 3.3 70B
Paperspace A4000 16 GB $0.76 Modelos menores até ~14 bilhões de parâmetros

A Lambda Labs oferece a configuração mais simples — as instâncias vêm com drivers NVIDIA e CUDA pré-instalados. Após iniciar uma instância por meio de seu painel de controle:

ssh ubuntu@
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:32b

A Vast.ai opera como um marketplace para capacidade ociosa de GPU, oferecendo os preços mais baixos, mas com disponibilidade variável. Você faz lances ou aluga instâncias por meio de sua interface web e, em seguida, acessa via SSH para instalar o Ollama.

Comparação de Custos: Ollama na Nuvem vs. Serviços de API

Se a implantação do Ollama na nuvem faz sentido economicamente depende do seu volume de uso. Use a calculadora de autohospedagem versus API para encontrar seu ponto de equilíbrio.

Modelo Custo da API (por 1 milhão de tokens) GPU na Nuvem Custo por Instância/Hora Tokens/Hora no Ponto de Equilíbrio
Llama 3.3 70B $0,10 de entrada / $0,32 de saída Lambda A100 40 GB $1.10 ~3,4 milhões de tokens de saída
Mistral Large 3 $2,00 de entrada / $6,00 de saída RunPod 4×A40 $3.16 ~530 mil tokens de saída
Qwen3 32B $0,08 de entrada / $0,28 de saída Vast.ai RTX 4090 $0.54 ~1,9 milhão de tokens de saída
DeepSeek R1 $0,50 de entrada / $2,15 de saída Lambda 4×A100 $4.40 ~2 milhões de tokens de saída

Se você estiver processando mais do que o volume de tokens no ponto de equilíbrio por hora, o Ollama em nuvem torna-se mais barato. Para cargas de trabalho intermitentes ou volumes baixos, APIs como Claude Sonnet 5 ($2,00 de entrada / $10,00 de saída por 1 milhão de tokens) ou Gemini 3.6 Flash ($1,50 de entrada / $7,50 de saída por 1 milhão de tokens) oferecem uma economia melhor, sem custos por tempo ocioso.

Padrões de Implantação

Instâncias sob Demanda

Inicie uma instância com GPU quando precisar, execute sua carga de trabalho e depois encerre-a. Isso funciona bem para processamento em lote, desenvolvimento ou inferência esporádica. Todos os principais provedores de nuvem e de GPUs suportam preços sob demanda.

Instâncias Spot/Preemptíveis

As Instâncias Spot da AWS, as VMs Preemptíveis do GCP e as VMs Spot do Azure oferecem descontos de 60–90%, mas podem ser encerradas com aviso prévio de 30 segundos a 2 minutos. São adequadas para cargas de trabalho em lote tolerantes a falhas, nas quais é possível salvar o progresso periodicamente.

No Vast.ai, instâncias interrompíveis operam com preços de mercado sem garantia de não encerramento, oferecendo os menores preços, mas exigindo tratamento robusto de erros.

Orquestração de Contêineres

Para implantações em produção, execute o Ollama no Kubernetes com pools de nós com GPU. Isso permite dimensionamento automático, balanceamento de carga e alta disponibilidade. Use a imagem oficial do Docker Ollama :

docker pull ollama/ollama
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama

Em seguida, implante-o em seu cluster com solicitações de recursos de GPU definidas na especificação do seu pod.

Seleção de Modelos para Implantações na Nuvem

Escolha modelos com base no orçamento de VRAM da sua GPU. Use o Calculadora de VRAM para estimar os requisitos:

  • VRAM de 16–24 GB (T4, RTX 4090, A10G): Mistral 7B (~4,5 GB em 4 bits), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)
  • VRAM de 40–48 GB (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B com espaço para contexto maior
  • VRAM de 80+ GB (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, requer 4×A100 ou equivalente), Mistral Large 3 (~400 GB)

Modelos que exigem mais de 80 GB de VRAM necessitam de configurações com múltiplas GPUs ou paralelismo de tensores, recurso que o Ollama não suporta nativamente até a versão 0.3. Para esses modelos, considere frameworks como vLLM ou TGI, ou use APIs comerciais em vez disso.

Otimização de Desempenho

Várias configurações afetam a velocidade de inferência do Ollama em GPUs na nuvem:

  • Quantização: Por padrão, o Ollama usa quantização de 4 bits (Q4_0). Use ollama pull model:q8_0 para 8 bits (melhor qualidade, 2× mais VRAM) ou model:q2_K para 2 bits (mais rápido, menor qualidade).
  • Janela de contexto: Definido via parâmetro num_ctx . Contextos maiores consomem mais VRAM — um contexto de 32K usa significativamente mais memória do que um de 4K para o mesmo modelo.
  • Tamanho do lote: Aumente num_batch para cargas de trabalho orientadas à taxa de transferência, onde a latência é menos importante do que o número de tokens por segundo.
  • Camadas na GPU: O Ollama transfere automaticamente todas as camadas para a GPU. Em instâncias com VRAM limitada, ele recorre à CPU para camadas que não cabem na GPU, reduzindo drasticamente a velocidade.

Perguntas frequentes

O Ollama oferece hospedagem em nuvem própria?

Não. O Ollama é um software auto-hospedado que executa modelos em sua própria infraestrutura. Não há serviço oficial de nuvem Ollama nem API gerenciada. Quando as pessoas se referem a "modelos Ollama na nuvem", querem dizer executar o software Ollama em infraestrutura de nuvem que eles mesmos provisionam por meio da AWS, GCP, Azure ou provedores especializados em GPUs.

Posso usar o formato de API do Ollama com modelos na nuvem?

Sim. Assim que o Ollama estiver em execução em uma máquina virtual na nuvem, ele expõe uma API REST na porta 11434 compatível com o formato da API da OpenAI. Você pode apontar qualquer cliente compatível com a OpenAI para o endereço IP e porta da sua instância na nuvem. Isso permite usar modelos hospedados pelo Ollama como substitutos diretos de APIs comerciais em muitas aplicações, embora você seja responsável pela gestão da disponibilidade, escalabilidade e segurança.

Qual provedor de nuvem é o mais barato para executar Ollama?

Provedores focados em GPU, como Lambda Labs (US$ 1,10/hora para A100 com 40 GB) e Vast.ai (US$ 0,34–US$ 0,54/hora para RTX 4090), oferecem preços significativamente inferiores aos da AWS, GCP e Azure para memória de GPU equivalente. A Lambda Labs oferece maior confiabilidade e suporte; a Vast.ai oferece os preços mais baixos, mas com disponibilidade variável. Para cargas de trabalho de produção que exigem SLAs, as grandes nuvens fornecem garantias superiores a um custo mais elevado.

Quanto custa executar o Llama 3.3 70B na nuvem versus APIs?

O Llama 3.3 70B exige cerca de 40 GB de VRAM com quantização de 4 bits. Uma instância Lambda Labs A100 40 GB custa $1,10/hora. Se você gerar 3,4 milhões de tokens de saída por hora (~945 tokens/segundo sustentados), atingirá o ponto de equilíbrio com a tarifa de API de $0,32 por milhão de tokens. Abaixo desse limiar, as APIs são mais baratas. Acima dele, a instância na nuvem é mais vantajosa. A maioria das cargas de trabalho reais é intermitente, e não contínua, favorecendo o modelo de precificação por API, exceto quando você executa tarefas de processamento em lote continuamente.

O Ollama pode escalar em múltiplas GPUs na nuvem?

O Ollama detecta e utiliza automaticamente múltiplas GPUs em uma única instância, mas executa um modelo por GPU, em vez de distribuir um único modelo entre várias GPUs (paralelismo de tensores). Isso significa que uma instância 4×A100 pode executar quatro instâncias separadas de modelos ou lidar eficientemente com quatro requisições simultâneas, mas não consegue carregar um único modelo de 400 GB, como o Mistral Large 3, que excede a capacidade de uma única GPU. Para paralelismo de modelos com múltiplas GPUs, use vLLM, TensorRT-LLM ou Text Generation Inference.

Executar Ollama na nuvem é seguro?

Por padrão, o Ollama vincula-se a 0.0.0.0:11434, expondo sua API a qualquer cliente de rede. Em instâncias na nuvem com IPs públicos, isso significa que seu endpoint de inferência fica acessível publicamente, a menos que você configure regras de firewall, grupos de segurança ou acesso por VPN. Defina OLLAMA_HOST=127.0.0.1:11434 para restringir o acesso ao localhost e, em seguida, use túnel SSH, um proxy reverso com autenticação ou uma VPN para proteger o acesso remoto. Implantações em nuvem também devem implementar registro de requisições, limitação de taxa e validação de entradas para evitar abusos.

Escrito por Mustafa Ihsan

Mustafa Ihsan é fundador e editor da Convly.ai. Ele criou e mantém o banco de dados em tempo real de modelos de IA do site, seu índice de desempenho por preço e suas calculadoras gratuitas para requisitos de VRAM, custos de API e economia de hospedagem local. Escreve sobre preços de modelos, resultados de benchmarks e o hardware necessário para executar modelos de IA localmente, preferindo sempre dados mensuráveis às declarações dos fabricantes.

Scroll to Top
Featured on There's An AI For That