- Ollama non offre modelli ospitati in cloud come servizio API: è invece un motore di inferenza locale da eseguire sull’hardware di vostra proprietà.
- È possibile distribuire Ollama su macchine virtuali cloud (AWS EC2, GCP Compute Engine, Azure) per combinare la facilità d’uso di Ollama con la scalabilità del cloud.
- Provider cloud specializzati nelle GPU, come Lambda Labs, Vast.ai e RunPod, offrono istanze GPU più convenienti rispetto ai principali cloud per l’esecuzione di Ollama.
- I costi di Ollama su cloud variano tra 0,50 e 3 $/ora per istanze GPU, contro 0,50–5 $ per milione di token offerti dai servizi API commerciali: il punto di pareggio dipende dal volume di utilizzo.
Ollama non fornisce modelli ospitati in cloud come servizio API gestito. Ollama è un motore di inferenza locale che esegue modelli open source sull’hardware di vostra proprietà. Tuttavia, potete distribuire Ollama su infrastrutture cloud — come AWS EC2, Google Cloud, macchine virtuali Azure o provider specializzati in GPU — per ottenere potenza computazionale cloud mantenendo l’interfaccia semplice di Ollama. Questo approccio vi garantisce il pieno controllo sull’ambiente di esecuzione ed è spesso più conveniente rispetto agli API commerciali quando i volumi di utilizzo sono elevati.
Cos’è Ollama (e cosa non è)
Ollama è un motore open source di inferenza che esegue modelli linguistici di grandi dimensioni in locale. Gestisce il download dei modelli, la quantizzazione e l’inferenza tramite una semplice interfaccia CLI e un’API REST. Secondo il repository ufficiale di Ollama, supporta modelli appartenenti alle famiglie Llama, Mistral, Gemma, Qwen e DeepSeek tra gli altri.
Ollama non opera come provider cloud. Non ospita modelli sui propri server né applica tariffe basate sul numero di token. Quando eseguite ollama run llama3.3, il modello viene eseguito su qualsiasi macchina abbia eseguito il comando: il tuo laptop, un server di un data center o una macchina virtuale nel cloud per la quale paghi separatamente.
il termine «ollama cloud modelli» si riferisce tipicamente a uno dei tre seguenti modelli di distribuzione:
- Esecuzione di Ollama su una macchina virtuale cloud con accelerazione GPU
- Distribuzione di Ollama su una piattaforma di orchestrazione container (Kubernetes, ECS)
- Utilizzo di Ollama su un’istanza GPU dedicata per una scalabilità su richiesta
Esecuzione di Ollama sui principali provider cloud
Istanze GPU AWS EC2
AWS offre istanze EC2 abilitate GPU nelle famiglie G, P e Inf. Per i carichi di lavoro Ollama, l’istanza g5.xlarge (1× NVIDIA A10G, 24 GB VRAM) parte da circa 1,01 $/ora in modalità on-demand nella regione us-east-1, mentre la g5.12xlarge (4× A10G, 96 GB VRAM) costa circa 5,67 $/ora.
Per distribuire Ollama su EC2:
# Avvia un'istanza Ubuntu 22.04 g5.xlarge con Deep Learning AMI
# Accedi all'istanza tramite SSH
sudo apt update
curl -fsSL https://ollama.com/install.sh | sh
# Verifica che la GPU venga rilevata
nvidia-smi
# Esegui un modello
ollama run llama3.3:70b
A Llama 3.3 70B Il modello richiede circa 40 GB di VRAM in quantizzazione a 4 bit, quindi occorre almeno una g5.12xlarge o superiore. Llama 3.1 8B ha bisogno di circa 5 GB di VRAM in quantizzazione a 4 bit, adattandosi comodamente su una g5.xlarge.
Google Cloud Platform
GCP fornisce istanze GPU tramite le famiglie di macchine N1 e A2 di Compute Engine. Un’istanza n1-standard-4 con 1× NVIDIA T4 (16 GB VRAM) costa circa 0,62 $/ora, mentre un’istanza a2-highgpu-1g con 1× A100 (40 GB VRAM) costa circa 3,67 $/ora nella regione us-central1.
# Crea un'istanza con GPU
gcloud compute instances create ollama-instance
--zone=us-central1-a
--machine-type=n1-standard-4
--accelerator=type=nvidia-tesla-t4,count=1
--image-family=ubuntu-2204-lts
--image-project=ubuntu-os-cloud
--maintenance-policy=TERMINATE
# Accedi via SSH e installa
gcloud compute ssh ollama-instance --zone=us-central1-a
curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral:7b
Microsoft Azure
Le VM della serie NC di Azure offrono GPU NVIDIA per carichi di lavoro di inferenza. Un’istanza NC6s_v3 (1× V100, 16 GB VRAM) costa circa 3,06 $/ora, mentre un’istanza NC24ads_A100_v4 (1× A100, 80 GB VRAM) costa circa 3,67 $/ora nella regione East US.
L’installazione segue lo stesso schema: provisioning di una VM Ubuntu abilitata GPU, installazione dei driver NVIDIA (se non si usa un’immagine preconfigurata) ed esecuzione dello script Installazione di Ollama di installazione.
Provider cloud specializzati nelle GPU
I provider cloud specializzati nelle GPU offrono spesso un rapporto costo-prestazioni migliore rispetto ai principali cloud per le distribuzioni di Ollama:
| Fornitore | GPU | VRAM | Costo/ora | Adatto a |
|---|---|---|---|---|
| Lambda Labs | A100 | 40 GB | $1.10 | DeepSeek R1 Distill Llama 70B, Llama 3.3 70B |
| Vast.ai | RTX 4090 | 24 GB | $0.34-$0.54 | Mistral 7B, Llama 3.1 8B, Phi-4 |
| RunPod | A40 | 48 GB | $0.79 | Mistral Large 3 (singola istanza), Llama 3.3 70B |
| Paperspace | A4000 | 16 GB | $0.76 | Modelli più piccoli fino a circa 14 miliardi di parametri |
Lambda Labs offre la configurazione più semplice: le istanze includono già i driver NVIDIA e CUDA preinstallati. Dopo aver avviato un’istanza tramite il loro dashboard:
ssh ubuntu@
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:32b
Vast.ai opera come marketplace per capacità GPU inutilizzata, offrendo i prezzi più bassi ma con disponibilità variabile. Potete fare offerte o noleggiare istanze tramite la loro interfaccia web, quindi accedere via SSH per installare Ollama.
Confronto dei costi: Ollama su cloud vs servizi API
La convenienza economica di Ollama ospitato in cloud dipende dal vostro volume di utilizzo. Utilizzate la calcolatore self-hosting vs API per trovare il tuo punto di pareggio.
| Modello | Costo API (per 1 milione di token) | GPU cloud | Costo dell'istanza/ora | Token/ora al punto di pareggio |
|---|---|---|---|---|
| Llama 3.3 70B | $0,10 in entrata / $0,32 in uscita | Lambda A100 40 GB | $1.10 | ~3,4 milioni di token in uscita |
| Mistral Large 3 | $2,00 in entrata / $6,00 in uscita | RunPod 4×A40 | $3.16 | ~530.000 token in uscita |
| Qwen3 32B | $0,08 in entrata / $0,28 in uscita | Vast.ai RTX 4090 | $0.54 | ~1,9 milioni di token in uscita |
| DeepSeek R1 | $0,50 in entrata / $2,15 in uscita | Lambda 4×A100 | $4.40 | ~2 milioni di token in uscita |
Se elabori più token rispetto al volume di pareggio orario, Ollama su cloud diventa più economico. Per carichi di lavoro intermittenti o volumi ridotti, le API come Claude Sonnet 5 ($2,00 in entrata / $10,00 in uscita per 1 milione di token) oppure Gemini 3.6 Flash ($1,50 in entrata / $7,50 in uscita per 1 milione di token) offrono condizioni economiche migliori, senza costi associati a tempi di inattività.
Modelli di distribuzione
Istanze su richiesta
Avvia un'istanza GPU quando necessario, esegui il tuo carico di lavoro e poi termina l'istanza. Questo approccio funziona bene per l'elaborazione batch, lo sviluppo o l'inferenza occasionale. Tutti i principali provider cloud e GPU supportano la tariffazione su richiesta.
Istanze Spot/Preemptible
Le istanze Spot di AWS, le VM Preemptible di GCP e le VM Spot di Azure offrono sconti del 60–90%, ma possono essere interrotte con un preavviso di 30 secondi–2 minuti. Sono adatte a carichi di lavoro batch tolleranti ai guasti, nei quali è possibile salvare periodicamente lo stato di avanzamento (checkpoint).
Su Vast.ai, le istanze interrompibili vengono eseguite ai prezzi di mercato senza alcuna garanzia di continuità, offrendo i prezzi più bassi disponibili, ma richiedono una gestione degli errori robusta.
Orchestrazione dei container
Per distribuzioni in produzione, esegui Ollama su Kubernetes con pool di nodi GPU. Ciò consente scalabilità automatica, bilanciamento del carico e alta disponibilità. Usa l'immagine ufficiale Ollama Docker immagine:
docker pull ollama/ollama
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama
Quindi distribuisci il servizio sul tuo cluster definendo le richieste di risorse GPU nello spec del pod.
Selezione dei modelli per le distribuzioni cloud
Scegli i modelli in base al budget di VRAM della tua GPU. Usa il Calcolatore VRAM per stimarne i requisiti:
- VRAM da 16 a 24 GB (T4, RTX 4090, A10G): Mistral 7B (~4,5 GB in quantizzazione a 4 bit), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)
- VRAM da 40 a 48 GB (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B, con spazio sufficiente per contesti più ampi
- VRAM da 80 GB in su (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, richiede 4×A100 o equivalente), Mistral Large 3 (~400 GB)
I modelli che richiedono più di 80 GB di VRAM necessitano di configurazioni multi-GPU o di parallelismo tensoriale, funzionalità non nativamente supportate da Ollama alla versione 0.3. Per tali modelli, valuta framework come vLLM o TGI, oppure utilizza API commerciali.
Ottimizzazione delle prestazioni
Diverse impostazioni influenzano la velocità di inferenza di Ollama sulle GPU cloud:
- QuantizzazioneQuantizzazione: Ollama utilizza per impostazione predefinita la quantizzazione a 4 bit (Q4_0). Usa
ollama pull model:q8_0per la quantizzazione a 8 bit (qualità migliore, occupa il doppio di VRAM) oppuremodel:q2_Kper la quantizzazione a 2 bit (più veloce, qualità inferiore). - Finestra contestualeDimensione del contesto: Impostabile tramite il parametro
num_ctx. Contesti più ampi consumano più VRAM: un contesto da 32K richiede significativamente più memoria rispetto a uno da 4K per lo stesso modello. - Dimensione del batch: Aumenta il parametro
num_batchper carichi di lavoro orientati al throughput, dove la latenza è meno importante rispetto al numero di token al secondo. - Livelli GPU: Ollama trasferisce automaticamente tutti i livelli sulla GPU. Su istanze con VRAM limitata, i livelli non contenibili verranno eseguiti sulla CPU, riducendo drasticamente la velocità.
Domande frequenti
Ollama offre un proprio servizio di hosting cloud?
No. Ollama è un software auto-hosted che esegue modelli sulla propria infrastruttura. Non esiste un servizio cloud ufficiale Ollama né un'API gestita. Quando si parla di «modelli Ollama su cloud», ci si riferisce all'esecuzione del software Ollama su infrastrutture cloud provisionate autonomamente tramite AWS, GCP, Azure o provider specializzati in GPU.
Posso utilizzare il formato API di Ollama con modelli su cloud?
Sì. Una volta avviato Ollama su una macchina virtuale cloud, espone un'API REST sulla porta 11434 compatibile con il formato API di OpenAI. È possibile indirizzare qualsiasi client compatibile con OpenAI all'indirizzo IP e alla porta della tua istanza cloud. Ciò consente di utilizzare i modelli ospitati da Ollama come sostituti diretti delle API commerciali in molte applicazioni, sebbene tu sia responsabile della gestione della disponibilità, dello scaling e della sicurezza.
Qual è il provider cloud più economico per eseguire Ollama?
Provider focalizzati sulle GPU, come Lambda Labs (1,10 $/ora per A100 da 40 GB) e Vast.ai (0,34–0,54 $/ora per RTX 4090), offrono prezzi significativamente inferiori rispetto ad AWS, GCP e Azure per quantità equivalenti di memoria GPU. Lambda garantisce maggiore affidabilità e supporto; Vast.ai offre i prezzi più bassi, ma con disponibilità variabile. Per carichi di lavoro produttivi che richiedono accordi SLA, i principali cloud forniscono garanzie migliori a fronte di costi più elevati.
Quanto costa eseguire Llama 3.3 70B sul cloud rispetto all’uso di API?
Llama 3.3 70B richiede circa 40 GB di VRAM in quantizzazione a 4 bit. Un'istanza Lambda Labs A100 40 GB costa $1,10/ora. Se generi 3,4 milioni di token in uscita all'ora (~945 token/secondo in modo continuativo), raggiungi il pareggio rispetto al costo dell'API pari a $0,32 per milione di token. Al di sotto di questa soglia, le API risultano più economiche; al di sopra, l'istanza cloud risulta vantaggiosa. La maggior parte dei carichi di lavoro reali è intermittente piuttosto che continuativo, rendendo quindi preferibile la tariffazione API, a meno che tu non esegua costantemente processi batch.
Ollama può scalare su più GPU nel cloud?
Ollama rileva e utilizza automaticamente più GPU su una singola istanza, ma esegue un modello per GPU anziché distribuire un singolo modello su più GPU (parallelismo tensoriale). Ciò significa che un'istanza 4×A100 può eseguire quattro istanze distinte di modelli o gestire quattro richieste concorrenti in modo efficiente, ma non può caricare un singolo modello da 400 GB come Mistral Large 3, che supera la capacità di una singola GPU. Per il parallelismo su più GPU, usa invece vLLM, TensorRT-LLM o Text Generation Inference.
L’esecuzione di Ollama nel cloud è sicura?
Per impostazione predefinita, Ollama si associa all'indirizzo 0.0.0.0:11434, esponendo la sua API a qualsiasi client di rete. Su istanze cloud con indirizzi IP pubblici, ciò significa che il tuo endpoint di inferenza è accessibile pubblicamente, a meno che tu non configuri regole firewall, gruppi di sicurezza o accesso VPN. OLLAMA_HOST=127.0.0.1:11434 per limitare l'accesso a localhost, quindi utilizza tunnel SSH, un reverse proxy con autenticazione o una VPN per garantire l'accesso remoto. Le distribuzioni su cloud dovrebbero inoltre implementare registrazione delle richieste, limitazione del numero di richieste e validazione degli input per prevenire abusi.

