- Ollama Cloud indica l’esecuzione di Ollama su infrastrutture cloud (AWS, GCP, Azure) anziché su hardware locale: stessa interfaccia a riga di comando (CLI) e stesso API, ma esecuzione remota.
- Tutti i modelli della libreria Ollama funzionano su istanze cloud; si paga orariamente per la potenza computazionale della GPU invece di acquistare l’hardware.
- Il punto di pareggio varia in base all’utilizzo: il calcolatore self-hosting vs API mostra quando le GPU cloud diventano più convenienti rispetto all’acquisto di hardware locale.
- Compromesso sulla privacy: l’hosting cloud implica che i tuoi prompt e le risposte transiteranno sulla rete e verranno elaborati sull’infrastruttura del fornitore, a differenza dell’inferenza completamente locale.
Le distribuzioni cloud di Ollama eseguono lo stesso server Ollama che installeresti localmente, ma su istanze GPU noleggiate da AWS, Google Cloud, Azure o altri fornitori. Ottieni la stessa libreria di modelli, gli stessi ollama run comandi e la stessa API REST—ma l’inferenza avviene su hardware remoto, per il quale paghi a ore anziché su hardware di tua proprietà. Questa guida spiega quando l’hosting cloud ha senso, come i relativi costi si confrontano con quelli delle GPU locali e quali compromessi comporta in termini di privacy e controllo.
- Cosa significa Ollama Cloud
- Come Ollama Cloud differisce da Ollama locale
- Compatibilità CLI e API
- Quali modelli sono disponibili
- Prezzi: cloud vs locale vs servizi API
- Privacy e controllo dei dati
- Quando scegliere il cloud invece dell’hardware locale
- Configurazione di Ollama su un'istanza cloud
- Considerazioni sulle prestazioni
- Domande frequenti
Cosa significa Ollama Cloud
Non esiste alcun prodotto autonomo denominato «Ollama Cloud» allo stato attuale (inizio 2026). Quando gli sviluppatori parlano di «Ollama cloud», intendono una delle due seguenti opzioni:
- Ollama auto-hosted su macchine virtuali cloud: Noleggi una macchina virtuale dotata di GPU da AWS EC2, Google Compute Engine, Azure, Lambda Labs o RunPod, installi Ollama manualmente e vi esegui i modelli. Gestisci l’istanza tu stesso, ma non acquisti l’hardware.
- Servizi Ollama gestiti: Piattaforme di terze parti che preinstallano Ollama, si occupano della scalabilità e ti addebitano in base al numero di richieste o per minuto. Questi servizi sono meno diffusi e solitamente si basano sull’approccio n. 1.
Entrambe le opzioni si differenziano dall’esecuzione di Ollama in locale sul proprio desktop o server. Il binario Ollama, la libreria di modelli, l’interfaccia a riga di comando (CLI) e l’API restano identici: cambia soltanto il luogo di esecuzione.
Come Ollama Cloud differisce da Ollama locale
| Dimensione | Ollama in locale | Ollama su cloud |
|---|---|---|
| Costo hardware | Acquisto iniziale della GPU ($500–$2500) | Noleggio orario ($0,50–$5/ora, a seconda della GPU) |
| Velocità di inferenza | Dipende dalla tua GPU; nessuna latenza di rete | Dipende dalla GPU noleggiata; aggiunge una latenza di round-trip di rete di 20–100 ms |
| Privacy | I prompt non lasciano mai il tuo dispositivo | I prompt e le risposte viaggiano sulla rete; il fornitore cloud ha accesso ai metadati del traffico |
| Scalabilità | Fissa, determinata dall’hardware disponibile | Possibilità di avviare istanze più grandi o aggiuntive su richiesta |
| Manutenzione | Tu gestisci sistema operativo, driver e aggiornamenti di Ollama | Tu gestisci la VM (se auto-hosted) oppure la piattaforma se ne occupa (nei servizi gestiti) |
| Disponibilità | Legata alla disponibilità (uptime) del tuo dispositivo | Sempre attiva, purché mantenga l’istanza in esecuzione; paghi anche per il tempo di inattività (idle time) |
L’esperienza funzionale è identica. Uno script che esegue curl http://localhost:11434/api/generate funziona senza modifiche se sostituisci localhost con l’indirizzo IP pubblico della tua istanza cloud.
Compatibilità CLI e API
L’interfaccia a riga di comando (CLI) e l’API REST di Ollama sono indipendenti dal trasporto. Per configurare la CLI in modo che punti a un’istanza cloud anziché a un server locale:
export OLLAMA_HOST=http://203.0.113.42:11434
ollama run llama3.1:8bSostituisci 203.0.113.42 con l’indirizzo IP pubblico della tua VM cloud. Il modello verrà scaricato sull’istanza cloud ed eseguito lì; la tua console riceverà le risposte in streaming tramite la rete.
Per i client API, modifica l’URL base:
curl http://203.0.113.42:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Spiega le reti neurali in una frase."
}'Tutti gli endpoint (/api/generate, /api/chat, /api/embeddings) si comportano in modo identico. Le librerie client (Python, JavaScript, Go) accettano un parametro host personalizzabile:
import ollama
client = ollama.Client(host='http://203.0.113.42:11434')
response = client.chat(model='llama3.1:8b', messages=[...])Non sono necessarie modifiche al codice oltre alla sostituzione dell’URL dell’endpoint.
Quali modelli sono disponibili
Ogni modello presente nella libreria Ollama funziona su istanze cloud. La Elenco modelli Ollama include Llama 3.1, Mistral, Gemma 2, Qwen, Phi, DeepSeek, e decine di altri modelli. La disponibilità dei modelli non è limitata dal luogo in cui viene eseguito Ollama.
Il vincolo principale è la VRAM della GPU. Un’istanza cloud dotata di una NVIDIA L4 (24 GB di VRAM) può eseguire gli stessi modelli quantizzati di una RTX 4090 locale. Un’istanza più piccola con 16 GB di VRAM è invece limitata a modelli più piccoli o a livelli più spinti di quantizzazione, esattamente come avviene con l’hardware locale. Usa il Calcolatore VRAM per determinare quale tipo di istanza ti serve per un dato modello e livello di quantizzazione.
Prezzi: cloud vs locale vs servizi API
I prezzi delle GPU su cloud variano in base al fornitore e al tipo di GPU. Ecco alcuni esempi rappresentativi di tariffe orarie all’inizio del 2026:
| Fornitore | GPU | VRAM | Costo/ora | Adatto a |
|---|---|---|---|---|
| AWS EC2 g5.xlarge | NVIDIA A10G | 24 GB | ~$1.00 | Llama 3.1 8B, Mistral 7B |
| GCP n1 + T4 | NVIDIA T4 | 16 GB | ~$0.50 | Modelli più piccoli, versioni quantizzate da 7B |
| Lambda Labs A10 | NVIDIA A10 | 24 GB | ~$0.60 | Llama 3.1 8B, Mistral 7B |
| RunPod RTX 4090 | RTX 4090 | 24 GB | ~$0.69 | Llama 3.1 8B, Mistral 7B |
| Azure NC6s v3 | NVIDIA V100 | 16 GB | ~$3.00 | Opzione obsoleta, spesso esistono alternative più economiche |
Se si utilizza un'istanza cloud 24 ore su 24, un'istanza da 0,60 USD/ora costa 432 USD/mese o 5.184 USD/anno. Una RTX 4090 locale (circa 1.600 USD) raggiunge il pareggio in meno di quattro mesi di utilizzo continuativo. Il calcolatore self-hosting vs API analizza questo aspetto considerando diversi modelli di utilizzo.
Il punto di pareggio varia in base al livello di utilizzo:
- Utilizzo intensivo (8+ ore/giorno): L'hardware locale si ripaga in pochi mesi.
- Utilizzo intermittente (qualche ora/settimana): Le istanze cloud risultano più convenienti: si paga solo per le ore effettivamente utilizzate.
- Carichi di lavoro a picco (burst): Con il cloud è possibile noleggiare una GPU di fascia alta per un compito breve senza doverla acquistare.
Confronta questo approccio con i servizi API ospitati come OpenAI, Anthropic o Groq, che addebitano in base al numero di token. Per Llama 3.1 8B un servizio API ospitato, i prezzi tipici sono compresi tra 0,10 e 0,30 USD per milione di token in input e tra 0,30 e 0,60 USD per milione di token in output. Se questa soluzione risulti più economica rispetto a Ollama su cloud dipende dal volume delle richieste e dalla lunghezza media delle risposte. Il Calcolatore dei costi API analizza nel dettaglio costi per modello e utilizzo mensile.
Privacy e controllo dei dati
Eseguire Ollama localmente significa che i tuoi prompt, gli output dei modelli e tutti i documenti elaborati non lasciano mai il tuo computer. Questo è fondamentale per settori regolamentati (sanità, legale, finanza) o per dati proprietari.
Eseguire Ollama su una macchina virtuale cloud comporta i seguenti rischi:
- Transito sulla rete: I prompt e le risposte viaggiano tra il client e l'istanza cloud, potenzialmente attraverso Internet pubblico, a meno che non si utilizzi una VPN o una rete privata.
- Accesso del fornitore cloud: AWS, Google e Azure hanno accesso tecnico alla memoria e al disco della tua VM. Sebbene contrattualmente si impegnino a non ispezionare i dati dei clienti, tale possibilità rimane comunque concreta.
- Log e metadati: I fornitori cloud registrano le connessioni di rete, le chiamate API alle loro interfacce di gestione e gli eventi di fatturazione. Questi log rivelano quando stai eseguendo inferenze e quanta potenza computazionale stai utilizzando, anche se non mostrano il contenuto effettivo dei prompt.
- Residenza dei dati: La tua VM viene eseguita in una specifica regione AWS o zona GCP. Se il tuo quadro normativo impone restrizioni sulla localizzazione dei dati, dovrai selezionare di conseguenza la regione.
Se il tuo modello di minaccia include attori statali o richieste di produzione probatoria da parte del fornitore cloud, l'inferenza locale è l'unica opzione sicura. Se invece ottimizzi per costo e comodità e i tuoi dati non sono sensibili, l'hosting su cloud è perfettamente praticabile.
Quando scegliere il cloud invece dell’hardware locale
Scegli Ollama su cloud quando:
- Hai bisogno di accedere a modelli linguistici di grandi dimensioni (LLM), ma non possiedi una GPU e non puoi giustificare il costo iniziale di una GPU performante ($800+).
- Il tuo utilizzo è intermittente — qualche ora alla settimana o al mese — e preferisci pagare per la potenza computazionale solo quando la utilizzi effettivamente.
- Hai bisogno di scalare temporaneamente verso l'alto per un grosso batch job, per poi ridurre nuovamente le risorse.
- Stai facendo prototipazione e vuoi testare diversi tipi di GPU (16 GB, 24 GB, 40 GB) prima di investire nell'acquisto di hardware dedicato.
- Stai sviluppando un servizio che richiede disponibilità continua (24/7) e ridondanza, e gestire autonomamente server fisici non è fattibile.
Scegli Ollama locale quando:
- Già possiedi una GPU con almeno 12 GB di VRAM, oppure sei disposto ad acquistarne una.
- Esegui inferenze quotidianamente per diverse ore: l'hardware si ripaga rapidamente.
- La privacy è un requisito assoluto: i tuoi dati non possono in alcun caso lasciare i tuoi locali.
- Vuoi eliminare completamente i costi per singola richiesta e avere spese prevedibili.
- Sei offline o operi su una rete con accesso in uscita limitato.
Il calcolatore self-hosting vs API ti permette di inserire il tuo utilizzo mensile previsto (ore di inferenza, numero di richieste, token medi per richiesta) e confrontare i costi dell'acquisto di una GPU, del noleggio di un'istanza cloud o dell'utilizzo di un servizio API ospitato. Per la maggior parte degli sviluppatori che eseguono modelli per qualche ora al giorno, l'hardware locale diventa più conveniente dopo 3–6 mesi.
Configurazione di Ollama su un'istanza cloud
Il processo è identico su tutti i provider: avvia un'istanza con GPU, accedi tramite SSH, installa Ollama ed espone la porta 11434.
AWS EC2
- Avvia un'istanza
g5.xlargeog5.2xlarge(Ubuntu 22.04 LTS, GPU NVIDIA A10G). - Accedi all'istanza tramite SSH:
ssh -i your-key.pem ubuntu@<instance-ip> - Installa Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Avvia Ollama:
ollama serve(oppure configuralo come servizio systemd). - Scarica un modello:
ollama pull llama3.1:8b - Configura il gruppo di sicurezza per consentire traffico TCP in entrata sulla porta 11434 proveniente dal tuo indirizzo IP.
Google Cloud Platform
- Crea una VM Compute Engine dotata di GPU T4 o A100 (seleziona una famiglia di macchine abilitata per GPU).
- Accedi tramite SSH dalla console GCP o
gcloud compute ssh. - Installa Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Avvia Ollama:
ollama serve - Aggiorna le regole del firewall per consentire il traffico TCP sulla porta 11434 dall'intervallo di indirizzi IP in uso.
Lambda Labs o RunPod
- Noleggia un'istanza dotata di una GPU RTX 4090 o A10.
- Accedi tramite SSH utilizzando le credenziali fornite.
- Installa Ollama:
curl -fsSL https://ollama.com/install.sh | sh - Avvia Ollama ed esegui il download dei modelli come indicato sopra.
Per l'uso in produzione, esegui Ollama come servizio systemd in modo che venga riavviato automaticamente al riavvio del sistema e utilizza un reverse proxy (Nginx o Caddy) con crittografia TLS se lo esponi a Internet pubblico.
Considerazioni sulle prestazioni
Le istanze cloud introducono una latenza di rete. Un server Ollama locale risponde in meno di 5 ms per il primo token (dopo il caricamento del modello). Un'istanza cloud aggiunge il tempo di andata e ritorno tra il tuo dispositivo e il data center: tipicamente 20–50 ms all'interno della stessa regione, 80–150 ms tra continenti diversi. Per conversazioni interattive, questa latenza è percepibile ma non compromette l’usabilità; per carichi di lavoro batch, invece, è trascurabile.
La velocità di generazione dei token dipende dalla GPU, non dalla sua ubicazione fisica. Una GPU A10G su AWS genera token alla stessa velocità di un’A10G sul tuo desktop. Tuttavia, le istanze cloud possono subire effetti di "vicini rumorosi": altre macchine virtuali sullo stesso host fisico possono degradare le prestazioni. L’uso di istanze dedicate o di noleggi bare-metal con GPU elimina questo problema, ma comporta costi maggiori.
Domande frequenti
Esiste un servizio ufficiale Ollama Cloud?
All’inizio del 2026, Ollama non offre un servizio cloud gestito. Il termine «Ollama Cloud» si riferisce all’esecuzione del server open source Ollama su infrastrutture cloud da te noleggiate e gestite autonomamente, oppure all’utilizzo di una piattaforma di terze parti che ospita Ollama per tuo conto. Il progetto Ollama fornisce il software; tu o il fornitore di hosting fornisci la potenza di calcolo.
Posso usare Ollama Cloud con gli stessi modelli che eseguo localmente?
Sì. La libreria di modelli è identica. Qualsiasi modello che scarichi con ollama pull localmente funziona anche su un’istanza cloud. L’unica limitazione è la VRAM: assicurati che la GPU cloud disponga di memoria sufficiente per il modello e per il livello di quantizzazione scelto. Consulta Requisiti VRAM per modello per abbinare i modelli ai tipi di istanza.
Come posso proteggere Ollama in esecuzione su un’istanza cloud?
Per impostazione predefinita, Ollama ascolta su 127.0.0.1:11434, che non è accessibile dall’esterno della macchina virtuale. Per esporlo, imposta OLLAMA_HOST=0.0.0.0:11434 prima di avviare il server. Quindi limita l’accesso tramite le regole del firewall cloud (gruppi di sicurezza AWS, regole firewall GCP) consentendo solo il tuo indirizzo IP o la tua VPN. Per l’uso in produzione, colloca Ollama dietro un reverse proxy con crittografia TLS e autenticazione (autenticazione HTTP di base, chiavi API o OAuth). Non esporre mai un server Ollama non autenticato su Internet pubblico: ciò consentirebbe a chiunque di eseguire modelli arbitrari a tue spese.
Qual è più economico: Ollama su una GPU cloud o l’API di OpenAI?
Dipende dall’uso. Per un modello da 7 miliardi di parametri, una GPU cloud costa circa 0,50–1,00 USD/ora. Se generi 10 milioni di token/ora, il costo è di circa 0,05–0,10 USD per milione di token: più conveniente rispetto alla maggior parte delle API ospitate per modelli di dimensioni equivalenti. Ma se generi soltanto 1 milione di token/ora, pagheresti 0,50–1,00 USD per milione di token, risultando più costoso rispetto ai servizi API. Inoltre, le API ospitate gestiscono automaticamente scalabilità, uptime e aggiornamenti dei modelli. Usa il calcolatore self-hosting vs API per modellare il tuo carico di lavoro specifico.
L’esecuzione di Ollama nel cloud riduce la riservatezza dei miei dati?
Sì, rispetto all’inferenza completamente locale. I tuoi prompt e i risultati generati dal modello viaggiano attraverso la rete e vengono memorizzati su una macchina virtuale alla quale il fornitore cloud ha accesso privilegiato (root). Se la privacy è fondamentale — ad esempio nel trattamento di dati sanitari protetti HIPAA, documenti legali coperti dal segreto professionale dell’avvocato o codice proprietario — esegui Ollama localmente. Se i tuoi dati non sono sensibili o se ti fidi degli impegni contrattuali del tuo fornitore cloud, l’hosting cloud rappresenta un ragionevole compromesso tra costo e comodità.
Posso eseguire più modelli su una singola istanza cloud?
Sì, purché l’istanza disponga di VRAM sufficiente per tenere contemporaneamente i modelli in memoria. Ollama carica i modelli su richiesta e li mantiene nella VRAM finché la pressione sulla memoria non li espelle. Un’istanza da 24 GB può contenere contemporaneamente Llama 3.1 8B (circa 8 GB con quantizzazione Q8) e Mistral 7B (dimensioni simili). Il passaggio tra modelli già caricati è istantaneo; il caricamento di un nuovo modello dal disco richiede alcuni secondi.

