{"id":2516,"date":"2026-08-31T20:12:45","date_gmt":"2026-08-31T20:12:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2516"},"modified":"2026-08-31T20:12:45","modified_gmt":"2026-08-31T20:12:45","slug":"ollama-cloud-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/it\/ollama-cloud-models\/","title":{"rendered":"Modelli Ollama Cloud: esecuzione di Ollama su infrastrutture cloud"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ollama non offre modelli ospitati in cloud come servizio API: \u00e8 invece un motore di inferenza locale da eseguire sull\u2019hardware di vostra propriet\u00e0.<\/li>\n<li>\u00c8 possibile distribuire Ollama su macchine virtuali cloud (AWS EC2, GCP Compute Engine, Azure) per combinare la facilit\u00e0 d\u2019uso di Ollama con la scalabilit\u00e0 del cloud.<\/li>\n<li>Provider cloud specializzati nelle GPU, come Lambda Labs, Vast.ai e RunPod, offrono istanze GPU pi\u00f9 convenienti rispetto ai principali cloud per l\u2019esecuzione di Ollama.<\/li>\n<li>I costi di Ollama su cloud variano tra 0,50 e 3 $\/ora per istanze GPU, contro 0,50\u20135 $ per milione di token offerti dai servizi API commerciali: il punto di pareggio dipende dal volume di utilizzo.<\/li>\n<\/ul>\n<\/div>\n<p>Ollama non fornisce modelli ospitati in cloud come servizio API gestito. <a href=\"https:\/\/convly.ai\/it\/what-is-ollama-complete-guide-2026\/\">Ollama<\/a> \u00e8 un motore di inferenza locale che esegue modelli open source sull\u2019hardware di vostra propriet\u00e0. Tuttavia, potete distribuire Ollama su infrastrutture cloud \u2014 come AWS EC2, Google Cloud, macchine virtuali Azure o provider specializzati in GPU \u2014 per ottenere potenza computazionale cloud mantenendo l\u2019interfaccia semplice di Ollama. Questo approccio vi garantisce il pieno controllo sull\u2019ambiente di esecuzione ed \u00e8 spesso pi\u00f9 conveniente rispetto agli API commerciali quando i volumi di utilizzo sono elevati.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a9604d08231b\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Attiva\/Disattiva<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a9604d08231b\"  aria-label=\"Attiva\/Disattiva\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#What_Ollama_Is_and_What_It_Isnt\" >Cos\u2019\u00e8 Ollama (e cosa non \u00e8)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Running_Ollama_on_Major_Cloud_Providers\" >Esecuzione di Ollama sui principali provider cloud<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#GPU-Focused_Cloud_Providers\" >Provider cloud specializzati nelle GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Cost_Comparison_Cloud_Ollama_vs_API_Services\" >Confronto dei costi: Ollama su cloud vs servizi API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Deployment_Patterns\" >Modelli di distribuzione<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Model_Selection_for_Cloud_Deployments\" >Selezione dei modelli per le distribuzioni cloud<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Performance_Optimization\" >Ottimizzazione delle prestazioni<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/it\/ollama-cloud-models\/#Frequently_Asked_Questions\" >Domande frequenti<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Is_and_What_It_Isnt\"><\/span>Cos\u2019\u00e8 Ollama (e cosa non \u00e8)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama \u00e8 un motore open source di inferenza che esegue modelli linguistici di grandi dimensioni in locale. Gestisce il download dei modelli, la quantizzazione e l\u2019inferenza tramite una semplice interfaccia CLI e un\u2019API REST. Secondo il <a href=\"https:\/\/github.com\/ollama\/ollama\" rel=\"noopener\" target=\"_blank\">repository ufficiale di Ollama<\/a>, it supports models from the Llama, Mistral, Gemma, Qwen, and DeepSeek families, among others.<\/p>\n<p>Ollama non opera come provider cloud. Non ospita modelli sui propri server n\u00e9 applica tariffe basate sul numero di token. Quando eseguite <code>ollama run llama3.3<\/code>, il modello viene eseguito su qualsiasi macchina abbia eseguito il comando: il tuo laptop, un server di un data center o una macchina virtuale nel cloud per la quale paghi separatamente.<\/p>\n<p>The term &#8220;ollama cloud models&#8221; typically refers to one of three deployment patterns:<\/p>\n<ul>\n<li>Esecuzione di Ollama su una macchina virtuale cloud con accelerazione GPU<\/li>\n<li>Distribuzione di Ollama su una piattaforma di orchestrazione container (Kubernetes, ECS)<\/li>\n<li>Utilizzo di Ollama su un\u2019istanza GPU dedicata per una scalabilit\u00e0 su richiesta<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Running_Ollama_on_Major_Cloud_Providers\"><\/span>Esecuzione di Ollama sui principali provider cloud<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Istanze GPU AWS EC2<\/h3>\n<p>AWS offre istanze EC2 abilitate GPU nelle famiglie G, P e Inf. Per i carichi di lavoro Ollama, l\u2019istanza g5.xlarge (1\u00d7 NVIDIA A10G, 24 GB VRAM) parte da circa 1,01 $\/ora in modalit\u00e0 on-demand nella regione us-east-1, mentre la g5.12xlarge (4\u00d7 A10G, 96 GB VRAM) costa circa 5,67 $\/ora.<\/p>\n<p>Per distribuire Ollama su EC2:<\/p>\n<pre><code># Avvia un'istanza Ubuntu 22.04 g5.xlarge con Deep Learning AMI\n# Accedi all'istanza tramite SSH\nsudo apt update\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\n\n# Verifica che la GPU venga rilevata\nnvidia-smi\n\n# Esegui un modello\nollama run llama3.3:70b\n<\/code><\/pre>\n<p>A <a href=\"https:\/\/convly.ai\/it\/vram-requirements-every-major-llm-2026\/\">Llama 3.3 70B<\/a> model requires approximately 40 GB VRAM at 4-bit quantization, so you&#8217;d need a g5.12xlarge or larger. Llama 3.1 8B needs around 5 GB VRAM at 4-bit, fitting comfortably on a g5.xlarge.<\/p>\n<h3>Google Cloud Platform<\/h3>\n<p>GCP fornisce istanze GPU tramite le famiglie di macchine N1 e A2 di Compute Engine. Un\u2019istanza n1-standard-4 con 1\u00d7 NVIDIA T4 (16 GB VRAM) costa circa 0,62 $\/ora, mentre un\u2019istanza a2-highgpu-1g con 1\u00d7 A100 (40 GB VRAM) costa circa 3,67 $\/ora nella regione us-central1.<\/p>\n<pre><code># Crea un'istanza con GPU\ngcloud compute instances create ollama-instance \n  --zone=us-central1-a \n  --machine-type=n1-standard-4 \n  --accelerator=type=nvidia-tesla-t4,count=1 \n  --image-family=ubuntu-2204-lts \n  --image-project=ubuntu-os-cloud \n  --maintenance-policy=TERMINATE\n\n# Accedi via SSH e installa\ngcloud compute ssh ollama-instance --zone=us-central1-a\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run mistral:7b\n<\/code><\/pre>\n<h3>Microsoft Azure<\/h3>\n<p>Le VM della serie NC di Azure offrono GPU NVIDIA per carichi di lavoro di inferenza. Un\u2019istanza NC6s_v3 (1\u00d7 V100, 16 GB VRAM) costa circa 3,06 $\/ora, mentre un\u2019istanza NC24ads_A100_v4 (1\u00d7 A100, 80 GB VRAM) costa circa 3,67 $\/ora nella regione East US.<\/p>\n<p>Installation follows the same pattern: provision a GPU-enabled Ubuntu VM, install NVIDIA drivers if not using a pre-configured image, and run the Ollama install script.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU-Focused_Cloud_Providers\"><\/span>Provider cloud specializzati nelle GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>I provider cloud specializzati nelle GPU offrono spesso un rapporto costo-prestazioni migliore rispetto ai principali cloud per le distribuzioni di Ollama:<\/p>\n<table>\n<thead>\n<tr>\n<th>Fornitore<\/th>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Costo\/ora<\/th>\n<th>Adatto a<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Lambda Labs<\/td>\n<td>A100<\/td>\n<td>40 GB<\/td>\n<td>$1.10<\/td>\n<td>DeepSeek R1 Distill Llama 70B, Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Vast.ai<\/td>\n<td>RTX 4090<\/td>\n<td>24 GB<\/td>\n<td>$0.34-$0.54<\/td>\n<td>Mistral 7B, Llama 3.1 8B, Phi-4<\/td>\n<\/tr>\n<tr>\n<td>RunPod<\/td>\n<td>A40<\/td>\n<td>48 GB<\/td>\n<td>$0.79<\/td>\n<td>Mistral Large 3 (singola istanza), Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Paperspace<\/td>\n<td>A4000<\/td>\n<td>16 GB<\/td>\n<td>$0.76<\/td>\n<td>Modelli pi\u00f9 piccoli fino a circa 14 miliardi di parametri<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Lambda Labs offre la configurazione pi\u00f9 semplice: le istanze includono gi\u00e0 i driver NVIDIA e CUDA preinstallati. Dopo aver avviato un\u2019istanza tramite il loro dashboard:<\/p>\n<pre><code>ssh ubuntu@\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run qwen3:32b\n<\/code><\/pre>\n<p>Vast.ai opera come marketplace per capacit\u00e0 GPU inutilizzata, offrendo i prezzi pi\u00f9 bassi ma con disponibilit\u00e0 variabile. Potete fare offerte o noleggiare istanze tramite la loro interfaccia web, quindi accedere via SSH per installare Ollama.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Cloud_Ollama_vs_API_Services\"><\/span>Confronto dei costi: Ollama su cloud vs servizi API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La convenienza economica di Ollama ospitato in cloud dipende dal vostro volume di utilizzo. Utilizzate la <a href=\"https:\/\/convly.ai\/it\/self-hosting-vs-api-calculator\/\">calcolatore self-hosting vs API<\/a> per trovare il tuo punto di pareggio.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modello<\/th>\n<th>Costo API (per 1 milione di token)<\/th>\n<th>GPU cloud<\/th>\n<th>Costo dell'istanza\/ora<\/th>\n<th>Token\/ora al punto di pareggio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>$0,10 in entrata \/ $0,32 in uscita<\/td>\n<td>Lambda A100 40 GB<\/td>\n<td>$1.10<\/td>\n<td>~3,4 milioni di token in uscita<\/td>\n<\/tr>\n<tr>\n<td>Mistral Large 3<\/td>\n<td>$2,00 in entrata \/ $6,00 in uscita<\/td>\n<td>RunPod 4\u00d7A40<\/td>\n<td>$3.16<\/td>\n<td>~530.000 token in uscita<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>$0,08 in entrata \/ $0,28 in uscita<\/td>\n<td>Vast.ai RTX 4090<\/td>\n<td>$0.54<\/td>\n<td>~1,9 milioni di token in uscita<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1<\/td>\n<td>$0,50 in entrata \/ $2,15 in uscita<\/td>\n<td>Lambda 4\u00d7A100<\/td>\n<td>$4.40<\/td>\n<td>~2 milioni di token in uscita<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>If you&#8217;re processing more than the break-even token volume per hour, cloud Ollama becomes cheaper. For bursty workloads or low volumes, APIs like Claude Sonnet 5 ($2.00 in \/ $10.00 out per 1M tokens) or Gemini 3.6 Flash ($1.50 in \/ $7.50 out per 1M tokens) offer better economics with no idle time costs.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Deployment_Patterns\"><\/span>Modelli di distribuzione<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Istanze su richiesta<\/h3>\n<p>Avvia un'istanza GPU quando necessario, esegui il tuo carico di lavoro e poi termina l'istanza. Questo approccio funziona bene per l'elaborazione batch, lo sviluppo o l'inferenza occasionale. Tutti i principali provider cloud e GPU supportano la tariffazione su richiesta.<\/p>\n<h3>Istanze Spot\/Preemptible<\/h3>\n<p>Le istanze Spot di AWS, le VM Preemptible di GCP e le VM Spot di Azure offrono sconti del 60\u201390%, ma possono essere interrotte con un preavviso di 30 secondi\u20132 minuti. Sono adatte a carichi di lavoro batch tolleranti ai guasti, nei quali \u00e8 possibile salvare periodicamente lo stato di avanzamento (checkpoint).<\/p>\n<p>Su Vast.ai, le istanze interrompibili vengono eseguite ai prezzi di mercato senza alcuna garanzia di continuit\u00e0, offrendo i prezzi pi\u00f9 bassi disponibili, ma richiedono una gestione degli errori robusta.<\/p>\n<h3>Orchestrazione dei container<\/h3>\n<p>For production deployments, run Ollama in Kubernetes with GPU node pools. This enables auto-scaling, load balancing, and high availability. Use the official Ollama Docker image:<\/p>\n<pre><code>docker pull ollama\/ollama\ndocker run -d --gpus=all -v ollama:\/root\/.ollama -p 11434:11434 ollama\/ollama\n<\/code><\/pre>\n<p>Quindi distribuisci il servizio sul tuo cluster definendo le richieste di risorse GPU nello spec del pod.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_for_Cloud_Deployments\"><\/span>Selezione dei modelli per le distribuzioni cloud<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Scegli i modelli in base al budget di VRAM della tua GPU. Usa il <a href=\"https:\/\/convly.ai\/it\/llm-vram-calculator\/\">Calcolatore VRAM<\/a> per stimarne i requisiti:<\/p>\n<ul>\n<li><strong>VRAM da 16 a 24 GB<\/strong> (T4, RTX 4090, A10G): Mistral 7B (~4.5 GB at 4-bit), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)<\/li>\n<li><strong>VRAM da 40 a 48 GB<\/strong> (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B, con spazio sufficiente per contesti pi\u00f9 ampi<\/li>\n<li><strong>VRAM da 80 GB in su<\/strong> (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, richiede 4\u00d7A100 o equivalente), Mistral Large 3 (~400 GB)<\/li>\n<\/ul>\n<p>I modelli che richiedono pi\u00f9 di 80 GB di VRAM necessitano di configurazioni multi-GPU o di parallelismo tensoriale, funzionalit\u00e0 non nativamente supportate da Ollama alla versione 0.3. Per tali modelli, valuta framework come vLLM o TGI, oppure utilizza API commerciali.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Optimization\"><\/span>Ottimizzazione delle prestazioni<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Diverse impostazioni influenzano la velocit\u00e0 di inferenza di Ollama sulle GPU cloud:<\/p>\n<ul>\n<li><strong>Quantizzazione<\/strong>Quantizzazione: Ollama utilizza per impostazione predefinita la quantizzazione a 4 bit (Q4_0). Usa <code>ollama pull model:q8_0<\/code> per la quantizzazione a 8 bit (qualit\u00e0 migliore, occupa il doppio di VRAM) oppure <code>model:q2_K<\/code> per la quantizzazione a 2 bit (pi\u00f9 veloce, qualit\u00e0 inferiore).<\/li>\n<li><strong>Finestra contestuale<\/strong>Dimensione del contesto: Impostabile tramite il parametro <code>num_ctx<\/code> . Contesti pi\u00f9 ampi consumano pi\u00f9 VRAM: un contesto da 32K richiede significativamente pi\u00f9 memoria rispetto a uno da 4K per lo stesso modello.<\/li>\n<li><strong>Dimensione del batch<\/strong>: Aumenta il parametro <code>num_batch<\/code> per carichi di lavoro orientati al throughput, dove la latenza \u00e8 meno importante rispetto al numero di token al secondo.<\/li>\n<li><strong>Livelli GPU<\/strong>: Ollama trasferisce automaticamente tutti i livelli sulla GPU. Su istanze con VRAM limitata, i livelli non contenibili verranno eseguiti sulla CPU, riducendo drasticamente la velocit\u00e0.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Domande frequenti<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ollama offre un proprio servizio di hosting cloud?<\/h3>\n<p>No. Ollama \u00e8 un software auto-hosted che esegue modelli sulla propria infrastruttura. Non esiste un servizio cloud ufficiale Ollama n\u00e9 un'API gestita. Quando si parla di \u00abmodelli Ollama su cloud\u00bb, ci si riferisce all'esecuzione del software Ollama su infrastrutture cloud provisionate autonomamente tramite AWS, GCP, Azure o provider specializzati in GPU.<\/p>\n<h3>Posso utilizzare il formato API di Ollama con modelli su cloud?<\/h3>\n<p>S\u00ec. Una volta avviato Ollama su una macchina virtuale cloud, espone un'API REST sulla porta 11434 compatibile con il formato API di OpenAI. \u00c8 possibile indirizzare qualsiasi client compatibile con OpenAI all'indirizzo IP e alla porta della tua istanza cloud. Ci\u00f2 consente di utilizzare i modelli ospitati da Ollama come sostituti diretti delle API commerciali in molte applicazioni, sebbene tu sia responsabile della gestione della disponibilit\u00e0, dello scaling e della sicurezza.<\/p>\n<h3>Qual \u00e8 il provider cloud pi\u00f9 economico per eseguire Ollama?<\/h3>\n<p>Provider focalizzati sulle GPU, come Lambda Labs (1,10 $\/ora per A100 da 40 GB) e Vast.ai (0,34\u20130,54 $\/ora per RTX 4090), offrono prezzi significativamente inferiori rispetto ad AWS, GCP e Azure per quantit\u00e0 equivalenti di memoria GPU. Lambda garantisce maggiore affidabilit\u00e0 e supporto; Vast.ai offre i prezzi pi\u00f9 bassi, ma con disponibilit\u00e0 variabile. Per carichi di lavoro produttivi che richiedono accordi SLA, i principali cloud forniscono garanzie migliori a fronte di costi pi\u00f9 elevati.<\/p>\n<h3>Quanto costa eseguire Llama 3.3 70B sul cloud rispetto all\u2019uso di API?<\/h3>\n<p>Llama 3.3 70B richiede circa 40 GB di VRAM in quantizzazione a 4 bit. Un'istanza Lambda Labs A100 40 GB costa $1,10\/ora. Se generi 3,4 milioni di token in uscita all'ora (~945 token\/secondo in modo continuativo), raggiungi il pareggio rispetto al costo dell'API pari a $0,32 per milione di token. Al di sotto di questa soglia, le API risultano pi\u00f9 economiche; al di sopra, l'istanza cloud risulta vantaggiosa. La maggior parte dei carichi di lavoro reali \u00e8 intermittente piuttosto che continuativo, rendendo quindi preferibile la tariffazione API, a meno che tu non esegua costantemente processi batch.<\/p>\n<h3>Ollama pu\u00f2 scalare su pi\u00f9 GPU nel cloud?<\/h3>\n<p>Ollama rileva e utilizza automaticamente pi\u00f9 GPU su una singola istanza, ma esegue un modello per GPU anzich\u00e9 distribuire un singolo modello su pi\u00f9 GPU (parallelismo tensoriale). Ci\u00f2 significa che un'istanza 4\u00d7A100 pu\u00f2 eseguire quattro istanze distinte di modelli o gestire quattro richieste concorrenti in modo efficiente, ma non pu\u00f2 caricare un singolo modello da 400 GB come Mistral Large 3, che supera la capacit\u00e0 di una singola GPU. Per il parallelismo su pi\u00f9 GPU, usa invece vLLM, TensorRT-LLM o Text Generation Inference.<\/p>\n<h3>L\u2019esecuzione di Ollama nel cloud \u00e8 sicura?<\/h3>\n<p>Per impostazione predefinita, Ollama si associa all'indirizzo 0.0.0.0:11434, esponendo la sua API a qualsiasi client di rete. Su istanze cloud con indirizzi IP pubblici, ci\u00f2 significa che il tuo endpoint di inferenza \u00e8 accessibile pubblicamente, a meno che tu non configuri regole firewall, gruppi di sicurezza o accesso VPN. <code>OLLAMA_HOST=127.0.0.1:11434<\/code> per limitare l'accesso a localhost, quindi utilizza tunnel SSH, un reverse proxy con autenticazione o una VPN per garantire l'accesso remoto. Le distribuzioni su cloud dovrebbero inoltre implementare registrazione delle richieste, limitazione del numero di richieste e validazione degli input per prevenire abusi.<\/p>","protected":false},"excerpt":{"rendered":"<p>Ollama doesn&#8217;t offer cloud-hosted models as an API service\u2014it&#8217;s a local inference engine you run on your own hardware. You [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2517,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2516","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2516","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/comments?post=2516"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2516\/revisions"}],"predecessor-version":[{"id":2518,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/posts\/2516\/revisions\/2518"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media\/2517"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/media?parent=2516"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/categories?post=2516"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/it\/wp-json\/wp\/v2\/tags?post=2516"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}