{"id":2516,"date":"2026-08-31T20:12:45","date_gmt":"2026-08-31T20:12:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2516"},"modified":"2026-08-31T20:12:45","modified_gmt":"2026-08-31T20:12:45","slug":"ollama-cloud-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/pt\/ollama-cloud-models\/","title":{"rendered":"Modelos da Nuvem Ollama: Executando Ollama em Infraestrutura de Nuvem"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>O Ollama n\u00e3o oferece modelos hospedados em nuvem como servi\u00e7o de API \u2014 \u00e9 um mecanismo de infer\u00eancia local que voc\u00ea executa em seu pr\u00f3prio hardware.<\/li>\n<li>Voc\u00ea pode implantar o Ollama em m\u00e1quinas virtuais na nuvem (AWS EC2, Google Cloud Compute Engine, Azure) para combinar a facilidade de uso do Ollama com a escalabilidade da nuvem.<\/li>\n<li>Provedores de nuvem especializados em GPU, como Lambda Labs, Vast.ai e RunPod, oferecem inst\u00e2ncias de GPU mais econ\u00f4micas do que as grandes nuvens para executar Ollama.<\/li>\n<li>Os custos do Ollama na nuvem variam entre US$ 0,50 e US$ 3 por hora para inst\u00e2ncias com GPU, contra US$ 0,50 a US$ 5 por milh\u00e3o de tokens para APIs comerciais \u2014 o ponto de equil\u00edbrio depende do volume de uso.<\/li>\n<\/ul>\n<\/div>\n<p>O Ollama n\u00e3o fornece modelos hospedados em nuvem como servi\u00e7o de API gerenciado. <a href=\"https:\/\/convly.ai\/pt\/what-is-ollama-complete-guide-2026\/\">Ollama<\/a> \u00e9 um mecanismo de infer\u00eancia local que executa modelos de c\u00f3digo aberto em seu pr\u00f3prio hardware. No entanto, voc\u00ea pode implantar o Ollama em infraestrutura de nuvem \u2014 como inst\u00e2ncias da AWS EC2, Google Cloud, m\u00e1quinas virtuais do Azure ou provedores especializados em GPU \u2014 para obter poder computacional em nuvem mantendo a interface simples do Ollama. Essa abordagem lhe d\u00e1 controle sobre o ambiente de execu\u00e7\u00e3o e pode ser mais econ\u00f4mica do que APIs comerciais em volumes elevados de uso.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a9604e04667b\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a9604e04667b\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#What_Ollama_Is_and_What_It_Isnt\" >O Que \u00c9 o Ollama (e o Que Ele N\u00e3o \u00c9)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Running_Ollama_on_Major_Cloud_Providers\" >Executando Ollama nos Principais Provedores de Nuvem<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#GPU-Focused_Cloud_Providers\" >Provedores de Nuvem Especializados em GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Cost_Comparison_Cloud_Ollama_vs_API_Services\" >Compara\u00e7\u00e3o de Custos: Ollama na Nuvem vs. Servi\u00e7os de API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Deployment_Patterns\" >Padr\u00f5es de Implanta\u00e7\u00e3o<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Model_Selection_for_Cloud_Deployments\" >Sele\u00e7\u00e3o de Modelos para Implanta\u00e7\u00f5es na Nuvem<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Performance_Optimization\" >Otimiza\u00e7\u00e3o de Desempenho<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/pt\/ollama-cloud-models\/#Frequently_Asked_Questions\" >Perguntas frequentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Is_and_What_It_Isnt\"><\/span>O Que \u00c9 o Ollama (e o Que Ele N\u00e3o \u00c9)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama \u00e9 um mecanismo de infer\u00eancia de c\u00f3digo aberto que executa modelos de linguagem grandes localmente. Ele gerencia downloads de modelos, quantiza\u00e7\u00e3o e infer\u00eancia por meio de uma CLI e de uma API REST simples. De acordo com o <a href=\"https:\/\/github.com\/ollama\/ollama\" rel=\"noopener\" target=\"_blank\">reposit\u00f3rio oficial do Ollama<\/a>, it supports models from the Llama, Mistral, Gemma, Qwen, and DeepSeek families, among others.<\/p>\n<p>O Ollama n\u00e3o opera como provedor de nuvem. Ele n\u00e3o hospeda modelos em seus pr\u00f3prios servidores nem cobra por token. Quando voc\u00ea executa <code>ollama run llama3.3<\/code>, o modelo \u00e9 executado na m\u00e1quina que executou o comando \u2014 seu laptop, um servidor de data center ou uma m\u00e1quina virtual em nuvem pela qual voc\u00ea paga separadamente.<\/p>\n<p>The term &#8220;ollama cloud models&#8221; typically refers to one of three deployment patterns:<\/p>\n<ul>\n<li>Executar Ollama em uma m\u00e1quina virtual na nuvem com acelera\u00e7\u00e3o por GPU<\/li>\n<li>Implantar Ollama em uma plataforma de orquestra\u00e7\u00e3o de cont\u00eaineres (Kubernetes, ECS)<\/li>\n<li>Usar Ollama em uma inst\u00e2ncia dedicada de GPU na nuvem para dimensionamento sob demanda<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Running_Ollama_on_Major_Cloud_Providers\"><\/span>Executando Ollama nos Principais Provedores de Nuvem<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Inst\u00e2ncias GPU da AWS EC2<\/h3>\n<p>A AWS oferece inst\u00e2ncias EC2 habilitadas para GPU nas fam\u00edlias G, P e Inf. Para cargas de trabalho do Ollama, a inst\u00e2ncia g5.xlarge (1\u00d7 NVIDIA A10G, 24 GB de VRAM) come\u00e7a em aproximadamente US$ 1,01\/hora sob demanda na regi\u00e3o us-east-1, enquanto a g5.12xlarge (4\u00d7 A10G, 96 GB de VRAM) custa cerca de US$ 5,67\/hora.<\/p>\n<p>Para implantar o Ollama na EC2:<\/p>\n<pre><code># Inicie uma inst\u00e2ncia Ubuntu 22.04 g5.xlarge com AMI para Deep Learning\n# Conecte-se \u00e0 inst\u00e2ncia via SSH\nsudo apt update\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\n\n# Verifique se a GPU foi detectada\nnvidia-smi\n\n# Execute um modelo\nollama run llama3.3:70b\n<\/code><\/pre>\n<p>A <a href=\"https:\/\/convly.ai\/pt\/vram-requirements-every-major-llm-2026\/\">Llama 3.3 70B<\/a> model requires approximately 40 GB VRAM at 4-bit quantization, so you&#8217;d need a g5.12xlarge or larger. Llama 3.1 8B needs around 5 GB VRAM at 4-bit, fitting comfortably on a g5.xlarge.<\/p>\n<h3>Google Cloud Platform<\/h3>\n<p>O GCP fornece inst\u00e2ncias com GPU por meio das fam\u00edlias de m\u00e1quinas N1 e A2 do Compute Engine. Uma n1-standard-4 com 1\u00d7 NVIDIA T4 (16 GB de VRAM) custa aproximadamente US$ 0,62\/hora, enquanto uma a2-highgpu-1g com 1\u00d7 A100 (40 GB de VRAM) custa cerca de US$ 3,67\/hora na regi\u00e3o us-central1.<\/p>\n<pre><code># Crie uma inst\u00e2ncia com GPU\ngcloud compute instances create ollama-instance \n  --zone=us-central1-a \n  --machine-type=n1-standard-4 \n  --accelerator=type=nvidia-tesla-t4,count=1 \n  --image-family=ubuntu-2204-lts \n  --image-project=ubuntu-os-cloud \n  --maintenance-policy=TERMINATE\n\n# Conecte-se via SSH e instale\ngcloud compute ssh ollama-instance --zone=us-central1-a\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run mistral:7b\n<\/code><\/pre>\n<h3>Microsoft Azure<\/h3>\n<p>As VMs da s\u00e9rie NC do Azure fornecem GPUs da NVIDIA para cargas de trabalho de infer\u00eancia. Uma NC6s_v3 (1\u00d7 V100, 16 GB de VRAM) custa aproximadamente US$ 3,06\/hora, enquanto uma NC24ads_A100_v4 (1\u00d7 A100, 80 GB de VRAM) custa cerca de US$ 3,67\/hora na regi\u00e3o Leste dos EUA.<\/p>\n<p>Installation follows the same pattern: provision a GPU-enabled Ubuntu VM, install NVIDIA drivers if not using a pre-configured image, and run the Ollama install script.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU-Focused_Cloud_Providers\"><\/span>Provedores de Nuvem Especializados em GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Provedores especializados em GPU na nuvem frequentemente oferecem melhor rela\u00e7\u00e3o custo-desempenho do que as grandes nuvens para implanta\u00e7\u00f5es do Ollama:<\/p>\n<table>\n<thead>\n<tr>\n<th>Provedor<\/th>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Custo\/Hora<\/th>\n<th>Indicado Para<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Lambda Labs<\/td>\n<td>A100<\/td>\n<td>40 GB<\/td>\n<td>$1.10<\/td>\n<td>DeepSeek R1 Distill Llama 70B, Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Vast.ai<\/td>\n<td>RTX 4090<\/td>\n<td>24 GB<\/td>\n<td>$0.34-$0.54<\/td>\n<td>Mistral 7B, Llama 3.1 8B, Phi-4<\/td>\n<\/tr>\n<tr>\n<td>RunPod<\/td>\n<td>A40<\/td>\n<td>48 GB<\/td>\n<td>$0.79<\/td>\n<td>Mistral Large 3 (inst\u00e2ncia \u00fanica), Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Paperspace<\/td>\n<td>A4000<\/td>\n<td>16 GB<\/td>\n<td>$0.76<\/td>\n<td>Modelos menores at\u00e9 ~14 bilh\u00f5es de par\u00e2metros<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>A Lambda Labs oferece a configura\u00e7\u00e3o mais simples \u2014 as inst\u00e2ncias v\u00eam com drivers NVIDIA e CUDA pr\u00e9-instalados. Ap\u00f3s iniciar uma inst\u00e2ncia por meio de seu painel de controle:<\/p>\n<pre><code>ssh ubuntu@\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run qwen3:32b\n<\/code><\/pre>\n<p>A Vast.ai opera como um marketplace para capacidade ociosa de GPU, oferecendo os pre\u00e7os mais baixos, mas com disponibilidade vari\u00e1vel. Voc\u00ea faz lances ou aluga inst\u00e2ncias por meio de sua interface web e, em seguida, acessa via SSH para instalar o Ollama.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Cloud_Ollama_vs_API_Services\"><\/span>Compara\u00e7\u00e3o de Custos: Ollama na Nuvem vs. Servi\u00e7os de API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Se a implanta\u00e7\u00e3o do Ollama na nuvem faz sentido economicamente depende do seu volume de uso. Use a <a href=\"https:\/\/convly.ai\/pt\/self-hosting-vs-api-calculator\/\">calculadora de autohospedagem versus API<\/a> para encontrar seu ponto de equil\u00edbrio.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>Custo da API (por 1 milh\u00e3o de tokens)<\/th>\n<th>GPU na Nuvem<\/th>\n<th>Custo por Inst\u00e2ncia\/Hora<\/th>\n<th>Tokens\/Hora no Ponto de Equil\u00edbrio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>$0,10 de entrada \/ $0,32 de sa\u00edda<\/td>\n<td>Lambda A100 40 GB<\/td>\n<td>$1.10<\/td>\n<td>~3,4 milh\u00f5es de tokens de sa\u00edda<\/td>\n<\/tr>\n<tr>\n<td>Mistral Large 3<\/td>\n<td>$2,00 de entrada \/ $6,00 de sa\u00edda<\/td>\n<td>RunPod 4\u00d7A40<\/td>\n<td>$3.16<\/td>\n<td>~530 mil tokens de sa\u00edda<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>$0,08 de entrada \/ $0,28 de sa\u00edda<\/td>\n<td>Vast.ai RTX 4090<\/td>\n<td>$0.54<\/td>\n<td>~1,9 milh\u00e3o de tokens de sa\u00edda<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1<\/td>\n<td>$0,50 de entrada \/ $2,15 de sa\u00edda<\/td>\n<td>Lambda 4\u00d7A100<\/td>\n<td>$4.40<\/td>\n<td>~2 milh\u00f5es de tokens de sa\u00edda<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>If you&#8217;re processing more than the break-even token volume per hour, cloud Ollama becomes cheaper. For bursty workloads or low volumes, APIs like Claude Sonnet 5 ($2.00 in \/ $10.00 out per 1M tokens) or Gemini 3.6 Flash ($1.50 in \/ $7.50 out per 1M tokens) offer better economics with no idle time costs.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Deployment_Patterns\"><\/span>Padr\u00f5es de Implanta\u00e7\u00e3o<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Inst\u00e2ncias sob Demanda<\/h3>\n<p>Inicie uma inst\u00e2ncia com GPU quando precisar, execute sua carga de trabalho e depois encerre-a. Isso funciona bem para processamento em lote, desenvolvimento ou infer\u00eancia espor\u00e1dica. Todos os principais provedores de nuvem e de GPUs suportam pre\u00e7os sob demanda.<\/p>\n<h3>Inst\u00e2ncias Spot\/Preempt\u00edveis<\/h3>\n<p>As Inst\u00e2ncias Spot da AWS, as VMs Preempt\u00edveis do GCP e as VMs Spot do Azure oferecem descontos de 60\u201390%, mas podem ser encerradas com aviso pr\u00e9vio de 30 segundos a 2 minutos. S\u00e3o adequadas para cargas de trabalho em lote tolerantes a falhas, nas quais \u00e9 poss\u00edvel salvar o progresso periodicamente.<\/p>\n<p>No Vast.ai, inst\u00e2ncias interromp\u00edveis operam com pre\u00e7os de mercado sem garantia de n\u00e3o encerramento, oferecendo os menores pre\u00e7os, mas exigindo tratamento robusto de erros.<\/p>\n<h3>Orquestra\u00e7\u00e3o de Cont\u00eaineres<\/h3>\n<p>For production deployments, run Ollama in Kubernetes with GPU node pools. This enables auto-scaling, load balancing, and high availability. Use the official Ollama Docker image:<\/p>\n<pre><code>docker pull ollama\/ollama\ndocker run -d --gpus=all -v ollama:\/root\/.ollama -p 11434:11434 ollama\/ollama\n<\/code><\/pre>\n<p>Em seguida, implante-o em seu cluster com solicita\u00e7\u00f5es de recursos de GPU definidas na especifica\u00e7\u00e3o do seu pod.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_for_Cloud_Deployments\"><\/span>Sele\u00e7\u00e3o de Modelos para Implanta\u00e7\u00f5es na Nuvem<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Escolha modelos com base no or\u00e7amento de VRAM da sua GPU. Use o <a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar os requisitos:<\/p>\n<ul>\n<li><strong>VRAM de 16\u201324 GB<\/strong> (T4, RTX 4090, A10G): Mistral 7B (~4.5 GB at 4-bit), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)<\/li>\n<li><strong>VRAM de 40\u201348 GB<\/strong> (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B com espa\u00e7o para contexto maior<\/li>\n<li><strong>VRAM de 80+ GB<\/strong> (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, requer 4\u00d7A100 ou equivalente), Mistral Large 3 (~400 GB)<\/li>\n<\/ul>\n<p>Modelos que exigem mais de 80 GB de VRAM necessitam de configura\u00e7\u00f5es com m\u00faltiplas GPUs ou paralelismo de tensores, recurso que o Ollama n\u00e3o suporta nativamente at\u00e9 a vers\u00e3o 0.3. Para esses modelos, considere frameworks como vLLM ou TGI, ou use APIs comerciais em vez disso.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Optimization\"><\/span>Otimiza\u00e7\u00e3o de Desempenho<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>V\u00e1rias configura\u00e7\u00f5es afetam a velocidade de infer\u00eancia do Ollama em GPUs na nuvem:<\/p>\n<ul>\n<li><strong>Quantiza\u00e7\u00e3o<\/strong>: Por padr\u00e3o, o Ollama usa quantiza\u00e7\u00e3o de 4 bits (Q4_0). Use <code>ollama pull model:q8_0<\/code> para 8 bits (melhor qualidade, 2\u00d7 mais VRAM) ou <code>model:q2_K<\/code> para 2 bits (mais r\u00e1pido, menor qualidade).<\/li>\n<li><strong>Janela de contexto<\/strong>: Definido via par\u00e2metro <code>num_ctx<\/code> . Contextos maiores consomem mais VRAM \u2014 um contexto de 32K usa significativamente mais mem\u00f3ria do que um de 4K para o mesmo modelo.<\/li>\n<li><strong>Tamanho do lote<\/strong>: Aumente <code>num_batch<\/code> para cargas de trabalho orientadas \u00e0 taxa de transfer\u00eancia, onde a lat\u00eancia \u00e9 menos importante do que o n\u00famero de tokens por segundo.<\/li>\n<li><strong>Camadas na GPU<\/strong>: O Ollama transfere automaticamente todas as camadas para a GPU. Em inst\u00e2ncias com VRAM limitada, ele recorre \u00e0 CPU para camadas que n\u00e3o cabem na GPU, reduzindo drasticamente a velocidade.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Perguntas frequentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>O Ollama oferece hospedagem em nuvem pr\u00f3pria?<\/h3>\n<p>N\u00e3o. O Ollama \u00e9 um software auto-hospedado que executa modelos em sua pr\u00f3pria infraestrutura. N\u00e3o h\u00e1 servi\u00e7o oficial de nuvem Ollama nem API gerenciada. Quando as pessoas se referem a \"modelos Ollama na nuvem\", querem dizer executar o software Ollama em infraestrutura de nuvem que eles mesmos provisionam por meio da AWS, GCP, Azure ou provedores especializados em GPUs.<\/p>\n<h3>Posso usar o formato de API do Ollama com modelos na nuvem?<\/h3>\n<p>Sim. Assim que o Ollama estiver em execu\u00e7\u00e3o em uma m\u00e1quina virtual na nuvem, ele exp\u00f5e uma API REST na porta 11434 compat\u00edvel com o formato da API da OpenAI. Voc\u00ea pode apontar qualquer cliente compat\u00edvel com a OpenAI para o endere\u00e7o IP e porta da sua inst\u00e2ncia na nuvem. Isso permite usar modelos hospedados pelo Ollama como substitutos diretos de APIs comerciais em muitas aplica\u00e7\u00f5es, embora voc\u00ea seja respons\u00e1vel pela gest\u00e3o da disponibilidade, escalabilidade e seguran\u00e7a.<\/p>\n<h3>Qual provedor de nuvem \u00e9 o mais barato para executar Ollama?<\/h3>\n<p>Provedores focados em GPU, como Lambda Labs (US$ 1,10\/hora para A100 com 40 GB) e Vast.ai (US$ 0,34\u2013US$ 0,54\/hora para RTX 4090), oferecem pre\u00e7os significativamente inferiores aos da AWS, GCP e Azure para mem\u00f3ria de GPU equivalente. A Lambda Labs oferece maior confiabilidade e suporte; a Vast.ai oferece os pre\u00e7os mais baixos, mas com disponibilidade vari\u00e1vel. Para cargas de trabalho de produ\u00e7\u00e3o que exigem SLAs, as grandes nuvens fornecem garantias superiores a um custo mais elevado.<\/p>\n<h3>Quanto custa executar o Llama 3.3 70B na nuvem versus APIs?<\/h3>\n<p>O Llama 3.3 70B exige cerca de 40 GB de VRAM com quantiza\u00e7\u00e3o de 4 bits. Uma inst\u00e2ncia Lambda Labs A100 40 GB custa $1,10\/hora. Se voc\u00ea gerar 3,4 milh\u00f5es de tokens de sa\u00edda por hora (~945 tokens\/segundo sustentados), atingir\u00e1 o ponto de equil\u00edbrio com a tarifa de API de $0,32 por milh\u00e3o de tokens. Abaixo desse limiar, as APIs s\u00e3o mais baratas. Acima dele, a inst\u00e2ncia na nuvem \u00e9 mais vantajosa. A maioria das cargas de trabalho reais \u00e9 intermitente, e n\u00e3o cont\u00ednua, favorecendo o modelo de precifica\u00e7\u00e3o por API, exceto quando voc\u00ea executa tarefas de processamento em lote continuamente.<\/p>\n<h3>O Ollama pode escalar em m\u00faltiplas GPUs na nuvem?<\/h3>\n<p>O Ollama detecta e utiliza automaticamente m\u00faltiplas GPUs em uma \u00fanica inst\u00e2ncia, mas executa um modelo por GPU, em vez de distribuir um \u00fanico modelo entre v\u00e1rias GPUs (paralelismo de tensores). Isso significa que uma inst\u00e2ncia 4\u00d7A100 pode executar quatro inst\u00e2ncias separadas de modelos ou lidar eficientemente com quatro requisi\u00e7\u00f5es simult\u00e2neas, mas n\u00e3o consegue carregar um \u00fanico modelo de 400 GB, como o Mistral Large 3, que excede a capacidade de uma \u00fanica GPU. Para paralelismo de modelos com m\u00faltiplas GPUs, use vLLM, TensorRT-LLM ou Text Generation Inference.<\/p>\n<h3>Executar Ollama na nuvem \u00e9 seguro?<\/h3>\n<p>Por padr\u00e3o, o Ollama vincula-se a 0.0.0.0:11434, expondo sua API a qualquer cliente de rede. Em inst\u00e2ncias na nuvem com IPs p\u00fablicos, isso significa que seu endpoint de infer\u00eancia fica acess\u00edvel publicamente, a menos que voc\u00ea configure regras de firewall, grupos de seguran\u00e7a ou acesso por VPN. Defina <code>OLLAMA_HOST=127.0.0.1:11434<\/code> para restringir o acesso ao localhost e, em seguida, use t\u00fanel SSH, um proxy reverso com autentica\u00e7\u00e3o ou uma VPN para proteger o acesso remoto. Implanta\u00e7\u00f5es em nuvem tamb\u00e9m devem implementar registro de requisi\u00e7\u00f5es, limita\u00e7\u00e3o de taxa e valida\u00e7\u00e3o de entradas para evitar abusos.<\/p>","protected":false},"excerpt":{"rendered":"<p>Ollama doesn&#8217;t offer cloud-hosted models as an API service\u2014it&#8217;s a local inference engine you run on your own hardware. You [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2517,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2516","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2516","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2516"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2516\/revisions"}],"predecessor-version":[{"id":2518,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/posts\/2516\/revisions\/2518"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media\/2517"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2516"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/categories?post=2516"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/tags?post=2516"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}