{"id":2516,"date":"2026-08-31T20:12:45","date_gmt":"2026-08-31T20:12:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2516"},"modified":"2026-08-31T20:12:45","modified_gmt":"2026-08-31T20:12:45","slug":"ollama-cloud-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/es\/ollama-cloud-models\/","title":{"rendered":"Modelos en la nube de Ollama: Ejecutar Ollama en infraestructura en la nube"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ollama no ofrece modelos alojados en la nube como servicio API: es un motor de inferencia local que usted ejecuta en su propio hardware.<\/li>\n<li>Puede implementar Ollama en m\u00e1quinas virtuales en la nube (AWS EC2, Compute Engine de GCP, m\u00e1quinas virtuales de Azure) para combinar la facilidad de uso de Ollama con la escalabilidad de la nube.<\/li>\n<li>Proveedores en la nube especializados en GPU, como Lambda Labs, Vast.ai y RunPod, ofrecen instancias GPU m\u00e1s rentables que las grandes nubes para ejecutar Ollama.<\/li>\n<li>Los costos de Ollama en la nube oscilan entre 0,50 y 3 USD\/hora para instancias con GPU, frente a 0,50\u20135 USD por mill\u00f3n de tokens en APIs comerciales; el punto de equilibrio depende del volumen de uso.<\/li>\n<\/ul>\n<\/div>\n<p>Ollama no proporciona modelos alojados en la nube como servicio API gestionado. <a href=\"https:\/\/convly.ai\/es\/what-is-ollama-complete-guide-2026\/\">Ollama<\/a> es un motor de inferencia local que ejecuta modelos de c\u00f3digo abierto en su propio hardware. Sin embargo, puede implementar Ollama en infraestructura en la nube \u2014por ejemplo, en instancias EC2 de AWS, Google Cloud, m\u00e1quinas virtuales de Azure o proveedores especializados en GPU\u2014 para aprovechar la potencia computacional de la nube manteniendo la interfaz sencilla de Ollama. Este enfoque le otorga control sobre el entorno de ejecuci\u00f3n y puede resultar m\u00e1s rentable que las APIs comerciales cuando el volumen de uso es elevado.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a9604e0c1adc\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Alternar<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a9604e0c1adc\"  aria-label=\"Alternar\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#What_Ollama_Is_and_What_It_Isnt\" >Qu\u00e9 es Ollama (y qu\u00e9 no es)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Running_Ollama_on_Major_Cloud_Providers\" >Ejecutar Ollama en grandes proveedores en la nube<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#GPU-Focused_Cloud_Providers\" >Proveedores en la nube centrados en GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Cost_Comparison_Cloud_Ollama_vs_API_Services\" >Comparaci\u00f3n de costos: Ollama en la nube frente a servicios API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Deployment_Patterns\" >Patrones de implementaci\u00f3n<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Model_Selection_for_Cloud_Deployments\" >Selecci\u00f3n de modelos para implementaciones en la nube<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Performance_Optimization\" >Optimizaci\u00f3n del rendimiento<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/es\/ollama-cloud-models\/#Frequently_Asked_Questions\" >Preguntas frecuentes<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Is_and_What_It_Isnt\"><\/span>Qu\u00e9 es Ollama (y qu\u00e9 no es)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama es un motor de inferencia de c\u00f3digo abierto que ejecuta modelos de lenguaje grande localmente. Se encarga de descargar modelos, aplicarles cuantizaci\u00f3n e inferir mediante una CLI sencilla y una API REST. Seg\u00fan el <a href=\"https:\/\/github.com\/ollama\/ollama\" rel=\"noopener\" target=\"_blank\">repositorio oficial de Ollama<\/a>, it supports models from the Llama, Mistral, Gemma, Qwen, and DeepSeek families, among others.<\/p>\n<p>Ollama no opera como un proveedor en la nube. No aloja modelos en sus propios servidores ni cobra por token. Cuando ejecuta <code>ollama run llama3.3<\/code>, el modelo se ejecuta en cualquier m\u00e1quina que ejecute el comando: su port\u00e1til, un servidor de centro de datos o una m\u00e1quina virtual en la nube por la que usted paga por separado.<\/p>\n<p>The term &#8220;ollama cloud models&#8221; typically refers to one of three deployment patterns:<\/p>\n<ul>\n<li>Ejecutar Ollama en una m\u00e1quina virtual en la nube con aceleraci\u00f3n GPU<\/li>\n<li>Implementar Ollama en una plataforma de orquestaci\u00f3n de contenedores (Kubernetes, ECS)<\/li>\n<li>Usar Ollama en una instancia dedicada de GPU en la nube para escalado bajo demanda<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Running_Ollama_on_Major_Cloud_Providers\"><\/span>Ejecutar Ollama en grandes proveedores en la nube<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Instancias GPU de AWS EC2<\/h3>\n<p>AWS ofrece instancias EC2 con GPU en las familias G, P e Inf. Para cargas de trabajo de Ollama, la instancia g5.xlarge (1\u00d7 NVIDIA A10G, 24 GB de VRAM) comienza en aproximadamente 1,01 USD\/hora bajo demanda en la regi\u00f3n us-east-1, mientras que la g5.12xlarge (4\u00d7 A10G, 96 GB de VRAM) cuesta alrededor de 5,67 USD\/hora.<\/p>\n<p>Para implementar Ollama en EC2:<\/p>\n<pre><code># Iniciar una instancia Ubuntu 22.04 g5.xlarge con AMI para aprendizaje profundo\n# Conectarse mediante SSH a la instancia\nsudo apt update\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\n\n# Verificar que la GPU est\u00e9 detectada\nnvidia-smi\n\n# Ejecutar un modelo\nollama run llama3.3:70b\n<\/code><\/pre>\n<p>A <a href=\"https:\/\/convly.ai\/es\/vram-requirements-every-major-llm-2026\/\">Llama 3.3 70B<\/a> model requires approximately 40 GB VRAM at 4-bit quantization, so you&#8217;d need a g5.12xlarge or larger. Llama 3.1 8B needs around 5 GB VRAM at 4-bit, fitting comfortably on a g5.xlarge.<\/p>\n<h3>Google Cloud Platform<\/h3>\n<p>GCP ofrece instancias con GPU mediante las familias de m\u00e1quinas N1 y A2 de Compute Engine. Una n1-standard-4 con 1\u00d7 NVIDIA T4 (16 GB de VRAM) cuesta aproximadamente 0,62 USD\/hora, mientras que una a2-highgpu-1g con 1\u00d7 A100 (40 GB de VRAM) cuesta alrededor de 3,67 USD\/hora en la regi\u00f3n us-central1.<\/p>\n<pre><code># Crear una instancia con GPU\ngcloud compute instances create ollama-instance \n  --zone=us-central1-a \n  --machine-type=n1-standard-4 \n  --accelerator=type=nvidia-tesla-t4,count=1 \n  --image-family=ubuntu-2204-lts \n  --image-project=ubuntu-os-cloud \n  --maintenance-policy=TERMINATE\n\n# Conectarse mediante SSH e instalar\ngcloud compute ssh ollama-instance --zone=us-central1-a\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run mistral:7b\n<\/code><\/pre>\n<h3>Microsoft Azure<\/h3>\n<p>Las m\u00e1quinas virtuales de la serie NC de Azure ofrecen GPUs NVIDIA para cargas de trabajo de inferencia. Una NC6s_v3 (1\u00d7 V100, 16 GB de VRAM) cuesta aproximadamente 3,06 USD\/hora, mientras que una NC24ads_A100_v4 (1\u00d7 A100, 80 GB de VRAM) cuesta alrededor de 3,67 USD\/hora en la regi\u00f3n East US.<\/p>\n<p>Installation follows the same pattern: provision a GPU-enabled Ubuntu VM, install NVIDIA drivers if not using a pre-configured image, and run the Ollama install script.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU-Focused_Cloud_Providers\"><\/span>Proveedores en la nube centrados en GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Los proveedores especializados en GPU en la nube suelen ofrecer una mejor relaci\u00f3n precio-rendimiento que las grandes nubes para implementaciones de Ollama:<\/p>\n<table>\n<thead>\n<tr>\n<th>Proveedor<\/th>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Costo por hora<\/th>\n<th>Adecuado para<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Lambda Labs<\/td>\n<td>A100<\/td>\n<td>40 GB<\/td>\n<td>$1.10<\/td>\n<td>DeepSeek R1 Distill Llama 70B, Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Vast.ai<\/td>\n<td>RTX 4090<\/td>\n<td>24 GB<\/td>\n<td>$0.34-$0.54<\/td>\n<td>Mistral 7B, Llama 3.1 8B, Phi-4<\/td>\n<\/tr>\n<tr>\n<td>RunPod<\/td>\n<td>A40<\/td>\n<td>48 GB<\/td>\n<td>$0.79<\/td>\n<td>Mistral Large 3 (instancia \u00fanica), Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Paperspace<\/td>\n<td>A4000<\/td>\n<td>16 GB<\/td>\n<td>$0.76<\/td>\n<td>Modelos peque\u00f1os hasta ~14 mil millones de par\u00e1metros<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Lambda Labs ofrece la configuraci\u00f3n m\u00e1s sencilla: las instancias incluyen controladores NVIDIA y CUDA preinstalados. Tras iniciar una instancia desde su panel de control:<\/p>\n<pre><code>ssh ubuntu@&lt;ip-de-la-instancia&gt;\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run qwen3:32b\n<\/code><\/pre>\n<p>Vast.ai funciona como un mercado para capacidad GPU no utilizada, ofreciendo los precios m\u00e1s bajos, aunque con disponibilidad variable. Usted puja o alquila instancias mediante su interfaz web y luego se conecta mediante SSH para instalar Ollama.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Cloud_Ollama_vs_API_Services\"><\/span>Comparaci\u00f3n de costos: Ollama en la nube frente a servicios API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Si implementar Ollama en la nube resulta econ\u00f3micamente viable depende de su volumen de uso. Utilice la <a href=\"https:\/\/convly.ai\/es\/self-hosting-vs-api-calculator\/\">calculadora de autohospedaje frente a API<\/a> para encontrar su punto de equilibrio.<\/p>\n<table>\n<thead>\n<tr>\n<th>Modelo<\/th>\n<th>API Cost (per 1M tokens)<\/th>\n<th>GPU en la nube<\/th>\n<th>Coste de la instancia por hora<\/th>\n<th>Tokens por hora en el punto de equilibrio<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>$0,10 de entrada \/ $0,32 de salida<\/td>\n<td>Lambda A100 40 GB<\/td>\n<td>$1.10<\/td>\n<td>~3,4 millones de tokens de salida<\/td>\n<\/tr>\n<tr>\n<td>Mistral Large 3<\/td>\n<td>$2,00 de entrada \/ $6,00 de salida<\/td>\n<td>RunPod 4\u00d7A40<\/td>\n<td>$3.16<\/td>\n<td>~530 000 tokens de salida<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>$0,08 de entrada \/ $0,28 de salida<\/td>\n<td>Vast.ai RTX 4090<\/td>\n<td>$0.54<\/td>\n<td>~1,9 millones de tokens de salida<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1<\/td>\n<td>$0,50 de entrada \/ $2,15 de salida<\/td>\n<td>Lambda 4\u00d7A100<\/td>\n<td>$4.40<\/td>\n<td>~2 millones de tokens de salida<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>If you&#8217;re processing more than the break-even token volume per hour, cloud Ollama becomes cheaper. For bursty workloads or low volumes, APIs like Claude Sonnet 5 ($2.00 in \/ $10.00 out per 1M tokens) or Gemini 3.6 Flash ($1.50 in \/ $7.50 out per 1M tokens) offer better economics with no idle time costs.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Deployment_Patterns\"><\/span>Patrones de implementaci\u00f3n<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Instancias bajo demanda<\/h3>\n<p>Inicie una instancia con GPU cuando la necesite, ejecute su carga de trabajo y luego final\u00edcela. Esto funciona bien para procesamiento por lotes, desarrollo o inferencia espor\u00e1dica. Todos los principales proveedores de nube y de GPU ofrecen precios bajo demanda.<\/p>\n<h3>Instancias Spot\/preemptibles<\/h3>\n<p>Las instancias Spot de AWS, las m\u00e1quinas virtuales preemptibles de GCP y las m\u00e1quinas virtuales Spot de Azure ofrecen descuentos del 60 al 90 %, pero pueden finalizarse con un aviso previo de 30 segundos a 2 minutos. Son adecuadas para cargas de trabajo por lotes tolerantes a fallos, donde puede guardar puntos de control del progreso.<\/p>\n<p>En Vast.ai, las instancias interrumpibles se ejecutan a precios de mercado sin garant\u00eda de no finalizaci\u00f3n, ofreciendo los precios m\u00e1s bajos, pero requieren una gesti\u00f3n robusta de errores.<\/p>\n<h3>Orquestaci\u00f3n de contenedores<\/h3>\n<p>For production deployments, run Ollama in Kubernetes with GPU node pools. This enables auto-scaling, load balancing, and high availability. Use the official Ollama Docker image:<\/p>\n<pre><code>docker pull ollama\/ollama\ndocker run -d --gpus=all -v ollama:\/root\/.ollama -p 11434:11434 ollama\/ollama\n<\/code><\/pre>\n<p>Luego despliegue en su cl\u00faster especificando las solicitudes de recursos GPU en la especificaci\u00f3n de su pod.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_for_Cloud_Deployments\"><\/span>Selecci\u00f3n de modelos para implementaciones en la nube<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Elija modelos seg\u00fan su presupuesto de VRAM de GPU. Utilice la <a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> para estimar los requisitos:<\/p>\n<ul>\n<li><strong>VRAM de 16 a 24 GB<\/strong> (T4, RTX 4090, A10G): Mistral 7B (~4.5 GB at 4-bit), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)<\/li>\n<li><strong>VRAM de 40 a 48 GB<\/strong> (A100 40 GB, A40): Llama 3.3 70B (~40 GB), DeepSeek R1 Distill Llama 70B (~40 GB), Mistral NeMo 12B con espacio suficiente para contextos m\u00e1s amplios<\/li>\n<li><strong>VRAM de 80 GB o m\u00e1s<\/strong> (A100 80 GB, H100): Llama 4 Scout (~65 GB), DeepSeek R1 (~400 GB, requiere 4\u00d7A100 o equivalente), Mistral Large 3 (~400 GB)<\/li>\n<\/ul>\n<p>Los modelos que requieren m\u00e1s de 80 GB de VRAM necesitan configuraciones multi-GPU o paralelismo de tensores, funcionalidad que Ollama no admite de forma nativa hasta la versi\u00f3n 0,3. Para esos modelos, considere frameworks como vLLM o TGI, o utilice API comerciales en su lugar.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Optimization\"><\/span>Optimizaci\u00f3n del rendimiento<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Varias opciones afectan la velocidad de inferencia de Ollama en GPUs en la nube:<\/p>\n<ul>\n<li><strong>Cuantizaci\u00f3n<\/strong>: Por defecto, Ollama usa cuantizaci\u00f3n de 4 bits (Q4_0). Use <code>ollama pull model:q8_0<\/code> para cuantizaci\u00f3n de 8 bits (mejor calidad, el doble de VRAM) o <code>model:q2_K<\/code> para cuantizaci\u00f3n de 2 bits (m\u00e1s r\u00e1pido, menor calidad).<\/li>\n<li><strong>Ventana de contexto<\/strong>: Se establece mediante el par\u00e1metro <code>num_ctx<\/code> . Contextos m\u00e1s amplios consumen m\u00e1s VRAM: un contexto de 32 K utiliza significativamente m\u00e1s memoria que uno de 4 K para el mismo modelo.<\/li>\n<li><strong>Tama\u00f1o del lote<\/strong>: Aumente el par\u00e1metro <code>num_batch<\/code> para cargas de trabajo orientadas al rendimiento, donde la latencia importa menos que los tokens por segundo.<\/li>\n<li><strong>Capas en GPU<\/strong>: Ollama traslada autom\u00e1ticamente todas las capas a la GPU. En instancias con VRAM limitada, recurrir\u00e1 a la CPU para las capas que no quepan, reduciendo dr\u00e1sticamente la velocidad.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Preguntas frecuentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>\u00bfOfrece Ollama su propio alojamiento en la nube?<\/h3>\n<p>No. Ollama es un software autoalojado que ejecuta modelos en su propia infraestructura. No existe ning\u00fan servicio oficial de Ollama en la nube ni ninguna API gestionada. Cuando las personas hablan de \u00abmodelos de Ollama en la nube\u00bb, se refieren a ejecutar el software Ollama en infraestructura en la nube que ellos mismos provisionan a trav\u00e9s de AWS, GCP, Azure o proveedores especializados de GPU.<\/p>\n<h3>\u00bfPuedo usar el formato de API de Ollama con modelos en la nube?<\/h3>\n<p>S\u00ed. Una vez que Ollama se est\u00e1 ejecutando en una m\u00e1quina virtual en la nube, expone una API REST en el puerto 11434 compatible con el formato de API de OpenAI. Puede apuntar cualquier cliente compatible con OpenAI a la direcci\u00f3n IP y puerto de su instancia en la nube. Esto le permite usar modelos alojados con Ollama como sustitutos directos de las API comerciales en muchas aplicaciones, aunque usted es responsable de gestionar la disponibilidad, el escalado y la seguridad.<\/p>\n<h3>\u00bfQu\u00e9 proveedor en la nube es el m\u00e1s econ\u00f3mico para ejecutar Ollama?<\/h3>\n<p>Proveedores centrados en GPU, como Lambda Labs (1,10 USD\/hora para A100 de 40 GB) y Vast.ai (0,34\u20130,54 USD\/hora para RTX 4090), ofrecen precios significativamente inferiores a los de AWS, GCP y Azure para cantidades equivalentes de memoria GPU. Lambda ofrece mayor fiabilidad y soporte; Vast.ai ofrece los precios m\u00e1s bajos, pero con disponibilidad variable. Para cargas de trabajo de producci\u00f3n que requieren acuerdos de nivel de servicio (SLA), las grandes nubes brindan garant\u00edas superiores a un costo mayor.<\/p>\n<h3>\u00bfCu\u00e1nto cuesta ejecutar Llama 3.3 70B en la nube frente a las APIs?<\/h3>\n<p>Llama 3.3 70B necesita aproximadamente 40 GB de VRAM con cuantizaci\u00f3n de 4 bits. Una instancia Lambda Labs A100 de 40 GB cuesta $1,10 por hora. Si genera 3,4 millones de tokens de salida por hora (~945 tokens por segundo de forma sostenida), alcanza el punto de equilibrio con la tarifa de API de $0,32 por mill\u00f3n de tokens. Por debajo de ese umbral, las API son m\u00e1s econ\u00f3micas; por encima, la instancia en la nube resulta m\u00e1s rentable. La mayor\u00eda de las cargas de trabajo reales son intermitentes, no sostenidas, lo que favorece los precios por API, salvo que ejecute trabajos de procesamiento por lotes de forma continua.<\/p>\n<h3>\u00bfPuede Ollama escalar a trav\u00e9s de m\u00faltiples GPU en la nube?<\/h3>\n<p>Ollama detecta y utiliza autom\u00e1ticamente m\u00faltiples GPUs en una \u00fanica instancia, pero ejecuta un modelo por GPU, en lugar de distribuir un \u00fanico modelo entre varias GPUs (paralelismo de tensores). Esto significa que una instancia con 4\u00d7A100 puede ejecutar cuatro instancias independientes de modelos o manejar eficientemente cuatro solicitudes simult\u00e1neas, pero no puede cargar un \u00fanico modelo de 400 GB como Mistral Large 3, que supera la capacidad de una sola GPU. Para paralelismo de modelos multi-GPU, use vLLM, TensorRT-LLM o Text Generation Inference.<\/p>\n<h3>\u00bfEs seguro ejecutar Ollama en la nube?<\/h3>\n<p>De forma predeterminada, Ollama se enlaza a 0.0.0.0:11434, exponiendo su API a cualquier cliente de red. En instancias en la nube con direcciones IP p\u00fablicas, esto implica que su punto final de inferencia es accesible p\u00fablicamente, a menos que configure reglas de firewall, grupos de seguridad o acceso VPN. Establezca <code>OLLAMA_HOST=127.0.0.1:11434<\/code> para restringir el acceso al host local y, a continuaci\u00f3n, utilizar el tunelado SSH, un proxy inverso con autenticaci\u00f3n o una VPN para proteger el acceso remoto. Las implementaciones en la nube tambi\u00e9n deben incluir registro de solicitudes, limitaci\u00f3n de frecuencia y validaci\u00f3n de entradas para prevenir el uso abusivo.<\/p>","protected":false},"excerpt":{"rendered":"<p>Ollama doesn&#8217;t offer cloud-hosted models as an API service\u2014it&#8217;s a local inference engine you run on your own hardware. You [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2517,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2516","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2516","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2516"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2516\/revisions"}],"predecessor-version":[{"id":2518,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/posts\/2516\/revisions\/2518"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media\/2517"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2516"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/categories?post=2516"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/tags?post=2516"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}