{"id":2516,"date":"2026-08-31T20:12:45","date_gmt":"2026-08-31T20:12:45","guid":{"rendered":"https:\/\/convly.ai\/?p=2516"},"modified":"2026-08-31T20:12:45","modified_gmt":"2026-08-31T20:12:45","slug":"ollama-cloud-models","status":"publish","type":"post","link":"https:\/\/convly.ai\/fr\/ollama-cloud-models\/","title":{"rendered":"Mod\u00e8les Ollama Cloud : Ex\u00e9cuter Ollama sur une infrastructure cloud"},"content":{"rendered":"<div class=\"convly-tldr\">\n<ul>\n<li>Ollama ne propose pas de mod\u00e8les h\u00e9berg\u00e9s dans le cloud sous forme de service API : c\u2019est un moteur d\u2019inf\u00e9rence local que vous ex\u00e9cutez sur votre propre mat\u00e9riel.<\/li>\n<li>Vous pouvez d\u00e9ployer Ollama sur des machines virtuelles cloud (AWS EC2, Compute Engine de Google Cloud, machines virtuelles Azure) afin de combiner la simplicit\u00e9 d\u2019utilisation d\u2019Ollama avec la scalabilit\u00e9 du cloud.<\/li>\n<li>Les fournisseurs cloud sp\u00e9cialis\u00e9s dans les GPU, tels que Lambda Labs, Vast.ai et RunPod, proposent des instances GPU plus \u00e9conomiques que les grands fournisseurs cloud pour l\u2019ex\u00e9cution d\u2019Ollama.<\/li>\n<li>Le co\u00fbt d\u2019Ollama dans le cloud s\u2019\u00e9l\u00e8ve \u00e0 0,50 \u00e0 3 $\/heure pour des instances GPU, contre 0,50 \u00e0 5 $ par million de jetons pour les API commerciales \u2014 le seuil de rentabilit\u00e9 d\u00e9pend du volume d\u2019utilisation.<\/li>\n<\/ul>\n<\/div>\n<p>Ollama ne fournit pas de mod\u00e8les h\u00e9berg\u00e9s dans le cloud sous forme de service API g\u00e9r\u00e9. <a href=\"https:\/\/convly.ai\/fr\/what-is-ollama-complete-guide-2026\/\">Ollama<\/a> est un moteur d\u2019inf\u00e9rence local qui ex\u00e9cute des mod\u00e8les open source sur votre propre mat\u00e9riel. Toutefois, vous pouvez d\u00e9ployer Ollama sur une infrastructure cloud \u2014 machines virtuelles AWS EC2, Google Cloud, Azure ou fournisseurs sp\u00e9cialis\u00e9s dans les GPU \u2014 afin de b\u00e9n\u00e9ficier de la puissance de calcul du cloud tout en conservant l\u2019interface simple d\u2019Ollama. Cette approche vous conf\u00e8re un contr\u00f4le total sur l\u2019environnement d\u2019ex\u00e9cution et peut s\u2019av\u00e9rer plus \u00e9conomique que les API commerciales pour des volumes d\u2019utilisation \u00e9lev\u00e9s.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_86 counter-flat ez-toc-counter ez-toc-container-direction\">\n<label for=\"ez-toc-cssicon-toggle-item-6a9604fb9926e\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Basculer<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #000000;color:#000000\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewbox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #000000;color:#000000\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewbox=\"0 0 24 24\" version=\"1.2\" baseprofile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a9604fb9926e\"  aria-label=\"Basculer\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1' ><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#What_Ollama_Is_and_What_It_Isnt\" >Ce qu\u2019est Ollama (et ce qu\u2019il n\u2019est pas)<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Running_Ollama_on_Major_Cloud_Providers\" >Ex\u00e9cuter Ollama sur les principaux fournisseurs cloud<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#GPU-Focused_Cloud_Providers\" >Fournisseurs cloud sp\u00e9cialis\u00e9s dans les GPU<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Cost_Comparison_Cloud_Ollama_vs_API_Services\" >Comparaison des co\u00fbts : Ollama dans le cloud contre les services API<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Deployment_Patterns\" >Sch\u00e9mas de d\u00e9ploiement<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Model_Selection_for_Cloud_Deployments\" >S\u00e9lection des mod\u00e8les pour les d\u00e9ploiements cloud<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Performance_Optimization\" >Optimisation des performances<\/a><\/li><li class='ez-toc-page-1'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/convly.ai\/fr\/ollama-cloud-models\/#Frequently_Asked_Questions\" >Questions fr\u00e9quemment pos\u00e9es<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"What_Ollama_Is_and_What_It_Isnt\"><\/span>Ce qu\u2019est Ollama (et ce qu\u2019il n\u2019est pas)<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ollama est un moteur d\u2019inf\u00e9rence open source qui ex\u00e9cute des mod\u00e8les de langage volumineux localement. Il g\u00e8re le t\u00e9l\u00e9chargement des mod\u00e8les, leur quantification et leur inf\u00e9rence via une interface CLI simple et une API REST. Selon le <a href=\"https:\/\/github.com\/ollama\/ollama\" rel=\"noopener\" target=\"_blank\">d\u00e9p\u00f4t officiel Ollama<\/a>, it supports models from the Llama, Mistral, Gemma, Qwen, and DeepSeek families, among others.<\/p>\n<p>Ollama ne fonctionne pas comme un fournisseur cloud. Il n\u2019h\u00e9berge pas de mod\u00e8les sur ses propres serveurs ni ne facture \u00e0 l\u2019usage du jeton. Lorsque vous ex\u00e9cutez <code>Ex\u00e9cuter llama3.3<\/code>, le mod\u00e8le s\u2019ex\u00e9cute sur la machine ayant lanc\u00e9 la commande \u2014 votre ordinateur portable, un serveur de centre de donn\u00e9es ou une machine virtuelle cloud que vous payez s\u00e9par\u00e9ment.<\/p>\n<p>The term &#8220;ollama cloud models&#8221; typically refers to one of three deployment patterns:<\/p>\n<ul>\n<li>Ex\u00e9cuter Ollama sur une machine virtuelle cloud dot\u00e9e d\u2019une acc\u00e9l\u00e9ration GPU<\/li>\n<li>D\u00e9ployer Ollama dans une plateforme d\u2019orchestration de conteneurs (Kubernetes, ECS)<\/li>\n<li>Utiliser Ollama sur une instance cloud d\u00e9di\u00e9e au GPU pour une mont\u00e9e en charge \u00e0 la demande<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Running_Ollama_on_Major_Cloud_Providers\"><\/span>Ex\u00e9cuter Ollama sur les principaux fournisseurs cloud<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Instances GPU EC2 d\u2019AWS<\/h3>\n<p>AWS propose des instances EC2 \u00e9quip\u00e9es de GPU dans les familles G, P et Inf. Pour les charges de travail Ollama, l\u2019instance g5.xlarge (1 \u00d7 NVIDIA A10G, 24 Go de VRAM) d\u00e9bute \u00e0 environ 1,01 $\/heure \u00e0 la demande dans la r\u00e9gion us-east-1, tandis que la g5.12xlarge (4 \u00d7 A10G, 96 Go de VRAM) co\u00fbte environ 5,67 $\/heure.<\/p>\n<p>Pour d\u00e9ployer Ollama sur EC2 :<\/p>\n<pre><code># Lancer une instance Ubuntu 22.04 g5.xlarge avec l\u2019AMI Deep Learning\n# Se connecter en SSH \u00e0 l\u2019instance\nsudo apt update\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\n\n# V\u00e9rifier que le GPU est d\u00e9tect\u00e9\nnvidia-smi\n\n# Ex\u00e9cuter un mod\u00e8le\nollama run llama3.3:70b\n<\/code><\/pre>\n<p>A <a href=\"https:\/\/convly.ai\/fr\/vram-requirements-every-major-llm-2026\/\">Llama 3.3 70B<\/a> model requires approximately 40 GB VRAM at 4-bit quantization, so you&#8217;d need a g5.12xlarge or larger. Llama 3.1 8B needs around 5 GB VRAM at 4-bit, fitting comfortably on a g5.xlarge.<\/p>\n<h3>Google Cloud Platform<\/h3>\n<p>GCP propose des instances GPU via les familles de machines N1 et A2 de Compute Engine. Une instance n1-standard-4 dot\u00e9e d\u2019un NVIDIA T4 (16 Go de VRAM) co\u00fbte environ 0,62 $\/heure, tandis qu\u2019une a2-highgpu-1g \u00e9quip\u00e9e d\u2019un A100 (40 Go de VRAM) co\u00fbte environ 3,67 $\/heure dans la r\u00e9gion us-central1.<\/p>\n<pre><code># Cr\u00e9er une instance avec GPU\ngcloud compute instances create ollama-instance \n  --zone=us-central1-a \n  --machine-type=n1-standard-4 \n  --accelerator=type=nvidia-tesla-t4,count=1 \n  --image-family=ubuntu-2204-lts \n  --image-project=ubuntu-os-cloud \n  --maintenance-policy=TERMINATE\n\n# Connexion SSH et installation\ngcloud compute ssh ollama-instance --zone=us-central1-a\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run mistral:7b\n<\/code><\/pre>\n<h3>Microsoft Azure<\/h3>\n<p>Les machines virtuelles de la s\u00e9rie NC d\u2019Azure int\u00e8grent des GPU NVIDIA adapt\u00e9s aux charges de travail d\u2019inf\u00e9rence. Une NC6s_v3 (1 \u00d7 V100, 16 Go de VRAM) co\u00fbte environ 3,06 $\/heure, tandis qu\u2019une NC24ads_A100_v4 (1 \u00d7 A100, 80 Go de VRAM) co\u00fbte environ 3,67 $\/heure dans la r\u00e9gion Est des \u00c9tats-Unis.<\/p>\n<p>Installation follows the same pattern: provision a GPU-enabled Ubuntu VM, install NVIDIA drivers if not using a pre-configured image, and run the Ollama install script.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"GPU-Focused_Cloud_Providers\"><\/span>Fournisseurs cloud sp\u00e9cialis\u00e9s dans les GPU<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les fournisseurs cloud sp\u00e9cialis\u00e9s dans les GPU offrent souvent un meilleur rapport performance\/prix que les grands fournisseurs cloud pour les d\u00e9ploiements Ollama :<\/p>\n<table>\n<thead>\n<tr>\n<th>Fournisseur<\/th>\n<th>GPU<\/th>\n<th>VRAM<\/th>\n<th>Co\u00fbt\/heure<\/th>\n<th>Adapt\u00e9 \u00e0<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Lambda Labs<\/td>\n<td>A100<\/td>\n<td>40 Go<\/td>\n<td>$1.10<\/td>\n<td>DeepSeek R1 Distill Llama 70B, Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Vast.ai<\/td>\n<td>RTX 4090<\/td>\n<td>24 Go<\/td>\n<td>$0.34-$0.54<\/td>\n<td>Mistral 7B, Llama 3.1 8B, Phi-4<\/td>\n<\/tr>\n<tr>\n<td>RunPod<\/td>\n<td>A40<\/td>\n<td>48 Go<\/td>\n<td>$0.79<\/td>\n<td>Mistral Large 3 (instance unique), Llama 3.3 70B<\/td>\n<\/tr>\n<tr>\n<td>Paperspace<\/td>\n<td>A4000<\/td>\n<td>16 Go<\/td>\n<td>$0.76<\/td>\n<td>Mod\u00e8les plus petits jusqu\u2019\u00e0 environ 14 milliards de param\u00e8tres<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Lambda Labs propose la configuration la plus simple : les instances sont livr\u00e9es avec les pilotes NVIDIA et CUDA d\u00e9j\u00e0 install\u00e9s. Apr\u00e8s avoir lanc\u00e9 une instance depuis leur tableau de bord :<\/p>\n<pre><code>ssh ubuntu@\ncurl -fsSL https:\/\/ollama.com\/install.sh | sh\nollama run qwen3:32b\n<\/code><\/pre>\n<p>Vast.ai fonctionne comme un march\u00e9 de capacit\u00e9 GPU inutilis\u00e9e, offrant les prix les plus bas, mais avec une disponibilit\u00e9 variable. Vous soumissionnez des offres ou louez des instances via leur interface web, puis vous vous connectez en SSH pour installer Ollama.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Cost_Comparison_Cloud_Ollama_vs_API_Services\"><\/span>Comparaison des co\u00fbts : Ollama dans le cloud contre les services API<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La pertinence \u00e9conomique d\u2019Ollama h\u00e9berg\u00e9 dans le cloud d\u00e9pend de votre volume d\u2019utilisation. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/self-hosting-vs-api-calculator\/\">calculateur auto-h\u00e9bergement vs API<\/a> pour d\u00e9terminer votre seuil de rentabilit\u00e9.<\/p>\n<table>\n<thead>\n<tr>\n<th>Mod\u00e8le<\/th>\n<th>Co\u00fbt de l\u2019API (par million de jetons)<\/th>\n<th>GPU cloud<\/th>\n<th>Co\u00fbt de l'instance par heure<\/th>\n<th>Jetons par heure au seuil d'\u00e9quilibre<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Llama 3.3 70B<\/td>\n<td>0,10 $ en entr\u00e9e \/ 0,32 $ en sortie<\/td>\n<td>Lambda A100 40 Go<\/td>\n<td>$1.10<\/td>\n<td>~3,4 millions de jetons de sortie<\/td>\n<\/tr>\n<tr>\n<td>Mistral Large 3<\/td>\n<td>2,00 $ en entr\u00e9e \/ 6,00 $ en sortie<\/td>\n<td>RunPod 4\u00d7A40<\/td>\n<td>$3.16<\/td>\n<td>~530 000 jetons de sortie<\/td>\n<\/tr>\n<tr>\n<td>Qwen3 32B<\/td>\n<td>0,08 $ en entr\u00e9e \/ 0,28 $ en sortie<\/td>\n<td>Vast.ai RTX 4090<\/td>\n<td>$0.54<\/td>\n<td>~1,9 million de jetons de sortie<\/td>\n<\/tr>\n<tr>\n<td>DeepSeek R1<\/td>\n<td>0,50 $ en entr\u00e9e \/ 2,15 $ en sortie<\/td>\n<td>Lambda 4\u00d7A100<\/td>\n<td>$4.40<\/td>\n<td>~2 millions de jetons de sortie<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>If you&#8217;re processing more than the break-even token volume per hour, cloud Ollama becomes cheaper. For bursty workloads or low volumes, APIs like Claude Sonnet 5 ($2.00 in \/ $10.00 out per 1M tokens) or Gemini 3.6 Flash ($1.50 in \/ $7.50 out per 1M tokens) offer better economics with no idle time costs.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Deployment_Patterns\"><\/span>Sch\u00e9mas de d\u00e9ploiement<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Instances \u00e0 la demande<\/h3>\n<p>D\u00e9marrez une instance GPU lorsque vous en avez besoin, ex\u00e9cutez votre charge de travail, puis mettez fin \u00e0 l'instance. Cette approche convient bien au traitement par lots, au d\u00e9veloppement ou \u00e0 des inf\u00e9rences occasionnelles. Tous les principaux fournisseurs de services cloud et de GPU prennent en charge la tarification \u00e0 la demande.<\/p>\n<h3>Instances Spot \/ pr\u00e9emptibles<\/h3>\n<p>Les instances Spot d'AWS, les machines virtuelles pr\u00e9emptibles de GCP et les machines virtuelles Spot d'Azure proposent des r\u00e9ductions de 60 \u00e0 90 %, mais peuvent \u00eatre interrompues avec un pr\u00e9avis de 30 secondes \u00e0 2 minutes. Elles conviennent aux traitements par lots tol\u00e9rants aux pannes, o\u00f9 il est possible de sauvegarder l'avancement du traitement.<\/p>\n<p>Sur Vast.ai, les instances interrompables s'ex\u00e9cutent aux prix du march\u00e9, sans garantie de non-interruption : elles offrent les tarifs les plus bas, mais exigent une gestion robuste des erreurs.<\/p>\n<h3>Orchestration de conteneurs<\/h3>\n<p>For production deployments, run Ollama in Kubernetes with GPU node pools. This enables auto-scaling, load balancing, and high availability. Use the official Ollama Docker image:<\/p>\n<pre><code>docker pull ollama\/ollama\ndocker run -d --gpus=all -v ollama:\/root\/.ollama -p 11434:11434 ollama\/ollama\n<\/code><\/pre>\n<p>Ensuite, d\u00e9ployez-la sur votre cluster en d\u00e9finissant les demandes de ressources GPU dans la sp\u00e9cification de votre pod.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Model_Selection_for_Cloud_Deployments\"><\/span>S\u00e9lection des mod\u00e8les pour les d\u00e9ploiements cloud<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Choisissez les mod\u00e8les en fonction du budget VRAM de votre GPU. Utilisez le <a href=\"https:\/\/convly.ai\/fr\/llm-vram-calculator\/\">Calculateur de VRAM<\/a> pour estimer les besoins :<\/p>\n<ul>\n<li><strong>VRAM de 16 \u00e0 24 Go<\/strong> (T4, RTX 4090, A10G): Mistral 7B (~4.5 GB at 4-bit), Llama 3.1 8B (~5 GB), Phi-4 (~9 GB), Qwen3 14B (~9 GB), Gemma 3 12B (~8 GB)<\/li>\n<li><strong>VRAM de 40 \u00e0 48 Go<\/strong> (A100 40 Go, A40) : Llama 3.3 70B (~40 Go), DeepSeek R1 Distill Llama 70B (~40 Go), Mistral NeMo 12B (avec marge pour un contexte plus large)<\/li>\n<li><strong>VRAM de 80 Go et plus<\/strong> (A100 80 Go, H100) : Llama 4 Scout (~65 Go), DeepSeek R1 (~400 Go, n\u00e9cessite 4\u00d7A100 ou \u00e9quivalent), Mistral Large 3 (~400 Go)<\/li>\n<\/ul>\n<p>Les mod\u00e8les n\u00e9cessitant plus de 80 Go de VRAM requi\u00e8rent des configurations multi-GPU ou du parall\u00e9lisme tensoriel, que Ollama ne prend pas nativement en charge \u00e0 ce jour (version 0.3). Pour ces mod\u00e8les, envisagez plut\u00f4t des frameworks tels que vLLM ou TGI, ou utilisez des API commerciales.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Performance_Optimization\"><\/span>Optimisation des performances<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Plusieurs param\u00e8tres influencent la vitesse d'inf\u00e9rence d'Ollama sur les GPU cloud :<\/p>\n<ul>\n<li><strong>Quantification<\/strong>: Par d\u00e9faut, Ollama utilise la quantification 4 bits (Q4_0). Utilisez <code>ollama pull model:q8_0<\/code> pour la quantification 8 bits (meilleure qualit\u00e9, consommation de VRAM doubl\u00e9e) ou <code>model:q2_K<\/code> pour la quantification 2 bits (plus rapide, qualit\u00e9 r\u00e9duite).<\/li>\n<li><strong>Fen\u00eatre de contexte<\/strong>: D\u00e9fini via le param\u00e8tre <code>num_ctx<\/code> . Des contextes plus longs consomment davantage de VRAM : un contexte de 32 K n\u00e9cessite nettement plus de m\u00e9moire qu\u2019un contexte de 4 K pour le m\u00eame mod\u00e8le.<\/li>\n<li><strong>Taille du lot (batch size)<\/strong>: Augmentez le param\u00e8tre <code>num_batch<\/code> pour les charges de travail ax\u00e9es sur le d\u00e9bit, lorsque la latence importe moins que le nombre de jetons par seconde.<\/li>\n<li><strong>Couches GPU<\/strong>: Ollama transf\u00e8re automatiquement toutes les couches vers le GPU. Sur des instances disposant d'une VRAM limit\u00e9e, il revient automatiquement sur le CPU pour les couches qui ne tiennent pas dans la VRAM, ce qui r\u00e9duit drastiquement la vitesse.<\/li>\n<\/ul>\n<h2><span class=\"ez-toc-section\" id=\"Frequently_Asked_Questions\"><\/span>Questions fr\u00e9quemment pos\u00e9es<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3>Ollama propose-t-il son propre h\u00e9bergement cloud ?<\/h3>\n<p>Non. Ollama est un logiciel auto-h\u00e9berg\u00e9 qui ex\u00e9cute des mod\u00e8les sur votre propre infrastructure. Il n\u2019existe aucun service cloud officiel Ollama ni aucune API g\u00e9r\u00e9e. Lorsque les gens font r\u00e9f\u00e9rence aux \u00ab mod\u00e8les Ollama cloud \u00bb, ils d\u00e9signent l\u2019ex\u00e9cution du logiciel Ollama sur une infrastructure cloud qu\u2019ils provisionnent eux-m\u00eames via AWS, GCP, Azure ou des fournisseurs sp\u00e9cialis\u00e9s dans les GPU.<\/p>\n<h3>Puis-je utiliser le format d\u2019API d\u2019Ollama avec des mod\u00e8les cloud ?<\/h3>\n<p>Oui. Une fois Ollama lanc\u00e9 sur une machine virtuelle cloud, il expose une API REST sur le port 11434, compatible avec le format d\u2019API OpenAI. Vous pouvez configurer n\u2019importe quel client compatible OpenAI pour qu\u2019il pointe vers l\u2019adresse IP et le port de votre instance cloud. Cela vous permet d\u2019utiliser les mod\u00e8les h\u00e9berg\u00e9s par Ollama comme substituts directs aux API commerciales dans de nombreuses applications, bien que vous assumiez pleinement la responsabilit\u00e9 de la disponibilit\u00e9, de la mont\u00e9e en charge et de la s\u00e9curit\u00e9.<\/p>\n<h3>Quel fournisseur cloud est le moins cher pour ex\u00e9cuter Ollama ?<\/h3>\n<p>Les fournisseurs sp\u00e9cialis\u00e9s dans les GPU, tels que Lambda Labs (1,10 $\/heure pour un A100 40 Go) et Vast.ai (0,34 \u00e0 0,54 $\/heure pour un RTX 4090), proposent des tarifs nettement inf\u00e9rieurs \u00e0 ceux d\u2019AWS, de GCP et d\u2019Azure pour une capacit\u00e9 \u00e9quivalente de m\u00e9moire GPU. Lambda Labs offre une meilleure fiabilit\u00e9 et un meilleur support ; Vast.ai propose les prix les plus bas, mais avec une disponibilit\u00e9 variable. Pour les charges de travail en production n\u00e9cessitant des accords de niveau de service (SLA), les grands fournisseurs cloud offrent des garanties sup\u00e9rieures, moyennant un co\u00fbt plus \u00e9lev\u00e9.<\/p>\n<h3>Quel est le co\u00fbt d\u2019ex\u00e9cution de Llama 3.3 70B dans le cloud par rapport aux API ?<\/h3>\n<p>Llama 3.3 70B n\u00e9cessite environ 40 Go de VRAM en quantification 4 bits. Une instance Lambda Labs A100 40 Go co\u00fbte 1,10 $\/heure. Si vous g\u00e9n\u00e9rez 3,4 millions de jetons de sortie par heure (~945 jetons\/seconde en continu), vous atteignez le seuil d\u2019\u00e9quilibre avec le tarif d\u2019API de 0,32 $ par million de jetons. En dessous de ce seuil, les API sont moins co\u00fbteuses. Au-dessus, l\u2019instance cloud devient plus avantageuse. La plupart des charges de travail r\u00e9elles sont ponctuelles plut\u00f4t que continues, ce qui favorise la tarification par API, sauf si vous ex\u00e9cutez des traitements par lots de fa\u00e7on ininterrompue.<\/p>\n<h3>Ollama peut-il s\u2019\u00e9tendre sur plusieurs GPU dans le cloud ?<\/h3>\n<p>Ollama d\u00e9tecte et utilise automatiquement plusieurs GPU sur une seule instance, mais il ex\u00e9cute un mod\u00e8le par GPU plut\u00f4t que de r\u00e9partir un seul mod\u00e8le sur plusieurs GPU (parall\u00e9lisme tensoriel). Cela signifie qu\u2019une instance 4\u00d7A100 peut ex\u00e9cuter quatre instances distinctes de mod\u00e8les ou traiter efficacement quatre requ\u00eates simultan\u00e9es, mais ne peut pas charger un mod\u00e8le unique de 400 Go comme Mistral Large 3, qui d\u00e9passe la capacit\u00e9 d\u2019un seul GPU. Pour le parall\u00e9lisme multi-GPU, privil\u00e9giez plut\u00f4t vLLM, TensorRT-LLM ou Text Generation Inference.<\/p>\n<h3>L\u2019ex\u00e9cution d\u2019Ollama dans le cloud est-elle s\u00e9curis\u00e9e ?<\/h3>\n<p>Par d\u00e9faut, Ollama \u00e9coute sur 0.0.0.0:11434, exposant ainsi son API \u00e0 tout client r\u00e9seau. Sur des instances cloud dot\u00e9es d\u2019une adresse IP publique, cela signifie que votre point de terminaison d\u2019inf\u00e9rence est accessible publiquement, \u00e0 moins que vous ne configuriez des r\u00e8gles de pare-feu, des groupes de s\u00e9curit\u00e9 ou un acc\u00e8s VPN. D\u00e9finissez la variable d\u2019environnement <code>OLLAMA_HOST=127.0.0.1:11434<\/code> pour limiter l\u2019acc\u00e8s au localhost, puis utilisez un tunnel SSH, un proxy inverse avec authentification ou un VPN afin de s\u00e9curiser l\u2019acc\u00e8s \u00e0 distance. Les d\u00e9ploiements cloud doivent \u00e9galement impl\u00e9menter la journalisation des requ\u00eates, la limitation de d\u00e9bit et la validation des entr\u00e9es afin de pr\u00e9venir les abus.<\/p>","protected":false},"excerpt":{"rendered":"<p>Ollama doesn&#8217;t offer cloud-hosted models as an API service\u2014it&#8217;s a local inference engine you run on your own hardware. You [\u2026]<\/p>\n","protected":false},"author":1,"featured_media":2517,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[7],"tags":[],"class_list":["post-2516","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news"],"_links":{"self":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2516","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/comments?post=2516"}],"version-history":[{"count":1,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2516\/revisions"}],"predecessor-version":[{"id":2518,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/posts\/2516\/revisions\/2518"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media\/2517"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/media?parent=2516"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/categories?post=2516"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/convly.ai\/fr\/wp-json\/wp\/v2\/tags?post=2516"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}