Monday, 31 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

نماذج سحابة Ollama: تشغيل Ollama على بنية تحتية سحابية

  • لا تقدّم Ollama نماذج مستضافة سحابيًّا كخدمة واجهة برمجة تطبيقات (API) — بل هي محرك استنتاج محلي تقوم بتشغيله على أجهزتك الخاصة.
  • يمكنك نشر Ollama على أجهزة افتراضية سحابية (مثل AWS EC2 وGCP Compute Engine وAzure) لدمج سهولة استخدام Ollama مع قابلية التوسع السحابي.
  • توفّر مزوِّدو الخدمات السحابية المتخصِّصون في وحدات معالجة الرسومات (GPU)، مثل Lambda Labs وVast.ai وRunPod، وحدات GPU أكثر فعالية من حيث التكلفة مقارنةً بالسحابات الكبرى لتشغيل Ollama.
  • تتراوح تكلفة تشغيل Ollama في السحابة بين ٠,٥٠ و٣ دولارات/ساعة للوحدات المزوَّدة بوحدات معالجة رسومات (GPU)، مقارنةً بـ ٠,٥٠ إلى ٥ دولارات لكل مليون رمز (token) في خدمات واجهات برمجة التطبيقات التجارية — ويعتمد نقطة التعادل على حجم الاستخدام.

لا توفّر Ollama نماذج مستضافة سحابيًّا كخدمة واجهة برمجة تطبيقات (API) مُدارة. Ollama هي محرك استنتاج مفتوح المصدر يقوم بتشغيل النماذج مفتوحة المصدر على أجهزتك الخاصة. ومع ذلك، يمكنك نشر Ollama على بنية تحتية سحابية — مثل أجهزة AWS EC2 الافتراضية أو Google Cloud أو أجهزة Azure الافتراضية أو مزوِّدي وحدات معالجة الرسومات المتخصصين — للحصول على قوة الحوسبة السحابية مع الاحتفاظ بواجهة Ollama البسيطة. ويتيح لك هذا النهج التحكّم الكامل في بيئة التشغيل وقد يكون أكثر فعالية من حيث التكلفة مقارنةً بخدمات واجهات برمجة التطبيقات التجارية عند أحجام استخدام مرتفعة.

ما هي Ollama (وما ليست عليه)

Ollama هي محرك استنتاج مفتوح المصدر يقوم بتشغيل نماذج اللغات الكبيرة محليًّا. وهي تتعامل مع تنزيل النماذج وتصغيرها (quantization) والاستنتاج عبر واجهة سطر أوامر بسيطة (CLI) وواجهة برمجة تطبيقات REST. ووفقًا للمستودع الرسمي لـ Ollama الرسمي، فإنها تدعم نماذج من عائلات Llama وMistral وGemma وQwen و DeepSeek وغيرها.

لا تعمل Ollama كمزوِّد خدمة سحابية. فهي لا تستضيف النماذج على خوادمها الخاصة ولا تفرض أسعارًا حسب عدد الرموز (per-token). وعند تشغيلك لـ تشغيل llama3.3يُنفَّذ النموذج على أي جهازٍ نفَّذ الأمر — سواءً كان ذلك جهازك اللوحي الشخصي، أو خادوم مركز البيانات، أو آلة افتراضية في السحابة تدفع مقابل استخدامها بشكل منفصل.

إن مصطلح «ollama cloud » يشير عادةً إلى أحد ثلاثة أنماط نشر:

  • تشغيل Ollama على جهاز افتراضي سحابي مزوَّد بوحدة معالجة رسومات (GPU)
  • نشر Ollama ضمن منصة تنسيق الحاويات (مثل Kubernetes أو ECS)
  • استخدام Ollama على وحدة سحابية مخصصة لوظائف وحدة معالجة الرسومات (GPU) للتوسع حسب الطلب

تشغيل Ollama على مزوِّدي الخدمات السحابية الرئيسيين

أجهزة AWS EC2 المزوَّدة بوحدات معالجة رسومات (GPU)

تقدم شركة AWS أجهزة افتراضية EC2 المزوَّدة بوحدات معالجة رسومات (GPU) ضمن العائلات G وP وInf. ولأحمال عمل Ollama، تبدأ تكلفة الجهاز الافتراضي g5.xlarge (وحدة واحدة من NVIDIA A10G بسعة ٢٤ جيجابايت من ذاكرة VRAM) عند حوالي ١,٠١ دولار/ساعة عند الشراء الفوري في المنطقة us-east-1، بينما تبلغ تكلفة الجهاز الافتراضي g5.12xlarge (٤ وحدات A10G بسعة ٩٦ جيجابايت من ذاكرة VRAM) نحو ٥,٦٧ دولار/ساعة.

لنشر Ollama على EC2:

# إطلاق جهاز افتراضي Ubuntu 22.04 من نوع g5.xlarge باستخدام صورة Deep Learning AMI
# الاتصال بالجهاز عبر SSH
sudo apt update
curl -fsSL https://ollama.com/install.sh | sh

# التحقق من اكتشاف وحدة معالجة الرسومات
nvidia-smi

# تشغيل نموذج
ollama run llama3.3:70b

أ Llama 3.3 70B يتطلّب النموذج ما يقارب ٤٠ جيجابايت من ذاكرة VRAM عند التصغير إلى ٤ بت، وبالتالي ستحتاج إلى جهاز g5.12xlarge أو أكبر. Llama 3.1 8B يتطلّب ما يقارب ٥ جيجابايت من ذاكرة VRAM عند التصغير إلى ٤ بت، مما يجعله مناسبًا تمامًا للجهاز الافتراضي g5.xlarge.

منصة Google Cloud Platform

توفر شركة GCP أجهزة مزوَّدة بوحدات معالجة رسومات (GPU) عبر عائلتي الآلات N1 وA2 في خدمة Compute Engine. ويبلغ سعر الجهاز n1-standard-4 المزوَّد بوحدة واحدة من NVIDIA T4 (١٦ جيجابايت من ذاكرة VRAM) حوالي ٠,٦٢ دولار/ساعة، بينما يبلغ سعر الجهاز a2-highgpu-1g المزوَّد بوحدة واحدة من A100 (٤٠ جيجابايت من ذاكرة VRAM) حوالي ٣,٦٧ دولار/ساعة في المنطقة us-central1.

# إنشاء جهاز افتراضي مزوَّد بوحدة معالجة رسومات (GPU)
gcloud compute instances create ollama-instance 
  --zone=us-central1-a 
  --machine-type=n1-standard-4 
  --accelerator=type=nvidia-tesla-t4,count=1 
  --image-family=ubuntu-2204-lts 
  --image-project=ubuntu-os-cloud 
  --maintenance-policy=TERMINATE

# الاتصال عبر SSH وتثبيت البرنامج
gcloud compute ssh ollama-instance --zone=us-central1-a
curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral:7b

مايكروسوفت أزور (Microsoft Azure)

توفر سلسلة أجهزة Azure NC VMs وحدات معالجة رسومات (GPU) من شركة NVIDIA لأحمال عمل الاستنتاج. ويبلغ سعر الجهاز NC6s_v3 (وحدة واحدة من V100 بسعة ١٦ جيجابايت من ذاكرة VRAM) حوالي ٣,٠٦ دولارات/ساعة، بينما يبلغ سعر الجهاز NC24ads_A100_v4 (وحدة واحدة من A100 بسعة ٨٠ جيجابايت من ذاكرة VRAM) حوالي ٣,٦٧ دولار/ساعة في منطقة East US.

يتبع التثبيت نفس النمط: توفير جهاز افتراضي أوبونتو مزوَّد بوحدة معالجة رسومات (GPU)، وتثبيت برامج تشغيل NVIDIA إذا لم تكن تستخدم صورة مُهيَّأة مسبقًا، ثم تشغيل نص التثبيت تثبيت Ollama install.sh

مزوِّدو الخدمات السحابية المتخصِّصون في وحدات معالجة الرسومات (GPU)

غالبًا ما تقدّم مزوِّدو الخدمات السحابية المتخصِّصون في وحدات معالجة الرسومات (GPU) أداءً أفضل من حيث التكلفة مقارنةً بالسحابات الكبرى لعمليات نشر Ollama:

مزود الخدمة وحدة معالجة الرسومات (GPU) ذاكرة VRAM التكلفة/الساعة مناسبة لـ
Lambda Labs A100 40 جيجابايت $1.10 DeepSeek R1 Distill Llama 70B وLlama 3.3 70B
Vast.ai RTX 4090 24 جيجابايت $0.34-$0.54 Mistral 7B وLlama 3.1 8B وPhi-4
RunPod A40 48 جيجابايت $0.79 Mistral Large 3 (في حالة جهاز واحد) وLlama 3.3 70B
Paperspace A4000 16 جيجابايت $0.76 النماذج الأصغر حتى حوالي ١٤ مليار معلّمة (parameter)

توفّر Lambda Labs أبسط عملية إعداد — إذ تأتي الأجهزة الافتراضية مزوَّدة ببرامج تشغيل NVIDIA وCUDA مثبتة مسبقًا. وبعد إطلاق الجهاز الافتراضي عبر لوحة التحكم الخاصة بها:

ssh ubuntu@
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3:32b

تعمل Vast.ai كسوق لوحدات معالجة الرسومات (GPU) غير المستخدمة، وتقدّم أدنى الأسعار لكن مع تقلّب في التوافر. ويمكنك المزايدة على الوحدات أو استئجارها عبر واجهتها الإلكترونية، ثم الاتصال بها عبر SSH لتثبيت Ollama.

مقارنة التكاليف: Ollama في السحابة مقابل خدمات واجهات برمجة التطبيقات (API)

يعتمد ما إذا كان نشر Ollama في السحابة منطقيًّا اقتصاديًّا على حجم استخدامك. واستخدم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لإيجاد نقطة التعادل الخاصة بك.

النموذج تكلفة واجهة برمجة التطبيقات (API) (لكل مليون رمز) وحدة معالجة رسومات سحابية (Cloud GPU) تكلفة المثيل لكل ساعة عدد الرموز لكل ساعة عند نقطة التعادل
Llama 3.3 70B ٠٫١٠ دولار داخليًا / ٠٫٣٢ دولار خارجيًا Lambda A100 40GB $1.10 حوالي ٣٫٤ مليون رمز خرج
Mistral Large 3 ٢٫٠٠ دولار داخليًا / ٦٫٠٠ دولار خارجيًا RunPod 4×A40 $3.16 حوالي ٥٣٠ ألف رمز خرج
Qwen3 32B ٠٫٠٨ دولار داخليًا / ٠٫٢٨ دولار خارجيًا Vast.ai RTX 4090 $0.54 حوالي ١٫٩ مليون رمز خرج
DeepSeek R1 ٠٫٥٠ دولار داخليًا / ٢٫١٥ دولار خارجيًا Lambda 4×A100 $4.40 حوالي مليوني رمز خرج

إذا كنت تُعالِج أكثر من حجم الرموز عند نقطة التعادل لكل ساعة، فإن استخدام Ollama سحابيًّا يصبح أرخص. أما بالنسبة لأحمال العمل المتقطعة أو الحجم المنخفض، فإن واجهات برمجة التطبيقات مثل Claude Sonnet 5 (٢٫٠٠ دولار داخليًا / ١٠٫٠٠ دولار خارجيًا لكل مليون رمز) أو Gemini 3.6 Flash (١٫٥٠ دولار داخليًا / ٧٫٥٠ دولار خارجيًا لكل مليون رمز) تقدّم اقتصاديات أفضل دون تكاليف وقت الخمول.

أنماط النشر

المثيلات حسب الطلب

ابدأ مثيل وحدة معالجة رسومية (GPU) عند الحاجة، ثم نفّذ حمل عملك، ثم أنهِ المثيل. وهذه الطريقة مناسبة جدًّا لمعالجة الدفعات، أو التطوير، أو الاستنتاج غير المتكرر. وتدعم جميع السحابات الرئيسية وموفري وحدات معالجة الرسوميات التسعير حسب الطلب.

المثيلات المؤقتة / القابلة للإيقاف المؤقت

تقدم مثيلات AWS Spot ومثيلات GCP القابلة للإيقاف المؤقت ومثيلات Azure Spot خصومات تتراوح بين ٦٠٪ و٩٠٪، لكنها قد تُنهى فجأة مع إشعار مسبق يتراوح بين ٣٠ ثانية ودقيقتين. وهي مناسبة لأحمال المعالجة الدفعية التي تتحمّل الأعطال، حيث يمكنك حفظ تقدّم العمل بشكل دوري.

أما على Vast.ai، فإن المثيلات القابلة للإيقاف تعمل بأسعار السوق دون أي ضمان بعدم الإنهاء، ما يوفّر أقل الأسعار لكنه يتطلّب معالجة قوية للأخطاء.

تنسيق الحاويات

لنشر الإنتاج، شغّل Ollama على نظام Kubernetes مع مجموعات عُقد وحدات معالجة الرسوميات (GPU node pools). وهذا يمكّن التوسع التلقائي وتوزيع الحمل والتوافر العالي. واستخدم صورة Ollama Docker الرسمية:

docker pull ollama/ollama
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama

ثم نفّذ النشر على مجمعك مع تحديد طلبات موارد وحدة معالجة الرسوميات في مواصفات البود (pod spec).

اختيار النماذج للنشر في السحابة

اختر النماذج بناءً على ميزانيتك من ذاكرة وحدة معالجة الرسوميات (VRAM). واستخدم حاسبة الذاكرة VRAM لتقدير المتطلبات:

  • ذاكرة VRAM تتراوح بين ١٦ و٢٤ جيجابايت (T4، RTX 4090، A10G): Mistral 7B (حوالي ٤٫٥ جيجابايت عند التكميم ٤-بت)، Llama 3.1 8B (حوالي ٥ جيجابايت)، Phi-4 (حوالي ٩ جيجابايت)، Qwen3 14B (حوالي ٩ جيجابايت)، Gemma 3 12B (حوالي ٨ جيجابايت)
  • ذاكرة VRAM تتراوح بين ٤٠ و٤٨ جيجابايت (A100 40GB، A40): Llama 3.3 70B (حوالي ٤٠ جيجابايت)، DeepSeek R1 Distill Llama 70B (حوالي ٤٠ جيجابايت)، Mistral NeMo 12B مع هامش كافٍ لسياقات أكبر
  • ذاكرة VRAM تزيد عن ٨٠ جيجابايت (A100 80GB، H100): Llama 4 Scout (حوالي ٦٥ جيجابايت)، DeepSeek R1 (حوالي ٤٠٠ جيجابايت، ويحتاج إلى ٤ وحدات A100 أو ما يعادلها)، Mistral Large 3 (حوالي ٤٠٠ جيجابايت)

النماذج التي تتطلب أكثر من ٨٠ جيجابايت من ذاكرة VRAM تحتاج إلى إعدادات متعددة وحدات معالجة رسومية أو توازي التنسور (tensor parallelism)، والتي لا يدعمها Ollama دعمًا أصليًّا حتى الإصدار ٠٫٣. ولتلك النماذج، فكّر في استخدام إطارات عمل مثل vLLM أو TGI، أو استخدم واجهات برمجة التطبيقات التجارية بدلًا منها.

تحسين الأداء

تؤثر عدة إعدادات على سرعة استنتاج Ollama على وحدات معالجة الرسوميات السحابية:

  • التكميةالتكميم: يُعيّن Ollama افتراضيًّا التكميم ٤-بت (Q4_0). استخدم الأمر ollama pull model:q8_0 للتكميم ٨-بت (جودة أفضل، لكنه يستهلك ضعف الذاكرة)، أو الأمر model:q2_K للتكميم ٢-بت (أسرع، لكن الجودة أقل).
  • نافذة السياقحجم السياق: يتم تعيينه عبر المعلّمة : حجم نافذة السياق (بين 2048 و8192، وكلما زادت القيمة زاد استهلاك الـ VRAM) . فاستخدام سياقات أكبر يستهلك ذاكرة VRAM أكثر — إذ يستهلك سياق بحجم ٣٢ ألف رمز ذاكرة أكبر بكثير من سياق بحجم ٤ آلاف رمز لنفس النموذج.
  • حجم الدفعة (Batch size)زِد قيمة المعلّمة num_batch لأحمال العمل التي تركز على الإنتاجية (throughput)، حيث تكون السرعة (tokens/second) أهم من زمن الاستجابة (latency).
  • طبقات وحدة معالجة الرسوميات (GPU layers)يقوم Ollama تلقائيًّا بتفريغ جميع الطبقات إلى وحدة معالجة الرسوميات. أما على المثيلات ذات الذاكرة المحدودة، فيعود تلقائيًّا إلى وحدة المعالجة المركزية (CPU) للطبقات التي لا تتّسع في الذاكرة، ما يؤدي إلى انخفاض كبير في السرعة.

الأسئلة الشائعة

هل تقدّم Ollama استضافة سحابية خاصة بها؟

لا. إن Ollama هو برنامج ذاتي الاستضافة يعمل على البنية التحتية الخاصة بك. ولا يوجد خدمة سحابية رسمية لـ Ollama أو واجهة برمجة تطبيقات مُدارة. وعندما يشير الناس إلى «نماذج Ollama السحابية»، فإنهم يقصدون تشغيل برنامج Ollama على البنية التحتية السحابية التي يوفّرونها بأنفسهم عبر AWS أو GCP أو Azure أو موفري وحدات معالجة الرسوميات السحابية.

هل يمكنني استخدام تنسيق واجهة برمجة تطبيقات Ollama مع النماذج السحابية؟

نعم. وبمجرد أن يعمل Ollama على جهاز افتراضي سحابي، فإنه يعرّض واجهة برمجة تطبيقات REST على المنفذ ١١٤٣٤، وهي متوافقة مع تنسيق واجهة برمجة تطبيقات OpenAI. ويمكنك توجيه أي عميل متوافق مع OpenAI إلى عنوان IP ومنفذ مثيلك السحابي. وهذا يسمح لك باستخدام النماذج المستضافة عبر Ollama كبديل مباشر لواجهات برمجة التطبيقات التجارية في العديد من التطبيقات، رغم أنك مسؤول عن إدارة التوافر والتوسع والأمان.

أيُّ مزوِّد سحابي يوفّر أدنى تكلفة لتشغيل Ollama؟

مزوِّدو الخدمات السحابية المتخصِّصون في وحدات معالجة الرسومات (GPU)، مثل Lambda Labs (بسعر ١,١٠ دولار/ساعة لوحدة A100 بسعة ٤٠ جيجابايت من الذاكرة VRAM) وVast.ai (بسعر يتراوح بين ٠,٣٤ و٠,٥٤ دولار/ساعة لوحدة RTX 4090)، يقدّمون أسعارًا أقل بكثير من AWS وGCP وAzure للوحدات المكافئة من حيث سعة ذاكرة وحدة معالجة الرسومات. وتتميّز Lambda بالموثوقية الأعلى والدعم الأفضل، بينما تقدّم Vast.ai أدنى الأسعار لكن مع تقلّب في توافر الوحدات. أما بالنسبة لأحمال العمل الإنتاجية التي تتطلّب اتفاقيات مستوى الخدمة (SLAs)، فإن السحابات الكبرى توفّر ضمانات أفضل مقابل تكاليف أعلى.

ما تكلفة تشغيل النموذج Llama 3.3 70B في السحابة مقارنةً بخدمات واجهات برمجة التطبيقات (API)؟

يتطلب نموذج Llama 3.3 70B حوالي ٤٠ جيجابايت من ذاكرة VRAM عند التكميم ٤-بت. وتكلّف مثيل Lambda Labs A100 40GB ما قدره ١٫١٠ دولار لكل ساعة. فإذا أنتجت ٣٫٤ مليون رمز خرج في الساعة (أي نحو ٩٤٥ رمزًا في الثانية باستمرار)، فإنك تصل إلى نقطة التعادل مع معدل واجهة برمجة التطبيقات البالغ ٠٫٣٢ دولار لكل مليون رمز. وأقل من هذه العتبة يكون استخدام واجهات برمجة التطبيقات أرخص، بينما يصبح المثيل السحابي أكثر فعالية عند تجاوزها. ومعظم أحمال العمل الواقعية متقطعة بدلًا من أن تكون مستمرة، ما يفضّل تسعير واجهات برمجة التطبيقات ما لم تكن تقوم بمهام معالجة دفعية بشكل دائم.

هل يمكن لـ Ollama التوسع عبر عدة وحدات معالجة رسومات (GPUs) في السحابة؟

يكتشف Ollama تلقائيًّا ويستخدم وحدات معالجة الرسوميات المتعددة على مثيل واحد، لكنه يشغل نموذجًا واحدًا على كل وحدة معالجة رسوميات بدلًا من توزيع نموذج واحد عبر وحدات معالجة الرسوميات (توازي التنسور). وهذا يعني أن مثيل 4×A100 يمكنه تشغيل أربعة مثيلات منفصلة لنماذج مختلفة أو التعامل بكفاءة مع أربع طلبات متزامنة، لكنه لا يستطيع تحميل نموذج واحد ضخم بحجم ٤٠٠ جيجابايت مثل Mistral Large 3 الذي يتجاوز سعة وحدة معالجة رسوميات واحدة. ولتحقيق توازي النماذج عبر وحدات معالجة الرسوميات المتعددة، استخدم بدلاً من ذلك vLLM أو TensorRT-LLM أو Text Generation Inference.

هل يُعدّ تشغيل Ollama في السحابة آمنًا؟

بشكل افتراضي، يرتبط Ollama بالعنوان 0.0.0.0:11434، ما يجعل واجهة برمجة التطبيقات الخاصة به متاحة لأي عميل شبكي. وعلى المثيلات السحابية ذات عناوين IP العامة، هذا يعني أن نقطة نهاية الاستنتاج الخاصة بك ستكون متاحة للجميع ما لم تضبط قواعد الجدار الناري أو مجموعات الأمان أو الوصول عبر شبكة خاصة افتراضية (VPN). ولتقييد الوصول إلى localhost فقط، عيّن المتغير OLLAMA_HOST=127.0.0.1:11434 ثم استخدم نفق SSH أو وكيل عكسي (reverse proxy) مزوّد بالمصادقة أو شبكة خاصة افتراضية (VPN) لتأمين الوصول البعيد. كما يجب أن تتضمّن عمليات النشر السحابية أيضًا تسجيل الطلبات وتحديد حدود المعدل والتحقق من المدخلات لمنع إساءة الاستخدام.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That