Wednesday, 12 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

سحابة Ollama: تشغيل النماذج في السحابة مقابل التشغيل المحلي

باختصار

  • Ollama Cloud يشير إلى تشغيل برنامج Ollama على بنية تحتية سحابية (مثل AWS أو GCP أو Azure) بدلًا من الأجهزة المحلية — مع الحفاظ على نفس واجهة سطر الأوامر (CLI) ونفس واجهة برمجة التطبيقات (API)، لكن التنفيذ يتم عن بُعد.
  • جميع النماذج الموجودة في مكتبة Ollama تعمل على حالات التشغيل السحابية؛ حيث تدفع مقابل وقت استخدام وحدة معالجة الرسومات (GPU) بالساعة بدلًا من شراء الأجهزة.
  • تتفاوت نقطة التعادل حسب طريقة الاستخدام: وتوضح حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) الرسم البياني المقابل الوقت الذي تصبح فيه وحدات معالجة الرسومات (GPU) السحابية أكثر فعالية من حيث التكلفة مقارنةً بشراء الأجهزة المحلية.
  • مقايضة الخصوصية: الاستضافة السحابية تعني أن مدخلاتك (Prompts) وردود النموذج تمر عبر الشبكة وتلامس البنية التحتية الخاصة بمزود الخدمة، على عكس الاستنتاج المحلي الكامل الذي يظل داخل جهازك.

تُنفَّذ عمليات النشر السحابية لبرنامج Ollama باستخدام نفس خادم Ollama الذي تثبّته محليًّا، لكن على وحدات معالجة رسومات مستأجرة من شركات مثل AWS أو Google Cloud أو Azure أو غيرها من مزودي الخدمات. وبذلك تحصل على نفس مكتبة النماذج، ونفس ollama run أوامر سطر الأوامر (CLI)، ونفس واجهة برمجة التطبيقات (REST API) — لكن عملية الاستنتاج تتم على أجهزة بعيدة تدفع مقابل استخدامها بالساعة بدلًا من امتلاكها. ويشرح هذا الدليل الحالات التي يكون فيها اللجوء إلى الاستضافة السحابية منطقيًّا، وكيف تقارن تكلفتها بتكلفة وحدات معالجة الرسومات (GPU) المحلية، وما الذي تفقده من حيث الخصوصية والتحكم.

ما المقصود بـ Ollama Cloud؟

لا توجد منتجات مستقلة باسم «أُولاما السحابة» حتى أوائل عام 2026. وعندما يشير المطورون إلى «أُولاما السحابة»، فإنهم يقصدون إحدى الحالتين التاليتين:

  1. تشغيل أُولاما ذاتي الاستضافة على أجهزة افتراضية سحابية: تستأجر جهازًا افتراضيًّا مزوَّدًا بوحدة معالجة رسوميات (GPU) من خدمات مثل AWS EC2 أو Google Compute Engine أو Azure أو Lambda Labs أو RunPod، ثم تقوم بتثبيت أُولاما يدويًّا وتشغيل النماذج عليه. وأنت المسؤول عن إدارة المثيل، لكنك لا تشترى العتاد المادي.
  2. خدمات أُولاما المُدارة: منصات طرف ثالث تُثبِّت أُولاما مسبقًا، وتتولى التوسع التلقائي، وتحسُب الفواتير حسب عدد الطلبات أو حسب الدقيقة. وهذه الخدمات أقل شيوعًا، وغالبًا ما تُبنى على أساس النهج الأول المذكور أعلاه.

وتختلف كلا الطريقتين عن تشغيل أُولاما محليًّا على جهاز سطح المكتب أو الخادم الخاص بك. فملف تنفيذ أُولاما ومكتبة النماذج وواجهة سطر الأوامر (CLI) وواجهة برمجة التطبيقات (API) تبقى متطابقة تمامًا — والفرق الوحيد هو موقع التنفيذ.

كيف يختلف Ollama السحابي عن Ollama المحلي؟

البعدأُولاما محليأُولاما سحابي
تكلفة العتادشراء وحدة معالجة رسوميات (GPU) مقدَّمًا (من ٥٠٠ إلى ٢٥٠٠ دولار أمريكي)استئجار ساعة واحدة (من ٠٫٥٠ إلى ٥ دولارات أمريكيّة لكل ساعة، حسب نوع وحدة المعالجة الرسومية)
سرعة الاستنتاجتعتمد على وحدة المعالجة الرسومية الخاصة بك؛ ولا توجد أي تأخيرات ناتجة عن الشبكةتعتمد على وحدة المعالجة الرسومية المستأجرة؛ مع إضافة تأخير في الجولة الشبكية يتراوح بين ٢٠ و١٠٠ ملي ثانية
الخصوصيةلا تغادر المُدخلات أبدًا جهازكتمرُّ المُدخلات والاستجابات عبر الشبكة؛ ويستطيع مقدِّم الخدمة السحابية رؤية بيانات الطلب الوصفية (metadata)
التوسُّعمحدَّد بالعتاد المتوفر لديكيمكنك إنشاء مثيلات أكبر أو إضافية عند الطلب
الصيانةأنت المسؤول عن إدارة نظام التشغيل وبرامج التشغيل وتحديثات أُولاماأنت المسؤول عن إدارة الجهاز الافتراضي (في حالة الاستضافة الذاتية)، أو تُدار هذه المهمة تلقائيًّا من قِبل المنصة (في حالة الخدمات المُدارة)
التوافرمرتبطة باستمرارية تشغيل جهازكيعمل باستمرار طالما أنك تترك المثيل قيد التشغيل؛ وتدفع مقابل الوقت الذي يظل فيه المثيل غير نشط (idle time)

التجربة الوظيفية متطابقة تمامًا. فعلى سبيل المثال، يعمل البرنامج النصي الذي يستدعي الأمر: curl http://localhost:11434/api/generate بدون أي تغيير إذا استبدلت عنوان localhost localhost بعنوان IP العام لمثيلك السحابي.

التوافق مع واجهة سطر الأوامر (CLI) وواجهة برمجة التطبيقات (API)

إن واجهة سطر أوامر أُولاما (CLI) وواجهة برمجة التطبيقات (REST API) لا تعتمدان على وسيلة النقل المستخدمة. ولتوجيه واجهة سطر الأوامر نحو مثيل سحابي بدلًا من الخادم المحلي، استخدم:

export OLLAMA_HOST=http://203.0.113.42:11434
ollama run llama3.1:8b

استبدل 203.0.113.42 بعنوان IP العام لمثيلك السحابي الافتراضي. ويتم تنزيل النموذج إلى المثيل السحابي، ويتم تنفيذ عملية الاستنتاج هناك، بينما تقوم واجهة سطر الأوامر لديك باستلام الاستجابات عبر الشبكة.

وبالنسبة لعملاء واجهة برمجة التطبيقات (API clients)، غيّر عنوان URL الأساسي كما يلي:

curl http://203.0.113.42:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "اشرح الشبكات العصبية في جملة واحدة."
}'

جميع نقاط النهاية (endpoints) — مثل:/api/generate, /api/chat, /api/embeddings— تتصرف بشكل متطابق تمامًا. كما تقبل مكتبات العملاء (المكتوبة بلغات Python وJavaScript وGo) معلَّمة مخصصة لعنوان المضيف (host parameter):

import ollama
client = ollama.Client(host='http://203.0.113.42:11434')
response = client.chat(model='llama3.1:8b', messages=[...])

ولا يتطلَّب الأمر أي تغييرات في الكود سوى تعديل عنوان نقطة النهاية (endpoint URL).

أي النماذج متاحة؟

يعمل كل نموذج موجود في مكتبة أُولاما على المثيلات السحابية. وتشمل المكتبة نماذج مثل Llama 3.1 وMistral وGemma 2 وQwen وPhi و قائمة نماذج Ollama includes Llama 3.1, Mistral, Gemma 2, Qwen, Phi, DeepSeekوالعديد من النماذج الأخرى (أكثر من عشرين نموذجًا). ولا تقيِّد مكان تشغيل أُولاما مدى توافر النماذج.

أما العامل المقيد فهو سعة ذاكرة وحدة المعالجة الرسومية (VRAM). فمثيل سحابي مزوَّد بوحدة معالجة رسوميات NVIDIA L4 (بسعة ٢٤ جيجابايت VRAM) قادر على تشغيل نفس النماذج المُكمَّنة (quantized models) التي يمكن لوحدة معالجة رسوميات محلية من نوع RTX 4090 تشغيلها. أما المثيل الأصغر المزوَّد بـ١٦ جيجابايت VRAM فيقتصر على تشغيل نماذج أصغر أو نماذج مُكمَّنة بكثافة أعلى، تمامًا كما هو الحال مع العتاد المحلي. ويمكنك استخدام حاسبة الذاكرة VRAM لتحديد نوع المثيل المناسب لنموذج معين ومستوى الكمّن المطلوب.

التسعير: السحابة مقابل المحلي مقابل خدمات واجهة برمجة التطبيقات (API)

تتفاوت أسعار وحدات المعالجة الرسومية السحابية حسب مقدِّم الخدمة ونوع وحدة المعالجة الرسومية. وفيما يلي أمثلة على أسعار الساعة الواحدة الممثلة اعتبارًا من أوائل عام 2026:

مزود الخدمةوحدة معالجة الرسومات (GPU)ذاكرة VRAMالتكلفة/الساعةمناسب لتشغيل
AWS EC2 g5.xlargeNVIDIA A10G24 جيجابايت~$1.00Llama 3.1 بحجم ٨ مليار معلَّمة، وMistral بحجم ٧ مليار معلَّمة
GCP n1 + T4NVIDIA T416 جيجابايت~$0.50النماذج الأصغر، أو النماذج المُكمَّنة بحجم ٧ مليار معلَّمة
Lambda Labs A10NVIDIA A1024 جيجابايت~$0.60Llama 3.1 بحجم ٨ مليار معلَّمة، وMistral بحجم ٧ مليار معلَّمة
RunPod RTX 4090RTX 409024 جيجابايت~$0.69Llama 3.1 بحجم ٨ مليار معلَّمة، وMistral بحجم ٧ مليار معلَّمة
Azure NC6s v3NVIDIA V10016 جيجابايت~$3.00خيار قديم، وغالبًا ما توجد بدائل أرخص

إذا كنت تشغِّل مثيل سحابي على مدار الساعة طوال أيام الأسبوع، فإن تكلفة المثيل الذي يبلغ سعره ٠٫٦٠ دولار أمريكي لكل ساعة تصل إلى ٤٣٢ دولارًا أمريكيًا شهريًّا أو ٥١٨٤ دولارًا أمريكيًا سنويًّا. أما بطاقة الرسومات المحلية من فئة RTX 4090 (بسعر تقريبي يبلغ ١٦٠٠ دولار أمريكي) فتُحقِّق نقطة التعادل خلال أقل من أربعة أشهر من الاستخدام المتواصل. وتُحلِّل هذه الأداة التكاليف عبر أنماط استخدام مختلفة. حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) وتُحلِّل هذه الأداة التكاليف عبر أنماط استخدام مختلفة.

تنقلب نقطة التعادل اعتمادًا على درجة الاستخدام:

  • الاستخدام الكثيف (٨ ساعات فأكثر يوميًّا): تُغطّي الأجهزة المحلية تكلفتها خلال أشهر قليلة.
  • الاستخدام المتقطِّع (بضعة ساعات أسبوعيًّا): تتفوَّق المثيلات السحابية؛ إذ تدفع فقط مقابل الساعات الفعلية التي تستغل فيها الموارد.
  • أحمال العمل المتقطِّعة (Burst workloads): تتيح لك الخدمات السحابية استئجار وحدة معالجة رسومات عالية الأداء لمهام قصيرة دون الحاجة إلى شرائها.

قارن ذلك بالخدمات المُستضافة عبر واجهات برمجة التطبيقات (API) مثل OpenAI وAnthropic وGroq، والتي تفرض رسومًا على أساس كل رمز (token). بالنسبة إلى Llama 3.1 بسعة 8 مليار معلَّمة التشغيل عبر واجهة برمجة تطبيقات مستضافة، تتراوح الأسعار النموذجية بين ٠٫١٠ و٠٫٣٠ دولار أمريكي لكل مليون رمز إدخال، وبين ٠٫٣٠ و٠٫٦٠ دولار أمريكي لكل مليون رمز إخراج. ويعتمد ما إذا كانت هذه التكلفة أقل من تكلفة تشغيل Ollama سحابيًّا على حجم طلباتك ومتوسط طول الاستجابات التي تحصل عليها. وتُفصِّل هذه الأداة التكاليف حسب النموذج والاستخدام الشهري. حاسبة تكلفة واجهة برمجة التطبيقات (API) وتُفصِّل هذه الأداة التكاليف حسب النموذج والاستخدام الشهري.

الخصوصية والتحكم في البيانات

يعني تشغيل Ollama محليًّا أن مدخلاتك (Prompts)، ونتائج النماذج (model outputs)، وأي وثائق تقوم بمعالجتها لا تغادر جهازك أبدًا. وهذا أمرٌ بالغ الأهمية في القطاعات الخاضعة للتنظيم (مثل الرعاية الصحية والقطاع القانوني والقطاع المالي) أو عند التعامل مع بيانات ملكية.

أما تشغيل Ollama على مثيل سحابي فيُعرِّضك لهذه المخاطر:

  • عبور الشبكة (Network transit): تمرُّ المدخلات (Prompts) والاستجابات بين عميلك والمثيل السحابي، وقد تمر عبر الإنترنت العام ما لم تستخدم شبكة خاصة افتراضية (VPN) أو شبكة خاصة.
  • وصول مقدِّم خدمة السحابة: لدى شركات AWS وGoogle وAzure إمكانية وصول فنية إلى ذاكرة المثيل السحابي (VM) ومحرّكه الصلب. وعلى الرغم من التزامها التعاقدى بعدم فحص بيانات العملاء، فإن احتمال حدوث ذلك لا يزال قائماً.
  • السجلات والبيانات الوصفية (Logs and metadata): تسجِّل شركات تقديم الخدمات السحابية اتصالات الشبكة وطلبات واجهات برمجة التطبيقات الإدارية الخاصة بها وأحداث الفوترة. وتُظهر هذه السجلات متى تقوم بتشغيل استنتاجات نموذجية (inference) ومقدار الموارد الحاسوبية التي تستهلكها، حتى لو لم تكن محتويات المدخلات (prompts) ظاهرة فيها.
  • مقر البيانات (Data residency): يتم تشغيل مثيلك السحابي في منطقة محددة من مناطق AWS أو في منطقة معيَّنة من مناطق Google Cloud Platform (GCP). وإذا كانت إطار عمل الامتثال الخاص بك يفرض قيودًا على موقع البيانات، فيجب عليك اختيار المنطقة وفقًا لذلك.

وإذا كان نموذج التهديد الخاص بك يشمل الجهات الفاعلة من المستوى الوطني (nation-state actors) أو أوامر الاستدعاء الصادرة عن مقدِّمي خدمات السحابة، فإن التشغيل المحلي هو الخيار الوحيد المتاح. أما إذا كنت تسعى لتحقيق أدنى تكلفة وأقصى راحة، وكانت بياناتك غير حساسة، فإن الاستضافة السحابية تظل خيارًا عمليًّا.

متى يجب اختيار الحل السحابي بدلًا من الأجهزة المحلية؟

اختر Ollama سحابي في الحالات التالية:

  • تحتاج إلى الوصول إلى نماذج اللغة الكبيرة (LLMs) لكنك لا تمتلك وحدة معالجة رسومات (GPU)، ولا يمكنك تبرير التكلفة المقدمة لشراء وحدة معالجة رسومات قادرة ($800+).
  • يكون استخدامك متقطِّعًا — بضعة ساعات أسبوعيًّا أو شهريًّا — وتفضِّل الدفع مقابل الموارد الحاسوبية فقط أثناء استخدامك لها.
  • تحتاج إلى التوسُّع المؤقت لمعالجة دفعة كبيرة من المهام، ثم العودة إلى مستوى أقل من الموارد.
  • أنت بصدد إجراء بروتوكولات تجريبية (prototyping) وتريد اختبار أنواع مختلفة من وحدات معالجة الرسومات (مثل ١٦ جيجابايت أو ٢٤ جيجابايت أو ٤٠ جيجابايت) قبل اتخاذ قرار شراء الأجهزة.
  • أنت تبني خدمة تتطلب توافرًا دائمًا (24/7 uptime) وتدعم التكرارية (redundancy)، ولا يمكن تحقيق ذلك بإدارة أجهزة الخوادم الخاصة بك.

اختر Ollama محلي في الحالات التالية:

  • لديك بالفعل وحدة معالجة رسومات تحتوي على ١٢ جيجابايت من الذاكرة (VRAM) أو أكثر، أو أنك على استعداد لشرائها.
  • تقوم بتشغيل عمليات الاستنتاج (inference) يوميًّا لعدة ساعات، وبالتالي تُغطّي تكلفة الأجهزة بسرعة.
  • الخصوصية أمرٌ لا يمكن التنازل عنه — فلا يجوز أن تغادر بياناتك مرافقك أبدًا.
  • تريد أن تكون التكلفة صفرًا لكل طلب، وأن تكون المصروفات متوقَّعة تمامًا.
  • أنت تعمل في وضع عدم الاتصال (offline) أو على شبكة ذات وصول خارجي مقيد.

الـ حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) تتيح لك هذه الأداة إدخال التقدير الشهري المتوقع للاستخدام (عدد ساعات الاستنتاج، وعدد الطلبات، ومتوسط عدد الرموز لكل طلب)، ثم مقارنة تكلفة شراء وحدة معالجة رسومات مقابل استئجار مثيل سحابي مقابل استخدام خدمة واجهة برمجة تطبيقات مستضافة. ولمعظم المطوِّرين الذين يشغلون النماذج بضع ساعات يوميًّا، فإن الأجهزة المحلية تتفوَّق من حيث التكلفة بعد مرور ٣–٦ أشهر.

إعداد أُولاما على مثيل سحابي

وتكون العملية متطابقة عبر جميع مقدِّمي الخدمات: إطلاق مثيل مزوَّد بوحدة معالجة رسومات، والاتصال به عبر بروتوكول SSH، وتثبيت Ollama، وفتح المنفذ ١١٤٣٤.

AWS EC2

  1. قم بإطلاق مثيل من نوع g5.xlarge أو g5.2xlarge (Ubuntu 22.04 LTS، وحدة معالجة رسومات NVIDIA A10G).
  2. اتصل بالمثيل عبر بروتوكول SSH: ssh -i your-key.pem ubuntu@<instance-ip>
  3. ثبِّت Ollama: curl -fsSL https://ollama.com/install.sh | sh
  4. شغِّل Ollama: ollama serve (أو قم بإعداده كخدمة نظام systemd).
  5. حمِّل نموذجًا: ollama pull llama3.1:8b
  6. اضبط مجموعة الأمان (security group) للسماح باتصالات TCP الداخلة عبر المنفذ ١١٤٣٤ من عنوان IP الخاص بك.

منصة Google Cloud Platform

  1. أنشئ جهازًا افتراضيًّا (VM) في خدمة Compute Engine مزوَّدًا بوحدة معالجة رسومات من نوع T4 أو A100 (اختر عائلة أجهزة تدعم وحدات معالجة الرسومات).
  2. اتصل عبر بروتوكول SSH باستخدام واجهة GCP أو gcloud compute ssh.
  3. ثبِّت Ollama: curl -fsSL https://ollama.com/install.sh | sh
  4. شغِّل Ollama: ollama serve
  5. حدّث قواعد الجدار الناري للسماح بمنفذ TCP 11434 من نطاق عناوين IP الخاص بك.

Lambda Labs أو RunPod

  1. استأجر مثيلًا مزوَّدًا ببطاقة رسوميات RTX 4090 أو A10.
  2. اتصل عبر SSH باستخدام بيانات الاعتماد المقدمة.
  3. ثبِّت Ollama: curl -fsSL https://ollama.com/install.sh | sh
  4. ابدأ تشغيل Ollama ونزِّل النماذج كما ورد أعلاه.

للاستخدام الإنتاجي، شغِّل Ollama كخدمة systemd لكي يُعاد تشغيله تلقائيًّا عند إعادة التشغيل، واستخدم وكيل عكسية (مثل Nginx أو Caddy) مع تشفير TLS إذا كنت ستعرِّضه للإنترنت العام.

اعتبارات الأداء

تؤدي المثيلات السحابية إلى إدخال زمن انتقال شبكي. فخادم Ollama المحلي يستجيب في أقل من ٥ مللي ثانية للرمز الأول (بعد تحميل النموذج)، أما المثيل السحابي فيضيف زمن الذهاب والإياب بين جهازك ومراكز البيانات — وهو ما يتراوح عادةً بين ٢٠–٥٠ مللي ثانية داخل نفس المنطقة الجغرافية، و٨٠–١٥٠ مللي ثانية عبر القارات. وفي سياق الدردشة التفاعلية، يكون هذا الفارق محسوسًا لكنه لا يُعطل الأداء. أما بالنسبة لأحمال العمل الدفعية (batch workloads)، فهو ضئيلٌ جدًّا ولا يؤثر عمليًّا.

تعتمد سرعة توليد الرموز على أداء وحدة معالجة الرسوميات (GPU)، وليس على الموقع الجغرافي. فوحدة معالجة الرسوميات A10G في AWS تولِّد الرموز بنفس المعدل الذي تولِّده به وحدة A10G الموجودة على مكتبك. ومع ذلك، قد تؤثر ظاهرة «الجيران المزعجين» (noisy-neighbor effects) في المثيلات السحابية: إذ يمكن لمعظم الأجهزة الافتراضية الأخرى التي تعمل على نفس الخادم المادي أن تُضعف الأداء. وتتفادى المثيلات المخصصة أو استئجار وحدات معالجة رسوميات مادية (bare-metal GPU) هذه المشكلة، لكنها تكلِّف أكثر.

الأسئلة الشائعة

هل توجد خدمة رسمية «Ollama Cloud»؟

حتى أوائل عام ٢٠٢٦، لا تقدِّم منصة Ollama خدمة سحابية مُدارة. أما مصطلح «Ollama cloud» فهو يشير إلى تشغيل خادم Ollama مفتوح المصدر على بنية تحتية سحابية تقوم باستئجارها وإدارتها بنفسك، أو استخدام منصة طرف ثالث تستضيف Ollama نيابةً عنك. ويوفِّر مشروع Ollama البرنامج فقط، بينما توفر أنت أو مقدِّم الخدمة البنية التحتية الحاسوبية.

هل يمكنني استخدام Ollama Cloud بالنماذج نفسها التي أشغلها محليًّا؟

نعم. مكتبة النماذج متطابقة تمامًا. وأي نموذج تُنزِّله باستخدام الأمر ollama pull محليًّا يعمل أيضًا على المثيل السحابي. والقيد الوحيد هو ذاكرة وحدة معالجة الرسوميات (VRAM): تأكَّد من أن وحدة معالجة الرسوميات السحابية لديك تمتلك ذاكرة كافية لتشغيل النموذج ومستوى التكميم (quantization level) الذي تريده. راجع متطلبات ذاكرة VRAM حسب النموذج لمطابقة النماذج بأنواع المثيلات.

كيف أؤمن خادم Ollama عند تشغيله على مثيل سحابي؟

بشكل افتراضي، يستمع Ollama إلى العنوان 127.0.0.1:11434والذي لا يمكن الوصول إليه من خارج الجهاز الافتراضي (VM). ولإتاحته للوصول الخارجي، عيِّن المتغير OLLAMA_HOST=0.0.0.0:11434 قبل بدء الخادم. ثم قيِّد الوصول عبر قواعد الجدار الناري السحابي (مثل مجموعات الأمان في AWS أو قواعد الجدار الناري في GCP) للسماح فقط بعنوان IP الخاص بك أو شبكة VPN الخاصة بك. وللاستخدام الإنتاجي، ضع Ollama خلف وكيل عكسية مزوَّد بتشفير TLS وآليات مصادقة (مثل المصادقة الأساسية عبر HTTP، أو مفاتيح API، أو OAuth). ولا تعرِّض أبدًا خادم Ollama غير الموثوق به (أي دون مصادقة) للإنترنت العام — لأن ذلك يسمح لأي شخص بتشغيل أي نموذج بشكل تعسفي على حسابك.

أيهما أرخص: تشغيل Ollama على وحدة معالجة رسوميات سحابية أم استخدام واجهة برمجة تطبيقات OpenAI؟

يعتمد ذلك على حجم الاستخدام. فلنموذج بحجم ٧ مليار معلَّمة (7B parameter model)، تبلغ تكلفة وحدة معالجة الرسوميات السحابية حوالي ٠٫٥٠–١٫٠٠ دولار أمريكي في الساعة. فإذا ولَّدت ١٠ ملايين رمز في الساعة، تكون التكلفة ٠٫٠٥–٠٫١٠ دولار لكل مليون رمز — وهي أرخص من معظم واجهات برمجة التطبيقات المُستضافة لنماذج مماثلة الحجم. أما إذا ولَّدت مليون رمز فقط في الساعة، فإن تكلفك ستكون ٠٫٥٠–١٫٠٠ دولار لكل مليون رمز، وهي أعلى من تكلفة خدمات واجهات برمجة التطبيقات. كما أن واجهات برمجة التطبيقات المُستضافة تتكفَّل تلقائيًّا بالتوسع، وضمان وقت التشغيل، وتحديث النماذج. ويمكنك استخدام حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لحساب التكلفة المُقدرة لحمل العمل المحدد لديك.

هل يؤدي تشغيل Ollama في السحابة إلى انخفاض خصوصية بياناته؟

نعم، مقارنةً بالاستنتاج الكامل محليًّا. فطلباتك (prompts) ومخرجات النموذج تنتقل عبر الشبكة وتنتهي على جهاز افتراضي تمتلك شركة تقديم الخدمة السحابية صلاحية الوصول الكامل (root access) إليه. فإذا كانت الخصوصية ذات أهمية بالغة — مثل التعامل مع بيانات صحية محمية بموجب قانون HIPAA، أو وثائق قانونية مشمولة بسرية العلاقة بين المحامي وموكله، أو أكواد مملوكة حصريًّا — فعليك تشغيل Ollama محليًّا. أما إذا لم تكن بياناتك حساسة أو كنت تثق بالالتزامات التعاقدية لشركة تقديم الخدمة السحابية، فإن الاستضافة السحابية تمثِّل توازنًا معقولًا بين التكلفة والراحة.

هل يمكنني تشغيل عدة نماذج على مثيل سحابي واحد؟

نعم، طالما أن المثيل يمتلك ذاكرة VRAM كافية لاحتفاظ جميع النماذج في الذاكرة في الوقت نفسه. فـ Ollama يقوم بتحميل النماذج عند الطلب ويحتفظ بها في ذاكرة VRAM حتى تطردها ضغوط الذاكرة. وبذلك، يستطيع مثيل بسعة ٢٤ جيجابايت استيعاب نموذج Llama 3.1 8B (بحجم تقريبي ٨ جيجابايت عند تكميم Q8) ونموذج Mistral 7B (بنفس الحجم تقريبًا) في آنٍ واحد. ويكون التبديل بين النماذج المحملة فوريًّا، أما تحميل نموذج جديد من القرص فيستغرق بضع ثوانٍ.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That