- يتيح لك أولاما تشغيل نماذج الذكاء الاصطناعي مثل Llama وMistral وGemma محليًّا عبر أداة سطر أوامر واحدة
- التثبيت خلال ثوانٍ:
curl https://ollama.com/install.sh | sh(لنظامَي Linux/macOS) أو تنزيل برنامج التثبيت الخاص بنظام Windows - تتطلب النماذج من الفئة المبتدئة ما بين ٤–٨ جيجابايت من ذاكرة VRAM؛ أما النماذج الإنتاجية بحجم ٧٠ مليار معلَّمة (70B) فتتطلب نحو ٤٠ جيجابايت من ذاكرة VRAM عند التكميم بـ ٤ بت
- نقطة التعادل مقارنةً بواجهات برمجة التطبيقات السحابية: نحو ٥٠٠ ألف رمز شهريًّا لنموذج بحجم ٧٠ مليار معلَّمة، وأقل من ذلك للنماذج الأصغر
أولاما أداة سطر أوامر تُعبِّئ نماذج لغة الذكاء الاصطناعي في حاويات يمكنك تشغيلها على عتادك الخاص. بدلًا من إرسال المطالبات إلى OpenAI أو Anthropic أو Google والدفع مقابل كل رمز، تقوم بتنزيل النموذج مرة واحدة—Llama 3.3 70B, Mistral 7B, Phi-4، أو أي من عشرات النماذج المدعومة—ويتم تنفيذ الاستنتاج (inference) بالكامل على وحدة معالجة الرسوميات (GPU) أو وحدة المعالجة المركزية (CPU) الخاصة بك. وبذلك تحتفظ ببياناتك محلّيًّا، ولا تدفع شيئًا مقابل كل طلب بعد تكلفة العتاد الأولية، كما تحتفظ بالتحكم الكامل في سلوك النموذج واستمرارية تشغيله.
المقايضة تكمن في العتاد: فأنت بحاجة إلى كمية كافية من ذاكرة VRAM لاحتواء النموذج. فنموذج بحجم ٧ مليارات معلَّمة (7B) عند تكميمه إلى ٤ بت يتطلب نحو ٤–٥ جيجابايت من ذاكرة GPU، وهي كمية تكفي لبطاقة رسوميات استهلاكية مثل RTX 4060. أما نموذج بحجم ٧٠ مليار معلَّمة (70B) فيحتاج إلى نحو ٤٠ جيجابايت عند التكميم بـ ٤ بت، ما يستلزم بطاقة رسوميات للمحترفين مثل RTX 6000 Ada أو تكوينًا متعدد بطاقات الرسوميات (multi-GPU). وتوضح حاسبة الذاكرة VRAM قاعدة البيانات الخاصة بمتطلبات VRAM
تثبيت أولاما
لينكس
شغّل نص التثبيت الرسمي، الذي يكتشف توزيعة النظام لديك ويُهيئ خدمة أولاما :
curl -fsSL https://ollama.com/install.sh | sh
وهذا يثبت الملف التنفيذي في المسار /usr/local/bin/ollama ويُسجِّل خدمة systemd. وتبدأ الخدمة تلقائيًّا وتصمد أمام إعادة التشغيل. وللتحقق منها:
ollama --version
إذا كنت تعمل وراء وكيل مؤسسي (corporate proxy) أو تحتاج إلى تثبيت يدوي، فقم بتنزيل الملف التنفيذي مباشرةً من إصدارات GitHub ووضعه في مجلد PATH.
macOS
نزّل .dmg برنامج التثبيت من ollama.com/download، افتحه، ثم اسحب أولاما إلى مجلد Applications. وتطبّق تطبيق شريط القوائم الخادم المحلي على localhost:11434. وللاستخدام من Terminal:
ollama --version
يمكن لمستخدمي macOS الذين يستخدمون معالجات Apple Silicon (M1/M2/M3/M4) تشغيل النماذج باستخدام الذاكرة الموحَّدة (unified memory) بدلًا من ذاكرة VRAM المنفصلة. ويمكن لمجموعة Mac Studio ذات الذاكرة الموحَّدة البالغة ١٩٢ جيجابايت أن تستضيف نموذج Llama 4 Maverick (٢٤٠ جيجابايت عند التكميم بـ ٤ بت) عبر التبديل إلى القرص الصلب (swapping to disk)، رغم انخفاض سرعة الاستنتاج بشكل كبير عند تجاوز سعة الذاكرة العشوائية الفعلية (physical RAM).
ويندوز
نزّل OllamaSetup.exe برنامج التثبيت من ollama.com/download وشغّله. ويُضيف برنامج التثبيت ملف ollama.exe إلى متغير البيئة PATH، ويبدأ الخدمة في الخلفية. افتح PowerShell أو Command Prompt للتحقق:
ollama --version
يدعم أولاما نظام Windows Subsystem for Linux (WSL2) مع تمرير وحدة معالجة الرسوميات (GPU passthrough): قم بتثبيت أولاما داخل توزيعة WSL2 الخاصة بك وفق تعليمات نظام Linux، وتأكد من تثبيت برامج تشغيل NVIDIA CUDA على نظام Windows المضيف.
تشغيل أول نموذج لك
نزِّل وشغِّل نموذج Llama 3.1 بحجم ٨ مليار معلَّمة (8B)، وهو نموذج قادر على اتباع التعليمات ويتناسب مع ٥ جيجابايت من ذاكرة VRAM:
ollama run llama3.1:8b
يقوم أولاما بتنزيل النموذج (حوالي ٤,٧ جيجابايت) إلى ~/.ollama/models (لنظامَي Linux/macOS) أو %USERPROFILE%.ollamamodels (لنظام Windows)، ويحمّله في الذاكرة، ثم يضعك في موجه تفاعلي. اكتب رسالة، واضغط Enter، فيُولِّد النموذج ردًّا محليًّا. اضغط على Ctrl+D أو اكتب /bye للخروج.
لتشغيل النموذج في الخلفية والاستعلام عنه عبر واجهة برمجة التطبيقات (API):
ollama serve
وهذا يبدأ خادمًا على http://localhost:11434. وفي نافذة طرفية أخرى:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Explain TCP congestion control",
"stream": false
}'
ويأتي الرد بصيغة JSON مع الإكمال الكامل في حقل response .
اختيار النموذج ومتطلبات ذاكرة VRAM
يدعم أولاما النماذج المفتوحة الوزن (open-weight models) من شركات مثل Meta وMistral AI وMicrosoft وGoogle وAlibaba وغيرها. ويعرض الجدول أدناه خيارات شائعة واحتياجاتها من الذاكرة عند التكميم بـ ٤ بت، مستندًا إلى قاعدة بيانات متطلبات VRAM:
| النموذج | عدد المعايير (البارامترات) | طول السياق | VRAM عند تكميم ٤ بت | الاستخدام |
|---|---|---|---|---|
| Llama 3.1 8B | 8 مليارات معلّمة | 128 ألف رمز | ~5 غيغابايت | اتباع التعليمات العامة، مناسب لبطاقات الرسوميات الاستهلاكية |
| Mistral 7B | ٧ مليارات معلَّمة | 32K | ~4.5 غيغابايت | استنتاج سريع، وتوليد كود جيد |
| Phi-4 | 14 مليار معلّمة | 16 ألف رمز | ~٩ جيجابايت | الاستنتاج والاستدلال الرياضي، فعّال من حيث الحجم |
| Mistral NeMo 12B | 12 مليار معلّمة | 128 ألف رمز | ~7.5 جيجابايت | المهام التي تتطلب سياقًا طويلًا، ومتعدد اللغات |
| Qwen3 8B | 8 مليارات معلّمة | 128 ألف رمز | ~5 غيغابايت | أداء قوي متعدد اللغات، وتنافسي مع النماذج الأكبر حجمًا |
| Gemma 3 4B | 4 مليار | 128 ألف رمز | ~3 جيجابايت | أصغر نموذج عملي يمكن تشغيله على وحدات معالجة الرسومات المدمجة (GPU المدمجة) |
| Llama 3.3 70B | 70 مليار معلَّمة | 128 ألف رمز | ~40 جيجابايت | نموذج استنتاجي جاهز للإنتاج، يُنافس فئة GPT-4 |
| DeepSeek R1 Distill Llama 70B | 70 مليار معلَّمة | 128 ألف رمز | ~40 جيجابايت | نموذج استنتاجي مُكثَّف، يؤدي أداءً ممتازًا في مجالات العلوم والتقنية والهندسة والرياضيات (STEM) |
لعرض قائمة جميع النماذج المتاحة على نظامك:
ollama list
لحذف نموذج ما وتحرير مساحة على القرص الصلب:
ollama rm llama3.1:8b
تتبع علامات النماذج التنسيق التالي: الاسم:الحجم أو الاسم:الإصدار. ويُفترض افتراضيًّا استخدام العلامة :latest. راجع الفهرس الكامل على أفضل نماذج اللغة المحلية (LLMs) لـ Ollama.
أوامر شائعة وإعدادات التهيئة
تشغيل نموذج باستخدام معايير مخصصة:
ollama run llama3.1:8b --temperature 0.7 --top-p 0.9
إدخال المُحفِّز (prompt) مباشرةً دون الدخول إلى الوضع التفاعلي:
ollama run llama3.1:8b "اكتب دالة بايثون لتحليل تواريخ ISO 8601"
تحميل نموذج إلى الذاكرة دون عرض مُحفِّز (مفيد لتسخين النموذج قبل خدمة الطلبات):
ollama pull llama3.1:8b
التحقق من النماذج التي تم تحميلها حاليًّا في ذاكرة VRAM:
ollama ps
تعيين عدد طبقات وحدة معالجة الرسومات التي سيتم تفريغها (مفيد عند التفريغ الجزئي لوحدة معالجة الرسومات في حال كانت ذاكرة VRAM محدودة):
OLLAMA_NUM_GPU=35 ollama run llama3.3:70b
افتراضيًّا، يقوم Ollama بتفريغ جميع الطبقات إلى وحدة معالجة الرسومات. أما تقليل قيمة OLLAMA_NUM_GPU فيبقي بعض الطبقات على وحدة المعالجة المركزية (CPU)، مما يُضحّي بالسرعة مقابل خفض استهلاك ذاكرة VRAM. وقد يحتاج نموذج 70B مع 20 طبقة على وحدة معالجة الرسومات إلى 20 غيغابايت فقط من ذاكرة VRAM، لكن سرعته قد تنخفض بنسبة 3–5 أضعاف.
لتغيير دليل تخزين النماذج، عيِّن المتغير OLLAMA_MODELS قبل التشغيل:
export OLLAMA_MODELS=/mnt/nvme/ollama_models ollama pull llama3.1:8b
يستخدم Ollama ملفات مُخطَّطة في الذاكرة (memory-mapped files)، لذا فإن النماذج تُحمَّل أسرع من وحدات التخزين NVMe مقارنةً بوحدات التخزين SATA SSD. وتتوقع أن يستغرق تحميل نموذج 8B حوالي 10–15 ثانية على نظامٍ حديث، بينما يستغرق تحميل نموذج 70B من 60 إلى 90 ثانية.
متطلبات الأجهزة
العامل المحدِّد هو ذاكرة VRAM وليس القدرة الحاسوبية. فنموذج 70B مكمَّن بـ 4 بت يحتاج إلى 40 غيغابايت من ذاكرة وحدة معالجة الرسومات، لكنه يعمل بشكل كافٍ على معمارية الجيل السابق. ويمكن لبطاقة RTX 3090 (24 غيغابايت) خدمة نموذجين 8B أو نموذج واحد 30B. أما بطاقة RTX 4090 (24 غيغابايت) فتتعامل مع نفس النماذج بزيادة أداء تتراوح بين 30% و40% بفضل تحسُّن نوى التنسور في معمارية Ada Lovelace.
وحدات معالجة الرسومات الموصى بها حسب الميزانية:
- المستوى المبتدئ (300–500 دولار أمريكي): RTX 4060 Ti بسعة 16 غيغابايت تتعامل بسلاسة مع نماذج 8B و12B
- المستوى شبه الاحترافي (1000–1500 دولار أمريكي): RTX 4090 أو A4000 Ada تعمل بسلاسة مع نماذج 30B
- المحطات الطرفية (Workstation) (4000–7000 دولار أمريكي): RTX 6000 Ada (48 غيغابايت) أو زوج من بطاقات RTX 4090 لتشغيل نماذج 70B
- الخدمة المتعددة النماذج (أكثر من 10 آلاف دولار أمريكي): A100 بسعة 80 غيغابايت أو H100 بسعة 80 غيغابايت لتشغيل عدة نسخ من نماذج 70B
اطّلع على دليل شراء وحدات معالجة الرسومات لمقارنات مفصلة. ويستفيد مستخدمو رقائق أبل Silicon من الذاكرة الموحَّدة: إذ يمكن لمُعالج M2 Ultra بسعة 192 غيغابايت تشغيل نماذج تتطلب عادةً إعدادات NVIDIA بتكلفة 25 ألف دولار أمريكي، رغم أن معدل إنتاج الرموز (token throughput) يكون أقل بنسبة 2–3 أضعاف مقارنةً ببطاقة A100.
مقارنة التكاليف: التشغيل المحلي مقابل واجهات برمجة التطبيقات
تفرض واجهات برمجة التطبيقات السحابية (Cloud APIs) رسومًا لكل رمز (token). Claude Sonnet 5 تكلف 2.00 دولار أمريكي لكل مليون رمز إدخال و10.00 دولارات أمريكية لكل مليون رمز إخراج. وتولِّد جلسة نموذجية لمساعد البرمجة 500 ألف رمز شهريًّا (250 ألف رمز إدخال و250 ألف رمز إخراج)، وبذلك تكون التكلفة السنوية 3000 دولار أمريكي.
أما نموذج Llama 3.3 70B الذي يتم استضافته ذاتيًّا على محطة عمل بتكلفة 6000 دولار أمريكي (RTX 6000 Ada) فلا يترتَّب عليه أي تكلفة هامشية بعد شراء الأجهزة. ونقطة التعادل تقع عند نحو 500 ألف رمز شهريًّا. فإذا كان الاستخدام أقل من ذلك، تكون الواجهات السحابية أرخص؛ وإذا تجاوزه، يصبح الاستنتاج المحلي أكثر فعالية من حيث التكلفة. استخدم حاسبة الاستضافة الذاتية لحساب التكلفة المُقدرة لحمل العمل المحدد لديك.
وتبلغ نقطة التعادل مع النماذج الأصغر حجمًا وقتًا أقصر. فنموذج 8B يعمل على بطاقة RTX 4060 Ti بتكلفة 500 دولار أمريكي يُغطي تكلفته خلال 3–4 أشهر مقارنةً بالواجهات السحابية عند الاستخدام المعتدل (100 ألف رمز شهريًّا). والميزة الإضافية هي الخصوصية: لا تغادر أكوادك ومستنداتك وبياناتك الداخلية شبكتك أبدًا.
الأسئلة الشائعة
هل يمكن لأولاما تشغيل النماذج على وحدة المعالجة المركزية (CPU) فقط؟
نعم، لكن سرعة الاستنتاج تكون أبطأ بعشرة إلى خمسين مرة حسب حجم النموذج. فنموذج 8B يولِّد 1–3 رموز في الثانية على معالج Ryzen أو Intel حديث، مقارنةً بـ 40–80 رمزًا في الثانية على بطاقة RTX 4090. ولفرض التشغيل على وحدة المعالجة المركزية فقط، عيِّن OLLAMA_NUM_GPU=0 وهذا مناسب للمعالجة الدفعية أو الاستخدامات ذات الحركة المرورية المنخفضة، لكنه غير عملي للدردشة التفاعلية.
كيف تؤثر التكميم (Quantization) على الجودة؟
يقلل التكمين بـ 4 بت حجم النموذج بنسبة 75% مع خسارة ضئيلة جدًّا في الجودة — وتظهر الاختبارات انخفاضًا في الدقة يتراوح بين 1% و3% على مقاييس MMLU وHumanEval مقارنةً بالتمثيل FP16. أما التكمين بـ 3 بت (Q3) فيقلل الحجم أكثر، لكنه يُضعف القدرة على الاستنتاج واتباع التعليمات بشكل ملحوظ. ويستخدم Ollama افتراضيًّا التنسيق Q4_0 الذي يوازن بين الجودة واستهلاك ذاكرة VRAM. ويمكنك سحب إصدارات 8 بت أو FP16 عبر تحديد علامات مثل llama3.1:8b-q8_0، مما يضاعف متطلبات ذاكرة VRAM.
هل يمكنني ضبط النماذج بدقة باستخدام أولاما؟
لا. فـ Ollama هو بيئة تشغيل للاستنتاج (inference runtime) وليس إطار عمل للتدريب. ولضبط النموذج (fine-tuning)، استخدم أدوات مثل Hugging Face Transformers أو Axolotl أو LLaMA Factory، ثم صدِّر النتيجة بصيغة GGUF واستورد النموذج إلى Ollama عبر ملف Modelfile. وثمة توثيق مفصَّل لهذه العملية في مستودع GitHub الخاص بـ Ollama ضمن docs/import.md.
ما هي واجهة برمجة تطبيقات أولاما (Ollama API) وكيف أستخدمها؟
يقدِّم Ollama واجهة برمجة تطبيقات REST متوافقة مع OpenAI على localhost:11434. وكتلة /api/generate ويعالج هذا النهاية (endpoint) عمليات الإكمال، بينما /api/chat يدعم المحادثات متعددة الدورات مع سجل الرسائل. ويمكنك دمجه في قواعد الكود الموجودة لديك عبر تغيير عنوان URL الأساسي: بدلًا من https://api.openai.com/v1, point your client to http://localhost:11434تتمتع العديد من الإطارات مثل LangChain وLlamaIndex بدعم أصلي لـ Ollama.
كم عدد الطلبات في الثانية التي يمكن لأولاما التعامل معها؟
يُخدم نموذج واحد محمل حاليًا طلبًا واحدًا في كل مرة. ويعتمد معدل الإنتاجية (Throughput) على حجم النموذج والعتاد المستخدم: فعلى سبيل المثال، تُولِّد بطاقات الرسوميات RTX 4090 ما بين ٦٠–٨٠ رمزًا/ثانية لنماذج بحجم ٨ مليار معلَّمة (8B)، وما بين ١٥–٢٥ رمزًا/ثانية لنماذج بحجم ٧٠ مليار معلَّمة (70B). ولخدمة مستخدمين متزامنين، يمكنك إما التوسع الأفقي (باستخدام عدة أجهزة) أو استخدام التجميع (batching) على مستوى التطبيق. ولا يحتوي أولاما على نظام انتظار طلبات مدمج؛ لذا ستحتاج إلى وسيط عكسي مثل NGINX أو موازن حمل.
هل يمكنني تشغيل عدة نماذج في وقتٍ واحد؟
نعم، إذا كانت لديك ذاكرة VRAM كافية. فحمل نموذجًا ثانيًا باستخدام الأمر ollama run في نافذة طرفية جديدة بينما يعمل النموذج الأول. ويشارك Ollama وحدة معالجة الرسومات بين النماذج. ويمكن لنموذجين 8B (إجمالي 10 غيغابايت) العمل بسلاسة على بطاقة RTX 4090 بسعة 24 غيغابايت. أما التبديل بين النماذج فيكون شبه فوري إذا كان كلا النموذجين محملين مسبقًا؛ وإلا فتتوقع أوقات تحميل تتراوح بين 10 و90 ثانية حسب حجم النموذج.

