Friday, 14 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

أولاما GPT OSS: تشغيل نماذج اللغة الكبيرة مفتوحة المصدر محليًّا (دليل)

باختصار

  • لم تُصدر شركة OpenAI عائلة نماذج باسم «GPT-OSS». وربما يشير مصطلح البحث هذا إلى تشغيل بدائل مفتوحة المصدر (مثل Llama 3 وMistral وQwen) عبر منصة Ollama.
  • تُشغِّل منصة Ollama مئات النماذج ذات الأوزان المفتوحة محليًّا. ومن الخيارات الشائعة ما يلي: ollama pull llama3.1:8b, ollama pull mistral:7b, ollama pull qwen2.5:7b.
  • احتياجات الذاكرة VRAM: تتطلب النماذج ذات الحجم 7 مليار معلَّمة (7B) ما بين 6–8 جيجابايت عند استخدام التكميم Q4، بينما تتطلب النماذج ذات الحجم 13 مليار معلَّمة (13B) ما بين 10–14 جيجابايت، أما النماذج ذات الحجم 70 مليار معلَّمة (70B) فتحتاج إلى ما بين 40–48 جيجابايت. ويمكنك استخدام حاسبة الذاكرة VRAM لتقدير هذه الاحتياجات.
  • تناسب النماذج المكمَّمة (Q4، Q5) بطاقات الرسومات الاستهلاكية مع خسارة طفيفة جدًّا في الجودة. أما التنسيق FP16 فيقدِّم أفضل جودة لكنه يضاعف متطلبات الذاكرة VRAM.

إذا كنت قد بحثت عن عبارة «ollama gpt oss»، فمن المرجح أنك ترغب في تشغيل نماذج لغوية كبيرة مفتوحة المصدر محليًّا باستخدام منصة Ollama — لكن شركة OpenAI لم تُصدِر عائلة نماذج ذات أوزان مفتوحة باسم «GPT-OSS». فقد أصدرت الشركة نموذج GPT-2 عام 2019 كنموذج ذي أوزان مفتوحة، لكن نماذجها الحديثة (مثل GPT-4 وGPT-4o وGPT-4.1) تظل حصريةً للوصول عبر واجهة برمجة التطبيقات (API) دون إتاحتها كأوزان مفتوحة. أما ما لا موجودٌ فعلاً فهو مئات النماذج ذات الأوزان المفتوحة الصادرة عن شركات مثل Meta (Llama) وMistral AI وAlibaba (Qwen) وغيرها، والتي يمكنك تنزيلها وتشغيلها عبر منصة Ollama على أجهزتك الخاصة. ويغطي هذا الدليل النماذج المتوافقة، ومتطلبات الذاكرة VRAM لكل حجم منها، وكيف يؤثر التكميم على الجودة، بالإضافة إلى مقارنة أداء هذه النماذج.

ما تُشغِّله منصة Ollama فعليًّا

Ollama هي محرك استنتاج محلي يقوم بتنزيل النماذج اللغوية الكبيرة ذات الأوزان المفتوحة وتكميمها وتشغيلها على أنظمة التشغيل macOS وLinux وWindows. وهي لا تستضيف نماذج OpenAI. وتشمل قائمة النماذج قائمة نماذج Ollama Llama 3.1 و Mistral 7BوQwen 2.5 وGemma 2 وPhi-3، فضلًا عن عشرات النماذج الأخرى. وكل نموذج متاح بعدة مستويات تكميم (مثل Q4_K_M وQ5_K_M وFP16) للتماهي بين متطلبات الذاكرة VRAM وجودة الأداء.

خطوات التثبيت الكاملة: كيفية تثبيت منصة Ollama.

عائلات النماذج مفتوحة المصدر المتاحة في منصة Ollama

عائلة النموذجالمطوّرأحجام المُعلَّماتالترخيصمميزاته البارزة
Llama 3.1ميتا8 مليار، 70 مليار، 405 مليارات معلَّمةLlama 3.1 (مرخص تجاريًّا)أفضل أداء عام في التفكير والاستنتاج ضمن كل فئة حجم
Mistralميسترال إيه آي7 مليار، 22 مليار معلَّمة (Mixtral 8x7B)Apache 2.0سريع وكفء وقوي في برمجة الحاسوب
Qwen 2.5علي بابا0.5 مليار، 1.5 مليار، 3 مليارات، 7 مليارات، 14 مليار، 32 مليار، 72 مليار معلَّمةApache 2.0متعدد اللغات، ويدعم سياقات طويلة جدًّا (حتى 128 ألف رمز)
Gemma 2جوجل2 مليار، 9 مليارات، 27 مليار معلَّمةGemma (مرخص تجاريًّا)صغير الحجم وسريع، ويمكن تشغيله على وحدة المعالجة المركزية (CPU)
Phi-3.5مايكروسوفت3.8 مليار معلَّمة (نسخة Mini)، 14 مليار معلَّمة (نسخة Medium)MITمدمج بكفاءة عالية وأداء قوي في مقاييس التفكير والاستنتاج

الـ قاعدة بيانات نماذج الذكاء الاصطناعي تضمّن القائمة المواصفات ومتطلبات الذاكرة VRAM وأسعار 37 نموذجًا، بما في ذلك جميع النماذج المذكورة أعلاه.

تنزيل النموذج وتشغيله

بعد تثبيت منصة Ollama، يمكنك تنزيل نموذج باستخدام الأمر ollama pull <model>:<tag>حيث يحدّد العلامة (tag) عدد المُعلَّمات ومستوى التكميم. ومن الأمثلة على ذلك:

ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9b

لتشغيل النموذج:

ollama run llama3.1:8b

وهذا يفتح جلسة دردشة تفاعلية. اكتب موجهك (prompt)، ثم اضغط Enter ليُولِّد النموذج ردًّا محليًّا. ولإنهاء الجلسة، اكتب /bye.

للاستخدام البرمجي للنموذج عبر واجهة برمجة التطبيقات (API):

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "اشرح مفهوم التكرار (recursion) في جملة واحدة."
}'

توفر منصة Ollama نقطة نهاية (endpoint) متوافقة مع واجهة برمجة تطبيقات OpenAI /v1/chat/completions لذلك يمكنك توجيه كود SDK الخاص بـ OpenAI الموجود لديك نحو http://localhost:11434 واستبدال النموذج السحابي بنموذج محلي.

أحجام المُعلَّمات ومتطلبات الذاكرة VRAM

يحدد حجم النموذج (7B أو 13B أو 70B) كلاً من جودته واحتياجاته من الذاكرة VRAM. فالنماذج الأكبر تتفوق في التفكير والاستنتاج لكنها تتطلب ذاكرة GPU أكبر. أما التكميم (Q4 أو Q5 أو FP16) فيُقلِّص حجم الأوزان لتخفيف متطلبات الذاكرة VRAM مع خسارة طفيفة في الجودة.

عدد المُعلَّماتالتكميةالذاكرة VRAM (تقريبيًّا)نماذج توضيحيةتوصية بالوحدة الرسومية (GPU)
٧ مليارات معلَّمةQ4_K_M4.5 جيجابايتLlama 3.1 بحجم ٨ مليار معلَّمة، وMistral بحجم ٧ مليار معلَّمةRTX 3060 (12 جيجابايت)، RTX 4060 Ti (16 جيجابايت)
٧ مليارات معلَّمةQ5_K_M5.5 جيجابايتكما ورد أعلاهنفسه
٧ مليارات معلَّمةFP1614 جيجابايتكما ورد أعلاهRTX 4060 Ti (16 جيجابايت)، RTX 4070
13 مليار معلمةQ4_K_M8 جيجابايتQwen 2.5 14B، Phi-3.5 14BRTX 3060 (12 جيجابايت)، RTX 4060 Ti (16 جيجابايت)
13 مليار معلمةFP1626 جيجابايتنفسهRTX 4090 (24 جيجابايت) أو A5000 (24 جيجابايت)
70 مليار معلَّمةQ4_K_M40 جيجابايتLlama 3.1 70B، Qwen 2.5 72BA100 (40/80 جيجابايت)، أو زوج من وحدات RTX 3090 (إجمالي 48 جيجابايت)
70 مليار معلَّمةFP16140 جيجابايتنفسهإعداد متعدد الوحدات الرسومية (Multi-GPU) أو وحدة A100 بسعة 80 جيجابايت

استخدم حاسبة الذاكرة VRAM لتقدير احتياجات الذاكرة لأي نموذج ومستوى تكميم (Quantization). إنها دليل متطلبات الذاكرة VRAM تسرد قيماً دقيقةً لكل نموذج رئيسي.

لمعرفة التوصيات الخاصة بشراء وحدات GPU، راجع أفضل وحدات معالجة الرسومات لتشغيل النماذج اللغوية الكبيرة محليًّا.

التكميم: المفاضلة بين الجودة وسعة الذاكرة VRAM

يقلل التكميم دقة أوزان النموذج من الأعداد العشرية ذات الدقة المزدوجة (FP16) إلى أعداد صحيحة ذات 4 أو 5 بت (Q4، Q5). ويؤدي هذا إلى خفض ذاكرة VRAM بنسبة 60–75% مع فقدان ضئيل في الجودة لمعظم المهام.

  • Q4_K_M: تكميم 4 بت. أقل استهلاك ممكن لذاكرة VRAM، مع انخفاض طفيف في الجودة عند تنفيذ مهام الاستنتاج المعقدة. مناسب جدًا لروبوتات الدردشة وملخّصات النصوص وإكمال الشيفرات البرمجية.
  • Q5_K_M: تكميم 5 بت. يستهلك ذاكرة VRAM أكثر بنسبة ~20% مقارنةً بـ Q4، ويقترب جودته من جودة FP16. وهو أفضل توازن يُوصى به لمعظم المستخدمين.
  • Q8_0: تكميم 8 بت. جودته قريبة جداً من جودة FP16، مع خفض بنسبة 50% في استهلاك VRAM. استخدمه إذا كانت لديك هامش كافٍ في سعة VRAM.
  • FP16: دقة كاملة. أفضل جودة ممكنة، لكنها تتطلب ضعف كمية VRAM المطلوبة في حالة Q4. وتُستخدم فقط في الأبحاث أو عندما يكون الانخفاض في الجودة غير مقبول على الإطلاق.

مثال: Llama 3.1 بسعة 8 مليار معلَّمة النموذج عند مستوى التكميم Q4_K_M يستهلك 4.5 جيجابايت ويحقّق نتيجة 67.2 في اختبار MMLU. أما عند الدقة الكاملة (FP16) فيستهلك 14 جيجابايت ويحقّق نتيجة 68.1 في نفس الاختبار. وللأغراض العملية فإن الفارق البالغ 0.9 نقطة لا يُلاحظ عادةً.

لتنزيل مستوى تكميم معيّن:

ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16

إذا لم تُحدّد علامة التكميم صراحةً، فإن Ollama يفترض افتراضياً استخدام Q4_K_M.

مقارنة الأداء: الفئة ذات الحجم 7 مليار معلَّمة (7B)

فئة النماذج ذات الحجم 7B–8B هي الأكثر شيوعاً للاستخدام المحلي. فهي تتوافق مع وحدات GPU الاستهلاكية وتحقق أداءً قوياً في مجالات البرمجة والاستنتاج والدردشة.

النموذجMMLU (بدون أمثلة تمهيدية - zero-shot)HumanEval (pass@1)طول السياقVRAM (عند التكميم Q4)
Llama 3.1 بسعة 8 مليار معلَّمة67.262.2128 ألف رمز4.5 جيجابايت
ميسترال 7B v0.362.540.232 ألف رمز4.1 جيجابايت
كوين 2.5 بسعة 7 مليارات معلّمة70.361.6128 ألف رمز4.3 جيجابايت
Gemma 2 9B71.361.08 آلاف رمز5.2 جيجابايت

يتصدّر كلٌّ من Qwen 2.5 7B وGemma 2 9B قائمة MMLU (المعرفة العامة)، بينما يتصدّر Llama 3.1 8B قائمة HumanEval (البرمجة). أما Mistral 7B فهو الأسرع من حيث الأداء، وأكثرها مرونة من حيث الترخيص (ترخيص Apache 2.0). وقائمة لوحة تصنيف النماذج اللغوية الكبيرة (LLM) تصنّف جميع النماذج حسب الذكاء والسعر وطول السياق.

أي نموذج يجب أن تختاره؟

  • أفضل جودة شاملة (في فئة 7B): ollama pull qwen2.5:7b أو ollama pull llama3.1:8b
  • الأفضل للبرمجة: ollama pull llama3.1:8b أو ollama pull qwen2.5-coder:7b
  • أسرع استنتاج: ollama pull mistral:7b أو ollama pull gemma2:2b (للتشغيل على وحدة المعالجة المركزية CPU أو وحدات GPU ذات سعة VRAM محدودة)
  • متعدد اللغات: ollama pull qwen2.5:7b (يدعم 29 لغة)
  • الوثائق الطويلة (سياق 128 ألف رمز فأكثر): ollama pull llama3.1:8b أو ollama pull qwen2.5:7b
  • أقوى أداء في الاستنتاج (إذا كانت لديك سعة VRAM تبلغ 40 جيجابايت فأكثر): ollama pull llama3.1:70b أو ollama pull qwen2.5:72b

الـ أفضل نماذج اللغة المحلية (LLMs) لـ Ollama الدليل يقيّم أداء جميع النماذج ويوصي بعلامات محددة حسب كل حالة استخدام.

متى تُفضِّل الاستضافة الذاتية مقابل استخدام واجهة برمجة التطبيقات (API)؟

من المنطقي تشغيل Ollama محلياً إذا كنت:

  • تمتلك بالفعل وحدة GPU بسعة VRAM تبلغ 12 جيجابايت فأكثر (مثل RTX 3060 أو RTX 4060 Ti أو ما هو أفضل)
  • تعالج بيانات حساسة لا يمكن أن تخرج عن شبكتك الداخلية
  • تولّد أكثر من 5 ملايين رمز شهرياً (حيث تتجاوز تكلفة واجهات برمجة التطبيقات API تكلفة امتلاك الخادم داخلياً TCO)
  • تحتاج إلى توفر دائم مضمون وخالية من حدود التكرار (rate limits)

استخدم واجهة برمجة تطبيقات مستضافة (مثل OpenAI أو Anthropic أو Groq) إذا:

  • أنت تُولِّد أقل من مليون رمز شهريًّا (ويعود استرداد تكلفة وحدة معالجة الرسومات المُستضافة ذاتيًّا بعد سنوات عديدة)
  • تحتاج إلى أعلى جودة ممكنة (فطرازَي Claude 3.5 Sonnet وGPT-4o يتفوقان على جميع النماذج المفتوحة)
  • لا ترغب في إدارة بنية تحتية الاستنتاج بنفسك

الـ حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) تُقدِّر هذه الأداة نقطة التعادل استنادًا إلى حجم الرموز الذي تستخدمه، وتكلفة وحدة معالجة الرسومات، ومعدَّل تكلفة الكهرباء. وتُظهر حاسبة تكلفة واجهة برمجة التطبيقات (API) الإنفاق الشهري المُقدَّر لكل نموذج.

ملاحظات خاصة بكل نظام تشغيل

macOS

يستخدم Ollama تقنية Metal لتسريع أداء وحدة معالجة الرسومات على أجهزة ماك المزوَّدة بمعالجات M1/M2/M3. وبفضل الذاكرة الموحَّدة، فإن سعة ذاكرة VRAM تساوي سعة ذاكرة النظام RAM. وعلى سبيل المثال، يمكن لجهاز M2 Max المزوَّد بـ64 غيغابايت تشغيل النموذج Llama 3.1 70B عند كمية التكميم Q4 (40 غيغابايت) مع ترك هامش كافٍ لتشغيل نظام التشغيل. ويمكن تثبيته عبر Homebrew كما يلي:

brew install ollama

ابدأ الخدمة باستخدام الأمر التالي:

ollama serve

لينكس

يتطلب Ollama وحدات معالجة رسومات من شركة NVIDIA مدعومة بـCUDA 11.8 أو أحدث، أو وحدات معالجة رسومات من شركة AMD مدعومة بـROCm 5.7 أو أحدث. ولتثبيته، استخدم الأمر التالي:

curl -fsSL https://ollama.com/install.sh | sh

وهذا يثبت الملف التنفيذي في المسار /usr/local/bin/ollama ويُنشئ خدمة systemd. ولبدء الخدمة، استخدم الأمر التالي:

sudo systemctl start ollama

تنزَّل النماذج إلى الدليل ~/.ollama/models. ولتغيير موقع التخزين، عيِّن المتغير البيئي OLLAMA_MODELS=/path/to/models في /etc/systemd/system/ollama.service.

ويندوز

يتطلب إصدار Ollama الخاص بنظام Windows وحدات معالجة رسومات من شركة NVIDIA مدعومة بـCUDA 11.8 أو أحدث، ومعالج رسومات ببرنامج تشغيل إصدار 520 أو أحدث. ويمكنك تنزيل ملف التثبيت من الموقع ollama.com ثم تشغيله. وتبدأ الخدمة تلقائيًّا عند التثبيت. أما النماذج فتنزَّل افتراضيًّا إلى الدليل C:\Users\\.ollama\models.

ولتشغيل Ollama من PowerShell، استخدم الأمر التالي:

ollama run llama3.1:8b

الأسئلة الشائعة

هل تقدِّم شركة OpenAI نموذجًا مفتوح المصدر يمكنني تشغيله عبر Ollama؟

كلا. فقد أطلقت شركة OpenAI نموذج GPT-2 عام 2019 كنموذج مفتوح الوزن (open-weight)، لكن جميع النماذج الحديثة (مثل GPT-3.5 وGPT-4 وGPT-4o وo1) هي نماذج مملوكة بالكامل ولا تتوفر إلا عبر واجهة برمجة التطبيقات (API). وإذا كنت تبحث عن قدرة استنتاج مماثلة لـOpenAI يمكنك تشغيلها محليًّا، فجرِّب النموذجين Llama 3.1 70B أو Qwen 2.5 72B — وكلاهما يتفوق على GPT-3.5 في معظم الاختبارات، ويمكن تشغيلهما عبر Ollama باستخدام 40 غيغابايت من VRAM عند كمية التكميم Q4.

هل يمكنني تشغيل Ollama على وحدة معالجة مركزية (CPU) دون وجود وحدة معالجة رسومات (GPU)؟

نعم، لكن سرعة الاستنتاج ستكون أبطأ بعشرة إلى خمسين مرة. فالنماذج الصغيرة (مثل Gemma 2 2B وQwen 2.5 0.5B وPhi-3.5 mini 3.8B) يمكن استخدامها بكفاءة على وحدات المعالجة المركزية الحديثة (المزوَّدة بـ16 خيط معالجة أو أكثر). أما النماذج الأكبر (7 مليار معلَّمة فأكثر) فستولِّد فقط 1–3 رموز في الثانية عند التشغيل على وحدة المعالجة المركزية، وهي سرعة بطيئة جدًّا للتفاعل المباشر. فإذا لم تكن تمتلك وحدة معالجة رسومات، فننصحك باستخدام واجهة برمجة تطبيقات مستضافة بدلًا من ذلك — راجع قسم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API).

ما تكلفة تشغيل Ollama مقارنةً بتكلفة استخدام واجهة برمجة تطبيقات OpenAI؟

تفرض شركة OpenAI رسومًا قدرها 0.15 دولار أمريكي لكل مليون رمز مدخل و0.60 دولار أمريكي لكل مليون رمز مخرج عند استخدام نموذج GPT-4o mini. أما وحدة معالجة الرسومات بسعة 12 غيغابايت (مثل RTX 4060 Ti التي تبلغ تكلفتها 400 دولار أمريكي) عند تشغيل نموذج Llama 3.1 8B، فهي تستهلك طاقةً بمعدل 0.05 دولار أمريكي في الساعة (وبافتراض سعر الكهرباء 0.12 دولار أمريكي لكل كيلوواط ساعة، واستهلاك النظام الكلي 400 واط). وتتراوح نقطة التعادل بين 3–5 ملايين رمز شهريًّا. وتُظهر أداة حاسبة تكلفة واجهة برمجة التطبيقات (API) و حاسبة الاستضافة الذاتية التكلفة الإجمالية الفعلية (TCO) وفقًا لاستخدامك الشخصي.

ما الفرق بين التنسيقات Q4_K_M وQ5_K_M وFP16؟

يستخدم التنسيق Q4_K_M تكميمًا بعرض 4 بت (أقل استهلاك لسعة VRAM، مع انخفاض طفيف في الجودة). أما التنسيق Q5_K_M فيستخدم تكميمًا بعرض 5 بت (يستهلك 20% أكثر من VRAM، ويقارب الجودة الكاملة بشكل أكبر). أما التنسيق FP16 فهو دقة كاملة بعرض 16 بت (أعلى جودة ممكنة، لكنه يستهلك ضعف سعة VRAM المطلوبة في حالة Q4). وللأغراض العملية العادية، يُعَد Q5_K_M أفضل توازن بين الجودة والأداء. أما التنسيق FP16 فيُوصى باستخدامه فقط إذا كانت لديك سعة VRAM زائدة، وتحتاج إلى تحقيق آخر 1–2% من الجودة لأغراض البحث أو الإنتاج.

هل يمكنني ضبط النماذج (fine-tune) ضمن Ollama؟

كلا. فـOllama هو محرك استنتاج فقط، وليس إطار عمل تدريب. ولضبط نموذج مفتوح المصدر، استخدم مكتبة Hugging Face Transformers مع تقنيات PEFT/LoRA أو أدوات Axolotl أو LLaMA Factory. ثم صدِّر الأوزان المُعدَّلة بصيغة GGUF واستوردها إلى Ollama باستخدام الأمر ollama create. وكتلة الدليل الكامل لـ Ollama ويشرح هذا الدليل سير العمل بالتفصيل.

ما وحدة معالجة الرسومات الأنسب لتشغيل النماذج بحجم 7 مليار معلَّمة محليًّا؟

للكمية Q4 للتكميم (4.5 غيغابايت VRAM): RTX 3060 بسعة 12 غيغابايت (بسعر 250 دولارًا أمريكيًّا مستعملة) أو RTX 4060 Ti بسعة 16 غيغابايت (بسعر 450 دولارًا أمريكيًّا جديدة). وللكمية FP16 (14 غيغابايت VRAM): RTX 4060 Ti بسعة 16 غيغابايت أو RTX 4070 (بسعر 550–600 دولار أمريكي). ولتشغيل النماذج بحجم 70 مليار معلَّمة عند كمية التكميم Q4 (40 غيغابايت): يمكن استخدام بطاقتي RTX 3090 بسعة 24 غيغابايت لكل منهما (بسعر 1800 دولار أمريكي مستعملة) أو وحدة A100 بسعة 40 غيغابايت (بسعر 6000 دولار أمريكي أو أكثر، مستعملة). ويقدِّم الدليل أفضل وحدات معالجة الرسومات مقارنةً مفصلةً بين السعر والأداء لكل فئة حجم.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That