- لم تُصدر شركة OpenAI عائلة نماذج باسم «GPT-OSS». وربما يشير مصطلح البحث هذا إلى تشغيل بدائل مفتوحة المصدر (مثل Llama 3 وMistral وQwen) عبر منصة Ollama.
- تُشغِّل منصة Ollama مئات النماذج ذات الأوزان المفتوحة محليًّا. ومن الخيارات الشائعة ما يلي:
ollama pull llama3.1:8b,ollama pull mistral:7b,ollama pull qwen2.5:7b. - احتياجات الذاكرة VRAM: تتطلب النماذج ذات الحجم 7 مليار معلَّمة (7B) ما بين 6–8 جيجابايت عند استخدام التكميم Q4، بينما تتطلب النماذج ذات الحجم 13 مليار معلَّمة (13B) ما بين 10–14 جيجابايت، أما النماذج ذات الحجم 70 مليار معلَّمة (70B) فتحتاج إلى ما بين 40–48 جيجابايت. ويمكنك استخدام حاسبة الذاكرة VRAM لتقدير هذه الاحتياجات.
- تناسب النماذج المكمَّمة (Q4، Q5) بطاقات الرسومات الاستهلاكية مع خسارة طفيفة جدًّا في الجودة. أما التنسيق FP16 فيقدِّم أفضل جودة لكنه يضاعف متطلبات الذاكرة VRAM.
إذا كنت قد بحثت عن عبارة «ollama gpt oss»، فمن المرجح أنك ترغب في تشغيل نماذج لغوية كبيرة مفتوحة المصدر محليًّا باستخدام منصة Ollama — لكن شركة OpenAI لم تُصدِر عائلة نماذج ذات أوزان مفتوحة باسم «GPT-OSS». فقد أصدرت الشركة نموذج GPT-2 عام 2019 كنموذج ذي أوزان مفتوحة، لكن نماذجها الحديثة (مثل GPT-4 وGPT-4o وGPT-4.1) تظل حصريةً للوصول عبر واجهة برمجة التطبيقات (API) دون إتاحتها كأوزان مفتوحة. أما ما لا موجودٌ فعلاً فهو مئات النماذج ذات الأوزان المفتوحة الصادرة عن شركات مثل Meta (Llama) وMistral AI وAlibaba (Qwen) وغيرها، والتي يمكنك تنزيلها وتشغيلها عبر منصة Ollama على أجهزتك الخاصة. ويغطي هذا الدليل النماذج المتوافقة، ومتطلبات الذاكرة VRAM لكل حجم منها، وكيف يؤثر التكميم على الجودة، بالإضافة إلى مقارنة أداء هذه النماذج.
- ما تُشغِّله منصة Ollama فعليًّا
- عائلات النماذج مفتوحة المصدر المتاحة في منصة Ollama
- تنزيل النموذج وتشغيله
- أحجام المُعلَّمات ومتطلبات الذاكرة VRAM
- التكميم: المفاضلة بين الجودة وسعة الذاكرة VRAM
- مقارنة الأداء: الفئة ذات الحجم 7 مليار معلَّمة (7B)
- أي نموذج يجب أن تختاره؟
- متى تُفضِّل الاستضافة الذاتية مقابل استخدام واجهة برمجة التطبيقات (API)؟
- ملاحظات خاصة بكل نظام تشغيل
- الأسئلة الشائعة
ما تُشغِّله منصة Ollama فعليًّا
Ollama هي محرك استنتاج محلي يقوم بتنزيل النماذج اللغوية الكبيرة ذات الأوزان المفتوحة وتكميمها وتشغيلها على أنظمة التشغيل macOS وLinux وWindows. وهي لا تستضيف نماذج OpenAI. وتشمل قائمة النماذج قائمة نماذج Ollama Llama 3.1 و Mistral 7BوQwen 2.5 وGemma 2 وPhi-3، فضلًا عن عشرات النماذج الأخرى. وكل نموذج متاح بعدة مستويات تكميم (مثل Q4_K_M وQ5_K_M وFP16) للتماهي بين متطلبات الذاكرة VRAM وجودة الأداء.
خطوات التثبيت الكاملة: كيفية تثبيت منصة Ollama.
عائلات النماذج مفتوحة المصدر المتاحة في منصة Ollama
| عائلة النموذج | المطوّر | أحجام المُعلَّمات | الترخيص | مميزاته البارزة |
|---|---|---|---|---|
| Llama 3.1 | ميتا | 8 مليار، 70 مليار، 405 مليارات معلَّمة | Llama 3.1 (مرخص تجاريًّا) | أفضل أداء عام في التفكير والاستنتاج ضمن كل فئة حجم |
| Mistral | ميسترال إيه آي | 7 مليار، 22 مليار معلَّمة (Mixtral 8x7B) | Apache 2.0 | سريع وكفء وقوي في برمجة الحاسوب |
| Qwen 2.5 | علي بابا | 0.5 مليار، 1.5 مليار، 3 مليارات، 7 مليارات، 14 مليار، 32 مليار، 72 مليار معلَّمة | Apache 2.0 | متعدد اللغات، ويدعم سياقات طويلة جدًّا (حتى 128 ألف رمز) |
| Gemma 2 | جوجل | 2 مليار، 9 مليارات، 27 مليار معلَّمة | Gemma (مرخص تجاريًّا) | صغير الحجم وسريع، ويمكن تشغيله على وحدة المعالجة المركزية (CPU) |
| Phi-3.5 | مايكروسوفت | 3.8 مليار معلَّمة (نسخة Mini)، 14 مليار معلَّمة (نسخة Medium) | MIT | مدمج بكفاءة عالية وأداء قوي في مقاييس التفكير والاستنتاج |
الـ قاعدة بيانات نماذج الذكاء الاصطناعي تضمّن القائمة المواصفات ومتطلبات الذاكرة VRAM وأسعار 37 نموذجًا، بما في ذلك جميع النماذج المذكورة أعلاه.
تنزيل النموذج وتشغيله
بعد تثبيت منصة Ollama، يمكنك تنزيل نموذج باستخدام الأمر ollama pull <model>:<tag>حيث يحدّد العلامة (tag) عدد المُعلَّمات ومستوى التكميم. ومن الأمثلة على ذلك:
ollama pull llama3.1:8b
ollama pull mistral:7b-instruct-q4_K_M
ollama pull qwen2.5:7b
ollama pull gemma2:9bلتشغيل النموذج:
ollama run llama3.1:8bوهذا يفتح جلسة دردشة تفاعلية. اكتب موجهك (prompt)، ثم اضغط Enter ليُولِّد النموذج ردًّا محليًّا. ولإنهاء الجلسة، اكتب /bye.
للاستخدام البرمجي للنموذج عبر واجهة برمجة التطبيقات (API):
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "اشرح مفهوم التكرار (recursion) في جملة واحدة."
}'توفر منصة Ollama نقطة نهاية (endpoint) متوافقة مع واجهة برمجة تطبيقات OpenAI /v1/chat/completions لذلك يمكنك توجيه كود SDK الخاص بـ OpenAI الموجود لديك نحو http://localhost:11434 واستبدال النموذج السحابي بنموذج محلي.
أحجام المُعلَّمات ومتطلبات الذاكرة VRAM
يحدد حجم النموذج (7B أو 13B أو 70B) كلاً من جودته واحتياجاته من الذاكرة VRAM. فالنماذج الأكبر تتفوق في التفكير والاستنتاج لكنها تتطلب ذاكرة GPU أكبر. أما التكميم (Q4 أو Q5 أو FP16) فيُقلِّص حجم الأوزان لتخفيف متطلبات الذاكرة VRAM مع خسارة طفيفة في الجودة.
| عدد المُعلَّمات | التكمية | الذاكرة VRAM (تقريبيًّا) | نماذج توضيحية | توصية بالوحدة الرسومية (GPU) |
|---|---|---|---|---|
| ٧ مليارات معلَّمة | Q4_K_M | 4.5 جيجابايت | Llama 3.1 بحجم ٨ مليار معلَّمة، وMistral بحجم ٧ مليار معلَّمة | RTX 3060 (12 جيجابايت)، RTX 4060 Ti (16 جيجابايت) |
| ٧ مليارات معلَّمة | Q5_K_M | 5.5 جيجابايت | كما ورد أعلاه | نفسه |
| ٧ مليارات معلَّمة | FP16 | 14 جيجابايت | كما ورد أعلاه | RTX 4060 Ti (16 جيجابايت)، RTX 4070 |
| 13 مليار معلمة | Q4_K_M | 8 جيجابايت | Qwen 2.5 14B، Phi-3.5 14B | RTX 3060 (12 جيجابايت)، RTX 4060 Ti (16 جيجابايت) |
| 13 مليار معلمة | FP16 | 26 جيجابايت | نفسه | RTX 4090 (24 جيجابايت) أو A5000 (24 جيجابايت) |
| 70 مليار معلَّمة | Q4_K_M | 40 جيجابايت | Llama 3.1 70B، Qwen 2.5 72B | A100 (40/80 جيجابايت)، أو زوج من وحدات RTX 3090 (إجمالي 48 جيجابايت) |
| 70 مليار معلَّمة | FP16 | 140 جيجابايت | نفسه | إعداد متعدد الوحدات الرسومية (Multi-GPU) أو وحدة A100 بسعة 80 جيجابايت |
استخدم حاسبة الذاكرة VRAM لتقدير احتياجات الذاكرة لأي نموذج ومستوى تكميم (Quantization). إنها دليل متطلبات الذاكرة VRAM تسرد قيماً دقيقةً لكل نموذج رئيسي.
لمعرفة التوصيات الخاصة بشراء وحدات GPU، راجع أفضل وحدات معالجة الرسومات لتشغيل النماذج اللغوية الكبيرة محليًّا.
التكميم: المفاضلة بين الجودة وسعة الذاكرة VRAM
يقلل التكميم دقة أوزان النموذج من الأعداد العشرية ذات الدقة المزدوجة (FP16) إلى أعداد صحيحة ذات 4 أو 5 بت (Q4، Q5). ويؤدي هذا إلى خفض ذاكرة VRAM بنسبة 60–75% مع فقدان ضئيل في الجودة لمعظم المهام.
- Q4_K_M: تكميم 4 بت. أقل استهلاك ممكن لذاكرة VRAM، مع انخفاض طفيف في الجودة عند تنفيذ مهام الاستنتاج المعقدة. مناسب جدًا لروبوتات الدردشة وملخّصات النصوص وإكمال الشيفرات البرمجية.
- Q5_K_M: تكميم 5 بت. يستهلك ذاكرة VRAM أكثر بنسبة ~20% مقارنةً بـ Q4، ويقترب جودته من جودة FP16. وهو أفضل توازن يُوصى به لمعظم المستخدمين.
- Q8_0: تكميم 8 بت. جودته قريبة جداً من جودة FP16، مع خفض بنسبة 50% في استهلاك VRAM. استخدمه إذا كانت لديك هامش كافٍ في سعة VRAM.
- FP16: دقة كاملة. أفضل جودة ممكنة، لكنها تتطلب ضعف كمية VRAM المطلوبة في حالة Q4. وتُستخدم فقط في الأبحاث أو عندما يكون الانخفاض في الجودة غير مقبول على الإطلاق.
مثال: Llama 3.1 بسعة 8 مليار معلَّمة النموذج عند مستوى التكميم Q4_K_M يستهلك 4.5 جيجابايت ويحقّق نتيجة 67.2 في اختبار MMLU. أما عند الدقة الكاملة (FP16) فيستهلك 14 جيجابايت ويحقّق نتيجة 68.1 في نفس الاختبار. وللأغراض العملية فإن الفارق البالغ 0.9 نقطة لا يُلاحظ عادةً.
لتنزيل مستوى تكميم معيّن:
ollama pull llama3.1:8b-instruct-q4_K_M
ollama pull llama3.1:8b-instruct-fp16إذا لم تُحدّد علامة التكميم صراحةً، فإن Ollama يفترض افتراضياً استخدام Q4_K_M.
مقارنة الأداء: الفئة ذات الحجم 7 مليار معلَّمة (7B)
فئة النماذج ذات الحجم 7B–8B هي الأكثر شيوعاً للاستخدام المحلي. فهي تتوافق مع وحدات GPU الاستهلاكية وتحقق أداءً قوياً في مجالات البرمجة والاستنتاج والدردشة.
| النموذج | MMLU (بدون أمثلة تمهيدية - zero-shot) | HumanEval (pass@1) | طول السياق | VRAM (عند التكميم Q4) |
|---|---|---|---|---|
| Llama 3.1 بسعة 8 مليار معلَّمة | 67.2 | 62.2 | 128 ألف رمز | 4.5 جيجابايت |
| ميسترال 7B v0.3 | 62.5 | 40.2 | 32 ألف رمز | 4.1 جيجابايت |
| كوين 2.5 بسعة 7 مليارات معلّمة | 70.3 | 61.6 | 128 ألف رمز | 4.3 جيجابايت |
| Gemma 2 9B | 71.3 | 61.0 | 8 آلاف رمز | 5.2 جيجابايت |
يتصدّر كلٌّ من Qwen 2.5 7B وGemma 2 9B قائمة MMLU (المعرفة العامة)، بينما يتصدّر Llama 3.1 8B قائمة HumanEval (البرمجة). أما Mistral 7B فهو الأسرع من حيث الأداء، وأكثرها مرونة من حيث الترخيص (ترخيص Apache 2.0). وقائمة لوحة تصنيف النماذج اللغوية الكبيرة (LLM) تصنّف جميع النماذج حسب الذكاء والسعر وطول السياق.
أي نموذج يجب أن تختاره؟
- أفضل جودة شاملة (في فئة 7B):
ollama pull qwen2.5:7bأوollama pull llama3.1:8b - الأفضل للبرمجة:
ollama pull llama3.1:8bأوollama pull qwen2.5-coder:7b - أسرع استنتاج:
ollama pull mistral:7bأوollama pull gemma2:2b(للتشغيل على وحدة المعالجة المركزية CPU أو وحدات GPU ذات سعة VRAM محدودة) - متعدد اللغات:
ollama pull qwen2.5:7b(يدعم 29 لغة) - الوثائق الطويلة (سياق 128 ألف رمز فأكثر):
ollama pull llama3.1:8bأوollama pull qwen2.5:7b - أقوى أداء في الاستنتاج (إذا كانت لديك سعة VRAM تبلغ 40 جيجابايت فأكثر):
ollama pull llama3.1:70bأوollama pull qwen2.5:72b
الـ أفضل نماذج اللغة المحلية (LLMs) لـ Ollama الدليل يقيّم أداء جميع النماذج ويوصي بعلامات محددة حسب كل حالة استخدام.
متى تُفضِّل الاستضافة الذاتية مقابل استخدام واجهة برمجة التطبيقات (API)؟
من المنطقي تشغيل Ollama محلياً إذا كنت:
- تمتلك بالفعل وحدة GPU بسعة VRAM تبلغ 12 جيجابايت فأكثر (مثل RTX 3060 أو RTX 4060 Ti أو ما هو أفضل)
- تعالج بيانات حساسة لا يمكن أن تخرج عن شبكتك الداخلية
- تولّد أكثر من 5 ملايين رمز شهرياً (حيث تتجاوز تكلفة واجهات برمجة التطبيقات API تكلفة امتلاك الخادم داخلياً TCO)
- تحتاج إلى توفر دائم مضمون وخالية من حدود التكرار (rate limits)
استخدم واجهة برمجة تطبيقات مستضافة (مثل OpenAI أو Anthropic أو Groq) إذا:
- أنت تُولِّد أقل من مليون رمز شهريًّا (ويعود استرداد تكلفة وحدة معالجة الرسومات المُستضافة ذاتيًّا بعد سنوات عديدة)
- تحتاج إلى أعلى جودة ممكنة (فطرازَي Claude 3.5 Sonnet وGPT-4o يتفوقان على جميع النماذج المفتوحة)
- لا ترغب في إدارة بنية تحتية الاستنتاج بنفسك
الـ حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) تُقدِّر هذه الأداة نقطة التعادل استنادًا إلى حجم الرموز الذي تستخدمه، وتكلفة وحدة معالجة الرسومات، ومعدَّل تكلفة الكهرباء. وتُظهر حاسبة تكلفة واجهة برمجة التطبيقات (API) الإنفاق الشهري المُقدَّر لكل نموذج.
ملاحظات خاصة بكل نظام تشغيل
macOS
يستخدم Ollama تقنية Metal لتسريع أداء وحدة معالجة الرسومات على أجهزة ماك المزوَّدة بمعالجات M1/M2/M3. وبفضل الذاكرة الموحَّدة، فإن سعة ذاكرة VRAM تساوي سعة ذاكرة النظام RAM. وعلى سبيل المثال، يمكن لجهاز M2 Max المزوَّد بـ64 غيغابايت تشغيل النموذج Llama 3.1 70B عند كمية التكميم Q4 (40 غيغابايت) مع ترك هامش كافٍ لتشغيل نظام التشغيل. ويمكن تثبيته عبر Homebrew كما يلي:
brew install ollamaابدأ الخدمة باستخدام الأمر التالي:
ollama serveلينكس
يتطلب Ollama وحدات معالجة رسومات من شركة NVIDIA مدعومة بـCUDA 11.8 أو أحدث، أو وحدات معالجة رسومات من شركة AMD مدعومة بـROCm 5.7 أو أحدث. ولتثبيته، استخدم الأمر التالي:
curl -fsSL https://ollama.com/install.sh | shوهذا يثبت الملف التنفيذي في المسار /usr/local/bin/ollama ويُنشئ خدمة systemd. ولبدء الخدمة، استخدم الأمر التالي:
sudo systemctl start ollamaتنزَّل النماذج إلى الدليل ~/.ollama/models. ولتغيير موقع التخزين، عيِّن المتغير البيئي OLLAMA_MODELS=/path/to/models في /etc/systemd/system/ollama.service.
ويندوز
يتطلب إصدار Ollama الخاص بنظام Windows وحدات معالجة رسومات من شركة NVIDIA مدعومة بـCUDA 11.8 أو أحدث، ومعالج رسومات ببرنامج تشغيل إصدار 520 أو أحدث. ويمكنك تنزيل ملف التثبيت من الموقع ollama.com ثم تشغيله. وتبدأ الخدمة تلقائيًّا عند التثبيت. أما النماذج فتنزَّل افتراضيًّا إلى الدليل C:\Users\\.ollama\models.
ولتشغيل Ollama من PowerShell، استخدم الأمر التالي:
ollama run llama3.1:8bالأسئلة الشائعة
هل تقدِّم شركة OpenAI نموذجًا مفتوح المصدر يمكنني تشغيله عبر Ollama؟
كلا. فقد أطلقت شركة OpenAI نموذج GPT-2 عام 2019 كنموذج مفتوح الوزن (open-weight)، لكن جميع النماذج الحديثة (مثل GPT-3.5 وGPT-4 وGPT-4o وo1) هي نماذج مملوكة بالكامل ولا تتوفر إلا عبر واجهة برمجة التطبيقات (API). وإذا كنت تبحث عن قدرة استنتاج مماثلة لـOpenAI يمكنك تشغيلها محليًّا، فجرِّب النموذجين Llama 3.1 70B أو Qwen 2.5 72B — وكلاهما يتفوق على GPT-3.5 في معظم الاختبارات، ويمكن تشغيلهما عبر Ollama باستخدام 40 غيغابايت من VRAM عند كمية التكميم Q4.
هل يمكنني تشغيل Ollama على وحدة معالجة مركزية (CPU) دون وجود وحدة معالجة رسومات (GPU)؟
نعم، لكن سرعة الاستنتاج ستكون أبطأ بعشرة إلى خمسين مرة. فالنماذج الصغيرة (مثل Gemma 2 2B وQwen 2.5 0.5B وPhi-3.5 mini 3.8B) يمكن استخدامها بكفاءة على وحدات المعالجة المركزية الحديثة (المزوَّدة بـ16 خيط معالجة أو أكثر). أما النماذج الأكبر (7 مليار معلَّمة فأكثر) فستولِّد فقط 1–3 رموز في الثانية عند التشغيل على وحدة المعالجة المركزية، وهي سرعة بطيئة جدًّا للتفاعل المباشر. فإذا لم تكن تمتلك وحدة معالجة رسومات، فننصحك باستخدام واجهة برمجة تطبيقات مستضافة بدلًا من ذلك — راجع قسم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API).
ما تكلفة تشغيل Ollama مقارنةً بتكلفة استخدام واجهة برمجة تطبيقات OpenAI؟
تفرض شركة OpenAI رسومًا قدرها 0.15 دولار أمريكي لكل مليون رمز مدخل و0.60 دولار أمريكي لكل مليون رمز مخرج عند استخدام نموذج GPT-4o mini. أما وحدة معالجة الرسومات بسعة 12 غيغابايت (مثل RTX 4060 Ti التي تبلغ تكلفتها 400 دولار أمريكي) عند تشغيل نموذج Llama 3.1 8B، فهي تستهلك طاقةً بمعدل 0.05 دولار أمريكي في الساعة (وبافتراض سعر الكهرباء 0.12 دولار أمريكي لكل كيلوواط ساعة، واستهلاك النظام الكلي 400 واط). وتتراوح نقطة التعادل بين 3–5 ملايين رمز شهريًّا. وتُظهر أداة حاسبة تكلفة واجهة برمجة التطبيقات (API) و حاسبة الاستضافة الذاتية التكلفة الإجمالية الفعلية (TCO) وفقًا لاستخدامك الشخصي.
ما الفرق بين التنسيقات Q4_K_M وQ5_K_M وFP16؟
يستخدم التنسيق Q4_K_M تكميمًا بعرض 4 بت (أقل استهلاك لسعة VRAM، مع انخفاض طفيف في الجودة). أما التنسيق Q5_K_M فيستخدم تكميمًا بعرض 5 بت (يستهلك 20% أكثر من VRAM، ويقارب الجودة الكاملة بشكل أكبر). أما التنسيق FP16 فهو دقة كاملة بعرض 16 بت (أعلى جودة ممكنة، لكنه يستهلك ضعف سعة VRAM المطلوبة في حالة Q4). وللأغراض العملية العادية، يُعَد Q5_K_M أفضل توازن بين الجودة والأداء. أما التنسيق FP16 فيُوصى باستخدامه فقط إذا كانت لديك سعة VRAM زائدة، وتحتاج إلى تحقيق آخر 1–2% من الجودة لأغراض البحث أو الإنتاج.
هل يمكنني ضبط النماذج (fine-tune) ضمن Ollama؟
كلا. فـOllama هو محرك استنتاج فقط، وليس إطار عمل تدريب. ولضبط نموذج مفتوح المصدر، استخدم مكتبة Hugging Face Transformers مع تقنيات PEFT/LoRA أو أدوات Axolotl أو LLaMA Factory. ثم صدِّر الأوزان المُعدَّلة بصيغة GGUF واستوردها إلى Ollama باستخدام الأمر ollama create. وكتلة الدليل الكامل لـ Ollama ويشرح هذا الدليل سير العمل بالتفصيل.
ما وحدة معالجة الرسومات الأنسب لتشغيل النماذج بحجم 7 مليار معلَّمة محليًّا؟
للكمية Q4 للتكميم (4.5 غيغابايت VRAM): RTX 3060 بسعة 12 غيغابايت (بسعر 250 دولارًا أمريكيًّا مستعملة) أو RTX 4060 Ti بسعة 16 غيغابايت (بسعر 450 دولارًا أمريكيًّا جديدة). وللكمية FP16 (14 غيغابايت VRAM): RTX 4060 Ti بسعة 16 غيغابايت أو RTX 4070 (بسعر 550–600 دولار أمريكي). ولتشغيل النماذج بحجم 70 مليار معلَّمة عند كمية التكميم Q4 (40 غيغابايت): يمكن استخدام بطاقتي RTX 3090 بسعة 24 غيغابايت لكل منهما (بسعر 1800 دولار أمريكي مستعملة) أو وحدة A100 بسعة 40 غيغابايت (بسعر 6000 دولار أمريكي أو أكثر، مستعملة). ويقدِّم الدليل أفضل وحدات معالجة الرسومات مقارنةً مفصلةً بين السعر والأداء لكل فئة حجم.

