Monday, 28 September 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

Ollama GPT أوس: الدليل الشامل لتشغيل النماذج المفتوحة من شركة OpenAI

باختصار

  • gpt-oss:20b يعمل باستخدام ما يقارب 16 غيغابايت من الذاكرة (ويتناسب مع معظم وحدات معالجة الرسومات المخصصة للألعاب)، gpt-oss:120b يتطلب ما يقارب 70 غيغابايت (على وحدة معالجة رسومات واحدة سعة 80 غيغابايت أو بتوزيعها عبر بطاقات استهلاكية متعددة)
  • ثبِّته باستخدام الأمر ollama pull gpt-oss:20b أو ollama pull gpt-oss:120b، ثم شغّله باستخدام الأمر ollama run gpt-oss:20b
  • وتستخدم كلا النسختين تقنية التكميم MXFP4 عند 4,25 بت لكل معلمة، وتدعم نافذة السياق الممتدة حتى 128 ألف رمز.
  • أطلقتها شركة OpenAI كنماذج مفتوحة الوزن بالشراكة مع Ollama، وهي تُقارن من حيث الجودة بنموذجي Llama 3.1 وQwen 2.5.

أطلقت OpenAI نموذج gpt-oss كنماذج مفتوحة الوزن في أغسطس 2025، وتُوزَّع حصريًّا عبر منصة Ollama. وتتكوّن عائلة gpt-oss من نسختين: الأولى نموذج بسعة 20 مليار معلمة يعمل بسلاسة على الأجهزة الاستهلاكية، والثانية نموذج بسعة 120 مليار معلمة يقدّم أداءً يقترب من أحدث النماذج المتقدمة عند تشغيله على وحدة معالجة رسومات عالية الأداء واحدة. وكلا النسختين تستخدمان تقنية التكميم MXFP4، التي تُخزِّن أوزان النموذج بكفاءة عند 4,25 بت لكل معلمة مع الحفاظ على جودة تقترب من الاستنتاج الكامل الدقة.

ما هي نماذج GPT-OSS؟

تمثل نماذج gpt-oss الإصدار الأول من OpenAI الذي يُنشر كنماذج مفتوحة الوزن، وذلك بعد ضغوط صناعية متزايدة تدعو إلى الشفافية وإمكانية إعادة الإنتاج. وعلى عكس نموذجي GPT-4 وGPT-4o، فإن هذه النماذج تُوزَّع مع أوزانها الكاملة وتفاصيل هندستها وترخيصها المرن الذي يسمح بالاستخدام التجاري دون قيود.

ويدعم كلا النموذجين نافذة سياق تصل إلى 128 ألف رمز، ويتعاملان مع المحادثات متعددة الدورات، ويؤديان مهام اتباع التعليمات بأداء يُقارن بنظيراتها من النماذج المفتوحة ضمن نفس فئة عدد المعلمات. أما النسخة ذات الـ20 مليار معلمة فتتنافس مباشرة مع Llama 3.1 8B و Mistral 7B، بينما يقع النموذج ذي الـ120 مليار معلمة بين نموذج Llama 3.1 بسعة 70 مليار معلمة وأنظمة الجيل الأحدث مثل GPT-4.

تعاونت OpenAI مع Ollama لتولي عملية التوزيع وتحسين الاستنتاج. وهذا يعني أنك تقوم بتثبيت وتشغيل gpt-oss بنفس الطريقة التي تُشغل بها أي نموذج آخر من نماذج Ollama، دون الحاجة إلى خطوات تحويل أو تكميم منفصلة.

متطلبات الأجهزة

ويوضح الجدول أدناه الحد الأدنى والحد الموصى به من المواصفات المادية لكل نسخة من نماذج gpt-oss. وتشمل أرقام الذاكرة أوزان النموذج بالإضافة إلى هامش معقول من الذاكرة المخصصة لنافذة السياق ومخازن الاستنتاج.

النموذج عدد المعايير (البارامترات) حجم القرص الحد الأدنى من الذاكرة الحد الموصى به من الذاكرة أجهزة مثال
gpt-oss:20b 20 مليار 14 غيغابايت 16 جيجابايت 24 جيجابايت RTX 4090، RTX 3090، A5000
gpt-oss:120b 120 مليار 65 غيغابايت 70 غيغابايت 80 غيغابايت A100 80GB، H100، RTX 4090 مزدوجة

يناسب النموذج ذو الـ20 مليار معلمة بطاقات معالجة الرسومات الاستهلاكية الصادرة منذ عام 2020 بسلاسة. فإذا كانت لديك بطاقة RTX 3090 أو RTX 4090 بسعة 24 غيغابايت من الذاكرة المخصصة للرسومات (VRAM)، يمكنك تشغيل النموذج gpt-oss:20b مع مساحة كافية لنافذة سياق تصل إلى 16 ألف رمز. أما إذا كانت سعة الذاكرة 16 غيغابايت (مثل بطاقتي RTX 4080 أو RTX 3080 Ti)، فلا يزال بإمكانك تشغيل النموذج، لكن يجب أن تقتصر طول نافذة السياق على 8 آلاف رمز لتفادي امتلاء الذاكرة.

أما النموذج ذو الـ120 مليار معلمة فيتطلب أجهزة مركز بيانات أو تكوينًا استهلاكيًّا متعدد وحدات معالجة رسومات. وتتعامل بطاقة A100 بسعة 80 غيغابايت مع هذا النموذج بسلاسة. ويمكن لبطاقتي RTX 4090 في جهاز كمبيوتر شخصي تقسيم النموذج بينهما، رغم انخفاض سرعة الاستنتاج قليلًا مقارنةً بالنشر على وحدة معالجة رسومات واحدة. ويمكنك استخدام حاسبة الذاكرة VRAM لتقدير متطلبات الذاكرة لمختلف أطوال نوافذ السياق.

وحدة المعالجة المركزية والذاكرة النظامية (RAM)

إذا كانت لديك ذاكرة VRAM غير كافية، فإن Ollama ستُحمّل الطبقات إلى الذاكرة النظامية (RAM) وتشغّلها عبر وحدة المعالجة المركزية (CPU). ولتشغيل النموذج gpt-oss:20b بالكامل على وحدة المعالجة المركزية، تحتاج إلى ما لا يقل عن 32 غيغابايت من الذاكرة النظامية. أما تشغيل النموذج gpt-oss:120b عبر وحدة المعالجة المركزية فهو غير عملي — إذ تتوقع تأخيرًا يبلغ عدة ثوانٍ لكل رمز حتى على أنظمة وحدات المعالجة المركزية متعددة النوى. راجع القسم الأفضل وحدات معالجة الرسومات (GPUs) للنماذج اللغوية الكبيرة المحلية دليل إذا كنت تبني أو تُحدّث مواصفات جهازك خصيصًا لتشغيل النماذج.

التثبيت

أولاً، قم بتثبيت Ollama إذا لم تكن قد فعلت ذلك من قبل. وتختلف خطوات التثبيت باختلاف نظام التشغيل:

macOS

نزّل تطبيق Ollama لأنظمة ماك أو إس من ollama.com واسحبه إلى مجلد /Applications، حيث يقوم برنامج التثبيت تلقائيًّا بإعداد سطر الأوامر (CLI). أو يمكنك تثبيته عبر Homebrew: Ollama شغّل نص التثبيت الرسمي، الذي يضع ملف التنفيذ في

brew install ollama

لينكس

ويُنشئ خدمة systemd تلقائيًّا: /usr/local/bin/ollama للتثبيت اليدوي أو تعليمات مخصصة حسب توزيعة النظام، راجع

curl -fsSL https://ollama.com/install.sh | sh

وشغّله. ويضيف البرنامج التثبيتي أولاما تلقائيًّا إلى متغير PATH ويبدأ الخدمة في الخلفية. وبعد التثبيت، افتح PowerShell أو موجه الأوامر للتحقق من التثبيت: دليل تثبيت Ollama.

ويندوز

قم بتنزيل برنامج التثبيت الخاص بنظام ويندوز من ollama.com بعد تثبيت Ollama، نزّل النموذج الذي تريده. بالنسبة للنسخة ذات الـ20 مليار معلمة:

ollama --version

تنزيل النماذج وتشغيلها

وبالنسبة للنسخة ذات الـ120 مليار معلمة:

ollama pull gpt-oss:20b

يقوم التنزيل بتنزيل أوزان النموذج إلى المجلد

ollama pull gpt-oss:120b

على أنظمة ماك أو إس وأنظمة لينكس، أو إلى ~/.ollama/models على أنظمة ويندوز. ويمكن استئناف التنزيل بعد مقاطعته دون فقدان التقدم المحرز. %USERPROFILE%.ollamamodels وبعد التنزيل، ابدأ جلسة تفاعلية باستخدام الأمر:

أو للنموذج الأكبر حجمًا:

ollama run gpt-oss:20b

ollama run gpt-oss:120b

ollama run gpt-oss:120b

يؤدي هذا إلى فتح واجهة دردشة. اكتب مُوجِّهك (prompt)، ثم اضغط على مفتاح Enter لعرض استجابة النموذج بشكل تدفقي. اكتب /bye للخروج.

الوصول إلى واجهة برمجة التطبيقات (API)

يُشغِّل Ollama خادم HTTP محليًّا على العنوان http://localhost:11434. ويمكنك إرسال الطلبات عبر أدوات مثل curl أو لغة Python أو أي عميل HTTP آخر:

curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "اشرح تقنية التكمين MXFP4 في جملة واحدة."
}'

وبالنسبة للتطبيقات المنظَّمة، يُوصى باستخدام حزمة تطوير البرمجيات (SDK) الخاصة بـ Ollama المكتوبة بلغتي Python أو JavaScript. وتتوفر كلا الحزمتين عبر برامج إدارة الحزم القياسية (pip install ollama, npm install ollama)، وتوفر واجهات مُحدَّدة الأنواع (typed interfaces) لتوليد النصوص، واستخراج التضمينات (embeddings)، وإدارة النماذج.

الأداء ومقارنة النماذج

ويُولِّد النموذج ذي الـ20 مليار معلَّمة ما بين 15 و30 رمزًا (token) في الثانية الواحدة على وحدة معالجة الرسومات RTX 4090، وذلك حسب طول السياق وتعقيد المُوجِّه. أما النموذج ذي الـ120 مليار معلَّمة فيُولِّد ما بين 8 و15 رمزًا في الثانية الواحدة على وحدة معالجة الرسومات A100 بسعة 80 غيغابايت. وتفترض هاتان القيمتان الإعدادات الافتراضية دون تطبيق أية تحسينات إضافية مثل التنبؤ الاستباقي (speculative decoding).

من حيث الجودة، يؤدي النموذج gpt-oss:20b أداءً مماثلًا لأداء نموذجي Llama 3.1 8B وMistral 7B في مقاييس التقييم التي تركز على الاستنتاج والتفكير مثل MMLU وGSM8K. كما أنه يتفوق عليهما في اتباع التعليمات متعددة الدورات (multi-turn instruction following)، ويرجع ذلك على الأرجح إلى ضبطه باستخدام التعلُّم التعزيزي المستند إلى التغذية الراجعة البشرية (RLHF) من شركة OpenAI. أما النسخة ذات الـ120 مليار معلَّمة فتقترب جودتها من جودة نموذج GPT-3.5 Turbo، ما يجعلها أقوى نموذج مفتوح المصدر تحت عتبة 200 مليار معلَّمة حتى شهر أغسطس 2026.

وبالمقارنة مع النماذج التجارية القائمة على واجهات برمجة التطبيقات (API)، يصبح تشغيل نموذج gpt-oss محليًّا أكثر جدوى من الناحية التكلفة عند تجاوز حجم استخدام يبلغ نحو مليوني رمز شهريًّا بالنسبة للنموذج ذي الـ20 مليار معلَّمة، أو 500 ألف رمز شهريًّا بالنسبة للنموذج ذي الـ120 مليار معلَّمة، وذلك بفرض أنك تمتلك بالفعل الأجهزة اللازمة. ويمكنك استخدام حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لحساب نقطة التعادل (break-even point) بدقةٍ بناءً على حجم الرموز وتكاليف الأجهزة.

التكميم MXFP4

ويأتي كلا النموذجين gpt-oss مزودين مسبقًا بتقنية التكمين MXFP4. وهذه التقنية هي تنسيق عائم الدقة المصغر (microscaling floating-point format) يمثل الأوزان بمعدل 4.25 بت لكل معلَّمة في المتوسط، مقارنةً بـ16 بت في دقة النصف (half-precision) القياسية. وعلى عكس أساليب التكمين القديمة مثل GPTQ أو AWQ، تحافظ تقنية MXFP4 على مدى ديناميكي أوسع، مما يقلل من فقدان الدقة المرتبط عادةً بالتكمين المكثف.

وفي الواقع العملي، يتصرف النموذج المكمَّن باستخدام MXFP4 بشكلٍ شبه مطابق للنموذج الكامل الدقة (full-precision) في معظم المهام. ويتم التكمين أثناء التدريب وليس بعد انتهائه (post-hoc)، ما يسمح للنموذج بالتكيف مع الدقة المخفضة. وبذلك، تقل متطلبات ذاكرة وحدة معالجة الرسومات (VRAM) بنسبة تصل إلى 75% مقارنةً بتنسيق FP16، ما يجعل تشغيل النموذج ذي الـ120 مليار معلَّمة ممكنًا على وحدة معالجة رسومات استهلاكية واحدة.

نافذة السياق واستهلاك الذاكرة

ويدعم كلا النموذجين gpt-oss نافذة سياق تصل إلى 128 ألف رمز، وهي تعادل تقريبًا 100 ألف كلمة من النص الإنجليزي. ومع ذلك، فإن الاستفادة الفعلية من هذه النافذة الكاملة تتطلب ذاكرة إضافية كبيرة تتجاوز وزن النموذج الأساسي فقط.

أما بالنسبة لنموذج gpt-oss:20b، فإن استخدام نافذة سياق تبلغ 128 ألف رمز يضيف ما يقارب 8 غيغابايت من استهلاك الذاكرة الإضافي. وبذاكرتك المحلية البالغة 24 غيغابايت من VRAM، يمكنك استخدام النافذة الكاملة بسلاسة. أما إذا كانت سعة ذاكرتك 16 غيغابايت، فيجب أن تقتصر نافذة السياق على 32–48 ألف رمز لتجنب نفاد الذاكرة أثناء التوليد.

أما بالنسبة لنموذج gpt-oss:120b، فإن استخدام نافذة سياق تبلغ 128 ألف رمز يضيف ما يقارب 20 غيغابايت من استهلاك الذاكرة الإضافي. ويمكن لوحدة معالجة رسومات بسعة 80 غيغابايت التعامل مع ذلك، لكن النشر على وحدتي معالجة رسومات استهلاكيتين بسعة إجمالية 70 غيغابايت يتطلب تحديد نافذة السياق عند 64 ألف رمز كحدٍ أقصى. يُرجى الاطلاع على متطلبات ذاكرة VRAM حسب النموذج للاطلاع على منحنيات توسع استهلاك الذاكرة التفصيلية.

الأسئلة الشائعة

هل يمكنني ضبط النموذجين gpt-oss يدويًّا (fine-tune)؟

نعم. أصدرت شركة OpenAI نموذجي gpt-oss بموجب رخصة مرنة تسمح بالضبط اليدوي لأي غرض، بما في ذلك التطبيقات التجارية. ويمكنك استخدام أطر الضبط اليدوي القياسية مثل Axolotl أو Hugging Face TRL. كما أن أوزان النموذج متوافقة مع بنية نموذج Llama، وبالتالي تعمل معظم أدوات الضبط المخصصة لـ Llama دون الحاجة إلى أي تعديل.

كيف يقارن نموذج gpt-oss:120b مع نموذج Llama 3.1 70B؟

يتفوق نموذج gpt-oss:120b على نموذج Llama 3.1 70B في اتباع التعليمات والمحادثات متعددة الدورات، لا سيما في المهام التي تتطلب الحفاظ على السياق عبر العديد من التبادلات. أما نموذج Llama 3.1 70B فيتفوق قليلًا في مقاييس التقييم الخالصة المتعلقة بالاستنتاج مثل MATH وDROP. وكلا النموذجين يؤديان أداءً متساويًا تقريبًا في مهام البرمجة. ويحتاج النموذج ذو الـ120 مليار معلَّمة إلى ذاكرة VRAM أكبر (70 غيغابايت مقابل 40 غيغابايت)، لكنه يقدّم تحسُّنًا ملحوظًا في جودة التفاعل على نمط المساعد الذكي (assistant-style interactions).

هل يمكنني تشغيل نموذج gpt-oss:120b على عدة وحدات معالجة رسومات استهلاكية؟

نعم. يقوم Ollama تلقائيًّا بتقسيم النموذج عبر وحدات معالجة الرسومات المتاحة إذا لم تكن سعة وحدة واحدة كافية. ويمكن لوحدتي معالجة رسومات RTX 4090 (إجمالي سعة VRAM = 48 غيغابايت) تشغيل نموذج gpt-oss:120b، رغم أن سرعة الاستنتاج تنخفض بنسبة 20–30% مقارنةً بوحدة معالجة رسومات واحدة سعة 80 غيغابايت بسبب النفقات الإضافية الناتجة عن الاتصال بين وحدات المعالجة. أما استخدام ثلاث وحدات أو أكثر فيُحقِّق عوائد متناقصة؛ فإذا كان لديك الميزانية الكافية لذلك، فإن استخدام وحدة معالجة رسومات واحدة من نوع A100 أو H100 سيكون أكثر فعالية من حيث التكلفة.

هل يعمل نموذج gpt-oss دون اتصال بالإنترنت؟

نعم، بعد تنزيل النموذج باستخدام الأمر ollama pull. ويقوم Ollama بتخزين أوزان النموذج الكاملة محليًّا، ويتم الاستنتاج بالكامل على جهازك. أما الوصول إلى الشبكة فيحدث فقط أثناء التنزيل الأولي أو عند التحقق من وجود تحديثات للنموذج. ويمكنك تعطيل عمليات التحديث التلقائية عبر تعيين المتغير OLLAMA_SKIP_UPGRADE=1 في بيئة التشغيل الخاصة بك.

ما الرخصة المطبَّقة على المخرجات التي يولدها نموذج gpt-oss؟

لا تدّعي رخصة gpt-oss الصادرة عن شركة OpenAI أي ملكية على المخرجات التي يولدها النموذج. فأنت تملك كامل حقوق المخرجات التي تُنتجها، ويمكنك استخدامها لأي غرض، بما في ذلك المنتجات والخدمات التجارية. وهذا يختلف عن شروط خدمة واجهة برمجة التطبيقات (API) الخاصة بشركة OpenAI، والتي تقيّد بعض حالات الاستخدام. وينبغي دائمًا الاطلاع على نص الرخصة الكامل المرفق مع ملف تنزيل النموذج للتأكد من أحدث الشروط.

هل يمكنني استخدام نماذج gpt-oss لأغراض تجارية؟

نعم. تسمح الرخصة باستخدام النماذج لأغراض تجارية دون قيود، بما في ذلك دمج النموذج في منتجات خاصة، أو تقديمه كخدمة، أو استخدامه لتوليد محتوى للبيع. ولا يُشترط منك فتح مصدر الأعمال المشتقة أو الإفصاح عن استخدامك لنموذج gpt-oss في منتجك، رغم أن الإسناد (attribution) يُشجَّع عليه.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى