مشهد النماذج اللغوية الكبيرة المفتوحة المصدر في عام 2026 هو الأقوى على الإطلاق. ويمكنك تحقيق أداءٍ يعادل أداء نموذج GPT-4 أو حتى تفوُّقه في مهام محددة، كما يمكنك تشغيل جميع هذه النماذج محليًّا إذا توافرت لديك الأجهزة المناسبة. والسؤال المطروح هو: أيُّ نموذجٍ هو الأفضل فعليًّا؟ وما تكلفة الأجهزة المطلوبة لتشغيله؟
هذه هي لوحة تصنيف أفضل النماذج اللغوية الكبيرة ذات الأوزان المفتوحة لعام 2026، مقترنةً بالطبقة الدقيقة من الأجهزة التي يتطلبها كل نموذج.
أبرز النقاط المستخلصة
- أفضل نموذج مفتوح المصدر من الجيل المتقدم: Llama 3.1 بسعة 405 مليارات معلَّمة (يتطلب ذاكرة وصول عشوائي تبلغ 200 جيجابايت فأكثر).
- أفضل نموذج من فئة الـ70 مليار معلَّمة: Qwen 2.5 بسعة 72 مليار معلَّمة – إصدار التوجيهات، ويتفوق على Llama 3 بسعة 70 مليار معلَّمة في معظم مقاييس الأداء لعام 2026.
- أفضل نموذج من فئة الـ30 مليار معلَّمة: Qwen 2.5 بسعة 32 مليار معلَّمة — يعمل على وحدة معالجة رسوميات سعة 24 جيجابايت باستخدام تقنية التكميم Q5.
- أفضل نموذج من فئة الـ7 إلى 14 مليار معلَّمة: Phi-4 14B — أداء استنتاجي استثنائي بالنسبة لحجمه.
- أفضل نموذج من نوع MoE (يستهلك ذاكرة كبيرة لكنه سريع في معالجة الرموز): DeepSeek V3 (236B / 21B نشط).
لوحة التصنيف لعام 2026
درجات المقاييس المركبة (MMLU + HumanEval + MATH + IFEval)، ومتوسطها وتطبيعها:
| الترتيب | النموذج | عدد المُعَلَّمات | النتيجة المركبة | أُطلِقَ |
|---|---|---|---|---|
| 1 | Llama 3.1 بسعة 405 مليارات معلَّمة | 405 مليار معلَّمة كثيفة (Dense) | 87.4 | يوليو 2024 |
| 2 | DeepSeek V3 | 236 مليار معلَّمة من نوع MoE (21 مليار معلَّمة نشطة) | 86.8 | ديسمبر 2024 |
| 3 | Mistral Large 2 | 123 مليار معلَّمة كثيفة (Dense) | 84.2 | يوليو 2024 |
| 4 | Qwen 2.5 72B Instruct | 72 B كثيف | 83.7 | سبتمبر 2024 |
| 5 | Llama 3 70B Instruct | 70 B كثيف | 82.5 | أبريل 2024 |
| 6 | Command R+ 104B | 104 B كثيف | 81.3 | أبريل 2024 |
| 7 | Mixtral 8x22B | 141 B MoE (39 B نشطة) | 80.1 | أبريل 2024 |
| 8 | Qwen 2.5 32B Instruct | 32 B كثيف | 79.4 | سبتمبر 2024 |
| 9 | Phi-4 (14 B) | 14 B كثيف | 77.8 | ديسمبر 2024 |
| 10 | Llama 3 بسعة 8 مليارات معلَّمة – إصدار التوجيهات | 8 B كثيف | 69.2 | أبريل 2024 |
تُحدّث التصنيفات كل ربع سنة مع ظهور نماذج جديدة. الترتيبات أعلاه تعكس الربع الثاني من 2026.
الأجهزة المطلوبة لكل نموذج (Q4_K_M، سياق 8 K)
| النموذج | الذاكرة المطلوبة | أرخص أجهزة للمستهلكين | الرموز/الثانية على هذا الجهاز |
|---|---|---|---|
| Llama 3 بسعة 8 مليارات معلَّمة | 4.9 GB | RTX 3060 12 GB (280 دولار) | 48 معالجة/ثانية |
| Phi-4 14B | 8.5 GB | RTX 3060 12 GB (280 دولار) | 32 ترجمة/ثانية |
| Qwen 2.5 14B | 9.0 GB | RTX 4060 Ti 16 GB (430 دولار) | 55 رمز/ثانية |
| Qwen 2.5 32B | 19.8 GB | RTX 4090 (24 GB مستخدم، 1300 دولار) | 40 رمز/ثانية |
| Llama 3 بسعة 70 مليار معلَّمة | 42.5 GB | RTX 5090 (32 GB عند Q4_K_S) أو 2× 3090 | 16-22 رمز/ثانية |
| Qwen 2.5 72B | 43.8 GB | RTX 5090 (32 GB عند Q4_K_S) أو 2× 3090 | 15-21 رمز/ثانية |
| Command R+ 104B | 62.7 GB | 2× RTX 4090 (2600 دولار) أو M4 Max 128 GB | 9-12 رمز/ثانية |
| Mistral Large 2 123B | 74.5 GB | M4 Max 128 GB (4999 دولار) أو DIGITS | 6-8 رموز/ثانية |
| Mixtral 8x22B | 85.1 GB | M4 Max 128 GB أو DIGITS | 11-14 رمز/ثانية (فائدة MoE) |
| DeepSeek V3 236B | 143.6 GB | DIGITS (3000 دولار) أو M4 Ultra 256 GB | 8-11 رمز/ثانية (فائدة MoE) |
| Llama 3.1 بسعة 405 مليارات معلَّمة | 244.5 GB | M4 Ultra 512 GB (12000 دولار) أو 8× 4090 | 2-4 رموز/ثانية |
للحصول على متطلبات VRAM الكاملة في كل مستوى تكمية، انظر ورقة VRAM المرجعية.
ما يجب تشغيله فعلياً، حسب الاستخدام
الدردشة اليومية / الأسئلة والأجوبة: Llama 3 8B جيد فعلاً في 2026. يناسب أي وحدة معالجة رسومات بـ 12+ GB. جرّب Phi-4 14B للحصول على استدلال أفضل بتكلفة ذاكرة هامشية.
مساعد البرمجة: Qwen 2.5 32B Instruct أو DeepSeek V3 هما الأفضل. إذا كان لديك 24 GB VRAM فقط، استخدم Qwen 32B عند Q5؛ إذا كان لديك ذاكرة أكبر، فإن DeepSeek V3 يتفوق.
تحليل المستندات الطويلة (السياق 32K+): Qwen 2.5 72B يتمتع بأفضل أداء للسياق الطويل بين النماذج المفتوحة في 2026.
الترجمة / متعدد اللغات: Qwen 2.5 72B مرة أخرى — تدريب Alibaba على الصينية/متعدد اللغات يعطيها أفضلية حقيقية.
الرياضيات + التفكير: Phi-4 (14B) يحقق نتائج قوية في معايير التفكير. للتفكير الحدودي، Llama 3.1 405B.
الكتابة الإبداعية / التمثيل الدرامي: Mistral Large 2 له أفضل «صوت» بين النماذج المفتوحة، على الرغم من أن المعايير تصنفه قليلاً أسفل Qwen 72B.
الاستدلال الإنتاجي على نطاق واسع: DeepSeek V3 (MoE) هو الفائز في كفاءة التكلفة — جودة حدودية مع سرعة الاستدلال للمعاملات النشطة.
المقايضات في التكميم
الأرقام أعلاه تفترض تكميم Q4_K_M، الأفضل لتحقيق التوازن بين الحجم والجودة في 2026. المرجع:
- FP16 (بدون تكميم): ~2× الذاكرة، ~1-2% جودة أفضل. نادراً ما يكون الأمر يستحق العناء.
- Q8_0: ~1.6× الذاكرة، لا يمكن تمييزه عن FP16.
- Q5_K_M: ~1.17× ذاكرة Q4_K_M، جودة أفضل بـ 0.5-1%. يستحق الأمر إذا كان لديك مساحة إضافية.
- Q4_K_M: التكميم الموصى به. أفضل توازن.
- Q3_K_M: ~0.82× الذاكرة، انخفاض الجودة بـ 4-7%. انحدارات واضحة.
- IQ2_XXS: ~0.59× الذاكرة، انخفاض الجودة بـ 15-25%. في الحالات الطارئة فقط.
الدليل الكامل للتكميم موجود في متطلبات VRAM لكل نموذج لغة كبير رئيسي.
المميزات والعيوب (مفتوح مقابل مغلق في 2026)
نماذج اللغات مفتوحة المصدر في 2026 — نقاط القوة
- أفضل النماذج المفتوحة تطابق أداء فئة GPT-4
- الخصوصية المحلية الكاملة + بدون تكاليف API
- قابلة للتخصيص / قابلة لضبط دقيق
- معمارات متعددة (كثيفة، MoE) لمقايضات مختلفة
القيود
- تكاليف الأجهزة تتراكم — $3K-12K للمستوى الأعلى محلياً
- أفضل النماذج المغلقة (GPT-5، Claude Opus 4.7) تتصدر في التفكير
- الكمون على الأجهزة الاستهلاكية أبطأ من السحابة
- نفقات الصيانة (التحديثات والمشغلات والتكميم)
الرافعة البرمجية: محرك الاستدلال الخاص بك يغير الإجابة
تفترض لوحة الترتيب أعلاه أنك تناسب نموذجاً بالكامل في VRAM وتشغله. في الممارسة العملية، فإن محرك الاستدلال الذي تختاره يمكن أن يتأرجح معدل الإنتاجية في العالم الحقيقي بمقدار يصل إلى حجم كامل على نفس الأجهزة، وأسلوب واحد يمكن أن يسمح لنموذج بالعمل على GPU تقول الجدول أنها صغيرة جداً. اختيار الأجهزة دون اختيار وقت التشغيل هو نصف قرار.
معسكران مهمان لمضيفي الخدمة الذاتية. vLLM (وتحسين محركات الإنتاجية المماثلة مثل SGLang) مبنية للتزامن: جدولة الدفع المستمر تحافظ على GPU مشبعة، لذا يمكن لبطاقة واحدة تخدم عدة طلبات متزامنة تقديم عدة أضعاف إجمالي الرموز في الثانية من إعداد بسيط. إذا كنت تبني تطبيقاً، أو واجهة برمجة تطبيقات داخلية، أو أي شيء متعدد المستخدمين، فهذا هو المعسكر الذي تريد أن تكون فيه. llama.cpp (and the front-ends built on it, Ollama و LM Studio) تُركِّز على مستخدم واحد وتوفير أقصى درجات المرونة: فهو يعمل على معظم الأنظمة تقريبًا، ويتعامل مع نماذج GGUF المُكمَّنة (Quants)، والأهم من ذلك أنه قادر على نقل أجزاء من النموذج إلى ذاكرة النظام (RAM). وعلى معالجات آبل Silicon، يملأ إطار عمل MLX نفس الدور الموجَّه لمستخدم واحد، ويستغل الذاكرة الموحَّدة بأقصى كفاءة ممكنة.
هذه القدرة على الانسكاب هي ما يجعل أكبر النماذج متاحة. تحمل نماذج الخليط من الخبراء مثل DeepSeek V3 إجمالي عدد معاملات ضخم لكن تفعل فقط شريحة صغيرة لكل رمز. llama.cpp expert-offload العلم (--n-cpu-moe) يحافظ على الطبقات النشطة دائماً على GPU ويدفع الخبراء النادرة اللمس إلى RAM. النتيجة: بطاقة 24 GB مقترنة بالكثير من ذاكرة النظام السريعة يمكن تشغيل نموذج MoE حدودي تقول جدول VRAM أنه لا يوجد عمل تشغيل له.
التحفظ الصريح هو السرعة. التنسيب التجاري مع السعة الكامنة. اعتماداً على مستوى الكم وعرض نطاق الذاكرة، توقع أي مكان من أرقام مفردة منخفضة من الرموز في الثانية على الإعدادات القوية إلى منتصف المراهقين — بشكل راسخ في منطقة «يعمل تقنياً»، ليس منطقة «الدردشة السريعة». الرافعة حقيقية، لكنها طريقة للوصول إلى نموذج لا تستطيع الوصول إليه بطريقة أخرى، وليست ترقية مجانية.
- البناء لعدة مستخدمين؟ اختر vLLM أو SGLang وحجم VRAM ليناسب النموذج بالكامل.
- مستخدم واحد، يريد أكبر نموذج على أجهزة متواضعة؟ استخدم llama.cpp مع MoE offload واسكب ميزانيتك في RAM وعرض نطاق الذاكرة، ليس فقط GPU.
- على ماك؟ تفضيل MLX أو Ollama؛ الذاكرة الموحدة بالفعل تفعل معظم وظيفة «الإزاحة» لك.
تحقق من هذه الأرقام في المصدر
تتغير المواصفات والأسعار دون إشعار. وهذه هي الصفحات الرسمية للمورِّدين لما ورد أعلاه:
الأسئلة الشائعة
هل لا تزال هناك نماذج لغوية كبيرة مفتوحة المصدر متاحة في عام 2026؟
نعم، تتوفر نماذج لغوية كبيرة مفتوحة المصدر على نطاق واسع في عام 2026، وعدة نماذج مغلقة منافسة لها. وتضم أبرز الخيارات في قائمة التصنيف المُقدَّمة من Hugging Face كلاً من: Llama 3.1 405B (النتيجة المركبة 87.4، وحجم الذاكرة نحو 244.5 جيجابايت)، وQwen 2.5 72B Instruct، وQwen 2.5 32B (19.8 جيجابايت)، وPhi-4 14B (77.8)، وDeepSeek V3 MoE (إجمالي 236 مليار معلَّمة، و21 مليار معلَّمة نشطة)، وكلُّها قابلة للتشغيل محليًّا عند توفر الأجهزة المناسبة.
هل نموذج اللغة مفتوح المصدر الأفضل فعلاً منافساً لـ GPT-4 في 2026؟
بالنسبة لمعظم المهام، نعم. Llama 3.1 405B و DeepSeek V3 يتفوقان على GPT-4 (القديم) في معظم المعايير العامة ويطابقان GPT-4.5 في كثير منها. يتخلفان عن GPT-5 / Claude Opus 4.7 في مهام التفكير والرياضيات والوكيل الأصعب. بالنسبة لمعظم المستخدمين، الفجوة إلى «الحدود المغلقة» يتم قياسها الآن بنقاط مئوية من رقم واحد.
لماذا يتم تصنيف DeepSeek V3 بدرجة عالية على الرغم من كونه MoE؟
نماذج MoE (Mixture of Experts) تفعّل فقط مجموعة فرعية من المعاملات لكل رمز. DeepSeek V3 إجمالي 236B لكن ~21B نشط فقط لكل رمز. لذا تحصل على معرفة نموذج أكبر بكثير بسرعة استدلال نموذج أصغر بكثير — عندما تناسب الذاكرة. إنها الخيار الأكثر عملية «جودة حدودية بسرعة أجهزة استهلاكية» في 2026.
هل يجب أن أضبط أحد هذه النماذج أم أستخدمه كما هو؟
استخدمه كما هو للمهام العامة. اضبط فقط إذا كان لديك حالة استخدام ضيقة ومتكررة (مثلاً أسلوب الكتابة الخاص بالمجال، تحليل المستندات القانونية) والديك ما لا يقل عن 500-1000 مثال تدريبي عالي الجودة. ضبط نموذج 70B يحتاج إلى أجهزة جادة.
ماذا عن Llama 4 / الإصدارات الجديدة؟
أكدت Meta على Llama 4 للإصدار في منتصف 2026 مع الالتزام المستمر بالأوزان المفتوحة. توقع 405B+ الرائدة والمتغيرات الأصغر المحسنة. سنحدّث هذا الترتيب عندما تصل المعايير الفعلية.
أي نموذج يجب أن أشغل على ماك ستوديو إم4 ماكس 128 GB؟
الأنسب: Qwen 2.5 72B عند Q5_K_M (51 GB) — يعمل بـ ~9 t/s، يترك مساحة كبيرة للسياق. للجودة العليا، Mistral Large 2 123B عند Q4 يناسب بشكل مريح. لسرعة MoE، Mixtral 8x22B ممتاز.
هل النماذج الأصغر (أقل من 7B) تستحق العناء؟
نعم، لحالات استخدام محددة. Phi-4 Mini 3.8B و Gemma 2 2B و SmolLM 1.7B جميعها تعمل بسرعة على الهواتف والأجهزة الطرفية. للدردشة العامة فهي ضعيفة بشكل ملحوظ مقارنة بنماذج 8B+، لكن للمهام الضيقة (التصنيف والاستخراج المنظم والترجمة البسيطة) فهي كافية.
هل GPU واحد كبير أم GPU أصغر أفضل لتشغيل هذه النماذج؟
للاستدلال البحت، بطاقة واحدة بـ VRAM كافية لعقد النموذج أبسط وتتجنب النفقات العامة لتقسيم الطبقات عبر الأجهزة. تكون بطاقتان منطقية عندما يكون الهدف هو VRAM إجمالية أكثر من أي GPU واحد ميسور التكلفة — على سبيل المثال إقران بطاقتين 24 GB لاستضافة نموذج لن يناسب واحداً. المقايضات حقيقية: GPU ثاني يضيف استهلاك الطاقة والحرارة وعنق الاختناق PCIe بين البطاقات وتكوين أكثر صعوبة. إذا كانت بطاقة واحدة يمكن أن تناسب نموذجك المستهدف بكم أنت راضٍ عنه، اشتري البطاقة الواحدة.
كم تبلغ تكلفة الكهرباء لتشغيل نموذج محلي 24/7?
استهلاك الطاقة العاطل والخفيف متواضع، لكن GPU عالي الجودة تحت حمل مستدام يمكن أن يسحب بضع مئات من الواط، وهذا يضيف إذا كانت الآلة دائماً قيد التشغيل. الخطوة العملية هي الحفاظ على الجهاز نائماً أو النموذج غير محمل عند الخمول، وتشغيل فقط تحت الطلب الحقيقي — تحمل معظم وقت التشغيل المحلي تحميل وتفريغ النماذج عند الطلب. بالنسبة للاستخدام الشخصي العرضي، تكون تكلفة التشغيل طفيفة؛ لنموذج يخدم حركة المرور على مدار الساعة، احسب الكهرباء في إجمالي تكلفة الملكية إلى جانب سعر الأجهزة.
هل يستحق تشغيل هذه النماذج محليًّا حقًّا، مع انخفاض أسعار واجهات البرمجة المُستضافة (Hosted APIs) إلى هذا الحد؟
يعتمد ذلك على سبب اختيارك للاستضافة الذاتية. فإذا كان هدفك الوحيد هو أدنى تكلفة ممكنة لكل رمز، فإن واجهات البرمجة المُستضافة لهذه النماذج المفتوحة نفسها لا يمكن منافستها من حيث التكلفة، ولا تتطلب أي عتاد على الإطلاق. أما الاستضافة المحلية فهي الأفضل عندما تحتاج إلى أن تبقى بياناتك على جهازك دون مغادرته أبدًا، أو عندما تريد ضمان توافر دائم دون قيود على معدل الاستخدام أو فوترة لكل رمز، أو عندما تقوم بمعالجة دفعات ضخمة حيث يُخفِّف امتلاك العتاد من التكلفة على المدى الطويل. وللمستخدمين العاديين، تظل واجهة البرمجة المُستضافة الخيار المنطقي، أما في حالات الخصوصية أو العمل دون اتصال أو الحاجة إلى إنتاجية عالية جدًّا، فإن الاستضافة المحلية تُحقِّق عائدًا مجزيًا.
الخلاصة
في 2026 يمكنك تشغيل قدرة فئة GPT-4 محلياً إذا كان لديك الأجهزة. السؤال هو: ما القدرة التي تحتاجها فعلاً، وأي مستوى أجهزة يطابق ذلك؟
- فئة 8B للاستخدام اليومي → أي جهاز كمبيوتر حديث به 12+ GB VRAM
- فئة 30B للمساعدة الجادة → RTX 4090 / 3090 24 GB
- فئة 70B للحصول على أفضل جودة مفتوحة → RTX 5090 32 GB أو M4 Max
- فئة 100B+ للنماذج المفتوحة المتقدمة → M4 Max 128 GB / Nvidia DIGITS / بناء متعدد GPU
- فئة 405B للأداء الأعلى → M4 Ultra 512 GB أو البنية التحتية للمؤسسات
استقرت السوق أخيراً على مجموعة حيث يكون الذكاء الاصطناعي المحلي قادراً على المنافسة بشكل حقيقي مع السحابة — حتى السحابة المغلقة. ما إذا كنت ستستخدم الخيار المحلي يعتمد في الغالب على ما إذا كانت رياضيات تكلفة الأجهزة تناسب أنماط الاستخدام لديك.
للجانب GPU من هذا القرار، راجع أفضل وحدات معالجة الرسومات (GPUs) للنماذج اللغوية الكبيرة المحلية دليل. وللجانب الكمبيوتر المحمول، يغطي أفضل أجهزة كمبيوتر محمولة للتعلم الآلي 2026 الخيارات المحمولة.
