Thursday, 23 July 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

أفضل النماذج المحلية للغة الكبيرة (LLMs) التي يمكن تشغيلها على منصة Ollama في عام ٢٠٢٦ (مرتبة حسب حالة الاستخدام)

محدّث · نُشِرت لأول مرة في 6 يونيو 2026

يمكن لمنصة Ollama تشغيل أكثر من مئة نموذج، وهذا بالضبط سبب تردد الناس عند اختيار أحدها. والخبر الجيد هو أنك تحتاج فقط إلى عدد قليل جدًا منها. ويصنّف هذا الدليل أفضل النماذج المحلية للغة الكبيرة في عام ٢٠٢٦ وفقًا للمهمة التي تحاول إنجازها — مثل العمل العام أو البرمجة أو الاستنتاج المنطقي أو التشغيل على أجهزة ذات مواصفات ضعيفة — مع تحديد الذاكرة المطلوبة لكل نموذج.

هل أنت جديد هنا؟ ابدأ بـ ما هي منصة Ollama؟، ثم تحقق من مواصفات جهازك قبل تنزيل أي شيء.

أبرز النقاط المستخلصة

  • أفضل أداة شاملة: Gemma 4 26B A4B — يدعم استدعاء الأدوات + الرؤية الحاسوبية، ويعمل بسلاسة، وهو الخيار الأكثر عملية لمعظم المستخدمين. ollama run gemma4
  • الأفضل للبرمجة: Qwen 3.6 27B — أقوى نموذج كثيف متخصص في البرمجة، وبأداء يبلغ نحو ٧٧٪ في اختبار SWE-bench، ويحتاج إلى نحو ٢٢ جيجابايت من ذاكرة VRAM.
  • الأفضل للاستنتاج المنطقي/الرياضيات: DeepSeek-R1 7B — أفضل أداء في سلسلة الاستنتاجات (chain-of-thought) ضمن النماذج الصغيرة القابلة للتشغيل.
  • الأفضل للأجهزة ذات المواصفات الضعيفة: Gemma2 2B — يعمل على نحو ١٫٧ جيجابايت من الذاكرة العشوائية (RAM)، ويمكن تشغيله بكفاءة على أجهزة كمبيوتر محمولة تعتمد فقط على وحدة المعالجة المركزية (CPU).
  • أكثر التراخيص التجارية أمانًا: يُوزَّع كلٌّ من نموذجي Qwen 3 وGemma 4 بموجب رخصة Apache 2.0.

كيف تفكر في اختيار النموذج المناسب

ثلاثة عوامل تحدد أي نموذج هو «الأفضل» بالنسبة لك، وبحسب هذه الأولوية:

  1. ما الذي تستوعبه مواصفات جهازك؟ يجب أن يتسع النموذج في ذاكرة RAM أو VRAM الخاصة بك (بالشكل المكمّن quantized). وأفضل نموذج لا يمكنك تشغيله سيكون عديم الفائدة. لا يمكنك تشغيله، لذا يجب أن تطابق حجم النموذج مع مواصفات جهازك باستخدام دليلنا الخاص بمتطلبات النظام دليل متطلبات النظام.
  2. ما طبيعة المهمة المطلوبة؟ تتطلب المهام المختلفة — كالبرمجة أو الدردشة العامة أو الاستنتاج المنطقي أو معالجة المستندات — نماذج مختلفة. فالخبير الممتاز في البرمجة ليس بالضرورة خبيرًا ممتازًا في الكتابة.
  3. هل يهم نوع الترخيص؟ إذا كنت تبني منتجًا تجاريًا، فافضل النماذج المرخصة بموجب رخصة Apache 2.0 (مثل Qwen 3 وGemma 4) على تلك المرخصة بموجب شروط أكثر تقييدًا.

الأفضل كنموذج شامل: Gemma 4 26B A4B

نموذج جوجل Gemma 4 26B A4B (الذي أُعلن عنه في أبريل ٢٠٢٦) هو النموذج الذي نختاره لمعظم المستخدمين كخيار أول. وهو نموذج يعتمد على مبدأ «مزيج الخبراء» (Mixture-of-Experts)، ويدعم استدعاء الأدوات والرؤية الحاسوبية بشكل مدمج، ويقدّم أداءً متفوقًا جدًا مقارنةً بحجم الذاكرة التي يستهلكها — ما يجعله مثاليًا للعملاء المحليين (local agents) واستدعاء الوظائف والمخرجات المنظمة. كما أنه مرخص بموجب رخصة Apache 2.0، ما يسمح لك باستخدامه تجاريًا.

ollama run gemma4

إذا كنت تبحث عن نموذج واحد يفي باحتياجات الدردشة العامة، والبرمجة الخفيفة، وتلخيص النصوص، ومهام العملاء الذكية، فهذا النموذج هو الخيار الآمن الافتراضي.

الأفضل للبرمجة: Qwen 3.6 27B

للكتابة وإعادة هيكلة التعليمات البرمجية محليًّا — دون إرسال سطر واحد إلى واجهة برمجة التطبيقات (API) — Qwen 3.6 27B هو أقوى نموذج تشفير كثيف يمكنك تشغيله محليًّا، ويحقِّق أداءً يبلغ نحو ٧٧٪ في اختبار SWE-bench ويتطلَّب ما يقارب ٢٢ جيجابايت من ذاكرة وحدة معالجة الرسومات (VRAM). وإذا كانت آلاتك قادرة على استيعابه، فهو أقرب ما يكون إلى مساعد تشفير سحابي لا يتواصل مع أي خادم خارجي أبدًا.

هل تعمل على أجهزة ذات مواصفات أقل؟ انتقل إلى نسخة أصغر من نموذج Qwen المُخصَّص للتشفير، أو استخدم Gemma 4. وللاطّلاع على التفصيل الكامل لأفضل النماذج المحلية المُوجَّهة للتشفير وكيفية أدائها في المهام الواقعية، راجع دليلنا الخاص بأفضل نموذج لغوي كبير محلي للتشفير: أفضل نموذج لغوي كبير محلي للتشفير.

الأفضل للاستنتاج المنطقي والرياضيات: DeepSeek-R1 7B

DeepSeek-R1 7B هو نموذج يعتمد على سلسلة الاستنتاجات (chain-of-thought)، ويقدِّم أفضل أداء محلي في مجال الرياضيات والاستدلال ضمن فئة النماذج ذات الحجم ٧ مليار معلَّمة (7B). وبما أنه «يتفكر» في المشكلات خطوة بخطوة، فهو الخيار الأمثل عندما تكون الدقة في المنطق متعدد الخطوات أهم من السرعة. وبحجم ٧ مليار معلَّمة، فإنه يعمل بسلاسة على أجهزة ذات مواصفات متوسطة، ما يجعله نموذج استدلالٍ سهل الوصول إليه بشكل غير مألوف.

ollama run deepseek-r1

الأفضل للأجهزة ذات المواصفات الضعيفة: Gemma2 2B

لا تمتلك وحدة معالجة رسومات مخصصة (GPU)؟ Gemma2 2B هو أسرع خيار للاستدلال على وحدة المعالجة المركزية (CPU)، ويحتاج فقط إلى نحو ١٫٧ جيجابايت من الذاكرة العشوائية (RAM). وقد لا يتفوَّق في الاختبارات القياسية، لكنه عمليٌّ فعليًّا في مهام التلخيص، والإجابة على الأسئلة البسيطة، وكتابة المسودات على أجهزة لابتوب أساسية — ما يثبت أنك لست بحاجة إلى محطة عمل لبدء استخدام الذكاء الاصطناعي محليًّا.

الأفضل للتطبيقات المؤسسية على نطاق واسع: Qwen3 235B-A22B

إذا كنت تمتلك أجهزة قوية جدًّا وتبحث عن نموذج مفتوح المصدر من الطراز الأوَّلي مع رخصة واضحة، فإن Qwen3 235B-A22B يُعدُّ أحد أكثر الخيارات أمانًا للمؤسسات: فهو نموذج يعتمد على مبدأ «مزيج الخبرات» (Mixture-of-Experts) ويحتوي على ٢٣٥ مليار معلَّمة إجمالًا، لكنه يستخدم فقط ٢٢ مليار معلَّمة نشطة لكل رمز (token)، ومرخَّص بموجب رخصة Apache 2.0. وهو مناسب جدًّا للتطبيقات متعددة اللغات والمنتجات التجارية — شريطة أن تمتلك الذاكرة الكافية لاستضافته.

مقارنة سريعة

النموذجالأفضل لـالذاكرة التقريبيةالترخيص
Gemma 4 26B A4Bعام / وكلاء / رؤية حاسوبيةوحدة معالجة رسومات متوسطة المواصفاتApache 2.0
Qwen 3.6 27Bالبرمجةنحو ٢٢ جيجابايت من VRAMApache 2.0
DeepSeek-R1 7Bالاستدلال / الرياضياتمتوسطة المواصفاتMIT
Gemma2 2Bأجهزة ضعيفة / تعتمد فقط على وحدة المعالجة المركزيةنحو ١٫٧ جيجابايت من RAMرخصة Gemma
Qwen3 235B-A22Bللمؤسسات / متعدد اللغاتعالية جدًّاApache 2.0

مسار قرار بسيط

  • نموذج واحد يغطي جميع المهام → Gemma 4.
  • معظم المهام تتعلَّق بالتشفير، وتمتلك وحدة معالجة رسومات قوية → Qwen 3.6 27B.
  • مهام استدلال صعبة أو رياضية → DeepSeek-R1.
  • لابتوب قديم بدون وحدة معالجة رسومات → Gemma2 2B.
  • لتطوير منتج تجاري → الالتزام بالنماذج المرخَّصة بموجب رخصة Apache 2.0 (مثل Qwen 3 وGemma 4).

أيًّا كان النموذج الذي تختاره، فإن الأمر المستخدم هو نفسه — ollama run <model> — ويمكنك ترك عدة نماذج مُثبَّتة في وقت واحد والتبديل بينها بحرية. ولتشغيل أيٍّ منها، ستحتاج أولًا إلى تثبيت Ollama: إليك دليل التثبيت التدريجي الخاص بنا: دليل التثبيت التدريجي.

التكمين (Quantization): لماذا قد يحتاج نفس النموذج إلى ٤ جيجابايت أو ١٤ جيجابايت؟

كل رقم متعلق بالذاكرة الظاهرة (VRAM) في هذا الدليل هو في الحقيقة رقم يعبّر عن مستوى التكميم (quantization). فالأوزان الأصلية للنموذج تُوزَّع بدقة 16 بت (FP16)، لكن أداة Ollama تقوم بضغطها قبل تشغيلها على جهازك — وهذا المستوى من الضغط، وليس عدد المعايير (parameters) وحده، هو ما يقرّر ما إذا كان النموذج سيتّسع على جهازك أم لا. وعندما تُجرّب الأمر عبر الأمر ollama run gemma4 بدون تحديد علامة (tag)، فإن أداة Ollama تقوم تلقائيًّا بتنزيل إصدار Q4_K_M مُكمَّم بـ 4 بت افتراضيًّا: وهو مستوى التكميم الذي أصبح المعيار الفعلي لمعظم أجهزة المستهلكين.

وتكون التوفيرات كبيرة جدًّا. فنموذج بحجم 7 مليار معامل (7B) يستهلك نحو 14 غيغابايت عند دقة FP16، وحوالي 7.7 غيغابايت عند تكميم Q8_0، وفقط نحو 4.5 غيغابايت عند تكميم Q4_K_M. ولذلك فإن الإصدار الافتراضي ذا الـ 4 بت هو ما يجعل نموذج الاستنتاج (reasoning) بحجم 7B يتّسع بسهولة على بطاقة رسومية سعة 8 غيغابايت مع وجود هامش كافٍ، كما أنه السبب في أن الرقم «22 غيغابايت» الخاص بنموذج البرمجة (coder) بحجم 27 مليار معامل (27B) ليس 50 غيغابايت أو أكثر. أما الخسارة في الجودة فهي أصغر مما يتوقّعه معظم الناس: إذ يفقد تكميم Q4_K_M عادةً فقط 1–3% من الأداء في الاختبارات القياسية مثل MMLU مقارنةً بالدقة الكاملة — أي أن نموذجًا بحجم 7B يحقّق نسبة 73% عند دقة FP16، سيحقق عادةً نحو 71–72%. وفي الواقع، تظهر هذه الخسارة في صورة إعادة صياغة عرضية لجملة ما، وليس في إعطاء إجابات خاطئة.

إذن متى ينبغي لك الانتقال عن الإصدار الافتراضي؟

  • ابقَ على تكميم Q4_K_M للدردشة والكتابة الأولية والتلخيص وأعمال الوكلاء العامة. فهو أفضل توازن بين الجودة والاحتياجات الذاكرة، نقطة.
  • ارتقِ إلى تكميم Q8_0 (شبه خالٍ من الخسائر، لكنه يستهلك ضعف الذاكرة تقريبًا) فقط عند توليد الأكواد أو عند الحاجة إلى استنتاج دقيق جدًّا، حيث يؤدي خطأ واحد في رمز (token) إلى إفساد المخرجات بالكامل — وذلك فقط إن توفر لديك هامش كافٍ من الذاكرة الظاهرة (VRAM).
  • انزل إلى تكميم Q3 أو أقل كحل أخير لتشغيل نموذج أكبر على بطاقة ذات سعة محدودة. وستشعر حينها بانخفاض ملحوظ في الجودة، بينما يكون اختيار نموذج أصغر مع تكميم Q4 غالبًا الخيار الأفضل من حيث التوازن.

ويمكنك تنزيل مستوى تكميم محدّد بإلحاق العلامة المناسبة باسم النموذج: ollama run qwen3.6:27b-q8_0 بدلًا من استخدام الاسم فقط دون علامة. والقاعدة العامة التي تنطبق على جميع الأجهزة هي: نموذج أكبر مع تكميم Q4 يتفوّق دائمًا تقريبًا على نموذج أصغر مع تكميم Q8 في حدود نفس ميزانية الذاكرة. والتكميم هو ما يمكنّك من تشغيل النموذج الذي تريده فعلًا — لذا ابدأ دائمًا باختيار أكبر نموذج يتّسع لجهازك عند تكميم Q4_K_M، ثم ارفع دقة التكميم فقط إذا طالبت الجودة بذلك وتوافرت لديك الذاكرة الظاهرة الكافية.

الأسئلة الشائعة

ما أفضل نموذج Ollama لعام ٢٠٢٦؟

لأغلب المستخدمين، نموذج Gemma 4 26B A4B — فهو نموذج متعدد المهارات قادر على تنفيذ المهام المختلفة، ويدعم استدعاء الأدوات والرؤية الحاسوبية، ومرخَّص بموجب رخصة Apache 2.0، ويتطلَّب ذاكرة معقولة نسبيًّا. أما بالنسبة للتشفير تحديدًا، فيتفوَّق عليه نموذج Qwen 3.6 27B؛ وفي مجال الاستدلال، فيتفوَّق عليه نموذج DeepSeek-R1.

ما أفضل نموذج لغوي كبير محلي للأجهزة منخفضة المواصفات؟

Gemma2 2B. فهو يعمل باستخدام نحو ١٫٧ جيجابايت من الذاكرة العشوائية (RAM)، ويعمل على أجهزة لابتوب تعتمد فقط على وحدة المعالجة المركزية. وإذا كانت لديك مساحة أكبر قليلًا، فإن نموذجًا بحجم ٧–٨ مليار معلَّمة مثل DeepSeek-R1 7B يقدِّم جودة أعلى ملحوظةً مع بقائه مناسبًا للأجهزة ذات المواصفات المتواضعة.

أي نموذج محلي يشبه ChatGPT أكثر ما يمكن؟

إن أكبر النماذج المفتوحة المصدر التي يمكنك استضافتها محليًّا — مثل Qwen3 235B-A22B — تقلِّل الفجوة معه كثيرًا، لكن أفضل النماذج السحابية الطليعية لا تزال متقدِّمة في أصعب مهام الاستدلال. أما في المحادثات اليومية، والتشفير، ومعالجة المستندات، فإن النموذج المحلي المختار بعناية كافٍ تمامًا، ويحافظ على خصوصية بياناتك.

هل أحتاج إلى وحدة معالجة رسومات قوية لهذه النماذج؟

يعتمد ذلك على النموذج. فنموذج Gemma2 2B يعمل على وحدة المعالجة المركزية؛ بينما يكفي ٨ جيجابايت من الذاكرة لتشغيل نموذج بحجم ٧ مليار معلَّمة بسلاسة؛ أما نموذج Qwen 3.6 27B فيتطلَّب نحو ٢٢ جيجابايت من VRAM. واجعل اختيارك للنموذج متناسبًا مع مواصفات جهازك باستخدام دليلنا: دليل متطلبات النظام.

هل هذه النماذج مجانية للاستخدام التجاري؟

يأتي كلٌّ من Qwen 3 وGemma 4 بموجب رخصة Apache 2.0، وهي رخصة مرنة تسمح بالاستخدام التجاري. أما DeepSeek-R1 فهو مرخَّص بموجب رخصة MIT. وتأكد دائمًا من رخصة النموذج المحدَّد قبل طرح منتجك، لأن الشروط قد تختلف باختلاف الإصدار.

كيف أحمّل إصدارًا أعلى جودةً وأقل ضغطًا من نموذج ما؟

أضف علامة التكميم إلى اسم النموذج. الأمر ollama run qwen3.6:27b يقدّم لك الإصدار الافتراضي Q4_K_M؛ بينما الأمر ollama run qwen3.6:27b-q8_0 يُحمّل الإصدار شبه الخالي من الخسائر ذا الـ 8 بت من النموذج، والذي يضاعف تقريبًا حجم الذاكرة المطلوبة. ويمكنك تصفّح صفحة النموذج على موقع ollama.com للاطّلاع على جميع العلامات المتاحة فعليًّا لهذا النموذج — وتتبع أسماء العلامات نمط نفس النموذج:الحجم-التكميم model:size-quant وبالنسبة للدردشة والاستخدام العام، فإن الإصدار الافتراضي Q4_K_M هو الخيار الأمثل؛ أما تكميم Q8_0 فيُحتَرَز له لمهام البرمجة أو الاستنتاج الدقيق فقط، عندما تكون لديك هامش كافٍ من الذاكرة الظاهرة.

هل يمكنني تشغيل أكثر من نموذج في الوقت نفسه؟

نعم، لكنها تتشارك في ذاكرتك. فتقوم أداة Ollama بتحميل النموذج عند الطلب والاحتفاظ به في الذاكرة لبضع دقائق، لذا فإن التبديل بين نموذجين مثل Gemma 4 وDeepSeek-R1 يكون فوريًّا بمجرد تثبيت كليهما — لكن تشغيلهما معًا يعني أن احتياجاتهما الذاكرة تتراكم. وعلى بطاقة رسومية واحدة سعة 8–16 غيغابايت، يمكنك توقع تشغيل نموذج واحد قوي في كل مرة، مع ترك أداة Ollama تقوم بالتبديل بين النماذج تلقائيًّا عند استدعائك لكل منها. ويمكنك تثبيت عدد غير محدود من النماذج حسب الرغبة؛ فالمستهلك الفعلي للذاكرة الظاهرة (VRAM) هو فقط النماذج النشطة.

لماذا يتباطأ نموذجي أو ينفذ ذاكرته عند معالجة مستندات طويلة؟

لأن السياق يستهلك ذاكرة ظاهرة (VRAM). فبالإضافة إلى أوزان النموذج نفسها، تقوم أداة Ollama بتخصيص ذاكرة تخزين مؤقتة للقيم المفتاحية (KV cache) تزداد حجمًا بشكل خطي مع اتساع نافذة السياق، وتكيّف أداة Ollama الحديثة افتراضيًّا حجم السياق مع قدرات جهازك (حوالي 4 آلاف رمز token عند سعة VRAM أقل من 24 غيغابايت، وتزداد إلى 32 ألف رمز عند سعة 24–48 غيغابايت، وإلى 256 ألف رمز عند السعات الأعلى من ذلك). وقد يؤدي إدخال مستند طويل أو سجل دردشة مطوّل إلى إضافة غيغابايتات من الذاكرة المؤقتة، ما يخفض بشدة معدل المعالجة بالرموز في الثانية. وإذا واجهت حدودًا، فاختصر طول السياق، أو فعّل تكميم الذاكرة المؤقتة KV-cache، الذي قد يقلّل هذه التكلفة بنسبة تقارب النصف مع تأثير ضئيل جدًّا على الجودة.

الخلاصة

لست بحاجة إلى اختبار مئة نموذج — بل تحتاج فقط إلى أربعة أو خمسة نماذج مناسبة. استخدم Gemma 4 كنموذج افتراضي، وQwen 3.6 عند التشفير، وDeepSeek-R1 عند الحاجة إلى الاستدلال، وGemma2 2B عند محدودية المواصفات. وكلٌّ منها لا يحتاج سوى أمر واحد: ollama run ولجميعها تبقى بياناتك على جهازك الشخصي.

انتقل إلى الأعلى
Featured on There's An AI For That