Thursday, 24 September 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

مقارنة Llama 4 Scout مع Llama 4 Maverick: المواصفات، الأسعار واختيار الأنسب (2026)

مُحدَّث · نُشِر لأول مرة في 23 يونيو 2026

أطلقت شركة Meta Llama 4 Scout و Llama 4 Maverick في اليوم نفسه — 5 أبريل 2025 — ومن السهل قراءتهما على أنهما «النموذج الصغير» و«النموذج الكبير». لكن هذه الصيغة خاطئة من حيث الجانب الأهم الذي يؤثر على فاتورتك. فكلا النموذجين يفعّلان 17 مليار معلَّمة بالضبط لكل رمز. أما ما يختلف فهو حجم مجموعة الخبراء التي تُستقى منها تلك الـ 17 مليار معلَّمة: فهي 16 خبيرًا في Scout، و128 خبيرًا في Maverick. وكل ما عدا ذلك — الفارق في السعر، والفارق في المتطلبات المادية، والفارق في الأداء في الاختبارات القياسية — ينتج مباشرةً عن هذا القرار المعماري الوحيد.

وهذا يعني أيضًا أن الحدس المألوف «كلما كان النموذج أكبر، كانت إجاباته أفضل» لا ينطبق هنا. فحجم Maverick الإجمالي أكبر بمعامل 3.7 مقارنةً بـ Scout، لكن أداؤه لا يكون أفضل بمعامل 3.7، بل وعلى بعض الاختبارات القياسية لا يكون أداؤه أفضل إطلاقًا. وفيما يلي المقارنة الكاملة جنبًا إلى جنب، المستندة إلى بطاقة المواصفات الرسمية التي نشرتها شركة Meta وأسعار موفري الخدمة الفعلية — بما في ذلك المواصفة الوحيدة التي يتم الاستشهاد بها باستمرار، والتي تكون عمليًّا غير متوفرة.

أبرز النقاط المستخلصة

  • عدد المعلمات الفاعلة متماثل، لكن مجموعات الخبراء مختلفة. Scout يحتوي على 109 مليار معلَّمة إجمالية / 17 مليار معلَّمة فاعلة عبر 16 خبيرًا. أما Maverick فيحتوي على 400 مليار معلَّمة إجمالية / 17 مليار معلَّمة فاعلة عبر 128 خبيرًا. وبالتالي فإن حساب الاستنتاج لكل رمز متطابق تقريبًا؛ لكن البصمة الذاكرة ليست كذلك.
  • سعة السياق البالغة 10 ملايين رمز في Scout حقيقية، لكنك على الأرجح لن تتمكن من استئجارها. درّبت شركة Meta نموذج Scout ليتعامل مع 10 ملايين رمز. أما مقدمو الخدمة المُستضافين فيقدمون سعات تتراوح بين 128 ألف رمز وحوالي 1.3 مليون رمز. أما تحقيق السعة الكاملة البالغة 10 ملايين رمز فيتطلّب الاستضافة الذاتية وذاكرة KV ضخمة جدًّا.
  • الميزة التنافسية لـ Maverick تتركّز في مجالات الاستنتاج والبرمجة. تحسّن بنسبة +12.6 نقطة في اختبار GPQA Diamond، و+10.6 نقطة في LiveCodeBench. أما في فهم المستندات فالأداء متساوٍ بينهما — فنتيجة DocVQA هي 94.4 لكليهما.
  • تكلفة Scout أقل بنحو 2.3× على أساس مدمج (0.15 دولار مقابل 0.35 دولار لكل مليون رمز مدمج عند نسبة إدخال إلى إخراج تبلغ 3:1).
  • أما الفرق الحقيقي فيتضح عند التشغيل المحلي على الأجهزة. يتناسب Scout مع بطاقة H100 واحدة سعة 80 جيجابايت عند التكميم بـ 4 بت؛ أما Maverick فيحتاج إلى نحو 240 جيجابايت عند التكميم بـ 4 بت، وإلى مضيف كامل مكوّن من 8 وحدات GPU عند استخدام تنسيق FP8.
  • اعتبر نتيجة LMArena الشهيرة البالغة 1417 نقطة الخاصة بـ Maverick غير صالحة. فقد اشتقّت تلك النتيجة من نسخة تجريبية غير منشورة من النموذج المخصّص للدردشة، وليس من الأوزان القابلة للتنزيل.

النسخة المختصرة في 30 ثانية

اختر Scout إذا كنت تعمل على مهام تتطلب معالجة مستندات طويلة أو استرجاع المعلومات أو التلخيص أو التعرف الضوئي على الحروف (OCR) أو استخراج المخططات أو النماذج، أو أي مهمة ذات حجم كبير تتفاقم فيها تكلفة كل رمز — ولا سيما إذا كنت ترغب في الاستضافة الذاتية على وحدة GPU واحدة. اختر Maverick إذا كانت مهامك تتطلب حقًّا معالجة استنتاجية أو برمجية، حيث تؤتي ميزته المزدوجة الأرقام في اختباري GPQA Diamond وLiveCodeBench ثمارها لتغطية التكاليف الإضافية للمعدات والإنفاق. أما بالنسبة لمعظم خطوط معالجة المستندات والاستخراج، فإن دفع 2.3× أكثر مقابل Maverick لا يمنحك تقريبًا أي تحسّن قابل للقياس.

البنية المعمارية: مقبض واحد يولّد نموذجين مختلفين جدًّا

كلا النموذجين هما نماذج تحويلية تعتمد على مزيج من الخبراء (MoE)، وتستخدم ما تسمّيه شركة Meta الاندماج المبكر (early fusion) للوظائف متعددة الوسائط الأصلية — بحيث تدخل رموز الصور والنص إلى نفس العمود الفقري (backbone) بدلًا من ربطها بواسطة مُكيّف بصري منفصل. وكلا النموذجين يقبلان النصوص والصور ويخرجان نصًّا. وكلاهما يعتمد على معلومات حتى أغسطس 2024.

أما الاختلاف الجوهري فيكمن في وحدة التوجيه (router). فـ Scout يختار من بين 16 خبيرًا، بينما يختار Maverick من بين 128 خبيرًا. وبما أن 17 مليار معلَّمة فقط تُفعَّل لكل رمز في كلتا الحالتين، فإن التكلفة الحاسوبية لكليهما متشابهة تقريبًا الحسابية لكل رمز — لكن كل خبير يجب أن يكون موجودًا في الذاكرة سواء أُفعِّل في رمز معين أم لا. ولذلك فإن حجم الذاكرة المطلوب لـ Maverick أكبر بمعامل 3.7 مقارنةً بـ Scout، رغم أن بطء الأداء لكل رمز طفيف جدًّا، وهذا هو السبب في أن نموذجًا نادرًا (sparse) بحجم 400 مليار معلَّمة يمكن تقديمه بأسعار لا يمكن أن تُحقَّق لو كان النموذج كثيفًا (dense) بحجم 400 مليار معلَّمة.

وهناك فرقٌ آخر يستحق الذكر: فقد درّب Scout على نحو 40 تريليون رمز، بينما درّب Maverick على نحو 22 تريليون رمز. أي أن Scout رأى بيانات أكثر موزَّعة على عدد أقل من الخبراء، بينما رأى Maverick بيانات أقل موزَّعة على عدد أكبر بكثير من الخبراء. وهذا يفسّر لماذا يحافظ Scout على أدائه القوي في مهام اتساع المعرفة وفهم المستندات، بينما يتأخر في المهام الاستنتاجية الصعبة.

نافذة السياق: 10 ملايين رمز على الورق، وأقل بكثير في الواقع

هذه هي أكثر الأرقام استشهادًا وأكثرها مضلّلة في إطلاق Llama 4. فشركة Meta تروّج لـ «نافذة سياق رائدة في القطاع بطول 10 ملايين رمز» لـ Scout، وهي محقَّقة عبر تصميم انتباه متداخل (interleaved-attention) دون استخدام تضمينات موضعية (positional embeddings). أما Maverick فيأتي بسعة سياق تبلغ مليون رمز.

المشكلة: في الواقع، لا يقدم أي مزوّد خدمة مستضاف فعليًّا سعة 10 ملايين رمز. أما السعات الفعلية فهي على النحو التالي: نحو 128–131 ألف رمز لدى Groq، ونحو 320 ألف رمز لدى DeepInfra، ونحو 328 ألف رمز لدى Together، ونحو مليون رمز لدى Fireworks، بينما تظهر قائمة Scout على OpenRouter سعة 1,310,720 رمزًا مع حد أقصى للإكمال يبلغ 16,384 رمزًا. وللاستفادة الفعلية من السعة الكاملة البالغة 10 ملايين رمز، عليك الاستضافة الذاتية، وعندها تواجه القيد الحقيقي: ذاكرة KV. فعند أعماق تتجاوز الملايين من الرموز، تفوق هذه الذاكرة حجم أوزان النموذج نفسه، وهذا بالضبط سبب وضع موفري الخدمة لهذا الحد.

وبالتالي فإن المقارنة الصادقة ليست «10 ملايين مقابل مليون رمز»، بل هي أقرب إلى ~1.3 مليون مقابل ~1 مليون رمز على المنصات التي سيستخدمها معظم الناس فعليًّا — وهي ميزة حقيقية لـ Scout، لكنها ميزة ضيقة نسبيًّا بدلًا من الفارق عشرة أضعاف الذي توحي به ورقة المواصفات. فإذا كانت لديك متطلبات فعلية تتجاوز الملايين من الرموز، فخصص ميزانية للاستضافة الذاتية وجرّب معدل الإنتاجية عند الأعماق الكبيرة قبل الالتزام.

الاختبارات القياسية: حيث تظهر المعلَّمات الإضافية البالغة 291 مليار معلَّمة

جميع الأرقام الواردة أدناه هي نتائج شركة Meta المنشورة رسميًّا للإصدارات المُوجَّهة (Instruct variants). وهي أرقام أولية من الجهة المصنِّعة، لذا ينبغي قراءتها كمؤشرات توجيهية بدلًا من نتائج نهائية مقررة.

معيار الأداء (Benchmark) Llama 4 Scout Llama 4 Maverick فجوة
MMLU Pro (الاستنتاج) 74.3 80.5 +6.2
GPQA Diamond (العلوم العليا) 57.2 69.8 +12.6
LiveCodeBench (البرمجة) 32.8 43.4 +10.6
MMMU (الاستنتاج المرتبط بالصور) 69.4 73.4 +4.0
MMMU Pro 52.2 59.6 +7.4
MathVista 70.7 73.7 +3.0
ChartQA 88.8 90.0 +1.2
DocVQA (الاختبار) 94.4 94.4 0.0
MGSM (الرياضيات متعددة اللغات) 90.6 92.3 +1.7
نصف كتاب MTOB (من الإنجليزية إلى الكاراجاواي) 42.2 54.0 +11.8

شكل هذه الجدول هو الحجة بأكملها. والميزة التنافسية لنموذج Maverick هي كبيرة وثابتة في مجالات الاستدلال والعلوم والبرمجة — حيث حقق تحسُّنًا نسبيًّا بنسبة 22% على اختبار GPQA Diamond، وتحسينًا نسبيًّا بنسبة 32% على اختبار LiveCodeBench. أما في مجال فهم المستندات والرسوم البيانية، فإن أداؤه ينهار تمامًا: ليصل إلى 1.2 نقطة فقط في اختبار ChartQA، ونتيجة تعادل تام في اختبار DocVQA.

إذا كان سير عملك يشمل استخراج الفواتير أو تحليل النماذج أو التعرف الضوئي على المعطيات في الإيصالات أو قراءة الرسوم البيانية، فإن الأرقام التي أعلنتها شركة Meta نفسها تشير إلى أن نموذج Maverick لن يقرأ مستنداتك أفضل من نموذج Scout — بل وستدفع تقريبًا ما يعادل 2.3 ضعف السعر لكل رمز للوصول إلى هذا المستوى من الأداء المتكافئ. وهذه هي النتيجة الأكثر جوهرية وقابلية للتطبيق في هذا التحليل.

ويجب تجاهل اختبار أداء واحد تمامًا: درجة LMArena ELO البالغة 1417التي أُعلن عنها على نطاق واسع لنموذج Maverick. فقد قدَّمت شركة Meta نسخة «تجريبية للدردشة» لم تُطرح أبدًا للتنزيل أو للوصول العام عبر واجهة برمجة التطبيقات (API)، كما وجد الباحثون أن مخرجات هذه النسخة لا تتطابق مع أوزان النموذج المنشورة على منصة Hugging Face. ولذلك عدَّلت منصة LMArena سياستها في 8 أبريل 2025 لتتطلب أن تتطابق إدخالات النماذج المفتوحة الوزن مع الأوزان المنشورة فعليًّا، مشيرةً إلى أن تفسير شركة Meta للقواعد لم يتطابق مع ما تتوقعه المنصة من موفِّري النماذج. أما الأوزان العامة غير المُعدَّلة المنشورة علنًا، فقد حقَّقت ترتيبًا بعيدًا جدًّا عن تلك الدرجة. وبغض النظر عن جودة الأداء التحويلي الفعلية لنموذج Maverick، فإن الرقم 1417 ليس دليلًا عليها.

المتطلبات المحلية للأجهزة: الـ VRAM عند تنسيقات FP16 وFP8 و4-bit

وتُحسب الذاكرة المطلوبة للأوزان ببساطة كحاصل ضرب عدد المعايير في عدد البايتات لكل معيار، ثم تُضاف نسبة تقارب 15–25% لحساب ذاكرة KV cache والمعالجة النشطة عند أطوال السياق المعقولة. أما عند أطوال السياق الطويلة، فترتفع متطلبات الذاكرة الخاصة بالـ cache بشكل كبير.

الدقة Scout (109 مليار معلمة) Maverick (400 مليار معلمة)
أوزان BF16/FP16 حوالي 218 غيغابايت حوالي 800 جيجابايت
أوزان FP8 حوالي 109 غيغابايت نحو 400 جيجابايت
أوزان INT4 حوالي 55 غيغابايت حوالي 200 غيغابايت
INT4 عملي (مع الهوامش الإضافية) ~65 جيجابايت ~240 جيجابايت
الحد الأدنى الواقعي من الأجهزة بطاقة واحدة من نوع H100 بسعة 80 غيغابايت، أو جهاز Mac بسعة 128 غيغابايت خادوم متعدد البطاقات الرسومية (4 بطاقات H100 تعمل بتقنية التكميم 4-bit)

وقد أشارت شركة Meta صراحةً إلى أن نموذج Scout «يتناسب مع بطاقة رسومية واحدة من نوع NVIDIA H100» عند استخدام تقنية التكميم INT4، وأن نموذج Maverick «يتناسب مع عقدة واحدة من نوع H100» — لاحظ كلمة عقدةوهذا يعني عقدة تحتوي على 8 بطاقات رسومية، وليس بطاقة واحدة فقط. إذ توفر عقدة مكوَّنة من 8 بطاقات H100 ما مجموعه 640 غيغابايت من الذاكرة، وهي كافية بسهولة لتشغيل نموذج Maverick بصيغة FP8، لكنها ليس غير كافية لتشغيله بصيغة BF16، حيث تتجاوز وحدها أوزان النموذج 800 غيغابايت، أي أكثر من سعة العقدة بكثير. أما تشغيل نموذج Maverick بكامل دقة أوزانه فيتطلب ذاكرة من فئة H200 أو استخدام عقدتين.

وبشكل عملي: فإن نموذج Scout هو نموذج يمكن تشغيله على بطاقة رسومية واحدة أو محطة عمل واحدة، وهو أحد أكثر النماذج قدرةً التي يمكن تشغيلها على جهاز Mac Studio بسعة 128 غيغابايت. أما نموذج Maverick فهو مخصص حصريًّا لمراكز البيانات. ويمكنك استخدام حاسبة الذاكرة VRAM هذه الأداة

المواصفاتLlama 4 ScoutLlama 4 Maverick
المطوّرميتاميتا
النوعمتعدد الوسائط (MoE)متعدد الوسائط (MoE)
عدد المعايير (البارامترات)إجمالي 109 مليار معامل / 17 مليار معامل نشطة (MoE)400 مليار مُعامل إجمالي / 17 مليار مُعامل نشط (MoE)
نافذة السياق10 ملايينمليون
النمطنص، صورة → نصنص، صورة → نص
الترخيصLlama 4 Community (مقيد في الاتحاد الأوروبي)Llama 4 Community (مقيد في الاتحاد الأوروبي)
أوزان مفتوحة المصدر✅ نعم✅ نعم
سعر الإدخال (بالدولار لكل مليون رمز)$0.1$0.2
سعر الإخراج (بالدولار لكل مليون رمز)$0.3$0.8
ذاكرة الفيديو (VRAM) بتنسيق 4 بت~65 جيجابايت~240 جيجابايت
حد أدنى من وحدات معالجة الرسومات (GPU) للمعالجة المحليةبطاقة رسوميات H100 بسعة 80 جيجابايت / ماك بسعة 128 جيجابايتخادوم متعدد وحدات معالجة رسومية (Multi-GPU)
أُطلِقَ20252025

أبرز الاختلافات

  • التكلفة: نموذج Llama 4 سكاوت هو أرخص بنسبة 133% من نموذج Llama 4 ماڤرك من حيث متوسط تكلفة الرمز الواحد.
  • السياق: يتفوق نموذج Llama 4 سكاوت في نافذة السياق (10 ملايين مقابل 1 مليون رمز)، ما يجعله أكثر ملاءمةً للمستندات الطويلة وقواعد التعليمات البرمجية الكبيرة ومدخلات أنظمة الاسترجاع المعزَّزة RAG الضخمة.
  • درجة الانفتاح: كلا النموذجين يمتلكان أوزانًا مفتوحة المصدر، وبالتالي يمكن استضافتهما محليًّا أو تخصيصهما حسب الحاجة. قارن احتياجاتهما من ذاكرة الفيديو (VRAM) أعلاه لمعرفة ما إذا كانت وحدة معالجة الرسومات لديك قادرة على تشغيل أحدهما.
  • تشغيل نموذج Llama 4 سكاوت محليًّا: ~65 جيجابايت عند التكميم بـ 4 بت (الحد الأدنى المطلوب: بطاقة رسوميات H100 بسعة 80 جيجابايت أو ماك بسعة 128 جيجابايت).
  • تشغيل Llama 4 Maverick محليًّا: ~~240 جيجابايت عند التكميم بت 4 (بحد أدنى خادوم متعدد وحدات معالجة رسومية).

أيُّها يجب أن تختار؟

اختر نموذج Llama 4 Scout إذا كنت تبحث عن أقل تكلفة لكل رمز في مهام ذات حجم عالٍ، أو إذا كنت بحاجة إلى نافذة سياق أكبر.

اختر Llama 4 Maverick إذا كان يتناسب مع هيكل نظامك الحالي أو إذا كنت تفضِّل منتجات شركة ميتا.

→ قَدِّر التكاليف الفعلية في حاسبة تكلفة واجهة برمجة التطبيقات (API) · تحقق من الأجهزة المحلية في حاسبة الذاكرة VRAM · استعرض جميع أكثر من 30 نموذجًا.

أسعار واجهات برمجة التطبيقات عبر موفري الخدمة

ولا يُصنَّف أيٌّ من النموذجين على أنه باهظ الثمن مقارنةً بالنماذج الرائدة؛ فكلاهما مُسعَّر كنموذج مفتوح الوزن للتشغيل الاستدلالي (inference) ضمن فئة السلع الأساسية. والأسعار المذكورة أدناه هي لكل مليون رمز، وهي تتغير باستمرار.

مزود الخدمة Scout: الإدخال / الإخراج Maverick: الإدخال / الإخراج
DeepInfra $0.10 / $0.30 $0.20 / $0.80
Groq $0.11 / $0.34 —
DigitalOcean — $0.20 / $0.696
NovitaAI $0.18 / $0.59 $0.27 / $0.85
Parasail — $0.35 / $1.00
Google Vertex $0.25 / $0.70 $0.35 / $1.15

وتستحق شركة Groq الانتباه فيما يتعلق بنموذج Scout: فهي أعلى سعرًا قليلًا من DeepInfra، لكنها تقدِّم خاصية تخزين الإدخال مؤقتًا (cached input) مقابل 0.055 دولار لكل مليون رمز، وهي ميزة ذات أهمية كبيرة جدًّا في سيناريوهات العملاء الذكية (agent loops) التي تعيد إرسال نفس رسالة النظام (system prompt) آلاف المرات. أما شركة Parasail فتقدم نفس الخدمة لنموذج Maverick مقابل 0.17 دولار.

ما التكلفة الفعلية لهذا الأمر

وبافتراض حمل إنتاجي معتدل يبلغ 100 مليون رمز إدخال و20 مليون رمز إخراج شهريًّا، وباستخدام أرخص سعر متاح في السوق:

  • Scout: (100 × 0.10 دولار) + (20 × 0.30 دولار) = 16 دولارًا شهريًّا
  • Maverick: (100 × 0.20 دولار) + (20 × 0.80 دولار) = 36 دولارًا شهريًّا

وعند زيادة الحجم عشرة أضعاف، يتسع الفارق ليصبح 160 دولارًا مقابل 360 دولارًا شهريًّا. وتبقى النسبة ثابتة تقريبًا عند 2.25–2.3 ضعفًا بغض النظر عن الحجم، وبالتالي فإن القرار لا يدور في جوهره حول المبالغ المطلقة عند أحجام صغيرة — بل حول ما إذا كانت الميزة التنافسية لنموذج Maverick في مجالات الاستدلال والبرمجة تستحق مضاعفة تكلفة كل وحدة بشكل دائم. ويُرجى حساب أرقامك الخاصة باستخدام حاسبة تكلفة واجهة برمجة التطبيقات (API).

التراخيص: اقرأ البند الخاص بالاتحاد الأوروبي قبل أن تبدأ في البناء

يُوزَّع كلا النموذجين بموجب اتفاقية ترخيص مجتمع Llama 4والتي تسمح باستخدام النموذج مفتوح الوزن تجاريًّا، لكنها ليست ترخيصًا مفتوح المصدر معتمدًا من منظمة OSI. وهناك قيدان عمليان يجب الانتباه إليهما. أولهما: أن المنتجات التي تجاوز عدد مستخدميها النشطين الشهريين 700 مليون مستخدم تتطلب ترخيصًا منفصلًا يتم التفاوض عليه مع شركة Meta. ثانيهما — والأرجح تأثيرًا عليك — أن الترخيص يقيِّد الاستخدام متعدد الوسائط (multimodal) بالنسبة للشركات والأفراد المقيمين في الاتحاد الأوروبي.

فإذا كنت شركة مقرها الاتحاد الأوروبي وتخطط لاستخدام القدرات البصرية (vision capabilities) في هذين النموذجين، فهذه مسألة قانونية يجب حلها قبل كتابة أي كود، وليس بعده. وغالبًا ما تلجأ الفرق في مثل هذه الحالات إلى نموذج بديل مفتوح الوزن يحمل ترخيصًا أوضح، مثل إصدارات Qwen أو GLM المرخصة بموجب رخصة Apache-2.0 أو MIT.

أيًّا منها يجب أن تختار؟

اختر نموذج Llama 4 Scout إذا

  • كان سير عملك يركِّز على المستندات أو التعرف الضوئي على المعطيات (OCR) أو النماذج أو الرسوم البيانية أو استرجاع المعلومات — حيث تظهر الاختبارات أداءً متكافئًا تقريبًا
  • وكنت ترغب في استضافة النموذج ذاتيًّا على بطاقة H100 واحدة أو جهاز Mac بسعة 128 غيغابايت أو صندوق GPU معتدل
  • تتراكم تكلفة كل رمز وفقًا لحجم الاستخدام لديك، وترغب في التوفير المقدَّر بنسبة ~2.3×
  • تحتاج إلى أطول نافذة سياق متاحة، ويمكنك العمل ضمن الحدود القصوى التي يحددها مقدِّمو الخدمة
  • أنت في مرحلة النمذجة الأولية (Prototyping) وتبحث عن أرخص نموذج مفتوح الوزن متعدد الوسائط قادر على الأداء المطلوب

اختر نموذج Llama 4 Maverick إذا

  • كان حمل عملك يعتمد فعليًّا على القدرة الاستنتاجية — مثل طرح الأسئلة العلمية والإجابة عنها، أو التحليل، أو المنطق متعدد الخطوات
  • كنت تولِّد الشيفرات البرمجية أو تراجعها، حيث تبلغ الفجوة بين النموذجين في اختبار LiveCodeBench 32% نسبيًّا
  • لديك بالفعل بنية تحتية متعددة وحدات معالجة رسومية (Multi-GPU)، أو كنت تستخدمها عبر واجهة برمجة التطبيقات (API) أصلًا
  • تحتاج إلى أداء أقوى في المهام متعددة اللغات والترجمة، كما يظهر في نتائج الاختبارين MGSM وMTOB
  • الدقة في حل المسائل الصعبة أهم من مضاعفة تكلفة كل رمز تقريبًا

المسار العملي لمعظم الفرق هو: ابدأ باستخدام نموذج Scout، وقم بالقياس، ثم ارفع مستوى المعالجة فقط للأسئلة التي تفشل في الإجابة عنها. وبما أن كلا النموذجين يستخدمان نفس تنسيق المُدخلات (Prompt) والمدخلات متعددة الوسائط، فإن توجيه الأسئلة الصعبة إلى نموذج Maverick بينما تُعالَج الكتلة الكبرى منها عبر نموذج Scout يتطلّب جهدًا هندسيًّا ضئيلًا عادةً ما يكون أفضل من توحيد الاستخدام على أحد النموذجين فقط.

الأسئلة الشائعة

هل نموذج Llama 4 Maverick أفضل من Llama 4 Scout؟

نعم، وبوضوح في مجالَي الاستنتاج والبرمجة — إذ يتفوّق Maverick بفارق 12.6 نقطة في اختبار GPQA Diamond و10.6 نقطة في اختبار LiveCodeBench. أما في فهم المستندات والرسوم البيانية، فكلا النموذجين متساويان عمليًّا، مع درجة متطابقة تبلغ 94.4 في اختبار DocVQA. ويعتمد مصطلح «الأفضل» هنا تمامًا على ما إذا كان حمل عملك يركّز على الاستنتاج أم على استخراج المعلومات.

هل يمكنني حقًّا استخدام نافذة السياق البالغة 10 ملايين رمز في نموذج Llama 4 Scout؟

لا، ليس عبر واجهة برمجة تطبيقات مُستضافة. فقد درّبت شركة Meta نموذج Scout ليدعم سياقًا بطول 10 ملايين رمز، لكن موفري الخدمة يقدمون سعات تتراوح بين 128 ألف رمز وحوالي 1.3 مليون رمز — فشركة Groq تحدّها عند نحو 131 ألف رمز، وDeepInfra عند نحو 320 ألف رمز، وTogether عند نحو 328 ألف رمز. أما الوصول إلى السعة الكاملة البالغة 10 ملايين رمز فيتطلّب الاستضافة الذاتية، وعندها يصبح حجم ذاكرة KV عند هذا العمق أكبر من وزن النموذج نفسه.

كم كمية الـ VRAM المطلوبة لتشغيل نموذج Llama 4 Scout محليًّا؟

حوالي 65 جيجابايت عند التكميم بـ 4 بت بما في ذلك الهوامش، وهي كمية تكفي لبطاقة واحدة من نوع H100 سعة 80 جيجابايت — وقد أكّدت شركة Meta هذه التهيئة. أما عند استخدام تنسيق FP8 فتحتاج إلى نحو 109 جيجابايت، وعند استخدام BF16 فتحتاج إلى نحو 218 جيجابايت. ويمكن لجهاز Mac Studio ذي الذاكرة الموحَّدة سعة 128 جيجابايت تشغيل النموذج بعد تكميمه.

هل يمكن تشغيل نموذج Llama 4 Maverick على وحدة معالجة رسوميات واحدة (GPU)؟

لا. فعند التكمية بـ 4 بت، يحتاج النموذج إلى نحو 240 غيغابايت من الذاكرة، أي ما يعادل أربعة معالجات H100 تقريبًا. أما ادعاء شركة Meta بأن النموذج «يتناسب مع مضيف واحد يحتوي على معالج H100» فهو يشير إلى عقدة (Node) تحتوي على 8 معالجات H100 تعمل بدقة FP8، وليس إلى معالج واحد فقط. أما عند دقة BF16، فتتجاوز أوزان النموذج البالغة 800 غيغابايت حتى سعة عقدة تحتوي على 8 معالجات H100 بسعة إجمالية تبلغ 640 غيغابايت.

ما مدى انخفاض تكلفة Scout مقارنةً بمثيله Maverick؟

أقل بنسبة 2.3× تقريبًا على أساس مدمج بنسبة إدخال إلى إخراج تبلغ 3:1 — أي ما يعادل 0.15 دولار أمريكي لكل مليون رمز مدمج مقابل 0.35 دولار أمريكي. وبافتراض حمل عمل شهري يتضمّن 100 مليون رمز إدخال و20 مليون رمز إخراج، تكون التكلفة 16 دولارًا مقابل 36 دولارًا.

هل نماذج Llama 4 مجانية للاستخدام التجاري؟

نعم، في الغالب. إذ يسمح ترخيص Llama 4 Community بالاستخدام التجاري، لكن المنتجات التي تجاوز عدد مستخدميها النشيطين الشهريين 700 مليون مستخدم تتطلّب اتفاقية منفصلة مع شركة Meta، كما أن الاستخدام متعدد الوسائط مقيد للجهات القانونية المقيمة في الاتحاد الأوروبي. وهو نموذج «مفتوح الأوزان» (open-weight)، وليس مفتوح المصدر وفق تعريف منظمة OSI.

لماذا أثارت درجة نموذج Llama 4 Maverick في منصة LMArena جدلًا؟

قدّمت شركة Meta نسخة تجريبية غير منشورة من النموذج تحت اسم «نسخة دردشة تجريبية»، وحقّقت درجة 1417 في مقياس ELO، لكن مخرجاتها لم تتطابق مع أوزان النموذج المتاحة للتنزيل العام. ولذلك عدّلت منصة LMArena سياستها في 8 أبريل 2025 لتطلب من المشاركين في فئة النماذج المفتوحة الوزن أن تتطابق مخرجات نماذجهم مع الأوزان المنشورة فعليًّا، وبعد تطبيق هذه السياسة، حصل النموذج غير المعدَّل على درجة أقل بكثير.

الخلاصة

إن نموذجي Scout وMaverick يشتركان في نفس المحرك، لكنهما يختلفان في حجم مجموعة الخبراء (Expert Pool) المدمجة في كل منهما، ويكون الاختيار بينهما واضحًا بشكل غير معتاد لأن مقاييس الأداء التي وضعتها شركة Meta نفسها ترسم الحد الفاصل بينهما. ويبرر Maverick تكلفته الأعلى في مهام الاستنتاج على مستوى الدراسات العليا وتوليد الشيفرات البرمجية، حيث تصل الفجوات بينه وبين Scout إلى خانة العشرات — وهي فجوات كبيرة جدًّا لا يمكن تجاهلها. أما في مهمة فهم المستندات، فلا يحقق Maverick أي تفوّق على Scout إطلاقًا، بل يساويه في الأداء تمامًا، رغم أنه يكلّف 2.3 مرة أكثر لكل رمز، ويحتاج إلى رف كامل في مركز البيانات بدلًا من معالج GPU واحد فقط.

ثمة تحذيران يجب أن تضعهما في اعتبارك دائمًا: أولًا، إن نافذة السياق المعلنة لنموذج Scout البالغة 10 ملايين رمز ليست متاحة حاليًّا للتأجير — لذا خطِّط لسعة تقارب 1.3 مليون رمز ما لم تكن تستضيف النموذج ذاتيًّا. ثانيًا، يجب أن تحذف تمامًا من تقييمك درجة Maverick البالغة 1417 في منصة LMArena؛ فهي تقيس أداء نموذج لا يمكن لأحد تنزيله. وقيّم كلا النموذجين بناءً على مقاييس الأداء المنشورة في بطاقات النماذج (Model Cards)، والأفضل من ذلك أن تقيّمهما على مجموعة تقييم خاصة بك — فالفجوة بين التسويق الذي تروّج له الشركات والوزن الفعلي الذي يتم شحنه للمستخدم كانت الدرس الأبرز في هذا الإطلاق المحدّد.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى