Thursday, 6 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

شرح مقاييس أداء الذكاء الاصطناعي (٢٠٢٦): ما الذي يقيسه كل منها ومن يتصدّرها؟

مقاييس أداء الذكاء الاصطناعي هي مجموعة ثابتة من المهام تُستخدم لتقييم قدرة النموذج، بحيث يُمكن
مقارنة نماذج مختلفة على نفس الاختبار.
لا يوجد مقياس أداء وحيد يُقرّر أي نموذج هو الأفضل — فكل مقياس يقيس جانباً ضيّقاً، وبعض أبرز المقاييس المعروفة
وصلت الآن إلى درجة تشبعٍ عالية. والنهج العملي هو الاطلاع على اثنين أو ثلاثة مقاييس تتطابق مع حِمل العمل الفعلي الخاص بك، ومعاملة أي رقم رئيسي واحد بحذرٍ شديد.
من يتصدّر حالياً؟
مرتّب وفق مؤشر التحليل الاصطناعي للذكاء، وهو مؤشر مركّب يجمع عدة تقييمات مستقلة بدلاً من اختبار واحد. أما العمود الأخير فهو ما تتجاهله معظم المقارنات: النتيجة مقسومةً على السعر المدمج، وهو ما تشتريه فعلياً.

نتيجة الذكاء

النتيجة لكل دولار
النتائج مُعطاة وفق مقياس مؤشر التحليل الاصطناعي للذكاء، وهو مؤشر مركّب يجمع عدة تقييمات مستقلة بدلاً من أي اختبار وحيد — وهذا هو النهج الصحيح لتفسير أي ادعاءٍ إعلامي عن «أفضل نموذج». وأقوى نموذج ذي أوزان مفتوحة المصدر هو
بنتيجة ٥٧. ويمكنك ترتيب المجموعة الكاملة بنفسك عبر

#النموذجالمطوّرمقاييس الأداء التي تهمّ في عام ٢٠٢٦المتوسط المُدمج بالدولار لكل مليون دولارإم إم إل يو (الفهم اللغوي متعدد المهام الضخم)
1كلاود أوبس ٥أنثروبيك61$9.006.8
2كلاود فابل ٥أنثروبيك60$18.003.3
3جي بي تي-٥.٦ سولأوبن إيه آي59$10.005.9
4كيمي ك٣ أوزان مفتوحة المصدرمون شوت آي57$5.4010.6
5كلاود أوبس ٤.٨أنثروبيك55.7$9.006.2
6جي بي تي-٥.٥أوبن إيه آي54.8$10.005.5
7غلْم ٥.٢ أوزان مفتوحة المصدرزهي بو آي51.1$2.0025.6
8جميني ٣.٥ فلاشجوجل50.2$3.0016.7
9كلاود سونيت ٤.٦أنثروبيك47$5.408.7
10جميني ٣.١ بروجوجل46.5$4.0011.6
11ديب سيك في4-برو أوزان مفتوحة المصدرDeepSeek44.3$0.52284.9
12كيمي ك٢.٧ كود أوزان مفتوحة المصدرمون شوت آي42$0.98042.9

أسئلة اختيار من متعدد تغطي ٥٧ موضوعاً، من الرياضيات الابتدائية إلى القانون المهني. وقد كان لسنوات عديدة الرقم الرئيسي القياسي، وهذه هي المشكلة اليوم: إذ تتكتّل النماذج المتقدمة في القمة بشكلٍ شديد التقارب لدرجة أن الفروق بينها تقع داخل هامش الخطأ. ولا يزال مقياس إم إم إل يو مفيداً لمقارنة نموذج صغير ذي أوزان مفتوحة مع نموذج كبير، لكنه يكاد يكون عديم الفائدة في التمييز بين نموذجين متقدمين. لذا اعتبر أي ادعاءٍ عن نتيجة إم إم إل يو لعام ٢٠٢٦ بمثابة اختبار حد أدنى، وليس معياراً للترتيب. كيمي ك٣ ج بي كيو إيه (أسئلة وإجابات على مستوى الدراسات العليا لا يمكن الإجابة عنها عبر جوجل) لوحة تصنيف النماذج اللغوية الكبيرة (LLM).

كتبها دكاترة متخصصون في مجالات الأحياء والفيزياء والكيمياء، وصُمّمت عمداً بحيث لا يساعد البحث عبر الويب في الإجابة عنها. وهي تجيب عن سؤال مختلف عن سؤال إم إم إل يو: فهي لا تسأل «هل قرأ النموذج كثيراً؟» بل تسأل «هل يستطيع النموذج الاستنتاج والتفكير في مشكلة صعبة حقاً ضمن مجال تقني؟». وبما أنها تقاوم كلاً من الحفظ والبحث والاسترجاع، فقد حافظت على قيمتها كأداة تمييز أفضل من إم إم إل يو مع مرور الزمن.

تقارير أخطاء فعلية من مستودعات جيت هاب الحقيقية، وتُقيَّم بناءً على ما إذا كانت التصحيحات التي قدّمها النموذج تجعل البرنامج

أسئلة متعددة الخيارات عبر 57 موضوعًا، تبدأ من الرياضيات الابتدائية وتنتهي بالمواضيع المهنية
والقانون. ولسنواتٍ عديدة كانت النتيجة الافتراضية الرئيسية المُعلَّقة في هذا الاختبار، والآن تكمن المشكلة في أن النماذج الرائدة تتجمع بإحكام شديد عند القمة بحيث تقع الفروق بينها داخل نطاق الضوضاء الإحصائية. ولا يزال اختبار MMLU مفيدًا لمقارنة نموذج صغير مفتوح المصدر مع نموذج كبير جدًّا، لكنه يكاد يكون عديم الفائدة في التمييز بين نموذجين رائدين. وعليه، فعليك اعتبار أي ادعاءٍ متعلقٍ بنسبة الأداء في اختبار MMLU لعام 2026 بمثابة اختبارٍ للحد الأدنى من الأداء لا كأداةٍ لترتيب النماذج.
يظل اختبار MMLU مفيدًا لوضع نموذج صغير مفتوح المصدر مقابل نموذج كبير جدًّا، لكنه يكاد يكون عديم الفائدة في التمييز بين نموذجين رائدين. وعليه، فعليك اعتبار أي ادعاءٍ متعلقٍ بنسبة الأداء في اختبار MMLU لعام 2026 بمثابة اختبارٍ للحد الأدنى من الأداء لا كأداةٍ لترتيب النماذج.
يظل اختبار MMLU مفيدًا لوضع نموذج صغير مفتوح المصدر مقابل نموذج كبير جدًّا، لكنه يكاد يكون عديم الفائدة في التمييز بين نموذجين رائدين. وعليه، فعليك اعتبار أي ادعاءٍ متعلقٍ بنسبة الأداء في اختبار MMLU لعام 2026 بمثابة اختبارٍ للحد الأدنى من الأداء لا كأداةٍ لترتيب النماذج.
يظل اختبار MMLU مفيدًا لوضع نموذج صغير مفتوح المصدر مقابل نموذج كبير جدًّا، لكنه يكاد يكون عديم الفائدة في التمييز بين نموذجين رائدين. وعليه، فعليك اعتبار أي ادعاءٍ متعلقٍ بنسبة الأداء في اختبار MMLU لعام 2026 بمثابة اختبارٍ للحد الأدنى من الأداء لا كأداةٍ لترتيب النماذج.

GPQA (أسئلة وأجوبة على مستوى الدراسات العليا، غير قابلة للبحث عبر محرك جوجل)

كتبها خبراء حاصلون على درجة الدكتوراه في مجالات الأحياء والفيزياء والكيمياء، وصُمِّمت عمداً بحيث لا يساعد البحث عبر الويب في إيجاد الإجابات.
ويجيب هذا الاختبار عن سؤالٍ مختلفٍ عن السؤال الذي يطرحه اختبار MMLU: فهو لا يسأل «هل قرأ النموذج كثيرًا؟» بل يسأل «هل يستطيع النموذج الاستنتاج المنطقي لحل مشكلةٍ بالغة الصعوبة في مجالٍ تقنيٍّ معيَّن؟».
ويجيب هذا الاختبار عن سؤالٍ مختلفٍ عن السؤال الذي يطرحه اختبار MMLU: فهو لا يسأل «هل قرأ النموذج كثيرًا؟» بل يسأل «هل يستطيع النموذج الاستنتاج المنطقي لحل مشكلةٍ بالغة الصعوبة في مجالٍ تقنيٍّ معيَّن؟».
وبما أن هذا الاختبار يقاوم كلًّا من الحفظ الآلي واسترجاع المعلومات، فقد ظل أكثر ثباتًا من اختبار MMLU كأداةٍ تمييزيةٍ مع مرور الزمن.

سو-بنش مُحقَّق

تقارير أخطاء فعلية مستخلصة من مستودعات GitHub الحقيقية، ويتم تقييمها بناءً على ما إذا كانت التعديلات التي قدَّمها النموذج تُصلح الخطأ أم لا.
اختبارات المشروع الخاصة تمر بنجاح. أما مجموعة «المُحقَّق» فهي الجزء الذي تم التحقق من صحته يدويًّا، بعد ترشيحه لإزالة
المهام المعطوبة أو المستحيلة — ولذلك يجب أن تتحقق من ذلك أيّ SWE-bench
يقدِّمه المورِّد. وهذه هي أكثر المقاييس صلةً بالقرار عند اختيارك نموذجًا لوكيل برمجي (coding agent)، لأن المهمة ونظام التقييم كليهما أصيلان. ويبلغ أداء نموذج Claude Sonnet 5
85.2% على مجموعة SWE-bench المُحقَّقة، و63.2% على مجموعة SWE-bench Pro الأصعب.
Terminal-Bench

مهام وكيلية تُنفَّذ في واجهة طرفية حقيقية: مثل تثبيت برنامج ما، أو تشخيص عطلٍ ما، أو كتابة نص برمجي لإصلاح مشكلة ما.

وهي تقاس مهارة مختلفة عن كتابة تصحيح برمجي (patch) — وهي القدرة على التحمُّل أثناء إنجاز مهام متعددة الخطوات، حيث يجب على النموذج قراءة مخرجات الأخطاء التي يولدها بنفسه والتعافي منها.
وأبلغ نموذج Claude Sonnet 5 عن نتيجة 80.4% على Terminal-Bench 2.1. فإذا كان استخدامك المقصود هو وكيل مستقل (autonomous agent) بدلًا من مساعد برمجي تفاعلي (inline code assistant)، فإن هذه المجموعة وOSWorld توفران لك معلوماتٍ أكثر فائدةً من تلك التي تقدِّمها SWE-bench.
استخدام الحاسوب في بيئة سطح مكتب حقيقية — مثل فتح التطبيقات، والنقر عبر واجهات المستخدم، وإتمام مهمة قد يقوم بها الإنسان باستخدام الفأرة.
والنتائج هنا منخفضةٌ جدًّا مقارنةً بالمقاييس النصية على امتداد المجال بأسره، وهي إشارة صادقةٌ إلى مدى حداثة (أو بدائية) وكلاء استخدام الحاسوب حتى الآن.
وأبلغ نموذج Claude Sonnet 5 عن نتيجة 81.2% على OSWorld-Verified؛ بينما أبلغ نموذج Nemotron 3 Nano Omni من شركة NVIDIA، وهو نموذج مفتوح الحجم 30 مليار معلَّمة، عن نتيجة 47.4% على OSWorld، وهي نتيجة معقولةٌ بالنسبة لحجمه.

أو إس وورلد

ARC-AGI
ألغاز استدلال بصري مجرَّد مُصمَّمة بحيث لا يُمكن للنمذجة القائمة على مطابقة الأنماط في بيانات التدريب أن تنتقل (transfer) إليها.
وتتكوَّن كل مهمة من عدد قليل من تحويلات الشبكة (grid transformations) التي يجب على النموذج استنتاجها من زوجٍ أو اثنين من الأمثلة.
ويعتبر ARC-AGI أقرب ما وصل إليه المجال إلى اختبارٍ حقيقيٍّ للتعميم الحقيقي (genuine generalisation) بدلًا من الاسترجاع (recall)، ولذلك فإن التقدُّم فيه بطيءٌ جدًّا، وتُعامَل أي قفزات نوعية فيه باعتبارها ذات أهمية كبيرة.
وأُبلغ عن أداء نموذج Claude Opus 5 على ARC-AGI 3 بأنه يعادل تقريبًا ثلاثة أضعاف أفضل نموذج تالي له.

أسئلة وضعها خبراء في تخصصات عديدة، وصُمِّمت خصيصًا لمقاومة التشبع (saturation) الذي أصاب مقياس MMLU.

والهدف التصميمي هو إنشاء مقياس يظل صعبًا مع تحسُّن النماذج، وبالتالي تكون النتائج منخفضةً بطبيعتها، وتكتسب المكاسب الصغيرة دلالةً كبيرةً.
اقرأ هذا المقياس باعتباره مُميِّزًا للحدود الأمامية (frontier discriminator)، وليس كمقياسٍ لمدى فائدته في العمل العادي.
ليس اختبارًا بحد ذاته، بل هو تركيبة (composite) تدمج عدة تقييمات مستقلة في درجة واحدة.
وهذا هو قيمته: فمن السهل استهداف أي مقياس فردي، بينما يصعب جدًّا التلاعب بمزيجٍ منه.
وهو المقياس المستخدم في الجدول أعلاه. ويتصدَّر نموذج Claude Opus 5 الترتيب حاليًّا بنتيجة 61، يليه Claude Fable 5 بنتيجة 60، ثم GPT-5.6 Sol بنتيجة 59 — بينما حقق نموذج Kimi K3 نتيجة 57، وهي أفضل نتيجة مسجَّلة حتى الآن بين النماذج المفتوحة الوزن (open-weight)، وتقترب من أفضل نموذج مغلق (closed model) بفارق أربع نقاط فقط.

امتحان البشرية الأخير

كيف تقرأ ادعاءً حول نتيجة اختبار أداء (benchmark claim)
اسأل: من الذي أجرى الاختبار؟
فالنتيجة التي يعلن عنها المورِّد على صفحة إطلاق منتجه تختلف تمامًا عن التقييم المستقل، إذ إن اللوحات القيادية المستقلة تطبِّق نفس الإطار (harness) على جميع النماذج، بينما يختار المورِّد ظروفه الخاصة.
تحقَّق من وجود تلوث (contamination).

مؤشر التحليل الاصطناعي للذكاء

إذا كانت أسئلة المقياس قد سبقت تاريخ إغلاق بيانات التدريب الخاصة بالنموذج ووجدت علنًا في مكانٍ ما، فمن المرجح أن تكون بعضها موجودةً في بيانات التدريب.
وهذا هو السبب الرئيسي في أن المقاييس القديمة تميل إلى التضخُّم مع مرور الوقت، ولذلك صُمِّمت المقاييس الجديدة لتكون «محصَّنة ضد جوجل» (Google-proof) أو يتم الاحتفاظ بها بعيدًا تمامًا عن بيانات التدريب.
انتبه إلى تحوُّل خط النهاية (moved goalpost).
مثل ذكر «SWE-bench» دون تحديد «المُحقَّقة»، أو الإشارة إلى مجموعة فرعية غير مسمَّاة، أو استخدام عدد مختلف من المحاولات، أو مقارنة نتيجة تشمل استخدام أدوات (tool use) مع أخرى لا تشملها — هذه هي الطرق المعتادة التي تتوقف فيها المقارنة عن أن تكون «من نظيرٍ لنظير» (like for like).
احذر التشبع (saturation).

فعندما يحصل كل نموذج جاد على نتيجة تزيد عن 90 في اختبارٍ ما، فهذا يعني أن الاختبار توقَّف عن التمييز بين النماذج.

وبالتالي فإن الاختلافات التي لا تتجاوز نقطة أو نقطتين في قمة مقياسٍ مشبعٍ ما هي ضوضاء (noise)، وليست إشارةً ذات دلالة (signal). السعر جزءٌ من الدرجة.
فالنموذج الأفضل بدرجتين لكنه أغلى ستة أضعاف ليس بالضرورة أفضل لمعظم حالات الاستخدام.
ولهذا السبب يتضمَّن الجدول أعلاه عمودًا لـ«النتيجة لكل دولار»، ولماذا يوجد مؤشر «الأداء مقابل السعر» (price-performance index).

أي مقياس أداء يجب أن تهتم به فعليًّا؟ لبناء وكيل برمجي (coding agent): ابدأ أولًا بمجموعة SWE-bench المُحقَّقة، ثم Terminal-Bench ثانيًا.
تاريخ قطع بيانات التدريب، وهي متوفرة علنًا، ومن المحتمل أن تكون بعض هذه التقارير موجودةً بالفعل ضمن بيانات التدريب.
السبب الرئيسي في أن الاختبارات القديمة تزداد قيمتها بشكل مُضخَّم مع مرور الوقت، ولماذا تُصمَّم الاختبارات الأحدث لتكون
«محصَّنة ضد جوجل» أو تُستبعد تمامًا.

انتبه إلى انتقال خط النهاية. اختبار «SWE-bench» بدون علامة «Verified»، وهو مجموعة فرعية غير مسمَّاة،
عدد مختلف من المحاولات، أو درجة تحقَّق باستخدام أدوات مقارنةً بتلك التي لا تستخدم أدوات — هذه
هي الطرق المعتادة التي تتوقَّف بها المقارنة عن كونها «مقابلةً لمقابلة».

احذر من التشبع. عندما يحصل كل نموذجٍ جادٍّ على درجة تفوق ٩٠ في اختبار ما، فإن هذا
الاختبار يتوقف عن التمييز بين النماذج. فالاختلافات التي تبلغ نقطة أو نقطتين في قمة اختبارٍ مشبعٍ
هي ضوضاءٌ وليست إشارةً ذات دلالة.

السعر جزءٌ من الدرجة. نموذجٌ أفضل بدرجتين وأعلى تكلفةً بستة أضعاف
الغالي ليس بالضرورة الأفضل بالنسبة لمعظم أحمال العمل. ولهذا السبب تتضمن الجدول أعلاه عمود «النتيجة لكل دولار»،
ولهذا السبب توجد مؤشر الكفاءة السعرية
أيضًا.
أي اختبار معياري يجب أن تهتم به فعليًّا؟

بناء وكيل برمجي:

يُفضَّل اختبار SWE-bench المُحقَّق أولًا، ثم اختبار Terminal-Bench ثانيًا. SWE-bench تم التحقق منه أولًا، وTerminal-Bench ثانيًا.
تجاهل اختبار MMLU تمامًا.

بناء وكيلٍ لاستخدام الحاسوب أو سطح المكتب: OSWorld، ثم Terminal-Bench.
توقَّع أن تكون الأرقام المطلقة منخفضةً نسبيًّا.

الإجابة عن الأسئلة التقنية أو العلمية: GPQA، وامتحان البشرية الأخير (Humanity's Last Exam) إذا كانت
أسئلتك بالفعل على مستوى الخبراء المتخصصين.

الوكيل العام أو روبوت الدردشة: المؤشر المركب يوفِّر معلوماتٍ أكثر فائدةً من أي اختبارٍ واحدٍ، لأنَّه لا يوجد اختبارٌ وحيدٌ يُماثل التنوُّع الواسع في الأسئلة التي يطرحها المستخدمون الفعليون.
اختبارٌ واحدٌ فقط، لأنَّ أيَّ اختبار معين لا يعكس التنوُّع الواسع في المهام التي يطلبها المستخدمون الحقيقيون فعلًا.

اختيار نموذج صغير للتشغيل الذاتي (Self-hosting): تلعب الاختبارات دورًا أقل أهميةً مقارنةً بمدى ملاءمة النموذج لاحتياجاتك. تحقَّق أولًا من
ما يمكنه التشغيل فعليًّا على أجهزتك المادية، ثم قارن
حاسبة ذاكرة الفيديو (VRAM) نتائج الاختبارات فقط بين النماذج التي تتوافق مع مواصفات أجهزتك.
النتائج المنشورة للاختبارات في قاعدتنا البيانات

النتائج المنشورة

النموذجمؤشر الذكاء الاصطناعي لشركة Artificial Analysis: ٥٩.
جي بي تي-٥.٦ سولSWE-Bench Verified: ٨٥,٢٪؛ SWE-Bench Pro: ٦٣,٢٪؛ Terminal-Bench 2.1: ٨٠,٤٪؛ OSWorld-Verified: ٨١,٢٪.
كلاود سونيت ٥مؤشر الذكاء الاصطناعي لشركة Artificial Analysis: ٦١ (مرتبة رقم ١ من أصل ١٧٠ نموذجًا). يفوق أداء Opus 4.8 بأكثر من الضعف في اختبار Frontier-Bench الإصدار ٠.١؛ ويبلغ نحو ثلاثة أضعاف أداء أفضل نموذج تالي في اختبار ARC-AGI 3.
كلاود أوبس ٥OCRBench V2: ٦٧,٠٤ | Video-MME: ٧٢,٢ | OSWorld: ٤٧,٤ | Speech IF: ٨٩,٣٩
إنفيديا نيموترون ٣ نانو أومنييتم إدراج النماذج فقط إذا نشر مطوِّروها أرقامًا محددةً بوضوح. وبالتالي فإن غياب نموذجٍ ما هنا لا يعني أن أداؤه ضعيفٌ، بل يعني فقط أننا لم نتحقق بعدُ من وجود رقم منشورٍ له — وهذه المعلومة في حد ذاتها ذات قيمةٍ كبيرةٍ عندما يروِّج المورِّد لادعاءٍ مبنيٍّ على نتيجة اختبارٍ ما.

ما هو اختبار الذكاء الاصطناعي (AI Benchmark)؟

الأسئلة الشائعة

مجموعة ثابتة من المهام ذات طريقة تقييم مُعرَّفة بوضوح، تُستخدم لمقارنة أداء النماذج المختلفة على مدخلاتٍ متطابقة. وتتراوح الاختبارات من اختبارات المعرفة متعددة الخيارات مثل MMLU، إلى المهام الوكيلية (Agentic Tasks) مثل حل مشكلات حقيقية على GitHub ضمن اختبار SWE-Bench، وكل منها يقيس جانبًا ضيقًا جدًّا من القدرات، وليس الجودة الشاملة.

أي اختبار ذكاء اصطناعي هو الأكثر موثوقيةً؟
لا يوجد اختبارٌ واحدٌ يُعتبر الأكثر موثوقيةً. فالمؤشرات المركبة هي الرقم الرئيسي الأكثر موثوقيةً، لأن دمج عدة تقييماتٍ يصعب التلاعب به مقارنةً بالتركيز على تحسين الأداء في اختبارٍ واحدٍ فقط. أما بالنسبة لقرارٍ معيَّنٍ، فإن الاختبار الأكثر موثوقيةً هو الذي يشبه إلى أقصى حدٍّ ممكنٍ طبيعة المهمة التي ستُناط به في الواقع — كأن تختار SWE-Bench Verified للوكالات البرمجية، أو OSWorld لمهام استخدام الحاسوب، أو GPQA للتفكير التقني.
ما الدرجة الجيدة في اختبار MMLU عام ٢٠٢٦؟
إن درجات اختبار MMLU قد اقتربت من التشبع الكامل بين النماذج الرائدة، وبالتالي لم تعد الدرجة العالية تُميِّز بين هذه النماذج. ومع ذلك، لا يزال الاختبار مفيدًا في تقييم النماذج المفتوحة الأصغر، حيث لا يزال التباين في الأداء واسعًا نسبيًّا. فإذا كنت تقارن بين نموذجين رائدين، فلن يُظهر لك اختبار MMLU فرقًا بينهما، ولن تحتاج حينها إلى الاعتماد على GPQA أو مؤشرٍ مركبٍ بدلًا منه.

هل يمكن التلاعب باختبارات الذكاء الاصطناعي؟

نعم، وبطريقتين. الأولى: أن تتضمَّن بيانات التدريب أسئلة الاختبار نفسه، مما يرفع الدرجات دون تحقيق أي تحسُّن حقيقي في القدرات — ولذلك صُمِّمت الاختبارات الجديدة لمقاومة عمليات البحث والحفظ الآلي. والثانية: اختيار ظروف التقييم بطريقة مُفضَّلة، مثل استخدام مجموعة فرعية مختلفة من الأسئلة، أو زيادة عدد المحاولات، أو السماح باستخدام أدوات مساعدة بينما لا يُسمح بها للنموذج الآخر. وتخفِّف اللوحات القيادية المستقلة والمؤشرات المركبة من هاتين المشكلتين معًا.
هل تتنبَّأ درجات الاختبارات بالأداء الفعلي في العالم الحقيقي؟
جزئيًّا فقط. فاختبارات المهام الأصيلة (Task-authentic benchmarks)، مثل SWE-Bench Verified وOSWorld، تتنبَّأ بشكلٍ معقولٍ جيدٍ لأن المهمة نفسها هي المهمة الواقعية. أما الاختبارات الأكاديمية متعددة الخيارات فتنبِّئ بشكلٍ ضعيفٍ جدًّا، لأن الإجابة عن أسئلة الامتحانات ليست المهمة التي تؤديها معظم التطبيقات في الواقع. وأقوى مؤشر تنبؤيٍّ لا يزال هو التقييم الذي تقوم ببنائه بنفسك على بياناتك الخاصة.
أي نموذج مفتوح الوزن (Open-weight model) يحقق أعلى درجة؟

نموذج Kimi K3 بنتيجة ٥٧ في مؤشر الذكاء الاصطناعي لشركة Artificial Analysis، وهو أفضل نتيجة مسجَّلة حتى الآن لنماذج الوزن المفتوح، ويبتعد بفارق أربع نقاط فقط عن أفضل نموذج مغلق. وتشير الجدول القيادي أعلاه إلى جميع الإدخالات الخاصة بالنماذج المفتوحة الوزن، ويمكن فرز المجموعة الكاملة في الصفحة.

لقد بلغت درجات نموذج MMLU حد التشبع إلى حدٍّ كبير بين النماذج الرائدة، وبالتالي لم تعد الدرجة العالية تُميِّز بينها.
ومع ذلك، لا يزال هذا الاختبار مفيدًا في تقييم النماذج المفتوحة الأصغر حجمًا، حيث لا يزال التباين في الأداء واسعًا. فإذا كنتَ
تُقارن بين نموذجين رائدين، فإن اختبار MMLU لن يُظهر فرقًا بينهما، ولذلك يُفضَّل الاعتماد على اختبار GPQA أو مؤشر مركَّب.
سيفعل.

هل يمكن التلاعب بنتائج مقاييس أداء الذكاء الاصطناعي؟

نعم، وبطريقتين. فقد تتضمّن بيانات التدريب أسئلة المقياس نفسه، ما يؤدي إلى تضخيم النتائج دون أي تحسُّنٍ فعليٍّ في القدرات — ولذلك صُمِّمت المقاييس الأحدث لمقاومة البحث والحفظ الآلي. كما يمكن اختيار ظروف التقييم بطريقة مُفضَّلة: مثل استخدام مجموعة جزئية مختلفة، أو زيادة عدد المحاولات، أو السماح باستخدام أدوات معينة عند المقارنة بنموذج لا يستخدمها. وتخفِّف اللوحات القيادية المستقلة التي تُدار بشكل منفصل والمؤشرات المركَّبة من كلا النوعين من التحيُّز.
أي مكاسب حقيقية في القدرات — ولذلك صُمِّمت مقاييس الأداء الأحدث لمقاومة عمليات البحث
والحفظ عن ظهر قلب. كما يمكن اختيار شروط التقييم بشكلٍ مُفضَّل: مثل استخدام مجموعة فرعية مختلفة، أو عدد أكبر من المحاولات، أو الاستفادة من أدوات معينة عند المقارنة بنموذج لا يستخدمها. وتخفِّف لوائح التصنيف المستقلة والمؤشرات المركبة من كلا المشكلتين.
وتخفِّف لوائح التصنيف المستقلة والمؤشرات المركبة من كلا المشكلتين.
وتخفِّف لوائح التصنيف المستقلة والمؤشرات المركبة من كلا المشكلتين.

هل تتنبَّأ نتائج المقاييس بأداء النموذج في العالم الحقيقي؟

جزئيًّا. فالمقاييس المُصمَّمة لتكون مُطابقةً للمهام الواقعية، مثل «SWE-bench Verified» و«OSWorld»، تتنبَّأ بدقة معقولة لأن المهمة المُختبرة هي بالفعل المهمة الواقعية نفسها.
أما مقاييس الاختيارات المتعددة الأكاديمية فهي تتنبَّأ بشكل ضعيف، لأن الإجابة عن أسئلة الامتحانات ليست المهمة التي تؤديها معظم التطبيقات عادةً.
وأفضل مؤشّر تنبُّئي لا يزال هو التقييم الذي تقوم أنت ببنائه على بياناتك الخاصة.
وأفضل مؤشّر تنبُّئي لا يزال هو التقييم الذي تقوم أنت ببنائه على بياناتك الخاصة.

أي نموذج مفتوح الوزن يحقق أعلى درجة؟

نموذج كيمي K3 بنتيجة ٥٧ على مؤشر الذكاء الاصطناعي من Artificial Analysis، وهي أفضل نتيجة محقَّقة لنموذج مفتوح الوزن حتى الآن، وتقلُّ بـ٤ نقاط فقط عن أفضل نموذج مغلق.
الجدول القيادي أعلاه يُحدِّد كل إدخال مفتوح الوزن، والمجموعة الكاملة قابلة للفرز في
الجدول أدناه
لوحة تصنيف النماذج اللغوية الكبيرة (LLM).

انتقل إلى الأعلى
Featured on There's An AI For That