أطلقت اثنتان من أكثر مختبرات الذكاء الاصطناعي طموحًا في الصين نموذجين جديدين مفتوحي الوزن للبرمجة خلال يومٍ واحدٍ هذا الشهر. فقد أطلقت شركة Moonshot كيمي ك٢.٧ كود في ١٢ يونيو؛ بينما ردَّت شركة Zhipu (Z.ai) في اليوم التالي بإطلاق غلْم ٥.٢ في ١٣ يونيو. وكلا النموذجين من نوع «مزيج الخبراء» (MoE) الضخم، وكلاهما يحمل رخصةً مرنة، وكلاهما موجَّهٌ مباشرةً إلى نفس المهمة: البرمجة ذات الأفق الطويل والقائمة على الوكلاء دون تكبُّد تكلفة استخدام أنظمة Claude أو GPT.
The twist is in how each lab handled benchmarks. Moonshot published a stack of first-party numbers for K2.7 Code on day one. Zhipu deployed غلْم ٥.٢ to its Coding Plan tiers first with no benchmark table at all, then released a full benchmark set alongside the API and MIT open weights days later. So as of this writing, both models now have vendor-published coding scores — but neither has a deep bench of fully independent SWE-bench numbers yet, and Moonshot’s headline figures sit on proprietary in-house suites that practitioners have already started to question. Here’s how the two actually stack up, what we can verify, and what’s still a question mark.
أبرز النقاط المستفادة
- أشكال مختلفة، وهدف واحد. كيمي ك٢.٧ كود is a 1T-param MoE with 32B active and 256K context; GLM 5.2 is ~744-753B total with ~40B active and a full 1M context.
- كلا النموذجين يمتلك الآن نتائج اختبارات قياسية منشورة من قِبل الشركات المطورة. Moonshot reports +21.8% on its own Kimi Code Bench v2 (62.0 vs 50.9) plus ~30% fewer reasoning tokens. Zhipu later published GLM 5.2 scores too — SWE-bench Pro 62.1, Terminal-Bench 2.1 81.0, FrontierSWE 74.4 — beating جي بي تي-٥.٥ on several long-horizon suites. Treat both vendors’ numbers with caution until independent runs land.
- التسعير يميل لصالح كيمي من حيث التكلفة لكل رمز، ولصالح GLM من حيث التكلفة الشهرية. سعر كيمي يُحسب حسب عدد الرموز الداخلة والخارجة: 0.95 دولار أمريكي لكل مليون رمز داخلي، و4.00 دولارات لكل مليون رمز خارجي؛ أما سعر GLM فيتراوح حول 1.40 دولار لكل مليون رمز داخلي و4.40 دولارات لكل مليون رمز خارجي، أو عبر خطة «GLM Coding Plan» ثابتة تبدأ من 10 دولارات شهريًّا (النسخة Lite).
- كلا النموذجين مفتوحان حقًّا ومرحبٌ باستخدامهما تجاريًّا. ترخيص GLM 5.2 هو ترخيص MIT؛ أما ترخيص كيمي فهو ترخيص MIT معدل (يسمح بالاستخدام التجاري، مع شرط الإسناد فقط في حال تجاوز عدد المستخدمين النشطين شهريًّا 100 مليون مستخدم أو تجاوز الإيرادات الشهرية 20 مليون دولار أمريكي).
- نموذج GLM يتكامل بسلاسة مع نظام Claude Code. توفر شركة Z.ai نقطة نهاية (Endpoint) متوافقة مع واجهة Anthropic، لذا تعمل وكلاء Claude Code / SDK الخاصين بـ Anthropic مباشرةً مع تغيير بسيط في عنوان URL الأساسي (base-URL) ومفتاح الوصول (API key).
- تشغيل الأوزان (Weights) ليس ممكنًا على أجهزة اللابتوب. سعة 744 مليار معامل وأكثر، وتريليون معامل تعني الحاجة إلى خوادم متعددة وحدات معالجة رسومية (Multi-GPU) أو تطبيق تقنيات تكمين (Quantization) متقدمة جدًّا — لذا سيبدأ معظم المستخدمين بالاعتماد أولًا على واجهات البرمجة السحابية (Cloud APIs).
- النسخة المختصرة في 30 ثانية
- الهندسة والمُعاملات النشطة
- نافذة السياق: مليون رمز مقابل 256 ألف رمز
- الاختبارات القياسية الخاصة بالبرمجة (والفجوة في الشفافية)
- التسعير والقيمة المقدمة
- الترخيص والانفتاح
- البرمجة الذاتية (Agentic coding) واستخدام الأدوات
- كيفية تشغيل كل نموذج فعليًّا
- كيف يتناسب هذان النموذجان مع نموذجي DeepSeek V4 وQwen 3.x
- الأسئلة الشائعة
- الخلاصة
- مقالات ذات صلة
النسخة المختصرة في 30 ثانية
إذا كنت تبحث عن أطول سياق ممكن، وأعلى درجات برمجية منشورة ومفتوحة المصدر، وترخيص معهد ماساتشوستس للتكنولوجيا (MIT)، وفاتورة شهرية ثابتة، والتوافق التام مع كلاود كود (Claude Code)، فإن نموذج GLM 5.2 يُعَدّ الحزمة الأكمل اليوم. أما إذا كنت تبحث عن أرخص سعر لكل رمز (token)، وأفضل خصم للذاكرة المؤقتة (cache) في الحلقات البرمجية الوكيلية (agent loops) التي تستهلك عددًا كبيرًا من الرموز، ومكاسب مُقاسَة في كفاءة استهلاك الرموز، فإن نموذج Kimi K2.7 Code هو الخيار الأكثر اقتصادية. ومع أن مقاييس الأداء المنشورة من قِبل كلا المورِّدين هي مقاييس أولية (first-party) حتى الآن، فإن مقارنة مباشرة في مهمة واحدة أعطت GLM تفوّقًا طفيفًا — لذا فإن أي شخصٍ يُعلِّن فائزًا نهائيًّا هذا الأسبوع يعتمد على تسويق المورِّد لا على بيانات مستقلة.
الهندسة والمُعاملات النشطة
بني هذان النموذجان على نفس الفكرة العامة: وهي نموذج ضخم قائم على التخصص المتناثر (sparse MoE)، حيث لا يتم تفعيل سوى جزء صغير من المعاملات (parameters) لكل رمز — لكنهما يضبطان هذه الفكرة بشكل مختلف.
يبدو نموذج Kimi K2.7 Code أكبر على الورق: فهو يحتوي على إجمالي مليار معامل (1 تريليون)، مع تفعيل 32 مليار معامل لكل رمز، مستمدًّا من 384 خبيرًا (8 خبراء يتم توجيه الرمز إليهم زائد خبير مشترك واحد لكل رمز). وهذه التفعيلات المتفرقة (sparse activation) هي السبب في إمكانية تشغيل نموذج يتضمّن مليار معامل بتكلفة معقولة. أما نموذج GLM 5.2 فهو أصغر إجمالًا (تشير وثائق Z.ai إلى نحو 753 مليار معامل، بينما تشير أدوات التتبع مثل vLLM إلى نحو 744 مليار)، لكنه يُفعِّل عددًا أكبر قليلًا من المعاملات لكل رمز (حوالي 40 مليار)، ويعتمد على سياق أطول ونظام مزدوج للجهد التفكيري: وضع «عالي» (High) للأعمال الروتينية، ووضع «أقصى» (Max) للمهام الأصعب المتعلقة بالهندسة المعمارية والتصحيح (debugging).
الاستنتاج العملي: قد يساعد حجم مجموعة الخبراء الأكبر لدى Kimi في توسيع نطاق المعرفة، بينما يركّز GLM عبر عدده الأكبر من المعاملات النشطة لكل رمز وأنماط الجهد التفكيري على العمق في حل مشكلة واحدة صعبة. وتتجه مقاييس الأداء المنشورة حاليًّا لصالح GLM في المهام الهندسية الطويلة الأمد، لكن هذه المقاييس أُجريت من قِبل المورِّد، لذا ينبغي اعتبار القصة المعمارية دليلًا داعمًا لا حكمًا نهائيًّا.
نافذة السياق: مليون رمز مقابل 256 ألف رمز
هذه هي أوضح فروقٍ يمكن التحقق منها بسهولة. فنموذج GLM 5.2 يوفّر سياقًا حقيقيًّا بسعة مليون رمز (1,000,000-token context) — وهو الإصدار glm-5.2[1m] — مع حد أقصى للإخراج يبلغ نحو 128 ألف إلى 131 ألف رمز. أما نموذج Kimi K2.7 Code فيعمل ضمن سياق 256 ألف رمز (262,144 رمزًا)، وحد أقصى افتراضي أصغر بكثير للإخراج يبلغ 32,768 رمزًا.
وبالنسبة لأعمال الوكلاء (agentic work) على نطاق المستودعات البرمجية (repo-scale) — مثل تحميل قاعدة برمجية كبيرة، أو تتبع عمليات التخطيط ثم التنفيذ الطويلة، أو إعادة هيكلة ملفات متعددة دفعة واحدة — فإن نافذة الـ 1 مليون رمز الخاصة بـ GLM تمثّل ميزة حقيقية، وتتطابق مع ما تقدّمه الآن أحدث النماذج المفتوحة مثل DeepSeek V4 and Qwen 3.6 Plus now offer. That said, 256K is still large, and in agentic loops most well-built tools retrieve and chunk context rather than stuffing the whole repo in. Bigger context helps; it isn’t automatically better code.
الاختبارات القياسية الخاصة بالبرمجة (والفجوة في الشفافية)
وهنا بالتحديد يجب أن تحافظ على شكوكك، لأن كل رقم بارز أدناه منشور من قِبل المورِّد.
أفادت شركة Moonshot بأن نموذج K2.7 Code حقّق درجة 62.0 في اختبار Kimi Code Bench v2 الداخلي الخاص بها، مسجّلًا ارتفاعًا بنسبة 21.8% مقارنةً بدرجة 50.9 التي حقّقها الإصدار K2.6، إلى جانب مكاسب في اختبارات Program Bench ومجموعات الاختبارات الوكيلية المرتكزة على MCP، وخفضًا بنسبة ~30% في استخدام رموز الاستنتاج (reasoning-token). وهذه ادعاءات محددة — لكنها تُجرى على مقاييس أداء خاصة بشركة Moonshot، وقد أفاد أحد المنشورات (VentureBeat) بأن ممارسين ذكروا أن هذه الأرقام لا تتطابق تمامًا مع الأداء الفعلي. أما أرقام SWE-bench Verified أو SWE-bench Pro المستقلة لنموذج K2.7 Code فهي غير متوفرة وقت كتابة هذا التقرير.
GLM 5.2 came out the other way around: it launched on Zhipu’s Coding Plan tiers with no benchmark table, then Z.ai published a full set alongside the API and open weights. Those scores are strong — SWE-bench Pro 62.1 (vs GPT-5.5’s 58.6 and GLM 5.1’s 58.4), Terminal-Bench 2.1 (Terminus-2) 81.0 (vs GPT-5.5’s 84.0), FrontierSWE 74.4% (vs GPT-5.5’s 72.6%), plus long-horizon wins on PostTrainBench (34.3 vs 28.4) and SWE-Marathon (13.0 vs 12.0). Several of those were run by outside evaluators (Proximal, the PostTrainBench team, Abundant AI), but they’re surfaced and curated by Z.ai, so treat them as vendor-published rather than fully independent. The takeaway: GLM 5.2 posts the stronger open-weight coding numbers on paper, while still trailing كلاود أوبس ٤.٨ on most of them.
وتوجد نقطة بيانات واحدة أقرب إلى الحياد. ففي مقارنة مباشرة على طريقة التقييم المستقل أجرتها شركة Kilo، حقّق GLM 5.2 تفوّقًا في التخطيط: 9.0 مقابل 8.1 لـ Kimi في مهمة خدمة تبديل الميزات (feature-flag service) للواجهة الخلفية، حيث نجح GLM في اجتياز جميع الاختبارات البالغ عددها 15، بينما نجح Kimi في 14 من أصل 15، وأنتج كلا النموذجين بنىً تشغيلية متطابقة تقريبًا. وهذه إشارة مفيدة، لكنها تتعلّق بمهمة واحدة فقط أجرتها جهة تقييم واحدة، وليس مجموعة مقاييس شاملة.
| المواصفات | GLM 5.2 (Zhipu / Z.ai) | Kimi K2.7 Code (Moonshot) |
|---|---|---|
| أُطلِقَ | ١٣ يونيو ٢٠٢٦ | 12 يونيو 2026 |
| إجمالي المعلَّمات / المعلَّمات النشطة | ~744–753 مليار معامل في نموذج التخصص المتناثر (MoE) / ~40 مليار معامل نشطة | تريليون معامل في نموذج التخصص المتناثر (MoE) / 32 مليار معامل نشطة (من 384 خبيرًا) |
| نافذة السياق | مليون رمز (Token) | 256 ألف رمز (262,144 رمزًا) |
| الحد الأقصى للإخراج | ~128–131 ألف رمز | ~32 ألف رمز (32,768 رمزًا) |
| مقاييس الأداء البرمجية الرسمية | SWE-bench Pro 62.1؛ Terminal-Bench 2.1 81.0؛ FrontierSWE 74.4% (منشورة من قِبل المورِّد، وبعضها أُجري من قِبل أطراف ثالثة) | +21.8% في Kimi Code Bench v2 (62.0 مقابل 50.9، مُبلَّغ عنها من قِبل المورِّد) |
| SWE-bench المستقل | غير متوفر بعد (مجموعات مقاييس عامة) | غير متوفر بعد |
| سعر واجهة برمجة التطبيقات (لكل مليون رمز) | ~1.40 دولار أمريكي للإدخال / ~4.40 دولار أمريكي للإخراج؛ وخطة شهرية ثابتة تبدأ من 10 دولارات أمريكي شهريًّا | 0.95 دولار أمريكي للإدخال / 4.00 دولار أمريكي للإخراج؛ و0.19 دولار أمريكي لكل مليون رمز مخزّن مؤقتًا (cached) |
| الترخيص | MIT | ترخيص MIT معدل (مسموح بالاستخدام التجاري؛ ويشترط الإسناد إذا تجاوز عدد المستخدمين النشطين الشهريين 100 مليون أو تجاوز الإيراد الشهري 20 مليون دولار أمريكي) |
| التوافق مع نقاط النهاية (Endpoint compatibility) | متوافق مع OpenAI وAnthropic | متوافق مع OpenAI (Moonshot / OpenRouter) |
التسعير والقيمة المقدمة
تختلف نماذج التسعير بشكل جذري، لذا فإن الإجابة عن السؤال «أيّها أرخص؟» تعتمد على طريقة الاستخدام.
يتم تسعير Kimi K2.7 Code بطريقة مباشرة عبر واجهة برمجة التطبيقات: 0.95 دولار أمريكي لكل مليون رمز إدخال، و4.00 دولارات أمريكية لكل مليون رمز إخراج، وسعر ملحوظ يبلغ 0.19 دولار أمريكي لكل مليون رمز مخزّن مؤقتًا. ويكتسب سعر التخزين المؤقت أهمية كبيرة في البرمجة الوكيلية، حيث يتم إعادة إرسال جزء كبير من السياق الثابت في كل خطوة. وبهذه الأسعار، يكون Kimi أرخص بكثير من النماذج الرائدة الغربية — فحسب سعر الإخراج وحده، يكون أرخص من الخيارات الممتازة بأكثر من عشر مرات.
أما GLM 5.2 فيُسعَّر عند حوالي 1.40 دولار أمريكي للإدخال و4.40 دولارات أمريكية للإخراج لكل مليون رمز (وهو ساري حاليًّا عبر مزوّدي الخدمة مثل FriendliAI وNovita وZ.ai)، لكن شركة Zhipu تروّج أيضًا لخطة التخطيط البرمجي (GLM Coding Plan)، وهي اشتراك شهري ثابت يشمل الطبقات التالية: Lite وPro وMax وTeam. وتبدأ خطة Lite من 10 دولارات أمريكية شهريًّا (ما يعادل نحو 400 طلبية أسبوعيًّا)، وPro من 30 دولارًا أمريكيًّا شهريًّا، وMax من 80 دولارًا أمريكيًّا شهريًّا — وهي قيمة ممتازة جدًّا إذا كنت تبرمج يوميًّا باستخدامه وتريد فواتير متوقعة.
فإذا كنت مطوّرًا فرديًّا تعمل داخل وكيل برمجي طوال اليوم، فقد تكون الخطة الشهرية الثابتة لـ GLM هي الخيار الأرخص عمليًّا. أما إذا كنت تدير أعباء عمل متغيرة أو متقطعة، أو تبني منتجًا فوق هذا النموذج، فإن نظام Kimi القائم على التسعير بالرمز مع تخزين مؤقت رخيص يجعل التكاليف أسهل في التقدير. ولرسم صورة أوسع عن التكلفة عبر الخيارات القابلة للاستضافة الذاتية، فإن ملخّصنا لـ الأفضل نموذج لغوي محلي متخصص في البرمجة في عام ٢٠٢٦ يضع كلا النموذجين في سياقهما.
الترخيص والانفتاح
كلا النموذجين مفتوحا الوزن (open-weight) فعلاً، مما يميّزهما عن المختبرات الرائدة المغلقة — لكن البنود الدقيقة تختلف.
يستخدم GLM 5.2 ترخيص MIT القياسي: يمكنك استخدامه، وتعديله، وتوزيعه تجاريًّا دون أي قيود. أما Kimi K2.7 Code فيستخدم ترخيص MIT معدلًا يسمح أيضًا بالاستخدام التجاري، لكنه يضيف شرطًا واحدًا: إذا تجاوز منتجك 100 مليون مستخدم نشط شهريًّا أو 20 مليون دولار أمريكي من الإيراد الشهري، فيجب عليك عرض عبارة «Kimi K2.7 Code» بوضوح في واجهة المستخدم. وهذا الشرط ليس مشكلة تقريبًا لأي فريق تقريبًا؛ لكنه شرط حقيقي بالنسبة لمزوّدي الخدمات الضخمة جدًّا (hyperscalers). وبالتالي، من حيث الترخيص الأقل تقييدًا، يتفوّق GLM 5.2 بترخيص MIT الكامل.
نقاط قوة GLM 5.2
- سياق كامل بسعة مليون رمز لأعمال المستودعات البرمجية
- أعلى درجات برمجية منشورة بين النماذج المفتوحة من حيث الوزن (open-weight)
- ترخيص MIT غير المقيد
- التوافق التام مع نقاط النهاية الخاصة بـ Anthropic وOpenAI
- خطة برمجية شهرية ثابتة تبدأ من 10 دولارات أمريكية شهريًّا
- تحكم في مستوى الجهد التفكيري: وضع «عالي» (High) ووضع «أقصى» (Max)
تحذيرات حول GLM 5.2
- جميع مقاييس الأداء منشورة من قِبل المورِّد (وبعضها أُجري من قِبل أطراف ثالثة)؛ ولا توجد حتى الآن مجموعة مقاييس SWE-bench مستقلة واسعة النطاق
- سعر واجهة برمجة التطبيقات لكل رمز أعلى قليلًا من Kimi
- إجمالي عدد المعاملات أقل
البرمجة الذاتية (Agentic coding) واستخدام الأدوات
يستهدف كلا النموذجين صراحةً وكلاء البرمجة الطويلة الأمد (long-horizon coding agents)، وليس مجرد إكمال أجزاء صغيرة من الكود، وكلاهما يدعم استدعاء الأدوات (tool-calling) بكفاءة عالية.
أما الميزة البارزة لـ GLM 5.2 بالنسبة لبناة الوكلاء فهي التوافق: فبما أن Z.ai تقدّم نقطة نهاية متوافقة مع Anthropic (إلى جانب نقطة نهاية متوافقة مع OpenAI)، يمكنك توجيه وكيل كلاود كود (Claude Code) أو وكيل يستخدم SDK الخاص بـ Anthropic إليه مباشرةً عبر تغيير عنوان URL الأساسي ومفتاح الوصول — دون الحاجة لإعادة كتابة أي كود. كما أنه يتكامل تكاملاً طبيعيًّا مع أدوات التطوير مثل Cline وCursor وأكثر من 20 أداة أخرى، كما أن درجاته المنشورة في المهام الطويلة الأمد (FrontierSWE وPostTrainBench وSWE-Marathon) موجّهة تحديدًا لأعباء العمل الوكيلية التي تمتد لساعات متعددة. أما Kimi K2.7 Code فيركّز على الكفاءة الوكيلية المُقاسة: فالانخفاض المبلغ عنه من قِبل Moonshot بنسبة ~30% في استخدام رموز الاستنتاج يهدف مباشرةً إلى خفض التكلفة والتأخير في الحلقات الوكيلية متعددة الخطوات، ويحقّق النموذج مكاسب في مجموعات الاختبارات المرتبطة بـ MCP. وإذا كنت تختار إطار عمل وكيل (agent harness) حول أحدهما، فإن دليلنا إلى الأفضل إطارات عمل الوكلاء الذكية (AI agent frameworks) في عام ٢٠٢٦ يغطي طبقة التنسيق (orchestration layer).
كيفية تشغيل كل نموذج فعليًّا
هناك طريقتان، وللغالبية العظمى من الناس تكون الإجابة هي السحابة.
واجهة برمجية سحابية (Cloud API) هي الطريق الأسهل. فنموذج Kimi K2.7 Code متاح عبر واجهة برمجة تطبيقات Moonshot ومجمّعات مثل OpenRouter؛ أما GLM 5.2 فهو متاح عبر خطة التخطيط البرمجي (GLM Coding Plan) وعبر نقاط النهاية المتوافقة مع OpenAI/Anthropic (عنوان URL الأساسي api.z.ai). وهنا يجب أن يبدأ الغالبية العظمى من المستخدمين.
أوزان مفتوحة المصدر منشورة — فنموذج Kimi K2.7 Code متاح على Hugging Face مع دعم vLLM وSGLang وKTransformers، كما يمكن تنزيل أوزان GLM 5.2 المرخصة بموجب MIT — لكن المتطلبات المادية جادة جدًّا. فنموذج بحجم تريليون معامل (حتى لو كان 32 مليار معامل نشطة فقط) أو نموذج بحجم نحو 750 مليار معامل يحتاج إلى خوادم متعددة وحدات معالجة رسومية (multi-GPU servers) أو تكميم GGUF مكثّف لتشغيله محليًّا؛ فهذان النموذجان ليسا مناسبين لبطاقة معالجة رسومية استهلاكية واحدة. فإذا كان هدفك هو استضافة نماذج برمجية أصغر على أجهزة استهلاكية عادية، فستكون خياراتك أفضل مع أفضل نماذج لغوية محلية (LLMs) لتشغيلها على منصة Ollama في عام 2026 مقارنةً بهذين العملاقين.
How they fit next to DeepSeek V4 and Qwen 3.x
Neither model exists in a vacuum. DeepSeek V4-Pro (released April 2026) ships 1.6T params with a 1M context and an MIT license, and posts a verified 80.6% on SWE-bench Verified — currently the strongest open-weight number around. Qwen 3.6 Plus also offers a 1M context and a frontier-competitive 78.8% on SWE-bench Verified. In other words, GLM 5.2 and Kimi K2.7 Code are entering a crowded, fast-moving field where rivals already have published, partly independent benchmarks on the standard public suites. GLM 5.2’s vendor numbers are competitive, but the gold-standard SWE-bench Verified comparisons still belong to DeepSeek and Qwen for now. For a closer look at that pair, see our مقارنتنا بين DeepSeek V4 وQwen3.
الأسئلة الشائعة
أيهما أفضل للبرمجة: GLM 5.2 أم Kimi K2.7 Code؟
لا توجد إجابةٌ مستقلةٌ تمامًا حتى الآن، لكن وفقًا للأرقام المنشورة يبدو أن GLM 5.2 أقوى في مهام البرمجة ذات الأفق الطويل: إذ تشير مقاييس شركة Zhipu إلى تحقيقه نسبة ٦٢,١٪ في اختبار SWE-bench Pro ونسبة ٧٤,٤٪ في اختبار FrontierSWE، متقدِّمًا بذلك على GPT-5.5 في عدة مجموعات اختبار، مع نافذة سياق تبلغ مليون رمز وتوافقٍ مع نظام Claude Code. أما Kimi K2.7 Code فهو أرخص من حيث التكلفة لكل رمز، ويُبلِّغ عن تحسُّنٍ نسبته +٢١,٨٪ في اختباره الخاص بالبرمجة. وفي اختبار مباشر واحد لمهمة واحدة (Kilo) أعطى الاختبار GLM تفوُّقًا طفيفًا في التخطيط (٩,٠ مقابل ٨,١، و١٥ من أصل ١٥ مقابل ١٤ من أصل ١٥ في الاختبارات). وكل هذه النتائج الرئيسية نشرتها الشركات المصنِّعة، لذا يجدر الانتظار حتى تُجرَى اختبارات SWE-bench المستقلة قبل اعتبار أيٍّ منها نهائية.
هل نُشِرت مقاييس أداءٍ لـ GLM 5.2؟
نعم — لكن ليس عند الإطلاق. فقد نشرت شركة Zhipu نموذج GLM 5.2 أولًا في طبقات «التخطيط البرمجي» الخاصة بها في ١٣ يونيو ٢٠٢٦ دون جدول مقاييس أداء، ثم نشرت مجموعةً كاملةً من المقاييس بعد أيامٍ قليلةٍ بالتزامن مع إطلاق واجهة برمجة التطبيقات (API) وإتاحة الأوزان المفتوحة بموجب رخصة MIT: وهي ٦٢,١٪ في اختبار SWE-bench Pro، و٨١,٠٪ في اختبار Terminal-Bench 2.1، و٧٤,٤٪ في اختبار FrontierSWE، و٣٤,٣٪ في اختبار PostTrainBench، و١٣,٠٪ في اختبار SWE-Marathon، متفوِّقًا بذلك على GPT-5.5 في عدة مجموعات اختبار ذات أفق طويل، وإن كان يتأخَّر عن Claude Opus 4.8 في معظمها. وقد أُجريت عدة اختبارات بواسطة جهات تقييم خارجية، لكنها خضعت لإشراف شركة Z.ai، وبالتالي فهي مقاييس نشرتها الشركة المصنِّعة، وليست مقاييس مستقلة تمامًا.
هل يمكنني استخدام GLM 5.2 مع نظام Claude Code؟
نعم. فشركة Z.ai توفِّر نقطة نهاية متوافقة مع منصة Anthropic (تحت api.z.ai، مثل https://api.z.ai/api/anthropic أو نقطة النهاية الخاصة بالبرمجة)، لذا يمكنك توجيه نظام Claude Code أو وكيل يستخدم مكتبة Anthropic SDK نحو نموذج GLM 5.2 عبر ضبط ANTHROPIC_BASE_URL ومفتاح واجهة برمجة التطبيقات (API) الخاص بـ Z.ai، ثم تحديد نموذج glm-5.2 (أو glm-5.2[1m]) — دون الحاجة إلى إعادة كتابة أي كود. ويتوقَّع أن ترفع حد زمن انتظار الطلبات، لأن زمن ظهور الرمز الأول في نافذة السياق البالغة مليون رمز أطول من القيمة الافتراضية في نظام Claude.
ما تكلفة كل نموذج؟
يُحتسَب سعر Kimi K2.7 Code وفق معدلات تدريجية: ٠,٩٥ دولار أمريكي لكل مليون رمز مُدخَل، و٤,٠٠ دولارات لكل مليون رمز مُخرَج، و٠,١٩ دولار لكل مليون رمز مُخبَّأ. أما سعر GLM 5.2 فيتراوح بين ١,٤٠ دولار لكل مليون رمز مُدخَل و٤,٤٠ دولارات لكل مليون رمز مُخرَج، أو يُباع ضمن خطة «البرمجة بـ GLM» بأسعار شهرية تبدأ من ١٠ دولارات (النسخة الخفيفة)، و٣٠ دولارًا للنسخة الاحترافية، و٨٠ دولارًا للنسخة القصوى.
هل يُسمح باستخدام Kimi K2.7 Code مجانًا في الاستخدام التجاري؟
نعم، عمليًّا. فهو يعتمد رخصة MIT المعدَّلة التي تسمح بالاستخدام التجاري؛ والشرط الإضافي الوحيد هو أن تظهر عبارة «Kimi K2.7 Code» في واجهة المستخدم لأي منتج يتجاوز عدد مستخدميه النشطين الشهريين ١٠٠ مليون مستخدم، أو إيراده الشهري ٢٠ مليون دولار أمريكي. أما رخصة GLM 5.2 البسيطة بموجب MIT فلا تتضمَّن مثل هذا الشرط.
هل يمكن تشغيل هذين النموذجين محليًّا؟
نعم، الأوزان متوفرة — فنموذج Kimi K2.7 Code متاح على منصة Hugging Face (يدعمه محركات vLLM/SGLang/KTransformers)، ونموذج GLM 5.2 متوفر بموجب رخصة MIT — لكن كلا النموذجين كبير جدًّا باعتبارهما نموذجين من نوع «مزيج الخبراء» (MoE). لذا يتوقَّع أن تحتاج إلى خوادم متعددة وحدات معالجة رسومية (GPU) أو تطبيق تقنيات تكمين (quantization) شديدة التشدُّد؛ ولا يمكن تشغيل أيٍّ منهما بسلاسة على وحدة معالجة رسومية استهلاكية واحدة.
أيهما يمتلك نافذة سياق أكبر؟
GLM 5.2، وبفارقٍ كبيرٍ جدًّا: مليون رمز مقابل ٢٥٦ ألف رمز لدى Kimi K2.7 Code. وهذا يجعل GLM الخيار الأفضل لسياقات تتضمَّن مستودعات برمجية كاملة أو تتبعات وكلاء طويلة جدًّا، رغم أن أدوات الوكلاء القوية تقلِّل من الحاجة المتكرِّرة لاستخدام النافذة الكاملة.
الخلاصة
هذان نموذجان ممتازان حقًّا ومفتوحا المصدر للبرمجة، أُطلِقا في يومٍ واحد، والحكم الصادق هو أن التنافس بينهما وثيقٌ جدًّا — مع تمتع GLM 5.2 حاليًّا بميزة نظرية على الورق. فكلا الشركتين المطوِّرتين نشرتا مقاييس أداءٍ خاصة بالبرمجة، وتتفوَّق مقاييس شركة Zhipu على نظيرتها (٦٢,١٪ في SWE-bench Pro و٧٤,٤٪ في FrontierSWE، متقدِّمةً على GPT-5.5 في عدة مجموعات اختبار ذات أفق طويل)، بالإضافة إلى نافذة سياق تبلغ مليون رمز، ورخصة MIT غير المقيدة، ونظام فوترة ثابت وواضح، وتكامل سلس مع نظام Claude Code. أما Kimi K2.7 Code فيردّ بسعر أقل لكل رمز، وخصم قوي على الرموز المُخبَّأة، ودورات وكلاء فعَّالة من حيث استهلاك الرموز، ومكاسب مُبلَّغ عنها ذاتيًّا.
إذا كنت تُطلِق منتجًا أو تدير أحمال عمل متغيرة كثيفة، فابدأ باستخدام واجهة برمجة التطبيقات (API) التدريجية الخاصة بـ Kimi واستفد من خصم التخزين المؤقت. أما إذا كنت تعمل داخل وكيل برمجي طوال اليوم وترى أن نافذة السياق البالغة مليون رمز ذات قيمة عالية، وأن أعلى النتائج المنشورة مهمة لك، وأن التوافق السلس مع منصة Anthropic أمرٌ بالغ الأهمية، فإن خطة البرمجة الخاصة بـ GLM 5.2 تكاد تكون لا تُضاهى. وأيًّا كان اختيارك، تذكَّر أن كل رقمٍ رئيسيٍّ هنا نشرته الشركة المصنِّعة — لذا انتظر نتائج SWE-bench Verified المستقلة قبل اعتبار أي ادعاء تسويقي حقيقةً راسخة. ففي مجالٍ حقَّق فيه DeepSeek V4-Pro بالفعل نسبةً مُوثَّقةً قدرها ٨٠,٦٪ في اختبار SWE-bench Verified، فإن معيار «أفضل نموذج برمجي مفتوح المصدر» يُقاس بواسطة جهات تقييم محايدة، وليس عبر ادعاءات المختبرات التي طوَّرت تلك النماذج.

