إمكانيات نمو ذكاء نفيديا الاصطناعي هي الإطار الذي تدور حوله تحليلٌ جديدٌ أصدرته شركة إنليكتيا للذكاء الاصطناعي، تحت العنوان «هيمنة نفيديا في مجال الذكاء الاصطناعي وإمكاناتها النموية». وما هو متاح علنًا من هذه المادة يقتصر على العنوان وسطرٍ واحدٍ من الملخّص: فلا توجد فيه أرقام إيرادات، ولا أرقام شحنات، ولا توقعات، ولا اقتباسات. وبالتالي يبقى السؤال الأسهل اختبارًا موجّهًا إلى من يبنون النماذج بدلًا من من يتداولونها. فكم يدفع المطوّر فعليًّا مقابل كل رمز (token)، وكم من الذاكرة يحتاجه النموذج قبل أن يبدأ حتى في التحميل، وهل تم تحديد ذلك كله بالفعل بموقف مزوِّد واحد في سوق وحدات التسارع (accelerators)؟
أبرز النقاط المستخلصة
- نشرت شركة إنليكتيا للذكاء الاصطناعي تحليلًا بعنوان «هيمنة نفيديا في مجال الذكاء الاصطناعي وإمكاناتها النموية». والمقتطف المتاح لا يتضمّن أي أرقام أو توقعات أو اقتباسات، لذا فإن أي رقم محدّد يُنسَب إلى هذه القصة في مكان آخر لا ينبع من هذه المادة.
- لم يُعلن شيءٌ على الإطلاق: لا أجهزة جديدة، ولا تغيير في الأسعار، ولا تحديثات بشأن الإمدادات. فالورقة عبارة عن حجة تتعلّق بالاتجاه المستقبلي، وليست حدثًا من أحداث إطلاق منتجات.
- والسبب الهيكلي الذي يجعل هذا الأمر مهمًّا للمطوّرين هو أن تكلفة وحدات التسارع وقدرتها التخزينية تشكّلان الأساس لكلٍّ من أسعار الرموز (tokens) المقدمة عبر الاستضافة، وميزانيات التشغيل الذاتي.
- تتراوح النماذج المفتوحة المصدر ذات الحدود الأمامية في قاعدة بيانات كونفلي بين نحو ١٤٠ جيجابايت و١,٤ تيرابايت من ذاكرة VRAM عند التكميم (quantisation) بـ ٤ بت، مع Kimi K3 في طرف هذه المجموعة العليا.
- وتتفاوت أسعار الاستضافة عبر ثلاثة أوامر من حيث الحجم، بدءًا من ٠,٠٢ دولار أمريكي لكل مليون رمز إدخال لـ Llama 3.1 8B وصولًا إلى ١٠ دولارات للداخل و٥٠ دولارًا للخارج لكلاود فابل ٥.
- أما نموذج نفيديا الخاص Nemotron 3 Nano Omni فيشغل نحو ٢١ جيجابايت عند تكميم NVFP4، ما يدل على أن نفس المُصنِّع يركّز بشدة على الاستنتاجات ذات البصمة الصغيرة (small-footprint inference).
- ما يتضمّنه تحليل إنليكتيا للذكاء الاصطناعي وما لا يتضمّنه
- لماذا يظهر موقف نفيديا في فاتورة الرموز الخاصة بالمطوّر
- مشكلة الـ ١,٤ تيرابايت: أوزان النماذج الحدّية و«جدار الذاكرة»
- التشغيل الذاتي مقابل الاستئجار: حيث تظهر الهيمنة فعليًّا
- النماذج الصغيرة الخاصة بنفيديا تقلّص البصمة العتادية، وليس بالضرورة الطلب الفعلي
- كيف تقرأ ادعاءً نموّيًّا لا يرتبط بأي أرقام
- الأسئلة الشائعة
- الخلاصة
ما يتضمّنه تحليل إنليكتيا للذكاء الاصطناعي وما لا يتضمّنه
إن الانضباط في التعامل مع هذه المسألة مهمٌّ أكثر من المعتاد. فشركة إنليكتيا للذكاء الاصطناعي هي ناشرة متخصصة في البحث الاستثماري، والمادة التي ظهرت مؤخرًا ليست سوى عنوان رئيسي بالإضافة إلى ملخّص قصير يدّعي أن التفوّق الذي حققته نفيديا في حوسبة الذكاء الاصطناعي لا يزال لديه هامش للنمو. ولا يوجد في هذا الملخّص أي نسبة مئوية لحصة السوق، ولا حجم وحدات مبيعات، ولا توقعات مؤرخة، ولا اسم تنفيذي مذكور. ولن نقوم نحن بتزويدها بهذه الأرقام نيابة عنها، كما ينبغي على القرّاء أن يكونوا متشكّكين تجاه أي تغطية إعلامية تبدو وكأنها تزودهم بها.
وما يمكن قوله بشكل عادل هو أن هذا الادعاء مألوفٌ، وأنه اتجاهيٌّ بدلًا من كونه مرتبطًا بحدثٍ معيّن. ولم تتغير أي شريحة تسعيرية هذا الأسبوع بسببه. ولم يتغيّر أي جدول زمني. فإذا كنت تخطط لقدرات معينة أو تختار بين استئجار واجهة برمجية (API) وشراء عتاد، فإن هذا التحليل وحده لا يقدّم لك شيئًا جديدًا يمكنك إدخاله في جدول بياناتك. بل ما يفعله هو إعادة صياغة الافتراض الذي يستند إليه تقريبًا كل ميزانية ذكاء اصطناعي تُكتب في عام ٢٠٢٦: وهو أن قوة الحوسبة تظل العامل المقيد الرئيسي، وأن هذا العامل مقيدٌ من حيث التكلفة من قِبل عدد ضئيل من المورّدين.
لماذا يظهر موقف نفيديا في فاتورة الرموز الخاصة بالمطوّر
أسعار الاستنتاج عبر الواجهات البرمجية ليست عشوائية. فسعر المزوّد لكل رمز يجب أن يغطي تكلفة استهلاك وحدة التسارع (amortisation)، وعرض النطاق الترددي للذاكرة، والطاقة، واستخدام الموارد، والنماذج التي تحتاج إلى ذاكرة أكبر لكل طلبٍ تشغل جزءًا أكبر من عقدة الخدمة (serving node) لفترة أطول. ولذلك فإن التباين الواسع في قاعدة بيانات نماذج الذكاء الاصطناعي يأتي بهذا الشكل، ولذلك فهو يتتبع حجم النموذج العتادي (model footprint) بدقة كبيرة بدلًا من تتبع مكانة العلامة التجارية.
وفي القاع، Mistral 7B وكلاود ٣,١ بحجم ٨ مليار معلّمة (Llama 3.1 8B) يبلغ سعرهما ٠,٠٢ دولار أمريكي لكل مليون رمز إدخال و٠,٠٣ دولار للخارج. وفي المنتصف، DeepSeek V4-فلاش يبلغ سعره ٠,١٤ دولارًا للداخل و٠,٢٨ دولار للخارج ضمن سياق يحتوي مليون رمز، بينما Qwen3 235B-A22B يبلغ سعره ٠,٤٥ دولارًا للداخل و١,٨٠ دولار للخارج. وفي القمة، Claude Fable 5 يبلغ سعره ١٠ دولارات للداخل و٥٠ دولارًا للخارج، مع GPT-5.6 Sol وجي بي تي-٥,٥ (GPT-5.5) بسعر ٥ دولارات للداخل و٣٠ دولارًا للخارج. وهذا يشكّل مدى تفاوتٍ قدره ٥٠٠ ضعف في تكلفة الإدخال عبر النماذج التي قد يأخذها المطوّر في الاعتبار بجدية لأداء مهمة تلخيص واحدة. وإذا أردت أن ترى كيف يؤثر هذا التباين على حمل عمل حقيقي بدلًا من مجرد قائمة أسعار، فإن حاسبة تكلفة واجهات برمجة تطبيقات الذكاء الاصطناعي (API) يمكنه أخذ أحجام الرموز لديك وإنتاج الرقم الشهري المقابل.
مشكلة الـ ١,٤ تيرابايت: أوزان النماذج الحدّية و«جدار الذاكرة»
الطريقة الأوضح لفهم سبب استمرار تضاعف الطلب على قوة الحوسبة هي النظر في ما يتطلبه احتواء نموذج حدّي حديث في الذاكرة. والتقديرات أدناه هي أرقام عند تكميم ٤ بت مستخلصة من قاعدة بياناتنا، وهي تصف أوزان النموذج بالإضافة إلى هامش معقول من الهوامش التشغيلية، وليست نسخة إنتاجية مُحسَّنة تحتوي على هامش كافٍ لذاكرة KV cache طويلة السياق. أما التشغيل الفعلي فيتطلّب أكثر من ذلك.
| النموذج | السياق | سعر الواجهة البرمجية (لكل مليون رمز إدخال / إخراج) | VRAM عند تكميم ٤ بت |
|---|---|---|---|
| كيمي K3 (مونشوت آي آي) | مليون | $3.00 / $15.00 | حوالي 1.4 تيرابايت |
| DeepSeek V4-Pro | مليون | $0.435 / $0.87 | حوالي 800 جيجابايت |
| Kimi K2.7 Code | 256 ألف رمز | $0.60 / $2.50 | نحو 500 جيجابايت |
| GLM 5.2 (زيبو آي آي) | مليون | $1.40 / $4.40 | نحو 370 جيجابايت |
| لاما ٤ مافريك (ميتا) | مليون | $0.20 / $0.80 | ~240 جيجابايت |
| كوين ٣ ٢٣٥ مليار معلّمة-A22B (علي بابا) | 128 ألف رمز | $0.45 / $1.80 | ~140 جيجابايت |
| NVIDIA Nemotron 3 Nano Omni | 256 ألف رمز | — | ~21 جيجابايت (باستخدام تنسيق NVFP4) |
إن بصمة حجم ١,٤ تيرابايت ليست نشرةً على بطاقة واحدة، بل ولا تُعدّ نشرةً على خادم واحد في معظم التكوينات أيضًا. بل هي عقدة متعددة وحدات معالجة رسوميات (multi-GPU node) مزودة باتصال داخلي سريع (fast interconnect)، وهي بالضبط الفئة المنتجية التي يحقّق فيها المورّد المسيطر أكبر قيمة. وهذه هي الآلية الكامنة وراء حجة النمو، المعبّر عنها بلغة العتاد بدلًا من لغة السوق.
التشغيل الذاتي مقابل الاستئجار: حيث تظهر الهيمنة فعليًّا
بالنسبة للفرق التي تزن خيارات التشغيل المحلي (on-prem) مقابل استخدام واجهة برمجية، فإن تسعير وحدات التسارع هو العامل الحاسم الوحيد. والحساب المحرج في عام ٢٠٢٦ هو أن الطبقة الرخيصة من النماذج المفتوحة المصدر أصبحت رخيصة جدًّا للاستئجار لدرجة أن التشغيل الذاتي يتطلّب تجاوز حاجز منخفض جدًّا ليصبح منطقيًّا. فدفع ٠,١٤ دولارًا للداخل و٠,٢٨ دولار للخارج مقابل DeepSeek V4-فلاش ضمن سياق مليون رمز يصعب تفوقه باستخدام عتادك الخاص ما لم تكن نسبة الاستخدام عالية ومستقرة، أو ما لم تجعل متطلبات إقامة البيانات (data residency) المقارنة غير ذات جدوى.
يحدّد أمرين هذا القرار: كم الذاكرة التي يحتاجها النموذج الذي اخترته، وعدد الساعات التي تكون فيها بطاقاتك مشغولة فعليًّا يوميًّا. ويتعامل حاسبة مجانية لحساب متطلبات الذاكرة عالية السرعة (VRAM) مع الأول، بينما يتعامل حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) مع الثاني، وإذا وصلت إلى مرحلة اختيار نوع المعالج (silicon)، فإن عرضنا التفصيلي لـ أفضل وحدات معالجة الرسومات للذكاء الاصطناعي يغطي ما يمكن أن تستوعبه كل فئة من الفئات العتادية عمليًّا. ولا شيء من هذا كله تغيّر بسبب مقالة إنليكتيا للذكاء الاصطناعي. بل هو ببساطة الحساب الرياضي الذي تقوم عليه الفرضية المركزية لهذه المقالة.
النماذج الصغيرة الخاصة بنفيديا تقلّص البصمة العتادية، وليس بالضرورة الطلب الفعلي
ومن الجدير بالملاحظة في قاعدة بياناتنا الخاصة: أن أصغر استهلاك للذاكرة في الجدول أعلاه هو لنموذج نفيديا. فنموذج نيموترون ٣ نانو أومني (Nemotron 3 Nano Omni) يدعم سياقًا بطول ٢٥٦ ألف رمز ويستهلك نحو ٢١ جيجابايت باستخدام تكميم NVFP4، ما يجعله يناسب بطاقة محطة عمل واحدة. وبجانبه يأتي نموذج جيمّا ٣ بحجم ٤ مليار معلّمة (Gemma 3 4B) بحجم قريب من ٣ جيجابايت، ولاما ٣,١ بحجم ٨ مليار معلّمة (Llama 3.1 8B) بحجم قريب من ٥ جيجابايت، وفاي-٤ (Phi-4) بحجم قريب من ٩ جيجابايت.
وإذا قرأنا هذا التحليل بوصفه تحليلًا بدلًا من كونه واقعًا مُبلَّغًا عنه، فإن له وجهين. فتنسيقات الدقة المنخفضة والنماذج الأصغر تقلّل من العتاد المطلوب لكل مهمة، ما ينبغي أن يخفّف الطلب في حدّ ذاته. لكن في الواقع، أدى انخفاض تكلفة الاستنتاج إلى توسيع نطاق المهام التي ترغب الفرق في تشغيلها، بما في ذلك مهام الوكلاء (agentic workloads) التي تطلق العديد من الطلبات لكل إجراء يقوم به المستخدم. وأيهما يغلب — التأثيران — لا يزال أمرًا غير محسوم، ولا يتناوله أي رقم في المصدر.
كيف تقرأ ادعاءً نموّيًّا لا يرتبط بأي أرقام
عندما يدّعي تحليل وجود هامش نمو دون تقديم بيانات، فإن الرد المفيد هو تسمية ما يجب أن يكون صحيحًا. وبشكل تقريبي: تستمر أوزان النماذج في النمو أسرع من التحسينات في الكفاءة التي تقلّل منها؛ وتظل واجهات الاتصال الداخلية (interconnect) وسعة الذاكرة العامل المقيد بدلًا من قوة العمليات الحسابية الخام (FLOPS)؛ وتبقى الطبقة البرمجية «ملتصقة» بما يكفي بحيث تظل تكاليف التحوّل (switching costs) حقيقية. وهذه هي الافتراضات الجوهرية، وكل واحدة منها قابلة للمراقبة بمرور الوقت من خلال المواصفات وبطاقات الأسعار بدلًا من التعليقات. ويعتني مؤشر الأداء السعري للذكاء الاصطناعي بالنصف المرئي من هذا الأمر لدى الأطراف الثالثة، وهو اتجاه التكلفة لكل وحدة من القدرة.
الأسئلة الشائعة
هل نشرت شركة إنليكتيا للذكاء الاصطناعي أرقامًا جديدةً خاصةً بنفيديا؟ لا، ليس في ما هو متاح. فالورقة عبارة عن عنوان رئيسي وملخّص قصير حول هيمنة نفيديا في مجال الذكاء الاصطناعي وإمكاناتها النموية، دون أرقام إيرادات أو شحنات أو حصص أو توقعات، ودون اقتباسات. لذا ينبغي التعامل بحذر مع أي رقم محدّد يُنسب إليها.
هل يغيّر هذا ما أدفعه حاليًّا مقابل النماذج؟ لا. لم يُعلن عن أي تغيير في الأسعار. وتبقى المعدلات الحالية في قاعدة بياناتنا دون تغيير، بما في ذلك كلاود سونيت ٥ بسعر ٢ دولار أمريكي للداخل و١٠ دولارات للخارج، وجيميني ٣,٦ فلاش بسعر ١,٥٠ دولار أمريكي للداخل و٧,٥٠ دولارات للخارج، وديب سيك V4-فلاش بسعر ٠,١٤ دولار أمريكي للداخل و٠,٢٨ دولار للخارج.
ما هو أكبر حجم عتادي مسجَّل في قاعدة بيانات كونفلي؟ كيمي K3، الذي يستهلك نحو ١,٤ تيرابايت من ذاكرة VRAM عند تكميم ٤ بت ضمن سياق مليون رمز. ويأتي ديب سيك V4-برو بعد ذلك باستهلاك نحو ٨٠٠ جيجابايت، و Kimi K2.7 Code باستهلاك نحو ٥٠٠ جيجابايت.
هل يمكنني تشغيل أي نموذج قادر على وحدة معالجة رسوميات واحدة (GPU) فقط؟ نعم، في الطرف الأصغر. فحجم جيمّا ٣ بحجم ٤ مليار معلّمة (Gemma 3 4B) نحو ٣ جيجابايت عند تكميم ٤ بت، ولاما ٣,١ بحجم ٨ مليار معلّمة نحو ٥ جيجابايت، وفاي-٤ نحو ٩ جيجابايت، ونمط نيموترون ٣ نانو أومني الخاص بنفيديا نحو ٢١ جيجابايت عند تكميم NVFP4. أما النماذج ذات المقياس الحدّي فهي تتطلّب تشغيلًا على وحدات معالجة رسوميات متعددة.
لماذا نتناول مادةً تتعلق بالبحث الاستثماري في موقع متخصص في العتاد؟ لأن الادعاء الجوهري القائل بأن الطلب على قوة الحوسبة الخاصة بالذكاء الاصطناعي لا يزال يتضاعف باستمرار يمكن التحقق منه باستخدام مواصفات النماذج وبطاقات الأسعار التي ننشرها. أما الإطار التسويقي فهو خارج نطاق اختصاصنا؛ لكن النتائج المترتبة على قرارات «البناء مقابل الاستئجار» فهي ضمن نطاق اهتمامنا.
الخلاصة
إن إنليكتيا للذكاء الاصطناعي أعادت صياغة رأيٍ سائدٍ على نطاق واسع بدلًا من أن تكون قد كشفت خبرًا جديدًا، والنسخة المتاحة منها لا تتضمّن أي أرقام يمكن الاعتماد عليها. أما الجوهر المهم للمطوّرين فيقع طبقةً أعمق: فقد وصلت أوزان النماذج الحدّية الآن إلى مئات الجيجابايت وتجاوزت التيرابايت عند تكميم ٤ بت، وهذه البصمة العتادية هي ما يجعل العقد متعددة وحدات المعالجة الرسومية مركز ثقل البنية التحتية للذكاء الاصطناعي، وهي ما ي feeding مباشرةً في كلٍّ من أسعار الرموز المقدمة عبر الاستضافة، وفي الحجة المؤيدة لامتلاك العتاد. فإذا كانت حجة نمو نفيديا صحيحة، فإن الإشارة المرئية ستكون استمرار ظهور نماذج شرهة للذاكرة تتفوّق على مكاسب الكفاءة. أما إذا كانت خاطئة، فستكون الإشارة هي انتقال الطبقة الرخيصة إلى استيعاب المزيد من حمولات العمل الفعلية. وكلا الإشارتين قابلتان للقياس، ولا يُقرّر أي منهما هذه التحليل.
المصادر: news.google.com. تم الإبلاغ في ٢٩ أغسطس ٢٠٢٦.

