كل جهاز كمبيوتر محمول وهاتف وبطاقة رسومات تُباع في عام 2026 تُعلن الآن عن رقم “AI”. بعضها يذكر وحدة “TOPS”، وبعضها يذكر وحدة «TFLOPS»، ونادرًا ما يوضح القسم التسويقي أن هذه وحدات قياس مختلفة تُستخدم لرقائق مختلفة تؤدي مهام مختلفة. تعد وحدة NPU في جهاز الكمبيوتر المحمول الجديد الخاص بك ووحدة GPU في جهاز الكمبيوتر المكتبي الخاص بك، من الناحية الفنية، «مسرعات للذكاء الاصطناعي»، لكنهما صُممتا للتفوق في طرفي نقيض من نفس المشكلة.
توضح هذه المقالة ماهية وحدة المعالجة العصبية (NPU) بالفعل، وكيف تختلف عن وحدة معالجة الرسومات (GPU) على مستوى البنية، وأي منهما أكثر أهمية بالنسبة لما تحاول القيام به. نستخدم أرقامًا حقيقية ومُثبتة مستمدة من الرقائق المتوفرة حاليًا في السوق: محرك Neural Engine من Apple، وHexagon من Qualcomm، ووحدات NPU من Intel وAMD الموجودة داخل أجهزة الكمبيوتر الشخصية المزودة ببرنامج Copilot+، ومكونات مراكز البيانات RTX وBlackwell من NVIDIA. لا رقائق نظرية، ولا مبالغة.
أبرز الاستنتاجات
- وظائف مختلفة، وليست أفضل أو أسوأ. صُممت وحدات NPU لإجراء عمليات الاستدلال منخفضة الاستهلاك للطاقة والتي تعمل بشكل مستمر على الجهاز؛ أما وحدات GPU فقد صُممت لتحقيق إنتاجية متوازية عالية ولأغراض التدريب.
- وحدة «TOPS» ووحدة «TFLOPS» ليستا نفس الوحدة. يُقاس أداء وحدات المعالجة العددية (NPUs) بوحدة «TOPS» بنظام INT8؛ أما وحدات معالجة الرسومات (GPUs) فيُقاس أداءها عادةً بوحدة «TFLOPS» بنظام العدد العائم. ولا يمكن مقارنة هذين الرقمين مباشرةً.
- الفجوة في الحجم هائلة. تبلغ قدرة وحدة المعالجة العصبية (NPU) في أجهزة الكمبيوتر المحمولة لعام 2026 حوالي 45-80 TOPS. وتبلغ قدرة بطاقة NVIDIA RTX 5090 3,352 AI TOPS، بينما تصل قدرة وحدة B200 المخصصة لمراكز البيانات إلى حوالي 4,500 TFLOPS في FP8.
- تتفوق وحدات NPU في الكفاءة، وليس في السرعة. فهي تعمل بتقنية الذكاء الاصطناعي في الخلفية (الكاميرا، والنسخ الصوتي، وميزات Copilot) باستهلاك لا يتجاوز جزءًا ضئيلاً من استهلاك وحدة معالجة الرسومات (GPU) من حيث الطاقة، ولهذا السبب يحتاج كل جهاز كمبيوتر مزود بـ Copilot+ إلى ما يزيد عن 40 TOPS من وحدة معالجة النواة العصبية (NPU).
- بالنسبة لنماذج اللغة الكبيرة (LLM) المحلية في الوقت الحالي، لا تزال وحدة معالجة الرسومات (GPU) (وعرض النطاق الترددي للذاكرة) هي الأفضل. لا يزال دعم برامج وحدة المعالجة العصبية (NPU) في مرحلة مبكرة؛ فطراز 7B الذي يعمل على وحدة NPU من Snapdragon يبلغ معدل معالجته حوالي 9-12 رمزًا في الثانية في منتصف عام 2026، في حين أن وحدة معالجة الرسومات (GPU) المنفصلة أسرع بكثير.
- الخط الفاصل أصبح غير واضح. يضم معالج M5 من Apple مسرعات عصبية داخل كل نواة من نوى وحدة معالجة الرسومات (GPU)، بينما يجمع معالج Strix Halo من AMD بين وحدة معالجة عصبية (NPU) بقوة 50 TOPS وذاكرة موحدة سعة 128 جيجابايت لتشغيل نماذج ذات 120 مليار معلمة محليًّا.
- ما هي وحدة المعالجة العصبية (NPU) في الواقع؟
- كيف تختلف وحدة معالجة الرسومات (GPU) من الناحية المعمارية
- TOPS مقابل TFLOPS: لماذا لا تتطابق الأرقام
- حيث يفوز الجميع
- رقائق عام 2026، بالأرقام
- ما يعنيه ذلك بالنسبة لتشغيل الذكاء الاصطناعي محليًّا
- كلمة سريعة عن وحدات المعالجة المركزية (CPU) ووحدات المعالجة التخصصية (TPU)
- الأسئلة الشائعة
- الخلاصة
- مقالات ذات صلة
ما هي وحدة المعالجة العصبية (NPU) في الواقع؟
وحدة المعالجة العصبية (NPU) هي كتلة رقاقة مصممة لأداء مهمة محددة بكفاءة فائقة، وهي العمليات الحسابية القائمة على الضرب والتراكم التي تشكل جوهر الشبكات العصبية. وهي ليست معالجًا متعدد الأغراض، ولا يمكنها تشغيل نظام التشغيل أو أي لعبة. ما يمكنها فعله هو معالجة كميات هائلة من العمليات الحسابية الصحيحة ذات الدقة المنخفضة (عادةً INT8 أو INT4) عبر أجهزة مخصصة باستهلاك طاقة منخفض جدًّا.
هذه الكفاءة هي جوهر الموضوع. الغرض من وحدة معالجة النواة العصبية (NPU) هو تمكين هاتفك من تعتيم خلفية مقطع فيديو، أو تحويل مذكرة صوتية إلى نص، أو تشغيل نموذج لغوي صغير دون استنزاف البطارية أو تشغيل المروحة. في نظام ويندوز، جعلت مايكروسوفت من هذه الوحدة فئة واضحة من الأجهزة: Copilot+ للكمبيوتر الشخصي يتطلب ذلك وحدة معالجة الذكاء الاصطناعي (NPU) قادرة على إجراء أكثر من 40 تريليون عملية في الثانية (40+ TOPS)، وذلك تحديدًا لكي تعمل الميزات المدمجة في الجهاز — مثل الترجمة الفورية وتوليد الصور — على وحدة NPU بدلاً من وحدة المعالجة المركزية (CPU) أو وحدة معالجة الرسومات (GPU). ويقوم نظام التشغيل Windows 11 الآن بتوزيع مهام الذكاء الاصطناعي بين وحدات المعالجة المركزية (CPU) ووحدات معالجة الرسومات (GPU) ووحدة معالجة الذكاء الاصطناعي (NPU)، بل إنه يعرض نسبة استخدام وحدة NPU في «مدير المهام».
الكلمة المفتاحية هي الاستنتاج. تعمل وحدات NPU على تشغيل النماذج التي تم تدريبها مسبقًا. ولا تُستخدم أبدًا تقريبًا لتدريب النماذج من الصفر، وهو ما يمثل عبء عمل مختلفًا جذريًّا وأكثر ثقلًا بكثير.
كيف تختلف وحدة معالجة الرسومات (GPU) من الناحية المعمارية
بدأت وحدة معالجة الرسومات (GPU) حياتها بتقديم المثلثات، وقد شكّل هذا الإرث منها محركًا ضخمًا متوازيًا للعمليات العائمة يضم آلاف النوى. وأضيفت إلى وحدات معالجة الرسومات الحديثة «نوى تينسور» (مصطلح شركة NVIDIA) المخصصة لحساب المصفوفات، وهو ما يجعلها الأداة الافتراضية للذكاء الاصطناعي. تحتوي بطاقة RTX 5090 على 21,760 نواة CUDA بالإضافة إلى نوى Tensor من الجيل الخامس.
هناك ثلاثة اختلافات معمارية ذات أهمية:
- الدقة. تعمل وحدات معالجة الرسومات (GPU) بكفاءة عالية في إجراء العمليات الحسابية ذات الدقة العالية ذات العلامة العائمة (FP16، FP32) اللازمة للتدريب، وتضيف أحدث طرازاتها مستويات ذات دقة أقل. وتعد وحدات معالجة الرسومات من طراز «بلاكويل» أول بطاقات مخصصة للمستهلكين تدعم دقة FP4. أما وحدات معالجة النواة العصبية (NPU)، فهي تعتمد بشكل شبه كامل على العمليات الحسابية الصحيحة ذات الدقة المنخفضة، وهو ما يعد أمراً رائعاً للاستدلال ولكنه غير مناسب للتدريب.
- الذاكرة. هذا هو العامل الفارق الخفي. تتمتع وحدة معالجة الرسومات (GPU) بذاكرة VRAM سريعة ومخصصة خاصة بها (تأتي بطاقة RTX 5090 مزودة بذاكرة GDDR7 سعة 32 جيجابايت وبسرعة نقل تبلغ حوالي 1.79 تيرابايت في الثانية). أما وحدة المعالجة العصبية (NPU)، فتتشارك الذاكرة الرئيسية للنظام مع جميع المكونات الأخرى، مما يحد من حجم النموذج الذي يمكنها استيعابه وسرعة تغذيته بالبيانات.
- الطاقة. تستهلك بطاقة RTX 5090 ما يصل إلى 575 واط. في المقابل، تقوم وحدة NPU المدمجة في الكمبيوتر المحمول بتنفيذ نفس فئة عمليات الاستدلال باستهلاك بضعة واطات فقط. وهذه الحقيقة وحدها تفسر سبب وجود كلتا الشريحتين.
إذا كنت ترغب في تشغيل نماذج كبيرة محليًّا، فغالبًا ما تكون الذاكرة وعرض النطاق الترددي أكثر أهمية من القوة الحاسوبية الخام، وهذا بالضبط هو السبب الذي يجعل مشتري وحدات معالجة الرسومات (GPU) يولون اهتمامًا كبيرًا بذاكرة VRAM. دليلنا إلى أفضل وحدات معالجة الرسومات لتشغيل نماذج اللغة الكبيرة محليًّا يتعمق في هذه المفاضلة.
TOPS مقابل TFLOPS: لماذا لا تتطابق الأرقام
وهذا هو المكان الذي تضلل فيه معظم أوراق المواصفات القراء. فبرنامج TOPS يحصي تريليونات من العمليات في الثانية، وفي وحدات NPU يعني ذلك في الغالب عمليات حسابية صحيحة من نوع INT8. ويُقاس TFLOPS بتريليونات من النقطة العائمة عمليات في الثانية، وهي الوحدة المستخدمة في وحدات معالجة الرسومات (GPU) وفي عمليات التدريب. وهما غير قابلتين للتبادل.
تضاعف INT8 معدل الإنتاجية تقريبًا مقارنةً بـ FP16 على نفس الأجهزة، لذا يمكن للمورد أن ينشر رقمًا رئيسيًّا أكبر بمجرد الاستشهاد بالتنسيق الأقل دقة. ولهذا السبب، غالبًا ما تُستخدم INT8 في تقييمات TOPS: فهي تبدو أفضل. كما أن كلا الرقمين يمثلان أرقامًا نظرية قصوى تم قياسها في ظل ظروف مثالية، وليسا معدل إنتاجية مستدامًا في العالم الواقعي.
وهناك فخ ثانٍ: TOPS “المنصة” مقابل TOPS «وحدة المعالجة العصبية» (NPU) وحدها. فعلى سبيل المثال، يتم الترويج لمنصة «Lunar Lake» من إنتل على أنها توفر 120 TOPS «منصة»، لكن هذا الرقم يشمل 67 TOPS من وحدة معالجة الرسومات (GPU)، و48 من وحدة المعالجة العصبية (NPU)، و5 من وحدة المعالجة المركزية (CPU). تبلغ قدرة وحدة NPU بمفردها 48 TOPS. عند مقارنة الرقائق، تأكد من أنك تقارن نفس الوحدة.
حيث يفوز الجميع
تُعد NPU الأداة المناسبة عندما…
- يتم تشغيل هذه المهام بشكل مستمر أو في الخلفية (تأثيرات الكاميرا، وإزالة الضوضاء، والترجمة الفورية، وتأثيرات Windows Studio).
- يُعد عمر البطارية والتحكم في درجة الحرارة من الأولويات، سواء في الهاتف أو في الكمبيوتر المحمول النحيف.
- أنت تقوم بتشغيل نماذج صغيرة ومُكمَّلة صُممت خصيصًا لهذا الجهاز.
- تريد الاستفادة من ميزات الذكاء الاصطناعي دون أن يتم تشغيل المروحة أبدًا.
تُعد وحدة معالجة الرسومات (GPU) الأداة المناسبة عندما…
- أنت تقوم بتدريب نموذج أو بضبطه.
- تريد تشغيل نماذج اللغة الكبيرة (LLM) المحلية ذات الحجم الكبير (13B، 30B، 70B+) بسرعات تتيح استخدامها بشكل عملي.
- تحتاج إلى معدل نقل بيانات خام لتوليد الصور أو مقاطع الفيديو أو المحتوى ثلاثي الأبعاد.
- أنت تقدم نماذج إلى العديد من المستخدمين في آن واحد في مركز البيانات.
نموذج ذهني واضح: تتولى وحدة المعالجة العصبية (NPU) مهام الذكاء الاصطناعي التي لا تفكر فيها، بينما تتولى وحدة معالجة الرسومات (GPU) مهام الذكاء الاصطناعي التي تقرر عمداً تشغيلها. وتأتي معظم أجهزة الكمبيوتر المحمولة لعام 2026 مزودة بكليهما، ويقوم نظام ويندوز بتحديد أيهما سيُستخدم لكل مهمة.
رقائق عام 2026، بالأرقام
هنا تكمن القوة الحقيقية للسيليكون. تم التحقق من جميع الأرقام الواردة أدناه مقارنةً بمصادر الموردين والمصادر الأولية اعتبارًا من منتصف عام 2026. يرجى الانتباه جيدًا إلى الوحدات: المجموعة الأولى هي NPU INT8 TOPS، أما المجموعة الثانية فهي قدرة الحوسبة الخاصة بالذكاء الاصطناعي في وحدة معالجة الرسومات (GPU).
| الشريحة | الفصل | تصنيف مسرعات الذكاء الاصطناعي | أين يعيش |
|---|---|---|---|
| محرك Apple A18 / A18 Pro العصبي | وحدة المعالجة العصبية (NPU) للهاتف | 35 معالجًا من طراز TOPS (16 نواة) | سلسلة iPhone 16 |
| محرك Apple M4 العصبي | وحدة المعالجة العصبية (NPU) في الكمبيوتر المحمول | 38 قميصًا | MacBook Air/Pro |
| وحدة المعالجة المركزية (CPU) سنابدراجون إكس إيليت (هيكساغون) | وحدة المعالجة العصبية (NPU) في الكمبيوتر المحمول | 45 قمة | أجهزة الكمبيوتر الشخصية من طراز Copilot+ (الدفعة الأولى) |
| إنتل كور ألترا 200V (لونار ليك) | وحدة المعالجة العصبية (NPU) في الكمبيوتر المحمول | 48 قميصًا | أجهزة الكمبيوتر الشخصية المزودة ببرنامج Copilot+ |
| AMD Ryzen AI 300 (XDNA 2) | وحدة المعالجة العصبية (NPU) في الكمبيوتر المحمول | 50 قميصًا | أجهزة الكمبيوتر الشخصية المزودة ببرنامج Copilot+ |
| كوالكوم سنابدراجون X2 إيليت (هيكساغون) | وحدة المعالجة العصبية (NPU) في الكمبيوتر المحمول | 80 قطعة (تصل إلى 85 قطعة في المنتجات الأكثر مبيعًا) | أجهزة الكمبيوتر الشخصية من طراز Copilot+ (الدفعة لعام 2026) |
| NVIDIA RTX 5080 | وحدة معالجة الرسومات (GPU) المخصصة للمستهلكين | 1,801 من أفضل المتفوقين في مجال الذكاء الاصطناعي | الكمبيوتر المكتبي / محطة العمل |
| NVIDIA RTX 5090 | وحدة معالجة الرسومات (GPU) المخصصة للمستهلكين | 3,352 من أفضل المتفوقين في مجال الذكاء الاصطناعي | الكمبيوتر المكتبي / محطة العمل |
| NVIDIA H100 | وحدة معالجة الرسومات (GPU) لمركز البيانات | 1,979 تي فلوبس (FP8 كثيفة) | السحابة / الخوادم |
| NVIDIA B200 (بلاكويل) | وحدة معالجة الرسومات (GPU) لمركز البيانات | حوالي 4,500 تي فلوبس في معالجة FP8 الكثيفة (9,000 تي فلوبس في معالجة FP4) | السحابة / الخوادم |
الانتقال من صفوف NPU إلى صفوف GPU ليس خطأً مطبعيًّا. فهناك فارق يبلغ تقريبًا مرتبتين من حيث الحجم بين وحدة NPU في جهاز كمبيوتر محمول رائد تبلغ قدرتها 80 TOPS وبطاقة RTX 5090 التي تبلغ قدرتها 3,352 AI TOPS، وذلك حتى قبل أن نأخذ في الاعتبار ذاكرة GPU المخصصة ذات النطاق الترددي العالي بسعة 32 جيجابايت. هذه الفجوة هي جوهر الموضوع: لم تكن وحدات NPU تسعى أبدًا إلى التفوق في الأداء المطلق. بل تتفوق في الأداء لكل واط.
نهج شركة آبل آخذ في التغير
تستحق شركة آبل إشارة منفصلة لأنها توقفت عن الانخراط في «لعبة» TOPS. وقد تم تصنيف محرك M4 Neural Engine بقدرة 38 TOPS، ولكن بالنسبة لمحرك M5 (الذي تم تزويد جهاز MacBook Pro مقاس 14 بوصة به في أواخر عام 2025، على أن يتبعه محركا M5 Pro وM5 Max في مارس 2026)، لم تنشر شركة آبل أي رقم يتعلق بقدرة محرك Neural Engine بالـTOPS على الإطلاق. بدلاً من ذلك، أعادت تصميم وحدة معالجة الرسومات (GPU) لوضع مسرع عصبي داخل كل نواة من النوى العشر لوحدة معالجة الرسومات، وتدعي أن أداء الذكاء الاصطناعي أسرع بما يصل إلى 3.5 أضعاف مقارنةً بـ M4. وهذا رهان متعمد على أن الذكاء الاصطناعي المدمج في وحدة معالجة الرسومات (GPU) أكثر أهمية من رقم وحدة المعالجة العصبية (NPU) المستقلة، وهو ما يخلط بين الفصل الواضح بين وحدة المعالجة العصبية (NPU) ووحدة معالجة الرسومات (GPU). إذا كنت تقارن بين أجهزة Mac وWindows من حيث الذكاء الاصطناعي، فإن مقارنة بين Snapdragon X Elite و Apple M4 يشرح بالتفصيل كيف يبدو استخدام هذين النظامين البيئيين في الواقع.
ما يعنيه ذلك بالنسبة لتشغيل الذكاء الاصطناعي محليًّا
وهنا يكمن الجانب الصريح الذي تتجاهله أوراق المواصفات. في منتصف عام 2026، لا تزال وحدة المعالجة العصبية (NPU) تمثل الحلقة الأضعف في تشغيل نماذج اللغة الكبيرة (LLMs) المحلية، ليس بسبب بطء الرقاقة، بل لأن مجموعة البرامج غير ناضجة بعد. أظهرت الاختبارات المستقلة التي أُجريت على معالج Snapdragon X Elite الذي يشغل نموذجًا مُكمَّنًا بحجم 7B عبر مسار QNN من Qualcomm أن معدل الأداء يبلغ حوالي 9-12 توكن في الثانية. أما التفاعل السلس الذي يشبه استخدام الأدوات فيبدأ عند ما يقارب 30 توكن في الثانية. والأسوأ من ذلك، أن بيئات التشغيل الشائعة مثل Ollama لا تزال تفتقر إلى بنية حوسبة خلفية تعتمد على وحدة المعالجة العصبية (NPU)، لذا فإن وحدة المعالجة العصبية (NPU) القوية تظل خاملة في العديد من الأجهزة بينما تقوم وحدة المعالجة المركزية (CPU) بالعمل.
لذا، إذا كان هدفك اليوم هو تشغيل نموذج ضخم فعليًّا في المنزل، فإن وحدة معالجة الرسومات (GPU) المنفصلة المزودة بذاكرة VRAM كبيرة تظل هي الحل العملي، وقد نضجت حزمة برامج AMD بما يكفي لتصبح بديلاً حقيقيًّا يستحق أن نأخذه في الاعتبار في مقارنة ROCm مقابل CUDA. وتكمن الحلول الوسطى المثيرة للاهتمام في تصميمات الذاكرة الموحدة: تجمع معالج Ryzen AI Max (“Strix Halo”) من AMD بين وحدة معالجة NPU XDNA 2 بقدرة 50 تيرا-عملية في الثانية (TOPS) وذاكرة موحدة تصل سعتها إلى 128 جيجابايت، ويمكنها تخصيص ما يصل إلى 96 جيجابايت كذاكرة VRAM، وهو ما يكفي لتحميل نماذج ذات 120 مليار معلمة محليًّا. وهذا عدد من النماذج يفوق بكثير ما يمكن لأي وحدة معالجة رسومات (GPU) بسعة 32 جيجابايت استيعابه، وهو ما يعيد تشكيل سوق أجهزة الكمبيوتر الصغيرة المخصصة للذكاء الاصطناعي المحلي.
أما بالنسبة للهواتف، فالأمر يختلف تمامًا وتفوز وحدة المعالجة العصبية (NPU) بشكل واضح: فلا توجد بديل من وحدات معالجة الرسومات (GPU) يستهلك ميليوات قليلة، كما أن الميزات المدمجة في الجهاز مصممة خصيصًا لتتوافق مع وحدة المعالجة العصبية (NPU). إذا كانت الذكاء الاصطناعي في الأجهزة المحمولة هو أولويتك، فراجع أفضل الهواتف المزودة بتقنية الذكاء الاصطناعي المدمجة في الجهاز.
كلمة سريعة عن وحدات المعالجة المركزية (CPU) ووحدات المعالجة التخصصية (TPU)
وهناك اختصاران آخران يكملان الصورة. يمكن للمعالج المركزي (CPU) تشغيل الذكاء الاصطناعي، لكنه الخيار الأبطأ في هذا الصدد؛ ففي «لونار ليك»، يساهم المعالج المركزي بـ 5 فقط من نقاط TOPS الخاصة بالمنصة. ويقوم في الغالب بتنسيق وإدارة المهام التي لا تستطيع وحدات NPU و GPU القيام بها.
وحدات معالجة التنسور (TPUs) هي دوائر ASIC المخصصة من Google، وهي أقرب من الناحية النظرية إلى وحدة معالجة عصبية (NPU) عملاقة في مركز البيانات منها إلى وحدة معالجة رسومات (GPU). وهي موجودة في السحابة، وليس في أجهزتك. توفر وحدة TPU من الجيل السابع من Google، المعروفة باسم “Ironwood”، أداءً يبلغ 4,614 تي فلوبس (TFLOPS) من العمليات العائمة من الدرجة الثامنة (FP8) لكل شريحة مع ذاكرة HBM3e بسعة 192 جيجابايت، ويمكن توسيع نطاق المجموعة الكاملة لتشمل آلاف الشرائح لتدريب النماذج المتطورة وتشغيلها. لن تجد أبدًا واحدة منها على مكتبك، لكن الكثير من تقنيات الذكاء الاصطناعي التي تستخدمها يتم تقديمها من خلالها.
الأسئلة الشائعة
هل وحدة المعالجة العصبية (NPU) أسرع من وحدة معالجة الرسومات (GPU)؟
لا، ليس من الناحية المطلقة. فوحدة معالجة الرسومات (GPU) المتطورة مثل RTX 5090 (3,352 AI TOPS) تتفوق بشكل كبير في الأداء الحسابي على أي وحدة معالجة الذكاء الاصطناعي (NPU) مخصصة للمستهلكين (45-80 TOPS). تكمن ميزة وحدة المعالجة العصبية (NPU) في كفاءتها: فهي تؤدي مهام الذكاء الاصطناعي باستهلاك بضعة واطات بدلاً من مئات الواطات، وهو ما يهم بالنسبة لعمر البطارية والميزات التي تعمل بشكل مستمر، وليس بالنسبة للسرعة القصوى.
هل يمكنني تشغيل نماذج على غرار ChatGPT على وحدة المعالجة العصبية (NPU) الخاصة بي؟
يمكنك تشغيل نماذج محلية صغيرة ومُكمَّلة على وحدة معالجة عُملية (NPU) تبلغ قدرتها 40+ TOPS، لكن التجربة لا تزال محدودة في منتصف عام 2026. يعمل النموذج الذي يبلغ حجمه 7B بمعدل يتراوح بين 9 و12 توكن في الثانية على وحدة معالجة عُملية (NPU) من Snapdragon، ولا تستطيع العديد من بيئات التشغيل استهداف وحدة معالجة عُملية (NPU) هذه على الإطلاق حتى الآن. وللحصول على تجربة سلسة مع النماذج الكبيرة، لا تزال وحدة معالجة الرسومات (GPU) المزودة بذاكرة VRAM كبيرة هي الخيار الأفضل.
لماذا تحتاج أجهزة الكمبيوتر المحمولة إلى وحدة معالجة عصبية (NPU) بقوة 40 TOPS لتشغيل Copilot+؟
حددت مايكروسوفت 40+ TOPS كحد أدنى حتى تعمل ميزات الذكاء الاصطناعي المدمجة في الجهاز (التعليقات التلقائية، وتأثيرات الاستوديو، و«Recall»، وتوليد الصور) على وحدة المعالجة العصبية (NPU) بدلاً من وحدة المعالجة المركزية (CPU) أو وحدة معالجة الرسومات (GPU). وهذا يمنع هذه الميزات التي تعمل بشكل مستمر من استنزاف عمر البطارية، ويضمن قدرة أساسية يمكن للمطورين الاستهداف إليها.
ما الفرق بين TOPS وTFLOPS؟
تقيس وحدة TOPS تريليونات العمليات الصحيحة في الثانية (عادةً INT8) وتُستخدم في وحدات المعالجة العددية (NPUs). أما وحدة TFLOPS فتقيس تريليونات العمليات ذات العلامة العائمة في الثانية وتُستخدم في وحدات معالجة الرسومات (GPUs) وعمليات التدريب. ونظرًا لاختلاف الدقة والوحدات المستخدمة، لا يمكن مقارنة رقم TOPS برقم TFLOPS بشكل مباشر.
هل يحتوي معالج M5 من آبل على وحدة معالجة شبكية (NPU)؟
نعم. يحتوي معالج M5 على محرك عصبي (Neural Engine) مكون من 16 نواة، لكن شركة آبل لم تعد تنشر رقمًا يعبّر عن أداءه بالـ«TOPS». وبدلاً من ذلك، أضافت آبل مسرعات عصبية (Neural Accelerators) إلى كل نواة من نوى وحدة معالجة الرسومات (GPU)، وتدعي أن أداء الذكاء الاصطناعي فيه أسرع بما يصل إلى 3.5 أضعاف مقارنة بمعالج M4، مما يشير إلى تحول نحو الذكاء الاصطناعي المدمج في وحدة معالجة الرسومات (GPU) بدلاً من الاعتماد على مواصفات وحدة معالجة الذكاء الاصطناعي (NPU) المستقلة.
هل وحدة معالجة TPU أفضل من وحدة معالجة GPU في مجال الذكاء الاصطناعي؟
بالنسبة لعمليات التدريب والاستدلال واسعة النطاق التي تجريها «جوجل» نفسها، تُعد وحدات TPU ذات قدرة تنافسية عالية وفعالة من حيث التكلفة على مستوى «البود». لكن وحدات TPU هي دوائر ASIC مخصصة للسحابة فقط ولا يمكن شراؤها لاستخدامها مع أجهزة الكمبيوتر الشخصية، في حين أن وحدات GPU هي دوائر متعددة الأغراض وتعمل في أي مكان. وبالنسبة لمعظم الناس، فإن الخيار العملي هو الاختيار بين وحدات NPU ووحدات GPU، وليس وحدات TPU.
Will NPUs replace وحدات معالجة الرسومات المُخصَّصة للذكاء الاصطناعي?
لا تناسب أحمال العمل الثقيلة. تتولى وحدات NPU مهام الاستدلال الفعالة على الجهاز، وستستمر هذه الحصة في النمو. لكن التدريب والنماذج المحلية الضخمة وتوليد البيانات ذات الإنتاجية العالية لا تزال تحتاج إلى وحدات GPU (أو TPU). الصورة الواقعية لعام 2026 هي التقارب، حيث ستستحوذ كل من وحدات NPU ووحدات GPU وتصميمات الذاكرة الموحدة على حصة من السوق.
الخلاصة
إن المقارنة بين وحدة المعالجة العصبية (NPU) ووحدة معالجة الرسومات (GPU) هي طريقة خاطئة في طرح الموضوع إذا نظرت إليها على أنها منافسة. فهما إجابتان على سؤالين مختلفين. إذا كنت تريد ذكاءً اصطناعيًا فعالًا يعمل دائمًا دون استنزاف البطارية، فإن وحدة NPU تؤدي مهمتها بشكل خفي داخل هاتفك وجهاز الكمبيوتر المحمول، كما أن الجيل الذي سيصدر في عام 2026 (بقدرة 80 TOPS على Snapdragon X2، و48-50 TOPS على Intel وAMD) يتمتع بقدرات حقيقية. أما إذا كنت ترغب في تدريب النماذج، أو تشغيل نماذج اللغة الكبيرة (LLMs) محليًّا، أو إنشاء محتوى وسائط بسرعة، فإن وحدة معالجة الرسومات (GPU) لا تزال الخيار الجاد الوحيد، ولا يوجد في عالم وحدة المعالجة العصبية (NPU) ما يقترب من بطاقة RTX 5090 أو B200 من حيث معدل الإنتاجية الخام.
التطور الأكثر إثارة للاهتمام هو أن الحدود بين هذه المكونات آخذة في التلاشي. فشركة «آبل» تعمل على دمج التسريع العصبي في وحدة معالجة الرسومات (GPU)، بينما تزود شركة «AMD» وحدات المعالجة العصبية (NPU) بذاكرة من فئة وحدة معالجة الرسومات (GPU)، كما أن البرمجيات تتقدم ببطء في هذا المجال. في الوقت الحالي، اختر الشراء بناءً على طبيعة أعباء العمل: استخدم وحدة المعالجة العصبية (NPU) للكفاءة والذكاء الاصطناعي المحيطي، واستخدم وحدة معالجة الرسومات (GPU) للقوة وحجم النماذج المحلية. لا تدع رقم TOPS واحدًا مكتوبًا على ملصق يتخذ القرار نيابة عنك.

