تتساءل إن كانت وحدة معالجة الرسومات الخاصة بك قادرة على تشغيل نموذج لغوي كبير معين محليًّا؟ توفر لك هذه الآلة الحاسبة المجانية تقديرًا للكمية المطلوبة من الـ VRAM لكل نموذج عند مستويات التكميم المختلفة — وتُبيّن لك بدقة أي النماذج يمكنها العمل على وحدتك.
| التكمية | الجودة | السعة التقديرية للـ VRAM | هل يناسب وحدة معالجة الرسومات الخاصة بك؟ |
|---|
التقدير مبني على أوزان النموذج عند كل مستوى تكميم، بالإضافة إلى عبء تشغيلي تقريبي قدره ~1.5 جيجابايت. أما السياقات الطويلة فهي تضيف ذاكرة التخزين المؤقت للقيم المفتاحية (KV-cache) فوق ذلك (وتزداد هذه الذاكرة مع طول السياق الذي تختاره). وفي نماذج «الخلط بين الخبراء» (Mixture-of-Experts)، يجب تحميل جميع المعايير إلى ذاكرة VRAM حتى وإن استُخدمت فقط مجموعة فرعية منها في حساب كل رمز.
اختر نموذجًا من قائمتنا قاعدة بيانات نماذج الذكاء الاصطناعي (أو أدخل عدد المعاملات المخصص)، واختر وحدة معالجة الرسوميات (GPU) الخاصة بك، وعيّن طول السياق المطلوب، ثم اعرف فورًا ما إذا كان النموذج سيعمل أم لا — وبأي جودة. والتقديرات تعتمد على أوزان النموذج؛ أما السياقات الطويلة فتضيف ذاكرة التخزين المؤقت للقيم المفتاحية (KV-cache) فوق ذلك.
إجابة سريعة: كم كمية الـ VRAM المطلوبة لتشغيل نموذج لغوي كبير (LLM) محليًّا؟
لتشغيل نموذج لغوي كبير محليًّا باستخدام تكميم 4 بت، احسب تقريبًا ٠٫٥–٠٫٦ جيجابايت من ذاكرة الـ GPU VRAM لكل مليار معامل، بالإضافة إلى ١–٣ جيجابايت للذاكرة المؤقتة KV cache عند أطوال السياق النموذجية. عمليًّا، يشغل نموذج بحجم ٨ مليار معامل (8B) ما يقارب ٥–٦ جيجابايت (وهو مريح جدًّا على بطاقة RTX 3060 بسعة ١٢ جيجابايت؛ ويُمكن تشغيله أيضًا على بطاقة RTX 4060 بسعة ٨ جيجابايت)، أما نموذج ١٣ مليار معامل (13B) فيتطلب نحو ٨–١٠ جيجابايت، ونموذج ٣٢ مليار معامل (32B) يحتاج بطاقة بسعة ٢٤ جيجابايت مثل RTX 4090 (حيث تشغل الأوزان نحو ٢٠ جيجابايت)، بينما يتطلب نموذج ٧٠ مليار معامل (70B) نحو ٤٠–٤٨ جيجابايت — أي بطاقة واحدة بسعة ٤٨ جيجابايت أو بطاقتَي GPU بسعة ٢٤ جيجابايت كلٌّ منهما. وباستخدام تكميم ٨ بت تتضاعف هذه الأرقام تقريبًا (~١–١٫٢ جيجابايت لكل مليار معامل)، وفي حالة التمثيل الكامل بـ fp16 تتضاعف تقريبًا أربع مرات (~٢ جيجابايت لكل مليار معامل).
قواعد إرشادية سريعة لأحجام أوزان النماذج، قبل إضافة السياق:
- تكميم ٤ بت (Q4): ~٠٫٥–٠٫٦ جيجابايت لكل مليار معامل
- تكميم ٨ بت (Q8): ~١–١٫٢ جيجابايت لكل مليار معامل
- fp16 / bf16: ~٢ جيجابايت لكل مليار معامل
- الذاكرة المؤقتة KV cache (السياق): أضف ~١–٤ جيجابايت عند استخدام ٨٠٠٠–٣٢٠٠٠ رمز (token)، وتزداد أكثر عند استخدام سياقات أطول جدًّا أو نماذج أكبر
الأسئلة الشائعة
كم كمية الـ VRAM المطلوبة لتشغيل نموذج بحجم ٧٠ مليار معامل؟
يتطلب نموذج بحجم ٧٠ مليار معامل نحو ٤٠–٤٨ جيجابايت من الـ VRAM عند استخدام تكميم ٤ بت — أي حوالي ٠٫٥–٠٫٦ جيجابايت لكل مليار معامل للأوزان، بالإضافة إلى الذاكرة المؤقتة KV cache. وهذا يناسب بطاقة واحدة بسعة ٤٨ جيجابايت أو بطاقتَي GPU بسعة ٢٤ جيجابايت مثل زوج من بطاقات RTX 4090. أما عند استخدام تكميم ٨ بت فتتضاعف الكمية تقريبًا لتصل إلى ~٨٠ جيجابايت، وفي حالة fp16 تحتاج إلى نحو ١٤٠ جيجابايت.
هل يمكن لبطاقتي RTX 4060 أو بطاقة بسعة ١٢ جيجابايت تشغيل نموذج بحجم ٨ مليار أو ٧ مليار معامل؟
نعم. يستخدم نموذج بحجم ٧–٨ مليار معامل عند تكميم ٤ بت فقط نحو ٤–٥ جيجابايت من الـ VRAM، وبالتالي يعمل بسلاسة على بطاقة بسعة ١٢ جيجابايت مثل RTX 3060، مع هامش واسع جدًّا متاح للسياق. أما بطاقة RTX 4060 فهي بسعة ٨ جيجابايت، وهي ما زالت قادرة على تشغيل نموذج بحجم ٧–٨ مليار معامل بكفاءة — لكنك ستكون لديك مساحة أقل لنوافذ السياق الطويلة.
كم كمية الـ VRAM المطلوبة لتشغيل نموذج بحجم ١٣ مليار معامل؟
يتطلب نموذج بحجم ١٣ مليار معامل نحو ٨–١٠ جيجابايت من الـ VRAM عند استخدام تكميم ٤ بت. وهو يناسب بطاقة GPU بسعة ١٢ جيجابايت عند استخدام سياقات قصيرة إلى متوسطة الطول، لكن بطاقة بسعة ١٦ جيجابايت تكون أكثر أمانًا بمجرد إضافة نافذة سياق أطول وهامش التشغيل الإضافي للمكتبات والبيئة.
هل تستطيع بطاقة GPU بسعة ٢٤ جيجابايت مثل RTX 4090 تشغيل نموذج بحجم ٣٢ مليار أو ٧٠ مليار معامل؟
تستطيع بطاقة GPU بسعة ٢٤ جيجابايت تشغيل نموذج بحجم ٣٢ مليار معامل بكفاءة عند تكميم ٤ بت: حيث تشغل الأوزان نحو ٢٠ جيجابايت، وتترك بضعة جيجابايت للذاكرة المؤقتة KV cache. أما نموذج ٧٠ مليار معامل فلا يمكن تحميله بالكامل عند تكميم ٤ بت — إذ يحتاج إلى ~٤٠–٤٨ جيجابايت — وبالتالي ستحتاج إما إلى وحدة GPU ثانية، أو إلى تفريغ جزء من المعالجة على وحدة المعالجة المركزية (CPU offloading)، أو إلى استخدام تكميم منخفض الجودة مثل ٢–٣ بت.
كم كمية ذاكرة GPU المستخدمة من قِبل نموذج لغوي كبير (LLM) لكل مليار معامل؟
كقاعدة عامة، احسب ~٠٫٥–٠٫٦ جيجابايت لكل مليار معامل عند تكميم ٤ بت، و~١–١٫٢ جيجابايت عند تكميم ٨ بت، و~٢ جيجابايت عند fp16/bf16. وبالتالي فإن نموذجًا بحجم ٣٠ مليار معامل يتطلب تقريبًا ١٦–١٨ جيجابايت عند تكميم ٤ بت، و~٣٢ جيجابايت عند تكميم ٨ بت، و~٦٠ جيجابايت عند fp16 — قبل إضافة الذاكرة المؤقتة KV cache.
كم كمية الـ VRAM الإضافية التي يستهلكها طول السياق (أي الذاكرة المؤقتة KV cache)؟
تنمو الذاكرة المؤقتة KV cache خطيًّا مع طول السياق، وتضيف نحو ٣ جيجابايت على نموذج بحجم ٨ مليار معامل عند الانتقال من ٨٠٠٠ إلى ٣٢٠٠٠ رمز (أي من نحو ١ جيجابايت عند ٨٠٠٠ رمز إلى نحو ٤ جيجابايت عند ٣٢٠٠٠ رمز)، وتزداد أكثر مع النماذج الأكبر وأطوال السياق الأطول. أما تكميم الذاكرة المؤقتة KV cache إلى ٨ بت فيقلل هذه الزيادة بنحو النصف تقريبًا، ولذلك يُوصى دائمًا بتوفير هامش إضافي قدره ١–٤ جيجابايت فوق حجم أوزان النموذج.
ما حجم النموذج الذي يمكنني تشغيله على ٨ جيجابايت أو ١٦ جيجابايت من الـ VRAM؟
على ٨ جيجابايت من الـ VRAM يمكنك تشغيل نماذج بحجم ٧–٨ مليار معامل بسلاسة عند تكميم ٤ بت؛ وعلى ١٦ جيجابايت يمكنك تشغيل نماذج حتى ١٣ مليار معامل بسلاسة، بل ويمكنك دفع حدود التشغيل لتشمل نموذجًا بحجم ٢٠–٢٤ مليار معامل مع سياق معتدل. أما لتشغيل نموذج بحجم ٣٢ مليار معامل فستحتاج إلى ٢٤ جيجابايت، ولنموذج بحجم ٧٠ مليار معامل فستحتاج إلى نحو ٤٨ جيجابايت.
أدوات مجانية إضافية من Convly
كمية الـ VRAM المطلوبة لتشغيل نماذج OpenAI محليًّا (تكميم ٤ بت)
1.4 جيجابايت
٣ جيجابايت
4.5 جيجابايت
5 جيجابايت
5 جيجابايت
7.5 جيجابايت
8 جيجابايت
٩ جيجابايت
٩ جيجابايت
16 جيجابايت
18 جيجابايت
٢٠ جيجابايت
٢١ جيجابايت
40 جيجابايت
40 جيجابايت
٦٥ جيجابايت
140 جيجابايت
140 جيجابايت
٢٤٠ جيجابايت
٣٧٠ جيجابايت
٤٠٠ جيجابايت
٤٠٠ جيجابايت
٥٠٠ جيجابايت
٨٠٠ جيجابايت
GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Aug 31, 2026.
🔍 أدمج هذه المخططات في موقعك (مجاني، مع ذكر المصدر)
احصل على الأرقام قبل الجميع
رسالة بريد إلكتروني أسبوعية واحدة: أي نماذج ذكاء اصطناعي غيَّرت أسعارها، وما الذي قاسَته الاختبارات الجديدة فعليًّا، وأي وحدة معالجة رسومات (GPU) تستحق الشراء. بدون ضجيج، وبلا محتوى زائد.
مجاني تمامًا. يمكنك إلغاء الاشتراك بنقرة واحدة. ولا نبيع أو نشارك عنوانك أبدًا.

