Monday, 31 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

هل يمكنني تشغيل هذا النموذج اللغوي الكبير محليًّا؟ — آلة حاسبة مجانية لتقدير الـ VRAM ووحدات معالجة الرسومات

تتساءل إن كانت وحدة معالجة الرسومات الخاصة بك قادرة على تشغيل نموذج لغوي كبير معين محليًّا؟ توفر لك هذه الآلة الحاسبة المجانية تقديرًا للكمية المطلوبة من الـ VRAM لكل نموذج عند مستويات التكميم المختلفة — وتُبيّن لك بدقة أي النماذج يمكنها العمل على وحدتك.

التكميةالجودةالسعة التقديرية للـ VRAMهل يناسب وحدة معالجة الرسومات الخاصة بك؟

التقدير مبني على أوزان النموذج عند كل مستوى تكميم، بالإضافة إلى عبء تشغيلي تقريبي قدره ~1.5 جيجابايت. أما السياقات الطويلة فهي تضيف ذاكرة التخزين المؤقت للقيم المفتاحية (KV-cache) فوق ذلك (وتزداد هذه الذاكرة مع طول السياق الذي تختاره). وفي نماذج «الخلط بين الخبراء» (Mixture-of-Experts)، يجب تحميل جميع المعايير إلى ذاكرة VRAM حتى وإن استُخدمت فقط مجموعة فرعية منها في حساب كل رمز.

اختر نموذجًا من قائمتنا قاعدة بيانات نماذج الذكاء الاصطناعي (أو أدخل عدد المعاملات المخصص)، واختر وحدة معالجة الرسوميات (GPU) الخاصة بك، وعيّن طول السياق المطلوب، ثم اعرف فورًا ما إذا كان النموذج سيعمل أم لا — وبأي جودة. والتقديرات تعتمد على أوزان النموذج؛ أما السياقات الطويلة فتضيف ذاكرة التخزين المؤقت للقيم المفتاحية (KV-cache) فوق ذلك.

إجابة سريعة: كم كمية الـ VRAM المطلوبة لتشغيل نموذج لغوي كبير (LLM) محليًّا؟

لتشغيل نموذج لغوي كبير محليًّا باستخدام تكميم 4 بت، احسب تقريبًا ٠٫٥–٠٫٦ جيجابايت من ذاكرة الـ GPU VRAM لكل مليار معامل، بالإضافة إلى ١–٣ جيجابايت للذاكرة المؤقتة KV cache عند أطوال السياق النموذجية. عمليًّا، يشغل نموذج بحجم ٨ مليار معامل (8B) ما يقارب ٥–٦ جيجابايت (وهو مريح جدًّا على بطاقة RTX 3060 بسعة ١٢ جيجابايت؛ ويُمكن تشغيله أيضًا على بطاقة RTX 4060 بسعة ٨ جيجابايت)، أما نموذج ١٣ مليار معامل (13B) فيتطلب نحو ٨–١٠ جيجابايت، ونموذج ٣٢ مليار معامل (32B) يحتاج بطاقة بسعة ٢٤ جيجابايت مثل RTX 4090 (حيث تشغل الأوزان نحو ٢٠ جيجابايت)، بينما يتطلب نموذج ٧٠ مليار معامل (70B) نحو ٤٠–٤٨ جيجابايت — أي بطاقة واحدة بسعة ٤٨ جيجابايت أو بطاقتَي GPU بسعة ٢٤ جيجابايت كلٌّ منهما. وباستخدام تكميم ٨ بت تتضاعف هذه الأرقام تقريبًا (~١–١٫٢ جيجابايت لكل مليار معامل)، وفي حالة التمثيل الكامل بـ fp16 تتضاعف تقريبًا أربع مرات (~٢ جيجابايت لكل مليار معامل).

قواعد إرشادية سريعة لأحجام أوزان النماذج، قبل إضافة السياق:

  • تكميم ٤ بت (Q4): ~٠٫٥–٠٫٦ جيجابايت لكل مليار معامل
  • تكميم ٨ بت (Q8): ~١–١٫٢ جيجابايت لكل مليار معامل
  • fp16 / bf16: ~٢ جيجابايت لكل مليار معامل
  • الذاكرة المؤقتة KV cache (السياق): أضف ~١–٤ جيجابايت عند استخدام ٨٠٠٠–٣٢٠٠٠ رمز (token)، وتزداد أكثر عند استخدام سياقات أطول جدًّا أو نماذج أكبر

الأسئلة الشائعة

كم كمية الـ VRAM المطلوبة لتشغيل نموذج بحجم ٧٠ مليار معامل؟

يتطلب نموذج بحجم ٧٠ مليار معامل نحو ٤٠–٤٨ جيجابايت من الـ VRAM عند استخدام تكميم ٤ بت — أي حوالي ٠٫٥–٠٫٦ جيجابايت لكل مليار معامل للأوزان، بالإضافة إلى الذاكرة المؤقتة KV cache. وهذا يناسب بطاقة واحدة بسعة ٤٨ جيجابايت أو بطاقتَي GPU بسعة ٢٤ جيجابايت مثل زوج من بطاقات RTX 4090. أما عند استخدام تكميم ٨ بت فتتضاعف الكمية تقريبًا لتصل إلى ~٨٠ جيجابايت، وفي حالة fp16 تحتاج إلى نحو ١٤٠ جيجابايت.

هل يمكن لبطاقتي RTX 4060 أو بطاقة بسعة ١٢ جيجابايت تشغيل نموذج بحجم ٨ مليار أو ٧ مليار معامل؟

نعم. يستخدم نموذج بحجم ٧–٨ مليار معامل عند تكميم ٤ بت فقط نحو ٤–٥ جيجابايت من الـ VRAM، وبالتالي يعمل بسلاسة على بطاقة بسعة ١٢ جيجابايت مثل RTX 3060، مع هامش واسع جدًّا متاح للسياق. أما بطاقة RTX 4060 فهي بسعة ٨ جيجابايت، وهي ما زالت قادرة على تشغيل نموذج بحجم ٧–٨ مليار معامل بكفاءة — لكنك ستكون لديك مساحة أقل لنوافذ السياق الطويلة.

كم كمية الـ VRAM المطلوبة لتشغيل نموذج بحجم ١٣ مليار معامل؟

يتطلب نموذج بحجم ١٣ مليار معامل نحو ٨–١٠ جيجابايت من الـ VRAM عند استخدام تكميم ٤ بت. وهو يناسب بطاقة GPU بسعة ١٢ جيجابايت عند استخدام سياقات قصيرة إلى متوسطة الطول، لكن بطاقة بسعة ١٦ جيجابايت تكون أكثر أمانًا بمجرد إضافة نافذة سياق أطول وهامش التشغيل الإضافي للمكتبات والبيئة.

هل تستطيع بطاقة GPU بسعة ٢٤ جيجابايت مثل RTX 4090 تشغيل نموذج بحجم ٣٢ مليار أو ٧٠ مليار معامل؟

تستطيع بطاقة GPU بسعة ٢٤ جيجابايت تشغيل نموذج بحجم ٣٢ مليار معامل بكفاءة عند تكميم ٤ بت: حيث تشغل الأوزان نحو ٢٠ جيجابايت، وتترك بضعة جيجابايت للذاكرة المؤقتة KV cache. أما نموذج ٧٠ مليار معامل فلا يمكن تحميله بالكامل عند تكميم ٤ بت — إذ يحتاج إلى ~٤٠–٤٨ جيجابايت — وبالتالي ستحتاج إما إلى وحدة GPU ثانية، أو إلى تفريغ جزء من المعالجة على وحدة المعالجة المركزية (CPU offloading)، أو إلى استخدام تكميم منخفض الجودة مثل ٢–٣ بت.

كم كمية ذاكرة GPU المستخدمة من قِبل نموذج لغوي كبير (LLM) لكل مليار معامل؟

كقاعدة عامة، احسب ~٠٫٥–٠٫٦ جيجابايت لكل مليار معامل عند تكميم ٤ بت، و~١–١٫٢ جيجابايت عند تكميم ٨ بت، و~٢ جيجابايت عند fp16/bf16. وبالتالي فإن نموذجًا بحجم ٣٠ مليار معامل يتطلب تقريبًا ١٦–١٨ جيجابايت عند تكميم ٤ بت، و~٣٢ جيجابايت عند تكميم ٨ بت، و~٦٠ جيجابايت عند fp16 — قبل إضافة الذاكرة المؤقتة KV cache.

كم كمية الـ VRAM الإضافية التي يستهلكها طول السياق (أي الذاكرة المؤقتة KV cache)؟

تنمو الذاكرة المؤقتة KV cache خطيًّا مع طول السياق، وتضيف نحو ٣ جيجابايت على نموذج بحجم ٨ مليار معامل عند الانتقال من ٨٠٠٠ إلى ٣٢٠٠٠ رمز (أي من نحو ١ جيجابايت عند ٨٠٠٠ رمز إلى نحو ٤ جيجابايت عند ٣٢٠٠٠ رمز)، وتزداد أكثر مع النماذج الأكبر وأطوال السياق الأطول. أما تكميم الذاكرة المؤقتة KV cache إلى ٨ بت فيقلل هذه الزيادة بنحو النصف تقريبًا، ولذلك يُوصى دائمًا بتوفير هامش إضافي قدره ١–٤ جيجابايت فوق حجم أوزان النموذج.

ما حجم النموذج الذي يمكنني تشغيله على ٨ جيجابايت أو ١٦ جيجابايت من الـ VRAM؟

على ٨ جيجابايت من الـ VRAM يمكنك تشغيل نماذج بحجم ٧–٨ مليار معامل بسلاسة عند تكميم ٤ بت؛ وعلى ١٦ جيجابايت يمكنك تشغيل نماذج حتى ١٣ مليار معامل بسلاسة، بل ويمكنك دفع حدود التشغيل لتشمل نموذجًا بحجم ٢٠–٢٤ مليار معامل مع سياق معتدل. أما لتشغيل نموذج بحجم ٣٢ مليار معامل فستحتاج إلى ٢٤ جيجابايت، ولنموذج بحجم ٧٠ مليار معامل فستحتاج إلى نحو ٤٨ جيجابايت.


كمية الـ VRAM المطلوبة لتشغيل نماذج OpenAI محليًّا (تكميم ٤ بت)

Kimi K3

1.4 جيجابايت

Gemma 3 4B

٣ جيجابايت

Mistral 7B

4.5 جيجابايت

Llama 3.1 8B

5 جيجابايت

Qwen3 8B

5 جيجابايت

Mistral NeMo 12B

7.5 جيجابايت

Gemma 3 12B

8 جيجابايت

Phi-4

٩ جيجابايت

Qwen3 14B

٩ جيجابايت

Gemma 3 27B

16 جيجابايت

Qwen3 30B-A3B

18 جيجابايت

Qwen3 32B

٢٠ جيجابايت

NVIDIA Nemotron 3 Nano Omni

٢١ جيجابايت

DeepSeek R1 Distill Llama 70B

40 جيجابايت

Llama 3.3 70B

40 جيجابايت

Llama 4 Scout

٦٥ جيجابايت

Qwen3 235B-A22B

140 جيجابايت

DeepSeek V4-Flash

140 جيجابايت

Llama 4 Maverick

٢٤٠ جيجابايت

GLM 5.2

٣٧٠ جيجابايت

Mistral Large 3

٤٠٠ جيجابايت

DeepSeek R1

٤٠٠ جيجابايت

Kimi K2.7 Code

٥٠٠ جيجابايت

DeepSeek V4-Pro

٨٠٠ جيجابايت

GB of VRAM at 4-bit quantization · open-weight models in the Convly database · Green = best value, orange = highest. Updated Aug 31, 2026.

🔍 أدمج هذه المخططات في موقعك (مجاني، مع ذكر المصدر)

احصل على الأرقام قبل الجميع

رسالة بريد إلكتروني أسبوعية واحدة: أي نماذج ذكاء اصطناعي غيَّرت أسعارها، وما الذي قاسَته الاختبارات الجديدة فعليًّا، وأي وحدة معالجة رسومات (GPU) تستحق الشراء. بدون ضجيج، وبلا محتوى زائد.

مجاني تمامًا. يمكنك إلغاء الاشتراك بنقرة واحدة. ولا نبيع أو نشارك عنوانك أبدًا.

انتقل إلى الأعلى
Featured on There's An AI For That