Thursday, 27 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

نماذج النماذج اللغوية الكبيرة المحلية: دليل شامل لتشغيل نماذج الذكاء الاصطناعي على أجهزتك

باختصار:

  • النماذج اللغوية الكبيرة المحلية تعمل على أجهزتك دون الحاجة إلى إجراء استدعاءات عبر واجهات برمجة التطبيقات (API). ومن الخيارات الشائعة Llama 3.1 (8B–405B) Mistral 7B، وPhi-3، وGemma 2.
  • استخدم Ollama للإعداد الأبسط (ollama run llama3.1), LM Studio لواجهة رسومية مستخدم (GUI)، أو llama.cpp للتحكم الأقصى.
  • يحتاج نموذج بحجم 8 مليار معلَّمة إلى ما بين 6 و8 جيجابايت من الـ VRAM عند استخدام التكميم (quantization) بـ 4 بت، أو إلى 16 جيجابايت عند الدقة الكاملة. أما النماذج بحجم 70 مليار معلَّمة فتتطلب 40 جيجابايت فأكثر من الـ VRAM، أو يمكن الاعتماد على التفريغ إلى ذاكرة النظام (system RAM offloading).
  • يقلل التكميم (Quantization) — سواء بصيغة GGUF أو GPTQ أو AWQ — من حجم النموذج بنسبة تتراوح بين 50% و75% مع خسارة ضئيلة جدًّا في الجودة، مما يجعل النشر المحلي عمليًّا على الأجهزة الاستهلاكية.

النماذج اللغوية الكبيرة المحلية هي نماذج لغوية ذكية تعمل بالكامل على أجهزتك — سواء كان ذلك جهاز كمبيوتر شخصي أو محمول أو خادم — دون إرسال أي بيانات إلى واجهات برمجة التطبيقات الخارجية. فبعد تنزيل أوزان النموذج، تقوم بتحميلها في الذاكرة ثم تشغيل عملية الاستنتاج محليًّا. وهذا يمنحك خصوصية تامة، وعدم وجود تكاليف لكل رمز، والتشغيل دون اتصال بالإنترنت، والتحكم الكامل في سلوك النموذج. أما الثمن الذي تدفعه مقابل ذلك فهو الاستثمار الأولي في الأجهزة، وبطء سرعة الاستنتاج مقارنةً بموفري الخدمات السحابية الذين يعملون على بنية تحتية مُحسَّنة.

أشهر نموذج لغوي كبير محلي النماذج

اعتبارًا من عام 2026، تقدم هذه النماذج أفضل توازن بين الجودة وإمكانية التشغيل على الأجهزة المتاحة للمستخدم العادي للنشر المحلي:

النموذج عدد المعايير (البارامترات) ذاكرة الفيديو (VRAM) بتنسيق 4 بت الـ VRAM (16 بت) الأفضل لـ
Llama 3.1 8B / 70B / 405B 6 جيجابايت / 40 جيجابايت / 240 جيجابايت 16 جيجابايت / 140 جيجابايت / 810 جيجابايت غرض عام، البرمجة، الاستنتاج المنطقي
ميسترال 7B v0.3 ٧ مليارات معلَّمة 5 جيجابايت ١٤ غيغابايت استنتاج سريع، ونسبة جودة/حجم ممتازة
Phi-3-medium 14 مليار معلّمة 9 جيجابايت 28 جيجابايت استنتاج فعّال، ويناسب وحدات معالجة الرسوميات الاستهلاكية
Gemma 2 9 مليارات / 27 مليار 6 جيجابايت / 18 جيجابايت 18 جيجابايت / 54 جيجابايت اتباع التعليمات، ومُحسَّن للأمان
Qwen 2.5 7B / 72B 5 جيجابايت / 42 جيجابايت 14 جيجابايت / 144 جيجابايت متعدد اللغات، قوي جدًّا في الرياضيات والبرمجة
DeepSeek-Coder-V2 16B / 236B 10 جيجابايت / 140 جيجابايت 32 جيجابايت / 472 جيجابايت توليد الأكواد وفهمها

تقديرات الـ VRAM تقريبية وتختلف حسب طول السياق وحجم الدفعة (batch size). استخدم حاسبة الذاكرة VRAM للحصول على متطلبات دقيقة وفقًا لإعدادك، أو راجع متطلبات ذاكرة VRAM حسب النموذج لمواصفات مفصلة تشمل أكثر من 37 نموذجًا.

متطلبات الأجهزة

تُحمَّل النماذج اللغوية الكبيرة المحلية بالكامل في الذاكرة أثناء عملية الاستنتاج. ويمكنك تشغيلها إما في ذاكرة وحدة معالجة الرسوميات (VRAM)، أو في ذاكرة النظام (RAM)، أو باستخدام مزيج منهما:

وحدة معالجة الرسوميات (الأسرع)

توفر وحدات معالجة الرسوميات من NVIDIA التي تدعم CUDA أفضل أداء ممكن. أما وحدات معالجة الرسوميات من AMD فتعمل عبر ROCm، لكن دعم الأدوات لها أقل. وتستخدم شرائح Apple Silicon (M1/M2/M3) الذاكرة الموحَّدة (unified memory) وتشغل النماذج بكفاءة عالية عبر Metal.

  • المستوى المبتدئ: RTX 3060 بسعة 12 جيجابايت أو RTX 4060 Ti بسعة 16 جيجابايت تشغل نماذج بحجم 7–8 مليار معلَّمة باستخدام التكميم بـ 4 بت
  • المستوى المتوسط: RTX 4090 بسعة 24 جيجابايت تتعامل مع نماذج بحجم 30 مليار معلَّمة مُكمَّمة، أو نماذج بحجم 13 مليار معلَّمة بدقتها الكاملة
  • المستوى المتقدم: A6000 بسعة 48 جيجابايت أو وحدتي معالجة رسوميات استهلاكيتين تعملان معًا لتشغيل نماذج بحجم 70 مليار معلَّمة باستخدام التكميم بـ 4 بت

اطّلع على أفضل وحدات معالجة الرسوميات لتشغيل نماذج اللغة الكبيرة محليًّا دليل لاختبارات الأداء ونسب السعر إلى الأداء.

وحدة المعالجة المركزية (أبطأ لكنها متاحة بسهولة)

يمكن لأي وحدة معالجة مركزية حديثة تشغيل نماذج النماذج اللغوية الكبيرة المحلية باستخدام ذاكرة الوصول العشوائي للنظام، وإن كانت أبطأ بعشرة إلى خمسين مرة مقارنةً باستنتاج وحدة معالجة الرسومات. وهذه الطريقة قابلة للتطبيق على النماذج الصغيرة (7–8 مليار معلَّمة) أو عندما تكون الخصوصية أكثر أهمية من السرعة.

  • الحد الأدنى: 16 جيجابايت من الذاكرة العشوائية لتشغيل نماذج 7 مليار معلَّمة عند تكميم 4 بت
  • موصى به: 32 جيجابايت فأكثر من الذاكرة العشوائية لتشغيل مريح مع نوافذ سياق أكبر
  • الخوادم: 128 جيجابايت فأكثر من الذاكرة العشوائية تُمكِّن تشغيل نماذج 70 مليار معلَّمة على أنظمة تعتمد فقط على وحدة المعالجة المركزية

هجين (وحدة معالجة الرسومات + وحدة معالجة مركزية)

تدعم معظم الإطارات البرمجية التفريغ: تحميل بعض الطبقات على وحدة معالجة الرسومات، بينما تُفرَّغ الطبقات المتبقية في الذاكرة العشوائية. وقد يستخدم نموذج 70 مليار معلَّمة مثلاً 24 جيجابايت من ذاكرة وحدة معالجة الرسومات + 32 جيجابايت من الذاكرة العشوائية، ما يوفِّر استنتاجًا أسرع بثلاثة إلى خمس مرات مقارنةً بالاعتماد على وحدة المعالجة المركزية فقط.

تشغيل النماذج اللغوية الكبيرة المحلية

Ollama (الأيسر)

Ollama يغلف llama.cpp عبر واجهة سطر أوامر بسيطة وسجل نماذج. وهو أسرع طريقة للبدء:

# التثبيت على أنظمة macOS/Linux
curl -fsSL https://ollama.ai/install.sh | sh

# لنظام Windows: نزِّل برنامج التثبيت من ollama.ai

# تشغيل نموذج (يتم تنزيله تلقائيًا)
ollama run llama3.1

# عرض قائمة النماذج المتاحة
ollama list

# تنزيل نموذج معيَّن
ollama pull mistral:7b-instruct-q4_0

يختار Ollama تلقائيًا وحدة معالجة الرسومات أو وحدة المعالجة المركزية، ويدير عملية التكميم، ويتعامل مع تنزيل النماذج. اقرأ الدليل الكامل لـ Ollama للمزيد من التفاصيل حول الإعداد والتكوين، أو انتقل مباشرةً إلى كيفية تثبيت منصة Ollama لإرشادات خطوة بخطوة حسب المنصة.

تصفح أكثر من 100 نموذج متاح في قائمة نماذج Ollama، أو راجع التوصيات المُنتقاة في أفضل النماذج المحلية لـ Ollama.

LM Studio (واجهة رسومية)

توفر LM Studio تطبيق سطح مكتب لأنظمة Windows وmacOS وLinux، مزوَّد بواجهة دردشة ومتصفِّح نماذج. نزِّل التطبيق من lmstudio.ai، ثم شغِّله، وابحث عن النماذج في تبويب «اكتشف»، وانقر على «تنزيل». وتستخدم النماذج تنسيق GGUF، وتُحمَّل مع إمكانية ضبط مستوى التكميم.

تعرض LM Studio استخدام ذاكرة وحدة معالجة الرسومات في الوقت الفعلي وسرعة الاستنتاج، مما يسهِّل ضبط الإعدادات. كما أنها تقوم بتشغيل خادم محلي متوافق مع واجهة برمجة تطبيقات OpenAI على http://localhost:1234/v1 لدمجها مع التطبيقات التي تتوقع تنسيق OpenAI. راجع الدليل الكامل لـ LM Studio لميزات متقدمة.

llama.cpp (متقدم)

llama.cpp هو المحرك الأساسي المستخدم في Ollama وLM Studio، ويوفر أقصى درجات التحكم للمطورين:

# استنساخ المشروع وبناؤه
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

# مع دعم CUDA
make LLAMA_CUDA=1

# تشغيل الاستنتاج
./main -m models/llama-3.1-8b-instruct-q4_0.gguf -p "اشرح الحوسبة الكمومية" -n 512 --gpu-layers 35

الـ --gpu-layers يتحكم هذا العلامة في عدد طبقات المحول التي تُحمَّل على وحدة معالجة الرسومات مقابل تلك التي تُحمَّل في الذاكرة العشوائية. وكلما زاد العدد، زاد استهلاك ذاكرة وحدة معالجة الرسومات، لكن سرعة التشغيل تزداد أيضًا. ابدأ بنصف عدد الطبقات الإجمالي للنموذج وقم بالضبط حسب الحاجة.

أدوات أخرى

  • text-generation-webui: واجهة ويب مزودة بالإضافات وتدعم عدة محركات تشغيل خلفية
  • vLLM: خادم استنتاج مُحسَّن للنشر الإنتاجي عالي الإنتاجية
  • LocalAI: بديل مباشر لواجهة برمجة تطبيقات OpenAI يدعم تنسيقات نماذج متعددة
  • Jan: تطبيق سطح مكتب مشابه لـ LM Studio مع تركيز خاص على الخصوصية

صيغ النماذج والتكميم

يقلل التكميم دقة النموذج من أعداد عشرية ذات 16 بت أو 32 بت إلى أعداد ذات 8 بت أو 4 بت أو دقة مختلطة، مما يخفض متطلبات الذاكرة بنسبة 50–75% مع فقدان جودة يتراوح بين 2–5%. وتختلف التنسيقات المُستخدمة حسب نوع الأجهزة المستهدفة:

GGUF (Ollama، LM Studio، llama.cpp)

GGUF هو التنسيق القياسي للنشر المحلي. وتشمل مستويات التكميم الشائعة:

  • Q4_0: 4 بت، أصغر حجم ممكن، وفقدان جودة يتراوح بين 5–10%
  • Q4_K_M: 4 بت بدقة مختلطة، توازن جيد بين الجودة والحجم
  • Q5_K_M: 5 بت، جودة أفضل من Q4 مع الحفاظ على صغر الحجم
  • Q8_0: 8 بت، فقدان جودة ضئيل جدًّا، لكن الملفات أكبر حجمًا
  • F16: دقة كاملة 16 بت، بدون تكميم

لأغلب حالات الاستخدام، يوفِّر Q4_K_M أو Q5_K_M أفضل نسبة بين الجودة والحجم. واستخدم Q8_0 أو F16 فقط إذا توافرت لديك ذاكرة وحدة معالجة الرسومات الزائدة واحتاجت إلى أقصى دقة ممكنة.

GPTQ (استنتاج بلغة بايثون)

يقوم GPTQ بالتكميم إلى 4 بت أو 3 بت ويوصِّل أداء الاستنتاج على وحدات معالجة الرسومات باستخدام مكتبات مثل AutoGPTQ أو ExLlama. وهو شائع في سير عمل Hugging Face Transformers. وتتم عملية تحميل نماذج GPTQ أسرع من نماذج GGUF، لكنها تتطلب بيئات بايثون.

AWQ (استنتاج سريع على وحدات معالجة الرسومات)

AWQ (كمِّم أوزان مُدركة للإشارات الداخلة) يحافظ على دقة أعلى من GPTQ عند التكميم إلى 4 بت، وذلك بحماية الأوزان المهمة. ويتطلب محركات استنتاج متوافقة مع AWQ مثل vLLM أو TGI.

اختيار نموذج لغوي كبير محلي

اختر حجم النموذج بما يتناسب مع أجهزتك وحالات الاستخدام الخاصة بك:

  • نماذج 7–8 مليار معلَّمة: تناسب بطاقات الرسومات الاستهلاكية (12–16 جيجابايت من ذاكرة وحدة معالجة الرسومات)، وتوفِّر استجابات سريعة، وهي مناسبة جدًّا للدردشة والمهمات البسيطة
  • نماذج 13–14 مليار معلَّمة: تتطلب 20–24 جيجابايت من ذاكرة وحدة معالجة الرسومات، وتتفوق بشكل ملحوظ في الاستنتاج واتباع التعليمات
  • نماذج 30–34 مليار معلَّمة: تحتاج إلى 40 جيجابايت فأكثر من ذاكرة وحدة معالجة الرسومات أو نظام هجين يجمع بين وحدة معالجة الرسومات والذاكرة العشوائية، وتقترب من جودة GPT-3.5
  • طرازات 70B+: تتطلب أجهزة خادم قوية أو تكميمًا جذريًّا، وتُنافس نموذج GPT-4 في العديد من المهام

تصفح المواصفات ونتائج الاختبارات المرجعية لـ 37 نموذجًا ضمن قاعدة بيانات نماذج الذكاء الاصطناعي، أو قارن الترتيبات ضمن لوحة تصنيف النماذج اللغوية الكبيرة (LLM) المُرتَّبة حسب الذكاء والسعر وطول السياق.

لتحليل التكلفة، استخدم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لإيجاد نقطة التعادل بين تكلفة الأجهزة المحلية وتكاليف واجهات برمجة التطبيقات (API) السحابية. فعلى الرغم من أن النماذج المحلية تتطلّب تكلفة أولية أعلى، فإن تكلفة كل رمز (token) إضافي تساوي صفرًا، ما يجعلها أقل تكلفة عند الحجم العالي.

الأسئلة الشائعة

هل يمكنني تشغيل نماذج النماذج اللغوية الكبيرة المحلية على جهاز كمبيوتر محمول؟

نعم، شرط أن تمتلك ذاكرة موحدة بسعة 16 جيجابايت فأكثر (شريحة Apple Silicon) أو ذاكرة وصول عشوائي (RAM) بسعة 16 جيجابايت فأكثر بالإضافة إلى وحدة معالجة رسوميات منفصلة (GPU) بسعة ذاكرة فيديو (VRAM) 8 جيجابايت فأكثر. فأجهزة MacBook Pro المزودة بشريحة M1 Max/ Ultra أو M2 Pro/ Max أو M3 Max تُشغل نماذج بحجم 7–13 مليار معلَّمة بكفاءة عالية. أما أجهزة الكمبيوتر المحمولة التي تعمل بنظامَي Windows أو Linux والمزودة بوحدات معالجة رسوميات متنقلة من سلسلة RTX 4060–4090 فهي قادرة على تشغيل نماذج بحجم 7–30 مليار معلَّمة، حسب سعة الـ VRAM المتوفرة. أما الاستنتاج القائم على وحدة المعالجة المركزية فقط (CPU-only inference) فيعمل على أي جهاز كمبيوتر محمول يحتوي على 16 جيجابايت من الذاكرة أو أكثر، لكنه أبطأ بنسبة تتراوح بين 10 و50 مرة.

كم تقل سرعة النماذج اللغوية الكبيرة المحلية مقارنةً بموفِّري واجهات برمجة التطبيقات (API)؟

يعتمد ذلك على المواصفات التقنية للجهاز. فنموذج بحجم 7 مليار معلَّمة يعمل على وحدة معالجة رسوميات RTX 4090 يولِّد ما بين 80 و120 رمزًا في الثانية، وهي سرعة مماثلة لتأخير واجهات برمجة التطبيقات (API latency). أما نفس النموذج عند التشغيل على وحدة المعالجة المركزية (CPU) فيولد ما بين 5 و15 رمزًا في الثانية فقط. أما النماذج الأكبر (70 مليار معلَّمة فأكثر) عند تشغيلها على أجهزة استهلاكية، فتولِّد ما بين رمزين و10 رموز في الثانية حتى عند استخدام تسريع بواسطة وحدة معالجة رسوميات. أما موفرو الخدمات السحابية فيستخدمون مجموعات من وحدات معالجة الرسوميات H100 المُحسَّنة لتحقيق أقصى إنتاجية، لكن النماذج المحلية تخلِّصك تمامًا من تأخير الشبكة — إذ تحصل على الرمز الأول من الاستجابة فورًا.

هل تتطلب النماذج اللغوية الكبيرة المحلية اتصالاً بالإنترنت؟

لا، بعد تنزيلها. فبعد تنزيل أوزان النموذج مرة واحدة (وتتراوح حجمها بين 1 و150 جيجابايت حسب حجم النموذج)، يتم تشغيل عملية الاستنتاج (inference) بالكامل دون اتصال بالإنترنت. وتقوم أدوات مثل Ollama وLM Studio وllama.cpp بتخزين النماذج محليًّا في الذاكرة المؤقتة (cache). وهذا يجعل النماذج اللغوية الكبيرة المحلية مناسبة جدًّا للبيئات المعزولة تمامًا عن الشبكة (air-gapped environments)، أو أثناء السفر، أو في المهام الحساسة من حيث الخصوصية حيث لا يسمح بأي شكل من الأشكال بخروج البيانات خارج شبكتك.

ما الفرق في الجودة بين النماذج المكمَّمة والنماذج ذات الدقة الكاملة؟

يؤدي التكميم بـ 4 بت (Q4_K_M) إلى فقدان يتراوح بين ٢٪ و٥٪ في الجودة مقارنةً بالدقة ١٦ بت في معظم الاختبارات المرجعية، ويؤثر هذا الفقد في الغالب على الاستنتاجات المعقدة والاسترجاع الدقيق للحقائق. أما التكميم بـ ٨ بت فيؤدي إلى فقدان أقل من ١٪. وفي مهام الدردشة ومساعدة البرمجة ومعالجة المستندات، لا يستطيع معظم المستخدمين التمييز بين Q4_K_M وF16. أما في التطبيقات الحرجة التي تتطلب أقصى درجات الدقة (مثل المجالات الطبية أو القانونية أو العلمية)، فيجب استخدام Q8_0 أو F16 إذا كانت لديك ذاكرة VRAM الكافية.

هل يمكنني ضبط النماذج اللغوية الكبيرة المحلية يدويًّا (fine-tune)؟

نعم، باستخدام مكتبات مثل Axolotl وLudwig أو Hugging Face TRL. ويحتاج ضبط النموذج يدويًّا إلى سعة أكبر من الـ VRAM مقارنةً بعملية الاستنتاج العادية؛ فعلى سبيل المثال، يتطلب الضبط الكامل (full fine-tuning) لنماذج بحجم 7 مليار معلَّمة ما لا يقل عن 24 جيجابايت من الـ VRAM، بينما تتراوح الحاجة إلى الـ VRAM في طرق الضبط الفعالة من حيث المعايير (parameter-efficient methods) مثل LoRA بين 12 و16 جيجابايت. وتستبدل أوزان النموذج المُعدَّل أو تُكمِّل أوزان النموذج الأصلي، وبالتالي يمكنك نشر النموذج المُعدَّل باستخدام نفس الأدوات (مثل Ollama وLM Studio وllama.cpp) بعد تحويله إلى صيغة GGUF أو أي صيغة أخرى مناسبة للاستنتاج.

أي نموذج من النماذج اللغوية الكبيرة المحلية يقترب أكثر من جودة ChatGPT؟

يقترب نموذج Llama 3.1 70B من جودة GPT-4 في مجالات الاستنتاج واتّباع التعليمات، بينما يطابق نموذج Llama 3.1 405B تلك الجودة أو يتفوّق عليها في العديد من الاختبارات المرجعية. أما للوصول إلى جودة تعادل GPT-3.5، فـ Llama 3.1 8B، أو Mistral 7B، أو Qwen 2.5 14B تكفي تمامًا. ولا يوجد نموذج محلي يُعيد إنتاج سلوك ChatGPT بدقة كاملة، لأن ChatGPT يستخدم توسّع الاسترجاع (retrieval augmentation) وعددًا من النماذج المختلفة ومعالجة لاحقة (post-processing)، لكن القدرات الأساسية للنماذج أصبحت الآن مماثلة عند نطاق 70B فأكثر.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That