كان تشغيل نموذج لغوي كبير على جهاز لابتوب خاص بك مشروع بحث سابقًا. أما في عام 2026، فهو إعدادٌ يستغرق 15 دقيقة فقط. ويمكنك تشغيل مساعد ذكاء اصطناعي فعّال تمامًا يعمل بالكامل على جهازك — دون اشتراك، ودون الحاجة إلى اتصال بالإنترنت، وبلا إرسال أي بيانات خارج حاسوبك أبدًا.
يشرح هذا الدليل العملية بأكملها: ما الأجهزة التي تحتاجها، وأي أداة يجب أن تستخدمها، وأي نموذج يجب أن تحمله، وكيفية تشغيله.
أبرز النقاط المستخلصة
- أسهل طريق: تثبيت Ollama أو LM Studio — وكلاهما يجعلك جاهزًا للتشغيل خلال دقائق.
- الأجهزة: 16 غيغابايت من الذاكرة العشوائية (RAM) هي الحد الأدنى المريح؛ بينما تعد أجهزة Mac المزوَّدة بشريحة Apple Silicon أو أجهزة اللابتوب المزودة بوحدة معالجة رسومات منفصلة الخيار الأمثل.
- حجم النموذج: نماذج بحجم 7–8B هي النقطة المثالية للأجهزة المحمولة — قادرة وسريعة.
- Quantization تضغط النماذج لتناسب عتادك؛ إصدارات «Q4» هي الخيار القياسي.
- لماذا تفعل هذا: إنها مجانية وخاصة تماماً وتعمل بدون اتصال.
لماذا تشغل LLM محلياً؟
خدمات الذكاء الاصطناعي السحابية مريحة، فلماذا تشغل النموذج بنفسك؟ ثلاثة أسباب حقيقية:
- الخصوصية. لا شيء تكتبه يترك جهازك. بالنسبة للعمل الحساس أو السري أو الشخصي، هذا ميزة حقيقية.
- التكلفة. إنها مجانية. لا اشتراكات، لا فواتير حسب الرمز، لا حدود استخدام — توليد ما تريد.
- متاح بدون اتصال وفي كل وقت. يعمل في الطائرة بدون إنترنت، ولا يمكن تحديد معدل استخدامه أو إيقافه.
المقابل: النموذج الذي يعمل على جهاز محمول أصغر وأقل قدرة من نموذج سحابي متقدم. لكن النماذج الصغيرة الحديثة كافية لكثير من الأعمال الحقيقية — الكتابة والملخصات ومساعدة البرمجة والعصف الذهني والأسئلة والأجوبة.
الخطوة 1: تحقق من عتادك
يعتمد أداء LLM محلي بشكل أساسي على الذاكرة. إليك الصورة الصحيحة:
| جهازك المحمول | ما يمكنك تشغيله |
|---|---|
| 8 GB RAM | نماذج صغيرة فقط (1–3B). قابلة للاستخدام لكن محدودة. |
| 16 GB RAM | نماذج 7–8B بكل راحة — النقطة المثالية. |
| 32 GB RAM | حتى نماذج بحجم ~13–14B بسرعة جيدة. |
| Apple Silicon (M-series) | ممتاز — الذاكرة الموحدة مثالية؛ تعمل النماذج الأكبر بشكل جيد. |
| NVIDIA GPU منفصل | الخيار الأسرع؛ VRAM هو حد حجم النموذج. |
الشيئان المهمان: إجمالي الذاكرة (RAM أو VRAM على GPU) يحدد أكبر نموذج يمكنك تحميله، و GPU أو Apple Silicon يحدد سرعة تشغيله. جهاز محمول حديث بـ 16 GB من الذاكرة هو نقطة انطلاق جيدة تماماً.
الخطوة 2: اختر أداتك
لا تتفاعل مع النموذج الخام — تستخدم أداة تحمل وتدير وتشغل النموذج. أفضل الخيارات في 2026:
- Ollama — الخيار الأكثر شيوعاً. أداة سطر أوامر نظيفة (مع تطبيق بسيط) تحمل وتشغل النماذج بأمر واحد، وتفتح API محلي حتى يمكن لتطبيقات أخرى الاتصال به. أفضل خيار شامل.
- LM Studio — تطبيق رسومي مصقول. تصفح وحمّل النماذج، تحدث في واجهة مدمجة، لا حاجة لسطر أوامر. الأفضل للمبتدئين الذين يريدون تجربة بصرية.
- Jan — تطبيق سطح مكتب مفتوح المصدر يركز على الخصوصية، بديل نظيف لـ LM Studio.
- llama.cpp — محرك الأداء العالية الذي بنيت عليه العديد من هذه الأدوات. استخدمه مباشرة إذا كنت تريد أقصى تحكم وكفاءة.
بالنسبة لمعظم الناس: Ollama إذا كنت مرتاحاً للطرفية، LM Studio إذا كنت تفضل النقر.
الخطوة 3: ثبت وشغل نموذجك الأول
الإعداد مع Ollama قصير حقاً:
- حمّل وثبّت Ollama من موقعه الرسمي.
- افتح طرفية.
- شغّل أمر واحد:
ollama run llama3.1
هذا الأمر يحمل النموذج في المرة الأولى (بضعة جيجابايت) ثم يفتح لك موجه دردشة. هذا كل شيء — لديك الآن مساعد ذكاء اصطناعي خاص يعمل محلياً. المرة التالية، يبدأ فوراً.
مع LM Studio يكون المعادل: افتح التطبيق، ابحث عن نموذج، انقر على تحميل، ثم انقر لبدء الدردشة — بالكامل عبر الواجهة.
الخطوة 4: اختر النموذج والحجم المناسب
شيئان للاختيار: عائلة النموذج وحجمه.
عائلة النموذج — النماذج المفتوحة القوية التي تعمل بشكل جيد محلياً تشمل Llama من Meta، و Qwenمن Alibaba، و Gemma، نماذج Mistral، والإصدارات الأصغر من DeepSeek. كلها جيدة؛ جرب بعضها وانظر أيها تفضل.
الحجم — تأتي النماذج بعدد معاملات محدد مثل 3B، 8B، 14B (B = مليار):
- 1–3B — سريعة جداً، خفيفة على الذاكرة، مناسبة للمهام البسيطة. جيدة لأجهزة 8 GB.
- 7–8B — النقطة الحلوة للأجهزة المحمولة. قادرة حقاً على الكتابة والمساعدة في البرمجة والأسئلة والأجوبة، وتعمل بشكل جيد على 16 GB.
- 13–14B وما فوق — أذكى بشكل ملحوظ، لكن تحتاج إلى 32 GB أو GPU قوي.
ابدأ بنموذج 8B. إنه أفضل توازن بين الإمكانية والسرعة لمعظم الأجهزة المحمولة.
الخطوة 5: فهم التكمية
ستشاهد أسماء نماذج بعلامات مثل Q4_K_M أو Q8. هذا هو التكمية — تقنية ضغط تقلل دقة أرقام النموذج بحيث تستخدم ذاكرة أقل بكثير، مع خسارة جودة صغيرة فقط.
- Q8 — أعلى جودة، أكبر حجم.
- Q4 — حوالي نصف ذاكرة Q8، مع جودة قريبة جداً. هذا هو التوصية القياسية.
- Q2/Q3 — الأصغر، لكن الجودة تتراجع بشكل ملحوظ؛ استخدمها فقط إذا أجبرتك الذاكرة.
القاعدة العملية: اختر Q4 نسخة من أكبر نموذج يمكن لذاكرتك أن تحمله بسهولة. أدوات مثل Ollama تختار تكمية معقولة بشكل افتراضي، لذا غالباً لا تضطر للتفكير فيها.
التطور الإضافي
بعد أن يبدأ التشغيل، يمكنك فعل أكثر من مجرد الدردشة في الطرفية:
- اتصل بواجهة أفضل — تطبيقات مثل Open WebUI توفر نافذة بأسلوب ChatGPT فوق نموذجك المحلي.
- استخدم API المحلي — Ollama يعرّف API على جهازك، بحيث يمكنك بناء سكريبتات وتطبيقات ضد نموذجك المحلي تماماً كما تفعل مع سحابة.
- جرب الاسترجاع — وجّه إعداد RAG نحو مستنداتك الخاصة لمساعد «دردشة مع ملفاتك» خاص تماماً.
لماذا هو بطيء — وكيفية إصلاحه
الشكوى الأكثر شيوعاً بعد التثبيت الأول ليست أن النموذج لن يعمل — بل أنه يتحرك ببطء شديد. على جهاز كمبيوتر محمول، البطء في الإخراج يأتي دائماً تقريباً من أن النموذج لا يستخدم بالفعل وحدة معالجة الرسومات GPU الخاصة بك. الطريقة الأسرع للتحقق هي تشغيل نموذج، ثم في نافذة طرفية أخرى قم بتشغيل ollama ps. يوضح الإخراج كيف تم تقسيم النموذج: إذا أظهر 100% GPU فأنت بخير؛ إذا أظهر 100% CPU أو تقسيم CPU/GPU، فقد وجدت مشكلتك.
هناك ثلاثة مشبوهين معتادين، بترتيب عدد مرات ظهورهم:
- لم يتم الكشف عن وحدة معالجة الرسومات GPU أبداً. على Windows و Linux مع بطاقة NVIDIA، هذا عادة يعني أن برامج تشغيل وحدة معالجة الرسومات تم تثبيتها بعد وقت التشغيل، لذا لم تختر CUDA support — Ollama تتحقق من وجود وحدة معالجة الرسومات GPU وقت التثبيت، وليس أثناء التشغيل. تأكد nvidia-smi يعمل، ثم أعد تثبيت وقت التشغيل حتى يكتشف وحدة معالجة الرسومات GPU. هذا الإصلاح الواحد يحل الأغلبية من تقارير «إنه يستخدم وحدة المعالجة المركزية CPU الخاصة بي».
- النموذج كبير جداً لـ VRAM الخاص بك. عندما لا يناسب النموذج، تسقط الطبقات الزائدة بصمت إلى ذاكرة النظام والمعالج — وهذه الطبقات القليلة من المعالج تبطئ كل شيء. الحل هو الانتقال إلى نموذج أصغر أو تكميم أثقل (بناء Q منخفض) بحيث يعيش النموذج الكامل في VRAM.
- نافذة السياق الخاصة بك كبيرة جداً. فزيادة طول السياق تستهلك أيضًا الذاكرة، لأن ذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache) تزداد مع طول السياق. وإذا زادت كثيرًا، فإن بعض الطبقات تعود تلقائيًّا إلى وحدة المعالجة المركزية. لذا إن لم تكن بحاجة إلى مطالبة طويلة جدًّا، فقلّل طول السياق (8 كيلوبايت كافية لمعظم المهام)، وسيتسع النموذج في الذاكرة براحة أكبر.
وهناك مشكلتان محددتان لأجهزة الكمبيوتر المحمولة. أولًا، سياسة طاقة البطارية: فمعظم أجهزة الكمبيوتر المحمولة العاملة بنظام ويندوز تُقلّل أداء وحدة معالجة الرسوميات المخصصة بشكل حاد عند فصل الشاحن، وقد يؤدي فصل الشاحن إلى خفض سرعة الاستنتاج بنسبة 50٪ أو أكثر. وهذه سلوك مبرمج في البرنامج الثابت (firmware)، وليس عطلًا — لذا ابقِ جهازك المحمول موصلًا بالشاحن أثناء العمل الجاد. ثانيًا، الحد من التردد بسبب ارتفاع الحرارة (thermal throttling): فبعد نحو 10–20 دقيقة من التوليد المستمر، تسخن أجهزة الكمبيوتر المحمولة الرقيقة وتخفض تردد وحدة المعالجة المركزية تلقائيًّا. ولتأخير بدء هذا التباطؤ، يمكنك رفع الجهاز ببضعة سنتيمترات على حامل لتحسين تدفق الهواء، والاعتماد على نموذج مكمّن بدرجة خفيفة أكثر (lighter quantization) يعمل عند حرارة أقل. وهذا لا يجعل جهازك المحمول محطة عمل احترافية، لكنه الفرق بين توليد بضعة رموز (tokens) في الثانية وبين مساعد فعّال حقًّا.
الأسئلة الشائعة
هل يمكنني تشغيل Llama على جهاز محمول عادي؟
نعم. جهاز محمول بـ 16 GB من الذاكرة يشغّل نماذج 7–8B بسهولة، وهي مفيدة حقاً. حتى أجهزة 8 GB يمكنها تشغيل نماذج أصغر 1–3B. أجهزة Mac بـ Apple Silicon والأجهزة المحمولة مع GPU منفصل تشغّل نماذج محلية بشكل استثنائي.
هل تشغيل LLM محلياً مجاني؟
نعم. النماذج مجانية للتحميل ولا توجد تكلفة استخدام — يمكنك توليد ما تشاء. «التكلفة» الوحيدة هي جهازك والمساحة على القرص التي تشغلها ملفات النموذج (بضعة جيجابايت لكل منها).
ما أفضل أداة لتشغيل LLMs محلياً؟
Ollama هي الأكثر شهرة وأفضل خيار شامل — أمر بسيط يحمّل ويشغّل أي نموذج، وتوفر API محلي. LM Studio هو الخيار الأفضل إذا فضلت تطبيق رسومي بدون سطر أوامر.
كم من ذاكرة الوصول العشوائي أحتاج لتشغيل نموذج محلي?
16 GB هي الحد الأدنى المريح لنماذج 7–8B قادرة فعلاً. مع 8 GB أنت محدود بنماذج أصغر 1–3B. مع 32 GB يمكنك تشغيل نماذج 13–14B. الذاكرة الإضافية تسمح لك في الأساس بتشغيل نماذج أكبر وأذكى.
هل LLMs المحلية جيدة مثل ChatGPT؟
ليست قادرة مثل نموذج سحابي متقدم — نماذج حجم الجهاز المحمول أصغر وأقل قوة. لكنها جيدة بما يكفي للعديد من المهام اليومية: الكتابة والتلخيص والمساعدة في البرمجة والأسئلة والأجوبة. تتنازل عن بعض الإمكانية مقابل الخصوصية الكاملة والتكلفة الصفر والوصول غير المتصل.
لماذا يعمل نموذجي اللغوي الكبير محليًّا ببطء شديد؟
في تسع من كل عشر حالات، السبب هو أن النموذج لا يستخدم وحدة معالجة الرسوميات (GPU). شغّل الأمر ollama ps بينما يكون النموذج محملًا: فإذا أظهر 100٪ CPU أو توزيعًا بين CPU/GPU، فهذه هي الإجابة. والأسباب الشائعة هي: تثبيت برامج تشغيل وحدة معالجة الرسوميات بعد تثبيت بيئة التشغيل (أعد تثبيت البيئة لتكتشف دعم CUDA)، أو أن النموذج كبير جدًّا بالنسبة لسعة ذاكرة VRAM (استخدم نموذجًا أصغر أو كمّنة أشد)، أو أن نافذة السياق كبيرة جدًّا لدرجة تدفع بعض الطبقات للعودة إلى وحدة المعالجة المركزية (قلّل طولها).
هل يجب أن أبقي جهازي المحمول موصلًا بالشاحن أثناء تشغيل نموذج لغوي كبير محليًّا؟
نعم، وذلك لأي مهمة تتجاوز طرح سؤال سريع. فمعظم أجهزة الكمبيوتر المحمولة العاملة بنظام ويندوز تحدّ من أداء وحدة معالجة الرسوميات المخصصة بشدة عند تشغيلها على البطارية للحفاظ على عمر التشغيل، مما قد يخفض معدل الرموز المولَّدة في الثانية (tokens-per-second) بنسبة تقارب النصف. وهذا التباطؤ ناتج عن سياسة إدارة الطاقة المبرمجة في البرنامج الثابت (firmware)، وليس عطلًا. أما توصيل الشاحن فيعيد تفعيل التردد الكامل لوحدة معالجة الرسوميات، كما أن استخدام حامل تبريد لتحسين تدفق الهواء يساعد في تجنّب الحد من التردد بسبب ارتفاع الحرارة الذي يحدث بعد جلسات العمل الطويلة.
هل يمكنني استخدام نموذج لغوي كبير محليًّا تمامًا دون اتصال بالإنترنت؟
نعم. فالاتصال بالإنترنت مطلوب فقط لتنزيل النموذج أول مرة. وبمجرد تخزين النموذج على القرص الصلب، يعمل بالكامل دون اتصال — ويمكنك فصل الجهاز تمامًا عن الإنترنت وما زال يردّ عليك. وهذه هي الميزة الأساسية من حيث الخصوصية: فمطالباتك لا تغادر جهازك أبدًا، ما يجعل النموذج المحلي خيارًا معقولًا للملاحظات السرية، أو المسودات، أو أي محتوى لا ترغب في إرساله إلى خدمة سحابية.
الخلاصة
تشغيل نموذج AI على جهازك المحمول لم يعد صعباً. ثبّت Ollama أو LM Studio، نموذج 8B بـ Q4 تكمية، وفي غضون 15 دقيقة لديك مساعد قادر مجاني وخاص تماماً ويعمل بلا اتصال.
لن يحل محل نموذج سحابي متقدم للمهام الأصعب — لكن للكتابة اليومية والمساعدة في البرمجة والأسئلة والأجوبة الخاصة، نموذج محلي مفيد حقاً. وبعد أن يبدأ التشغيل، فهو ملكك: لا اشتراك، لا حدود، ولا بيانات تترك جهازك.
