Thursday, 20 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

LM Studio: دليل شامل لتشغيل نماذج الذكاء الاصطناعي المحلية

باختصار:

  • LM Studio هو تطبيق سطح مكتب مجاني لتشغيل نماذج اللغة الكبيرة محليًّا على حاسوبك دون الحاجة إلى البرمجة أو استخدام سطر الأوامر
  • قم بتنزيل النماذج مباشرةً من Hugging Face عبر المتصفح المدمج في التطبيق، مع دعم تنسيق GGUF واختيار تلقائي للتكبير الكمي (quantization)
  • يتضمن واجهة دردشة رسومية، وخادم واجهة برمجية محلية (متوافق مع OpenAI)، وتسريعًا أجهزيًّا تلقائيًّا (CUDA، Metal، CPU)
  • يتطلب كمية كافية من الذاكرة VRAM/RAM حسب حجم النموذج — عادةً ٨ جيجابايت كحد أدنى للنماذج ذات ٧ مليار معلمة (7B)، و٢٤ جيجابايت فأكثر للنماذج ذات ١٣ مليار معلمة (13B)

LM Studio هو تطبيق سطح مكتب يسمح لك بتنزيل نماذج اللغة الكبيرة وتشغيلها والتفاعل معها على حاسوبك الشخصي. ويوفّر واجهة رسومية للمهام التي تتطلّب عادةً أدوات سطر الأوامر، ما يجعل الذكاء الاصطناعي المحلي في متناول المطوّرين والمستخدمين التقنيين الراغبين في التحكّم الكامل في نماذجهم دون إرسال بياناتهم إلى واجهات برمجية خارجية. كما يتولّى التطبيق اكتشاف النماذج وتنزيلها واختيار التكبير الكمي والتسريع الأجهزي تلقائيًّا.

على عكس خدمات الذكاء الاصطناعي المستندة إلى السحابة، LM Studio يعمل بالكامل دون اتصال بالإنترنت بعد تنزيل النموذج. فمحادثاتك ووثائقك وتعليماتك لا تغادر جهازك أبدًا. وهذا يجعله مناسبًا للأعمال الحساسة، والتجارب دون تكاليف واجهات برمجية خارجية، والبيئات التي تعاني من ضعف الاتصال بالإنترنت أو انقطاعه تمامًا.

التثبيت

ويندوز

نزّل برنامج التثبيت من lmstudio.ai. وكتلة .exe حجم ملف المُثبِّت عادةً بين ٢٠٠ و٤٠٠ ميجابايت. شغّله واتبع معالج الإعداد. وسيتم تثبيت LM Studio تلقائيًّا في C:\Users\[اسم_المستخدم]\AppData\Local\LM-Studio افتراضيًّا. أما النماذج فتُنزَّل تلقائيًّا إلى C:\Users\[اسم_المستخدم]\.cache\lm-studio\models ما لم تغيّر المسار يدويًّا في الإعدادات.

لتحقيق تسريع باستخدام وحدة معالجة الرسومات (GPU) في أنظمة Windows، تحتاج إلى برامج تشغيل NVIDIA الإصدار ٥٢٢.٠٦ أو أحدث لدعم CUDA. وسيكتشف LM Studio تلقائيًّا وحدة معالجة الرسومات لديك ويستفيد منها إن كانت متاحة.

macOS

نزّل .dmg ملف lmstudio.ai. افتحه واسحب أيقونة LM Studio إلى مجلد التطبيقات (Applications). وتُنزَّل النماذج افتراضيًّا إلى ~/Library/Application Support/LMStudio/models .

تتلقّى أجهزة ماك المزوّدة بشريحة Apple Silicon (M1، M2، M3، M4) تسريعًا تلقائيًّا عبر تقنية Metal. أما أجهزة ماك المزوّدة بمعالجات Intel فتعتمد على الاستنتاج عبر وحدة المعالجة المركزية (CPU)، وهي أبطأ بكثير لكنها تعمل بشكل كافٍ مع النماذج الصغيرة.

لينكس

نزّل .AppImage ملف. اجعله قابلاً للتنفيذ باستخدام الأمر chmod +x LM-Studio-*.AppImage، ثم شغّله بالأمر ./LM-Studio-*.AppImage. وتُنزَّل النماذج افتراضيًّا إلى ~/.cache/lm-studio/models.

لتحقيق تسريع باستخدام وحدة معالجة الرسومات من نوع NVIDIA، ثبّت حزمة أدوات CUDA الإصدار ١١.٨ أو أحدث، وتأكد من أن الأمر nvidia-smi يعرض وحدة معالجة الرسومات لديك. وسيكتشف LM Studio دعم CUDA تلقائيًّا.

تنزيل النماذج وتحميلها

يستخدم LM Studio تنسيق GGUF، وهو تنسيق نماذج مكمّم يقلّل من متطلبات الذاكرة مع الحفاظ على الجودة. عند فتح التطبيق، انقر على أيقونة البحث في الشريط الجانبي الأيسر لتصفح النماذج. ويقوم محرك البحث المدمج باستعراض النماذج من Hugging Face وفلترتها تلقائيًّا لعرض الملفات المتوافقة بصيغة GGUF فقط.

ابحث عن نموذج باستخدام اسمه (مثل «llama 3.1» أو «mistral» أو «phi»). ويعرض كل نتيجة عدة مستويات تكميم، مُوسومة مثل Q4_K_M, Q5_K_Sأو Q8_0. ويشير الرقم إلى عمق البت — فـ Q4 يستخدم ٤ بت لكل وزن، بينما يستخدم Q8 ثمانية بت. وكلما انخفض الرقم، قلّ حجم الملف وازدادت سرعة الاستنتاج، لكن الجودة قد تتناقص قليلًا.

في معظم الحالات العملية، Q4_K_M أو Q5_K_M يقدّم أفضل توازن بين الأداء والكفاءة. ويمكنك استخدام حاسبة الذاكرة VRAM لتقدير كمية الذاكرة المطلوبة لنموذج معين وبمستوى تكميم معيّن. وفيما يلي دليل تقريبي:

حجم النموذجالذاكرة المطلوبة لـ Q4_K_M (VRAM)الذاكرة المطلوبة لـ Q5_K_M (VRAM)الذاكرة المطلوبة لـ Q8_0 (VRAM)
نموذج بـ ٧ مليار معلمة (7B)حوالي ٥ جيجابايتحوالي ٦ جيجابايتحوالي ٩ جيجابايت
نموذج بـ ١٣ مليار معلمة (13B)حوالي ٩ جيجابايتحوالي ١١ جيجابايتحوالي ١٦ جيجابايت
نموذج بـ ٣٤ مليار معلمة (34B)حوالي ٢٢ جيجابايتحوالي ٢٧ جيجابايتحوالي ٤٠ جيجابايت
نموذج بـ ٧٠ مليار معلمة (70B)حوالي ٤٢ جيجابايتحوالي ٥١ جيجابايتحوالي ٧٥ جيجابايت

انقر على أيقونة التنزيل بجانب مستوى التكميم الذي اخترته. وتتراوح أحجام النماذج بين ٣ جيجابايت و٥٠ جيجابايت فأكثر حسب حجم النموذج. وبعد الانتهاء من التنزيل، انقر على اسم النموذج في مكتبتك لتحميله. وسيعرض LM Studio كمية الذاكرة المخصصة من وحدة معالجة الرسومات (GPU) والذاكرة العشوائية (RAM) في الزاوية السفلى اليمنى. وإذا لم يسع النموذج بالكامل في ذاكرة وحدة معالجة الرسومات، فسيُحمّل بعض طبقاته في الذاكرة العشوائية للنظام، ما يؤدي إلى إبطاء عملية الاستنتاج بشكل ملحوظ.

استخدام واجهة الدردشة

بعد تحميل النموذج، تظهر واجهة الدردشة في النافذة الرئيسية. اكتب مُهمتك في مربع النص الموجود في الأسفل ثم اضغط على مفتاح Enter أو انقر على أيقونة الإرسال. ويولِّد النموذج الرد محليًّا—ولا يتطلب اتصالاً بالإنترنت بعد التحميل.

أبرز الضوابط:

  • شريط تمرير درجة الحرارة (Temperature) (في الشريط الجانبي الأيمن): يتحكم في عامل العشوائية. استخدم القيم من ٠٫١ إلى ٠٫٣ للمهام الواقعية، ومن ٠٫٧ إلى ١٫٠ للكتابة الإبداعية.
  • أقصى عدد للرموز (Max tokens): يحدّ من طول الرد. والقيمة الافتراضية عادةً ما تكون ٢٠٤٨؛ ويمكنك زيادتها للحصول على نواتج أطول.
  • مُهمة النظام (System prompt): تُحدِّد سلوك النموذج وهويته. انقر على زر «تحرير» في الشريط العلوي لتعديلها.
  • متتاليات الإيقاف (Stop sequences): رموز تُوقِف عملية التوليد مبكرًا، وهي مفيدة عند الحاجة إلى تنسيقات خرج منظمة.

يدعم LM Studio المحادثات متعددة الدورات (multi-turn conversations). ويظل كل رسالة ضمن السياق حتى تنقر على «محادثة جديدة» (New Chat) أو يمتلئ نافذة السياق. وتتراوح سعة نافذة السياق لدى معظم النماذج بين ٤٠٠٠ و٣٢٠٠٠ رمزًا—راجع بطاقة النموذج لمعرفة التفاصيل الخاصة به.

تشغيل خادم واجهة برمجية محلي

يتضمن LM Studio خادم واجهة برمجية (API) متوافقًا مع OpenAI، ما يسمح لك باستخدام النماذج المحلية كبدائل جاهزة لـ GPT-4 أو GPT-3.5 في التطبيقات الحالية. انقر على الأيقونة في الشريط الجانبي الأيسر لفتح تبويب الخادم المحلي (Local Server).

اختر نموذجًا محملًا من القائمة المنسدلة ثم انقر على «بدء الخادم» (Start Server). ويُشغل الخادم افتراضيًّا على العنوان http://localhost:1234 . وتعرض واجهة المستخدم مثالاً على كود:

curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{
    "model": "local-model",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

أي أداة تدعم تنسيق واجهة برمجية OpenAI تعمل مع خادم LM Studio. عيِّن عنوان URL الأساسي (base URL) إلى http://localhost:1234/v1 واستخدِم أي سلسلة غير فارغة كمفتاح API (لا يقوم LM Studio بالتحقق من صحته). ويشمل ذلك:

  • LangChain (بايثون/جافاسكريبت): عيِّن المعلَّمة openai_api_base إلى localhost
  • حزمة OpenAI Python SDK: openai.api_base = "http://localhost:1234/v1"
  • محررات النصوص المزودة بميزات الذكاء الاصطناعي (مثل Cursor وContinue وCody): وجِّهها إلى localhost في إعداداتها
  • النصوص البرمجية المخصصة (Custom scripts): استبدل https://api.openai.com/v1 مع http://localhost:1234/v1

يدعم الخادم الاستجابات التدفقية (streaming responses) والاستدعاء الوظيفي (function calling) — إن كان النموذج مدربًا على هذه الميزة. وراجع السجلات (logs) في تبويب الخادم لتصحيح الأخطاء في الطلبات.

التكوين وإعدادات الأجهزة

انقر على أيقونة الترس (الإعدادات) في الزاوية السفلى اليسرى لضبط ما يلي:

  • مسار مجلد النموذج (Model folder path): غيِّر الموقع الذي تُحمَّل إليه النماذج وتُستخرج منه.
  • عدد الطبقات المحولة إلى وحدة معالجة الرسومات (GPU offload layers): يتحكم في عدد الطبقات التي تُنفَّذ على وحدة معالجة الرسومات مقابل وحدة المعالجة المركزية. ويعمل الكشف التلقائي (Auto-detect) بكفاءة عالية، لكن التعديل اليدوي قد يكون مفيدًا إذا كنت تشغل برامج متعددة في وقت واحد.
  • تجاوز طول السياق (Context length override): زِدْه إن دعم النموذج ذلك واحتاجت محادثاتك إلى سياق أطول. وكلما زاد طول السياق، زاد استهلاك ذاكرة VRAM.
  • عدد خيوط الاستنتاج (Inference threads): عدد خيوط وحدة المعالجة المركزية المُخصصة لعملية الاستنتاج. والقيمة الافتراضية هي «تلقائي» (auto)، لكن ضبطها على عدد النوى الفيزيائية (وليس النوى المُفرطة عبر تقنية Hyperthreading) قد يحسّن الأداء.

لتحقيق أفضل أداء، أغلق التطبيقات الأخرى التي تستهلك وحدة معالجة الرسومات بشدة (مثل الألعاب وبرامج تحرير الفيديو والتصميم ثلاثي الأبعاد) قبل تحميل النماذج الكبيرة. وعلى أجهزة اللابتوب، تأكَّد من توصيلها بالطاقة وضبط وضع الطاقة على «أداء عالٍ»— إذ يؤثر خفض تردد وحدة المعالجة المركزية أو وحدة معالجة الرسومات (CPU/GPU throttling) تأثيرًا كبيرًا على سرعة الاستنتاج.

LM Studio مقابل Ollama

يُجرّب كلٌّ من LM Studio و Ollama تشغيل النماذج محليًّا، لكنهما يختلفان في واجهة المستخدم وتدفق العمل:

الميزةLM StudioOllama
الواجهةواجهة المستخدم الرسومية لسطح المكتبواجهة سطر الأوامر + واجهة برمجية (CLI + API)
اكتشاف النماذجمتصفح مضمنسجل نماذج منفصل
الصيغةملفات GGUFتنسيق مخصص (يحوّل من ملفات GGUF)
التحكم في التكمين (Quantization control)اختيار تكمين معيّنتلقائي
واجهة دردشة (Chat UI)مضمنةغير متوفرة (استخدم أدوات خارجية)
منحنى التعلُّممنخفضة (بصرية)أكثر حدة (عبر سطر الأوامر)

استخدم LM Studio إذا كنت تفضل واجهة مرئية، والتحكم المباشر في ملفات النماذج، ولا ترغب في استخدام سطر الأوامر. واستخدم Ollama إذا كنت تفضل سير العمل عبر سطر الأوامر، أو تبحث عن خادم خفيف الوزن، أو تقوم بإدماجه في خط أنابيب برمجي. وكلا الأداتين مجانيتان وتتعاملان مع تسريع وحدة معالجة الرسومات بنفس الكفاءة. راجع دليلنا المفصّل دليل النماذج المحلية للحصول على توصيات مُقترحة تعمل مع أي من هاتين الأداتين.

اختيار النماذج المناسبة لـ LM Studio

يعتمد النموذج الذي تختاره على مواصفات جهازك وحالات الاستخدام المطلوبة. راجع دليلنا قاعدة بيانات نماذج الذكاء الاصطناعي لمقارنة المواصفات ومتطلبات ذاكرة VRAM عبر أكثر من ٣٧ نموذجًا.

لأجهزة ذات ذاكرة VRAM تتراوح بين ٨ و١٦ جيجابايت: Llama 3.1 بسعة 8 مليار معلَّمة, Mistral 7BPhi-3 Medium (14B). وهي تُؤدّي مهام الدردشة العامة، وتقديم المساعدة في البرمجة، والتلخيص بكفاءة عالية.

للوحدات ذات سعة VRAM تبلغ 24 جيجابايت: Llama 3.1 70B (كمّية Q3)، Mixtral 8x7B، Command R+ 35B (كمّية Q4). وتشكّل هذه النماذج قفزةً كبيرةً في الجودة فيما يتعلّق بالاستنتاج والتعليمات المعقدة.

للوحدات ذات سعة VRAM تبلغ 48 جيجابايت فأكثر: Llama 3.1 405B (كمّية Q3)، Qwen 2.5 72B (كمّية Q5). وتقدّم أداءً يقترب من الحدود الأمامية في معظم المهام.

إذا كنت غير متأكدٍ مما إذا كان النموذج يناسب أجهزتك أم لا، فاستخدم حاسبة الذاكرة VRAM قبل التنزيل. فالنموذج الذي يشغل الذاكرة تقريبًا سيُحوّل جزءًا من حمله إلى الذاكرة العشوائية (RAM)، ما يؤدي إلى خفض سرعة التشغيل بنسبة تتراوح بين 5 و10 أضعاف مقارنةً بتشغيله الكامل داخل ذاكرة VRAM.

الأسئلة الشائعة

هل يعمل LM Studio دون اتصال بالإنترنت؟

نعم، تمامًا. فتحتاج إلى الاتصال بالإنترنت فقط لتنزيل النماذج في البداية، وبعد تنزيلها، يعمل LM Studio دون أي اتصال شبكي. كما تعمل النماذج وعملية الاستنتاج وخادم واجهة البرمجة المحلية (API) كلها دون اتصال. وهذا يجعله مناسبًا للبيئات المعزولة تمامًا (air-gapped) أو للعمل في غياب الاتصال الشبكي.

هل يمكنني استخدام نماذج LM Studio في تطبيقاتي الخاصة؟

نعم. ابدأ خادم واجهة البرمجة المحلية (local API server) داخل LM Studio، ثم وجّه تطبيقك إلى http://localhost:1234/v1. وأي كودٍ يستخدم تنسيق واجهة برمجة تطبيقات OpenAI سيعمل دون الحاجة إلى أي تعديل. كما يمكنك تحميل ملفات GGUF مباشرةً في كودك باستخدام مكتبات مثل llama.cpp, llama-cpp-pythonأو ctransformers— فملفات النماذج التي يُنزّلها LM Studio هي ملفات GGUF قياسية مخزَّنة في مجلد التخزين المؤقت (cache folder) الخاص بك.

ما تكلفة LM Studio؟

LM Studio مجاني تمامًا. فلا توجد رسوم اشتراك، ولا رسوم على واجهة البرمجة (API)، ولا حدود على الاستخدام. كما أن النماذج نفسها مجانية أيضًا — ومعظمها مفتوحة المصدر ومرخّصة بموجب رخص مرنة (مثل رخصة MIT، ورخصة Apache 2.0، ورخصة مجتمع Llama 3.1). أما التكاليف الوحيدة التي قد تتكبّدها فهي تكاليف الأجهزة والطاقة الكهربائية. ويمكنك استخدام حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لمقارنة تكاليف الاستنتاج المحلي مع أسعار واجهات برمجة التطبيقات السحابية.

لماذا يتباطأ الاستنتاج على جهازي؟

هناك ثلاثة أسباب شائعة: (1) لا تتسع ذاكرة VRAM لاستيعاب النموذج بالكامل، فيتم تحويل جزء منه إلى الذاكرة العشوائية (RAM) — تحقّق من عرض الذاكرة في واجهة LM Studio، وجرب استخدام كمّية أقل (quantization) أو نموذجًا أصغر. (2) لم يتم اكتشاف وحدة معالجة الرسومات (GPU) — تأكّد من تحديث برامج التشغيل (في أنظمة Windows/Linux)، أو من أنك تستخدم معالج Apple Silicon (في أنظمة macOS). (3) خفض أداء وحدة المعالجة المركزية (CPU throttling) في أجهزة اللابتوب — وصِل الجهاز بمصدر طاقة وعيّن وضع الأداء إلى «عالي الأداء». وتزداد سرعة الاستنتاج تقريبًا بشكل طردي مع عرض نطاق نقل بيانات ذاكرة VRAM، لذا ستكون بطاقات الرسومات القديمة أو المخصصة للأجهزة المحمولة أبطأ من بطاقات سطح المكتب حتى لو كانت سعة ذاكرتها كافية.

هل يمكنني ضبط النماذج أو تدريبها داخل LM Studio؟

لا. فـ LM Studio مخصص فقط للاستنتاج (inference-only)؛ فهو يقوم بتحميل النماذج المدرّبة مسبقًا وتشغيلها، لكنه لا يدعم عمليات التدريب أو الضبط الدقيق (fine-tuning). وللقيام بهذه العمليات، تحتاج إلى إطارات عمل متخصصة في التدريب مثل Axolotl أو Hugging Face Transformers أو MLX (لأجهزة Apple Silicon). ويمكنك ضبط نموذج ما في مكان آخر، ثم تصديره بصيغة GGUF، وبعدها تحميل هذا النموذج المُعدّل في LM Studio.

ما الفرق بين التسميات المختلفة للكمّية مثل Q4_K_M وQ5_K_S وغيرها؟

الرقم (Q4، Q5، Q8) يشير إلى عدد البتات لكل وزن — وكلما انخفض الرقم، قلّ حجم النموذج وازدادت سرعته، بينما كلما ارتفع، زادت دقته. أما الجزء التالي من التسمية فيدلّ على طريقة الكمّية المستخدمة: K_M (متوسطة، متوازنة)، K_S (صغيرة، ضغط أكثر حزمًا)، K_L (كبيرة، تحافظ على دقة أعلى). ولمعظم المستخدمين، فإن Q4_K_M أو Q5_K_M هي النقطة المثلى. واستخدم Q2 أو Q3 فقط إذا كانت سعة VRAM محدودة للغاية؛ إذ تنخفض الجودة بشكل ملحوظ عند استخدامهما. أما Q8 فهي قريبة من الدقة الكاملة، لكنها لا تقدّم تحسّنًا ملحوظًا في الجودة مقارنةً بـ Q5 في معظم المهام، رغم أنها تتطلب ضعف سعة VRAM.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That