Tuesday, 1 September 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

أولاما على ويندوز: دليل التثبيت وتعليمات الإعداد

باختصار:

  • حمِّل برنامج التثبيت الرسمي من ollama.com/download، ثم شغِّله، وسيتم تثبيت أولاما كخدمة تعمل في الخلفية
  • يتطلب ويندوز 10 أو أحدث، وبحد أدنى 8 غيغابايت من الذاكرة العشوائية (RAM)؛ كما يتم اكتشاف وحدات معالجة الرسومات من نوع NVIDIA/AMD تلقائياً لتسريع الأداء
  • شغِّل النماذج باستخدام الأمر ollama run <model> من موجه الأوامر (Command Prompt) أو PowerShell — ولا حاجة لأي إعداد إضافي
  • يتم تثبيت النماذج افتراضياً في المجلد %USERPROFILE%.ollamamodels يمكنك تغيير هذا المسار عبر متغير البيئة OLLAMA_MODELS متغير البيئة

أولاما على ويندوز هو تطبيق أصلي يقوم بتشغيل نماذج اللغات الكبيرة محلياً دون الحاجة إلى Docker أو WSL2. ويقوم برنامج التثبيت الخاص لويندوز بإعداد أولاما كخدمة نظام تبدأ تلقائياً وتوفِّر تسريع الأداء عبر DirectML وCUDA. ويستغرق التثبيت أقل من دقيقتين، ويمكنك تشغيل نماذج مثل Llama 3.3 70B أو Mistral 7B فوراً من سطر الأوامر.

المتطلبات النظامية لأولاما على ويندوز

يتطلب أولاما ويندوز 10 (البناء 1903 أو أحدث) أو ويندوز 11. وأدنى مواصفات مادية مطلوبة هي:

مكون الحد الأدنى المُوصى به
نظام التشغيل ويندوز 10 (1903+) ويندوز 11
الذاكرة العشوائية (RAM) 8 جيجابايت 16 غيغابايت أو أكثر
مساحة القرص 10 جيجابايت فارغة 50 غيغابايت فأكثر لعدة نماذج
وحدة معالجة رسومات (اختياري) NVIDIA GTX 1050 أو ما يعادلها من AMD NVIDIA RTX 3060 بسعة 12 غيغابايت أو أفضل

يعمل تسريع الأداء عبر وحدة معالجة الرسومات مع وحدات NVIDIA (CUDA 11.8 أو أحدث) ومع وحدات AMD الحديثة (عبر ROCm على ويندوز). ويشمل برنامج التثبيت المكتبات اللازمة لوحدات معالجة الرسومات، لذا لا حاجة لتثبيت CUDA بشكل منفصل. وفي حالة عدم توفر وحدة معالجة رسومات، يعود أولاما تلقائياً إلى الاستنتاج عبر وحدة المعالجة المركزية (CPU)، وهي أبطأ بخمسة إلى عشرة أضعاف، لكنها تظل قابلة للعمل مع النماذج الأصغر.

يتحدد حجم الذاكرة العشوائية (RAM) أو ذاكرة وحدة معالجة الرسومات (VRAM) المطلوبة فعلياً وفقاً لحجم النموذج. فعلى سبيل المثال، Mistral 7B يتطلب حوالي 4.5 غيغابايت من VRAM عند التكمين (quantization) بـ4 بت، بينما يتطلب Llama 3.3 70B نحو 40 غيغابايت. راجع حاسبة الذاكرة VRAM لتقييم المتطلبات الخاصة بأي نموذج قبل تنزيله.

تثبيت أولاما على ويندوز

برنامج التثبيت الرسمي لويندوز عبارة عن ملف تنفيذي واحد يتعامل مع جميع التبعيات:

  1. تنزيل OllamaSetup.exe من ollama.com/download
  2. شغِّل برنامج التثبيت — ويجب أن تكون لديك صلاحيات المسؤول (administrator)
  3. اقبل اتفاقية الترخيص ثم انقر على زر التثبيت (الموقع الافتراضي هو C:\Program Files\Ollama)
  4. يُكمل البرنامج التثبيت خلال 30–60 ثانية، ويبدأ خدمة أولاما تلقائياً

بعد التثبيت، افتح موجه الأوامر (Command Prompt) أو PowerShell وتحقق من التثبيت باستخدام الأمر التالي:

ollama --version

يجب أن ترى مخرجات مثل ollama version 0.x.x. وتستمر خدمة أولاما في العمل في الخلفية — وستظهر أيقونة أولاما في شريط المهام (system tray) عندما تكون الخدمة نشطة.

دعم وحدات معالجة الرسومات واكتشافها

يكتشف أولاما تلقائياً وحدات معالجة الرسومات المتاحة على ويندوز ويستخدمها. وللتأكد من أن تسريع الأداء عبر وحدة معالجة الرسومات يعمل بالفعل:

ollama run llama3.3:70b "test"

بينما يتم تحميل النموذج، راقب «مدير المهام» (Task Manager) في علامة التبويب «الأداء» (Performance). وإذا ظهرت نسبة الاستخدام تحت GPU 0 أو GPU 1، فهذا يعني أن التسريع نشط. ويتم في الجولة الأولى تنزيل النموذج (بحجم يتراوح بين 5 و40 غيغابايت حسب حجمه) إلى المجلد %USERPROFILE%.ollamamodels، وقد يستغرق ذلك عدة دقائق على الاتصالات البطيئة.

يحصل مستخدمو NVIDIA الذين يستخدمون وحدات معالجة رسومات RTX 3060 أو أحدث على أفضل أداء بسبب سعة VRAM التي تبلغ 12 غيغابايت أو أكثر، والتحسينات المبنية على معمارية Ampere/Ada. أما دعم وحدات معالجة الرسومات من AMD على ويندوز فهو في تحسن مستمر، لكنه لا يزال يتخلف عن NVIDIA — وتتوقع أبطأ بنسبة 20–30% في الاستنتاج مقارنةً بوحدات AMD المكافئة. ولا يدعم أولاما وحدات معالجة الرسومات من Intel Arc رسمياً حتى سبتمبر 2026.

إذا لم يكتشف أولاما وحدة معالجة الرسومات الخاصة بك، فتحقق من أن برامج تشغيل وحدة معالجة الرسومات محدثة (NVIDIA: الإصدار 537.13 أو أحدث، AMD: Adrenalin 23.11 أو أحدث). وغالباً ما تشير رسائل الخطأ في أولاما إلى ما إذا كانت وحدة معالجة الرسومات قد تم تجاوزها بسبب نقص VRAM أو غياب برامج التشغيل.

تشغيل أول نموذج لك

الـ ollama run يقوم الأمر التالي بتنزيل النموذج وتحميله وبدء جلسة تفاعلية معه:

ollama run phi4

وهذا يُنزِّل نموذج Microsoft Phi-4 (الذي يحتاج نحو 9 غيغابايت من VRAM عند التكمين بـ4 بت) ويفتح موجه دردشة. اكتب سؤالك واضغط Enter ليُجيبك النموذج محلياً. وللخروج، استخدم الأمر /bye أو Ctrl+C.

من أبرز النماذج التي يمكنك تجربتها على أجهزة ويندوز:

النموذج ذاكرة الفيديو (VRAM) بتنسيق 4 بت الأفضل لـ
Mistral 7B ~4.5 غيغابايت مهام عامة واستجابات سريعة
Llama 3.1 8B ~5 غيغابايت جودة وسرعة متوازنتان
Phi-4 ~٩ جيجابايت الاستنتاج، الحجم المدمج
Llama 3.3 70B ~40 جيجابايت بطاقات الرسوميات عالية الأداء، أفضل جودة

تصفح النماذج المتاحة على قائمة نماذج Ollama أو ابحث في المكتبة باستخدام ollama list بعد سحب نموذج واحد على الأقل.

التكوين ومتغيرات البيئة

يقرأ Ollama التهيئة من متغيرات بيئة نظام Windows. قم بتعيين هذه المتغيرات في خصائص النظام → متغيرات البيئة أو في PowerShell باستخدام الأمر $env:VARIABLE_NAME.

المتغيرات الرئيسية:

  • OLLAMA_MODELS: دليل تخزين النماذج (الافتراضي: %USERPROFILE%.ollamamodels). غيّر هذا إذا كانت مساحة القرص C لديك محدودة.
  • OLLAMA_HOST: عنوان الخادم (الافتراضي: 127.0.0.1:11434). عيّنه إلى 0.0.0.0:11434 لقبول الاتصالات الشبكية.
  • OLLAMA_NUM_PARALLEL: عدد الطلبات المتزامنة (الافتراضي: 1). زِد هذه القيمة إذا كنت تُخدِّم عدة عملاء في آنٍ واحد.
  • OLLAMA_MAX_LOADED_MODELS: عدد النماذج المحتفظ بها في ذاكرة VRAM (الافتراضي: 1). عيّنها إلى 2 أو أكثر إذا كانت لديك ذاكرة VRAM سعة 24 جيجابايت فأكثر، وترغب في التبديل الفوري بين النماذج.

بعد تعديل متغيرات البيئة، أعد تشغيل خدمة Ollama من «الخدمات» (اضغط Win+R واكتب services.msc، ثم ابحث عن Ollama وانقر عليه بزر الماوس الأيمن واختر «إعادة التشغيل») أو أعد تشغيل النظام بالكامل.

لنقل النماذج إلى قرص مختلف، عيّن المتغير OLLAMA_MODELS ثم أعد تشغيل الخدمة. ويجب إعادة سحب النماذج الموجودة مسبقًا يدويًّا — فـ Ollama لا يقوم بنقلها تلقائيًّا.

ضبط الأداء

تعتمد سرعة الاستنتاج على سعة ذاكرة VRAM وحجم النموذج ومستوى التكميم. فعلى سبيل المثال، يُولِّد نموذج بحجم 7 مليار معامل (7B) عند تكميم 4 بت ما بين 30–60 رمزًا في الثانية على بطاقة RTX 3060، بينما تنخفض السرعة إلى 3–8 رموز في الثانية للنماذج ذات حجم 70 مليار معامل (70B)، ما لم تكن تمتلك 48 جيجابايت أو أكثر من ذاكرة VRAM عبر عدة بطاقات رسوميات.

تعمل إعدادات البطاقات الرسومية المتعددة تلقائيًّا — حيث يقوم Ollama بتوزيع طبقات النموذج تلقائيًّا عبر البطاقات الرسومية المكتشفة. فمثلًا، يمكن لبطاقتَي RTX 3090 (24 جيجابايت لكل منهما) تشغيل نموذج Llama 3.3 70B بسرعة مقبولة، بينما ستؤدي بطاقة واحدة من نوع RTX 3090 إلى نقل بعض الطبقات إلى ذاكرة النظام RAM مما يؤدي إلى تباطؤ شديد في الأداء.

إذا كان الأداء أبطأ مما هو متوقع:

  • افتح «مدير المهام» أثناء عملية الاستنتاج — فإذا تجاوزت نسبة استخدام وحدة المعالجة المركزية (CPU) 30% فهذا يعني أن جزءًا من النموذج موجود في ذاكرة النظام بسبب نقص ذاكرة VRAM
  • جرّب تكميمًا أصغر (مثل: ollama pull mistral:7b-instruct-q4_K_M بدلًا من التكميم الافتراضي Q8)
  • أغلق التطبيقات الأخرى التي تستخدم وحدة معالجة الرسومات (مثل المتصفحات التي تدعم التسارع المادي، والألعاب، وبرامج تحرير الفيديو)
  • حدّث برامج تشغيل وحدة معالجة الرسومات — فتوفر أحدث برامج تشغيل NVIDIA تحسينًا في سرعة الاستنتاج بنسبة 5–10% مقارنة بالإصدارات القديمة التي يزيد عمرها عن 6 أشهر

لترقية الأجهزة، راجع أفضل وحدات معالجة الرسوميات لتشغيل نماذج اللغة الكبيرة محليًّا الدليل الموجّه للمقارنة بين العائد مقابل السعر عبر خيارات NVIDIA وAMD.

التكامل مع التطبيقات

يقدّم Ollama واجهة برمجة تطبيقات REST على localhost:11434 متوافقة مع هيكل واجهة برمجة تطبيقات OpenAI. ويمكن للتطبيقات التي تدعم نقاط النهاية المتوافقة مع OpenAI أن تتصل بـ Ollama مع إدخال تغييرات طفيفة جدًّا.

مثال على أمر curl لتوليد نص:

curl http://localhost:11434/api/generate -d '{
  "model": "mistral",
  "prompt": "اشرح Docker في جملة واحدة"
}'

تشمل التكاملات الشائعة Open WebUI (واجهة ويب)، وContinue.dev (إضافة لبرنامج VS Code)، وLangChain (لغة Python). ويجب أن تكون خدمة Ollama قيد التشغيل لكي تعمل استدعاءات واجهة برمجة التطبيقات — وهي تبدأ تلقائيًّا عند بدء تشغيل النظام افتراضيًّا.

الأسئلة الشائعة

هل يتطلب أولاما WSL2 أو Docker على ويندوز؟

لا. برنامج التثبيت الخاص بويندوز هو تطبيق أصلي يعمل أولاما كخدمة ويندوز دون الحاجة إلى الافتراضية أو الحاويات. كانت الإصدارات السابقة تتطلب Docker، لكن الإصدار الأصلي لويندوز ألغى هذه المتطلبات في أواخر عام 2024. إذا كنت قد ثبَّتَ أولاما قبل نوفمبر 2024، فقم بإزالة إصدار Docker ثم حمِّل أحدث برنامج تثبيت أصلي.

هل يمكنني استخدام أولاما دون اتصال بالإنترنت بعد تنزيل النماذج؟

نعم. وبمجرد سحب نموذج باستخدام الأمر ollama pull <model>، يتم تخزينه محليًّا ويُشغَّل دون الحاجة إلى اتصال بالإنترنت. والشرط الوحيد الذي يتطلب الاتصال بالشبكة هو التنزيل الأولي — وتتراوح أحجام النماذج بين 2 جيجابايت (للنماذج الصغيرة بحجم 7 مليار معامل) و80 جيجابايت أو أكثر (للنماذج الكبيرة بحجم 70 مليار معامل فأكثر). وبعد التنزيل، يمكنك فصل الجهاز عن الشبكة وسيستمر Ollama في العمل بشكل طبيعي.

ما تكلفة تشغيل نماذج أولاما مقارنةً بواجهات برمجة التطبيقات (API)؟

Ollama مجاني تمامًا — فأنت تدفع فقط مقابل الأجهزة والكهرباء. قارن ذلك بتكلفة واجهات برمجة التطبيقات الخارجية: Claude Sonnet 5 يفرض رسومًا قدرها 2.00 دولار أمريكي لكل مليون رمز مُدخل، وبالتالي فإن معالجة 10 ملايين رمز (ما يعادل تقريبًا 7.5 ملايين كلمة) تكلف 20 دولارًا أمريكيًّا. أما الإعداد الذاتي (self-hosted) فيصبح مربحًا بسرعة كبيرة إذا كنت تعالج كميات كبيرة من البيانات. واستخدم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لحساب نقطة التعادل الخاصة بك استنادًا إلى حجم الاستخدام المتوقع.

أي النماذج تعمل بشكل أفضل على وحدات معالجة الرسومات الاستهلاكية (GPU)؟

بالنسبة لوحدات معالجة الرسومات التي تتراوح سعة ذاكرة VRAM فيها بين 8–12 جيجابايت (مثل RTX 3060 وRTX 4060 Ti)، فإن نماذج Mistral 7B (~4.5 جيجابايت عند تكميم 4 بت) وLlama 3.1 8B (~5 جيجابايت) وPhi-4 (~9 جيجابايت) توفر نسبًا ممتازة بين الجودة والأداء. أما إذا كانت لديك سعة VRAM تتراوح بين 16–24 جيجابايت (مثل RTX 3090 وRTX 4090)، فيصبح من الممكن تشغيل نماذج مثل Mistral NeMo 12B (~7.5 جيجابايت) بل وحتى Llama 3.3 70B (~40 جيجابايت مع تكميم عدواني جدًّا أو نقل الطبقات إلى الذاكرة الرئيسية). راجع متطلبات ذاكرة VRAM حسب النموذج للحصول على قائمة كاملة.

هل يمكن لأولاما استخدام وحدتي معالجة رسومات من نوع NVIDIA وAMD في وقتٍ واحد؟

لا. يستخدم أولاما إما CUDA (لـNVIDIA) أو ROCm (لـAMD) حسب ما يكتشفه أولاً، لكنه لا يمكنه دمج محركات وحدات معالجة الرسومات المختلفة في جلسة واحدة. فإذا كانت لديك وحدتا معالجة رسومات من نوع NVIDIA وAMD معاً، فإن أولاما يُفضِّل وحدة NVIDIA. أما دعم وحدات معالجة الرسومات المتعددة فيعمل فقط عندما تستخدم جميع الوحدات نفس مجموعة برامج التشغيل — أي وحدتان من نوع NVIDIA أو وحدتان من نوع AMD، وليس واحدة من كل نوع.

كيف أقوم بـ إلغاء تثبيت Ollama من نظام Windows؟

افتح الإعدادات → التطبيقات → التطبيقات المثبتة، وابحث عن Ollama ثم انقر على «إلغاء التثبيت». ويؤدي هذا إلى إزالة التطبيق والخدمة، لكنه يترك النماذج في المجلد %USERPROFILE%.ollama. ولتحرير مساحة التخزين، احذف هذا المجلد يدويًّا. وإذا لم تتوقف الخدمة تلقائيًّا أثناء عملية الإلغاء، افتح «مدير المهام»، وابحث عن OllamaService.exe ضمن العمليات في الخلفية، وأنهِها قبل إعادة المحاولة.

الخطوات التالية

بعد تثبيت Ollama على نظام Windows، استكشف المكتبة الكاملة للنماذج على الدليل الكامل لـ Ollama لفهم كيفية تأثير اختيار النموذج والتكميم ونافذة السياق على الجودة. ولأحمال العمل الإنتاجية، احسب التكاليف المستمرة لواجهات برمجة التطبيقات مقابل الاستضافة الذاتية باستخدام حاسبة تكلفة واجهة برمجة التطبيقات (API) لتحديد ما إذا كانت عمليات الاستنتاج المحلية أم واجهات برمجة التطبيقات السحابية هي الأنسب لميزانيتك ومتطلبات التوسع.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى