Thursday, 23 July 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

ما هو أُولاما؟ الدليل الكامل لتشغيل نماذج اللغة الكبيرة محليًّا في عام 2026

محدّث · نُشِرت لأول مرة في 6 يونيو 2026

إذا كنت قد قضيت بعض الوقت في مجال الذكاء الاصطناعي المحلي خلال العامين الماضيين، فلا بد أنك سمعت بهذا الاسم. Ollama هي الأداة التي حولت عملية “تشغيل نموذج لغوي ضخم على جهازك الخاص” من عطلة نهاية أسبوع مليئة بأخطاء CUDA إلى أمر واحد فقط: تشغيل llama3.3.

يشرح هذا الدليل بالتفصيل ماهية Ollama، وكيفية عملها من الناحية الفنية، وما يمكنها وما لا يمكنها فعله، وما إذا كانت الأداة المناسبة لك في عام 2026.

Quick answer: What is Ollama and how does it work?

Ollama is a free, open-source tool that downloads, manages, and runs open large language models locally on Mac, Windows, or Linux with a single command — no cloud, no API keys, and no data leaving your machine. Under the hood it wraps the llama.cpp engine (plus Apple’s MLX on Mac since v0.19) and handles model downloads, quantization, and GPU allocation, then exposes a REST API on port 11434 that is OpenAI-compatible at /v1. One command like تشغيل llama3.3 pulls a model and gets you from install to a running model in about two minutes.

  • كيف تعمل: wraps llama.cpp (and Apple MLX on Mac since v0.19) and serves models over a local REST API — http://localhost:11434, OpenAI-compatible at /v1.
  • How to run a model: تشغيل llama3.3 downloads and starts the model in around two minutes — other picks include gemma4 و qwen3.
  • Hardware needed: the sweet spot is around 16 GB of VRAM or unified memory; budget roughly 0.6 GB of memory per billion parameters at Q4_K_M quantization.
  • What it can run: over 100 open models, from ~5 GB 7B models up to ~43 GB 70B models.
  • Cost and limits: $0 and MIT-licensed, fully private and offline — but not built for high-concurrency serving, where vLLM is roughly 16–20× faster under load.

أبرز النقاط المستخلصة

  • ما هي: أداة مجانية ومفتوحة المصدر تتيح تنزيل نماذج اللغة الكبيرة (LLMs) المفتوحة وإدارتها وتشغيلها محليًّا بأمر واحد — دون الحاجة إلى السحابة أو مفاتيح واجهة برمجة التطبيقات (API)، ودون أن تغادر البيانات جهازك.
  • كيف تعمل: إنه يلف الـ llama.cpp المحرك (وكذلك MLX من Apple على أجهزة Mac منذ الإصدار v0.19) ويتولى عمليات تنزيل النماذج، والتكمية، وتخصيص وحدة معالجة الرسومات (GPU)، وواجهة برمجة تطبيقات REST على المنفذ 11434.
  • الفئة المستهدفة: المطورون وهواة الابتكار الذين يبحثون عن الطريقة الأسهل لإنشاء نماذج أولية باستخدام نماذج محلية. إنها نقطة الانطلاق التي “تقلل الندم” في عام 2026.
  • من لا يُناسبه هذا المنتج: تقديم الخدمة في بيئة الإنتاج ذات التزامن العالي — ولهذا الغرض،, يكون أداء vLLM أسرع بنحو 16–20 ضعفًا تحت الحمل.
  • التكلفة: $0. وهو مرخص بموجب ترخيص MIT ويعمل بالكامل على أجهزتك.

ما هو «أولاما» في الواقع؟

Ollama هي بيئة تشغيل مفتوحة المصدر لنماذج اللغة الكبيرة (LLMs) تعمل على جهاز الكمبيوتر الخاص بك — سواء كان يعمل بنظام Mac أو Windows أو Linux. يمكنك اعتبارها بمثابة “Docker لنماذج اللغة الكبيرة”: فبدلاً من التعقيدات المرتبطة ببيئات Python وأوزان النماذج وبرامج تشغيل وحدة معالجة الرسومات (GPU)، ما عليك سوى كتابة أمر واحد ليبدأ النموذج في العمل.

الفكرة بسيطة: احتفظ ببياناتك على جهازك، ولا تدفع أي رسوم مقابل كل رمز، واعمل دون اتصال بالإنترنت. عند تشغيل ollama run gemma4, ، يقوم Ollama بتنزيل النموذج، وتحميله في ذاكرة وحدة معالجة الرسومات (GPU) الخاصة بك (أو ذاكرة الوصول العشوائي للنظام إذا لم تكن تمتلك وحدة معالجة رسومات)، ثم ينقلك إلى نافذة الدردشة. هذا كل شيء.

وراء هذه البساطة، يقوم «أولاما» بالكثير من العمل نيابة عنك:

  • إدارة النماذج — استخراج النماذج وإصدارها وتخزينها من سجلها، بالطريقة نفسها التي يتعامل بها مدير الحزم مع البرامج.
  • التكمين — استخدام الإصدارات المضغوطة (GGUF) من النماذج تلقائيًّا، بحيث يتسع النموذج الذي يحتوي على 27 مليار معلمة في ذاكرة الجهاز الاستهلاكي.
  • تخصيص طبقات وحدة معالجة الرسومات (GPU) — تحديد الجزء من النموذج الذي سيتم تشغيله على وحدة معالجة الرسومات (GPU) مقابل وحدة المعالجة المركزية (CPU)، بناءً على سعة ذاكرة الفيديو (VRAM) المتوفرة لديك.
  • السياق وإدارة ذاكرة التخزين المؤقتة KV — التعامل مع الذاكرة التي تتزايد حجمها كلما طالت المحادثة.
  • واجهة برمجة تطبيقات REST — الكشف عن كل شيء على http://localhost:11434 حتى تتمكن تطبيقاتك الخاصة من التواصل معه.

كيف يعمل الأمر من الناحية الفنية

Ollama ليس في حد ذاته محرك استدلال. إنه طبقة التجربة ملفوفة حول واحدة. أما تحت غطاء المحرك، فهي تستخدم llama.cpp, ، محرك C++ الذي يتولى العمليات الحسابية الفعلية لتشغيل النموذج المُكمَّن بكفاءة على وحدات المعالجة المركزية (CPU) ووحدات معالجة الرسومات (GPU). اعتبارًا من الإصدار v0.19 (مارس 2026)، يستخدم Ollama أيضًا البنية الخلفية MLX الخاصة بشركة آبل على Apple Silicon — وهو تغيير أدى إلى زيادة هائلة في السرعة (على معالج M5 Max يعمل بنظام Qwen 3.5، تضاعف معدل إنتاجية فك التشفير تقريبًا).

يبدو سير العمل كما يلي:

  1. تقوم بتنفيذ أمرأولاما ران كوين3 من واجهة المستخدم، أو طلب موجه إلى واجهة برمجة التطبيقات.
  2. يقوم برنامج «أولاما» بحل النموذج — إذا لم يكن قد تم تنزيله بعد، فإنه يستخرج قيم GGUF من السجل.
  3. يقوم بتحميل النموذج في الذاكرة — توزيع الطبقات بين وحدة معالجة الرسومات (GPU) ووحدة المعالجة المركزية (CPU) بناءً على سعة ذاكرة الفيديو (VRAM) المتاحة.
  4. وهي تعرض الردود — إما بشكل تفاعلي في محطة العمل الخاصة بك أو بتنسيق JSON عبر واجهة برمجة التطبيقات REST.

تعد واجهة برمجة التطبيقات (REST API) هذه هي الجزء الذي يهم المطورين أكثر من غيره. يمكن لأي تطبيق قادر على إرسال طلب HTTP استخدام نموذج محلي عبر Ollama — ونظرًا لأن Ollama أضافت نقطة نهاية متوافقة مع OpenAI، فإن الكثير من الأكواد الحالية تعمل بمجرد تغيير عنوان URL الأساسي.

ما يمكنك صنعه باستخدامه

تُعد «أولاما» المحرك الرئيسي وراء مجموعة ضخمة من مشاريع الذكاء الاصطناعي المحلية في عام 2026:

  • روبوتات الدردشة الخاصة التي لا ترسل أي بيانات إلى السحابة أبدًا.
  • مساعدو البرمجة — الأحدث ollama launch يقوم «كوماند» بربط أدوات مثل «كلود كود»،, OpenCode, ، و«Codex» إلى نموذج محلي أو سحابي دون الحاجة إلى ملفات التكوين.
  • أنظمة RAG استخدام واجهة برمجة تطبيقات (API) التضمين الدفعي من Ollama لفهرسة مستنداتك الخاصة.
  • الوكلاء والعمليات الآلية التي تستعين بنماذج محلية لأغراض التصنيف أو الاستخراج أو التلخيص بتكلفة هامشية صفرية.
  • خطوط إنتاج ذات مخرجات منظمة — أصبح بإمكان Ollama الآن تقييد مخرجات النموذج وفقًا لمخطط JSON، مما يجعله موثوقًا للاستخدام البرمجي.

مكانة «أولاما» بين البدائل الأخرى

لا يُعد «أولاما» الطريقة الوحيدة لتشغيل النماذج محليًّا، كما أنه ليس دائمًا الخيار الأفضل. وإليكم الصورة الحقيقية للأمور:

أداةالأفضل لـالمفاضلة
Ollamaإنشاء نماذج أولية بواسطة مطور واحد على أي نظام تشغيلبطء في ظل التزامن المكثف
LM Studioواجهة مستخدم رسومية أنيقة لتصفح ملفات العارضات والدردشة معهنأقل قابلية للبرمجة؛ يركز على أجهزة سطح المكتب أولاً
في إل إل إمخدمة إنتاج متعددة المستخدمين تعمل على وحدات معالجة الرسومات (GPUs)إعداد معقد؛ لا يعتمد على الموارد المحلية أولاً
llama.cppالسرعة القصوى والأجهزة المدمجة/الطرفيةأدنى مستوى؛ تقوم بتجميعه بنفسك

إذا كنت تعمل بمفردك، فإن Ollama تتفوق من حيث السهولة المطلقة. ولكن بمجرد أن تحتاج إلى خدمة العديد من المستخدمين في آن واحد، فسترغب في قراءة تحليلنا الكامل لـ أُولاما مقابل LM Studio مقابل vLLM مقابل llama.cpp.

البدء في غضون دقيقتين

حاجز الدخول ضئيل حقًّا:

  1. قم بتثبيته — قم بتنزيل التطبيق المناسب لنظام التشغيل الخاص بك (انظر دليل التثبيت التدريجي).
  2. استدعاء نموذج وتشغيلهollama run gemma4 لمن يبحث عن لاعب متعدد المواهب وقوي، أو أولاما ران كوين3 لأغراض البرمجة.
  3. تحدث إليه — الدردشة في المحطة الطرفية، أو توجيه تطبيقك إلى http://localhost:11434.

قبل اختيار طراز ما، تأكد من أن جهازك قادر على تشغيله — دليلك إلى متطلبات نظام أُولاما يحدد أحجام النماذج وفقًا لسعة ذاكرة الوصول العشوائي (RAM) وذاكرة الفيديو (VRAM) التي تحتاجها فعليًّا.

ما هي الأجهزة التي تحتاجها فعليًّا؟

سيعمل برنامج “أولاما” على أي جهاز تقريبًا مزود بمعالج وذاكرة وصول عشوائي (RAM) سعة 8 جيجابايت، لكن “تشغيله” و«إمكانية استخدامه بشكل عملي» مسألتان مختلفتان. الرقم الوحيد الذي يحدد تجربتك هو حجم الذاكرة التي يتسع لها النموذج، لأن النموذج بأكمله يجب أن يتواجد في ذاكرة الوصول العشوائي (أو، في الحالة المثالية، ذاكرة الفيديو الخاصة بوحدة معالجة الرسومات) أثناء تشغيله. وهناك قاعدة عامة موثوقة تقريبًا وهي 0.6 جيجابايت من الذاكرة لكل مليار معلمة بالتكمية الافتراضية Q4_K_M، مع ترك هامش صغير للسياق.

تمنحك هذه الحسابات دليلاً سريعاً لتحديد الأحجام بالنسبة لفئات الطرز الأكثر شيوعًا:

فئة النموذجحجم التنزيل التقريبي (Q4_K_M)ذاكرة مريحة
7–8B (Llama 3.x، Mistral)حوالي 5 غيغابايت8 جيجابايت فأكثر
13–14B (كوين، فاي)حوالي 9 جيجابايت16 جيجابايت فأكثر
32 مليار معلَّمةحوالي 20 جيجابايت24 جيجابايت فأكثر
70B (Llama 3.3)حوالي 43 جيجابايت64 جيجابايت فأكثر

بالنسبة لمعظم الناس، فإن الخيار الأمثل عمليًّا هو وحدة معالجة الرسومات (GPU) أو جهاز Mac بسعة تبلغ حوالي 16 جيجابايت من ذاكرة VRAM أو الذاكرة الموحدة — ما يكفي لتشغيل نماذج من فئة 7B إلى 14B بسرعات تبدو فورية. وتقع كل من بطاقة الرسومات من فئة RTX بسعة 16 جيجابايت وجهاز Mac المزود بمعالج Apple Silicon بسعة 16 جيجابايت ضمن هذه الفئة تمامًا.

هناك نقطتان هندسيتان مهمتان عند الاختيار. تفوز وحدة معالجة الرسومات (GPU) المنفصلة من NVIDIA بشكل قاطع كلما كان النموذج يتسع داخل ذاكرة VRAM الخاصة بها، مما يوفر أسرع معدل للرموز في الثانية. أما Apple Silicon، فـ الذاكرة الموحدة وهنا تكمن المفاضلة المعاكسة: فهو يتشارك كل ذاكرة الوصول العشوائي (RAM) الخاصة بالنظام مع وحدة معالجة الرسومات (GPU)، لذا يمكن لجهاز Mac بسعة 64 جيجابايت أو 128 جيجابايت تشغيل نماذج بحجم يتراوح بين 32B و70B، وهي نماذج لا يمكن تحميلها على بطاقات الرسومات الاستهلاكية — وإن كان ذلك بمعدل إنتاجية أقل. ويقع الحد الفاصل عند حوالي 24 جيجابايت.

أنت يمكن تشغيل Ollama بدون استخدام وحدة معالجة الرسومات (GPU) على الإطلاق. تتعامل وحدة المعالجة المركزية (CPU) الحديثة متعددة النوى مع نموذج بحجم 7B بمعدل عملي يتراوح بين بضعة رموز إلى رقم مزدوج منخفض في الثانية، لكن النماذج الكبيرة بحجم 70B على وحدة المعالجة المركزية (CPU) تنخفض إلى أقل من رمز واحد في الثانية — وهو أمر جيد للمهام الدفعية التي تُنفذ خلال الليل، لكنه مزعج بالنسبة للدردشة. إذا كانت السرعة التفاعلية مهمة، فإن تسريع وحدة معالجة الرسومات (GPU) أو Apple Silicon هو العامل الحاسم.

الأسئلة الشائعة

هل تطبيق Ollama مجاني؟

نعم. Ollama هو برنامج مفتوح المصدر يخضع لرخصة MIT وهو مجاني تمامًا. “التكلفة” الوحيدة هي الأجهزة التي يتم تشغيله عليها والكهرباء التي يستهلكها — ولا توجد أي رسوم لكل توكن لأن العملية لا تمر عبر أي مزود خدمات سحابية.

هل تقوم «أولاما» بإرسال بياناتي إلى أي مكان؟

لا. فبحكم تصميم النظام، تتم عملية الاستدلال بالكامل على جهازك. ولا يقتصر النشاط الشبكي إلا على تنزيل النموذج عند استدعائه لأول مرة. وهذا هو السبب الرئيسي الذي يدفع الفرق العاملة في مجالات الرعاية الصحية والشؤون القانونية والمالية إلى استخدامه — فالمطالبات الحساسة لا تغادر المبنى أبدًا.

هل أحتاج إلى وحدة معالجة رسومات (GPU) لتشغيل Ollama؟

لا، لكنه يساعد كثيرًا. يعمل برنامج «أولاما» على وحدة المعالجة المركزية (CPU) وحدها في حالة النماذج الأصغر حجمًا (يمكن تشغيل نموذج يتراوح حجمه بين 2 و3 مليارات معلمة بسلاسة على جهاز كمبيوتر محمول حديث)، ويستخدم وحدة معالجة الرسومات (GPU) تلقائيًّا عند توفرها. أما بالنسبة للنماذج التي يتجاوز حجم معلماتها حوالي 13 مليار معلمة، فإن استخدام وحدة معالجة الرسومات (GPU) أو معالج «آبل سيليكون» المزود بذاكرة موحدة يُحدث فرقًا كبيرًا. انظر دليل متطلبات النظام لمزيد من التفاصيل.

ما هي النماذج التي يمكن لـ«أولاما» تشغيلها؟

أكثر من 100 نموذج مفتوح المصدر، بما في ذلك Llama 3.3 وLlama 4 من Meta، وGemma 4 من Google، وسلسلة Qwen 3 من Alibaba،, ديب سيك V3 وR1، و«ميسترال»، و«Phi-4» من مايكروسوفت. اختيارنا من بين أفضل نماذج LLM محلية للتشغيل على Ollama يوضح أيهما يجب استخدامه في كل مهمة.

هل «أولاما» أفضل من «تشات جي بي»؟

أدوات مختلفة. يوفر لك ChatGPT نموذجًا متطورًا لا يتطلب أي إعدادات، لكنه يرسل بياناتك إلى السحابة ويفرض رسوم اشتراك. أما Ollama فيشغّل نماذج مفتوحة أصغر حجمًا محليًّا، وهي مجانية وتتمتع بالخصوصية، لكن حتى أفضل نموذج محلي لا يزال يتخلف عن أفضل نماذج السحابة في المهام الأكثر صعوبة. من حيث الخصوصية والتكلفة والاستخدام دون اتصال بالإنترنت، يتفوق Ollama؛ أما من حيث القدرة الأساسية على الاستدلال المعقد، فلا تزال النماذج السحابية المتطورة في الصدارة.

ما هو منفذ واجهة برمجة تطبيقات (API) Ollama؟

تُتيح شركة «أولاما» واجهة برمجة التطبيقات (REST API) الخاصة بها على http://localhost:11434 بشكل افتراضي. كما يوفر نقطة نهاية متوافقة مع OpenAI، لذا فإن الكثير من أكواد OpenAI-SDK الحالية تعمل بمجرد توجيه عنوان URL الأساسي إلى مثيل Ollama المحلي الخاص بك.

هل يمكن لـ Ollama أن تحل محل واجهة برمجة تطبيقات OpenAI في تطبيقي الحالي؟

بالنسبة لمعظم التطبيقات، نعم. توفر Ollama نقطة نهاية متوافقة مع OpenAI على http://localhost:11434/v1, ، بما في ذلك /v1/chat/completions الطريق الذي تستدعيه معظم الأدوات. قم بتوجيه عميل OpenAI الخاص بك إلى base_url عند القيام بذلك، قم بتمرير أي مفتاح API مؤقت، واضبط حقل النموذج على علامة Ollama مثبتة. كما يتم دعم التضمينات والرؤية واستدعاء الأدوات أيضًا، لذا فإن العديد من المشاريع تنتقل إلى هذا النظام بمجرد تغيير سطرين فقط. ويغطي هذا النظام أجزاءً من واجهة برمجة تطبيقات OpenAI بدلاً من كل المعلمات، لذا تأكد من أي حقول غير معتادة تعتمد عليها تطبيقاتك.

هل يمكنني تشغيل Ollama بدون وحدة معالجة رسومات (GPU)؟

نعم. يعمل Ollama بالكامل على وحدة المعالجة المركزية (CPU) في حالة عدم وجود وحدة معالجة رسومات (GPU) متوافقة — ما عليك سوى توفر ذاكرة وصول عشوائي (RAM) كافية في النظام لاستيعاب النموذج. تعمل وحدة المعالجة المركزية (CPU) متعددة النوى الحالية على تشغيل نموذج بحجم 7B بسرعات قابلة للاستخدام، لكن معدل الإنتاجية ينخفض بشكل حاد مع زيادة حجم النماذج، كما أن النماذج من فئة 70B التي تعمل على وحدة المعالجة المركزية (CPU) تكون بطيئة جدًّا بحيث لا تصلح للاستخدام التفاعلي. أما بالنسبة للدردشة اليومية، فإن وحدة معالجة الرسومات (GPU) أو جهاز Mac المزود بمعالج Apple Silicon يُحدث فرقًا كبيرًا بين الأداء البطيء والأداء السريع.

ما مقدار مساحة القرص التي تشغلها نماذج Ollama، وأين يتم تخزينها؟

ضع في اعتبارك أحجام التنزيل المذكورة أعلاه: النموذج بحجم 7B يشغل حوالي 5 جيجابايت على القرص، والنموذج بحجم 70B يشغل حوالي 43 جيجابايت، كما أن تنزيل عدة نماذج يؤدي إلى زيادة سريعة في الحجم الإجمالي. بشكل افتراضي، يتم تخزينها في المجلد ~/.ollama/models (أو C:Users.ollamamodels (في نظام ويندوز). يمكنك تغيير موقع هذا الدليل باستخدام الأمر OLLAMA_MODELS متغير بيئي، وقم بإزالة أي شيء لم تعد بحاجة إليه باستخدام ollama rm.

الخلاصة

فازت “أولاما” بالريادة في مجال نماذج اللغة الكبيرة المحلية (LLM) في عام 2026 من خلال إتقان أمر واحد بشكل استثنائي: إزالة العقبات. فهي مجانية، وتضمن الخصوصية، وتعمل على الأجهزة التي تمتلكها بالفعل، وتنتقل بك من مرحلة «أريد تجربة نموذج محلي» إلى نموذج جاهز للتشغيل في غضون دقيقتين تقريبًا. ليس الخيار الأسرع في ظل الأحمال الثقيلة، ولن يتفوق النموذج المحلي على أفضل حلول السحابة في أصعب المشكلات — ولكن كبوابة دخول إلى الذكاء الاصطناعي المحلي، لا يوجد ما يضاهيه. إذا كنت مبتدئًا، فابدأ من هنا.

انتقل إلى الأعلى
Featured on There's An AI For That