Friday, 2 October 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

Ollama Gemma 4: نماذج Gemma الحالية وكيفية تشغيلها

ملخص سريع:

  • لا يوجد إصدار Gemma 4 اعتبارًا من أغسطس 2026. تتضمن أسرة Gemma الأخيرة Gemma 2 (2B و9B و27B) و Gemma الأصلية (2B و7B).
  • شغّل Gemma 2 على Ollama باستخدام ollama run gemma2:27b, ollama run gemma2:9bأو ollama run gemma2:2b حسب ذاكرة GPU لديك.
  • يتطلب نموذج 27B 16 جيجابايت على الأقل من VRAM للدقة الكاملة، بينما يعمل 9B بشكل مريح على معالجات رسومات بسعة 8 جيجابايت و2B على 4 جيجابايت.
  • تدعم جميع نماذج Gemma على Ollama المطالب الفورية للنظام وأسلوب JSON والمحادثات متعددة الأدوار خارج الصندوق.

عند البحث عن Ollama Gemma 4، من المحتمل أنك تبحث عن أحدث نماذج Gemma المتاحة عبر Ollama. اعتبارًا من أغسطس 2026، لا يوجد إصدار رسمي من Gemma 4 من Google DeepMind. أحدث النماذج هي أسرة Gemma 2 (بمتغيرات 2B و9B و27B) وسلسلة Gemma الأصلية (2B و7B). كلا الأسرتين تعملان بشكل أصلي على Ollama بأمر واحد.

نماذج Gemma المتاحة على Ollama

يدعم Ollama ستة متغيرات من نموذج Gemma عبر جيلين. يستخدم كل منها ترخيص الأوزان المفتوحة من Google ويمكنه التشغيل بالكامل دون الاتصال بالإنترنت بعد تنزيله.

اسم النموذج عدد المعايير (البارامترات) أمر Ollama الحد الأدنى من VRAM (Q4) طول السياق
Gemma 2 27B 27 مليار ollama run gemma2:27b 16 جيجابايت 8,192 رمز
Gemma 2 9B 9 مليار ollama run gemma2:9b 6 GB 8,192 رمز
Gemma 2 2 ب 2 مليار ollama run gemma2:2b 2 GB 8,192 رمز
Gemma 7B 7 مليار ollama run gemma:7b 5 جيجابايت 8,192 رمز
Gemma 2B 2 مليار ollama run gemma:2b 2 GB 8,192 رمز
Gemma 2B Instruct 2 مليار ollama run gemma:2b-instruct 2 GB 8,192 رمز

توفر سلسلة Gemma 2 أداءً أفضل لكل معامل مقارنة بنماذج Gemma الأصلية. بالنسبة لمعظم المستخدمين، gemma2:9b يوفر أفضل توازن بين الجودة والمتطلبات الأجهزة. يمكنك رؤية كيف تقارن هذه النماذج بالبدائل في لوحة تصنيف النماذج اللغوية الكبيرة (LLM).

تثبيت وتشغيل نماذج Gemma

أولاً، تأكد من تثبيت Ollama على نظامك. إذا لم تقم بتثبيته بعد، اتبع دليل تثبيت Ollama لمنصتك. بمجرد التثبيت، يتطلب تشغيل أي نموذج Gemma أمرًا واحدًا يقوم بتنزيل وتشغيل النموذج تلقائيًا.

macOS و Linux

افتح Terminal وقم بتشغيل:

ollama run gemma2:9b

هذا يقوم بتنزيل نموذج Gemma 2 بمعاملات 9B (حوالي 5.5 جيجابايت للإصدار الكمي 4-بت) وبدء جلسة دردشة تفاعلية. لاستخدام حجم مختلف:

# لـ 27B (أعلى جودة، يحتاج إلى 16 جيجابايت على الأقل من VRAM)
ollama run gemma2:27b

# لـ 2B (الأسرع، يعمل على معالجات رسومات بسعة 4 جيجابايت)
ollama run gemma2:2b

# Gemma 7B الأصلية
ollama run gemma:7b

ويندوز

افتح Command Prompt أو PowerShell واستخدم نفس الأوامر:

ollama run gemma2:9b

يجب على مستخدمي Windows الذين يمتلكون معالجات NVIDIA GPU التأكد من تحديث تعريفات GPU الخاصة بهم للحصول على أداء مثالي. دعم معالجات AMD GPU عبر ROCm يعمل على Linux لكنه لا يزال تجريبياً على Windows اعتباراً من أغسطس 2026.

التشغيل كخادم API

لتشغيل Gemma كخدمة API دائمة بدلاً من محادثة تفاعلية:

# Start Ollama server (runs automatically on macOS/Linux, manual on Windows)
ollama serve

# In another terminal, pull the model without starting chat
ollama pull gemma2:9b

# Make API requests
curl http://localhost:11434/api/generate -d '{
  "model": "gemma2:9b",
  "prompt": "Explain quantum entanglement in simple terms.",
  "stream": false
}'

يعمل هذا الأسلوب بشكل متطابق على جميع الأنظمة الأساسية ويتكامل مع مكتبات توافقة OpenAI بتوجيهها إلى http://localhost:11434.

متطلبات النظام والأداء

تعمل نماذج Gemma بكفاءة على الأجهزة الاستهلاكية بفضل تحسينات Ollama والتكميم. متطلبات VRAM تختلف بشكل كبير حسب حجم النموذج ومستوى التكميم.

النموذج دقة كاملة (FP16) مكمّمة بـ 4 بت (Q4) الرموز/الثانية (RTX 4090)
Gemma 2 27B 54 GB 16 جيجابايت 22-28 t/s
Gemma 2 9B 18 جيجابايت 6 GB 45-60 t/s
Gemma 2 2 ب 4 جيجابايت 2 GB 120-150 t/s
Gemma 7B 14 GB 5 جيجابايت 40-55 t/s

بشكل افتراضي، يقوم Ollama بتنزيل إصدارات مكممة بـ 4 بت التي تقلل استخدام الذاكرة بنسبة 75% مع فقدان جودة بسيط. احسب احتياجات VRAM الدقيقة لأجهزتك باستخدام حاسبة VRAM، التي تأخذ في الاعتبار طول السياق وحجم الدفعة. للحصول على شرح شامل لمتطلبات الذاكرة عبر النماذج، انظر إلى متطلبات VRAM حسب النموذج.

وحدات معالجة الرسومات الموصى بها

  • RTX 4060 Ti 16GB / RTX 3090: يمكنه تشغيل Gemma 2 27B بتكميم Q4 مع نوافذ سياق كاملة.
  • RTX 4070 / RX 7800 XT: مثالي لـ Gemma 2 9B مع هامش إضافي للمحادثات الطويلة.
  • RTX 4060 / RTX 3060: يتعامل مع Gemma 2 2B و Gemma 7B بسهولة.
  • معالجات الرسومات المدمجة (Apple Silicon, Intel Arc): Gemma 2 2B يعمل بشكل جيد على أجهزة Mac بمعالج M1/M2 وعلى معالجات Intel Arc الحديثة بذاكرة موحدة بحجم 16GB أو أكثر.

للحصول على توصيات GPU مفصلة ومعايير الأداء، راجع أفضل وحدات معالجة الرسومات لتشغيل LLMs محليًا دليلنا.

الاختيار بين نماذج Gemma

يعتمد نموذج Gemma الصحيح على حالة الاستخدام والأجهزة ومتطلبات الجودة. تتفوق نماذج Gemma 2 بثبات على نماذجها السابقة عبر مهام المنطق والاتباع والترميز.

Gemma 2 27B ينافس نماذج أكبر بكثير من حيث الجودة لكنه يتطلب ذاكرة VRAM كبيرة. استخدمه للمنطق المعقد أو الكتابة التقنية أو توليد الكود حيث تكون الدقة أهم من السرعة. إنه قابل للمقارنة مع نماذج بحجم 70B من عائلات أخرى في العديد من المعايير.

Gemma 2 9B هو الخيار الأمثل لمعظم المطورين. يعمل على معالجات رسومات متوسطة المستوى ويوفر أداء قوية عبر المهام العامة وينتج استجابات سريعة بما يكفي للتطبيقات التفاعلية. هذا هو النموذج الذي يجب أن تبدأ به إلا إذا كان لديك قيود محددة.

Gemma 2 2 ب يتفوق في سيناريوهات الإنتاجية العالية: معالجة الدفعات أو النشر على الحافة أو تشغيل عدة وكلاء في نفس الوقت. بينما هو أقل قدرة من النماذج الأكبر، إلا أنه كفء بشكل مفاجئ لاستخراج البيانات المنظمة والتصنيف والحوار البسيط.

الأصلي Gemma 7B و 2B لا تزال متاحة لكنها لا توفر أي مزايا على Gemma 2 سوى استخدام VRAM أقل قليلاً بنفس الأحجام. يجب أن تستخدم المشاريع الجديدة Gemma 2 بشكل افتراضي.

للحصول على خيارات إضافية، استكشف قائمة نماذج Ollama أو انظر إلى أفضل النماذج المحلية لـ Ollama للبدائل مثل Llama و Mistral و Qwen.

تكوين النموذج والتحسين

يكشف Ollama عدة معاملات لضبط سلوك Gemma والأداء. أنشئ Modelfile لتخصيص الإعدادات:

FROM gemma2:9b

# Set temperature (0.0 = deterministic, 1.0 = creative)
PARAMETER temperature 0.7

# Limit response length
PARAMETER num_predict 512

# Set system prompt
SYSTEM You are a technical documentation assistant. Provide accurate, concise answers with code examples.

حمّل التكوين المخصص الخاص بك:

ollama create my-gemma -f ./Modelfile
ollama run my-gemma

تتضمن المعاملات الرئيسية:

  • temperature: يتحكم في العشوائية (0.1-0.3 للمهام الواقعية، 0.7-0.9 للعمل الإبداعي)
  • top_p: عتبة أخذ العينات النووية (0.9 افتراضي، أقل للمخرجات أكثر تركيزاً)
  • num_predict: الحد الأقصى للرموز المراد توليدها (-1 بدون حد، 512-2048 نموذجي)
  • num_ctx: حجم نافذة السياق (2048-8192، أعلى يستخدم VRAM أكثر)

لمقارنة التكاليف بين تشغيل Gemma محلياً واستخدام واجهات برمجية مستضافة، استخدم حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لإيجاد نقطة التعادل الخاصة بك.

التكامل مع أدوات التطوير

نماذج Gemma على Ollama تعمل مع مكتبات LLM القياسية بتوجيهها إلى نقطة نهاية Ollama المحلية. إليك كيفية التكامل مع الأطر الشهيرة:

Python (LangChain)

from langchain_community.llms import Ollama

llm = Ollama(model="gemma2:9b")
response = llm.invoke("Write a Python function to calculate Fibonacci numbers.")
print(response)

JavaScript (LangChain.js)

import { Ollama } from "@langchain/community/llms/ollama";

const llm = new Ollama({
  baseUrl: "http://localhost:11434",
  model: "gemma2:9b",
});

const response = await llm.invoke("Explain async/await in JavaScript.");
console.log(response);

عملاء متوافقة مع OpenAI

تدعم العديد من المكتبات صيغة API الخاصة بـ OpenAI. قم بتكوينها لاستخدام Ollama:

import openai

client = openai.OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # required but ignored
)

response = client.chat.completions.create(
    model="gemma2:9b",
    messages=[{"role": "user", "content": "Hello!"}]
)
print(response.choices[0].message.content)

استكشاف أخطاء المشاكل الشائعة

فشل تنزيل النموذج أو انتهت مهلة الانتظار: تتراوح نماذج Gemma من 1.5 GB (2B مُكمّم) إلى 54 GB (27B بدقة كاملة). على الاتصالات البطيئة، استخدم ollama pull gemma2:9b في محطة طرفية مخصصة لمراقبة تقدم التنزيل. تستأنف التنزيلات الجزئية تلقائياً في حالة المقاطعة.

أخطاء نقص الذاكرة: إذا تعطل Ollama أو رفض تحميل نموذج، فإن وحدة معالجة الرسومات لديك تفتقر إلى VRAM كافي. انتقل إلى نموذج أصغر (gemma2:2b بدلاً من 9b) أو قلل نافذة السياق باستخدام PARAMETER num_ctx 2048 في ملف Modelfile مخصص. تحقق من المتطلبات الفعلية باستخدام حاسبة VRAM.

توليد بطيء على Apple Silicon: تأكد من تفعيل تسريع Metal. يستخدم Ollama Metal بشكل افتراضي على macOS، لكن الإصدارات الأقدم من Ollama قد تعود للمعالج المركزي. قم بالتحديث إلى أحدث إصدار باستخدام brew upgrade ollama أو أعد التثبيت من موقع Ollama.

API تُرجع ردود فارغة: تحقق من أن ollama serve قيد التشغيل وآمن على http://localhost:11434. اختبر باستخدام curl http://localhost:11434/api/tags لسرد النماذج المتاحة. إذا لم يظهر النموذج، قم بتشغيل ollama pull gemma2:9b أولاً.

GPU في Windows غير مكتشف: يتطلب Ollama وحدات معالجة رسومات NVIDIA مع دعم CUDA أو وحدات معالجة رسومات AMD مع ROCm (Linux فقط). حدّث برامج تشغيل وحدة معالجة الرسومات من Device Manager أو من موقع الشركة المصنعة. تحقق من الكشف باستخدام nvidia-smi (NVIDIA) أو rocm-smi (AMD).

الأسئلة المتكررة

هل هناك نموذج Gemma 4 متاح؟

لا. اعتباراً من أغسطس 2026، أطلقت Google DeepMind Gemma (2B, 7B) و Gemma 2 (2B, 9B, 27B)، لكن لا يوجد Gemma 4. يشير الرقم «2» في Gemma 2 إلى الجيل الثاني من عائلة النماذج، وليس عدد المعاملات. عند البحث عن «Gemma 4»، من المحتمل أنك تريد أحدث النماذج: Gemma 2 27B للحصول على أقصى جودة، أو Gemma 2 9B للأداء المتوازن، أو Gemma 2 2B للبيئات محدودة الموارد.

ما الفرق بين Gemma و Gemma 2؟

Gemma 2 هي بنية الجيل الثاني مع تحسينات كبيرة في المنطق والامتثال للتعليمات والقدرات متعددة اللغات. تحقق نماذج Gemma 2 جودة مماثلة للنماذج الأكبر من الجيل الأول مع استخدام ذاكرة أقل وتوليد أسرع. على سبيل المثال، Gemma 2 9B يطابق أو يتجاوز Gemma 7B الأصلي عبر معظم المعايير. ما لم يكن لديك سبب محدد لاستخدام سلسلة Gemma الأصلية، ابدأ بـ Gemma 2.

هل يمكنني استخدام نماذج Gemma تجارياً؟

نعم. تستخدم نماذج Gemma ترخيص الأوزان المفتوحة من Google الذي يسمح بالاستخدام التجاري والتعديل والتوزيع. على عكس بعض النماذج المفتوحة بتراخيص للبحث فقط، يمكنك نشر Gemma في تطبيقات الإنتاج أو منتجات SaaS أو الأنظمة الموجهة للمؤسسات دون ترخيص إضافي. القيد الوحيد هو أنك لا تستطيع استخدام اسم Gemma للإيحاء باعتماد Google لمنتجك.

كيف يقارن Gemma 2 9B مع Llama 3 8B على Ollama؟

يعمل كلا النموذجين بشكل جيد على أجهزة مماثلة (6-8 GB VRAM)، لكن لهما نقاط قوة مختلفة. يعمل Gemma 2 9B بشكل عام بشكل أفضل في مهام امتثال التعليمات والمخرجات المنظمة، مما يجعله مفضلاً لاستخدام الأدوات وتوليد JSON وتطبيقات الوكيل. يميل Llama 3 8B إلى إنتاج ردود محادثة أكثر طبيعية ويتعامل مع الكتابة الإبداعية بشكل أفضل قليلاً. بالنسبة للمهام التقنية والبرمجة، يجد معظم المطورين Gemma 2 9B أكثر موثوقية. قارن بين النموذجين لحالتك الاستخدام المحددة لأن جودة الإدراك تختلف حسب التطبيق.

هل أحتاج إلى الدفع لتشغيل نماذج Gemma على Ollama؟

لا. Ollama برنامج مجاني ومفتوح المصدر، ويتم إطلاق نماذج Gemma بأوزان مفتوحة بدون تكلفة. تدفع فقط مقابل الأجهزة (GPU، RAM، الكهرباء) المطلوبة لتشغيلها. لمقارنات تكاليف الاستخدام، يوضح حاسبة تكلفة واجهة برمجة التطبيقات (API) متى يصبح الاستضافة المحلية أكثر اقتصاداً من واجهات برمجة التطبيقات السحابية. يوفر معظم المطورين الذين يشغلون أكثر من 10000 استعلام شهرياً المال من خلال استضافة Gemma ذاتياً بدلاً من استخدام واجهات برمجة التطبيقات التجارية.

هل يمكن لنماذج Gemma أن تعمل بدون GPU؟

نعم، لكنها بطيئة. يعود Ollama إلى تنفيذ المعالج المركزي عندما لا يتم اكتشاف وحدة معالجة رسومات متوافقة. يعمل Gemma 2 2B بسرعة 3-8 رموز في الثانية على وحدات المعالجة المركزية الحديثة (Ryzen 5000+ أو Intel 12th gen+)، وهو قابل للاستخدام للاستعلامات العرضية لكن محبط للدردشة التفاعلية. ينتج Gemma 2 9B والنماذج الأكبر أقل من 2 رموز في الثانية على وحدة المعالجة المركزية، مما يجعلها غير عملية. للاستخدام الجاد نموذج محلي استثمر في وحدة معالجة رسومات—حتى RTX 3060 بميزانية محدودة أو RTX 2080 مستخدمة يحسن التجربة بشكل كبير. انظر توصيات الأجهزة في دليل Ollama الكامل.

كتبه مصطفى إحسان

مصطفى إحسان هو مؤسس ومحرر Convly.ai. بنى ويحتفظ بقاعدة بيانات نماذج AI المباشرة للموقع، ومؤشر أداء السعر، وآلاته الحاسبة المجانية لمتطلبات VRAM وتكاليف API واقتصاديات الاستضافة الذاتية. يكتب عن تسعير النماذج ونتائج المقاييس والأجهزة المطلوبة لتشغيل نماذج AI محلياً، ويفضل باستمرار الأرقام المقاسة على ادعاءات البائع.

انتقل إلى الأعلى