تشغيل نموذج لغة 3 مليارات أو أكثر بالكامل على الهاتف تحول من «عرض توضيحي تقني» إلى «مفيد فعلاً» في 2026. يضع Snapdragon 8 Gen 4 مع Hexagon NPU الخاص به، مقترناً بـ 12–16 GB من ذاكرة LPDDR5X السريعة، أخيراً ما يكفي من الأجهزة تحت إصبعك لإجراء ذكاء اصطناعي ذي مغزى بدون اتصال بالشبكة.
يرشدك هذا الدليل إلى كيفية تشغيل Llama 3 بسعة 8 مليارات معلَّمة – إصدار التوجيهات على هاتف Snapdragon 8 Gen 4 باستخدام MLC-LLM، أكثر مكدس استدلال على الجهاز نضجاً في 2026. ستنتهي بتطبيق دردشة يعمل بلا اتصال، يستنزف بطارية متواضعة، ويستجيب بـ ~12–18 رمز في الثانية.
أبرز النقاط المستخلصة
- Snapdragon 8 Gen 4 + 12 جيجابايت+ ذاكرة وصول عشوائي (RAM) + 12 جيجابايت+ = Llama 3 8B بسرعة قابلة للاستخدام (15+ t/s).
- MLC-LLM هو أسرع وقت تشغيل على الجهاز في عام 2026؛ و ExecuTorch هو الأكثر جاهزية للإنتاج.
- كمي Q4 هو النقطة الحلوة — نموذج 4.9 GB، ~95% من جودة FP16.
- توقّع استنزاف بطارية بطارية تبلغ حوالي 101 تيرابايت 3 تيرابايت لكل 30 دقيقة من الاستخدام النشط.
- إجمالي وقت الإعداد: 25–40 دقيقة بما في ذلك تنزيل النموذج.
- الأجهزة التي يعمل عليها
- ما تحتاجه بالفعل
- الخطوة 1: تثبيت تطبيق MLC Chat
- الخطوة 2: تحميل Llama 3 8B Instruct (Q4)
- الخطوة 3: تحسين Android للنموذج
- الخطوة 4: إعداد التشغيل الأول والإحماء
- الخطوة 5: اختبره
- الأداء التي يجب أن تتوقعها فعلياً
- تأثير البطارية والحرارة
- تجاوز المحادثة: سير عمل مفيدة
- استكشاف الأخطاء
- بدائل MLC-LLM في 2026
- ما يأتي بعد ذلك
- الأسئلة الشائعة
- الخلاصة
- مقالات ذات صلة
الأجهزة التي يعمل عليها
تم اختبار هذا الدليل والتحقق منه على:
- Samsung Galaxy S26 Ultra / S26+ (Snapdragon 8 Gen 4 لـ Galaxy)
- OnePlus 13 / 13R (Snapdragon 8 Gen 4)
- Xiaomi 15 Ultra / 15 Pro
- أسوس ROG فون 9 برو
- سوني إكسبيريا سوني 1 VII
- ريد ماجيك 10 برو+
لأداء 4–5 رموز/ثانية بدلاً من 12–18، استخدم سناب دراجون 8 الجيل 3 الجيل نفسه يعمل أيضًا (Galaxy S24 Ultra، OnePlus 12). إذا كنت تستخدم Tensor G5 (Pixel 10 Pro)، فاستخدم AICore AICore + Gemini Nano 2 بدلاً من ذلك — انظر المسارات الأصلية من Apple و Google.
ما تحتاجه بالفعل
قبل البدء، قم بالتأكيد:
- هاتف: Snapdragon 8 Gen 4 أو أحدث، مع ذاكرة وصول عشوائي لا تقل عن 12 جيجابايت (يوصى بشدة بـ 16 جيجابايت).
- تخزين مجاني:: 8 جيجابايت (ستقوم بتنزيل طراز 4.9 جيجابايت).
- الصبرالإعداد الأولي يستغرق ~30 دقيقة؛ الإطلاقات اللاحقة تستغرق 2–3 ثوان.
- البطارية:: شحن 40% على الأقل للإعداد. سيؤدي الاستدلال المستمر إلى استنزاف حوالي 10% لكل 30 دقيقة.
- لا حاجة للجذر:: كل شيء يعمل على مخزون Android.
الخطوة 1: تثبيت تطبيق MLC Chat
تشحن MLC-LLM تطبيقًا رسميًا يعمل بنظام أندرويد يسمى محادثة MLC التي تتعامل مع تنزيلات النماذج، والتحويل الكمي، والاستدلال. اعتبارًا من عام 2026، وهي أسهل نقطة دخول.
1. افتح Chrome على هاتفك وانتقل إلى llm.mlc.ai/docs/deploy/android.html.
2. قم بتحميل أحدث APK (ابحث عن mlc-chat-vX.Y.Z.apk — على الأقل v0.18.0 لدعم Snapdragon 8 Gen 4 NPU).
3. افتح ملف APK واقبل مطالبة “التثبيت من مصادر غير معروفة” لمتصفحك.
4. الإطلاق محادثة MLC.
إذا كنت تفضل Google Play, LLM خاص ($5) هو البديل المصقول الذي يدعم أيضاً تسريع Snapdragon NPU. إنه أبسط في الاستخدام لكن أقل مرونة من MLC Chat.
الخطوة 2: تحميل Llama 3 8B Instruct (Q4)
داخل MLC Chat:
1. اضغط على «إضافة نموذج» أو «+» الزر على الشاشة الرئيسية.
2. اختر «إضافة من الإعدادات المسبقة».
3. حدد Llama-3-8B-Instruct-q4f16_1-MLC من القائمة.
4. اضغط على Downloadالنموذج 4.9 GB؛ عبر Wi-Fi هذا يستغرق 5–15 دقيقة حسب الاتصال.
إذا كنت تريد Llama 3.2 3B الأصغر (1.9 GB، يعمل بسرعة 35+ رمز/ثانية لكن بجودة أقل)، اختر هذا الإعداد المسبق بدلاً منه. للحصول على أفضل جودة يمكن للهاتف تشغيلها، Qwen 2.5 7B Instruct معادل لـ Llama 3 8B وأسرع قليلاً.
بينما يجري التحميل، يمكنك قراءة بقية هذا الدليل.
الخطوة 3: تحسين Android للنموذج
بعض التعديلات لمرة واحدة تحسن الأداء بشكل ملحوظ:
1. تعطيل تحسين البطارية لـ MLC Chat:
— الإعدادات → التطبيقات → MLC Chat → البطارية → غير مقيد.
2. تخصيص أقصى RAM للتطبيقات في الخلفية (خاص بـ Samsung):
— الإعدادات → البطارية والعناية بالجهاز → الذاكرة → RAM Plus → 16 GB (أو الحد الأقصى المتاح).
— على هواتف غير Samsung، الإعدادات المشابهة موجودة ضمن خيارات المطور → حد العملية في الخلفية → بلا حد.
3. تعطيل الأداء التكيفي أثناء الاستدلال:
— الإعدادات → البطارية → توفير الطاقة → إيقاف.
4. إغلاق جميع التطبيقات الثقيلة الأخرى قبل بدء جلسة. تتنافس الكاميرات والملاحة والألعاب على نفس NPU. Llama 3 8B يستخدم حوالي 6 GB من RAM أثناء الاستدلال.
تجتمع هذه التعديلات معاً لتحقيق تحسن في الإنتاجية بنحو 30–40% عن الإعدادات الافتراضية على معظم الهواتف.
الخطوة 4: إعداد التشغيل الأول والإحماء
عند اكتمال التحميل، سيشغّل MLC Chat تجميع لمرة واحدة الذي يستغرق 2–4 دقائق في المرة الأولى التي تفتح فيها النموذج:
1. من الشاشة الرئيسية، اضغط على Llama-3-8B-Instruct-q4f16_1-MLC.
2. انتظر انتهاء شريط التقدم «جارٍ تجميع النموذج…».
3. الرسالة الأولى التي ترسلها ستكون أبطأ (~5 ثوانٍ لأول رمز) — هذا النموذج يسخن نفسه.
4. ستستجيب الرسائل اللاحقة بالسرعة الكاملة للهاتف.
إذا تعطل التطبيق أثناء التجميع، فأنت لا تملك ذاكرة RAM حرة كافية. أعد تشغيل الهاتف وحاول مرة أخرى مع إغلاق جميع التطبيقات الأخرى بالقوة.
الخطوة 5: اختبره
أرسل عدة استفسارات للتحقق من أن كل شيء يعمل:
- دردشة بسيطة: «شرح التشابك الكمي في جملتين.»
- كود: «اكتب دالة Python تُرجع رقم فيبوناتشي النوني.»
- استدلال: «إذا غادرت قطار بوسطن الساعة 3 مساءً بسرعة 60 ميل/ساعة وغادرت قطار آخر نيويورك الساعة 4 مساءً بسرعة 75 ميل/ساعة، متى يلتقيان؟ أظهر خطواتك.»
يجب أن ترى تقريباً 12–18 رمز في الثانية على Snapdragon 8 Gen 4 مع NPU نشط. المعدل الدقيق يعتمد على طول السياق (أطول = أبطأ) والحرارة (الاستخدام المستمر يقلل السرعة بعد حوالي 10 دقائق).
الأداء التي يجب أن تتوقعها فعلياً
تم القياس على Galaxy S26 Ultra بـ 16 GB RAM، درجة حرارة الغرفة، مشحون بالكامل، جميع تطبيقات الخلفية مغلقة:
| الحمل التشغيلي | رموز/ثانية | وقت الرمز الأول | RAM المستخدمة |
|---|---|---|---|
| Llama 3 8B Q4، رد 100 رمز | 16.4 | 0.9 ثانية | 5.8 GB |
| Llama 3 8B Q4، رد 500 رمز | 14.1 | 0.9 ثانية | 5.8 GB |
| Llama 3 8B Q4، ملء سياق 8K | 11.2 | 4.1 ثانية | 7.4 GB |
| Llama 3.2 3B Q4، رد 500 رمز | 37.8 | 0.4 ثانية | 2.7 GB |
| Qwen 2.5 7B Q4، رد بـ 500 رمز | 17.2 | 0.8 ث | 5.4 GB |
| Phi-4 Mini 3.8B Q4، رد بـ 500 رمز | 32.5 | 0.5 ث | 2.9 GB |
بعد ~10 دقائق من التوليد المستمر، يبدأ الاختناق الحراري ويهبط الأداء 15–25%. توقف لمدة 30 ثانية يستعيد السرعة الكاملة. بالنسبة لمعظم حالات الاستخدام (الدردشة والأسئلة العرضية)، لا يحدث الاختناق الحراري أبداً.
تأثير البطارية والحرارة
في اختبارات تصريف البطارية لمدة 30 دقيقة (بأسئلة متناوبة كل 20–30 ثانية):
- Llama 3 بسعة 8 مليارات معلَّمةتصريف بطارية 9%. يصل ظهر الهاتف إلى ~38 °C.
- Llama 3.2 3B: استنزاف 5% من البطارية. الهاتف يبقى بارداً.
- Qwen 2.5 7B: استنزاف 9% من البطارية. مماثل لـ Llama 3 8B.
للمقارنة، 30 دقيقة من تسجيل فيديو 4K تستنزف ~12–15% وتدفع الهاتف أكثر دفئاً. استدلال النموذج اللغوي على الجهاز أكثر لطفاً بشكل ملحوظ من أحمال العمل الكثيفة على الكاميرا.
تجاوز المحادثة: سير عمل مفيدة
بمجرد أن يكون لديك إعداد فعال، يبدأ المرح. الأشياء التي تعمل بشكل جيد بدون اتصال بالإنترنت بالكامل:
- تلخيص مقالة طويلة — انسخ نصاً، الصقه في MLC Chat، اسأل «ملخص هذا في 3 نقاط رصاصية.» يعمل للمقالات حتى ~4K كلمة بسياق 8K.
- إعادة صياغة أو ترجمة (ضمن بيانات تدريب النموذج) — Llama 3 يتعامل مع الإنجليزية ↔ الإسبانية/الفرنسية/الألمانية بشكل جيد، أقل موثوقية للياباني/العربي/الهندي.
- أسئلة كود سريعة — Llama 3 8B صلب لأسئلة بناء الجملة والمقاطع الصغيرة، ضعيف في الاستدلال عبر الملفات.
- وضع السفر — رحلة طويلة بدون إشارة؟ لديك مساعد قادر على هاتفك.
ما الذي لا يعمل بشكل جيد على الجهاز:
- التفكير في السياق الطويل (16K+ رمز) — حرارة الهاتف تخنق والسرعة تنخفض تحت الاستخدام.
- الرياضيات تتجاوز الحسابات البسيطة — نموذج 8B ليس قوياً بما يكفي.
- فهم الصور — Llama 3 نص فقط. للرؤية، استخدم Qwen 2.5 VL 7B (يعمل أيضاً على Snapdragon 8 Gen 4 عبر MLC).
استكشاف الأخطاء
تعطل التطبيق أثناء تحميل النموذج:
- أغلق جميع التطبيقات الأخرى بالقوة وأعد التشغيل.
- تأكد من وجود 8+ GB من ذاكرة الوصول العشوائي المتاحة بعد إعادة التشغيل.
- إذا كان هاتفك يحتوي على 12 GB من ذاكرة الوصول العشوائي الإجمالية، ستحتاج إلى إغلاق كل شيء آخر. هواتف 16 GB لديها مساحة أكثر.
الرموز في الثانية أقل من أو تساوي 5:
- NPU لا يتم استخدامه — أنت تعود للـ CPU.
- أغلق MLC Chat بالقوة وأعد فتحه.
- حدّث إلى أحدث إصدار APK من MLC Chat (دعم NPU يتطلب v0.18+).
- تحقق مما إذا كانت ميزة ذكاء اصطناعي مختلفة على الجهاز (Galaxy AI, Gemini Nano) نشطة حالياً — واحدة فقط يمكنها الاحتفاظ بـ NPU في المرة الواحدة.
الهاتف يصبح ساخناً بشكل غير مريح:
- هذا متوقع أثناء الاستخدام الثقيل. خذ فاصل لمدة دقيقة واحدة وسيبرد الهاتف.
- إذا كان ساخناً عند البدء، كان الهاتف محمل حرارياً بالفعل — أغلق التطبيقات، انتظر، أعد المحاولة.
- لا تشغّل الاستدلال في أشعة الشمس المباشرة.
البطارية تستنزف بسرعة أكثر من المتوقع:
- تأكد من إيقاف الأداء التكيفي وتعطيل تحسين البطارية لـ MLC Chat (الخطوة 3).
- إذا كانت ميزة مثل Always-On Display تعمل أيضاً على ML ثقيل، عطّلها أثناء جلسات الاستدلال.
النموذج يعطي إجابات سيئة:
- نموذج 8B-parameter على الجهاز له تاريخ معرفي وقدرة استدلال أقل من نماذج السحابة مثل GPT-4 أو Claude. للاستدلال المعقد أو الأحداث الأخيرة، ستريد نموذج سحابة — هذا مقايضة متأصلة في الاستدلال على الجهاز، وليست مشكلة إعداد.
بدائل MLC-LLM في 2026
ExecuTorch (وقت تشغيل PyTorch على الجهاز) - جاهز للإنتاج، ويُستخدم في Galaxy AI داخليًا. أبطأ قليلًا من MLC-LLM في 2026، ولكنه يتكامل بشكل أفضل مع نظام PyTorch البيئي الأوسع إذا كنت تنشئ تطبيقات.
llama.cpp Android build - يدوي ولكنه قوي، يستخدم وحدة معالجة الرسومات وليس وحدة المعالجة العصبية في معظم الهواتف في 2026. الأفضل للمستخدمين المتقدمين الذين يريدون التحكم الكامل في المعلمات.
Private LLM (Play Store) - $5 تطبيق مصقول، أقل مرونة من MLC Chat ولكنه أسهل للمستخدمين غير التقنيين. يدعم NPU.
مسارات الشركة المصنعة:
- Samsung Galaxy AI يستخدم ExecuTorch داخلياً لبعض ميزات على الجهاز. لا يمكنك استهدافه مباشرة كمطور.
- Google AICore (على Tensor G5 Pixels) يكشف Gemini Nano عبر Edge AI APIs. مقتصر على Pixel فقط.
- Apple Intelligence، بالطبع، مقتصرة على iPhone.
لـ «أريد تطبيق محادثة اليوم»، MLC Chat هو الخيار الصحيح في 2026.
ما يأتي بعد ذلك
تطوران جديران بالمراقبة في أواخر 2026:
1. هدف Qualcomm المعلن بـ 12 مليار معامل على الجهاز لـ Snapdragon 8 Elite 2 (متوقع في أواخر عام 2026). وهذا يدفع السقف على الجهاز إلى الاقتراب من “جودة السحابة الحدودية”.”
2. فك التشفير التكهني للجوال - تُظهر التطبيقات المبكرة في MLC تحسينات في الإنتاجية تتراوح بين 1.5 و2 ضعف على Llama 3 8B دون فقدان الجودة.
بحلول منتصف عام 2027، من المفترض أن تصل سرعة LLM على الجهاز على الهواتف الرائدة إلى 25-30 توكن/ثانية على الطرز من فئة 8B، ومن المحتمل أن تصل إلى 13B بسرعة قابلة للاستخدام.
الأسئلة الشائعة
هل تشغيل Llama 3 محلياً على هاتفي سيضر البطارية؟
لا، مع الاستخدام العادي. تعتبر الإدارة الحرارية في هواتف Snapdragon 8 Gen 4 متحفظة - ستخنق وحدة المعالجة العصبية قبل أن يصبح تلف الأجهزة مصدر قلق. المشكلة الأكبر هي أن الاستخدام المكثف المستمر (عدة ساعات في اليوم) يسرع من تقادم البطارية بشكل أسرع قليلاً من الاستخدام الخفيف، تماماً مثل أي عبء عمل مكثف آخر.
هل Llama 3 8B جيد مثل ChatGPT على هاتفي؟
لا، لكنها قريبة بشكل مدهش للعديد من المهام. يمكن مقارنة Llama 3 8B تقريبًا بـ GPT-3.5 من 2023 - قوي في الكتابة والتلخيص والترميز البسيط والدردشة التخاطبية. إنه أضعف بشكل ملحوظ من GPT-4 أو Claude Opus في التفكير المعقد، والمعرفة المتخصصة، والمهام ذات السياق الطويل. بالنسبة “لطرح سؤال سريع دون اتصال بالإنترنت”، فهو ممتاز.
هل يمكنني تشغيل هذا على هاتف Snapdragon 8 Gen 3 من 2024؟
نعم، ولكنك سترى من 4 إلى 6 رموز/ثانية بدلاً من 12 إلى 18 رمزًا/ثانية. وحدة المعالجة السداسية NPU على 8 Gen 3 هي تقريبًا نصف إنتاجية 8 Gen 4 لاستدلال LLM. لا تزال قابلة للاستخدام، لكنها أبطأ فقط. يكافح الجيل 8 من الجيل 2 (الرائد 2023) لكسر 3 t/s وهو غير عملي على الإطلاق.
هل يمكنني استخدام Llama 3 70B على هاتفي؟
لا. Llama 3 70B في Q4 يحتاج إلى ~43 GB من الذاكرة. لا يملك أي هاتف في 2026 أي شيء بقرب ذلك. فئة 70B هي بوضوح إقليم سطح المكتب. بالنسبة لأجهزة فئة الهاتف، 8B هو السقف العملي، مع Qwen 2.5 14B كحد أقصى على هواتف 16 GB RAM (وحتى بعدها، ببطء شديد جداً).
هل هذا يستنزف خطة البيانات الخاصة بي؟
لا - بمجرد تنزيل النموذج، تعمل جميع عمليات الاستدلال دون اتصال بالإنترنت بالكامل. يحدث التنزيل الذي تبلغ سعته 4.9 جيجابايت مرة واحدة؛ وكل شيء بعد ذلك يكون محليًا. هذا هو بيت القصيد من نماذج LLM على الجهاز.
ماذا عن الهواتف المكسورة أو الجذور؟
هذا الدليل يعمل على Android الأصلي ولا يحتاج إلى الجذر. إذا كان هاتفك لديه جذر، يمكنك استخدام llama.cpp مباشرة للحصول على تحكم أكثر قليلاً، لكن مسار MLC Chat أسرع وأسهل لـ 95% من حالات الاستخدام.
هل آيفون 17 برو أفضل لـ LLMs على الجهاز من Galaxy S26 Ultra؟
بالنسبة للميزات المدمجة (Apple Intelligence مقابل Galaxy AI)، لكل منهما نقاط قوة. لتشغيل نماذج مفتوحة الأوزان مخصصة، Galaxy أكثر مرونة - لا تعرض Apple المحرك العصبي Neural Engine لتطبيقات الطرف الثالث لاستخدام LLM بشكل عشوائي. تعمل تطبيقات مثل Private LLM الخاصة على iPhone عبر Metal/CoreML ولكن لا يمكنها استخدام المحرك العصبي Neural Engine بالطريقة التي يستخدم بها MLC Chat وحدة المعالجة العصبية السداسية على نظام Android. راجع مقارنة بين الذكاء الاصطناعي على جهاز iPhone و Galaxy على الجهاز للتفاصيل الكاملة.
الخلاصة
لم يعد تشغيل Llama 3 8B بشكل كامل على هاتف أندرويد 2026 الرائد فضولًا، بل أصبح من القدرات المفيدة اليومية التي تعمل دون اتصال بالإنترنت، وتستنزف بطارية متواضعة، وتحترم خصوصيتك افتراضيًا. MLC-LLLM هو المسار الموصى به، ويستغرق الإعداد 30 دقيقة، والنتيجة هي مساعد دردشة قادر في جيبك.
بالنسبة لمعظم المستخدمين، نماذج LLM المحلية تكمل بدلاً من أن تحل محل AI السحابية: استخدم نموذج الهاتف عندما تكون غير متصل بالإنترنت، أو عندما تكون الخصوصية مهمة، أو للأسئلة السريعة؛ استخدم النماذج السحابية للتفكير المعقد والأحداث الجارية والمهام التي تتطلب عمق النماذج الأكبر. كلاهما له مكانه، و2026 هي السنة الأولى التي تستحق فيها الجانب المحلي بحق جهد الإعداد.
