- واجهة برمجة التطبيقات للاستدلال من Hugging Face — المعروفة رسميًا الآن باسم مقدمو استنتاجات النماذج — توجه الطلبات إلى Groq و Together AI و Fireworks و Cerebras وغيرها من خلال رمز HF واحد عند
https://router.huggingface.co/v1. - الطبقة المجانية: 0.10 دولار/شهر في أرصدة للحسابات المجانية،2.00 دولار/شهر لمستخدمي PRO. توفر HF معدلات المزود من خلال بدون هامش ربح.
- المزود السابق
hf-inferenceيركز الآن على الاستدلال من فئة المعالج؛ نماذج GPU توجه إلى مزودي طرف ثالث بسعة دافئة. - استخدم Inference Endpoints عندما تحتاج إلى نموذج خاص أو نموذج معايرة، سعة GPU مضمونة، أو زمن استجابة متسق — بدءًا من 0.50 دولار/ساعة لـ NVIDIA T4 على AWS.
توفر واجهة برمجة التطبيقات للاستدلال من Hugging Face للمطورين إمكانية الوصول عبر REST إلى مئات النماذج مفتوحة الأوزان — نماذج اللغة الكبيرة وموديلات الدمج وموليدات الصور والكلام والمصنفات — دون الحاجة إلى توفير أي بنية تحتية. تقوم بالمصادقة برمز HF واحد، وإرسال الطلبات إلى طبقة التوجيه الخاصة بـ Hugging Face، وتقوم بتوزيعها إلى أيهما من مزودي الخدمة الأساسيين لديه النموذج جاهز. اعتبارًا من 2025، تُعرّف هذه الخدمة رسميًا باسم مقدمو استنتاجات النماذج، لكن تدفق الرمز وعنوان URL الأساسي ونمط الاستخدام الأساسي يبقى كما هو مع واجهة برمجة التطبيقات للاستدلال الأصلية.
- ما هي واجهة برمجة التطبيقات للاستدلال من Hugging Face (وماذا تغير)
- كيف يعمل جهاز التوجيه
- المصادقة والطلب الأول الخاص بك
- الطبقة المجانية والأرصدة وما يحدث بعد ذلك
- البدء البارد ومزود hf-inference
- واجهة برمجة التطبيقات للاستدلال مقابل نقاط نهاية الاستدلال
- مقارنة الأسعار مع مزودي الخدمات الآخرين
- عندما تكون نقاط النهاية المخصصة أو الاستضافة الذاتية أفضل
- الأسئلة الشائعة
ما هي واجهة برمجة التطبيقات للاستدلال من Hugging Face (وماذا تغير)
في الأصل، أشارت "واجهة برمجة التطبيقات للاستدلال" إلى خدمة بدون خادم مستضافة من قبل Hugging Face على api-inference.huggingface.co التي حملت النماذج حسب الطلب. هذه الخدمة لا تزال موجودة باسم hf-inference مزود، لكن اعتبارًا من يوليو 2025 يركز على الاستدلال من فئة المعالج: الدمج والتصنيف النصي و NER والتلخيص والنماذج الأصغر ذات الأهمية التاريخية مثل BERT أو GPT-2.
للاستدلال المسرّع بـ GPU — نماذج اللغة الكبيرة وتوليد الصور والكلام — توجه Hugging Face الآن من خلال مزودي شركاء: Groq و Together AI و Fireworks و Cerebras و DeepInfra و Replicate و Fal AI وغيرها. الواجهة لم تتغير: رمز واحد وعنوان URL أساسي واحد وتنسيق طلب متوافق مع OpenAI. عنوان URL جهاز التوجيه هو https://router.huggingface.co/v1. القديم api-inference.huggingface.co لا يزال عنوان URL يتعامل مع الاتصالات القديمة مع hf-inference، لكن التكاملات الجديدة يجب أن توجه إلى جهاز التوجيه.
كيف يعمل جهاز التوجيه
عندما ترسل طلبًا إلى router.huggingface.co، تختار Hugging Face مزودًا بناءً على سياسة تُلحقها بمعرّف النموذج:
| لاحقة السياسة | السلوك |
|---|---|
:fastest (افتراضي) |
مزود الإنتاجية الأعلى المتاح حاليًا |
:cheapest |
أقل سعر لكل رمز إخراج |
:preferred |
قائمة تفضيلاتك المرتبة من إعدادات HF |
:groq, :togetherإلخ. |
فرض مزود معين باسم |
ألحق السياسة مباشرة بسلسلة معرّف النموذج: "deepseek-ai/DeepSeek-R1:cheapest". عند حذف لاحقة الافتراضي :fastest. إعادة التوجيه التلقائي مدرجة — إذا تم وضع علم على المزود المحدد كغير متاح، يعيد جهاز التوجيه التوجيه إلى بديل.
المصادقة والطلب الأول الخاص بك
انتقل إلى huggingface.co/settings/tokens، قم بإنشاء Fine-grained رمز، وتفعيل الـ إجراء طلبات إلى مقدّمي الاستنتاجات تصريح. اضبطه على HF_TOKEN في بيئة التشغيل الخاصة بك.
Python — huggingface_hub
pip install huggingface_hub
import os
from huggingface_hub import InferenceClient
client = InferenceClient() # reads HF_TOKEN from environment
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324",
messages=[{"role": "user", "content": "Explain tokenization in two sentences."}],
)
print(completion.choices[0].message.content)
Python — OpenAI drop-in
from openai import OpenAI
import os
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3-0324:fastest",
messages=[{"role": "user", "content": "Explain tokenization in two sentences."}],
)
print(completion.choices[0].message.content)
cURL
curl https://router.huggingface.co/v1/chat/completions
-H "Authorization: Bearer $HF_TOKEN"
-H "Content-Type: application/json"
-d '{
"model": "deepseek-ai/DeepSeek-V3-0324:fastest",
"messages": [{"role": "user", "content": "Explain tokenization in two sentences."}]
}'
نقطة النهاية المتوافقة مع OpenAI تغطي إكمال الدردشة فقط. للمهام الأخرى — تحويل النص إلى صورة، والتضمينات، وتحويل الكلام إلى نص — استخدم huggingface_hub مكتبة Python أو @huggingface/inference SDK للـ JavaScript، والتي تتعامل مع صيغة الطلب الخاصة بكل مزود تلقائياً.
الطبقة المجانية والأرصدة وما يحدث بعد ذلك
يحصل كل حساب Hugging Face على رصيد شهري يُطبق تلقائياً على الطلبات الموجهة:
| نوع الحساب | الرصيد الشهري | الدفع حسب الاستخدام بعد؟ |
|---|---|---|
| مجاني | $0.10 (قابل للتغيير) | نعم — يتطلب شراء أرصدة |
| PRO | $2.00 | نعم |
| الفريق / المؤسسة | $2.00 لكل مستخدم، مجمّع | نعم |
بمجرد انتهاء أرصدتك، لن يتوقف الوصول — تشتري أرصدة إضافية للمتابعة. تفرض Hugging Face عليك نفس السعر الذي يفرضه المزود، بدون رسوم إضافية. تكلفة طلب معين تعتمد على النموذج والمزود؛ يمكنك تتبع النفقات حسب النموذج والمزود على huggingface.co/settings/inference-providers/overview.
إذا كان لديك بالفعل حسابات مع مزود معين، يمكنك تعيين مفتاح مزود مخصص في إعدادات HF. الطلبات لا تزال تمر عبر HF، لكن المزود يحاسبك مباشرة ولا تنطبق أرصدتك الشهرية على HF. قبل الالتزام بحجم معين، استخدم حاسبة تكلفة واجهة برمجة التطبيقات (API) لتوقع النفقات الشهرية حسب النموذج وحجم الاستدعاءات.
البدء البارد ومزود hf-inference
المزود السابق hf-inference يحمّل المزود النماذج عند الطلب. عندما لم يتم استدعاء نموذج مؤخراً وأصبح غير نشط، فإن الطلب الأول يؤدي إلى تحميل النموذج قبل أن تبدأ الاستجابة — بداية باردة. هذا يضيف زمن انتظار ملحوظ لهذا الاستدعاء الأول.
اعتباراً من يوليو 2025، hf-inference يركز على استدلال CPU: نماذج التضمين، المصنفات، NER، نماذج النصوص الأصغر. البدايات الباردة ذات صلة أكثر في هذا السياق.
بالنسبة لأحمال العمل المسرعة بـ GPU — النماذج اللغوية الكبيرة، توليد الصور — يوجه الموجّه الطلبات إلى مزودي جهات خارجية مثل Groq أو Together AI الذين يشغلون سعة GPU مشتركة دافئة. البدايات الباردة ليست مصدر قلق لهؤلاء المزودين بنفس الطريقة، رغم أنك تشارك السعة وليس لديك ضمان الإنتاجية أثناء طفرات حركة المرور.
إذا كانت زمن انتظار البداية الباردة أو تنوع الإنتاجية غير مقبول — على سبيل المثال، لنقطة نهاية الإنتاج حساسة لزمن الانتظار — فإن Inference Endpoint مخصص هو الحل.
واجهة برمجة التطبيقات للاستدلال مقابل نقاط نهاية الاستدلال
لدى منصة Hugging Face منتجين مختلفين للاستدلال. يشتركان في نفس نظام الرموز وHub النموذج، لكنهما يعملان بطرق مختلفة جداً:
| Inference Providers (API) | Inference Endpoints (Dedicated) | |
|---|---|---|
| البنية الأساسية | مشتركة، تدار بواسطة مزودي الشركاء | مثيل GPU مخصص في المنطقة التي تختارها |
| نموذج التسعير | الدفع لكل طلب بأسعار المزود | فواتير كل دقيقة أثناء التشغيل أو التهيئة |
| البدايات الباردة | ممكنة على نماذج hf-inference CPU | لا توجد أثناء تشغيل نقطة النهاية |
| النماذج الخاصة | لا — نماذج Hub عامة فقط | نعم — مستودعات خاصة ونماذج دقيقة التدريب |
| التحكم بالأجهزة | لا يوجد | اختر نوع GPU والعدد والمنطقة |
| الحد الأدنى للتكلفة | $0 (ضمن الأرصدة المجانية) | ~$0.50/hr قيد التشغيل (AWS NVIDIA T4) |
يتم فرض فواتير Inference Endpoints لكل دقيقة فقط أثناء وجودها في حالة running أو initializing — نقاط النهاية المتوقفة مؤقتاً لا تكلف شيئاً. تتراوح خيارات AWS GPU من T4 بسعر $0.50/hr (14 GB VRAM) إلى H200 بسعر $5.00/hr لكل بطاقة (141 GB VRAM). تتضمن خيارات GCP H100 بسعر $10.00/hr لكل بطاقة (80 GB VRAM). قبل اختيار مستوى معين، استخدم حاسبة الذاكرة VRAM للتحقق من أن نموذجك يناسب GPU المستهدف.
مقارنة الأسعار مع مزودي الخدمات الآخرين
نظراً لأن Hugging Face توجه الطلبات إلى نفس المزودين الأساسيين — Together AI و Fireworks و DeepInfra و Groq — التي يمكنك الوصول إليها مباشرة أو من خلال OpenRouter، فإن أسعار كل رمز لنموذج معين متطابقة بشكل عام. لا تضيف HF أي علامة إضافية.
الفروقات العملية:
- الأرصدة المجانية: تعطيك HF $0.10–$2.00/شهر من الاستخدام المجاني تلقائياً. ليس لدى OpenRouter والمزودين المباشرين ما يعادل هذا المخصص الشهري.
- نطاق النموذج: تركز HF Inference Providers على النماذج مفتوحة الأوزان من Hub. يغطي OpenRouter أيضاً النماذج المغلقة المصدر (GPT-4o و Claude و Gemini). إذا كنت تحتاج إلى نماذج مفتوحة وملكية معاً في موجّه واحد، يغطي OpenRouter مساراً أوسع.
- المهام غير المتعلقة بالدردشة: التضمينات وتوليد الصور والكلام متاحة عبر SDK الخاص بـ HF. معظم الموجهات المنافسة تقتصر على إكمال الدردشة فقط.
- توحيد الفواتير: يغطي حساب HF واحد جميع المزودين، مع لوحة معلومات استخدام واحدة. تتطلب حسابات المزود المباشر علاقات فواتير منفصلة لكل واحد.
للحصول على مقارنة نموذج كاملة حسب السعر والقدرات، راجع قاعدة بيانات نماذج الذكاء الاصطناعي تغطية المواصفات والأسعار عبر النماذج الرئيسية.
عندما تكون نقاط النهاية المخصصة أو الاستضافة الذاتية أفضل
استخدم مزودي الاستدلال عندما تكون في مرحلة النمذجة الأولية، أو لديك حمل متغير أو غير متوقع، وتحتاج إلى الوصول إلى كتالوج نموذج عام واسع دون إدارة الخوادم.
انتقل إلى نقطة نهاية Inference Endpoint مخصصة عندما:
- تحتاج إلى خدمة نموذج معدّل بدقة أو خاص غير متاح على Hub العام.
- تكون اتساقية الكمون متطلباً — يمكن لمزودي الخدمة المشتركة أن يكون لديهم أوقات استجابة متغيرة تحت الحمل.
- تحتاج إلى معدل نقل مضمون لـ SLA الإنتاج.
تأمل في استضافة ذاتية عندما يكون حجم استدعاءاتك مرتفعاً بدرجة كافية بحيث تتجاوز تكاليف كل رمز تكلفة الامتلاك المطفأة للأجهزة، أو عندما تحظر متطلبات خصوصية البيانات إرسال المدخلات إلى واجهات برمجة تطبيقات الطرف الثالث. الحاسبة نقطة التعادل بين الاستضافة المحلية وواجهة برمجة التطبيقات (API) يوفر مقارنة تكلفة ملموسة بناءً على حجم طلباتك وحجم النموذج. للحصول على توصيات الأجهزة إذا اتخذت هذا الطريق، انظر إلى أفضل وحدات معالجة الرسومات لتشغيل النماذج اللغوية الكبيرة محليًّا.
الأسئلة الشائعة
ما الفرق بين Inference API و Inference Endpoints؟
Inference API (الآن Inference Providers) هي خدمة مشتركة تُدفع حسب الطلب وتوجه إلى مزودي GPU الشركاء وبنية CPU الخاصة بـ HF. Inference Endpoints عبارة عن نسخ GPU مخصصة تقوم بتوفيرها في منطقة سحابية؛ تشغل نموذجاً واحداً بشكل مستمر ويتم فرض رسوم عليها في الدقيقة من وقت التشغيل. استخدم API للنمذجة الأولية والأحمال المتغيرة؛ استخدم Endpoints لضمانات كمون الإنتاج والنماذج الخاصة أو المعدّلة بدقة.
هل أحتاج إلى اشتراك Pro لاستخدام Inference API؟
لا. الحساب المجاني يحصل على 0.10 دولار/شهر في اعتمادات، وهو كافٍ للتجريب الخفيف. يتلقى مشتركو PRO 2.00 دولار/شهر. كلا المستويين يدعمان مشتريات الاعتمادات المدفوعة مقابل الاستخدام بمجرد استنفاد البدل الشهري. ميزة خطة PRO الرئيسية في الاستدلال هي مبلغ الاعتماد الشهري الأعلى، وليس الوصول المقيد بالنماذج أو المزودين.
لماذا يكون طلبي الأول أبطأ بكثير من الطلبات التالية؟
إذا كنت توجه إلى مزود hf-inference فإنه يحمّل النماذج عند الحاجة. يجب تحميل نموذج خامل إلى الذاكرة قبل أن يكتمل طلبك، مما يضيف كمون إلى هذا الاستدعاء الأول. لا ينطبق هذا على مزودي GPU مثل Groq أو Together AI، الذين يشغلون بنية تحتية مشتركة دافئة. تحديد :fastest أو مزود GPU محدد معين في معرّف النموذج سيتجنب هذا التأخير تماماً.
هل HF Inference API متوافق مع OpenAI Python SDK؟
نعم، لإكمالات الدردشة. عيّن base_url="https://router.huggingface.co/v1" وأسند رمز HF الخاص بك كـ api_key. وكتلة /v1/chat/completions و /v1/models endpoints متوافقة مع OpenAI. لأنواع مهام أخرى — التضمينات، توليد الصور، الكلام — تحتاج إلى huggingface_hub مكتبة Python أو @huggingface/inference JS SDK؛ لا يتم تغطيتها من خلال نقطة النهاية المتوافقة مع OpenAI.
هل يمكنني خدمة نموذج معدّل بدقة من خلال Inference API؟
ليس من خلال Inference Providers — فهو يخدم فقط النماذج المتاحة في كتالوج Hub العام والمدعومة من قبل مزود شريك. لنموذج خاص أو معدّل بدقة، قم بنشر Inference Endpoint مخصص، والذي يدعم مستودعات Hub الخاصة ويسمح لك بإحضار أوزان النموذج الخاصة بك إلى نسخة GPU تتحكم فيها.
كيف أتابع وأتحكم في التكاليف؟
تفصيل استخدامك حسب النموذج والمزود موجود في huggingface.co/settings/inference-providers/overview. يمكن لمسؤولي الفريق والمؤسسة تعيين حدود الإنفاق وتعطيل مزودي معينين من صفحة إعدادات المنظمة. للحصول على تقديرات التكاليف المستقبلية قبل أن تبدأ في البناء، استخدم حاسبة تكلفة واجهة برمجة التطبيقات (API).
