- يستضيف موقع Hugging Face نماذج التحويل من صورة إلى فيديو (I2V) التي يمكنك تشغيلها بثلاث طرق: مستضافة (hosted) مساحات (Spaces) عروض توضيحية (demos)، و واجهة برمجية للاستنتاج (Inference API/Endpoints)، أو محليًّا باستخدام مكتبة
diffusersHugging Face Transformers. - تشمل نماذج التحويل من صورة إلى فيديو المفتوحة الوزن (open-weight) الشائعة ما يلي: Wan 2.1/2.2 I2V (من شركة علي بابا)، Stable Video Diffusion (SVD/SVD-XT) من شركة Stability AI، و LTX-Video من شركة Lightricks.
- الحد الأدنى الواقعي لسعة الـ VRAM المحلية: حوالي 10–16 جيجابايت لتشغيل SVD بدقة 576×1024، و24 جيجابايت فأكثر لتشغيل Wan 2.2 I2V-A14B بدقة 720p، مع إمكانية تطبيق خدع التفريغ (offloading tricks) المذكورة في
diffusersللمعاملة مع بطاقات أصغر سعة. - إذا كنت لا ترغب في إدارة وحدات معالجة الرسوميات بنفسك، فإن الواجهات البرمجية المُستضافة مثل Wan 2.5 Kling ($0.05/ثانية) أو Kling 2.5 Turbo Pro Runway ($0.07/ثانية) تكون عادةً أرخص من شراء وحدة معالجة رسوميات.
نموذج هاغينغ فيس للتحويل من صورة إلى فيديو يشير إلى استخدام النماذج المستضافة على huggingface.co تحت وسم (tag) image-to-video لتحويل صورة ثابتة إلى مقطع فيديو قصير. ويمكنك التفاعل مع هذه النماذج بثلاث طرق: عبر العروض التوضيحية (demos) التي تُفعَّل بالنقر في المتصفح، أو عبر واجهة برمجية للاستنتاج (Inference API) مساحات (Spaces) أو نقاط النهاية (Inference Endpoints)، أو عن طريق تنزيل الأوزان وتشغيلها محليًّا باستخدام مكتبة Python. فيما يلي ما يعمل فعليًّا، حسب النموذج ومنصة التشغيل./نهايات الاستدلال، أو عن طريق تنزيل الأوزان وتشغيلها محليًّا باستخدام diffusers Hugging Face Transformers
ما الذي يشمله وسم image-to-video فعليًّا
يُرشِّح وسم الخط الإنتاجي (pipeline tag) نماذج مركز النماذج (Hub) التي يكون مدخلها المقصود صورة واحدة (مع إمكانية إدخال نص توضيحي اختياري)، ومخرجها مقطع فيديو قصير، عادةً ما يكون مدته من ثانيتين إلى 6 ثوانٍ بمعدل إطارات يتراوح بين 16 و24 إطارًا في الثانية. وفي وقت كتابة هذا المقال، تعد العائلات النشطة من النماذج المفتوحة الوزن الأكثر انتشارًا ما يلي:
| النموذج | المؤلف | الإخراج النموذجي | ترخيص الأوزان |
|---|---|---|---|
| Wan 2.2 I2V-A14B | علي بابا (Wan-AI) | دقة 720p، مدة 5 ثوانٍ، معدل إطارات 24 إطارًا في الثانية | Apache 2.0 |
| Wan 2.1 I2V-14B / I2V-1.3B | علي بابا (Wan-AI) | دقة 480p–720p، مدة نحو 5 ثوانٍ | Apache 2.0 |
| Stable Video Diffusion (SVD) | Stability AI | دقة 576×1024، 14 إطارًا | SVD غير تجاري / تجاري عبر Stability AI |
| SVD-XT | Stability AI | دقة 576×1024، 25 إطارًا | نفس ترخيص SVD |
| LTX-Video | Lightricks | دقة 768×512، مدة نحو 5 ثوانٍ بمعدل 24 إطارًا في الثانية | نسخة مُعدَّلة من OpenRAIL-M |
| CogVideoX-5B-I2V | THUDM | 720×480، مدّة 6 ثوانٍ بمعدل 8 إطارات في الثانية | رخصة Apache 2.0 (للشفرة)، ورخصة مخصصة (لأوزان النموذج) |
| image-to-video | بانتيكومار (المجتمع) | نقطة تحقق تجريبية صغيرة | راجع بطاقة النموذج |
يجب دائمًا التحقُّق من الدقة وعدد الإطارات والترخيص المذكورين في بطاقة النموذج ذاتها — فالمؤلفون يحدِّثون هذه المعلومات باستمرار. وبطاقة Wan 2.2 موجودة على الرابط huggingface.co/Wan-AI/Wan2.2-I2V-A14B، بينما توجد بطاقة SVD-XT على الرابط huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt، وبطاقة LTX-Video على الرابط huggingface.co/Lightricks/LTX-Video.
ثلاث طرق لتشغيل نموذج هاغينغ فيس للتحويل من صورة إلى فيديو
1. مساحات Hugging Face (بدون تثبيت، تعمل مباشرةً عبر المتصفح فقط)
يوفِّر مجتمع المستخدمين مساحة واحدة أو أكثر لكل نموذج رائد من نماذج التحويل من صورة إلى فيديو (I2V). انتقل إلى huggingface.co/spaces، وابحث عن اسم النموذج (مثل «Wan 2.2 I2V» أو «LTX-Video»)، ثم قم برفع صورة، واكتب مُحفِّزًا اختياريًّا، وانقر على زر توليد. وتُدار المساحات المجانية على وحدات معالجة رسوميات مشتركة من نوع ZeroGPU (شرائح H200) مع حصة يومية محددة لكل مستخدم؛ لذا إذا كانت المساحة مشغولة، فستدخل في طابور الانتظار. أما للتطبيقات الإنتاجية، فيمكنك نسخ المساحة وربطها بعتاد مدفوع عبر إعدادات المساحة.
2. واجهة برمجة التطبيقات الخاصة بالاستدلال (Inference API) ونقاط النهاية الخاصة بالاستدلال (Inference Endpoints)
تدعم واجهة الاستدلال الخدمية بدون خوادم (serverless) Python. فيما يلي ما يعمل فعليًّا، حسب النموذج ومنصة التشغيل. بعض نماذج التحويل من صورة إلى فيديو مباشرةً؛ أما بالنسبة للنماذج الأخرى، فيجب عليك نشر نقطة نهاية استدلال مخصصة Inference Endpoint على وحدة معالجة رسوميات من نوع A10G أو L4 أو L40S أو A100 أو H100. وتُحتسب تكلفة نقاط النهاية بالساعة حسب وقت تشغيل وحدة المعالجة الرسومية، لذا فإن ترك نقطة نهاية نشطة طوال الشهر سيكون مكلفًا جدًّا؛ إذ تتراوح التكلفة الشهرية لنقطة نهاية A100-80GB تعمل على مدار الساعة طوال أيام الأسبوع عادةً بين آلاف الدولارات. ويمكنك استخدام حاسبة المقارنة بين الاستضافة الذاتية وواجهة برمجة التطبيقات (API) لمقارنة التكاليف مقابل واجهات برمجة التطبيقات الخاصة بتوليد الفيديو المُحسوبة بالثانية.
3. الاستدلال المحلي باستخدام diffusers
العميل المرجعي هو مكتبة Hugging Face diffusers . للتثبيت، استخدم الأمر التالي:
pip install --upgrade diffusers transformers accelerate torch imageio imageio-ffmpeg
مثال بسيط على نموذج SVD-XT (مستند إلى بطاقة النموذج):
import torch
from diffusers import StableVideoDiffusionPipeline
from diffusers.utils import load_image, export_to_video
pipe = StableVideoDiffusionPipeline.from_pretrained(
"stabilityai/stable-video-diffusion-img2vid-xt",
torch_dtype=torch.float16, variant="fp16"
)
pipe.enable_model_cpu_offload()
image = load_image("input.png").resize((1024, 576))
frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0]
export_to_video(frames, "out.mp4", fps=7)
أما بالنسبة لنموذج Wan 2.2، فاستخدم WanImageToVideoPipeline؛ ولنموذج LTX-Video، فاستخدم LTXImageToVideoPipeline. وتأكد من الاطلاع على بطاقة النموذج للحصول على اسم الصنف الدقيق — فـ diffusers تُضيف أنابيب جديدة في كل إصدار.
الـ VRAM والأجهزة، بصراحة
يُعد التحويل من صورة إلى فيديو (I2V) أثقل من توليد الصور لأنك تقوم بإزالة الضوضاء من عدد كبير من الإطارات ضمن كامن زمني (temporal latent) دفعة واحدة. وتقدّم بطاقات النماذج وم repository الخاص بمكتبة diffusers تقديرات تقريبية تتعلق باستهلاك الذاكرة كما يلي:
| النموذج | الذاكرة الرسومية الأصلية (fp16) | مع إيقاف تشغيل النموذج على وحدة المعالجة المركزية (CPU offload) أو التكميم (quantization) |
|---|---|---|
| SVD / SVD-XT (576×1024) | ~16–20 غيغابايت | ~8–10 غيغابايت باستخدام enable_model_cpu_offload() |
| LTX-Video | ~12–24 غيغابايت حسب مدة الفيديو | يعمل على بطاقات بسعة 12 غيغابايت مع إيقاف التشغيل على وحدة المعالجة المركزية |
| Wan 2.1 I2V-1.3B | ~8–12 غيغابايت | يعمل على بطاقة RTX 3060 بسعة 12 غيغابايت |
| Wan 2.2 I2V-A14B (720p) | ~24 غيغابايت فأكثر | تناسب بطاقة سعة 16 غيغابايت عند استخدام التكميم fp8 أو GGUF من خلال إصدارات المجتمع |
| CogVideoX-5B-I2V | ~18–24 جيجابايت | ~5 غيغابايت مع إيقاف التشغيل الكامل على وحدة المعالجة المركزية (حسب ما ورد في بطاقة THUDM) |
وتتفاوت هذه الأرقام حسب الدقة وعدد الإطارات. وللإطلاع على نظرة عامة حول كيفية تغير استهلاك ذاكرة وحدة المعالجة الرسومية مع التغير في المواصفات، راجع القسم المعنون حاسبة الذاكرة VRAM و أفضل وحدات معالجة الرسوميات للنماذج المحلية — فالبطاقات نفسها (RTX 3090 و4090 و5090 وA6000) تُعتبر الخيار الأمثل أيضًا لتوليد الفيديو.
ويندوز
قم بتثبيت Python 3.10 أو 3.11 من الموقع python.org، ثم ثبّت إصدار PyTorch المدعوم بواسطة CUDA من الرابط pytorch.org/get-started/locally المتوافق مع إصدار برنامج تشغيل NVIDIA المثبت لديك. وبعد إنشاء بيئة افتراضية (venv)، نفّذ الأمر pip install diffusers transformers accelerate، وعيّن HF_HOME إلى قرص به مساحة فارغة تزيد عن ٥٠ جيجابايت — فملفات أوزان نموذجي Wan وCogVideoX كبيرة جدًّا. ولا يدعم نظام ويندوز تقنية ROCm؛ لذا يجب على مستخدمي معالجات AMD استخدام WSL2 أو نظام لينكس. ولواجهة مستخدم أكثر سهولة، ComfyUI يحتوي على سير عمل جاهز مدمج لـ SVD وWan وLTX-Video.
macOS
يعمل معالج آبل Silicon (من M1 إلى M4) diffusers عبر واجهة MPS. ثبِّت PyTorch مع دعم MPS، ثم مرر torch_dtype=torch.float16 و .to("mps"). وبشكل واقعي، يُنتج نموذج SVD مقطع فيديو مكوَّن من ٢٥ إطارًا على معالج M2 Max خلال عدة دقائق؛ أما نموذج Wan 2.2 A14B فهو غير عملي على أي جهاز لا يمتلك ذاكرة موحدة تبلغ ٦٤ جيجابايت على الأقل. ويُعد نموذج LTX-Video حاليًّا أنسب نموذج لإنشاء الفيديو من الصورة (I2V) على أجهزة ماك بسبب عدده الأقل من خطوات التوليد. أما أجهزة ماك المزودة بمعالجات إنتل فلا تدعم أي مسار فعّال باستخدام وحدة معالجة الرسوميات — استخدم بدلًا منها واجهة برمجية مضيفة (hosted API).
لينكس
يُعتبر نظام لينكس الهدف الأساسي. ثبِّت برنامج تشغيل NVIDIA، وبيئة تشغيل CUDA 12.x (المضمَّنة في حزم PyTorch)، ثم pip install diffusers transformers accelerate. وللاستخدام متعدد وحدات معالجة الرسوميات أو للمقاطع الطويلة، استخدم accelerate config و pipe.enable_sequential_cpu_offload(). إكسفورمرز و torch.compile() توفر تسريعًا كبيرًا لـ SVD وWan على بطاقات Ampere/Ada/Hopper.
متى يجب تجاوز هاغينغ فيس واستخدام واجهة برمجية مُستضافة لإنشاء الفيديو
إذا كنت بحاجة إلى مقطع فيديو قصير واحد يوميًّا، فإن استخدام مساحة (Space) أو بطاقة RTX محلية كافٍ. أما إذا احتجت إلى إنتاجية موثوقة، فإن واجهات برمجة التطبيقات المضيفة (hosted APIs) المدفوعة حسب الثانية غالبًا ما تكون أرخص من دفع تكلفة نقطة نهاية (endpoint) لبطاقة A100 أو H100 دون استخدامها بكفاءة:
- Wan 2.5 — بدءًا من ٠٫٠٥ دولار أمريكي للثانية (من نفس السلالة التي تنتمي إليها أوزان Wan المفتوحة على Hub)
- Sora 2 — بدءًا من ٠٫٠٥ دولار أمريكي للثانية؛ Sora 2 Pro بدءًا من ٠٫١٥ دولار أمريكي للثانية
- Veo 3.1 — بدءًا من ٠٫٠٥ دولار أمريكي للثانية
- Kling 2.5 Turbo Pro — بدءًا من ٠٫٠٧ دولار أمريكي للثانية
وبسعر ٠٫٠٥ دولار أمريكي لكل ثانية، تكلفة إنتاج ١٠٠٠ مقطع فيديو مدته خمس ثوانٍ هي ٢٥٠ دولارًا أمريكيًّا؛ بينما تأجير بطاقة H100 بمعدلات السحابة النموذجية لتحقيق نفس الإنتاجية عادةً ما يكلِّف أكثر. استخدم حاسبة تكلفة واجهة برمجة التطبيقات (API) وتصفح قاعدة بيانات النماذج للاطلاع على أسعار الخدمة الحالية.
الأسئلة الشائعة
هل يوجد نموذج وحيد على منصة Hugging Face مخصص لإنشاء الفيديو من الصورة ينبغي أن أبدأ به افتراضيًّا؟
لا يوجد نموذج افتراضي واحد. بالنسبة للأوزان المفتوحة والترخيص المرن، يُنتج نموذج Wan 2.2 I2V-A14B حاليًّا أفضل إخراج بدقة 720p، لكنه يتطلب 24 جيجابايت أو أكثر من الـ VRAM. وعلى بطاقات الرسوميات بسعة 12 جيجابايت، فإن نموذجي LTX-Video أو Wan 2.1 I2V-1.3B هما الخياران العمليان. أما نموذج SVD-XT فهو أقدم لكن وثائقه ممتازة جدًّا.
هل يمكنني استخدام هذه النماذج تجاريًّا؟
يعتمد ذلك على النسخة (checkpoint) المستخدمة. فنسخ Wan 2.1/2.2 ورمز CogVideoX ونموذج LTX-Video تتمتع جميعها بترخيص مرن، لكن كلًّا منها يخضع لشروطه الخاصة؛ أما أوزان Stable Video Diffusion فهي موزَّعة بموجب رخصة مجتمعية من شركة Stability، مع طبقة تجارية منفصلة. اقرأ دائمًا قسم «الترخيص» في بطاقة النموذج (model card) قبل إصدار أي منتج أو توزيعه.
لماذا يرتجف إخراجي أو يبدو وكأنه عرض شرائح؟
عادةً ما يكون السبب واحدًا مما يلي: عدد خطوات الاستنتاج (inference steps) قليل جدًّا (ارفع قيمة num_inference_steps), motion_bucket_id/guidance_scale التي تم ضبطها منخفضة جدًّا بالنسبة لـ SVD، أو صورة إدخال نسبة العرض إلى الارتفاع فيها لا تتطابق مع دقة التدريب الخاصة بالنموذج. لذا يجب مطابقة دقة النموذج الأصلية (مثل ١٠٢٤×٥٧٦ لـ SVD-XT) قبل التوليد.
هل يمكنني تشغيل نموذج التحويل من صورة إلى فيديو على جهاز كمبيوتر محمول يحتوي على 8 جيجابايت من الـ VRAM؟
فقط مع أصغر النماذج وباستخدام تقنيات التفريغ القصوى (aggressive offloading). ويمكن تشغيل نموذجي Wan 2.1 I2V-1.3B وLTX-Video المُكمَّشَين محليًّا، لكن يجب أن تتوقع دقائق لكل مقطع. أما لأي نموذج أكبر من ذلك، فستكون واجهات الواجهات البرمجية المُستضافة (hosted API) أو المساحات (Spaces) أسرع وأرخص من محاولة التغلب على أخطاء استنفاد الذاكرة (OOM errors).
هل يدعم Ollama نموذج التحويل من صورة إلى فيديو؟
كلا. فـ Ollama يركّز على نماذج اللغة الكبيرة النصية والمتعددة الوسائط (LLMs)، وليس على أنابيب انتشار الفيديو (diffusion video pipelines). راجع دليل Ollama لمعرفة ما يغطيه بالفعل؛ أما لإنشاء الفيديو من الصورة (I2V)، فالخيار الأمثل هو diffusers أو ComfyUI.
كم يستغرق إنشاء مقطع واحد على وحدة معالجة رسوميات استهلاكية (GPU)؟
بالتقريب: يُنتج نموذج SVD-XT على بطاقة RTX 4090 مقطع فيديو مكوَّن من ٢٥ إطارًا في أقل من دقيقة بكثير عند الإعدادات الافتراضية؛ أما نفس النموذج مع enable_model_cpu_offload() على بطاقة سعة ١٢ جيجابايت فهو أبطأ بعدة مرات. كما أن نموذج Wan 2.2 A14B عند دقة ٧٢٠ بكسل أثقل بكثير. وتختلف الأرقام الدقيقة باختلاف عدد الخطوات، والدقة، وإصدار PyTorch، لذا اعتبر أي نتيجة مفردة تراها في اختبار أداء (benchmark) مجرد تقدير.
