Saturday, 29 August 2026 | التحديث اليومي نظرة ثاقبة للذكاء الاصطناعي، مكتوبة للبناة

كيفية تحويل صورة إلى فيديو باستخدام الذكاء الاصطناعي (2026): النماذج، التكاليف، والخيارات المجانية

أبرز النقاط المستخلصة

  • يقبل كل نموذج فيديو رائد حاليًا صورةً كإطار ابتدائي
    Sora 2, Veo 3.1, Kling 2.5 Turbo Pro و Wan 2.5 ويقبل جميعها إدخال النص أو الصورة.
  • يتم احتساب تكلفة إنشاء الفيديو من الصورة بنفس المعدل لكل ثانية كما في حالة إنشائه من النص على هذه النماذج.
    يتم فرض الرسوم وفقًا لمدة الفيديو الناتج، وليس وفقًا لكيفية بدء التصوير.
  • أرخص خيار هو ٠٫٠٥ دولار أمريكي لكل ثانية — Veo 3.1 Lite بدقة 720p أو Wan 2.5 —
    وبالتالي فإن توليد مقطع فيديو مدته ٥ ثوانٍ من صورة ثابتة يكلف حوالي ٢٥ سنتًا أمريكيًا في كل محاولة.
  • توجد طبقات مجانية، لكنها محدودة جدًّا وتتغيّر باستمرار. فعلى سبيل المثال، تقدّم Runway
    ١٢٥ رصيدًا لمرة واحدة لا يتجدد.

تحويل صورة ثابتة إلى مقطع متحرك أصبح الآن ميزةً رئيسيةً بدلًا من كونه بحثًا
قطعة فنية — يوفّر الجزء الأكبر من العمل. ويغطي هذا الصفحة النماذج التي تقبل الصور كمدخل، ومعدل التكلفة لكل ثانية من الفيديو الناتج، وأين تنتهي فعالية الخيارات المجانية.
يغطي هذا الصفحة النماذج التي تقبل الصور كمدخل، ومعدل التكلفة لكل ثانية من الفيديو الناتج، وأين تنتهي فعالية الخيارات المجانية.
هذه الصفحة تغطي النماذج التي تقبل الصور كمدخل، ومعدل التكلفة لكل ثانية من الفيديو الناتج، وأين تنتهي فعالية الخيارات المجانية.

الإجابة السريعة: كيف تحوّل صورةً إلى فيديو باستخدام الذكاء الاصطناعي؟

تُرسل إلى نموذج الفيديو صورتك كإطار أول، مع إدخال نص قصير يصف الحركة المرغوبة، ثم تدفع مقابل كل ثانية من الفيديو الناتج. ويدعم كل نموذج رائد متاح في السوق هذه الميزة:
Sora 2، Veo 3.1، Kling 2.5 Turbo Pro وWan 2.5 تقبل جميعها إدخال النص أو الصورة.
Sora 2، Veo 3.1، Kling 2.5 Turbo Pro وWan 2.5 تقبل جميعها إدخال النص أو الصورة.
أرخص نموذج هو ٠٫٠٥ دولار أمريكي لكل ثانية من الفيديو النهائي، ما يجعل توليد مقطع مدته ٥ ثوانٍ يكلف تقريبًا
٠٫٢٥ دولار أمريكي لكل توليد، قبل المحاولات المتكررة. وتوجد أدوات مجانية تعمل عبر المتصفح ويمكنها توليد حركة من صورة دون الحاجة إلى بطاقة دفع، لكنها تحدّ من الدقة، وتُضيف علامات مائية، وتمنح رصيدًا محدودًا ثابتًا بدلًا من رصيدٍ يتجدد دوريًّا.
وتمنح رصيدًا محدودًا ثابتًا بدلًا من رصيدٍ يتجدد دوريًّا.
وتمنح رصيدًا محدودًا ثابتًا بدلًا من رصيدٍ يتجدد دوريًّا.

أي النماذج تقبل الصورة كمدخل؟

هذه النقطة هي التي يغفل عنها معظم صفحات المقارنة. فالإدخال على هيئة صورة ليس طبقة منتج منفصلة — بل هو وضع تشغيلي لنفس النموذج، وبسعر متطابق تمامًا:
فالإدخال على هيئة صورة ليس طبقة منتج منفصلة — بل هو وضع تشغيلي لنفس النموذج، وبسعر متطابق تمامًا:

النموذج المطوّر المدخلات من (لكل ثانية)
Veo 3.1 جوجل نص، صورة 0.05 دولار (طبقة Lite، دقة 720p)
Wan 2.5 علي بابا نص، صورة ٠٫٠٥ دولار (عبر fal)
Kling 2.5 Turbo Pro Kuaishou نص، صورة ٠٫٠٧ دولار (عبر fal)
Sora 2 OpenAI نص، صورة 0.05 دولار (طبقة الدُفعات، دقة 720p)
Sora 2 Pro OpenAI نص، صورة ٠٫١٥ دولار (دفعة جماعية، دقة 720p)

ملاحظة زمنية مهمة إذا كنت تختار اليوم: حددت OpenAI
24 سبتمبر 2026 تاريخ ١٥ أبريل ٢٠٢٥ كموعد لإيقاف خدمة Videos API وكلا نموذجي Sora 2،
بدون تحديد بديل حتى الآن. فإذا كنت تبدأ سير عمل لإنشاء فيديو من صورة الآن، فإن البدء على Sora يعني أنك تبدأ على عدّاد تنازلي.
بدون تحديد بديل حتى الآن. فإذا كنت تبدأ سير عمل لإنشاء فيديو من صورة الآن، فإن البدء على Sora يعني أنك تبدأ على عدّاد تنازلي.

ما التكلفة اللازمة لتوليد حركة من صورة واحدة؟

وبما أن الفوترة تتم حسب عدد ثواني الفيديو الناتج، فإن تكلفة مقطع فيديو مُنشأ من صورة تساوي ببساطة المعدل مضروبًا في المدة التي تطلبها:
وبما أن الفوترة تتم حسب عدد ثواني الفيديو الناتج، فإن تكلفة مقطع فيديو مُنشأ من صورة تساوي ببساطة المعدل مضروبًا في المدة التي تطلبها:

النموذج والطبقة مقطع مدته ٥ ثوانٍ مقطع مدته ١٠ ثوانٍ مقطع مدته ٣٠ ثانية
Veo 3.1 Lite، دقة 720p $0.25 $0.50 $1.50
Wan 2.5 $0.25 $0.50 $1.50
Kling 2.5 Turbo Pro $0.35 $0.70 $2.10
Veo 3.1 Lite، دقة 1080p $0.40 $0.80 $2.40
Veo 3.1 Fast، دقة 1080p $0.60 $1.20 $3.60
Veo 3.1 Standard، دقة 4K $3.00 $6.00 $18.00

هذه الأرقام تخص كل عملية توليد ناجحة. وعادةً ما تتطلب عملية التحويل من صورة إلى فيديو عدد محاولات أقل مقارنةً بـ
لأن الإطار الأول محدّد مسبقًا وأنت توجّه فقط الحركة — لكن لقطة تتطلّب ثلاث محاولات ستتكلّف ثلاثة أضعاف المبلغ المذكور أعلاه. خطّط لميزانيتك وفق معدل إعادة المحاولة الخاص بك، وليس وفق التعريفة المعلنة.
خطّط لميزانيتك وفق معدل إعادة المحاولة الخاص بك، وليس وفق التعريفة المعلنة.
خطّط لميزانيتك وفق معدل إعادة المحاولة الخاص بك، وليس وفق التعريفة المعلنة.

هل توجد طريقة مجانية فعلًا للقيام بذلك؟

نعم، ولكن ضمن حدودٍ يستحق فهمها قبل الاعتماد عليها. فالطبقات المجانية في هذه الفئة تهدف إلى الترويج لا إلى الاستقرار الهيكلي: فهي موجودة لدفعك نحو الخطة المدفوعة، وشروطها قابلة للتغيير.
فالطبقات المجانية في هذه الفئة تهدف إلى الترويج لا إلى الاستقرار الهيكلي: فهي موجودة لدفعك نحو الخطة المدفوعة، وشروطها قابلة للتغيير.
والشروط قابلة للتغيير.

Runway هو المثال الأوضح المنشور. وتقدّم صفحة أسعاره
١٢٥ اعتمادًا لمرة واحدة فرصة تجربة الأدوات — عبر إيداع ثابت غير قابل للتجديد — مع
خطط مدفوعة تبدأ من ١٢ دولارًا أمريكيًّا شهريًّا عند الاشتراك السنوي، ثم ٢٨ و٧٦ دولارًا أمريكيًّا للطبقتين الأعلى.

وتُعلن أدوات أخرى عن سعات مجانية يومية بدلًا من ذلك، وهذه الأرقام تتغيّر بشكلٍ متكررٍ جدًّا
لدرجة أن أي رقم يُذكر في مدوّنة ما يستحق إعادة التحقق منه على الصفحة الرسمية للمزوِّد قبل أن تبني خطتك
حوله. وإن كانت الأرقام تتفاوت، فإن النمط العام للفئات المجانية يظل ثابتًا: افترض وجود
سقف أدنى للدقة، وعلامة مائية مرئية، وأقصى مدة مسموحة للمقطع أقصر، وطابور انتظار أبطأ.

الحصول على نتيجة جيدة من صورة ثابتة

يختلف نوع التلميح المطلوب في التحويل من صورة إلى فيديو عما هو مطلوب في التحويل من نص إلى فيديو. فالموديل لا يخترع
المشهد — بل لديه بالفعل مشهدٌ جاهز — ولذلك يجب أن يصف التلميح الحركةوليس المحتوى.

  • صف الكاميرا، وليس الموضوع. «اقتراب بطيء للداخل، وعمق مجال ضحل»
    يمنح الموديل مهمةً محددةً. أما «منظر جبلي جميل» فهو وصف لما يستطيع رؤيته بالفعل.
  • اذكر حركة واحدة فقط، لا ثلاث حركات. غالبًا ما تؤدي التعليمات المركبة خلال مقطع قصير إلى
    إنتاج لقطة لا تُنفِّذ أيًّا منها بدقة.
  • ابدأ من إطار نظيف عالي الدقة. وتتفاقم آثار الضغط والحبوب الظاهرة بشدة في الصورة الأصلية عبر كل إطار يتم توليده.
    اجعل المقاطع قصيرةً وافصل بينها بالقص.
  • تنخفض درجة الاتساق مع زيادة الطول في جميع الموديلات الحالية؛ لذا فإن أربع لقطات مدتها خمس ثوانٍ، محرَّرة معًا، تكون أفضل من لقطة واحدة مدتها عشرون ثانية. توقع أن تكون الوجوه والأيدي نقطة الفشل الرئيسية.
    إذا احتوت الصورة الثابتة على إحداهما أو كليهما،
  • فاحسب عدد محاولات إعادة التوليد المطلوبة أكبر مما ستكون عليه في حالة منتج أو منظر طبيعي. الأرخص عمليًّا:
    Veo 3.1 Lite بدقة ٧٢٠ بكسل أو Wan 2.5، وكلاهما بسعر ٠٫٠٥ دولار أمريكي لكل ثانية.

أيُّهما يجب أن تستخدم؟

  • أفضل تحسين من حيث الجودة مقابل السعر: Veo 3.1 Fast بدقة ١٠٨٠ بكسل، بسعر ٠٫١٢ دولار أمريكي لكل ثانية.
  • عندما تكون دقة الإخراج هي المتطلب الأساسي: Veo 3.1 Standard بدقة ٤K، بسعر ٠٫٦٠ دولار أمريكي لكل
  • ثانية — وهي الطبقة الوحيدة بدقة ٤K ضمن هذه المجموعة، باستثناء الطبقة Fast التي تبلغ تكلفتها ٠٫٣٠ دولار أمريكي. إذا كنت تجربه لأول مرة فقط:
    فإن الطبقة المجانية عبر المتصفح تكفي تمامًا لمعرفة ما إذا كانت الفكرة
  • تعمل أساسًا، قبل أن تصبح أي من الخيارات المذكورة أعلاه جديرة بالتهيئة. نعم من الناحية التقنية — فكل موديل مذكور هنا يقبل صورةً عشوائية كإطار أول. لكن النتائج
    تتفاوت اختلافًا كبيرًا حسب الصورة الأصلية: فالصور الثابتة النظيفة والمُضاءة جيدًا عالية الدقة تتحرك بموثوقية أعلى بكثير

الأسئلة الشائعة

هل يمكن للذكاء الاصطناعي تحويل أي صورة إلى فيديو؟

من الصور المضغوطة أو ذات الملمس الكثيف، كما أن الصور التي تحتوي وجوهًا أو أيديًا تتطلب محاولات أكثر.
لا. ففي جميع الموديلات المذكورة أعلاه، تُحسب التكلفة لكل ثانية من الفيديو الناتج، بغض النظر عما إذا كانت عملية التوليد بدأت من تلميح نصي أم من صورة.
Veo 3.1 Lite بدقة ٧٢٠ بكسل وWan 2.5 كلاهما يكلفان ٠٫٠٥ دولار أمريكي لكل ثانية من الفيديو الناتج، ما يجعل المقطع ذا الخمس ثوانٍ يكلف حوالي ٠٫٢٥ دولار أمريكي لكل توليد. أما Kling 2.5 Turbo Pro فيبلغ سعره ٠٫٠٧ دولار أمريكي لكل ثانية.

هل يكلّف إنشاء الفيديو من الصورة أكثر من إنشائه من النص؟

الحدود العملية قصيرة. فدرجة الاتساق تنخفض مع طول المقاطع في جميع الموديلات الحالية، وهذا
السبب في أن معظم سير العمل الإنتاجية تولِّد عدة لقطات قصيرة ثم تحررها معًا، بدلًا من طلب لقطة واحدة طويلة.

ما أرخص نموذج ذكاء اصطناعي لإنشاء فيديو من صورة؟

نعم عمومًا، إلى جانب سقف للدقة وطابور انتظار أبطأ. كما أن السعات المجانية تُقدَّم غالبًا كعروض ترويجية تتغير باستمرار — فعلى سبيل المثال، السعة المجانية لدى Runway هي إيداع لمرة واحدة بقيمة ١٢٥ رصيدًا،
وليس منحة شهرية متكررة.

ما أقصى مدة يمكن أن يصل إليها فيديو تم إنشاؤه بواسطة الذكاء الاصطناعي؟

الحدود العملية قصيرة. فتتراجع التماسك مع طول المقاطع في كل النماذج الحالية، ولهذا السبب
تعتمد معظم سير العمل الإنتاجية على توليد عدة لقطات قصيرة ثم تحريرها معًا بدلًا من
الطلب على لقطة واحدة طويلة.

هل تُضيف الأدوات المجانية لإنشاء فيديو من صورة علامة مائية؟

نعم عمومًا، إلى جانب حد أقصى للدقة وطابور انتظار أبطأ. كما أن الاعتمادات المجانية تكون عادةً ذات طابع ترويجي وتتغيّر بشكل متكرر — فعلى سبيل المثال، ائتمان رانواي هو إيداع لمرة واحدة بقيمة ١٢٥ نقطة، وليس
ترويجية وتتغير غالبًا — فعلى سبيل المثال، خدمة Runway هي إيداع لمرة واحدة بقيمة ١٢٥ رصيدًا
منحة شهرية متكررة.

بقلم مصطفى إحسان

مصطفى إحسان هو مؤسس ومُحرِّر موقع Convly.ai. وقد أنشأ قاعدة بيانات النماذج الحية للذكاء الاصطناعي الخاصة بالموقع، ومؤشر الأداء السعري الخاص به، بالإضافة إلى الحاسبات المجانية لحساب متطلبات الذاكرة VRAM، وتكاليف واجهة برمجة التطبيقات (API)، والاقتصاديات المرتبطة بالاستضافة الذاتية. ويكتب مصطفى عن أسعار النماذج، ونتائج الاختبارات المعيارية، والأجهزة اللازمة لتشغيل نماذج الذكاء الاصطناعي محليًّا، ويعطي دائمًا الأولوية للأرقام المُقاسة بدقة على الادعاءات التي تطلقها الشركات المصنِّعة.

انتقل إلى الأعلى
Featured on There's An AI For That