Saturday, 29 August 2026 | Updating Daily AI insight, written for builders

So wandeln Sie ein Bild mit KI in ein Video um (2026): Modelle, Kosten und kostenlose Optionen

Wichtigste Erkenntnisse

  • Jedes aktuelle Spitzen-Video-Modell akzeptiert ein Bild als Startframe
    Sora 2, Veo 3.1, Kling 2.5 Turbo Pro und Wan 2.5 und alle unterstützen sowohl Text- als auch Bild-Eingaben.
  • Bild-zu-Video kostet pro Sekunde genauso viel wie Text-zu-Video bei diesen Modellen.
    Sie werden für die Länge der Ausgabe berechnet, nicht dafür, wie die Szene gestartet wurde.
  • Der günstigste Weg liegt bei 0,05 USD pro Sekunde — Veo 3.1 Lite in 720p oder Wan 2.5 —
    Daher kostet die Animation eines Standbilds zu einem fünfsekündigen Clip etwa 25 Cent pro Versuch.
  • Kostenlose Tarife existieren, sind jedoch begrenzt und ändern sich häufig. Runway bietet beispielsweise
    125 einmalige Credits, die sich nicht automatisch erneuern.

Die Umwandlung eines Standbilds in einen bewegten Clip ist mittlerweile eine vollwertige Funktion statt einer reinen Forschungs-
Demo, und es ist die einzige Videotask, bei der Sie die Eingabe bereits haben – ein Foto, ein Produktshot, ein
Kunstwerk — erledigt den größten Teil der Arbeit. Auf dieser Seite erfahren Sie, welche Modelle ein Bild akzeptieren, wie viel jedes Modell pro Sekunde Ausgabe berechnet und ab wann die kostenlosen Optionen ihre Nützlichkeit verlieren.
jeweils pro Sekunde der Ausgabe berechnet, und wo die kostenlosen Optionen ihre Nützlichkeit verlieren.

Kurze Antwort: Wie wandeln Sie ein Bild mit KI in ein Video um?

Sie übergeben dem Video-Modell Ihr Bild als ersten Frame sowie eine kurze Beschreibung der gewünschten Bewegung und zahlen pro Sekunde Ausgabezeit. Jedes führende Modell am Markt unterstützt diese Funktion:
Sora 2, Veo 3.1, Kling 2.5 Turbo Pro und Wan 2.5 akzeptieren sowohl Text- als auch Bild-Eingaben.
Sora 2, Veo 3.1, Kling 2.5 Turbo Pro und Wan 2.5 akzeptieren sowohl Text- als auch Bild-Eingaben.
Der günstigste Tarif liegt bei 0,05 US-Dollar pro Sekunde fertiges Video, was eine fünfsekündige Animation auf rund
0,25 USD pro Generierung, vor Wiederholungsversuchen. Es gibt kostenlose Browser-Tools, die ein Foto ohne weiteres animieren können.
Karte erforderlich ist; allerdings begrenzen sie die Auflösung, fügen Wasserzeichen hinzu und gewähren eine feste, statt einer wiederkehrenden Nutzungsgutschrift.
statt einer wiederkehrenden Nutzungsgutschrift.

Welche Modelle akzeptieren ein Bild als Eingabe

Dieser Aspekt fehlt oft auf Vergleichsseiten. Die Bild-Eingabe ist keine separate Produktstufe –
sondern lediglich ein Betriebsmodus desselben Modells, zu identischen Preisen:

Modell Entwickler Eingabe Ab (pro Sekunde)
Veo 3.1 Google Text, Bild 0,05 USD (Lite, 720p)
Wan 2.5 Alibaba Text, Bild 0,05 USD (über fal)
Kling 2.5 Turbo Pro Kuaishou Text, Bild 0,07 USD (über fal)
Sora 2 OpenAI Text, Bild 0,05 USD (Batch, 720p)
Sora 2 Pro OpenAI Text, Bild 0,15 USD (Batch, 720p)

Ein zeitlicher Hinweis, der bei Ihrer heutigen Entscheidung wichtig ist: OpenAI hat den
24. September 2026 15. Juli als Abschaltdatum für die Videos-API sowie für beide Sora-2-Modelle festgelegt,
ohne bislang einen Nachfolger zu benennen. Wenn Sie heute einen Bild-zu-Video-Workflow starten, beginnen Sie damit also auf einer Countdown-Uhr.
startet den Vorgang mit einem Countdown.

Was kostet die Animation eines einzelnen Bilds

Da die Abrechnung pro Sekunde Ausgabezeit erfolgt, ergibt sich die Kosten für einen Bild-zu-Video-Clip einfach aus dem Satz multipliziert mit der gewünschten Länge:
multipliziert mit der von Ihnen angeforderten Dauer:

Modell und Leistungsstufe 5-Sekunden-Clip 10-Sekunden-Clip 30-Sekunden-Clip
Veo 3.1 Lite, 720p $0.25 $0.50 $1.50
Wan 2.5 $0.25 $0.50 $1.50
Kling 2.5 Turbo Pro $0.35 $0.70 $2.10
Veo 3.1 Lite, 1080p $0.40 $0.80 $2.40
Veo 3.1 Fast, 1080p $0.60 $1.20 $3.60
Veo 3.1 Standard, 4K $3.00 $6.00 $18.00

Das sind pro erfolgreiche Generierung. Die Umwandlung von Bild zu Video erfordert in der Regel weniger Versuche als
Text-zu-Video, weil der erste Frame bereits festgelegt ist und Sie lediglich die Bewegung steuern – aber ein
Shot, der drei Versuche benötigt, kostet immer noch das Dreifache des oben genannten Betrags. Kalkulieren Sie Ihr Budget anhand Ihrer eigenen Wiederholungsrate, nicht anhand des offiziellen Tarifs.
nicht anhand des offiziellen Tarifs.

Gibt es wirklich kostenlose Möglichkeiten dafür?

Ja, allerdings mit Einschränkungen, deren Bedeutung Sie verstehen sollten, bevor Sie sich darauf verlassen. Kostenlose Tarife bei diesen
Kategorie sind werblicher Natur statt strukturell: Sie sollen Sie zum Wechsel in den kostenpflichtigen Tarif bewegen und besitzen daher
Begriffe ändern sich.

Runway ist das deutlichste veröffentlichte Beispiel. Auf seiner Preisübersicht bietet es
125 einmalige Credits die Möglichkeit, die Tools auszuprobieren – eine einmalige Einzahlung, die sich nicht automatisch verlängert – mit
gezahlten Abonnements ab 12 US-Dollar pro Monat bei jährlicher Abrechnung, danach 28 und 76 US-Dollar für die höheren Stufen.

Andere Tools werben stattdessen mit täglichen kostenlosen Kontingenten; diese Zahlen ändern sich jedoch so häufig,
dass jede auf einem Blog genannte Zahl vor der konkreten Planung unbedingt auf der eigenen Webseite des Anbieters überprüft werden sollte,
um sie als Grundlage zu nutzen. Das Muster bei kostenlosen Tarifen bleibt konsistent, auch wenn die konkreten Zahlen variieren: Rechnen Sie mit einer
niedrigeren Auflösungsobergrenze, einem sichtbaren Wasserzeichen, einer kürzeren maximalen Clip-Länge und einer langsameren Warteschlange.

So erzielen Sie ein gutes Ergebnis aus einem Standbild

Bei der Umwandlung von Bild zu Video erfordert die Prompt-Eingabe eine andere Herangehensweise als bei Text-zu-Video. Das Modell erfindet keine Szene neu – sie ist bereits vorhanden – daher sollte die Eingabe
die Bewegung beschreiben, nicht den Inhalt.Beschreiben Sie die Kameraführung, nicht das Motiv.

  • „Langsame Annäherung mit geringer Tiefenschärfe“ gibt dem Modell eine klare Aufgabe. „Eine wunderschöne Berglandschaft“ beschreibt hingegen lediglich das, was es bereits sieht.
    Nennen Sie nur eine Bewegung, nicht drei.
  • Zusammengesetzte Anweisungen innerhalb eines kurzen Clips führen meist dazu, dass keiner der gewünschten Effekte sauber umgesetzt wird.
    Beginnen Sie mit einem sauberen, hochauflösenden Einzelbild.
  • Kompressionsartefakte und starkes Rauschen im Ausgangsbild verstärken sich in jedem generierten Frame. Halten Sie Clips kurz und schneiden Sie zwischen ihnen.
    Körnung in der Quelle wird in jedem generierten Frame verstärkt.
  • Rechnen Sie damit, dass Gesichter und Hände die Schwachstellen sind. Falls das Standbild eines davon enthält,
    planen Sie mehr Wiederholungsversuche ein, als Sie für ein Produkt oder eine Landschaft benötigen würden.
  • Günstigste funktionierende Option: Veo 3.1 Lite in 720p oder Wan 2.5, jeweils 0,05 US-Dollar pro Sekunde.
    Beste Qualitäts-Leistungs-Relation als nächster Schritt:

Welches sollten Sie verwenden?

  • Veo 3.1 Fast in 1080p, 0,12 US-Dollar pro Sekunde. Wenn die Ausgabeauflösung im Vordergrund steht:
  • Veo 3.1 Standard in 4K, 0,60 US-Dollar pro Sekunde – die einzige 4K-Stufe in dieser Gruppe außer Veo Fast für 0,30 US-Dollar.
  • Einfach mal ausprobieren: Eine kostenlose Browser-Version reicht völlig aus, um zu prüfen, ob die Idee überhaupt funktioniert – bevor irgendeine der oben genannten Optionen eingerichtet werden muss.
    Technisch ja – jedes hier aufgeführte Modell akzeptiert ein beliebiges Bild als ersten Frame. Die Ergebnisse
  • variieren jedoch stark je nach Quelle: saubere, gut beleuchtete, hochauflösende Standbilder animieren deutlich zuverlässiger als komprimierte oder stark strukturierte Bilder; zudem benötigen Motive mit Gesichtern oder Händen mehr Versuche.
    Nein. Bei allen oben genannten Modellen wird stets pro Sekunde Ausgabezeit berechnet – unabhängig davon, ob die Generierung von einem Prompt oder einem Bild ausgeht.

Häufig gestellte Fragen

Kann KI jedes Foto in ein Video umwandeln?

Veo 3.1 Lite in 720p und Wan 2.5 kosten beide 0,05 US-Dollar pro Sekunde Ausgabezeit, was für einen 5-Sekunden-Clip etwa 0,25 US-Dollar pro Generierung bedeutet. Kling 2.5 Turbo Pro kostet 0,07 US-Dollar pro Sekunde.
unterscheiden sich stark je nach Quelle: Saubere, gut beleuchtete, hochauflösende Standbilder lassen sich deutlich zuverlässiger animieren
als komprimierte oder stark strukturierte Bilder, und Bilder mit Gesichtern oder Händen erfordern mehr Versuche.

Kosten Bild-zu-Video-Modelle mehr als Text-zu-Video-Modelle?

Nein. Bei allen oben genannten Modellen wird pro Sekunde Ausgabe berechnet, unabhängig davon, ob die
Generierung von einem Prompt oder einem Bild ausgeht.

Welches ist das günstigste Bild-zu-Video-KI-Modell?

Veo 3.1 Lite in 720p und Wan 2.5 kosten beide 0,05 USD pro Sekunde Ausgabe, was für einen fünfsekündigen
Clip etwa 0,25 USD pro Generierung bedeutet. Kling 2.5 Turbo Pro kostet 0,07 USD pro Sekunde.

Wie lang kann ein KI-generiertes Video sein?

Die praktischen Grenzen sind kurz. Die Kohärenz nimmt bei allen aktuellen Modellen mit zunehmender Clip-Länge ab, weshalb
die meisten Produktions-Workflows mehrere kurze Shots generieren und diese anschließend zusammenschneiden, anstatt
eine einzige lange Einstellung anzufordern.

Fügen kostenlose Bild-zu-Video-Tools ein Wasserzeichen hinzu?

Im Allgemeinen ja, zusammen mit einer Auflösungsbeschränkung und einer langsameren Warteschlange. Kostenlose Kontingente sind außerdem
werbebedingt und ändern sich häufig – Runways beispielsweise besteht aus einer einmaligen Gutschrift von 125 Credits statt
einer wiederkehrenden monatlichen Zuweisung.

Verfasst von Mustafa Ihsan

Mustafa Ihsan ist Gründer und Chefredakteur von Convly.ai. Er entwickelte und pflegt die Live-Datenbank für KI-Modelle der Website, ihren Preis-Leistungs-Index sowie kostenlose Rechner für VRAM-Anforderungen, API-Kosten und Wirtschaftlichkeit des Self-Hostings. Er schreibt über Modellpreise, Benchmark-Ergebnisse und die Hardware, die zum lokalen Betrieb von KI-Modellen erforderlich ist, und bevorzugt stets messbare Zahlen gegenüber Herstellerangaben.

Scroll to Top
Featured on There's An AI For That