Wednesday, 16 September 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Hugging Face Image to Video : modèles, Spaces et inférence locale

  • Hugging Face héberge des modèles image vers vidéo (I2V) que vous pouvez exécuter de trois façons : hébergée Spaces (démonstrations interactives), l’API d’inférence / les points de terminaison d’inférence, ou localement avec la bibliothèque diffusers diffusers.
  • Parmi les modèles I2V open-weight populaires figurent Wan 2.1/2.2 I2V (Alibaba), Stable Video Diffusion (SVD/SVD-XT) de Stability AI, et LTX-Video de Lightricks.
  • VRAM réelle requise localement : environ 10–16 Go pour SVD en 576×1024, 24 Go ou plus pour Wan 2.2 I2V-A14B en 720p, avec des astuces de déchargement (offloading) décrites dans diffusers la documentation pour les cartes graphiques plus petites.
  • Si vous ne souhaitez pas gérer vous-même des GPU, des API hébergées telles que Wan 2.5 Runway ($0,05/s) ou Kling 2.5 Turbo Pro Kling ($0,07/s) sont généralement moins coûteuses qu’un achat de GPU.

Image vers vidéo sur Hugging Face désigne l’utilisation de modèles hébergés sur huggingface.co sous l’étiquette (tag) image-to-video pour transformer une image fixe en une courte séquence animée. Vous interagissez avec eux de trois manières : démonstrations interactives dans le navigateur, transformer une image fixe en une courte séquence animée. Vous interagissez avec eux de trois manières : en cliquant pour passer à l’élément suivant Spaces ou les points de terminaison d’inférence, ou en téléchargeant les poids et en les exécutant localement avec la bibliothèque Inference APIPython diffusers. Ce qui suit indique concrètement ce qui fonctionne réellement, modèle par modèle et plateforme par plateforme. diffusers Bibliothèque Python. Voici ce qui fonctionne réellement, par modèle et par plateforme.

Ce que l’étiquette image-to-video image-to-video couvre réellement

Cette étiquette (tag) filtre le Hub afin d’afficher uniquement les modèles dont l’entrée attendue est une image (éventuellement accompagnée d’un prompt textuel) et dont la sortie est une courte vidéo, typiquement de 2 à 6 secondes à 16–24 images par seconde. À l’heure où ces lignes sont écrites, les familles open-weight les plus actives sont :

Modèle Auteur Sortie typique Licence des poids
Wan 2.2 I2V-A14B Alibaba (Wan-AI) 720p, 5 s, 24 ips Apache 2.0
Wan 2.1 I2V-14B / I2V-1.3B Alibaba (Wan-AI) 480p–720p, environ 5 s Apache 2.0
Stable Video Diffusion (SVD) Stability AI 576×1024, 14 images SVD : usage non commercial / commercial via Stability
SVD-XT Stability AI 576×1024, 25 images Identique à SVD
LTX-Video Lightricks 768×512, environ 5 s à 24 images par seconde Variante OpenRAIL-M
CogVideoX-5B-I2V THUDM 720×480, 6 s à 8 images par seconde Licence Apache 2.0 (code), licence personnalisée (poids)
image-to-video Bantikumar (communauté) Point de contrôle de démonstration simplifié Voir la fiche du modèle

Vérifiez toujours la résolution, le nombre d’images et la licence directement sur la fiche du modèle — les auteurs les mettent régulièrement à jour. La fiche de Wan 2.2 se trouve à l’adresse huggingface.co/Wan-AI/Wan2.2-I2V-A14B, celle de SVD-XT à huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt, et celle de LTX-Video à huggingface.co/Lightricks/LTX-Video.

Trois façons d’exécuter l’image vers vidéo sur Hugging Face

1. Espaces Hugging Face (aucune installation requise, fonctionne directement dans le navigateur)

Chaque modèle majeur I2V dispose d’un ou plusieurs Espaces communautaires. Rendez-vous sur huggingface.co/spaces, recherchez le nom du modèle (par exemple « Wan 2.2 I2V » ou « LTX-Video »), téléversez une image, saisissez éventuellement une instruction, puis cliquez sur Générer. Les Espaces gratuits s’exécutent sur des GPU partagés ZeroGPU (tranches H200) avec un quota quotidien par utilisateur ; si l’Espace est occupé, vous devrez attendre votre tour. Pour un usage en production, dupliquez l’Espace et attachez-y du matériel payant via les paramètres de l’Espace.

2. API d’inférence et Points de terminaison d’inférence

L’ Inference API API d’inférence sans serveur prend en charge certains modèles I2V directement ; pour les autres, vous déployez un sur une A10G, L4, L40S, A100 ou H100. Les points de terminaison sont facturés à l’heure de fonctionnement GPU, ce qui rend coûteux de les laisser actifs pendant un mois ; un point de terminaison 24/7 basé sur une A100-80 Go coûte généralement plusieurs milliers de dollars par mois. Utilisez le calculateur auto-hébergement vs API dédié sur une carte A10G, L4, L40S, A100 ou H100. Ces points de terminaison sont facturés à l’heure de fonctionnement GPU, ce qui rend coûteux de les laisser actifs pendant un mois entier : un point de terminaison A100-80 Go disponible 24 heures sur 24 coûte généralement plusieurs milliers de dollars par mois. Utilisez le

comparateur d’API vidéo par seconde diffusers

pour comparer les coûts. diffusers 3. Inférence locale avec

La bibliothèque de référence est celle de Hugging Face

. Installez-la à l’aide de la commande suivante :

import torch
from diffusers import StableVideoDiffusionPipeline
from diffusers.utils import load_image, export_to_video

pipe = StableVideoDiffusionPipeline.from_pretrained(
    "stabilityai/stable-video-diffusion-img2vid-xt",
    torch_dtype=torch.float16, variant="fp16"
)
pipe.enable_model_cpu_offload()

image = load_image("input.png").resize((1024, 576))
frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0]
export_to_video(frames, "out.mp4", fps=7)

Exemple minimal pour SVD-XT (issu de la fiche du modèle) : import torch from diffusers import StableVideoDiffusionPipeline from diffusers.utils import load_image, export_to_video pipe = StableVideoDiffusionPipeline.from_pretrained( "stabilityai/stable-video-diffusion-img2vid-xt", torch_dtype=torch.float16, variant="fp16" ) pipe.enable_model_cpu_offload() image = load_image("input.png").resize((1024, 576)) frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0] export_to_video(frames, "out.mp4", fps=7)Pour Wan 2.2, utilisez WanImageToVideoPipeline; pour LTX-Video, utilisez diffusers LTXImageToVideoPipeline

VRAM et matériel, honnêtement

. Vérifiez la fiche du modèle pour connaître le nom exact de la classe —

Modèle ajoute de nouvelles pipelines à chaque version. L’inférence I2V est plus gourmande que la génération d’images, car elle implique la suppression du bruit simultanément sur de nombreuses images d’un latent temporel. Les fiches de modèles et le dépôt diffusers indiquent approximativement :
VRAM native (fp16) Avec déchargement CPU / quantification SVD / SVD-XT (576×1024) ~16–20 Go
LTX-Video ~8–10 Go avec enable_model_cpu_offload()
~12–24 Go selon la durée de la vidéo Fonctionne sur cartes de 12 Go avec déchargement Wan 2.1 I2V-1.3B
~8–12 Go Fonctionne sur une RTX 3060 12 Go Wan 2.2 I2V-A14B (720p)
CogVideoX-5B-I2V ~18–24 Go ~24 Go ou plus

Adaptable sur 16 Go avec fp8/forks GGUF communautaires Calculateur de VRAM et ~5 Go avec déchargement complet (selon la fiche THUDM) Ces valeurs varient selon la résolution et le nombre d’images. Pour une vue d’ensemble de l’évolution de la mémoire GPU, consultez la page

Windows

meilleures cartes graphiques pour les modèles locaux — les mêmes modèles (RTX 3090, 4090, 5090, A6000) constituent également le choix optimal pour la génération vidéo. Installez Python 3.10 ou 3.11 depuis python.org, puis la version CUDA de PyTorch depuis pytorch.org/get-started/locally, puis définissez HF_HOME sur un disque disposant d’au moins 50 Go d’espace libre — les poids de Wan et de CogVideoX sont volumineux. Windows ne prend pas en charge ROCm ; les utilisateurs AMD doivent utiliser WSL2 ou Linux. Pour une interface utilisateur plus conviviale, ComfyUI propose des workflows natifs pour SVD, Wan et LTX-Video.

macOS

Les puces Apple Silicon (M1 à M4) exécutent diffusers via MPS. Installez PyTorch avec le support MPS, puis précisez torch_dtype=torch.float16 et .to("mps"). En pratique, SVD génère une séquence vidéo de 25 images sur un M2 Max en plusieurs minutes ; Wan 2.2 A14B est peu réaliste sur tout système disposant de moins de 64 Go de mémoire unifiée. LTX-Video est actuellement le modèle I2V le plus utilisable sur Mac, grâce à son nombre réduit d’étapes d’inférence. Les Mac Intel ne disposent d’aucun chemin fonctionnel exploitant le GPU — utilisez plutôt une API hébergée.

Linux

Linux est la plateforme principale ciblée. Installez le pilote NVIDIA et le runtime CUDA 12.x (intégré aux wheels PyTorch), puis pytorch.org/get-started/locally. Pour l’inférence multi-GPU ou pour générer des séquences longues, utilisez accelerate config et pipe.enable_sequential_cpu_offload(). xformers et torch.compile() permettent d’obtenir des gains de vitesse importants pour SVD et Wan sur les cartes graphiques Ampere/Ada/Hopper.

Quand éviter Hugging Face au profit d’une API vidéo hébergée

Si vous avez besoin d’un seul court extrait par jour, un espace Hugging Face ou une carte RTX locale conviennent parfaitement. Si vous exigez un débit fiable, les API hébergées facturées à la seconde sont généralement moins coûteuses que de louer un point de terminaison A100/H100 inactif :

  • Wan 2.5 — à partir de 0,05 $/seconde (même lignée que les poids ouverts de Wan disponibles sur le Hub),
  • Sora 2 — à partir de 0,05 $/seconde ; Sora 2 Pro à partir de 0,15 $/seconde
  • Veo 3.1 — à partir de 0,05 $/seconde
  • Kling 2.5 Turbo Pro — à partir de 0,07 $/seconde

À 0,05 $ la seconde, 1 000 extraits de cinq secondes coûtent 250 $. Louer un H100 aux tarifs habituels des fournisseurs cloud pour obtenir le même débit revient généralement plus cher. Utilisez le Calculateur de coûts d’API et parcourez le Base de données de modèles pour connaître les tarifs en vigueur.

Questions fréquemment posées

Existe-t-il un seul modèle « image vers vidéo » sur Hugging Face auquel je devrais me référer par défaut ?

Aucun modèle par défaut unique. Pour les poids ouverts et les licences permissives, Wan 2.2 I2V-A14B produit actuellement les meilleures sorties en 720p, mais nécessite 24 Go de VRAM ou plus. Sur des cartes graphiques disposant de 12 Go de VRAM, LTX-Video ou Wan 2.1 I2V-1.3B constituent les choix pratiques. SVD-XT est plus ancien, mais très bien documenté.

Puis-je utiliser ces modèles à des fins commerciales ?

Cela dépend du checkpoint utilisé. Wan 2.1/2.2, le code de CogVideoX et LTX-Video sont distribués sous des licences permissives, mais chacun comporte ses propres conditions spécifiques ; les poids de Stable Video Diffusion sont fournis sous la licence communautaire Stability, qui prévoit un niveau commercial distinct. Lisez toujours attentivement la section « Licence » de la fiche modèle avant toute intégration commerciale.

Pourquoi ma sortie clignote-t-elle ou ressemble-t-elle à un diaporama ?

Généralement l’une des causes suivantes : trop peu d’étapes d’inférence (augmentez num_inference_steps), motion_bucket_id/guidance_scale trop faible pour SVD, ou une image d’entrée dont le format ne correspond pas à la résolution d’entraînement du modèle. Ajustez la résolution de l’image d’entrée à celle native du modèle (par exemple 1024 × 576 pour SVD-XT) avant de lancer la génération.

Puis-je exécuter l’image vers vidéo sur un ordinateur portable équipé de 8 Go de VRAM ?

Uniquement avec les modèles les plus légers et un déchargement (offloading) agressif. Wan 2.1 I2V-1.3B et les versions quantifiées de LTX-Video peuvent fonctionner, mais comptez plusieurs minutes par séquence vidéo. Pour tout modèle plus volumineux, une API hébergée ou un Space seront plus rapides et moins coûteux que de lutter contre des erreurs de mémoire insuffisante (OOM).

Ollama prend-il en charge l’image vers vidéo ?

Non. Ollama est conçu principalement pour les modèles de langage textuels et multimodaux, et non pour les pipelines de génération vidéo par diffusion. Consultez la Guide Ollama pour connaître sa couverture exacte ; pour l’I2V, privilégiez plutôt diffusers ou ComfyUI.

Combien de temps prend la génération d’une seule séquence vidéo sur une GPU grand public ?

Ordre de grandeur : SVD-XT sur une RTX 4090 produit un extrait vidéo de 25 images en nettement moins d’une minute avec les paramètres par défaut ; ce même modèle, exécuté avec ~16–20 Go sur une carte de 12 Go, est plusieurs fois plus lent. Wan 2.2 A14B en 720p est nettement plus gourmand. Les performances exactes dépendent du nombre d’étapes, de la résolution et de la version de PyTorch, donc considérez tout résultat de benchmark isolé comme approximatif.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice de rapport prix/performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’hébergement local. Il écrit notamment sur la tarification des modèles, les résultats de benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les données mesurées aux affirmations des éditeurs.

Défiler vers le haut