- Choisissez d'abord le type de vidéo. Texte-vers-vidéo (tapez une description), image-vers-vidéo (animez une photo que vous avez déjà), vidéo avatar (un présentateur numérique lit votre script), ou montage assisté par IA (sous-titres, voix off, doublage ajoutés au contenu réel).
- Les endroits les plus faciles pour commencer : de Canva Créer un clip vidéo crée des clips jusqu'à 8 secondes avec son synchronisé. Le créateur de vidéo IA de CapCut transforme un script en vidéo, offre 100+ avatars, et utilise Seedance 2.5 GLM-4.5-Air
- Vous voulez des clips plus longs ? Seedance 2.5 crée des clips jusqu'à 30 secondes avec son ; MiniMax H3 (Hailuo 3.0) crée jusqu'à 15 secondes en 2K avec son stéréo.
- Les vidéos longues sont assemblées, non générées. Faites plusieurs courts clips, joignez-les dans un éditeur, ajoutez voix off et sous-titres. Vérifiez les prix actuels sur la propre page de chaque fournisseur, et étiquetez le contenu IA.
Pour créer une vidéo IA : choisissez le type dont vous avez besoin, écrivez un court prompt décrivant le plan, générez un clip (la plupart des outils plafonnent entre 8 et 30 secondes), puis joignez plusieurs clips dans un éditeur gratuit et ajoutez voix off et sous-titres. Canva et CapCut fonctionnent tous les deux dans un navigateur, vous pouvez donc terminer une première vidéo aujourd'hui sans rien installer.
Le reste de ce guide explique les quatre types de vidéo IA, quel outil convient à quel travail, ce que les choses coûtent réellement, et un premier projet que vous pouvez copier.
Les quatre types de vidéo IA
Presque chaque outil que vous rencontrerez fait l'une de ces quatre choses. Savoir lequel vous voulez économise des heures.
1. Texte-vers-vidéo
Vous tapez une description — « un golden retriever courant dans l'herbe haute au coucher du soleil, caméra à l'épaule » — et l'outil invente le contenu. Bon pour les paysages, les ambiances de produits, le B-roll abstrait et les courts clips sociaux. Faible pour tout ce qui nécessite un détail exact : des panneaux lisibles, des visages spécifiques, des logos de marque, ou un personnage qui doit avoir la même apparence dans dix plans.
2. Image-vers-vidéo
Vous téléchargez une image fixe et l'outil l'anime : la caméra dérive, les cheveux bougent, la vapeur monte. C'est généralement la route la plus fiable pour les débutants, car vous contrôlez comment la scène ressemble avant que tout mouvement ne soit ajouté. Les photographes, les propriétaires de boutiques et toute personne ayant une photo de produit devraient commencer ici. Nous couvrons le flux de travail en détail dans notre guide pour transformer une image en vidéo, et si vous avez besoin de l'image d'abord, voir comment créer des images IA.
3. Vidéos avatar et présentateur parlant
Vous collez un script et un présentateur numérique le lit à la caméra, synchronisé aux lèvres. C'est la norme pour les vidéos de formation, les explications, les annonces internes et les versions multi-langues du même message. Synthesia offre 240+ avatars en 160+ langues ; le créateur de vidéo IA de CapCut inclut 100+ avatars. Vous pouvez généralement choisir un présentateur standard, ou en créer un à partir d'une vidéo consentante d'une vraie personne.
4. Montage assisté par IA
La catégorie la plus discrète et souvent la plus utile. Ici, la vidéo est réelle — filmée sur votre téléphone — et l'IA aide uniquement avec le travail autour : sous-titres automatiques, suppression d'arrière-plan, ajustement des mots de remplissage, narration texte-vers-voix, et doublage dans une autre langue. CapCut et Canva font beaucoup de cela. Si la narration est votre besoin principal, notre guide de voix off IA va plus loin.
Quel outil pour quel travail
| Ce que vous voulez | Type | Choix raisonnable | Détail vérifié |
|---|---|---|---|
| Un court clip social, sans installation | Texte-vers-vidéo | Canva, Créer un clip vidéo | Jusqu'à 8 secondes, avec son synchronisé |
| Script directement en vidéo finie | Mixte | Créateur de vidéo IA CapCut | Script en vidéo, 100+ avatars, utilise Seedance 2.5 |
| Le clip unique le plus long que vous puissiez obtenir | Texte-vers-vidéo ou image-vers-vidéo | Seedance 2.5 | Jusqu'à 30 secondes, avec son |
| Clip plus net avec audio stéréo | Texte-vers-vidéo ou image-vers-vidéo | MiniMax H3 (Hailuo 3.0) | Jusqu'à 15 secondes, 2K, son stéréo |
| Formation ou explication avec un présentateur | Avatar | Avatar et vidéo de formation | 240+ avatars, 160+ langues |
| Sous-titres, doublage, nettoyage sur contenu réel | Montage assisté par IA | CapCut ou Canva | Les deux fonctionnent dans un navigateur |
Pour une sélection plus large, consultez nos compilations de les meilleurs générateurs vidéo IA et les meilleurs générateurs vidéo IA gratuits.
Votre premier projet : une vidéo de 20 secondes
Prévoyez 30 à 60 minutes la première fois. L'astuce est d'arrêter de penser « faire une vidéo » et de commencer à penser « faire quatre petits plans et les assembler ».
- Écrivez quatre plans sur papier. Une ligne chacun, cinq secondes chacun. Exemple : (1) grains de café tombant dans un moulin, gros plan ; (2) vapeur s'élevant d'une tasse sur un comptoir en bois ; (3) mains faisant glisser la tasse sur le comptoir ; (4) la devanture du magasin à l'heure d'or.
- Transformez chaque ligne en prompt. Utilisez la formule ci-dessous. Si l'écriture est ce que vous redoutez, demandez à un chatbot de rédiger dix variations de prompt, puis choisissez les deux que vous préférez.
- Générez un plan à la fois. Attendez-vous à exécuter chaque prompt deux ou trois fois. Rejeter des prises est normal, ce n'est pas un échec. Sauvegardez chaque clip utilisable.
- Enregistrez ou générez une narration. Votre propre voix sur un téléphone sonne toujours mieux que la plupart des lectures synthétiques. Si vous utilisez la synthèse vocale, gardez les phrases courtes.
- Assemblez, ajoutez des sous-titres, exportez. Déposez les clips sur une timeline dans CapCut ou Canva, élaguez les premières et dernières images faibles de chaque clip, ajoutez la musique bas, générez automatiquement les sous-titres, puis lisez les sous-titres vous-même — les sous-titres automatiques écorchent les noms et les chiffres.
- Regardez-le une fois sans son et une fois sur un téléphone. La plupart des erreurs se révèlent lors de ces deux passages.
Une formule de prompt qui fonctionne
Sujet, puis action, puis caméra, puis lumière, puis style. « Une tasse de café en céramique sur un comptoir en bois usé, la vapeur s'enroulant vers le haut, un zoom lent, la lumière chaude du matin d'une fenêtre latérale, tourné sur pellicule 35 mm. » Ajoutez ce que vous ne pas voulez pas si l'outil le supporte. Gardez une idée par clip — les prompts qui demandent trois événements en cinq secondes produisent de la bouillie. Notre les meilleurs outils de retouche de portraits peut aussi décortiquer une description à partir d'une image que vous aimez.
Ce que coûte la vidéo IA
Deux mondes de tarification différents existent, et les confondre est l'erreur de débutant la plus courante.
Applications grand public (Canva, CapCut, Synthesia et similaires) vendent des abonnements, généralement avec des crédits ou un plafond mensuel de générations. Ces limites changent souvent, consultez donc la page de tarification du fournisseur lui-même — par exemple la page de tarification de Synthesia — plutôt que de faire confiance à un chiffre dans un article.
L'accès développeur aux mêmes modèles sous-jacents est facturé à la seconde de vidéo finie. Ce sont les chiffres de modèle publiés par Convly, et ils sont utiles comme vérification de cohérence sur ce que vaut un clip :
| Modèle | Fabricant | À partir de |
|---|---|---|
| Wan 2.5 | Alibaba | — Google’s |
| Veo 3.1 | — Google’s | |
| Kling 2.5 Turbo Pro | Kuaishou | 0,07 $ par seconde |
| Seedance 2.5 | ByteDance | 0,097 $ par seconde |
À ces tarifs, une vidéo de 20 secondes coûte environ un à deux dollars de génération brute — avant les prises que vous rejetez, ce qui peut facilement le tripler. Google publie ses propres tarifs vidéo par seconde sur la page de tarification de l'API Gemini.
Important : ces chiffres par seconde sont des prix développeur. Ce ne sont pas pas ce qu'un abonnement Canva, CapCut, ChatGPT ou Gemini vous donne, et vous ne pouvez pas les utiliser pour calculer le nombre de clips qu'un plan inclut. Pour les détails plan par plan, consultez nos guides sur les niveaux gratuit, Go, Plus et Pro de ChatGPT et les plans IA de Google.
Si vous utilisez un chatbot pour écrire des scripts, ce côté est bon marché. Les modèles texte sont facturés par token — un token représente environ trois-quarts d'un mot. GPT-6 Luna coûte 0,10 $ en entrée / 0,50 $ en sortie par million de tokens avec une fenêtre de contexte de 1,05M tokens (la quantité de texte que le modèle peut retenir à la fois), et Gemini 3.8 Flash coûte 0,75 $ en entrée / 3,75 $ en sortie par million avec un contexte de 1M. Un après-midi entier de rédaction de scripts coûte des centimes. C'est la vidéo qui coûte cher.
Windows, macOS et Linux
Presque tout cela est du travail dans un navigateur, donc votre système d'exploitation importe moins que votre connexion Internet. Là où cela importe :
Windows
Configuration de bureau la mieux prise en charge. CapCut offre une application de bureau Windows aux côtés de son éditeur Web, et Adobe et DaVinci Resolve s'exécutent nativement si vous dépassez les outils gratuits. Si votre PC dispose d'une carte graphique NVIDIA discrète, vous pouvez aussi expérimenter avec des modèles ouverts localement, bien que la génération vidéo soit beaucoup plus lourde que la génération d'image et que les exigences changent à chaque version — traitez la vidéo locale comme un projet de loisir, pas comme votre premier.
macOS
Également bien pris en charge : CapCut dispose d'une application Mac, et Canva fonctionne dans Safari ou Chrome. Les Mac avec Apple Silicon gèrent confortablement l'édition sur timeline et l'exportation. La génération en cloud se comporte de manière identique à Windows.
Linux
Pas d'application de bureau officielle CapCut. Utilisez les versions navigateur de Canva, CapCut et des sites générateurs, qui fonctionnent dans Chrome ou Firefox. Pour l'édition, DaVinci Resolve dispose d'une compilation Linux et Kdenlive est une excellente option gratuite. Rien à propos de la vidéo IA en cloud n'est bloqué sur Linux — seules certaines applications de bureau le sont.
Un outil à éviter : Sora
Ne construisez pas un flux de travail autour de Sora d'OpenAI. L'application Sora a fermé le 26 avril 2026, et l' Sora 2 API s'est arrêtée le 24 septembre 2026 sans remplacement désigné. Les anciens tutoriels la recommandent toujours ; ils sont obsolètes. OpenAI énumère les retraits sur sa dépréciations. C'est une bonne habitude en général : avant de suivre un tutoriel vidéo IA, vérifiez que l'outil existe toujours.
Honnêteté, consentement et étiquettes
Quelques lignes qui vous tiennent à l'écart des ennuis :
- N'utilisez pas le visage ou la voix d'une vraie personne sans sa permission claire. Cela inclut les collègues, les célébrités et les personnes sur les photos que vous avez trouvées en ligne. Les outils d'avatar demandent une vidéo de consentement pour une raison. Notre article sur les deepfakes et comment les repérer explique pourquoi les plateformes traitent cela sérieusement.
- Pas de faux avis ou de faux témoignages. Une personne synthétique qui vante votre produit n'est pas un client, et la présenter comme telle est trompeuse. Si vous créez des annonces sociales avec l'IA, lisez comment créer des annonces UGC sans enfreindre les règles premier.
- Étiquetez-le. De nombreuses plateformes exigent que les vidéos générées par l'IA ou considérablement altérées soient divulguées, et plusieurs ajoutent des étiquettes automatiquement. Les règles diffèrent selon la plateforme et le pays, consultez donc la politique de l'endroit où vous publiez.
- Vérifiez les faits avant de publier. Les séquences générées inventent heureux les détails : mauvais nombre de doigts, texte à l'écran brouillé, produits qui n'existent pas. Pour l'école ou le travail, demandez ce qui est permis avant de soumettre du matériel créé par l'IA.
Problèmes courants et correctifs rapides
| Problème | Cause probable | Corriger |
|---|---|---|
| Les visages fondent ou les mains ont l'air étrange | Trop de mouvement, sujet trop proche | Bougez la caméra au lieu du sujet ; reculez pour un plan plus large |
| Le texte à l'écran est du charabia | Les modèles ont du mal à rendre les mots | Ajoutez le texte plus tard dans l'éditeur, pas dans l'invite |
| Le personnage change entre les plans | Chaque clip est généré à partir de zéro | Utilisez une image de référence et image-vers-vidéo pour chaque plan |
| Le clip s'arrête en pleine action | Limite de durée atteinte | Planifiez les plans pour tenir dans la limite, ou divisez en deux clips |
| L'audio et la bouche ne sont pas synchronisés | Voix off ajoutée sur les images générées | Utilisez un outil avatar dédié pour les présentateurs |
Questions fréquemment posées
Puis-je créer une vidéo IA de long métrage ?
Pas en une seule génération. Les outils actuels produisent des clips courts — 8 secondes dans Canva Create a Video Clip, jusqu'à 15 secondes pour MiniMax H3, jusqu'à 30 secondes pour Seedance 2.5. Les vidéos plus longues sont créées en générant de nombreux clips et en les montant ensemble, exactement comme une équipe de cinéma humaine tourne des prises séparées.
Existe-t-il réellement une méthode gratuite pour y parvenir ?
Oui, dans les limites. Plusieurs outils offrent des niveaux gratuits avec des filigranes, des temps d'attente ou une petite allocation mensuelle, et les éditeurs gratuits gèrent le montage et les sous-titres. Les allocations changent fréquemment, vérifiez donc la page tarifaire du fournisseur lui-même plutôt que n'importe quel article — y compris celui-ci. Notre libre Générateur de vidéos basé sur l'IA synthèse est une bonne liste de départ.
Ai-je besoin d'un ordinateur puissant ?
Non. La génération se fait sur les serveurs du fournisseur, donc un ordinateur portable basique, un Chromebook ou même un téléphone suffit pour les outils cloud. Une machine plus puissante n'aide que pour l'étape d'édition et d'exportation. Exécuter des modèles vidéo localement est une autre affaire et exige un matériel graphique sérieux.
Puis-je mettre mon propre visage dans une vidéo IA ?
Généralement oui — plusieurs plateformes d'avatar vous permettent de créer une ressemblance à partir de vidéos que vous enregistrez vous-même, en suivant leur processus de consentement. Utiliser le visage ou la voix de quelqu'un d'autre sans permission est une tout autre chose et peut violer à la fois les règles de la plateforme et la loi locale.
Quel est le mieux, texte-vers-vidéo ou image-vers-vidéo ?
Image-vers-vidéo pour tout ce où l'apparence compte — produits, marque, un personnage cohérent — car vous approuvez l'image avant qu'elle ne bouge. Texte-vers-vidéo pour la rapidité et pour les scènes que vous ne pouvez pas photographier. La plupart des projets pratiques mélangent les deux.
Pourquoi mes clips ont-ils l'air pire que les démos ?
Les bobines de démo sont les meilleures prises sur des dizaines, souvent avec des prompts sélectionnés à la main. Supposez un taux de rejet de deux à trois pour un, écrivez une idée claire par prompt, et attendez-vous à ce que la première version de tout projet soit un brouillon.
