Tuesday, 29 September 2026 | Updating Daily AI insight, written for builders

Cómo hacer videos con IA: la guía completa para principiantes

  • Elige primero el tipo de video. Texto a video (escribe una descripción), imagen a video (anima una foto que ya tienes), video de avatar (un presentador digital lee tu guión), o edición asistida por IA (subtítulos, narración, doblaje añadido a metraje real).
  • Lugares más fáciles para empezar: El Create a Video Clip crea clips de hasta 8 segundos con sonido sincronizado. El creador de videos de IA de CapCut convierte un guión en un video, ofrece más de 100 avatares, y usa el Seedance 2.5 .
  • ¿Quieres clips más largos? Seedance 2.5 crea clips de hasta 30 segundos con sonido; MiniMax H3 (Hailuo 3.0) crea hasta 15 segundos a 2K con sonido estéreo.
  • Los videos largos se unen, no se generan. Haz varios clips cortos, únelos en un editor, añade narración y subtítulos. Comprueba los precios actuales en la página de cada proveedor, y etiqueta el contenido de IA.

Para hacer un video de IA: elige el tipo que necesitas, escribe un indicación breve describiendo la toma, genera un clip (la mayoría de herramientas limitan entre 8 y 30 segundos), luego une varios clips en un editor gratuito y añade narración y subtítulos. Canva y CapCut funcionan en el navegador, así que puedes terminar tu primer video hoy sin instalar nada.

El resto de esta guía explica los cuatro tipos de video de IA, qué herramienta se ajusta a qué trabajo, cuánto cuesta realmente todo, y un primer proyecto que puedes copiar.

Los cuatro tipos de video de IA

Casi toda herramienta que conocerás hace una de estas cuatro cosas. Saber cuál quieres ahorra horas.

1. Texto a video

Escribes una descripción — «un retriever dorado corriendo entre hierba alta al atardecer, cámara en mano» — y la herramienta inventa el metraje. Bueno para escenarios, estados de ánimo de productos, B-roll abstracto y clips sociales cortos. Débil en cualquier cosa que requiera detalle exacto: señales legibles, rostros específicos, logos de marca, o un personaje que debe verse idéntico en diez tomas.

2. Imagen a video

Subes una fotografía fija y la herramienta la anima: la cámara se desplaza, el cabello se mueve, sube vapor. Esta suele ser la ruta más confiable para principiantes, porque controlas cómo se ve la escena antes de que se añada movimiento. Fotógrafos, dueños de tiendas y cualquiera con una foto de producto debería empezar aquí. Cubrimos el flujo de trabajo en detalle en nuestra guía para convertir una imagen en video, y si necesitas la fotografía primero, ve cómo crear imágenes con IA.

3. Videos de avatar y presentador

Pegas un guión y un presentador digital lo lee a cámara, sincronizado con los labios. Este es el estándar para videos de capacitación, explicadores, anuncios internos y versiones multilingües del mismo mensaje. Synthesia ofrece más de 240 avatares en más de 160 idiomas; el creador de videos de IA de CapCut incluye más de 100 avatares. Normalmente puedes elegir un presentador de stock, o crear uno a partir de metraje consentido de una persona real.

4. Edición asistida por IA

La categoría más tranquila y a menudo la más útil. Aquí el video es real — filmado en tu teléfono — e IA solo ayuda con el trabajo alrededor: subtítulos automáticos, eliminación de fondo, recorte de palabras de relleno, narración de texto a voz, y doblaje a otro idioma. CapCut y Canva hacen mucho de esto. Si la narración es tu necesidad principal, nuestro tutorial de narración de IA profundiza más.

Qué herramienta para qué trabajo

Lo que quieres Tipo Opción razonable Detalle verificado
Un clip social rápido, sin instalación Texto a video Canva, Create a Video Clip Hasta 8 segundos, con sonido sincronizado
Guión directo a video terminado Mixto Creador de videos de IA de CapCut Guión a video, más de 100 avatares, usa Seedance 2.5
El clip de una sola toma más largo que puedes obtener Texto o imagen a video Seedance 2.5 Hasta 30 segundos, con sonido
Clip más nítido con audio estéreo Texto o imagen a video MiniMax H3 (Hailuo 3.0) Hasta 15 segundos, 2K, sonido estéreo
Capacitación o explicador con un presentador Avatar Synthesia Más de 240 avatares, más de 160 idiomas
Subtítulos, doblaje, limpieza en metraje real Edición asistida por IA CapCut o Canva Ambas se ejecutan en un navegador

Para una lista más amplia, consulta nuestros artículos sobre los mejores generadores de video con IA y los mejores generadores de video con IA gratuitos.

Tu primer proyecto: un video de 20 segundos

Planifica entre 30 y 60 minutos la primera vez. El truco es dejar de pensar «hacer un vídeo» y empezar a pensar «hacer cuatro planos cortos y unirlos».

  1. Escribe cuatro planos en papel. Una línea cada uno, cinco segundos cada uno. Ejemplo: (1) granos de café cayendo en un molinillo, primer plano; (2) vapor subiendo de una taza en un mostrador de madera; (3) manos deslizando la taza por el mostrador; (4) la fachada de la tienda a la hora dorada.
  2. Convierte cada línea en un prompt. Usa la fórmula siguiente. Si escribir es lo que te asusta, pídele a un chatbot que redacte diez variaciones de prompt, luego elige las dos que te gusten.
  3. Genera un plano a la vez. Espera ejecutar cada prompt dos o tres veces. Rechazar tomas es normal, no un fracaso. Guarda todos los clips utilizables.
  4. Graba o genera narración. Tu propia voz en un teléfono suena mejor que la mayoría de lecturas sintéticas. Si usas síntesis de voz, mantén las oraciones cortas.
  5. Monta, añade subtítulos, exporta. Coloca los clips en una línea de tiempo en CapCut o Canva, recorta los primeros y últimos fotogramas débiles de cada clip, añade música baja, genera subtítulos automáticos, luego lee los subtítulos tú mismo — los subtítulos automáticos distorsionan nombres y números.
  6. Míralo una vez sin sonido y una vez en un teléfono. La mayoría de errores se revelan en esas dos pasadas.

Una fórmula de prompt que funciona

Sujeto, luego acción, luego cámara, luego luz, luego estilo. «Una taza de cerámica de café en un mostrador de madera gastado, vapor rizándose hacia arriba, movimiento de cámara lento hacia adentro, luz cálida de la mañana desde una ventana lateral, grabado en película de 35 mm». Añade lo que no no quieres si la herramienta lo permite. Mantén una idea por clip — los prompts que piden tres eventos en cinco segundos producen papilla. Nuestro de conversión imagen-a-indicativo de Convly también puede hacer ingeniería inversa de una descripción a partir de una imagen que te guste.

Qué cuesta el video de IA

Existen dos mundos de precios diferentes, y mezclarlos es el error más común de los principiantes.

Aplicaciones para consumidores (Canva, CapCut, Synthesia y similares) venden suscripciones, normalmente con créditos o un límite mensual de generaciones. Esos límites cambian a menudo, así que consulta la página de precios del proveedor — por ejemplo la página de precios de Synthesia — en lugar de confiar en una cifra en un artículo.

Acceso para desarrolladores a los mismos modelos subyacentes se factura por segundo de vídeo terminado. Estas son las cifras de modelo publicadas por Convly, y son útiles como comprobación de cordura sobre lo que vale un clip:

Modelo Fabricante Desde
Wan 2.5 Alibaba cubre la ruta de suscripción.
Veo 3.1 Google cubre la ruta de suscripción.
Kling 2.5 Turbo Pro Kuaishou $0,07 por segundo
Seedance 2.5 ByteDance $0,097 por segundo

A esas tarifas, un vídeo de 20 segundos cuesta aproximadamente uno o dos dólares de generación bruta — antes de las tomas que descartas, que fácilmente pueden triplicarlo. Google publica sus propias tarifas de vídeo por segundo en la página de precios de Gemini API.

Importante: esos números por segundo son precios para desarrolladores. No son no lo que te da una suscripción a Canva, CapCut, ChatGPT o Gemini, y no puedes usarlos para calcular cuántos clips incluye un plan. Para detalles plan por plan, consulta nuestras guías sobre los niveles Free, Go, Plus y Pro de ChatGPT y los planes de IA de Google.

Si usas un chatbot para escribir scripts, esa parte es barata. Los modelos de texto se facturan por token — un token es aproximadamente tres cuartas partes de una palabra. GPT-6 Luna cuesta $0,10 entrada / $0,50 salida por millón de tokens con una ventana de contexto de 1,05M tokens (la cantidad de texto que el modelo puede retener en la mente a la vez), y Gemini 3.8 Flash cuesta $0,75 entrada / $3,75 salida por millón con un contexto de 1M. Toda una tarde escribiendo scripts cuesta centavos. El vídeo es donde va el dinero.

Windows, macOS y Linux

Casi todo esto es trabajo en navegador, así que tu sistema operativo importa menos que tu conexión a internet. Donde sí importa:

Windows

Configuración de escritorio mejor compatible. CapCut ofrece una aplicación de escritorio para Windows junto con su editor web, y Adobe y DaVinci Resolve se ejecutan nativamente si superas las herramientas gratuitas. Si tu PC tiene una tarjeta gráfica NVIDIA discreta, también puedes experimentar con modelos abiertos localmente, aunque la generación de vídeo es mucho más pesada que la generación de imágenes y los requisitos cambian con cada lanzamiento — trata el vídeo local como un proyecto de hobby, no como tu primer proyecto.

macOS

También bien compatible: CapCut tiene una aplicación Mac, y Canva se ejecuta en Safari o Chrome. Los Mac con Apple Silicon manejan cómodamente la edición de líneas de tiempo y la exportación. La generación en la nube se comporta idénticamente a Windows.

Linux

Sin aplicación de escritorio oficial de CapCut. Usa las versiones en navegador de Canva, CapCut y los sitios generadores, que funcionan en Chrome o Firefox. Para edición, DaVinci Resolve tiene una compilación para Linux y Kdenlive es una opción gratuita sólida. Nada sobre IA de vídeo en la nube está bloqueado en Linux — solo algunas aplicaciones de escritorio lo están.

Una herramienta a evitar: Sora

No construyas un flujo de trabajo alrededor de Sora de OpenAI. La aplicación Sora cerró el 26 de abril de 2026, y la Sora 2 API se detuvo el 24 de septiembre de 2026 sin ningún reemplazo nombrado. Los tutoriales más antiguos todavía la recomiendan; están desactualizados. OpenAI lista los retiros en su página de obsolescencia. Este es un buen hábito en general: antes de seguir cualquier tutorial de vídeo IA, comprueba que la herramienta todavía existe.

Honestidad, consentimiento y etiquetas

Algunas líneas que te mantienen fuera de problemas:

  • No uses la cara o la voz de una persona real sin su permiso claro. Esto incluye colegas, celebridades y personas en fotos que encontraste en línea. Las herramientas de avatar piden consentimiento por una razón. Nuestro artículo sobre deepfakes y cómo detectarlos explica por qué las plataformas lo tratan seriamente.
  • Sin reseñas falsas o testimonios inventados. Una persona sintética elogiando tu producto no es un cliente, y presentarlo como tal es engañoso. Si estás haciendo anuncios sociales con IA, lee cómo hacer anuncios UGC sin romper las reglas primero.
  • Etiquétalo. Muchas plataformas requieren que se divulgue vídeo generado por IA o alterado significativamente, y varios añaden etiquetas automáticamente. Las reglas difieren según la plataforma y el país, así que comprueba la política de donde estés publicando.
  • Comprueba los hechos antes de publicar. El metraje generado inventa detalles felizmente: número incorrecto de dedos, texto en pantalla garrapateado, productos que no existen. Para la escuela o el trabajo, pregunta qué está permitido antes de enviar material hecho con IA.

Problemas comunes y soluciones rápidas

Problema Causa más probable Corregir
Las caras se derriten o las manos se ven mal Demasiado movimiento, sujeto demasiado cerca Mueve la cámara en lugar del sujeto; retrocede a un plano más amplio
El texto en pantalla es incoherente Los modelos tienen dificultades para renderizar palabras Añade el texto después en el editor, no en el prompt
Los personajes cambian entre tomas Cada clip se genera desde cero Usa una imagen de referencia e imagen a vídeo para cada toma
El clip termina a mitad de la acción Se alcanza el límite de duración Planifica las tomas para que se ajusten al límite, o divide en dos clips
El audio y los labios están desincronizados Locución añadida sobre el metraje generado Usa una herramienta de avatar específica para presentadores

Preguntas frecuentes

¿Puedo hacer un video de IA de largo completo?

No en una sola generación. Las herramientas actuales producen clips cortos — 8 segundos en Canva's Create a Video Clip, hasta 15 segundos para MiniMax H3, hasta 30 segundos para Seedance 2.5. Los vídeos más largos se crean generando muchos clips y montándolos, exactamente como un equipo de cine humano graba tomas separadas.

¿Existe una forma realmente gratuita de hacer esto?

Sí, dentro de ciertos límites. Varias herramientas ofrecen niveles gratuitos con marcas de agua, esperas en cola o una pequeña asignación mensual, y los editores gratuitos se encargan del montaje y los subtítulos. Las asignaciones cambian frecuentemente, así que consulta la página de precios del proveedor en lugar de cualquier artículo — incluyendo este. Nuestro y no la total. Una tarjeta de 12 GB con 1,5 GB ya consumidos por el compositor y un navegador dispone de unos 10,5 GB disponibles; esto puede hacer que un modelo que «debería caber» falle al cargarse. En NVIDIA, la lista por proceso que aparece en la parte inferior de la salida de generador de vídeo con IA resumen es una buena lista de inicio.

¿Necesito una computadora potente?

No. La generación ocurre en los servidores del proveedor, así que un portátil básico, un Chromebook o incluso un teléfono es suficiente para herramientas en la nube. Una máquina más potente solo ayuda en la etapa de edición y exportación. Ejecutar modelos de vídeo localmente es otra cosa y requiere hardware gráfico serio.

¿Puedo poner mi propio rostro en un video de IA?

Generalmente sí — varias plataformas de avatares te permiten crear un parecido a partir de metraje que grabes tú mismo, siguiendo su proceso de consentimiento. Usar la cara o la voz de otra persona sin permiso es algo completamente diferente y puede violar tanto las reglas de la plataforma como la ley local.

¿Qué es mejor, texto a video o imagen a video?

Imagen a video para todo aquello donde la apariencia importa — productos, marca, un personaje coherente — porque apruebas el fotograma antes de que se mueva. Texto a video para rapidez y para escenas que no puedes fotografiar. La mayoría de proyectos prácticos combinan los dos.

¿Por qué mis clips se ven peor que los demostraciones?

Los rollos de demostración son las mejores tomas de decenas, a menudo con indicaciones seleccionadas a mano. Asume una tasa de rechazo de dos o tres a uno, escribe una idea clara por indicación, y espera que la primera versión de cualquier proyecto sea un borrador.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top