- Hugging Face aloja modelos de imagen a video (I2V) que puedes ejecutar de tres maneras: alojados Spaces (demostraciones interactivas), la API de inferencia/Endpoints de inferencia, o localmente con la biblioteca
diffusers. - Entre los checkpoints abiertos más populares de I2V se incluyen Wan 2.1/2.2 I2V (Alibaba), Stable Video Diffusion (SVD/SVD-XT) de Stability AI y LTX-Video de Lightricks.
- VRAM realista local: ~10–16 GB para SVD a 576×1024, 24 GB o más para Wan 2.2 I2V-A14B a 720p, con técnicas de descarga (offloading) en
diffuserspara tarjetas más pequeñas. - Si no quieres gestionar GPUs, APIs alojadas como Wan 2.5 ($0,05/segundo) o Kling 2.5 Turbo Pro ($0,07/segundo) suelen ser más económicas que comprar una GPU.
Imagen a video en Hugging Face hace referencia al uso de modelos alojados en huggingface.co bajo la etiqueta de canalización imagen-a-video para convertir una imagen fija en un breve clip animado. Puedes interactuar con ellos de tres formas: demostraciones interactivas en el navegador, la convertir una imagen fija en un breve clip animado. Usted interactúa con ellos de tres maneras: haciendo clic para avanzar Spaces (demostraciones interactivas), la API de inferencia/Endpoints de inferencia o descargando los pesos y ejecutándolos localmente con la biblioteca diffusers de Python. A continuación se detalla qué funciona realmente, según el modelo y la plataforma.
Qué cubre realmente la etiqueta imagen-a-video imagen-a-video
La etiqueta de canalización filtra el Hub para mostrar únicamente modelos cuya entrada prevista es una imagen (opcionalmente junto con un prompt de texto) y cuya salida es un breve video, típicamente de 2 a 6 segundos a 16–24 fps. En el momento de redactar este artículo, las familias de modelos de pesos abiertos más activas son:
| Modelo | Autor | Salida típica | Licencia de los pesos |
|---|---|---|---|
| Wan 2.2 I2V-A14B | Alibaba (Wan-AI) | 720p, 5 s, 24 fps | Apache 2.0 |
| Wan 2.1 I2V-14B / I2V-1.3B | Alibaba (Wan-AI) | 480p–720p, ~5 s | Apache 2.0 |
| Stable Video Diffusion (SVD) | Stability AI | 576×1024, 14 fotogramas | SVD: uso no comercial / comercial mediante Stability |
| SVD-XT | Stability AI | 576×1024, 25 fotogramas | Igual que SVD |
| LTX-Video | Lightricks | 768×512, ~5 s a 24 fps | variante OpenRAIL-M |
| CogVideoX-5B-I2V | THUDM | 720×480, 6 s a 8 fps | Apache 2.0 (código), personalizada (pesos) |
| imagen-a-video | Bantikumar (comunidad) | Punto de control de demostración reducido | Consulte la ficha del modelo |
Confirme siempre la resolución, el número de fotogramas y la licencia directamente en la ficha del modelo, ya que los autores las actualizan. La ficha de Wan 2.2 se encuentra en huggingface.co/Wan-AI/Wan2.2-I2V-A14B, la de SVD-XT en huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt, y la de LTX-Video en huggingface.co/Lightricks/LTX-Video.
Tres formas de ejecutar imagen a video en Hugging Face
1. Espacios (sin instalación, solo navegador)
Cada modelo importante de I2V dispone de uno o varios Espacios comunitarios. Vaya a huggingface.co/spaces, busque el nombre del modelo (por ejemplo, «Wan 2.2 I2V» o «LTX-Video»), cargue una imagen, escriba un mensaje opcional y haga clic en Generar. Los Espacios gratuitos se ejecutan en ZeroGPU compartida (fracciones de H200) con una cuota diaria por usuario; si el Espacio está ocupado, deberá esperar en cola. Para entornos de producción, duplique el Espacio y asigne hardware de pago desde la configuración del Espacio.
2. API de inferencia y puntos finales de inferencia
La API sin servidor API de inferencia admite directamente algunos modelos I2V; para otros, debe implementar un punto final de inferencia en una GPU A10G, L4, L40S, A100 o H100. Los puntos finales se facturan por hora de tiempo activo de la GPU, por lo que mantener uno en ejecución durante un mes resulta costoso; un punto final A100-80 GB disponible las 24 horas del día suele costar miles de dólares mensuales. Utilice el calculadora de autohospedaje frente a API para compararlos con APIs de generación de vídeos por segundo.
3. Inferencia local con diffusers
El cliente de referencia es la biblioteca diffusers de Hugging Face. Instalación:
pip install --upgrade diffusers transformers accelerate torch imageio imageio-ffmpeg
Ejemplo mínimo de SVD-XT (tomado de la ficha del modelo):
import torch
from diffusers import StableVideoDiffusionPipeline
from diffusers.utils import load_image, export_to_video
pipe = StableVideoDiffusionPipeline.from_pretrained(
"stabilityai/stable-video-diffusion-img2vid-xt",
torch_dtype=torch.float16, variant="fp16"
)
pipe.enable_model_cpu_offload()
image = load_image("input.png").resize((1024, 576))
frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0]
export_to_video(frames, "out.mp4", fps=7)
Para Wan 2.2 use WanImageToVideoPipeline; para LTX-Video use LTXImageToVideoPipeline. Consulte la ficha del modelo para conocer el nombre exacto de la clase — diffusers añade nuevas canalizaciones en cada versión.
VRAM y hardware, sin filtros
La generación I2V exige más recursos que la generación de imágenes porque se aplica denoising simultáneamente a múltiples fotogramas de un latente temporal. Las fichas de los modelos y el repositorio diffusers indican aproximadamente:
| Modelo | VRAM nativa (fp16) | Con descarga a CPU / cuantización |
|---|---|---|
| SVD / SVD-XT (576×1024) | ~16–20 GB | ~8–10 GB con enable_model_cpu_offload() |
| LTX-Video | ~12–24 GB según la duración | Funciona en tarjetas de 12 GB con descarga |
| Wan 2.1 I2V-1.3B | ~8–12 GB | Funciona en una RTX 3060 de 12 GB |
| Wan 2.2 I2V-A14B (720p) | ~24 GB o más | Cabe en 16 GB con fp8/GGUF mediante bifurcaciones comunitarias |
| CogVideoX-5B-I2V | ~18–24 GB | ~5 GB con descarga completa (según la ficha de THUDM) |
Estos valores varían según la resolución y el número de fotogramas. Para una visión general de la escalabilidad de memoria GPU, consulte la guía de Calculadora de VRAM y mejores GPUs para modelos locales — las mismas tarjetas (RTX 3090, 4090, 5090, A6000) son también ideales para generación de vídeo.
Windows
Instale Python 3.10 o 3.11 desde python.org y luego la versión CUDA de PyTorch desde pytorch.org/get-started/locally compatible con su controlador NVIDIA. Cree un entorno virtual y ejecute pip install diffusers transformers accelerate, y establezca HF_HOME en una unidad con al menos 50 GB libres: los pesos de Wan y CogVideoX son muy grandes. Windows no tiene soporte para ROCm; los usuarios de AMD deben usar WSL2 o Linux. Para una interfaz más amigable, ComfyUI cuenta con flujos de trabajo nativos para SVD, Wan y LTX-Video.
macOS
Los chips Apple Silicon (M1–M4) ejecutan diffusers mediante MPS. Instale PyTorch con soporte para MPS y luego pase torch_dtype=torch.float16 y .to("mps"). En la práctica, SVD genera un clip de 25 fotogramas en varios minutos en una M2 Max; Wan 2.2 A14B resulta poco práctico en cualquier sistema con menos de 64 GB de memoria unificada. Actualmente, LTX-Video es el modelo I2V más usable en Mac debido a su menor número de pasos. Los Mac con procesadores Intel carecen de una ruta funcional de GPU: use mejor una API alojada.
Linux
Linux es la plataforma principal. Instale el controlador NVIDIA, el entorno de ejecución CUDA 12.x (incluido en los paquetes wheels de PyTorch) y luego pip install diffusers transformers accelerate. Para múltiples GPU o clips largos, utilice accelerate config y pipe.enable_sequential_cpu_offload(). xformers y torch.compile() proporcionan aceleraciones significativas para SVD y Wan en tarjetas de las arquitecturas Ampere/Ada/Hopper.
Cuándo omitir Hugging Face y usar una API de video alojada
Si necesita un solo clip corto al día, una instancia en Hugging Face Spaces o una tarjeta RTX local son suficientes. Si requiere un rendimiento fiable y constante, las APIs alojadas por segundo suelen ser más económicas que pagar por un endpoint inactivo con A100/H100:
- Wan 2.5 — desde 0,05 USD/segundo (misma línea que los pesos abiertos de Wan disponibles en el Hub)
- Sora 2 — desde 0,05 USD/segundo; Sora 2 Pro desde 0,15 USD/segundo
- Veo 3.1 — desde 0,05 USD/segundo
- Kling 2.5 Turbo Pro — desde 0,07 USD/segundo
A 0,05 USD por segundo, 1.000 clips de cinco segundos cuestan 250 USD; alquilar un H100 a tarifas típicas en la nube para lograr el mismo rendimiento suele costar más. Utilice el Calculadora de costos de API y explore el Base de datos de modelos para conocer los precios actuales.
Preguntas frecuentes
¿Existe un único modelo de «imagen a video» en Hugging Face al que debería recurrir por defecto?
No hay un valor predeterminado único. Para pesos abiertos y licencias permisivas, Wan 2.2 I2V-A14B genera actualmente la mejor salida a 720p, pero requiere 24 GB o más de VRAM. En tarjetas con 12 GB, LTX-Video o Wan 2.1 I2V-1.3B son las opciones prácticas. SVD-XT es más antiguo, pero está muy bien documentado.
¿Puedo usar estos modelos con fines comerciales?
Depende del checkpoint. Wan 2.1/2.2, el código de CogVideoX y LTX-Video tienen licencias permisivas, pero cada uno incluye sus propios términos; los pesos de Stable Video Diffusion se distribuyen bajo la licencia comunitaria de Stability, con una capa comercial adicional. Lea siempre la sección «Licencia» de la ficha del modelo antes de integrarlo en cualquier producto.
¿Por qué mi salida parpadea o parece una presentación de diapositivas?
Normalmente se debe a alguna de estas causas: demasiados pocos pasos de inferencia (incremente num_inference_steps), motion_bucket_id/guidance_scale está configurado demasiado bajo para SVD, o bien la imagen de entrada tiene una relación de aspecto distinta de la resolución de entrenamiento del modelo. Ajuste la imagen de entrada a la resolución nativa del modelo (por ejemplo, 1024×576 para SVD-XT) antes de generar.
¿Puedo ejecutar imagen a video en una laptop con 8 GB de VRAM?
Solo con los modelos más pequeños y una descarga agresiva (offloading). Wan 2.1 I2V-1.3B y versiones cuantizadas de LTX-Video pueden ejecutarse, pero espere varios minutos por clip. Para cualquier modelo mayor, una API alojada o un Space serán más rápidos y económicos que luchar contra errores de memoria insuficiente (OOM).
¿Soporta Ollama imagen a video?
No. Ollama está centrado en modelos de lenguaje textuales y multimodales, no en pipelines de difusión para video. Consulte la Guía de Ollama para ver qué cubre exactamente; para I2V, prefiera diffusers o ComfyUI.
¿Cuánto tiempo tarda un solo clip en una GPU de consumo?
En términos de orden de magnitud: SVD-XT en una RTX 4090 genera un clip de 25 fotogramas en mucho menos de un minuto con la configuración predeterminada; el mismo modelo con enable_model_cpu_offload() en una tarjeta de 12 GB es varias veces más lento. Wan 2.2 A14B a 720p es considerablemente más exigente. Los valores exactos dependen del número de pasos, la resolución y la versión de PyTorch, así que considere cualquier benchmark individual como aproximado.
