Wednesday, 16 September 2026 | Updating Daily AI insight, written for builders

Hugging Face Imagen a video: modelos, Spaces e inferencia local

  • Hugging Face aloja modelos de imagen a video (I2V) que puedes ejecutar de tres maneras: alojados Spaces (demostraciones interactivas), la API de inferencia/Endpoints de inferencia, o localmente con la biblioteca diffusers .
  • Entre los checkpoints abiertos más populares de I2V se incluyen Wan 2.1/2.2 I2V (Alibaba), Stable Video Diffusion (SVD/SVD-XT) de Stability AI y LTX-Video de Lightricks.
  • VRAM realista local: ~10–16 GB para SVD a 576×1024, 24 GB o más para Wan 2.2 I2V-A14B a 720p, con técnicas de descarga (offloading) en diffusers para tarjetas más pequeñas.
  • Si no quieres gestionar GPUs, APIs alojadas como Wan 2.5 ($0,05/segundo) o Kling 2.5 Turbo Pro ($0,07/segundo) suelen ser más económicas que comprar una GPU.

Imagen a video en Hugging Face hace referencia al uso de modelos alojados en huggingface.co bajo la etiqueta de canalización imagen-a-video para convertir una imagen fija en un breve clip animado. Puedes interactuar con ellos de tres formas: demostraciones interactivas en el navegador, la convertir una imagen fija en un breve clip animado. Usted interactúa con ellos de tres maneras: haciendo clic para avanzar Spaces (demostraciones interactivas), la API de inferencia/Endpoints de inferencia o descargando los pesos y ejecutándolos localmente con la biblioteca diffusers de Python. A continuación se detalla qué funciona realmente, según el modelo y la plataforma.

Qué cubre realmente la etiqueta imagen-a-video imagen-a-video

La etiqueta de canalización filtra el Hub para mostrar únicamente modelos cuya entrada prevista es una imagen (opcionalmente junto con un prompt de texto) y cuya salida es un breve video, típicamente de 2 a 6 segundos a 16–24 fps. En el momento de redactar este artículo, las familias de modelos de pesos abiertos más activas son:

Modelo Autor Salida típica Licencia de los pesos
Wan 2.2 I2V-A14B Alibaba (Wan-AI) 720p, 5 s, 24 fps Apache 2.0
Wan 2.1 I2V-14B / I2V-1.3B Alibaba (Wan-AI) 480p–720p, ~5 s Apache 2.0
Stable Video Diffusion (SVD) Stability AI 576×1024, 14 fotogramas SVD: uso no comercial / comercial mediante Stability
SVD-XT Stability AI 576×1024, 25 fotogramas Igual que SVD
LTX-Video Lightricks 768×512, ~5 s a 24 fps variante OpenRAIL-M
CogVideoX-5B-I2V THUDM 720×480, 6 s a 8 fps Apache 2.0 (código), personalizada (pesos)
imagen-a-video Bantikumar (comunidad) Punto de control de demostración reducido Consulte la ficha del modelo

Confirme siempre la resolución, el número de fotogramas y la licencia directamente en la ficha del modelo, ya que los autores las actualizan. La ficha de Wan 2.2 se encuentra en huggingface.co/Wan-AI/Wan2.2-I2V-A14B, la de SVD-XT en huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt, y la de LTX-Video en huggingface.co/Lightricks/LTX-Video.

Tres formas de ejecutar imagen a video en Hugging Face

1. Espacios (sin instalación, solo navegador)

Cada modelo importante de I2V dispone de uno o varios Espacios comunitarios. Vaya a huggingface.co/spaces, busque el nombre del modelo (por ejemplo, «Wan 2.2 I2V» o «LTX-Video»), cargue una imagen, escriba un mensaje opcional y haga clic en Generar. Los Espacios gratuitos se ejecutan en ZeroGPU compartida (fracciones de H200) con una cuota diaria por usuario; si el Espacio está ocupado, deberá esperar en cola. Para entornos de producción, duplique el Espacio y asigne hardware de pago desde la configuración del Espacio.

2. API de inferencia y puntos finales de inferencia

La API sin servidor API de inferencia admite directamente algunos modelos I2V; para otros, debe implementar un punto final de inferencia en una GPU A10G, L4, L40S, A100 o H100. Los puntos finales se facturan por hora de tiempo activo de la GPU, por lo que mantener uno en ejecución durante un mes resulta costoso; un punto final A100-80 GB disponible las 24 horas del día suele costar miles de dólares mensuales. Utilice el calculadora de autohospedaje frente a API para compararlos con APIs de generación de vídeos por segundo.

3. Inferencia local con diffusers

El cliente de referencia es la biblioteca diffusers de Hugging Face. Instalación:

pip install --upgrade diffusers transformers accelerate torch imageio imageio-ffmpeg

Ejemplo mínimo de SVD-XT (tomado de la ficha del modelo):

import torch
from diffusers import StableVideoDiffusionPipeline
from diffusers.utils import load_image, export_to_video

pipe = StableVideoDiffusionPipeline.from_pretrained(
    "stabilityai/stable-video-diffusion-img2vid-xt",
    torch_dtype=torch.float16, variant="fp16"
)
pipe.enable_model_cpu_offload()

image = load_image("input.png").resize((1024, 576))
frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0]
export_to_video(frames, "out.mp4", fps=7)

Para Wan 2.2 use WanImageToVideoPipeline; para LTX-Video use LTXImageToVideoPipeline. Consulte la ficha del modelo para conocer el nombre exacto de la clase — diffusers añade nuevas canalizaciones en cada versión.

VRAM y hardware, sin filtros

La generación I2V exige más recursos que la generación de imágenes porque se aplica denoising simultáneamente a múltiples fotogramas de un latente temporal. Las fichas de los modelos y el repositorio diffusers indican aproximadamente:

Modelo VRAM nativa (fp16) Con descarga a CPU / cuantización
SVD / SVD-XT (576×1024) ~16–20 GB ~8–10 GB con enable_model_cpu_offload()
LTX-Video ~12–24 GB según la duración Funciona en tarjetas de 12 GB con descarga
Wan 2.1 I2V-1.3B ~8–12 GB Funciona en una RTX 3060 de 12 GB
Wan 2.2 I2V-A14B (720p) ~24 GB o más Cabe en 16 GB con fp8/GGUF mediante bifurcaciones comunitarias
CogVideoX-5B-I2V ~18–24 GB ~5 GB con descarga completa (según la ficha de THUDM)

Estos valores varían según la resolución y el número de fotogramas. Para una visión general de la escalabilidad de memoria GPU, consulte la guía de Calculadora de VRAM y mejores GPUs para modelos locales — las mismas tarjetas (RTX 3090, 4090, 5090, A6000) son también ideales para generación de vídeo.

Windows

Instale Python 3.10 o 3.11 desde python.org y luego la versión CUDA de PyTorch desde pytorch.org/get-started/locally compatible con su controlador NVIDIA. Cree un entorno virtual y ejecute pip install diffusers transformers accelerate, y establezca HF_HOME en una unidad con al menos 50 GB libres: los pesos de Wan y CogVideoX son muy grandes. Windows no tiene soporte para ROCm; los usuarios de AMD deben usar WSL2 o Linux. Para una interfaz más amigable, ComfyUI cuenta con flujos de trabajo nativos para SVD, Wan y LTX-Video.

macOS

Los chips Apple Silicon (M1–M4) ejecutan diffusers mediante MPS. Instale PyTorch con soporte para MPS y luego pase torch_dtype=torch.float16 y .to("mps"). En la práctica, SVD genera un clip de 25 fotogramas en varios minutos en una M2 Max; Wan 2.2 A14B resulta poco práctico en cualquier sistema con menos de 64 GB de memoria unificada. Actualmente, LTX-Video es el modelo I2V más usable en Mac debido a su menor número de pasos. Los Mac con procesadores Intel carecen de una ruta funcional de GPU: use mejor una API alojada.

Linux

Linux es la plataforma principal. Instale el controlador NVIDIA, el entorno de ejecución CUDA 12.x (incluido en los paquetes wheels de PyTorch) y luego pip install diffusers transformers accelerate. Para múltiples GPU o clips largos, utilice accelerate config y pipe.enable_sequential_cpu_offload(). xformers y torch.compile() proporcionan aceleraciones significativas para SVD y Wan en tarjetas de las arquitecturas Ampere/Ada/Hopper.

Cuándo omitir Hugging Face y usar una API de video alojada

Si necesita un solo clip corto al día, una instancia en Hugging Face Spaces o una tarjeta RTX local son suficientes. Si requiere un rendimiento fiable y constante, las APIs alojadas por segundo suelen ser más económicas que pagar por un endpoint inactivo con A100/H100:

  • Wan 2.5 — desde 0,05 USD/segundo (misma línea que los pesos abiertos de Wan disponibles en el Hub)
  • Sora 2 — desde 0,05 USD/segundo; Sora 2 Pro desde 0,15 USD/segundo
  • Veo 3.1 — desde 0,05 USD/segundo
  • Kling 2.5 Turbo Pro — desde 0,07 USD/segundo

A 0,05 USD por segundo, 1.000 clips de cinco segundos cuestan 250 USD; alquilar un H100 a tarifas típicas en la nube para lograr el mismo rendimiento suele costar más. Utilice el Calculadora de costos de API y explore el Base de datos de modelos para conocer los precios actuales.

Preguntas frecuentes

¿Existe un único modelo de «imagen a video» en Hugging Face al que debería recurrir por defecto?

No hay un valor predeterminado único. Para pesos abiertos y licencias permisivas, Wan 2.2 I2V-A14B genera actualmente la mejor salida a 720p, pero requiere 24 GB o más de VRAM. En tarjetas con 12 GB, LTX-Video o Wan 2.1 I2V-1.3B son las opciones prácticas. SVD-XT es más antiguo, pero está muy bien documentado.

¿Puedo usar estos modelos con fines comerciales?

Depende del checkpoint. Wan 2.1/2.2, el código de CogVideoX y LTX-Video tienen licencias permisivas, pero cada uno incluye sus propios términos; los pesos de Stable Video Diffusion se distribuyen bajo la licencia comunitaria de Stability, con una capa comercial adicional. Lea siempre la sección «Licencia» de la ficha del modelo antes de integrarlo en cualquier producto.

¿Por qué mi salida parpadea o parece una presentación de diapositivas?

Normalmente se debe a alguna de estas causas: demasiados pocos pasos de inferencia (incremente num_inference_steps), motion_bucket_id/guidance_scale está configurado demasiado bajo para SVD, o bien la imagen de entrada tiene una relación de aspecto distinta de la resolución de entrenamiento del modelo. Ajuste la imagen de entrada a la resolución nativa del modelo (por ejemplo, 1024×576 para SVD-XT) antes de generar.

¿Puedo ejecutar imagen a video en una laptop con 8 GB de VRAM?

Solo con los modelos más pequeños y una descarga agresiva (offloading). Wan 2.1 I2V-1.3B y versiones cuantizadas de LTX-Video pueden ejecutarse, pero espere varios minutos por clip. Para cualquier modelo mayor, una API alojada o un Space serán más rápidos y económicos que luchar contra errores de memoria insuficiente (OOM).

¿Soporta Ollama imagen a video?

No. Ollama está centrado en modelos de lenguaje textuales y multimodales, no en pipelines de difusión para video. Consulte la Guía de Ollama para ver qué cubre exactamente; para I2V, prefiera diffusers o ComfyUI.

¿Cuánto tiempo tarda un solo clip en una GPU de consumo?

En términos de orden de magnitud: SVD-XT en una RTX 4090 genera un clip de 25 fotogramas en mucho menos de un minuto con la configuración predeterminada; el mismo modelo con enable_model_cpu_offload() en una tarjeta de 12 GB es varias veces más lento. Wan 2.2 A14B a 720p es considerablemente más exigente. Los valores exactos dependen del número de pasos, la resolución y la versión de PyTorch, así que considere cualquier benchmark individual como aproximado.

Escrito por Mustafa Ihsan

Mustafa Ihsan es el fundador y editor de Convly.ai. Creó y mantiene la base de datos en vivo de modelos de IA del sitio, su índice de relación precio-rendimiento y sus calculadoras gratuitas para los requisitos de VRAM, los costos de las API y la economía del autohospedaje. Escribe sobre precios de modelos, resultados de pruebas comparativas y el hardware necesario para ejecutar modelos de IA localmente, y prefiere sistemáticamente los datos medidos a las afirmaciones de los fabricantes.

Scroll to Top