- Hugging Face ospita modelli image-to-video (I2V) che è possibile eseguire in tre modi: ospitati Spaces dimostrativi, gli API/Endpoint di inferenza, oppure localmente con la
diffuserslibreria. - Tra i checkpoint I2V open-weight più diffusi figurano Wan 2.1/2.2 I2V (Alibaba), Stable Video Diffusion (SVD/SVD-XT) di Stability AI e LTX-Video di Lightricks.
- VRAM reale richiesta: circa 10–16 GB per SVD a 576×1024, 24 GB o più per Wan 2.2 I2V-A14B a 720p; tecniche di offloading descritte in
diffusersper schede con meno VRAM. - Se non desideri gestire direttamente le GPU, API ospitate come Wan 2.5 ($0,05/sec) o Kling 2.5 Turbo Pro ($0,07/sec) risultano generalmente più economiche dell’acquisto di una GPU.
Image to video su Hugging Face indica l’utilizzo di modelli ospitati su huggingface.co con il tag di pipeline image-to-video per trasformare un’immagine statica in un breve video animato. È possibile interagire con tali modelli in tre modi: demo interattive nel browser, Spaces API di inferenza /Endpoint di inferenza o scaricando i pesi ed eseguendoli localmente con lalibreria Python. Di seguito è riportato ciò che funziona effettivamente, modello per modello e piattaforma per piattaforma. diffusers Libreria Python. Di seguito è riportato ciò che funziona effettivamente, per modello e per piattaforma.
Cosa copre effettivamente il tag con il tag di pipeline image-to-video
Il tag di pipeline filtra l’Hub in modo da mostrare solo modelli il cui input previsto è un’immagine (eventualmente accompagnata da un prompt testuale) e il cui output è un breve video, tipicamente lungo 2–6 secondi e con una frequenza fotogrammi di 16–24 fps. Al momento della stesura, le famiglie open-weight più attive sono:
| Modello | Autore | Output tipico | Licenza dei pesi |
|---|---|---|---|
| Wan 2.2 I2V-A14B | Alibaba (Wan-AI) | 720p, 5 secondi, 24 fps | Apache 2.0 |
| Wan 2.1 I2V-14B / I2V-1.3B | Alibaba (Wan-AI) | 480p–720p, circa 5 secondi | Apache 2.0 |
| Stable Video Diffusion (SVD) | Stability AI | 576×1024, 14 fotogrammi | Licenza non commerciale per SVD / licenza commerciale tramite Stability |
| SVD-XT | Stability AI | 576×1024, 25 fotogrammi | Stessa licenza di SVD |
| LTX-Video | Lightricks | 768×512, ~5 s a 24 fps | Variante OpenRAIL-M |
| CogVideoX-5B-I2V | THUDM | 720×480, 6 s a 8 fps | Apache 2.0 (codice), licenza personalizzata (pesi) |
| con il tag di pipeline | Bantikumar (comunità) | Checkpoint dimostrativo ridotto | Vedi la scheda del modello |
Verificare sempre risoluzione, numero di fotogrammi e licenza direttamente sulla scheda del modello — gli autori aggiornano questi dettagli. La scheda di Wan 2.2 è disponibile all’indirizzo huggingface.co/Wan-AI/Wan2.2-I2V-A14B, SVD-XT all’indirizzo huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt, e LTX-Video all’indirizzo huggingface.co/Lightricks/LTX-Video.
Tre modi per eseguire image-to-video su Hugging Face
1. Spaces (nessuna installazione richiesta, funziona esclusivamente nel browser)
Ogni modello I2V principale dispone di uno o più Spaces comunitari. Visita huggingface.co/spaces, cerca il nome del modello (ad esempio «Wan 2.2 I2V» o «LTX-Video»), carica un’immagine, inserisci facoltativamente un prompt, quindi fai clic su Generare. Gli Spaces gratuiti vengono eseguiti su ZeroGPU condivisa (fette H200) con un limite giornaliero per utente; se lo Space è occupato, verrai messo in coda. Per l’uso in produzione, duplica lo Space e collega hardware a pagamento dalle impostazioni dello Space.
2. API di inferenza ed Endpoint di inferenza
L’API serverless /Endpoint di inferenza o scaricando i pesi ed eseguendoli localmente con la supporta direttamente alcuni modelli I2V; per altri è necessario distribuire un Endpoint di inferenza su una GPU A10G, L4, L40S, A100 o H100. Gli endpoint vengono fatturati in base alle ore di attività della GPU, quindi mantenerne uno attivo per un mese comporta costi elevati; un endpoint A100-80 GB attivo 24/7 costa tipicamente migliaia di dollari al mese. Usa il calcolatore self-hosting vs API per confrontarlo con le API video basate sul costo al secondo.
3. Inferenza locale con diffusers
Il client di riferimento è la libreria Hugging Face diffusers . Installazione:
pip install --upgrade diffusers transformers accelerate torch imageio imageio-ffmpeg
Esempio minimo di SVD-XT (tratto dalla scheda del modello):
import torch
from diffusers import StableVideoDiffusionPipeline
from diffusers.utils import load_image, export_to_video
pipe = StableVideoDiffusionPipeline.from_pretrained(
"stabilityai/stable-video-diffusion-img2vid-xt",
torch_dtype=torch.float16, variant="fp16"
)
pipe.enable_model_cpu_offload()
image = load_image("input.png").resize((1024, 576))
frames = pipe(image, decode_chunk_size=8, num_frames=25).frames[0]
export_to_video(frames, "out.mp4", fps=7)
Per Wan 2.2 utilizza WanImageToVideoPipeline; per LTX-Video utilizza LTXImageToVideoPipeline. Controlla la scheda del modello per il nome esatto della classe — diffusers aggiunge nuove pipeline ad ogni rilascio.
VRAM e hardware, onestamente
L’I2V richiede maggiori risorse rispetto alla generazione di immagini perché si effettua la denoising simultanea di molti fotogrammi di un latente temporale. Le schede dei modelli e il repository diffusers riportano approssimativamente:
| Modello | VRAM nativa (fp16) | Con offload su CPU / quantizzazione |
|---|---|---|
| SVD / SVD-XT (576×1024) | ~16–20 GB | ~8–10 GB con enable_model_cpu_offload() |
| LTX-Video | ~12–24 GB a seconda della durata | Funziona su schede da 12 GB con offload abilitato |
| Wan 2.1 I2V-1.3B | ~8–12 GB | Funziona su una RTX 3060 da 12 GB |
| Wan 2.2 I2V-A14B (720p) | ~24 GB+ | Si adatta su una GPU da 16 GB con fp8/forks GGUF della comunità |
| CogVideoX-5B-I2V | ~18–24 GB | ~5 GB con offload completo (secondo quanto indicato nella scheda THUDM) |
I valori variano in base a risoluzione e numero di fotogrammi. Per una visione generale della scalabilità della memoria GPU consulta la guida sui Calcolatore VRAM e migliori GPU per modelli locali — le stesse GPU (RTX 3090, 4090, 5090, A6000) rappresentano il punto ottimale anche per la generazione video.
Windows
Installa Python 3.10 o 3.11 da python.org, quindi la build CUDA di PyTorch da pytorch.org/get-started/locally compatibile con il tuo driver NVIDIA. Crea un ambiente virtuale (venv), pip install diffusers transformers accelerate, e imposta HF_HOME su un'unità con almeno 50 GB di spazio libero — i pesi di Wan e CogVideoX sono molto grandi. Windows non supporta ROCm; gli utenti AMD dovrebbero usare WSL2 o Linux. Per un'interfaccia più intuitiva, ComfyUI dispone di flussi di lavoro nativi per SVD, Wan e LTX-Video.
macOS
Apple Silicon (M1–M4) esegue diffusers tramite MPS. Installa PyTorch con il supporto MPS, quindi passa torch_dtype=torch.float16 e .to("mps"). In pratica, SVD genera un video da 25 fotogrammi su un M2 Max in alcuni minuti; Wan 2.2 A14B è impraticabile su dispositivi con meno di 64 GB di memoria unificata. LTX-Video è attualmente il modello I2V più utilizzabile su Mac grazie al minor numero di passaggi richiesti. I Mac Intel non dispongono di alcun percorso funzionante per la GPU — usa invece un'API ospitata.
Linux
Linux è la piattaforma principale. Installa il driver NVIDIA e il runtime CUDA 12.x (incluso nei pacchetti PyTorch), quindi pip install diffusers transformers accelerate. Per l'elaborazione su più GPU o per video lunghi, usa accelerate config e pipe.enable_sequential_cpu_offload(). xformers e torch.compile() offrono notevoli miglioramenti prestazionali per SVD e Wan sulle schede Ampere/Ada/Hopper.
Quando conviene saltare Hugging Face e ricorrere a un’API video ospitata
Se hai bisogno di un singolo breve video al giorno, una Space o una scheda RTX locale sono sufficienti. Se invece richiedi un throughput affidabile, le API ospitate a pagamento al secondo risultano generalmente più economiche rispetto al noleggio di un endpoint A100/H100 inutilizzato:
- Wan 2.5 — a partire da 0,05 USD/sec (stessa linea del modello Wan open source disponibile sull'Hugging Face Hub)
- Sora 2 — a partire da 0,05 USD/sec; Sora 2 Pro a partire da 0,15 USD/sec
- Veo 3.1 — a partire da 0,05 USD/sec
- Kling 2.5 Turbo Pro — a partire da 0,07 USD/sec
A 0,05 USD al secondo, 1.000 video da cinque secondi costano 250 USD; noleggiare un H100 ai normali tassi cloud per ottenere lo stesso throughput costa solitamente di più. Usa il Calcolatore dei costi API e consulta il Database di modelli per conoscere i prezzi aggiornati.
Domande frequenti
Esiste un singolo modello «Hugging Face immagine-a-video» a cui dovrei fare riferimento come scelta predefinita?
Nessun modello predefinito unico. Per pesi aperti e licenze permissive, attualmente Wan 2.2 I2V-A14B produce l’output migliore a 720p, ma richiede almeno 24 GB di VRAM. Su schede con 12 GB di VRAM, le scelte pratiche sono LTX-Video o Wan 2.1 I2V-1.3B. SVD-XT è più vecchio, ma documentato in modo eccellente.
Posso utilizzare questi modelli a fini commerciali?
Dipende dal checkpoint. Wan 2.1/2.2, il codice di CogVideoX e LTX-Video hanno licenze permissive, ma ciascuno ha termini specifici; i pesi di Stable Video Diffusion sono distribuiti sotto la licenza comunitaria Stability, con un livello commerciale separato. Leggi sempre attentamente la sezione «License» della scheda del modello prima di distribuire qualsiasi prodotto.
Perché il mio output presenta flickering o sembra una sequenza di immagini fisse?
Di solito uno dei seguenti motivi: troppo pochi passaggi di inferenza (incrementa num_inference_steps), motion_bucket_id/guidance_scale troppo basso per SVD, oppure un'immagine di input con un rapporto d'aspetto non compatibile con la risoluzione di addestramento del modello. Adatta la risoluzione nativa del modello (ad esempio 1024×576 per SVD-XT) prima di generare.
Posso eseguire image-to-video su un laptop con 8 GB di VRAM?
Solo con i modelli più piccoli e applicando tecniche aggressive di offloading. Wan 2.1 I2V-1.3B e versioni quantizzate di LTX-Video possono essere eseguiti, ma occorrono diversi minuti per generare ogni clip. Per modelli più grandi, un’API ospitata o uno Space risulteranno più veloci e meno costosi che cercare di aggirare errori di memoria esaurita (OOM).
Ollama supporta l’image-to-video?
No. Ollama è focalizzato su modelli linguistici testuali e multimodali, non su pipeline di generazione video basate su diffusione. Consulta il Guida a Ollama per sapere quali modelli supporta; per l'I2V, continua a usare diffusers o ComfyUI.
Quanto tempo richiede la generazione di una singola clip su una GPU consumer?
Ordine di grandezza: SVD-XT su una RTX 4090 genera un video da 25 fotogrammi in molto meno di un minuto con le impostazioni predefinite; lo stesso modello con enable_model_cpu_offload() attivo su una scheda da 12 GB è diverse volte più lento. Wan 2.2 A14B a 720p è sostanzialmente più oneroso. I valori esatti dipendono dal numero di passaggi, dalla risoluzione e dalla versione di PyTorch, quindi considera ogni benchmark isolato come approssimativo.
