| Stato del modello | Disponibile su MindVideo AI | Disponibile su MindVideo AI |
| Input principali | Testo, immagini, video, audio | Testo, immagini, video, audio |
| Flussi supportati | Da testo a video, da immagine a video, da video a video, editing video e generazione basata su riferimenti | Da testo a video, da immagine a video, da video a video, editing video e generazione basata su riferimenti |
| Durata del video | Fino a 30 secondi in una sola generazione | Da 4 a 15 secondi |
| Materiali di riferimento | Fino a 30 immagini, 10 clip video e 10 clip audio | Fino a 9 immagini, 3 video e 3 file audio di riferimento |
| Estensione in più fasi | Supporta un’estensione video più coerente per sequenze più lunghe | Supporta l’estensione video |
| Generazione audio | Generazione nativa audio-video migliorata | Supporta la generazione audio nativa |
| Audio e sincronizzazione labiale | Migliore coordinazione tra dialogo, suono, movimento e tempi della scena | Supporta la sincronizzazione audiovisiva e labiale |
| Coerenza visiva | Migliore continuità di personaggi, prodotti, scene e stile visivo nelle sequenze lunghe | Coerenza dei soggetti migliorata, con margini di miglioramento nelle scene con più soggetti |
| Editing mirato | Modifiche più mirate con prompt, riferimenti ed editing localizzato | Controllo tramite prompt di clip, personaggi, azioni e trame |
| Flusso 3D | Clay render e riferimenti 3D per guidare composizione, movimento, direzione della camera e illuminazione | Non indicato |