| Estado del modelo | Disponible en MindVideo AI | Disponible en MindVideo AI |
| Entradas principales | Texto, imágenes, vídeos, audio | Texto, imágenes, vídeos, audio |
| Flujos compatibles | Texto a vídeo, imagen a vídeo, vídeo a vídeo, edición de vídeo y generación basada en referencias | Texto a vídeo, imagen a vídeo, vídeo a vídeo, edición de vídeo y generación basada en referencias |
| Duración del vídeo | Hasta 30 segundos en una sola generación | De 4 a 15 segundos |
| Materiales de referencia | Hasta 30 imágenes, 10 clips de vídeo y 10 clips de audio | Hasta 9 imágenes, 3 vídeos y 3 archivos de audio de referencia |
| Extensión en varias rondas | Permite una extensión de vídeo más coherente para secuencias largas | Permite extender vídeos |
| Generación de audio | Generación nativa de audio y vídeo mejorada | Admite generación de audio nativa |
| Audio y sincronización labial | Mejor coordinación entre diálogo, sonido, movimiento y ritmo de escena | Admite sincronización audiovisual y labial |
| Coherencia visual | Mejor continuidad de personajes, productos, escenas y estilo visual en secuencias largas | Mayor coherencia del sujeto, con margen de mejora en escenas con varios sujetos |
| Edición dirigida | Cambios más específicos con prompts, referencias y edición localizada | Control mediante prompts de clips, personajes, acciones y tramas |
| Flujo 3D | Clay renders y referencias 3D para guiar composición, movimiento, dirección de cámara e iluminación | No mencionado |