Alibaba lanza Wan 3.0, su IA generativa de vídeo que duplica la duración máxima respecto a su predecesor

Alibaba ha presentado Wan 3.0, la nueva versión de su modelo de inteligencia artificial capaz de generar clips de vídeo a partir de un prompt. La actualización duplica la duración máxima de los vídeos que conseguía su predecesor y unifica funciones que antes estaban repartidas entre varios modelos. El anuncio llega unas semanas después de que la compañía china lanzara Qwen 3.8-Max, una IA que compite de frente con las versiones más potentes de Claude y ChatGPT, según ha informado la propia empresa en su blog corporativo.
Un modelo que acepta múltiples referencias y genera audio por defecto
Según la publicación oficial de Alibaba, Wan 3.0 puede convertir texto, imágenes, vídeos, audios o incluso documentos en clips de hasta 30 segundos de duración. El usuario solo necesita escribir el prompt junto con las referencias que desee combinar y la IA se encarga del resto. El modelo es capaz de construir una escena completa con movimiento de cámara, diálogo y efectos de sonido integrados.
Una de las ventajas de esta versión respecto a su predecesor es el soporte para múltiples tipos de referencia. Wan 3.0 acepta hasta diez imágenes, cinco clips de vídeo y cinco archivos de audio como referencia en una sola generación. Los usuarios también pueden adjuntar una presentación o documentos en PDF, así como una página web de la que quieran extraer información o contexto para crear la escena. Sin embargo, Wan 3.0 solo puede tomar un documento o una página web dentro de una generación, pero no ambos al mismo tiempo.
Otro agregado de esta actualización es que Wan 3.0 genera audio por defecto. A diferencia de otros modelos, los clips de esta versión vienen con sonido, por lo que los personajes pueden hablar o incluso cantar de forma sincronizada con la escena. La IA también adapta el ambiente sonoro para que sea coherente con el resto de elementos y no se sienta fuera de lugar, aunque si el usuario lo prefiere, también puede generar clips sin audio.
Conversión de documentos en vídeos narrados y mejora en escenas digitales
Wan 3.0 permite ajustar la duración de los clips de forma manual, segundo a segundo, o a través de una función que recomienda la extensión más adecuada según el contenido del prompt. Los usuarios pueden elegir varias resoluciones de salida, entre las que se incluyen 480p, 720p y 1080p, con relaciones de aspecto fijas o adaptables.
Una de las funciones más llamativas es la posibilidad de convertir una presentación o documento en un vídeo. La IA puede leer un PDF o una web y usar el contenido como base para crear el clip, lo que resulta útil para transformar un PowerPoint en una presentación narrada. Otras novedades incluyen mejoras en la renderización de escenas digitales, como interfaces de software, gráficos en movimiento o texto en pantalla. Según Alibaba, los rostros y textos ya no se distorsionan entre fotogramas, al menos no tanto como con Wan 2.7, lo que beneficia la creación de videotutoriales que expliquen una interfaz de usuario.
Disponibilidad y perfil de usuario objetivo
Wan 3.0 ya está disponible en beta pública a través de Model Studio, la plataforma de desarrollo de IA de Alibaba Cloud. La compañía china dijo que su IA apunta a profesionales que quieren crear anuncios cortos para redes sociales, materiales de entrenamiento para robots o conversión de documentos técnicos en vídeos narrados.
Este lanzamiento se produce en un momento en el que Alibaba acelera su estrategia en inteligencia artificial, con el reciente lanzamiento de Qwen 3.8-Max, un modelo que compite directamente con las versiones más avanzadas de Claude y ChatGPT. Con Wan 3.0, la compañía busca consolidar su oferta en el segmento de generación de vídeo, un área cada vez más disputada entre los principales proveedores de IA.



