Alibaba выпустила видеогенератор Wan 3.0, который делает ролик из PDF, презентации или таблицы

Модель создаёт видео до 30 секунд в 1080p и принимает на вход не только текст и картинки, но и документы, таблицы, слайды и веб-страницы. Релиз состоялся сразу после размещения акций на $10 млрд под ИИ-планы компании.
Alibaba официально выпустила Wan 3.0 — новую версию своей нейросети для генерации видео от лаборатории Tongyi Lab. Об этом сообщила компания. Модель работает в режиме публичной беты с 6 августа, а теперь стала общедоступной. Главная особенность Wan 3.0 — омнимодальные референсы: помимо привычных текста, изображений, аудио и видео, на вход можно подавать веб-страницы и документы, включая форматы DOC, XLS, PPT, PDF и Markdown.
Именно поддержка документов — ключевая фишка. Пользователи уже демонстрируют, как «скармливают» модели презентацию или многостраничный PDF с описанием персонажа, продукта и сюжета и получают на выходе готовый 30-секундный ролик — без отдельного промпта и раскадровки. Wan 3.0 генерирует видео длительностью до 30 секунд в разрешении до 1080p, сохраняя детали персонажа, композицию сцены и графику стабильными на протяжении всего ролика. В соцсетях модель хвалят за «кинематографическое» качество и согласованность сцен.
Опробовать Wan 3.0 можно на сайте create.wan.video, а также через Alibaba Cloud Model Studio и Qwen Cloud; кроме того, модель доступна в сторонних сервисах вроде Leonardo.Ai, SeaArt, Scenario и других. Стандартные цены в API составляют $0,05, $0,10 и $0,20 за секунду видео в разрешении 480p, 720p и 1080p соответственно; у ускоренной версии Wan3.0-Video-Prime — $0,068, $0,14 и $0,28 за секунду.