Сбер выкатил новое семейство генеративных моделей — Kandinsky WM 1.0. Главная фишка в том, что этот искусственный интеллект умеет создавать видео, которые не просто выглядят реалистично, но и подчиняются законам физики.
Разработка целиком заточена под Physical AI. Проще говоря, её создавали, чтобы тренировать беспилотники, промышленных роботов и прочие автономные железяки на том, до чего в реальной жизни лучше не доводить.
Откуда что берется
В фундамент заложили модель Kandinsky 5.0 Video Lite. Её доучили на миллионах роликов, снятых камерами роботов, беспилотных машин и заводов.
Зачем это нужно? Настоящие испытания стоят дорого, а смоделировать редкую или откровенно опасную ситуацию в реальности порой сложно или опасается сам испытатель. Нейросеть решает эту проблему на раз:
- генерирует ролики длиной около пяти секунд;
- показывает всё: от возни с мелкими предметами до жестких дорожных или производственных ЧП;
- экономит кучу денег и времени на сбор датасетов.
Физика на месте
Чтобы картинка не рассыпалась на абсурдные баги, разработчики применили дополнительное обучение и методы подкрепления. Благодаря этому объекты движутся как положено, геометрия не плывет, а физические взаимодействия выглядят убедительно.
Скрывать разработку не стали. Код и веса моделей уже лежат в открытом доступе по лицензии MIT. Центр робототехники Сбера и институт AIRI вовсю гоняют новинку в хвост и в гриву — готовят роботов к труду и прокачивают дорожные симуляторы.
Комментарии