Muse Image и Muse Video
Это первый релиз после ренейма Meta GenAI в Meta Superintelligence lab.
По сути это что-то типа GPT-Image/Nano Banana, где очень тесно интегрирована диффузионная модель и LLM (потенцаильно шаря часть слоев). Модель теперь сама пишет Python-код и парсит веб для референсов (что уже было у NB). Наверняка все работает на базе Muse.
Показали ,как модель сначала пишет код для генерации фрактала, а затем чётко вставляет его на картинку, полезно для инфографики, теперь модель сначала построить график в питоне по вашим данным а затем ставит его в картинку и для менюшек в ресторанах, где нужна чёткая верстка, которую модель может сделать на условном html. Еще Muse сама исправляет косяки на сгенерированных картинках (типа Test-Time-Scaling, где делается несколько генераций и выбирается лучшая). Причём последняя фича якобы эмерджентно вылезла прямо при RL-тренировке.
В общем ещё одна нанобана, но с большим (?) ризонингом. На t2i арене попала на ~~второе~~ тректье место, совсем на тоненького опередив NB2 и Reve-2, но вчера выпущенный Reve-2.1 уже опять обскакал Muse.
На Image Edit Arena - тоже второе место, слегка обогнал MAI-image-2.5 (куда как раз ушла часть моей бывшей команды из Меты, в которой я работал раньше). На других аренах модели пока нет.
Без скандала не обошлось. Кто-то посчитал, что будет хорошей идеей генерить лица юзеров инсты просто по @-тегу (опция включена по дефолту), что не все оценили. Такого я, если честно, от Марка не ожидал .
пока без агентов, но уже уверенно сидит в топ-3 лидербордов, обойдя happyhorse от Alibaba.
Блогпост - папиру, я думаю, можно не ждать
Потыкать модель можно пока только в американской инсте - у Меты занимает вечность, чтобы что-то выкатить на Европу.
@ai_newz