Архив доступен 2 007 сообщений С 2020 года

Лента канала хранится отдельно от общего реестра и подгружается страницами, чтобы аналитик мог читать архив без тяжёлого общего поиска поверх сообщений.

Нейродайджест за неделю ()

LLM

Opus 5 — Новая модель Anthropic обгоняет Fable 5 на нескольких бенчмарках. Доступна по API за $5/$25 — вдвое дешевле Fable.

Gemini 3.6 Flash — Минорный апдейт от Google: чуть дешевле ($7.5 вместо $9 за выход), а Flash Lite наоборот подорожал вдвое по стоимости за таск.

Генеративные модели

FLUX 3 — Black Forest Labs наконец анонсировали видеомодель. Одна модель на картинки, видео и аудио.

Clean Plate для LTX-2.3 — Lightricks выкатили LoRA, которая вычищает людей и транспорт из видео.

Прочее

GTM Lead в GenPeach AI — Ищу founding sales-лида для AI-видеогенерации.

Читать дайджест

дайджест

@ai_newz

Вышел Opus 5

@ai_newz

Black Forest Labs наконец-то показали видеомодель

Анонсировали FLUX 3 - но еще не выпустили. Видео модель ребята уже два года как обещают, и вот-вот она должна нацонец выйти. Думаю, что они наконец смогли приблизиться по качеству к видео моделям от Google, поэтому и хотят побыстрее ее выпустить.

Говорят, что это одна модель которая может генерировать изображения, видео и аудио.

Релизить будут постепенно в ближайшие недели и месяцы.

Блогпост

@ai_newz

Muse Image и Muse Video

Это первый релиз после ренейма Meta GenAI в Meta Superintelligence lab.

По сути это что-то типа GPT-Image/Nano Banana, где очень тесно интегрирована диффузионная модель и LLM (потенцаильно шаря часть слоев). Модель теперь сама пишет Python-код и парсит веб для референсов (что уже было у NB). Наверняка все работает на базе Muse.

Показали ,как модель сначала пишет код для генерации фрактала, а затем чётко вставляет его на картинку, полезно для инфографики, теперь модель сначала построить график в питоне по вашим данным а затем ставит его в картинку и для менюшек в ресторанах, где нужна чёткая верстка, которую модель может сделать на условном html. Еще Muse сама исправляет косяки на сгенерированных картинках (типа Test-Time-Scaling, где делается несколько генераций и выбирается лучшая). Причём последняя фича якобы эмерджентно вылезла прямо при RL-тренировке.

В общем ещё одна нанобана, но с большим (?) ризонингом. На t2i арене попала на ~~второе~~ тректье место, совсем на тоненького опередив NB2 и Reve-2, но вчера выпущенный Reve-2.1 уже опять обскакал Muse.

На Image Edit Arena - тоже второе место, слегка обогнал MAI-image-2.5 (куда как раз ушла часть моей бывшей команды из Меты, в которой я работал раньше). На других аренах модели пока нет.

Без скандала не обошлось. Кто-то посчитал, что будет хорошей идеей генерить лица юзеров инсты просто по @-тегу (опция включена по дефолту), что не все оценили. Такого я, если честно, от Марка не ожидал .

пока без агентов, но уже уверенно сидит в топ-3 лидербордов, обойдя happyhorse от Alibaba.

Блогпост - папиру, я думаю, можно не ждать

Потыкать модель можно пока только в американской инсте - у Меты занимает вечность, чтобы что-то выкатить на Европу.

@ai_newz

GPT 5.6 уже раскатывают на всех пользователей

Sol будет доступен всем платным пользователям, Terra и Luna бесплатным. Вмест с релизом модели релизнули ChatGPT Work — ответ Claude Cowork, агент в ChatGPT для не-кодинговых задач. Второй заметный релиз — ChatGPT Sites, возможность публиковать мелкие сайтики сделанные при помощи ChatGPT, такой себе "у нас есть артефакты дома". Ну и Codex и ChatGPT это теперь одно приложение на десктопе.

@ai_newz

Guided Star-Shaped Masked Diffusion

У masked diffusion LLM есть довольно тупая проблема: если токен уже размаскировался, всё, он заморожен. Ошиблась модель на раннем шаге — дальше она уже не исправляет ошибку, а пытается построить вокруг неё текст. Такие несогласованности особенно заметны при маленьком количестве шагов. Существующие методы перемаскирования дают модели шанс передумать, но требуют сотен шагов, что убивает главное преимущество диффузии — скорость.

Авторы из T-Tech и ВШЭ на ICML представили метод, в котором все зашумлённые состояния зависят только от чистого текста, но не друг от друга. На каждом шаге модель предсказывает полную чистую последовательность, а следующее состояние сэмплируется заново из неё, ничего не наследуя от текущего: любой токен можно вернуть в маску и переписать, причём дообучения это не требует.

С нуля так генерировать нельзя — перемаскирование на ранних шагах разрушает несложившийся контекст, поэтому первые ~70% шагов черновик пишется обычным способом, и лишь потом включается режим правки. Куда именно править, указывает отдельный лёгкий предсказатель ошибок, обученный на промахах модели при генерации. Главный минус такого подхода — отсутствие возможности вставлять и удалять токены.

В результате, за 128 шагов метод обгоняет по качеству и разнообразию текста лучший из прежних подходов с бюджетом в 512 шагов, что позволяет генерировать почти втрое быстрее (3.4 против 9.2 секунды на H200). Предсказатель ошибок, обученный на веб-текстах, переносится на код, математику и новости без дообучения.

Пейпер

Код

@ai_newz

Meta выпустила Muse Spark 1.1

Новая версия лучше во всём, особенно прокачали агентный кодинг. Вместе с моделью Meta запустила свой API, цена за Muse Spark 1.1 — $1.25/$4.25 за миллион токенов, всем аккаунтам дают бесплатных 20 баксов API кредитов.

@ai_newz

GPT 5.6 выйдет уже завтра

OpenAI пообещали релизнуть все три модели линейки в этот четверг, а пока что расширяют превью на компании за пределами США.

@ai_newz

Fable 5 оставили в Claude Code до 12го июля

Это я что, зря всю ночь его гонял тратя лимиты вместо сна

Видимо релиз 5.6 Sol совсем скоро

Штраф на 4.7 миллиарда

Пост не совсем про AI, но Google играет ключевую роль в нашем деле, так что пройти мимо сложно.

Компания окончательно проиграла апелляцию в высшей инстанции ЕС, подтвердив рекордный антимонопольный штраф в размере 4.12 миллиарда евро (~4.68 миллиарда долларов). Кейс тянется с 2018 года - тогда ЕК обвинила Google в ограничении конкуренции из-за обязательной предустановки Search и Chrome на Android в обмен на лицензирование Google Play.

Вот такой выходит налог на базу пользователей Gemini и их данные с Google аккаунтов. Интересно какие проследуют за этим изменения.

@ai_newz

Anthropic, как и обещали, вернули доступ к Fable 5

@ai_newz

Anthropic опубликовали блогпост с деталями перевыпуска Fable 5

Официально подтвердили что причиной блокировки стал репорт амазона, где Fable 5 нашла уязвимость и написала код который её может использовать. Те же самые уязвимости могли найти и использовать Opus 4.8, GPT 5.5 и Kimi K2.7. Тем не менее Anthropic натренировали более жёсткий классификатор, который будет перекидывать запросы на Opus 4.8.

Доступ должны включить всем у кого он был в течение ~суток. До 7 июня до половины лимитов подписок Pro, Team, Max и Premium Enterprise могут быть использованы на Fable 5, дальше по кредитам.

@ai_newz

С Anthropic сняли экспортные ограничения

Доступ к Fable 5 начнут восстанавливать уже завтра. Мы пока не знаем деталей сделки с правительством, интересно на какие именно уступки пришлось пойти компании. Ну и продлят ли доступ к Fable подписчикам или сразу будут требовать апишные цены мы тоже не знаем.

@ai_newz

Вышел Claude Sonnet 5

По перформансу ближе к Opus 4.8 чем к Sonnet 4.6. Модель уже доступна всем пользователям, включая бесплатных. Цена до конца лета $2/$10 за миллион токенов, потом поднимут до классических $3/$15.

@ai_newz

Comfy MCP

Если вы ещё не освоили Comfy и до сих пор генерите на аггрегаторах, самое время пересаживаться. Я ещё нигде не видел нормальной реализации воркфлоу, а здесь как бы первоисточник. Хоть и API может выходить немного дороже подписки в сухом пересчёте, часто все может быть наоборот из-за сгоревших в конце месяца остатков токенов и очередей на генерации.

Поддержка MCP исключает необходимость погружаться во все тонкости спагетиобразных пайплайнов. Теперь агент может сам находить нужные ноды и собирать любой воркфлоу.

Блогпост

@ai_newz

Сбер опубликовал KVAE-Audio с открытым исходным кодом

В открытый доступ выложили алгоритм для сжатия аудиоданных. Инструмент обрабатывает звук в формате 48 кГц и сжимает его в 960 раз по времени. Итоговое латентное пространство ограничено 64 каналами. Компактный размер представления позволяет значительно быстрее обучать генеративные модели, чем если бы они обучались на сырых аудиосигналах.

При разработке подобных решений всегда требуется точный баланс между качеством восстановления изначального звука и генерацией нового. Инженеры внедрили кастомную технику регуляризации для решения типичной проблемы сильного перекоса алгоритмов в сторону реконструкции. Благодаря такому подходу архитектура превзошла токенизатор MMAudio от Sony по всем измеряемым метрикам. Модель также обошла DACVAE от Meta и SAME-L от Stability AI в качестве генерации, сохранив аналогичный уровень восстановления при радикально меньшем количестве параметров.

Проект стал логичным продолжением семейства KVAE. Ранее в этой линейке были опубликованы решения для компрессии изображений и видео. Код и веса доступны GitHub и HuggingFace под свободной лицензией MIT.

Блогпост

Код

Веса

@ai_newz

Нейродайджест за неделю ()

LLM

Анонс GPT 5.6 от OpenAI — Вышли три варианта (Sol, Terra, Luna). Это ответов на Fable. В следующем месяце версию Sol обещают запустить на Cerebras со скоростью 750 токенов в секунду.

Генеративные модели

Нативные 4K в SeeDance 2.5 — ByteDance анонсировали новую модель с поддержкой до 50 мультимодальных референсов. А ещё запустили платформу для легальных ремиксов с отчислениями правообладателям.

Прочее

Чип OpenAI — Jalapeño предназначен исключительно для инференса. Разработан совместно с Broadcom всего за девять месяцев, но продавать или сдавать в аренду его не планируют.

ИИ прочитал обуглившийся свиток — В рамках Vesuvius Challenge впервые удалось полностью расшифровать папирус, переживший извержение Везувия. Это оказался философский текст 2 века до нашей эры.

Читать дайджест

дайджест

@ai_newz

На китайских чипах натренировали первую большую LLM

Meituan релизнули LongCat 2.0, которую тренировали на 50 тысячах неназванных китайских чипов, по деталям похожих на Huawei Ascend 910C. Претрейн большой, 1,6 триллиона параметров (почти как у DeepSeek V4 Pro), из которых 48 миллиардов активных. Тренировали на 35 триллионах токенов, причём несколько сотен миллиардов токенов это данные с длиной контекста около миллиона токенов. Таких масштабов раньше достигали только на GPU Nvidia и TPU от гугла, так что это очень большое достижение.

Интересная особенность модели — тут неактивные параметры уходят не только на MoE слои, но и на огромные n-gram эмбеддинги, которые занимают почти 10% всех параметров модели (у LongCat Flash-Lite, на которой их тестили, на это ушла вообще почти половина параметров). Кстати по эмбеддингам они тоже параллелят, получив в итоге 6D параллелизм. Ну и конечно они не смогли удержаться и сделали собственный вариант Sparse Attention, путём модификации до неузнаваемости DSA.

Последние два месяца LongCat 2.0 тестили на Openrouter под кодовым именем Owl Alpha, звёзд с неба она там не хватала. В API модель стоит $0.75/$3 за миллион токенов, что дороговато для такого уровня интеллекта (хотя прожорливость пока что непонятна). Веса модели обещают скоро релизнуть, Meituan обычно релизит под Apache 2.0/MIT.

Веса будут тут

Блогпост

@ai_newz

OpenAI показали GPT 5.6

Идёт в трёх вариантах: Sol, Terra и Luna. Sol это новый флагман, Terra примерно находится на уровне GPT 5.5, а Luna немного хуже 5.4. Sol стоит $5/$30 за миллион токенов, Terra $2.5/$15 и Luna $1/$6. Кэширование токенов теперь платное, такие промпты на 25% дороже, а скидка на кэшированные токены остаётся 90%.

Самая впечатляющая деталь этих моделей — GPT 5.6 Sol запустят на Cerebras в следующем месяце, на скорости в 750 токенов в секунду. Terra и Luna тоже хотелось бы там увидеть, но про них пока что ничего не говорят, как ничего не говорят и про цену.

Модель доступна лишь ограниченному количеству партнёров в США, пока OpenAI договариваются с правительством. Общую доступность обещают через несколько недель.

@ai_newz

В Vesuvius Challenge впервые прочитали весь обуглившийся свиток

Из-за того что папирус разлагается за несколько сотен лет, за тысячелетия было утеряно большинство текстов из той эпохи. Геркуланумским папирусам в каком-то смысле повезло — из-за извержения Везувия две тысячи лет назад свитки обуглились и были погребены, что позволило им сохраниться.

Уже в наше время вышло сделать трёхмерные сканы свитков при помощи рентгена и использовать нейросети для их "виртуального разворачивания". Таким образом в 2023 году победителям Vesuvius Challenge удалось прочитать небольшой отрывок из одного папируса, после чего нескольких участников наняли заниматься этим на постоянной основе, что привело к реконструкции содержимого всего свитка.

К сожалению, большая часть PHerc. 1667, расшифрованного свитка, была физически уничтожена во время нескольких попыток открыть его в 19 и 20 веке, так что из 19-24 сантиметров свитка, физически уцелело лишь 8. По нему понятно, что это стоический текст датированный 2 веком до нашей эры, у которого удалось идентифицировать автора — Аристокреона, ученика известного стоического философа Хрисиппа.

Остались ещё сотни свитков которые ждут своего часа, команда и не думает останавливаться. Новый текст из свитков в ближайшие годы станет регулярным событием.

Блогпост

@ai_newz