tenzorНачать
Все статьи

SenseNova-U1.5: одна модель и понимает картинку, и рисует её

Обычно за картинки отвечают две разные нейросети. Одна умеет смотреть: разбирает, что изображено, читает надписи, отвечает на вопросы по фотографии. Вторая умеет рисовать: делает изображение по описанию. Соединяют их снаружи, на уровне приложения.

SenseNova-U1.5 сделана иначе: понимание и генерация живут в одной модели на 8 миллиардов параметров. Работа вышла на этой неделе и уже собрала внимание среди свежих публикаций.

SenseNova-U1.5: единая модель понимает изображение и генерирует его

Почему объединение — это сложно

Раздельная схема не просто так держалась годами. Смотреть на картинку и создавать её — противоположные задачи. Первая сжимает изображение до смысла, вторая разворачивает смысл обратно в пиксели. Внутренние представления у этих задач разные, и склеить их без потерь никому долго не удавалось.

Отсюда и знакомая боль: попросили поправить одну деталь, а модель перерисовала весь кадр. Она не редактирует, а рисует заново по мотивам, потому что «видящая» часть и «рисующая» — разные механизмы, между которыми смысл передаётся текстом.

Раздельная связка моделей и единая мультимодальная модель

Что сделали авторы

Из архитектуры убрали два привычных узла: отдельный визуальный кодировщик и промежуточный сжиматель изображения. Модель работает с картинкой напрямую, а качество визуального входа подтянули за счёт восстановления кусочков изображения с сохранением пространственной связности.

Дальше пошла специализация. Отдельные «эксперты» дообучались каждый на своём: визуальная эстетика, отрисовка текста на двух языках, инфографика, редактирование. Затем их умения свели в одну модель.

Из заявленного стоит отметить три вещи:

  • разрешение до 4K в родном формате, без апскейла сверху;
  • правка по нескольким образцам сразу, с сохранением лица, геометрии и нетронутых участков кадра;
  • чередование текста и картинок в одном ответе — модель может объяснять и иллюстрировать подряд.

Что значит «нетронутые участки остаются нетронутыми»

Именно это чаще всего ломается при редактировании. Вы просите заменить вывеску на здании, а заодно уезжает лицо человека рядом и сбивается перспектива. Авторы прямо заявляют эту способность как результат, а не как побочный эффект.

Заявленные возможности SenseNova-U1.5: 4K, несколько образцов, текст

Что интересного в заявленных результатах

Любопытнее всего один побочный вывод. Модель почти не видела в обучении структурированных форматов вроде инфографики и сложных схем, но справляется с длинными и структурированными визуальными инструкциями. То есть умение разбирать картинку перетекло в умение её планировать и собирать.

Если это подтвердится на независимых проверках, вывод важнее конкретных цифр: понимание и генерация не просто уживаются в одной модели, а усиливают друг друга. Ровно этого от объединённых архитектур и ждали.

Оговорка обязательна: пока мы видим заявления авторов. Независимых замеров нет, сравнение с флагманами не проводилось, потрогать модель в популярных сервисах нельзя.

Что это значит для пользователя

Прямо сейчас — ничего: новой кнопки в каталоге не появилось. Но направление объясняет, куда движется редактирование картинок в целом.

Сегодня, чтобы правка не поплыла, приходится помогать инструментам. Закрасить кистью нужную область, чтобы остальное осталось нетронутым. Просить точные операции вместо перерисовки, когда нужно просто обрезать или повернуть. Держать цепочку правок короткой, чтобы не копились артефакты.

Единые модели обещают снять часть этих подпорок: модель, которая по-настоящему видит кадр, в принципе не должна перерисовывать то, о чём её не просили. Обещают — пока не гарантируют.

Чем единая модель отличается от связки из двух?+

В связке одна модель разбирает картинку, вторая рисует новую по текстовому описанию. В единой архитектуре обе задачи решает одна модель, поэтому смысл не теряется при передаче между ними.

Что такое правка по нескольким образцам?+

Вы даёте несколько исходных картинок сразу — например, лицо с одной и одежду с другой — и модель собирает результат, сохраняя ключевые признаки каждой.

Можно ли попробовать SenseNova-U1.5?+

В популярных сервисах модели пока нет, это исследовательская публикация с заявленными результатами.

Как сейчас править картинку, чтобы не поплыл весь кадр?+

Закрашивать кистью только нужную область, использовать точные операции вместо перерисовки и не выстраивать длинные цепочки правок.

Что дальше почитать

Попробуйте редактирование по области

Кисть по нужному участку, несколько референсов и модели на выбор — результат виден сразу.

Открыть картинки