Mercury 2.5: языковая модель, которая пишет ответ целиком, а не по словам
8 сентября Inception Labs выпустила Mercury 2.5 — самую крупную на сегодня диффузионную языковую модель. Главная цифра релиза: 1107 токенов в секунду на обычных видеокартах NVIDIA. Для сравнения, быстрые привычные модели выдают 200–300 токенов в секунду.
Разница здесь не в проценте скорости, а в самом способе писать текст. Про диффузионные языковые модели в рунете почти не пишут, поэтому объясним по порядку.
Как обычные модели пишут текст
Почти все знакомые вам модели (GPT, Claude, Gemini, DeepSeek) авторегрессионные. Они пишут строго слева направо, по одному кусочку слова за раз. Модель смотрит на всё, что уже написано, и предсказывает следующий токен. Потом смотрит снова, вместе с только что написанным, и предсказывает следующий.
Отсюда знакомый эффект печатающей машинки в чате: текст появляется словами. И отсюда же главное ограничение — длинный ответ не может появиться быстро, потому что каждый следующий токен нужно дождаться. Сотое слово физически не начнёт считаться, пока не готово девяносто девятое.
Как пишет диффузионная модель
Диффузия пришла из генерации картинок. Там модель начинает со случайного шума и постепенно, за несколько десятков шагов, превращает его в изображение — но не по пикселю, а весь кадр сразу, уточняя его целиком на каждом шаге.
Mercury делает то же самое с текстом. Она начинает с «замусоренной» заготовки ответа нужной длины и за несколько проходов уточняет её целиком — все части одновременно. Слово в конце предложения проясняется параллельно со словом в начале.
Почему это быстрее
Дело не в том, что видеокарта считает быстрее. Дело в том, что шагов принципиально меньше: вместо пятисот последовательных предсказаний — несколько десятков проходов, каждый из которых уточняет весь ответ разом. Отсюда и разрыв в скорости.
У подхода есть и обратная сторона. Модель заранее работает с ответом определённой длины, ей сложнее «передумать по ходу» и развернуть рассуждение на десять абзацев, если задача оказалась глубже, чем выглядела. Поэтому диффузионные модели пока сильны не в глубоких рассуждениях, а в задачах, где ответ предсказуемого объёма и нужен мгновенно.
Что в цифрах
- 1107 токенов в секунду на стандартных GPU NVIDIA.
- Задержка около 170 мс — это уровень, при котором голосовой ассистент отвечает без неловкой паузы.
- +40% к «интеллекту» относительно Mercury 2, по замерам разработчиков. По качеству модель сопоставима с экономичными моделями большой тройки — GPT-5.6 Luna в лёгком режиме и Gemini 3.5 Flash-Lite.
- Контекст 260 тысяч токенов — хватает на солидный проект целиком.
- Цена — $0,20 за миллион входных токенов и $0,75 за миллион выходных; на старте действует скидка 80%.
Живой пример из релиза: сервис Augment Code перевёл на Mercury 2.5 вспомогательные задачи и сократил время сжатия контекста со 150 до 27 секунд, а расходы на этот этап — на 90%.
Где скорость решает, а где нет
Скорость ответа — не то же самое, что польза. Если вы просите разобрать договор или написать стратегию, вам всё равно, пришёл ответ за три секунды или за десять: вы будете читать его минуту.
А вот где разница принципиальна:
- Голосовые ассистенты и телефония. Пауза больше полусекунды ощущается как «связь зависла». Тут 170 мс — это разница между живым разговором и роботом.
- Подсказки кода прямо в редакторе. Пока подсказка думает секунду, программист успевает дописать строку сам.
- Служебные шаги внутри агентов. Когда модель делает десять внутренних действий на один ваш вопрос, каждая сэкономленная секунда умножается на десять.
- Массовая обработка. Разметить десять тысяч отзывов — задача, где скорость превращается прямо в деньги.
Для обычного чата с человеком выигрыш скорее психологический: ответ появляется целиком, а не выползает словами.
Стоит ли ждать её в русскоязычных сервисах
Mercury 2.5 доступна через API Inception, Baseten и OpenRouter, так что технически подключить её несложно. Вопрос в другом — в задачах. Для повседневного чата на русском выбор сегодня и так широкий, а вот для голосовых сценариев и агентов, где всё упирается в задержку, такие модели выглядят интересно.
Мы смотрим на неё именно с этой стороны. Какие модели уже доступны в tenzor и сколько стоит тысяча токенов у каждой — в таблице моделей для чата.
Что такое диффузионная языковая модель?+
Модель, которая генерирует текст не по одному токену слева направо, а уточняет весь ответ целиком за несколько проходов — по тому же принципу, по которому нейросети рисуют картинки из шума.
Насколько Mercury 2.5 быстрее обычных моделей?+
Разработчики заявляют 1107 токенов в секунду против типичных 200–300 у быстрых авторегрессионных моделей, то есть в 4–5 раз.
Она умнее GPT или Claude?+
Нет. По качеству Mercury 2.5 сопоставима с экономичными моделями большой тройки, а не с флагманами. Её преимущество — скорость и цена, а не глубина рассуждений.
Где такая скорость нужна на практике?+
В голосовых ассистентах, подсказках кода в редакторе, внутренних шагах агентов и массовой обработке данных. В обычной переписке разница заметна меньше.
Что дальше почитать
- Модели для чата — что доступно сейчас и по какой цене.
- Токены и кредиты: как устроена оплата — почему счёт идёт за токены, а не за сообщения.
Сравните модели на своей задаче
Скорость, качество и цена у моделей расходятся сильно. Проще всего проверить на том, что вы делаете каждый день.
Открыть чат