tenzorНачать
Все статьи

«Модель стала тупее»: кто-то наконец начал это измерять

Жалоба «на прошлой неделе работало лучше» звучит после каждого релиза, и проверить её обычно нечем. Независимый проект livenerf взялся за это всерьёз: каждый день в течение месяца он прогоняет через Opus 5.5 одну и ту же панель из 78 вопросов, а рядом гоняет контрольную Opus 5. На 29 сентября собрано 6 дней из 30, итоги обещают к 24 октября.

Почему до сих пор нельзя было проверить

Ощущение «модель испортилась» возникает почти у всех и почти всегда бездоказательно. Причин несколько, и все они мешают замеру.

Модель отвечает по-разному на один и тот же вопрос. Два прогона подряд дают разный текст, поэтому сравнение «вчера ответила лучше» ничего не значит: это может быть обычный разброс.

Меняются и запросы. Человек привыкает, формулирует иначе, берётся за задачи сложнее. Кажется, что испортилась модель, а изменились требования.

Наконец, у самих провайдеров есть нагрузка: в часы пик ответы идут медленнее, короче, иногда обрубаются. Это не «понизили качество модели», но ощущается похоже.

Как устроен замер

Ключевое решение авторов — подбор вопросов. Взяли только те, которые модель решает иногда: не всегда и не никогда.

Логика простая. Если задачу модель решает в 100% случаев, просадку на ней не увидеть, пока она не станет катастрофической. Если не решает никогда, тоже ничего не увидеть. А вот задача с попаданием где-то посередине чувствительна к небольшим изменениям.

Дальше обычная дисциплина измерения.

Что делаютЗачем
78 вопросов, один и тот же набор каждый деньисключить влияние смены запросов
прогон раз в день 30 днейотделить тренд от случайного разброса
рядом контрольная Opus 5если просядут обе, дело в инфраструктуре, а не в модели
считают ещё и длину ответа в токенах«сократили ответ» тоже форма ухудшения
проверка на заведомом сдвиге до началаубедиться, что метод вообще способен поймать просадку

Вопросы взяты из известных наборов: научные задачи университетского уровня, профильные тесты по предметам, олимпиадная математика.

Почему контрольная модель важнее всего

Это самая ценная часть конструкции. Если обе модели просели в один день, виновата нагрузка или маршрутизация запросов. Если просела только новая — вопрос к ней. Без контроля любые графики объясняются чем угодно.

Чего этот проект не докажет

Стоит сказать сразу, чтобы потом не было разочарования.

Результат будет только про одну модель и только про такие задачи. Ощущение «стало хуже в моей работе» он не подтвердит и не опровергнет: ваши задачи не похожи на олимпиадную математику.

Кроме того, «ослабление» бывает не в модели, а в обвязке вокруг неё: короче системный промпт, меньше шагов у агента, агрессивнее обрезка контекста. Снаружи это выглядит как испортившаяся модель, хотя веса те же.

И самое неудобное: даже честный результат «просадки нет» не убедит того, кто её чувствует. Тут помогает только собственный замер.

Как проверить самому, без статистики

Способ, который занимает полчаса и потом закрывает вопрос навсегда.

Сохраните три-пять своих типовых задач с готовым правильным ответом. Договор, из которого надо вытащить сроки; таблица, где надо посчитать сумму; письмо, которое надо переписать. Ответ, который вас устроил, храните рядом.

Прогоняйте их, когда возникает ощущение «стало хуже». Не по памяти, а буквально те же тексты. В половине случаев окажется, что результат тот же, а изменились ваши ожидания.

Сравнивайте не текст, а попадание в задачу. «Сформулировано иначе» — не ухудшение. «Пропустил условие» — ухудшение.

Проверьте вторую модель в тот же момент. Если просели обе, дело не в модели, а в загрузке провайдера или в вашем интернете.

Смотрите, не изменился ли контекст. Диалог на сотню сообщений и свежий чат ведут себя по-разному, и чаще всего «модель поглупела» означает «в диалоге накопился мусор».

В tenzor для такой проверки удобно держать один чат с эталонными задачами и переключать модель в шапке: видно и результат, и списание за каждый ответ.

Правда ли, что нейросети становятся хуже после релиза?+

Массовых доказательств нет, но и опровержения тоже: до сих пор никто не вёл регулярных замеров. Проект livenerf — первая попытка мерить это ежедневно с контрольной моделью для сравнения.

Почему кажется, что модель стала глупее?+

Обычные причины: модель отвечает по-разному на один и тот же вопрос, меняются ваши формулировки и требования, накопился мусор в длинном диалоге, а в часы пик у провайдера ответы короче и медленнее.

Как проверить самому?+

Держать три-пять своих типовых задач с известным правильным ответом и прогонять именно их, а не похожие. Дополнительно прогнать вторую модель в тот же момент: если просели обе, дело в загрузке, а не в модели.

Когда будут результаты livenerf?+

Авторы собирают данные 30 дней, на 29 сентября пройдено 6. Итоги обещаны примерно к 24 октября 2026 года.

Что дальше почитать

Соберите свой эталонный чат

Пять задач с известным правильным ответом — и вопрос «стало хуже или нет» решается за пять минут.

Открыть чат