«Модель стала тупее»: кто-то наконец начал это измерять
Жалоба «на прошлой неделе работало лучше» звучит после каждого релиза, и проверить её обычно нечем. Независимый проект livenerf взялся за это всерьёз: каждый день в течение месяца он прогоняет через Opus 5.5 одну и ту же панель из 78 вопросов, а рядом гоняет контрольную Opus 5. На 29 сентября собрано 6 дней из 30, итоги обещают к 24 октября.
Почему до сих пор нельзя было проверить
Ощущение «модель испортилась» возникает почти у всех и почти всегда бездоказательно. Причин несколько, и все они мешают замеру.
Модель отвечает по-разному на один и тот же вопрос. Два прогона подряд дают разный текст, поэтому сравнение «вчера ответила лучше» ничего не значит: это может быть обычный разброс.
Меняются и запросы. Человек привыкает, формулирует иначе, берётся за задачи сложнее. Кажется, что испортилась модель, а изменились требования.
Наконец, у самих провайдеров есть нагрузка: в часы пик ответы идут медленнее, короче, иногда обрубаются. Это не «понизили качество модели», но ощущается похоже.
Как устроен замер
Ключевое решение авторов — подбор вопросов. Взяли только те, которые модель решает иногда: не всегда и не никогда.
Логика простая. Если задачу модель решает в 100% случаев, просадку на ней не увидеть, пока она не станет катастрофической. Если не решает никогда, тоже ничего не увидеть. А вот задача с попаданием где-то посередине чувствительна к небольшим изменениям.
Дальше обычная дисциплина измерения.
| Что делают | Зачем |
|---|---|
| 78 вопросов, один и тот же набор каждый день | исключить влияние смены запросов |
| прогон раз в день 30 дней | отделить тренд от случайного разброса |
| рядом контрольная Opus 5 | если просядут обе, дело в инфраструктуре, а не в модели |
| считают ещё и длину ответа в токенах | «сократили ответ» тоже форма ухудшения |
| проверка на заведомом сдвиге до начала | убедиться, что метод вообще способен поймать просадку |
Вопросы взяты из известных наборов: научные задачи университетского уровня, профильные тесты по предметам, олимпиадная математика.
Почему контрольная модель важнее всего
Это самая ценная часть конструкции. Если обе модели просели в один день, виновата нагрузка или маршрутизация запросов. Если просела только новая — вопрос к ней. Без контроля любые графики объясняются чем угодно.
Чего этот проект не докажет
Стоит сказать сразу, чтобы потом не было разочарования.
Результат будет только про одну модель и только про такие задачи. Ощущение «стало хуже в моей работе» он не подтвердит и не опровергнет: ваши задачи не похожи на олимпиадную математику.
Кроме того, «ослабление» бывает не в модели, а в обвязке вокруг неё: короче системный промпт, меньше шагов у агента, агрессивнее обрезка контекста. Снаружи это выглядит как испортившаяся модель, хотя веса те же.
И самое неудобное: даже честный результат «просадки нет» не убедит того, кто её чувствует. Тут помогает только собственный замер.
Как проверить самому, без статистики
Способ, который занимает полчаса и потом закрывает вопрос навсегда.
Сохраните три-пять своих типовых задач с готовым правильным ответом. Договор, из которого надо вытащить сроки; таблица, где надо посчитать сумму; письмо, которое надо переписать. Ответ, который вас устроил, храните рядом.
Прогоняйте их, когда возникает ощущение «стало хуже». Не по памяти, а буквально те же тексты. В половине случаев окажется, что результат тот же, а изменились ваши ожидания.
Сравнивайте не текст, а попадание в задачу. «Сформулировано иначе» — не ухудшение. «Пропустил условие» — ухудшение.
Проверьте вторую модель в тот же момент. Если просели обе, дело не в модели, а в загрузке провайдера или в вашем интернете.
Смотрите, не изменился ли контекст. Диалог на сотню сообщений и свежий чат ведут себя по-разному, и чаще всего «модель поглупела» означает «в диалоге накопился мусор».
В tenzor для такой проверки удобно держать один чат с эталонными задачами и переключать модель в шапке: видно и результат, и списание за каждый ответ.
Правда ли, что нейросети становятся хуже после релиза?+
Массовых доказательств нет, но и опровержения тоже: до сих пор никто не вёл регулярных замеров. Проект livenerf — первая попытка мерить это ежедневно с контрольной моделью для сравнения.
Почему кажется, что модель стала глупее?+
Обычные причины: модель отвечает по-разному на один и тот же вопрос, меняются ваши формулировки и требования, накопился мусор в длинном диалоге, а в часы пик у провайдера ответы короче и медленнее.
Как проверить самому?+
Держать три-пять своих типовых задач с известным правильным ответом и прогонять именно их, а не похожие. Дополнительно прогнать вторую модель в тот же момент: если просели обе, дело в загрузке, а не в модели.
Когда будут результаты livenerf?+
Авторы собирают данные 30 дней, на 29 сентября пройдено 6. Итоги обещаны примерно к 24 октября 2026 года.
Что дальше почитать
- Как выбрать нейросеть под задачу и бюджет — как сравнивать модели по результату, а не по ощущениям.
- Что такое кеш промпта — почему длинный диалог ведёт себя иначе, чем свежий.
Соберите свой эталонный чат
Пять задач с известным правильным ответом — и вопрос «стало хуже или нет» решается за пять минут.
Открыть чат