Модель учат не копировать правильное, а отталкиваться от неправильного
Нейросеть можно улучшать без новых данных: пусть она сама себе будет учителем. Ей дают задачу вместе с готовым ответом, она пишет подробное решение, зная ответ заранее, — а потом учится повторять это решение уже вслепую. Приём называется самодистилляцией и работает на многих задачах.
На сложных рассуждениях он внезапно портит модель. Свежая работа объясняет почему и предлагает перевернуть подход.
В чём подвох уверенного образца
Представьте студента, которому дали задачу вместе с ответом из конца учебника. Он пишет безупречно гладкое решение: ни одного «попробуем так... нет, не выходит», ни одной проверки, прямая дорога к цели. Потом этот текст дают другому студенту как образец.
Второй студент выучивает не способ думать, а манеру держаться уверенно. В задаче, где ответ заранее неизвестен, такая манера вредна: настоящее рассуждение состоит из тупиков, сомнений и возвратов назад.
С моделью происходит то же самое. Подражая решению, написанному со знанием ответа, она подавляет в себе выражение неуверенности и отучается от поисковых ходов. На простых задачах это незаметно, а на сложных — прямо роняет качество.
Коротко
Модель, которую учат на идеально уверенных решениях, становится увереннее, но не умнее. А уверенность без способности перепроверять себя — худшее сочетание из возможных.
Что предлагают вместо этого
Метод назвали Negative Self-Distillation — обучение от обратного. Идея такая:
- Модели дают роль плохого решателя: например, «рассуждай небрежно, не перепроверяя себя».
- Она порождает рассуждение в этой роли — специально с типичными для неё ошибками.
- Дальше её учат отдаляться от такого рассуждения, а не приближаться к образцу.
Важная деталь: никакого внешнего учителя и готовых ответов здесь не нужно. Модель сама изготавливает себе плохой пример, и сама же от него отстраивается. Отрицательный пример при этом специфичен для конкретной задачи — не «ошибки вообще», а те, которые модель делает именно здесь.
Почему это интереснее, чем кажется
Наказывать за неправильное умели и раньше — беда в том, что при грубом подходе модель заодно разучивается говорить связно: отдаляясь от плохого решения, она уходит в сторону от языка вообще. Ценность работы в том, что авторы нашли способ отталкиваться от ошибки, не разрушая всё остальное.
Есть и более общий вывод, за которым стоит следить. Последние годы модели улучшали, показывая им больше хорошего: чище данные, качественнее примеры, строже отбор. Здесь предлагается обратное — показать модели, как выглядит её собственная небрежность, чтобы она научилась в неё не сваливаться. Если подход приживётся, «учиться на ошибках» перестанет быть только человеческой метафорой.
Что с этого пользователю
Напрямую ничего: это исследовательская работа, кнопки с таким режимом нигде нет. Но одно практическое следствие есть уже сейчас, и оно про доверие.
Уверенный тон ответа ничего не говорит о его правильности. Модель училась выглядеть убедительно, а не быть правой — и чем аккуратнее сформулирован ответ, тем сильнее соблазн его не проверять. Особенно это касается чисел, дат, цитат и ссылок на источники.
Простое правило: если ответ важен, попросите модель перепроверить себя и показать ход рассуждения. Возражение вслух работает лучше, чем повторный вопрос — модель гораздо чаще находит собственную ошибку, когда её просят раскритиковать свой же ответ.
Что такое самодистилляция?+
Способ улучшать модель без новых данных: она пишет решение, заранее зная правильный ответ, а потом учится воспроизводить это решение самостоятельно.
Почему обычная самодистилляция вредит сложным задачам?+
Решение, написанное со знанием ответа, выглядит неестественно уверенным. Подражая ему, модель отучается сомневаться и перепроверять себя — а без этого сложные задачи не решаются.
Что делает новый метод?+
Модель сама порождает нарочно небрежное рассуждение и учится от него отдаляться, вместо того чтобы копировать идеальный образец.
Как это использовать на практике?+
Никак — метод исследовательский. Полезно другое: уверенный тон ответа не признак правильности, важные ответы стоит просить перепроверить.
Что дальше почитать
- Модель, которая предсказывает понятие, а не слово — ещё одна попытка поменять сам способ обучения.
- Почему нейросети похожи друг на друга — про обычную дистилляцию и перенос умений между моделями.
Проверьте, как модель рассуждает
Задайте сложный вопрос и попросите разобрать ход решения — разница между моделями видна сразу.
Открыть чат