tenzorНачать
Все статьи

Модель учат не копировать правильное, а отталкиваться от неправильного

Нейросеть можно улучшать без новых данных: пусть она сама себе будет учителем. Ей дают задачу вместе с готовым ответом, она пишет подробное решение, зная ответ заранее, — а потом учится повторять это решение уже вслепую. Приём называется самодистилляцией и работает на многих задачах.

На сложных рассуждениях он внезапно портит модель. Свежая работа объясняет почему и предлагает перевернуть подход.

Модель учится, отдаляясь от нарочно ошибочного рассуждения

В чём подвох уверенного образца

Представьте студента, которому дали задачу вместе с ответом из конца учебника. Он пишет безупречно гладкое решение: ни одного «попробуем так... нет, не выходит», ни одной проверки, прямая дорога к цели. Потом этот текст дают другому студенту как образец.

Второй студент выучивает не способ думать, а манеру держаться уверенно. В задаче, где ответ заранее неизвестен, такая манера вредна: настоящее рассуждение состоит из тупиков, сомнений и возвратов назад.

С моделью происходит то же самое. Подражая решению, написанному со знанием ответа, она подавляет в себе выражение неуверенности и отучается от поисковых ходов. На простых задачах это незаметно, а на сложных — прямо роняет качество.

Коротко

Модель, которую учат на идеально уверенных решениях, становится увереннее, но не умнее. А уверенность без способности перепроверять себя — худшее сочетание из возможных.

Что предлагают вместо этого

Метод назвали Negative Self-Distillation — обучение от обратного. Идея такая:

  1. Модели дают роль плохого решателя: например, «рассуждай небрежно, не перепроверяя себя».
  2. Она порождает рассуждение в этой роли — специально с типичными для неё ошибками.
  3. Дальше её учат отдаляться от такого рассуждения, а не приближаться к образцу.

Важная деталь: никакого внешнего учителя и готовых ответов здесь не нужно. Модель сама изготавливает себе плохой пример, и сама же от него отстраивается. Отрицательный пример при этом специфичен для конкретной задачи — не «ошибки вообще», а те, которые модель делает именно здесь.

Как устроено обучение от обратного: три шага метода

Почему это интереснее, чем кажется

Наказывать за неправильное умели и раньше — беда в том, что при грубом подходе модель заодно разучивается говорить связно: отдаляясь от плохого решения, она уходит в сторону от языка вообще. Ценность работы в том, что авторы нашли способ отталкиваться от ошибки, не разрушая всё остальное.

Есть и более общий вывод, за которым стоит следить. Последние годы модели улучшали, показывая им больше хорошего: чище данные, качественнее примеры, строже отбор. Здесь предлагается обратное — показать модели, как выглядит её собственная небрежность, чтобы она научилась в неё не сваливаться. Если подход приживётся, «учиться на ошибках» перестанет быть только человеческой метафорой.

Уверенный тон ответа не означает его правильности

Что с этого пользователю

Напрямую ничего: это исследовательская работа, кнопки с таким режимом нигде нет. Но одно практическое следствие есть уже сейчас, и оно про доверие.

Уверенный тон ответа ничего не говорит о его правильности. Модель училась выглядеть убедительно, а не быть правой — и чем аккуратнее сформулирован ответ, тем сильнее соблазн его не проверять. Особенно это касается чисел, дат, цитат и ссылок на источники.

Простое правило: если ответ важен, попросите модель перепроверить себя и показать ход рассуждения. Возражение вслух работает лучше, чем повторный вопрос — модель гораздо чаще находит собственную ошибку, когда её просят раскритиковать свой же ответ.

Что такое самодистилляция?+

Способ улучшать модель без новых данных: она пишет решение, заранее зная правильный ответ, а потом учится воспроизводить это решение самостоятельно.

Почему обычная самодистилляция вредит сложным задачам?+

Решение, написанное со знанием ответа, выглядит неестественно уверенным. Подражая ему, модель отучается сомневаться и перепроверять себя — а без этого сложные задачи не решаются.

Что делает новый метод?+

Модель сама порождает нарочно небрежное рассуждение и учится от него отдаляться, вместо того чтобы копировать идеальный образец.

Как это использовать на практике?+

Никак — метод исследовательский. Полезно другое: уверенный тон ответа не признак правильности, важные ответы стоит просить перепроверить.

Что дальше почитать

Проверьте, как модель рассуждает

Задайте сложный вопрос и попросите разобрать ход решения — разница между моделями видна сразу.

Открыть чат