Почему нейросети похожи друг на друга: что показал эксперимент с Qwen
Наверняка замечали: спрашиваешь одно и то же у разных моделей, а ответы выходят подозрительно похожими. Те же примеры, та же структура, местами те же обороты. Разработчики разные, компании на разных континентах — а результат как из одного места.
Небольшой эксперимент, который на днях обсуждали на Hacker News, показывает, откуда это берётся.
Что сделал исследователь
Взял 45 задач: 15 из точных наук, 15 гуманитарных и 15 искусственных головоломок. Каждую скормил китайской модели Qwen 3.8 двумя способами.
Первый — как есть. Второй — подставив в начало её рассуждений первый процент рассуждений чужой модели, GPT-5.5 Pro. Дальше Qwen думала сама, никто её не вёл.
Разница получилась крупной: качество ответов выросло на 18 процентных пунктов. На точных науках скачок ещё заметнее — почти 27 пунктов, на головоломках около 15.
Отдельная деталь: похожий опыт с рассуждениями Claude Opus такого эффекта не дал. То есть Qwen отзывается не на «любую подсказку умной модели», а именно на манеру GPT.
Что это значит
Автор делает осторожный вывод: Qwen, судя по всему, училась на данных модели семейства GPT.
Логика такая. Если продолжать чужой ход мысли модели легко и это резко улучшает результат, значит, такой ход мысли ей знаком. Как человеку, который узнал почерк соавтора: подхватить знакомую манеру проще, чем чужую.
Строгим доказательством это не является — свечку никто не держал. Но сигнал заметный.
Что такое дистилляция
Явление называется дистилляцией. Работает так: берут сильную модель, задают ей десятки тысяч вопросов, собирают ответы вместе с рассуждениями — и учат на этом свою модель поменьше.
Экономика тут неотразимая. Обучение флагмана с нуля стоит сотни миллионов долларов и требует годы работы команды. Собрать выдачу чужого флагмана и обучить на ней компактную модель — на порядки дешевле. Результат получается слабее оригинала, но заметно ближе к нему, чем вышло бы своими силами.
Отсюда и дешёвые модели, которые «почти как флагман». Часть из них — в буквальном смысле его отражение.
Три следствия для тех, кто этим пользуется
Похожие ответы — это норма, а не совпадение. Если две модели ответили одинаково, вы не получили подтверждения. Возможно, одна просто повторила другую. Перепроверять факты у второй модели того же происхождения бессмысленно.
Разнообразие моделей имеет практический смысл. Когда важна независимая проверка, берите модели разных семейств — Claude, Gemini, GPT, — а не две модели одной родословной. Сравнить доступные варианты можно в таблице моделей для чата.
Дешёвая модель нередко наследует и ошибки. Вместе с манерой рассуждать перенимаются типовые заблуждения оригинала. Экономия реальная, но проверять ответы всё равно нужно.
Что дальше
Юридическая сторона вопроса пока не решена. Условия использования у всех крупных лабораторий запрещают обучать конкурирующие модели на их выдаче, но доказать факт обучения сложно: прямых улик нет, есть косвенные вроде описанного эксперимента.
Пока идут споры, практический вывод остаётся простым. В tenzor собраны модели разных семейств именно поэтому: для настоящей перепроверки нужны разные родословные, а не разные названия.
Что такое дистилляция модели?+
Обучение новой модели на ответах другой, более сильной. Ей задают десятки тысяч вопросов, собирают ответы с рассуждениями и учат на этом компактную модель.
Что показал эксперимент с Qwen 3.8?+
Подстановка первого процента рассуждений GPT-5.5 Pro подняла качество ответов Qwen на 18 процентных пунктов, а на точных науках — почти на 27. С рассуждениями Claude Opus такого эффекта не было.
Это доказывает, что Qwen училась на GPT?+
Строго — нет. Это косвенный признак: модель уверенно подхватывает знакомую манеру рассуждений. Прямых доказательств у исследователя нет.
Как перепроверить ответ нейросети?+
Спросить модель другого семейства и другого разработчика. Две модели общего происхождения могут повторить одну и ту же ошибку.
Что дальше почитать
- Модели для чата — модели разных семейств и цены за 1000 токенов.
- Токены и кредиты: как устроена оплата — почему дешёвые модели дешёвые.
Сравните ответы разных моделей
Один вопрос, две модели разных семейств — самый простой способ поймать ошибку.
Открыть чат