tenzorНачать
Все статьи

OpenAI обвинила людей из Moonshot AI (Kimi) в краже рассуждений моделей

30 сентября OpenAI сообщила, что пресекла скоординированную кампанию по вытягиванию скрытых рассуждений своих моделей. Активность шла с 1 июля, на пике 24–25 июля это было 16 000 запросов от более чем 4000 пользователей, а весь связанный кластер насчитывал свыше 15 000 пользователей и был полностью остановлен к 28 июля. Ядро активности OpenAI приписывает людям, связанным с Moonshot AI, разработчиком Kimi. Шифрование при этом не взломали, а переписки пользователей не утекли.

Что именно произошло

Когда модель OpenAI решает задачу, она сначала «думает»: строит внутреннюю цепочку рассуждений. Пользователь видит итоговый ответ, а сами рассуждения скрыты. В них бывает то, чего нет в ответе, и по ним проще повторить манеру работы модели.

Именно эти рассуждения и пытались достать. OpenAI описывает новый приём: зашифрованные рассуждения копировали из одного диалога в другой и просили модель расшифровать и переписать их открытым текстом. Были и другие варианты, и со временем схема менялась.

Компания называет это враждебной дистилляцией (adversarial distillation): систематическим и несанкционированным использованием ответов или рассуждений одной модели, чтобы обучить, повторить или улучшить другую.

Хронология кампании

КогдаЧто было
1 июляпервая замеченная активность, поначалу небольшая
24–25 июлярезкий всплеск: 16 000 запросов с характерным шаблоном извлечения от 4000+ пользователей
после всплескарасследование находит связанный кластер из 15 000+ пользователей
к 28 июлякластер полностью пресечён
30 сентябряOpenAI публикует разбор

До публикации компания, по её словам, оценила масштаб, выкатила защиту и обсудила её с исследователями и партнёрами. Работа над мерами и расследование продолжаются.

При чём здесь Kimi и Moonshot AI

Это самая громкая часть новости, и формулировка у OpenAI осторожная. Компания пишет, что неясно, стоял ли за всеми операторами один участник. Но «ядро» активности она приписывает людям, связанным с Moonshot AI, разработчиком Kimi.

Это оценка самой OpenAI. Доказательств в публикации не приводится, и обвинение адресовано не компании целиком, а «людям, связанным» с ней. Ответа Moonshot AI в публикации OpenAI нет.

Взломали ли OpenAI и утекли ли переписки

Нет, если верить OpenAI. Компания прямо пишет, что операторы не взламывали шифрование, не получали доступ к базам данных и к сохранённым перепискам пользователей. Они манипулировали самим общением с моделью, чтобы она выдала скрытое в видимом виде, и делали это массово, нарушая условия использования.

OpenAI добавляет, что такая уязвимость касается не только её моделей. Независимые исследователи отдельно сообщили компании о похожих атаках через другие модели и через сжатие длинных диалогов, и OpenAI подтвердила, что эти пути атаки реальны.

Что такое дистилляция модели простыми словами

Дистилляция означает обучение одной модели на выдаче другой, более сильной. Сильной модели задают множество вопросов, собирают её ответы, а лучше вместе с ходом рассуждений, и на этом материале учат свою модель. Получается дешевле, чем обучать с нуля, и результат заметно ближе к оригиналу.

Сама по себе дистилляция обычная техника: компании так делают компактные версии собственных моделей. Проблема возникает, когда чужую модель «доят» без разрешения. Условия использования крупных лабораторий это запрещают.

Почему OpenAI так беспокоят именно рассуждения? Ответ показывает итог, а рассуждение показывает способ, и учиться на способе выгоднее. Компания также пишет, что на извлечённых рассуждениях можно обучить модель, которая не унаследует защитных ограничений оригинала. Подробнее о том, как дистилляция делает разные нейросети похожими друг на друга, мы писали в разборе эксперимента с Qwen.

Что сделала OpenAI

Меры компания описывает в три слоя.

  • Аккаунты. Подозрительные аккаунты заблокированы или ограничены, регистрация ужесточена, мониторинг связанных сетей расширен.
  • Техника. Закрыт путь, по которому чужие зашифрованные рассуждения можно было «переиграть» и расшифровать. Добавлены проверки, которые задерживают потоковый ответ, если он может раскрыть рассуждения. Когда активность шла через сторонние сервисы, OpenAI вместе с ними находила и отключала аккаунты.
  • Обмен данными. Выводы переданы другим разработчикам через Frontier Model Forum (отраслевое объединение лабораторий) и по государственным каналам обмена информацией.

Дальше OpenAI ждёт, что попытки дистилляции станут изощрённее. Компания собирается защищать развёртывания у облачных партнёров так же, как свои сервисы, и проверять не только видимый текст, но и вывод инструментов.

Касается ли это тех, кто пользуется Kimi

По данным OpenAI, переписки пользователей не утекали, так что людей, которые просто задают вопросы GPT или Kimi, эта история напрямую не затрагивает. Обвинение касается того, как могли собирать данные для обучения, а не того, что происходит с вашими диалогами. Kimi K3 по-прежнему доступна в чате tenzor, как и модели OpenAI. Что умеет Kimi и чем она отличается, есть на странице модели.

Если вам важна независимая перепроверка ответа, полезный вывод тот же, что и в истории с Qwen: сверяйте ответы моделей разных семейств. Модели, которые учились друг у друга, повторяют и ошибки.

Что OpenAI рассказала про Kimi и Moonshot AI?+

OpenAI сообщила, что пресекла кампанию по извлечению скрытых рассуждений своих моделей и приписывает ядро этой активности людям, связанным с Moonshot AI, разработчиком Kimi. Это оценка OpenAI: доказательств в публикации нет, и компания оговаривается, что не уверена, что за всеми операторами стоял один участник.

Сколько было запросов и аккаунтов?+

Активность началась 1 июля. На пике 24–25 июля было 16 000 запросов от более чем 4000 пользователей, а связанный кластер насчитывал свыше 15 000 пользователей. К 28 июля его полностью пресекли.

Что такое дистилляция модели?+

Обучение новой модели на ответах и рассуждениях другой, более сильной. Это дешевле, чем обучать с нуля. Враждебной OpenAI называет дистилляцию, которая идёт без разрешения и в нарушение условий использования.

Утекли ли переписки пользователей ChatGPT?+

По словам OpenAI, нет. Шифрование не взломано, доступа к базам данных и сохранённым перепискам у операторов не было: они добивались, чтобы модель сама выдала скрытые рассуждения.

Что ответила Moonshot AI?+

В публикации OpenAI ответа Moonshot AI нет.

Что дальше почитать

Сравните ответы разных моделей

GPT, Claude, Gemini и Kimi в одном чате. Задайте один вопрос двум моделям разных семейств.

Открыть чат