tenzorНачать
Все статьи

Математики требуют от OpenAI ответа: на чьих работах учились модели

В сентябре OpenAI объявила о десяти математических достижениях. Через пару дней вокруг них разгорелся спор, который за сутки собрал больше 700 очков на Hacker News: несколько математиков публично усомнились, что модель пришла к результатам сама.

Сюжет стоит разобрать, потому что он не про математику. Он про то, куда деваются данные, которые мы отправляем в чат.

Математики спрашивают, на чьих работах учились модели OpenAI

Суть претензии

Математик Андреас Том заявил, что его собственные разговоры с ChatGPT могли поучаствовать в решении, которое OpenAI записала себе в достижения, — речь о задаче про несофические группы, то есть бесконечные структуры, которые нельзя приблизить конечными. Его формулировка прямая: «Я считаю это как минимум нечестностью».

Профессор математики из Нью-Йоркского университета Тристан Букмастер задал похожий вопрос про свою работу с инструментом Codex.

Речь не о статьях в открытом доступе. Речь о неопубликованных рассуждениях, которые учёные обсуждали с ассистентом, — и о том, что эти рассуждения могли вернуться миру уже как результат модели.

Что ответила OpenAI

Компания отрицает использование «конкретных пользовательских данных», но добавляет важную оговорку: исключить, что обезличенные данные из использования их продуктов помогли улучшить модели, нельзя.

Том считает такую формулировку уклончивой, и его аргумент трудно оспорить: обезличивание убирает имя, но не убирает содержание мысли. Для математика ценность как раз в содержании, а не в подписи под ним.

Обезличивание убирает имя, но не убирает содержание идеи

Почему это касается не только математиков

Подставьте на место доказательства что-нибудь своё.

Предприниматель обсуждает с ассистентом неанонсированный продукт. Юрист разбирает стратегию по делу. Разработчик вставляет кусок закрытого кода. Маркетолог загружает клиентскую базу, чтобы посчитать сегменты. Во всех случаях верна та же логика: имя можно убрать, а идею — нет.

Это не значит, что нейросетями нельзя пользоваться в работе. Это значит, что стоит понимать правила и управлять ими.

Что можно сделать уже сейчас

  1. Проверьте настройку обучения. У крупных сервисов есть переключатель «использовать мои данные для улучшения моделей». Найдите его и посмотрите, в каком он положении — прямо сейчас.
  2. Разделяйте чувствительное и обычное. Черновик письма и стратегия сделки не обязаны жить в одном сервисе.
  3. Обезличивайте сами, до отправки. Заменить имена, суммы и номера договоров на заглушки занимает минуту, а вопрос «а что если» снимает целиком.
  4. Читайте, что написано про данные. В tenzor переписка нужна только для того, чтобы показать вам историю чатов: на обучении моделей она не используется.
Что можно сделать: проверить настройку обучения, разделять данные, обезличивать до отправки

Чем всё кончится

Скорее всего — ничем громким. Доказать, что конкретная мысль попала в обучающую выборку, почти невозможно: моделям не выдают справку о происхождении знаний.

Но осадок останется, и это уже влияет на поведение. Учёные начинают обсуждать незавершённые работы осторожнее, компании заводят внутренние правила, а формулировка «мы не используем ваши данные» перестаёт приниматься на слово.

В чём обвиняют OpenAI?+

Математик Андреас Том и его коллеги считают, что их неопубликованные рассуждения, обсуждавшиеся с ChatGPT, могли попасть в обучение моделей и вернуться как достижение самой компании.

Что ответила OpenAI?+

Компания отрицает использование конкретных пользовательских данных, но признаёт, что не может исключить: обезличенные данные из использования её продуктов могли помочь улучшить модели.

Мои переписки могут попасть в обучение?+

Зависит от сервиса и настроек. У крупных сервисов есть переключатель использования данных для улучшения моделей — стоит проверить его положение. В tenzor переписка используется только для показа вашей истории чатов.

Как работать с чувствительными данными безопаснее?+

Заменять имена, суммы и номера договоров на заглушки до отправки, разделять рабочие и чувствительные задачи между сервисами и проверять настройки приватности.

Что дальше почитать

Работайте с документами спокойно

Переписка нужна только для вашей истории чатов — на обучении моделей она не используется.

Открыть чат