Математики требуют от OpenAI ответа: на чьих работах учились модели
В сентябре OpenAI объявила о десяти математических достижениях. Через пару дней вокруг них разгорелся спор, который за сутки собрал больше 700 очков на Hacker News: несколько математиков публично усомнились, что модель пришла к результатам сама.
Сюжет стоит разобрать, потому что он не про математику. Он про то, куда деваются данные, которые мы отправляем в чат.
Суть претензии
Математик Андреас Том заявил, что его собственные разговоры с ChatGPT могли поучаствовать в решении, которое OpenAI записала себе в достижения, — речь о задаче про несофические группы, то есть бесконечные структуры, которые нельзя приблизить конечными. Его формулировка прямая: «Я считаю это как минимум нечестностью».
Профессор математики из Нью-Йоркского университета Тристан Букмастер задал похожий вопрос про свою работу с инструментом Codex.
Речь не о статьях в открытом доступе. Речь о неопубликованных рассуждениях, которые учёные обсуждали с ассистентом, — и о том, что эти рассуждения могли вернуться миру уже как результат модели.
Что ответила OpenAI
Компания отрицает использование «конкретных пользовательских данных», но добавляет важную оговорку: исключить, что обезличенные данные из использования их продуктов помогли улучшить модели, нельзя.
Том считает такую формулировку уклончивой, и его аргумент трудно оспорить: обезличивание убирает имя, но не убирает содержание мысли. Для математика ценность как раз в содержании, а не в подписи под ним.
Почему это касается не только математиков
Подставьте на место доказательства что-нибудь своё.
Предприниматель обсуждает с ассистентом неанонсированный продукт. Юрист разбирает стратегию по делу. Разработчик вставляет кусок закрытого кода. Маркетолог загружает клиентскую базу, чтобы посчитать сегменты. Во всех случаях верна та же логика: имя можно убрать, а идею — нет.
Это не значит, что нейросетями нельзя пользоваться в работе. Это значит, что стоит понимать правила и управлять ими.
Что можно сделать уже сейчас
- Проверьте настройку обучения. У крупных сервисов есть переключатель «использовать мои данные для улучшения моделей». Найдите его и посмотрите, в каком он положении — прямо сейчас.
- Разделяйте чувствительное и обычное. Черновик письма и стратегия сделки не обязаны жить в одном сервисе.
- Обезличивайте сами, до отправки. Заменить имена, суммы и номера договоров на заглушки занимает минуту, а вопрос «а что если» снимает целиком.
- Читайте, что написано про данные. В tenzor переписка нужна только для того, чтобы показать вам историю чатов: на обучении моделей она не используется.
Чем всё кончится
Скорее всего — ничем громким. Доказать, что конкретная мысль попала в обучающую выборку, почти невозможно: моделям не выдают справку о происхождении знаний.
Но осадок останется, и это уже влияет на поведение. Учёные начинают обсуждать незавершённые работы осторожнее, компании заводят внутренние правила, а формулировка «мы не используем ваши данные» перестаёт приниматься на слово.
В чём обвиняют OpenAI?+
Математик Андреас Том и его коллеги считают, что их неопубликованные рассуждения, обсуждавшиеся с ChatGPT, могли попасть в обучение моделей и вернуться как достижение самой компании.
Что ответила OpenAI?+
Компания отрицает использование конкретных пользовательских данных, но признаёт, что не может исключить: обезличенные данные из использования её продуктов могли помочь улучшить модели.
Мои переписки могут попасть в обучение?+
Зависит от сервиса и настроек. У крупных сервисов есть переключатель использования данных для улучшения моделей — стоит проверить его положение. В tenzor переписка используется только для показа вашей истории чатов.
Как работать с чувствительными данными безопаснее?+
Заменять имена, суммы и номера договоров на заглушки до отправки, разделять рабочие и чувствительные задачи между сервисами и проверять настройки приватности.
Что дальше почитать
- Почему нейросети похожи друг на друга — откуда модели берут знания.
- Нейросети, которые работают прямо в телефоне — когда данные вообще не покидают устройство.
Работайте с документами спокойно
Переписка нужна только для вашей истории чатов — на обучении моделей она не используется.
Открыть чат