Отчёт Anthropic: как ловят тех, кто использует нейросети во вред
Anthropic опубликовала отчёт о том, как её команда безопасности выявляла и пресекала злоупотребления Claude с декабря 2025 по август 2026 года. Такие документы выходят редко: обычно лаборатории ограничиваются формулировкой «мы заботимся о безопасности».
Здесь же — конкретные случаи с цифрами. Заодно это лучший ответ на частый вопрос пользователей: почему нейросеть иногда отказывается отвечать на, казалось бы, безобидную просьбу.
Что нашли
Отчёт разбит на семь категорий вреда. Самое заметное:
Кибероперации. Группа, связанная с российскими государственными структурами, вела разведку против украинских и европейских целей — в отчёте упомянуто более 20 организаций. Отдельно описаны финансово мотивированные преступники, собиравшие учётные данные: в их конвейере проанализировано 1,8 миллиона Android-приложений. И операторы, автоматизировавшие поиск уязвимостей и написание эксплойтов.
Информационные операции. Девять кампаний генерировали содержимое для фейковых новостных сайтов и соцсетей на аудиторию шести континентов: 8913 статей примерно на 70 поддельных сайтах.
Остальное: слежка, мошенничество, попытки работать с биологической тематикой, обычные вооружения и нелегальная перегонка моделей — когда чужую модель обучают на выдаче Claude.
Отдельная цифра про скорость: один взлом прошёл путь от единственного украденного токена до полного административного доступа примерно за три часа.
Что с этим сделали
Аккаунты заблокировали, детекторы усилили, данные передали правоохранителям и коллегам по отрасли, ограничения пересобрали по итогам расследований.
Про биологическую тематику отдельно писала New York Times: компания заявила, что пресекла попытки получить помощь в работе над биологическим оружием. Это та область, где модели настроены отказывать жёстче всего — и понятно почему.
Почему нейросеть отказывается отвечать вам
Теперь понятная часть. Фильтры настраиваются не на злодеев из кино, а на формулировки. Злодей и любознательный человек спрашивают похоже, и модель не умеет читать намерения.
Отсюда ложные срабатывания: вопрос по химии в школьной задаче, сюжет детектива, вопрос про уязвимость, которую вы закрываете в собственном коде. Модель видит форму запроса, а не контекст вашей жизни.
Что с этим делать на практике:
- Объясните контекст сразу. «Пишу детектив, нужна правдоподобная сцена» работает заметно лучше, чем та же просьба без пояснения.
- Спрашивайте о задаче, а не о способе. «Как защитить форму от подбора пароля» проходит там, где «как подобрать пароль к форме» вызовет отказ.
- Попробуйте другую модель. Строгость фильтров у разработчиков разная — в tenzor модель в чате переключается в один клик, и отказ у одной часто не означает отказа у другой.
Что из этого следует
Отказы — не капризы и не цензура ради цензуры: это побочный эффект работы, которую видно в отчёте. Претензия к разработчикам справедлива в другом — в точности настройки: слишком широкий фильтр мешает обычным людям и почти не мешает тем, кто действительно ищет обход.
Что нашли в отчёте Anthropic?+
Кибероперации против европейских и украинских организаций, девять кампаний по производству фейковых новостей — 8913 статей на 70 сайтах, попытки работы с биологической тематикой, мошенничество, слежку и нелегальную перегонку моделей.
Почему нейросеть отказывается отвечать на безобидный вопрос?+
Фильтры настроены на формулировки, а не на намерения. Запрос по школьной химии или сюжету детектива может выглядеть похоже на опасный, и модель перестраховывается.
Как снизить число отказов?+
Объясняйте контекст задачи, спрашивайте о цели, а не о способе навредить, и пробуйте другую модель — строгость фильтров у разработчиков разная.
Что такое нелегальная перегонка моделей?+
Обучение своей модели на ответах чужой. Условия использования крупных лабораторий это запрещают, и Anthropic относит такие случаи к злоупотреблениям.
Что дальше почитать
- Почему нейросети похожи друг на друга — что такое перегонка моделей на примере эксперимента с Qwen.
- Модели для чата — у какой модели какие правила.
Не подошла одна модель — возьмите другую
Строгость фильтров у разработчиков разная, в чате модель переключается в один клик.
Открыть чат