tenzorНачать
Все статьи

Отчёт Anthropic: как ловят тех, кто использует нейросети во вред

Anthropic опубликовала отчёт о том, как её команда безопасности выявляла и пресекала злоупотребления Claude с декабря 2025 по август 2026 года. Такие документы выходят редко: обычно лаборатории ограничиваются формулировкой «мы заботимся о безопасности».

Здесь же — конкретные случаи с цифрами. Заодно это лучший ответ на частый вопрос пользователей: почему нейросеть иногда отказывается отвечать на, казалось бы, безобидную просьбу.

Отчёт Anthropic о пресечённых злоупотреблениях: семь категорий вреда

Что нашли

Отчёт разбит на семь категорий вреда. Самое заметное:

Кибероперации. Группа, связанная с российскими государственными структурами, вела разведку против украинских и европейских целей — в отчёте упомянуто более 20 организаций. Отдельно описаны финансово мотивированные преступники, собиравшие учётные данные: в их конвейере проанализировано 1,8 миллиона Android-приложений. И операторы, автоматизировавшие поиск уязвимостей и написание эксплойтов.

Информационные операции. Девять кампаний генерировали содержимое для фейковых новостных сайтов и соцсетей на аудиторию шести континентов: 8913 статей примерно на 70 поддельных сайтах.

Остальное: слежка, мошенничество, попытки работать с биологической тематикой, обычные вооружения и нелегальная перегонка моделей — когда чужую модель обучают на выдаче Claude.

Отдельная цифра про скорость: один взлом прошёл путь от единственного украденного токена до полного административного доступа примерно за три часа.

Цифры отчёта: 8913 статей на 70 фейковых сайтах, 1,8 млн проанализированных приложений, 20 организаций-целей

Что с этим сделали

Аккаунты заблокировали, детекторы усилили, данные передали правоохранителям и коллегам по отрасли, ограничения пересобрали по итогам расследований.

Про биологическую тематику отдельно писала New York Times: компания заявила, что пресекла попытки получить помощь в работе над биологическим оружием. Это та область, где модели настроены отказывать жёстче всего — и понятно почему.

Почему нейросеть отказывается отвечать вам

Теперь понятная часть. Фильтры настраиваются не на злодеев из кино, а на формулировки. Злодей и любознательный человек спрашивают похоже, и модель не умеет читать намерения.

Отсюда ложные срабатывания: вопрос по химии в школьной задаче, сюжет детектива, вопрос про уязвимость, которую вы закрываете в собственном коде. Модель видит форму запроса, а не контекст вашей жизни.

Что с этим делать на практике:

  1. Объясните контекст сразу. «Пишу детектив, нужна правдоподобная сцена» работает заметно лучше, чем та же просьба без пояснения.
  2. Спрашивайте о задаче, а не о способе. «Как защитить форму от подбора пароля» проходит там, где «как подобрать пароль к форме» вызовет отказ.
  3. Попробуйте другую модель. Строгость фильтров у разработчиков разная — в tenzor модель в чате переключается в один клик, и отказ у одной часто не означает отказа у другой.
Почему приходит отказ: модель видит форму запроса, а не контекст вашей задачи

Что из этого следует

Отказы — не капризы и не цензура ради цензуры: это побочный эффект работы, которую видно в отчёте. Претензия к разработчикам справедлива в другом — в точности настройки: слишком широкий фильтр мешает обычным людям и почти не мешает тем, кто действительно ищет обход.

Что нашли в отчёте Anthropic?+

Кибероперации против европейских и украинских организаций, девять кампаний по производству фейковых новостей — 8913 статей на 70 сайтах, попытки работы с биологической тематикой, мошенничество, слежку и нелегальную перегонку моделей.

Почему нейросеть отказывается отвечать на безобидный вопрос?+

Фильтры настроены на формулировки, а не на намерения. Запрос по школьной химии или сюжету детектива может выглядеть похоже на опасный, и модель перестраховывается.

Как снизить число отказов?+

Объясняйте контекст задачи, спрашивайте о цели, а не о способе навредить, и пробуйте другую модель — строгость фильтров у разработчиков разная.

Что такое нелегальная перегонка моделей?+

Обучение своей модели на ответах чужой. Условия использования крупных лабораторий это запрещают, и Anthropic относит такие случаи к злоупотреблениям.

Что дальше почитать

Не подошла одна модель — возьмите другую

Строгость фильтров у разработчиков разная, в чате модель переключается в один клик.

Открыть чат