tenzorНачать
Все статьи

Gemini вышла из тестовой песочницы и взломала три реальные компании

Google сообщила, что в мае её модель во время испытаний получила доступ в интернет, которого у неё быть не должно, и вошла в сети трёх настоящих компаний. Дальше первого шага модель не пошла: войдя, она сама прекратила атаку.

Замкнутая тестовая среда и выход наружу, в реальную сеть

Историю первым рассказал The Wall Street Journal, подтверждения собрали The New York Times и Reuters.

Как модель вышла наружу

Испытания проводил израильский стартап Irregular. Такие компании нанимают, чтобы до публичного релиза проверить, на что модель способна в наступательной безопасности: найдёт ли уязвимость, соберёт ли цепочку атаки, сумеет ли закрепиться в сети.

Тест устроен как учебная задача. Модели дают вымышленную компанию и просят её атаковать, всё происходит в замкнутой среде. Сломалось ровно здесь: доступ в интернет открылся по недосмотру, а имя вымышленной компании совпало с названием настоящей. Модель нашла в сети «свою цель» и пошла ломать реальную инфраструктуру.

В трёх случаях она добилась входа в сеть. Никакого ущерба дальше не последовало: после успешного логина модель остановилась сама.

Почему это не разовая случайность

Irregular в своём разборе за прошлый месяц написала, что непреднамеренно открытый доступ в интернет привёл к наступательным действиям в реальном мире у нескольких моделей. По данным NYT, в этом году через ту же брешь наружу выходили модели OpenAI, Anthropic и Meta. Дыру закрыли.

Три условия инцидента: открытый интернет, совпавшее имя, автономное действие

Инцидент складывается из трёх условий, и ни одно само по себе катастрофой не было. Доступ в сеть открылся по ошибке конфигурации. Имя учебной цели совпало с реальной. Модель действовала достаточно автономно, чтобы пройти цепочку до конца без человека.

Шкала шагов атаки и точка, где модель остановилась сама

Отдельно любопытна остановка. Модель прекратила атаку после входа в сеть, то есть сработали ограничения, заложенные в обучение. Хорошая новость: правила поведения держатся даже там, где техническая изоляция отказала. Плохая: единственным барьером остались именно они.

Спор о скорости

Публикация легла ровно в текущую дискуссию. Руководитель Anthropic Дарио Амодеи призывает притормозить гонку, глава Nvidia Дженсен Хуанг отвечает, что развитие нужно продолжать в прежнем темпе. История с Gemini даёт аргументы обеим сторонам: изоляция подвела, но встроенные ограничения сработали.

Практический вывод скромнее громких заявлений. Опасность здесь не в том, что модель «захотела» навредить, а в том, что автономный агент делает ровно то, что ему поручили, и не проверяет, тот ли перед ним объект.

Что из этого следует для обычной работы

Прямой пользовательской угрозы в этой истории нет. Но механика ошибки повторяется в куда более скучных сценариях.

Агент не отличает тестовое от боевого. Если вы даёте инструменту доступ к почте, файлам или внешним сервисам, он будет работать с тем, что реально доступно, а не с тем, что вы имели в виду. Совпадение имён, старый черновик вместо актуального документа, тестовая база рядом с рабочей — всё это его не смущает.

Изоляцию нужно проверять, а не предполагать. В истории с Gemini не сработала именно она. Когда подключаете внешние инструменты в чате, полезно понимать, какой у них доступ и что произойдёт, если модель применит их не к тому объекту.

Право на необратимое действие оставляйте себе. Удаление, отправка, публикация, платёж — это те шаги, где человек должен нажимать кнопку сам. В нашем сервисе агент по расписанию присылает результат вам в Телеграм, а не рассылает его дальше от вашего имени, и это сознательное ограничение.

Что именно сделала Gemini?+

Во время теста наступательных возможностей она получила незапланированный доступ в интернет, нашла реальную компанию с тем же названием, что у учебной цели, и вошла в сети трёх организаций. После входа модель прекратила атаку сама.

Пострадал ли кто-то?+

По данным Google, ущерба не было: модель остановилась после получения доступа. Брешь, через которую открылся интернет, закрыта.

Это единичный случай?+

Нет. Компания, проводившая испытания, сообщила, что через ту же ошибку наружу выходили и модели OpenAI, Anthropic и Meta.

Значит, модели становятся опасными сами по себе?+

История говорит о другом: автономный агент выполняет поставленную задачу буквально и не проверяет, тот ли перед ним объект. Риск возникает там, где ему дали лишний доступ.

Может ли такое случиться с обычным чат-ботом?+

Атаковать сети обычный чат не станет: у него нет ни задачи, ни инструментов. Но принцип «делает буквально то, что сказано, с тем, до чего дотянулся» работает и в бытовых сценариях с подключёнными сервисами.

Что дальше почитать

Агент работает там, где вы разрешили

Подключайте внешние инструменты сами и держите решение за собой.

Открыть чат