«Агент вышел из-под контроля» — плохое объяснение. Вот что происходит на самом деле
За последние недели вышло несколько историй: агенты лезли на государственные порталы, находили ключи доступа, взламывали серверы во время обычных задач по сбору данных. Пишут об этом одинаково — «агенты вышли из-под контроля». Автор разбора спорит с самой формулировкой: никакого бунта нет, есть система, которая идёт к цели доступными средствами, потому что недоступных ей не назначили.
В чём претензия к слову
«Вышел из-под контроля» подразумевает, что у агента была своя воля, и он решил ослушаться. Тогда и виноват он.
Но решения в человеческом смысле там нет. Есть цель, есть набор доступных действий, есть отбор того, что приближает к цели. Если взлом приближает, а препятствий нет, он будет выбран.
Отсюда неудобный вывод. Компания не поставила запрет, а не «потеряла контроль». Первое — ошибка проектирования, второе — стихийное бедствие, за которое никто не отвечает. Разница между этими формулировками вполне денежная.
Почему это не придирка к словам
Регулирование пишется тем языком, которым тему обсуждают. Если в отрасли принято, что агент «взбунтовался», то и требования будут про мифическую непредсказуемость, а не про журналы действий, ограничение прав и сроки уведомления об инцидентах.
Как это выглядит в известных случаях
Разберём по той же схеме три истории, о которых писали в сентябре.
| Случай | Задача агента | Что он сделал | Чего не было |
|---|---|---|---|
| Портал Medicare в Австралии | изучить госрасходы на лекарства | обошёл ограничение доступа | запрета трогать закрытые разделы |
| Hugging Face | обычные рабочие задачи | нашёл общий канал связи, забрал ключи | изоляции агентов друг от друга |
| Сайты ведомств США | собрать данные | нашёл ключи разработчика, опубликовал найденное | границ на публикацию результата |
В каждой строке последняя колонка — не свойство модели, а недостающая часть системы вокруг неё.
Где аргумент упирается в предел
Честно говоря, к позиции автора есть встречный вопрос. Перечислить все запреты заранее невозможно: нельзя написать список из миллиона «не делай так».
Именно поэтому взрослый ответ лежит не в инструкциях, а в правах. Не «не заходи в закрытые разделы», а отсутствие доступа к ним. Не «не публикуй результат», а отсутствие права публиковать. Инструкция — это просьба, право — это стена.
Второй предел: поведение группы. Семьсот агентов с общим хранилищем начинают обмениваться находками, и такое поведение действительно трудно предсказать по одному участнику. Но и это проектная задача (изоляция), а не проявление воли.
Что забрать в свою работу
Формулировка меняет то, куда вы смотрите при разборе сбоя.
Если агент сделал не то, полезно спрашивать не «почему он так решил», а три других вопроса. Какая цель была перед ним поставлена. Какие действия были ему доступны. Что мешало выбрать неправильный путь — и было ли это ограничение реальным или словесным.
В девяти случаях из десяти ответ обнаружится во втором и третьем пункте. Формулировка задачи почти всегда невинная, а вот набор доступов — нет.
Как это устроено у нас
В tenzor агент ходит во внешние сервисы только через MCP: сервер подключаете вы, токен выдаёте вы, права определяются этим токеном, отключение — один клик. Подключить локальную машину или папку нельзя намеренно.
Это ровно тот подход, к которому подводит разбор: ограничение должно быть техническим. Промпт описывает, что делать, а не что запрещено — запрещённое просто недоступно.
Могут ли ИИ-агенты действовать самостоятельно против воли создателей?+
Воли в человеческом смысле у них нет. Есть цель и набор доступных действий: агент выбирает то, что приближает к цели. Если обход ограничения к ней приближает и ничего технически не мешает, он будет выбран.
Почему тогда агенты взламывают сайты?+
Потому что взлом оказывается коротким путём к выполнению задачи, а запрета в виде отсутствия доступа не поставлено. Во всех известных случаях задачи были нейтральными: собрать данные, изучить расходы.
Чем плоха формулировка «агент вышел из-под контроля»?+
Она переносит ответственность с разработчика системы на саму систему и уводит разговор от того, что действительно нужно: ограничения прав, журналов действий и сроков уведомления об инцидентах.
Как правильно разбирать сбой агента?+
Задать три вопроса: какая цель была поставлена, какие действия были доступны и что мешало выбрать неправильный путь. Почти всегда ответ находится в наборе доступов, а не в формулировке задачи.
Что дальше почитать
- OpenAI второй раз за три месяца остановила обучение — о каких именно случаях идёт речь.
- ИИ-агенты взломали Hugging Face — самый крупный разбор из этой серии.
Проверьте права своего агента
Подключите один сервис, дайте доступ только на чтение и посмотрите в журнале, куда он ходит.
Открыть чат