tenzorНачать
Все статьи

Чат-бот ошибся в разведсводке, и военные подняли самолёты

Весной этого года по американским военным разошлась разведсводка: китайское судно на Ближнем Востоке везёт компоненты ядерной программы. Начали готовить перехват. За несколько часов до операции выяснилось, что отчёт собран с помощью чат-бота, а груз опознан неверно.

Судно в море и отчёт с выводом, который оказался ложным

Историю опубликовал CNN со ссылкой на четыре источника, знакомых с эпизодом. Отчёт один из них назвал полностью ложным, другой сформулировал жёстче: он «едва не начал войну».

Что произошло

Аналитик командования спецопераций разбирал данные по грузовому манифесту судна. Часть сведений пришла из открытых источников, часть из закрытых перехватов. Он обратился к чат-боту, тот свёл одно с другим и выдал вывод о характере груза.

Дальше произошло самое интересное. Аналитик попросил нейросеть оформить результат в стандартный формат разведсводки, и документ ушёл по инстанциям. Такому формату военные доверяют по умолчанию: он выглядит как работа человека, прошедшего проверку.

Самолёты были в воздухе, группа готовилась подниматься на борт. Проверить первоисточник додумались в последний момент. Любая операция против китайского судна могла обернуться вооружённым конфликтом между двумя странами.

Почему ошибку не заметили раньше

Галлюцинация нейросети не выглядит как сбой. Программа не падает, не пишет «данных не хватает» и не оставляет пустое место. Она выдаёт связный, уверенный и правдоподобный текст, где выдуманный факт стоит рядом с настоящими и оформлен ровно так же.

Схема: открытые источники и закрытые данные сводятся в один уверенный вывод

К этому добавились три обстоятельства, которые описывают собеседники CNN.

Ответственность размазана. Разные подразделения используют разные инструменты по разным правилам. Единого стандарта проверки того, что выдала нейросеть, попросту нет, а надёжность систем отличается в разы.

Скорость важнее проверки. Нейросети внедряют ради быстроты решений, и это создаёт давление на аналитиков: сводку ждут сегодня, а не через неделю. Чем выше темп, тем меньше шансов, что кто-то пойдёт сверять первичный документ.

Молодые доверяют больше. Несколько источников отметили: аналитики, выросшие на этих инструментах, склонны принимать их выводы некритично. Один бывший высокопоставленный чиновник сказал про ведомственные разработки жёстко: внутренние инструменты в основном те же коммерческие, только с помадой.

По словам одного из собеседников, случай не единичный. Похожие ошибки в разведсообществе начались с тех пор, как эти инструменты пошли в широкое употребление.

Спор о рисках сместился

Последние недели в Вашингтоне обсуждают предупреждения инженеров и руководителей ИИ-компаний о далёких экзистенциальных угрозах. История с судном показывает риск другого рода, гораздо ближе: человек принимает разрушительное решение, опираясь на убедительно оформленную неправду.

Отдельная больная точка — выбор целей. Источник CNN формулирует прямо: применение нейросетей в целеуказании растёт, а внятных правил, как присутствие человека в контуре предотвратит гибель мирных жителей или огонь по своим, до сих пор нет.

Что из этого следует для обычной работы

Между разведсводкой и рабочим отчётом дистанция огромная, а механика ошибки одна и та же. Четыре привычки, которые её ловят.

Четыре привычки: спросить источник, разделить поиск и вывод, сверить с оригиналом, решать самому

Просите источник, а не пересказ. Формулировка «дай ссылку на документ, откуда взято» меняет поведение модели: она либо приносит источник, либо честно признаёт, что его нет. Наши модели с веб-поиском показывают ссылки чипами под ответом, и по ним стоит кликать, а не верить на слово.

Разделяйте поиск и вывод. Сначала соберите факты, проверьте их, и только потом просите сделать заключение. В истории с судном нейросеть сделала оба шага разом, и проверить промежуточный результат стало негде.

Не отдавайте оформление итога. Красивый формат придаёт тексту вес, которого у содержания может не быть. Если документ пойдёт дальше вас, соберите его сами или хотя бы перечитайте каждую фактическую строчку.

Чем выше цена ошибки, тем ниже доверие. Для черновика письма проверка избыточна, для цифр в отчёте руководству обязательна. Полезно заранее решить, какие задачи вы вообще не доверяете нейросети без сверки с первоисточником.

Что именно случилось с китайским судном?+

Аналитик собрал разведсводку с помощью чат-бота, и тот неверно определил перевозимый груз. Отчёт разошёлся по военным, началась подготовка перехвата, самолёты были в воздухе. Ошибку нашли перед самой операцией.

Известно, какой чат-бот использовали?+

Нет. CNN не смог установить, был это коммерческий сервис или ведомственная разработка. По словам бывшего чиновника, внутренние инструменты во многом повторяют коммерческие.

Почему нейросети вообще выдумывают факты?+

Языковая модель предсказывает правдоподобное продолжение текста, а не проверяет истинность. Когда данных не хватает, она достраивает пробел тем, что выглядит уместно, и подаёт это с той же уверенностью, что и проверенный факт.

Как отличить выдуманный факт от настоящего?+

По внешнему виду ответа — никак, поэтому просите ссылки и сверяйте с первоисточником. Признаки риска: точные числа без источника, цитаты, названия документов и судебные дела с реквизитами.

Значит, нейросети нельзя доверять серьёзную работу?+

Можно, если отделить сбор данных от выводов и оставить решение за человеком. Проблема в этой истории не в самом инструменте, а в том, что его результат прошёл по инстанциям без единой проверки.

Что дальше почитать

Проверяйте ответы по ссылкам

Веб-поиск в чате показывает источники под ответом — можно открыть и убедиться самому.

Открыть чат