Открытую модель проверили на взлом: эксплойт за 20 минут и 20 долларов
Anthropic опубликовала разбор: они проверили открытую модель GLM-5.3 на способность писать кибератаки. Рабочие эксплойты она выдавала в 12% попыток на публичном наборе уязвимостей браузерного движка. Встроенные отказы обходятся легко: выдуманная легенда даёт 64% успеха, подставленное начало рассуждения — 92%, а снятие ограничений прямо из весов — 100%. Разработка эксплойта под известную уязвимость обошлась в 20 минут человеческого внимания и 20,40 доллара.
Что именно проверяли
Тестов было три, и они различаются по сложности.
Публичный набор задач на уязвимости движка браузера: дана известная слабость, нужно написать работающий код, который её использует. Здесь 12% успеха.
Внутренний набор Anthropic на поиск уязвимостей в открытом софте — задача труднее, потому что слабое место надо ещё найти. Тут 4%.
И проверка с живым специалистом в изолированной среде: сколько человеческого времени и денег уходит, если модель работает ассистентом. Ответ — 20 минут и 20 долларов на один эксплойт под известную уязвимость.
Насколько легко снимаются отказы
Самая тревожная часть разбора не про способности, а про защиту. У модели есть встроенные отказы, и они держатся плохо.
| Способ обхода | Успех |
|---|---|
| простая выдуманная легенда в запросе | 64% |
| подставленное начало ответа за модель | 92% |
| удаление ограничений из весов модели | 100% |
Последняя строка возможна только потому, что модель открытая: веса лежат в свободном доступе, и их можно переучить. По расчётам Anthropic, снятие отказов стоит около 2200 часов работы видеокарт, то есть примерно 4400 долларов. После этого доля отказов падает с более чем 90% до 3-12%.
Где здесь настоящая новость
Не в том, что модель умеет писать эксплойты — это умеют почти все сильные модели. А в том, что открытая модель вышла без внятных защит от такого применения, и ограничения из неё удаляются за сумму, которую легко потратит одиночка.
Открытые модели: та же свобода в обе стороны
Открытые веса дают ровно то, за что их и любят: их можно запускать у себя, дообучать под свою задачу, не отдавать данные наружу. Мы сами про это писали, когда разбирали локальные модели решений.
Обратная сторона той же медали: если веса у вас на диске, то из них можно убрать всё, включая отказы. Закрытая модель за API живёт на сервере провайдера, и вы физически не можете переучить её не отказывать.
Отсюда практический вывод, который редко звучит в спорах «открытое против закрытого». Разница не в качестве и не в цене, а в том, где находится контроль. У открытой модели он у того, кто держит веса. И это одинаково верно и для честного разработчика, и для нечестного.
Что предлагает Anthropic
Три вещи, и они понятны без юридического образования.
Дать защитникам доступ к сильным моделям через контролируемые программы: если атакующие уже пользуются, у обороняющихся не должно быть худшего инструмента.
Требовать независимую проверку безопасности моделей на государственном уровне, а не полагаться на самооценку разработчика.
И добиваться, чтобы авторы открытых моделей всё-таки встраивали защиты, даже понимая, что их можно снять: стоимость снятия — тоже барьер.
Что делать обычному пользователю
Пугаться тут нечего: к вашему рабочему чату эта история отношения не имеет. Полезны два вывода.
Открытая модель не равно безопасная. Аргумент «открытое прозрачнее, значит надёжнее» работает для проверки кода и не работает для поведения модели.
Ждите больше отказов, а не меньше. После таких разборов провайдеры закручивают фильтры, и безобидные запросы про безопасность тоже начинают попадать под них. Если вы изучаете уязвимости по работе, формулируйте задачу честно и подробно: короткий запрос из двух слов похож на злоупотребление сильнее развёрнутого.
В tenzor мы работаем через API провайдеров и с их защитами, своих моделей не обучаем и веса не трогаем. Какие модели доступны и чем различаются — в таблице моделей для чата.
Может ли нейросеть написать работающий эксплойт?+
В проверке Anthropic открытая модель GLM-5.3 выдавала рабочий код в 12% попыток на публичном наборе задач по уязвимостям браузерного движка и в 4% на более сложном поиске уязвимостей в открытом софте.
Насколько надёжны встроенные отказы моделей?+
В этом тесте слабо: выдуманная легенда обходила их в 64% случаев, подставленное начало ответа — в 92%, а удаление ограничений из весов давало 100% и стоило около 4400 долларов машинного времени.
Значит, открытые модели опаснее закрытых?+
Они отличаются тем, где находится контроль. Веса открытой модели у владельца файла, поэтому из неё можно убрать ограничения. У закрытой модели за API такой возможности нет, но и запускать её у себя нельзя.
Как это касается обычного пользователя?+
Напрямую — никак. Косвенно: после таких разборов провайдеры усиливают фильтры, и под них попадают безобидные вопросы про безопасность. Формулируйте задачу подробно и честно, короткий запрос выглядит подозрительнее.
Что дальше почитать
- Модели решений теперь обучают дома — обратная сторона открытых весов.
- ИИ-агенты взломали Hugging Face — что бывает, когда модель сама ищет обходные пути.
Посмотрите, какие модели доступны
В таблице видно цену, сильные стороны и ограничения каждой. Переключается в шапке чата.
Открыть чат