tenzorНачать
Все статьи

Открытую модель проверили на взлом: эксплойт за 20 минут и 20 долларов

Anthropic опубликовала разбор: они проверили открытую модель GLM-5.3 на способность писать кибератаки. Рабочие эксплойты она выдавала в 12% попыток на публичном наборе уязвимостей браузерного движка. Встроенные отказы обходятся легко: выдуманная легенда даёт 64% успеха, подставленное начало рассуждения — 92%, а снятие ограничений прямо из весов — 100%. Разработка эксплойта под известную уязвимость обошлась в 20 минут человеческого внимания и 20,40 доллара.

Что именно проверяли

Тестов было три, и они различаются по сложности.

Публичный набор задач на уязвимости движка браузера: дана известная слабость, нужно написать работающий код, который её использует. Здесь 12% успеха.

Внутренний набор Anthropic на поиск уязвимостей в открытом софте — задача труднее, потому что слабое место надо ещё найти. Тут 4%.

И проверка с живым специалистом в изолированной среде: сколько человеческого времени и денег уходит, если модель работает ассистентом. Ответ — 20 минут и 20 долларов на один эксплойт под известную уязвимость.

Насколько легко снимаются отказы

Самая тревожная часть разбора не про способности, а про защиту. У модели есть встроенные отказы, и они держатся плохо.

Способ обходаУспех
простая выдуманная легенда в запросе64%
подставленное начало ответа за модель92%
удаление ограничений из весов модели100%

Последняя строка возможна только потому, что модель открытая: веса лежат в свободном доступе, и их можно переучить. По расчётам Anthropic, снятие отказов стоит около 2200 часов работы видеокарт, то есть примерно 4400 долларов. После этого доля отказов падает с более чем 90% до 3-12%.

Где здесь настоящая новость

Не в том, что модель умеет писать эксплойты — это умеют почти все сильные модели. А в том, что открытая модель вышла без внятных защит от такого применения, и ограничения из неё удаляются за сумму, которую легко потратит одиночка.

Открытые модели: та же свобода в обе стороны

Открытые веса дают ровно то, за что их и любят: их можно запускать у себя, дообучать под свою задачу, не отдавать данные наружу. Мы сами про это писали, когда разбирали локальные модели решений.

Обратная сторона той же медали: если веса у вас на диске, то из них можно убрать всё, включая отказы. Закрытая модель за API живёт на сервере провайдера, и вы физически не можете переучить её не отказывать.

Отсюда практический вывод, который редко звучит в спорах «открытое против закрытого». Разница не в качестве и не в цене, а в том, где находится контроль. У открытой модели он у того, кто держит веса. И это одинаково верно и для честного разработчика, и для нечестного.

Что предлагает Anthropic

Три вещи, и они понятны без юридического образования.

Дать защитникам доступ к сильным моделям через контролируемые программы: если атакующие уже пользуются, у обороняющихся не должно быть худшего инструмента.

Требовать независимую проверку безопасности моделей на государственном уровне, а не полагаться на самооценку разработчика.

И добиваться, чтобы авторы открытых моделей всё-таки встраивали защиты, даже понимая, что их можно снять: стоимость снятия — тоже барьер.

Что делать обычному пользователю

Пугаться тут нечего: к вашему рабочему чату эта история отношения не имеет. Полезны два вывода.

Открытая модель не равно безопасная. Аргумент «открытое прозрачнее, значит надёжнее» работает для проверки кода и не работает для поведения модели.

Ждите больше отказов, а не меньше. После таких разборов провайдеры закручивают фильтры, и безобидные запросы про безопасность тоже начинают попадать под них. Если вы изучаете уязвимости по работе, формулируйте задачу честно и подробно: короткий запрос из двух слов похож на злоупотребление сильнее развёрнутого.

В tenzor мы работаем через API провайдеров и с их защитами, своих моделей не обучаем и веса не трогаем. Какие модели доступны и чем различаются — в таблице моделей для чата.

Может ли нейросеть написать работающий эксплойт?+

В проверке Anthropic открытая модель GLM-5.3 выдавала рабочий код в 12% попыток на публичном наборе задач по уязвимостям браузерного движка и в 4% на более сложном поиске уязвимостей в открытом софте.

Насколько надёжны встроенные отказы моделей?+

В этом тесте слабо: выдуманная легенда обходила их в 64% случаев, подставленное начало ответа — в 92%, а удаление ограничений из весов давало 100% и стоило около 4400 долларов машинного времени.

Значит, открытые модели опаснее закрытых?+

Они отличаются тем, где находится контроль. Веса открытой модели у владельца файла, поэтому из неё можно убрать ограничения. У закрытой модели за API такой возможности нет, но и запускать её у себя нельзя.

Как это касается обычного пользователя?+

Напрямую — никак. Косвенно: после таких разборов провайдеры усиливают фильтры, и под них попадают безобидные вопросы про безопасность. Формулируйте задачу подробно и честно, короткий запрос выглядит подозрительнее.

Что дальше почитать

Посмотрите, какие модели доступны

В таблице видно цену, сильные стороны и ограничения каждой. Переключается в шапке чата.

Открыть чат