Anthropic: открытая GLM-5.3 почти догнала Claude Mythos Preview в эксплойтах
Anthropic сравнила открытую модель GLM-5.3 от Zhipu с Claude Mythos Preview на бенчмарках по эксплуатации уязвимостей. Результаты близки, но защитные механизмы открытой модели легко обойти — вплоть до полного отказа от них за 2200 GPU-часов.
- На ExploitBench GLM-5.3 построила рабочий эксплойт в 50 из 410 попыток, Mythos Preview — в 56.
- GLM-5.3 вместе с человеком за день нашла неизвестные уязвимости в JS-движке браузера и прочитала приватный SSH-ключ.
- Метод abliteration снизил отказ модели от вредных запросов с более 90% до 2–12% за 2200 GPU-часов.

Anthropic опубликовала анализ кибервозможностей открытой модели GLM-5.3 от Zhipu. По её данным, модель почти догнала Claude Mythos Preview в разработке эксплойтов, но её защитные механизмы легко снять. GLM-5.3 доступна для скачивания всем желающим, тогда как Mythos Preview выдаётся только проверенным защитникам через Project Glasswing.
Бенчмарки
На ExploitBench, который измеряет эксплуатацию известных багов в движке Chrome V8, GLM-5.3 построила рабочий эксплойт в 50 из 410 попыток, а Mythos Preview — в 56. Во внутреннем бенчмарке Anthropic по бинарной эксплуатации на базе проектов Google OSS-Fuzz GLM-5.3 получила полный контроль над программой в 4% задач против 6% у Mythos Preview. Более старые модели, включая GLM-5.2 и Claude Opus 4.6, провалили оба теста, а Kimi K3 и DeepSeek V4.1-Flash почти не отличились от нуля.
Реальные находки
В паре с человеком-экспертом GLM-5.3 за один день нашла несколько неизвестных уязвимостей в JavaScript-движке популярного браузера. Модель связала их в веб-страницу, способную прочитать любой файл на компьютере посетителя, и в тесте вытащила приватный SSH-ключ. Anthropic сообщила об уязвимостях разработчикам браузера, другие находки в драйверах и прошивках ещё проверяются.
Меньшая модель GLM-5.3-Flash за 20 минут внимания человека и восемь часов машинного времени собрала рабочую атаку из недавно раскрытого бага Chrome и другой известной уязвимости. Атака обошла дополнительную аппаратную защиту процессора. По API-ценам Zhipu это стоило бы $20,40.
Обход защитных механизмов
В симуляции Anthropic GLM-5.3 отказывалась выполнять явные вредоносные команды. Но когда тот же запрос подавался как red-team упражнение, модель пыталась подключиться к целевой системе в 64% запусков, а с предзаполненными шагами рассуждения — в 92%. После abliteration, метода удаления отказного поведения из открытых весов, показатель достиг 100%. Симуляция не выполняет код, поэтому неизвестно, увенчалась бы атака успехом. Защищённые модели Claude остались на нуле.
Anthropic впервые применила abliteration: процесс занял около 2200 GPU-часов и стоил примерно $4400, опытная команда, по оценке компании, управилась бы за $1200. Доля отказов на вредные запросы упала с более 90% до 2–12%, а результаты научных и кибертестов почти не изменились. По словам Anthropic, несколько разработчиков выпустили разблокированные версии модели в первые дни после релиза.
Независимая оценка
Агентство CAISI пришло к похожим выводам: GLM-5.3 — самая киберспособная открытая модель на сегодня, отстающая от лучших американских моделей примерно на четыре месяца. Оговорка: CAISI тестировала американские модели с отключёнными киберзащитами, а верхний tier включает модели, доступные только проверенным пользователям.
Британский AI Security Institute ранее выяснил, что открытые модели сократили отставание в кибервозможностях с шести–десяти месяцев до четырёх–семи. Институт также отметил их дешевизну и неэффективность защитных механизмов, предупредив о риске необратимого злоупотребления, но указав на плюсы вроде приватного хостинга и кастомизации.
Anthropic не раскрывает веса своих моделей и в отчёте представляет это как ключевое преимущество безопасности. При этом дешёвая китайская открытая модель, близкая к фронтиру, — прямой конкурент компании, а призыв к государственному тестированию её наследников может выглядеть как регуляторный захват.
Для профиТехнические детали: архитектура, цифры, ссылки
Бенчмарки: ExploitBench (Chrome V8) — GLM-5.3: 50/410 успешных эксплойтов, Mythos Preview: 56/410. Внутренний бенчмарк Anthropic на базе OSS-Fuzz — полный контроль: 4% против 6%. GLM-5.2 и Claude Opus 4.6 провалили оба теста.
Abliteration: около 2200 GPU-часов, стоимость ~$4400 (оценка для опытной команды — ~$1200). Отказ от вредных запросов упал с >90% до 2–12%, научные и кибер-оценки почти не изменились.
Симуляция атаки: отказ при явном запросе, 64% попыток подключения при маскировке под red-team, 92% с предзаполненными шагами, 100% после abliteration. Код не исполнялся, успех атаки не подтверждён.
Стоимость атаки GLM-5.3-Flash: 20 минут внимания человека + 8 часов машинного времени = $20,40 по API-ценам Zhipu.
Оценка CAISI: GLM-5.3 — самая киберспособная открытая модель, отстаёт от лучших американских примерно на 4 месяца. Оговорка: американские модели тестировались с отключёнными защитами.
Вопросы и ответы
- Насколько GLM-5.3 близка к Claude Mythos Preview в создании эксплойтов?
- На ExploitBench GLM-5.3 построила эксплойт в 50 из 410 попыток, Mythos Preview — в 56. Во внутреннем бенчмарке Anthropic разрыв составил 4% против 6%.
- Можно ли снять защиту с GLM-5.3?
- Да, Anthropic применила abliteration за 2200 GPU-часов и снизила отказ от вредных запросов с более 90% до 2–12%. Разблокированные версии уже появились.
- Что говорит независимая оценка CAISI?
- CAISI называет GLM-5.3 самой киберспособной открытой моделью и оценивает отставание от лучших американских моделей примерно в четыре месяца.

