Microsoft открыла инструмент для поиска уязвимостей в ИИ-агентах

Microsoft опубликовала навык для VS Code, который за один прогон находит уязвимости в ИИ-агентах и подтверждает, что защита сработала. В демо доля нарушений упала с 30% до 5,9%.

Главное
  • Инструмент run-assert-eval последовательно запускает четыре этапа: поиск сценариев отказа, превращение их в eval-тесты, генерацию runtime-политики и повторную проверку.
  • В демонстрации с агентом биллинговой поддержки базовая версия нарушала правила в 12 из 40 диалогов — 30%.
  • После внедрения политики безопасности уровень нарушений снизился до 5,9%, а отказы на правомерных запросах обнулились.
Схема работы инструмента Microsoft для поиска уязвимостей в ИИ-агентах
Фото: iXBT

Microsoft опубликовала навык для VS Code, который замыкает в одну команду полный цикл поиска и устранения уязвимостей в ИИ-агентах. Инструмент run-assert-eval последовательно запускает четыре этапа: Clarity ищет потенциальные сценарии отказов, Assert превращает их в измеримые eval-тесты, Agent Control Specification генерирует runtime-политику для блокировки опасных действий, а затем агент прогоняется по тем же тестам повторно — чтобы получить доказательство, что защита сработала.

Ключевое требование архитектуры — тестовый набор, определение поведения и судья-оценщик остаются неизменными на всех прогонах, так что переменной выступает только политика безопасности.

Как это работает на примере

В демонстрационном примере Microsoft использовала агента биллинговой поддержки, который по спецификации должен обслуживать строго один клиентский аккаунт. На старте Clarity выявила два критических режима отказа: проведение операций без проверки личности и раскрытие данных чужого аккаунта. После преобразования рисков в структурированный набор тестов — с разбивкой по типам запросов и ролям пользователей — базовая версия агента показала 30% нарушений во втором сценарии: в 12 из 40 релевантных диалогов он просто отдавал полную запись о клиенте.

Сгенерированная на основе этих измерений политика встраивается в этапы «pre call» и «post call» — она блокирует любой вызов инструмента, чей идентификатор аккаунта не совпадает с аккаунтом владельца. При повторном прогоне на тех же тестах уровень нарушений упал до 5,9%, а главное — не пострадала полезность агента: счётчик отказов на правомерных запросах обнулился на всех четырёх срезах тестового набора.

Зачем это нужно

Подход, при котором оценка и управление поведением традиционно разнесены по разным командам и разным временным циклам, накапливает риск именно в зазоре между обнаружением проблемы и подтверждением, что система её больше не содержит, — а новый инструмент сжимает этот зазор до одной команды.

Microsoft подчёркивает, что замер безопасности и уровня пользы ведётся раздельно: агент, блокирующий вообще все запросы, получит идеальный счёт по первой метрике и провалит вторую, а значит, правдоподобен только тот результат, где обе движутся в правильном направлении.

Assert и Agent Control Specification уже доступны в open source, навык поставляется с 7 проработанными областями и 14 наборами рисков.

Для профиТехнические детали: архитектура, цифры, ссылки

Инструмент run-assert-eval поставляется как навык для VS Code. Assert и Agent Control Specification доступны в open source. Навык включает 7 проработанных областей и 14 наборов рисков.

Архитектура предполагает неизменность тестового набора, определения поведения и судьи-оценщика на всех прогонах — переменной выступает только политика безопасности. Политика встраивается в этапы «pre call» и «post call» и блокирует вызовы инструментов с несовпадающим идентификатором аккаунта.

Вопросы и ответы

Что делает инструмент run-assert-eval?
Он последовательно запускает четыре этапа: поиск сценариев отказов, превращение их в eval-тесты, генерацию runtime-политики и повторную проверку агента на тех же тестах.
Насколько упал уровень нарушений в демо?
С 30% до 5,9% при повторном прогоне на тех же тестах.
Доступен ли инструмент в open source?
Да, Assert и Agent Control Specification уже доступны в open source.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем