OpenAI раскрыла правила внешнего аудита безопасности своих моделей
OpenAI опубликовала свод принципов и приоритетов для внешнего аудита безопасности своих моделей. Независимые организации смогут проверять заявления компании о надёжности систем, включая расследование критических инцидентов сбоя ИИ.
- Документ описывает четыре направления внешних проверок безопасности моделей OpenAI.
- Аудиторы получат «серый» доступ к системам для тестирования защиты от джейлбрейков.
- OpenAI уже ведёт переговоры с несколькими организациями о пилотных проектах.

OpenAI опубликовала свод принципов и приоритетов для проведения внешнего аудита безопасности своих моделей. Документ описывает четыре направления, по которым независимые организации — частные и некоммерческие — смогут проверять утверждения лаборатории о надёжности систем. В отличие от предварительных оценок перед запуском продуктов, новые процедуры рассчитаны на длительную и глубокую проверку, не привязанную к конкретным релизам.
Четыре направления проверок
Первое направление — независимая оценка «кейсов безопасности» (safety cases), охватывающих обучение, тестирование, внутреннее и внешнее развёртывание моделей. Аудиторы должны будут ответить на вопрос, подтверждаются ли заявления компании о безопасности реальными данными и соблюдались ли заявленные условия на всех этапах. Отдельно экспертам предстоит проверить, не создают ли методы обучения стимулы для обмана, саботажа или обхода ограничений со стороны ИИ.
Второе направление касается критических защитных механизмов — от мониторинга дезадаптации до защиты от джейлбрейков. Проверяющие получат «серый» доступ к системам, чтобы в реалистичных условиях протестировать, насколько надёжно фильтры блокируют вредоносные запросы в сферах кибербезопасности и биооружия, и где именно защита даёт сбой.
Третье направление — аудит тестов на возможности из категорий риска Preparedness Framework: химические и биологические угрозы, киберугрозы, способность ИИ к самоулучшению, а также тесты на риски дезадаптации.
Четвёртое, наиболее чувствительное направление — независимое расследование критических инцидентов сбоя моделей. В качестве примера приводится случай со взломом платформы Hugging Face, когда привлечение внешней стороны оказалось оправданным. От оценщиков потребуют экспертизу в киберкриминалистике, анализе цепочек рассуждений моделей и технике расследований.
Принципы и пилотные проекты
OpenAI подчёркивает, что выводы таких проверок могут напрямую влиять на «кейс безопасности» конкретной модели. Лаборатория также сформулировала семь принципов проведения аудита: заранее согласованный объём проверки и регистрируемые «заявления о безопасности», пропорциональный доступ к данным с учётом ограничений по интеллектуальной собственности, прозрачная методология, подтверждённая экспертиза и независимость оценщиков, защита конфиденциальности, практические рекомендации по исправлению уязвимостей и ответственная практика публикации отчётов.
OpenAI заявила, что уже ведёт переговоры с несколькими сторонними организациями о пилотных проектах в рамках новой схемы.
Для профиТехнические детали: архитектура, цифры, ссылки
Схема аудита охватывает четыре направления: независимая оценка safety cases (обучение, тестирование, внутреннее и внешнее развёртывание), проверка критических защитных механизмов (мониторинг дезадаптации, защита от джейлбрейков), аудит тестов Preparedness Framework (химические и биологические угрозы, киберугрозы, самоулучшение ИИ, риски дезадаптации) и независимое расследование критических инцидентов сбоя моделей.
Аудиторы получат «серый» доступ к системам. Семь принципов включают заранее согласованный объём проверки, пропорциональный доступ к данным с учётом ограничений по интеллектуальной собственности, прозрачную методологию, подтверждённую экспертизу и независимость оценщиков, защиту конфиденциальности, практические рекомендации по исправлению уязвимостей и ответственную практику публикации отчётов.
Вопросы и ответы
- Какие направления внешнего аудита безопасности моделей OpenAI?
- Четыре: независимая оценка «кейсов безопасности», проверка критических защитных механизмов, аудит тестов Preparedness Framework и расследование критических инцидентов сбоя моделей.
- Что такое «серый» доступ к системам?
- Это доступ, который получат проверяющие, чтобы в реалистичных условиях протестировать надёжность фильтров от вредоносных запросов.
- Уже есть пилотные проекты по аудиту?
- OpenAI заявила, что ведёт переговоры с несколькими сторонними организациями о пилотных проектах в рамках новой схемы.

