Заказчики требуют от LLM/AI Firewall более 500 формализованных требований
Крупные заказчики перешли от запроса «прокси для ChatGPT» к матрице из более чем 500 формализованных требований к защите генеративного ИИ. В неё входят контроль ИИ-агентов, MCP, соответствие 152-ФЗ и управление расходом токенов.
- Требования к LLM/AI Firewall выросли до более 500 формализованных пунктов, включая защиту ИИ-агентов и MCP.
- Заказчики требуют контроля теневого ИИ, fail-closed и локализации данных.
- Бюджет токенов становится контрольным механизмом с лимитами на организацию, команду и пользователя.

Корпоративный ИИ перестал быть пилотным проектом в одном департаменте. Запросы к моделям идут из IDE, внутренних ассистентов, агентных контуров и «теневых» чатов сотрудников. Поверхность атаки включает промпт-инъекции, утечку персональных данных во внешнюю модель, неконтролируемый расход токенов и вызов инструментов ИИ-агентом без соответствующих прав.
От прокси к контрольному контуру
За последний год требования крупных enterprise-компаний к защите генеративного ИИ существенно изменились. Сначала это был короткий перечень задач к «прокси для ChatGPT», теперь — матрица на десятки страниц с более чем 500 формализованными требованиями. В неё входят стандартные задачи, а также требования к ИИ-агентам, MCP, 152-ФЗ и цепочке поставок моделей.
CISO больше не спрашивает, умеет ли система «ловить jailbreak». Он спрашивает, где стоит точка контроля, что происходит при падении анализатора, уходит ли конфиденциальный документ во внешнюю модель и кто увидит, что сервисная учётка исчерпала месячный бюджет токенов.
Слои требований
Матрица делится на две части. Первая — исходная форма: общие характеристики, каталог моделей, базовый конвейер безопасности, защита агентов, анонимизация персональных данных, роли и лимиты, API, классификация и маршрутизация, MCP Gateway. Вторая часть жёстче: варианты развёртывания, fail-closed, теневой ИИ, цепочка поставки моделей, ML Red Teaming и регрессия, производительность, защита самого шлюза, локализация данных, ИИ-агенты на конечной точке.
Первый слой — точка контроля. LLM/AI Firewall должен встать в разрыв трафика: API-шлюз, прозрачный прокси, sidecar, браузерный плагин или толстый клиент на конечной точке. Подключение не должно ломать работу ИИ-агентов и ассистентов. Важно выявлять теневой ИИ, когда сотрудники уходят в публичный чат мимо шлюза.
Второй слой — каталог моделей. Публичное имя, которое видит клиент, и конкретное развёртывание за ним — разные сущности. За одним именем может стоять пул: локальный vLLM, GigaChat, внешний провайдер. У каждой записи есть режим, цена входа и выхода, цена кэша, пределы контекста, RPM/TPM и обязательная метка размещения. Минимальный набор провайдеров: Anthropic, OpenAI, DeepSeek, на практике добавляют GigaChat, YandexGPT, Ollama, vLLM, llama.cpp.
Третий слой — конвейер безопасности. Это не один классификатор, а пайплайн с явным порядком шагов: нормализация и правила, затем небольшие модели, затем судья на спорных оценках. Отдельные требования — русскоязычная морфология, гомоглифы, косвенные инъекции из файлов, почты, RAG и результатов инструментов, разбор офисных форматов, OCR и речь.
Четвёртый слой — данные. Заказчик говорит языком 152-ФЗ: нужны ИНН, СНИЛС, паспорт, полис, спецкатегории, контрольные суммы, устойчивый плейсхолдер на всю сессию и обратная подстановка в потоковом ответе. Маскирование должно накрывать историю диалога и саммари.
Пятый слой — люди, команды и деньги. Требуется иерархия «организация — команда — пользователь», двухуровневый RBAC и вход только через корпоративный каталог. Бюджет становится контрольным механизмом: потолок задаётся в валюте учёта на организацию, команду и пользователя, проверка RPM, TPM и стоимости идёт до вызова модели.
Контроль токенов
Токен — одновременно единица стоимости, риска и нагрузки на инференс. Если LLM/AI Firewall не считает его до вызова модели, он не управляет риском. В карточке модели нужны разные ставки: за входящий текст, за ответ, за повторное использование контекста и за внутренние рассуждения.
Для профиТехнические детали: архитектура, цифры, ссылки
Матрица требований включает более 500 формализованных пунктов. Ключевые архитектурные элементы:
- Точки контроля: API-шлюз, прозрачный прокси, sidecar, браузерный плагин, толстый клиент.
- Каталог моделей с метками размещения, ценами за вход/выход/кэш, лимитами RPM/TPM.
- Конвейер безопасности: нормализация, правила, малые модели, судья на спорных оценках.
- ML Red Teaming: текстовые атаки, визуальные вставки, скрытые слои на изображениях, речевые инструкции в аудио, многошаговые сценарии.
- Соответствие 152-ФЗ: ИНН, СНИЛС, паспорт, полис, спецкатегории, контрольные суммы, плейсхолдеры на сессию.
- RBAC: организация — команда — пользователь, вход через корпоративный каталог.
- Бюджеты: лимиты на организацию, команду и пользователя, проверка до вызова модели.
Минимальный набор провайдеров: Anthropic, OpenAI, DeepSeek. На практике добавляют GigaChat, YandexGPT, Ollama, vLLM, llama.cpp.
Что это значит для России
Требования заказчиков напрямую ссылаются на 152-ФЗ, что делает соответствие российскому законодательству о персональных данных обязательным пунктом матрицы. В список провайдеров на практике включают GigaChat и YandexGPT, а также локальные решения вроде vLLM и Ollama.
Локализация данных и контроль теневого ИИ особенно актуальны для российских компаний, где сотрудники могут использовать публичные чаты в обход корпоративных политик.
Вопросы и ответы
- Что такое LLM/AI Firewall?
- Это контрольный контур, который встаёт в разрыв трафика между пользователями и моделями, проверяет запросы на промпт-инъекции, утечки данных и контролирует расход токенов.
- Сколько требований предъявляют заказчики?
- Более 500 формализованных требований, включая защиту ИИ-агентов, MCP, соответствие 152-ФЗ и цепочку поставок моделей.
- Зачем контролировать расход токенов?
- Токен — это единица стоимости, риска и нагрузки. Без подсчёта до вызова модели невозможно управлять бюджетом и объяснить рост счетов.


