Jev от TypeSafe: guard-модель с контекстом 64K токенов
15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре прогнал её на бенчмарке Aegis 2.0 и разобрал, что она умеет, а что нет.
- Jev вышел 15 сентября и позиционируется как guard-модель для LLM Guardrails
- По данным OpenRouter контекст Jev — 32K токенов, в документации TypeSafe указано 64K
- На промптах Aegis 2.0 модель показала F1 0.85, recall 0.84 и FPR 0.15 при пороге 0.5

15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре изучил её возможности и прогнал на бенчмарке Aegis 2.0 от NVIDIA, чтобы понять, насколько она годится для защиты LLM-приложений.
Что такое Jev
Jev — не языковая модель, а классификатор для задач LLM Guardrails. По данным OpenRouter, контекстное окно модели составляет 32K токенов, а в документации TypeSafe указано 64K на запрос. Для энкодерных моделей это нестандартно: большинство из них фиксируют размеры в 512, 2048 или максимум 8192 токена.
Автор обзора отмечает, что не может назвать Jev просто GliClass с особым рецептом тюнинга именно из-за размера контекста. Похожий подход есть у Privacy Filter от OpenAI — открытого энкодера с контекстом 128K токенов и banded attention, где каждый токен видит только ±128 соседей.
Что модель умеет и не умеет
Jev справляется с обнаружением jailbreak и prompt injection: очевидные кейсы вроде «игнорируй предыдущие инструкции» он блокирует. Автор связывает это с тем, что за последние два года накопилось достаточно данных для обучения на таких примерах.
С детекцией PII ситуация сложнее. Jev может сказать, содержит ли текст персональные данные, но не выделит конкретный спан с именованной сущностью. Автор предупреждает: если использовать модель по API, передавать ей ПДн не стоит — это утечка на внешний сервис и нарушение ФЗ-152.
Результаты на Aegis 2.0
Инференс для бенчмарка шёл через интеграцию Jev с LangChain. На промптах распределение ответов бимодальное: safe группируется у нуля, unsafe — у единицы. При пороге 0.5 модель показала F1 0.85, recall 0.84 и FPR 0.15. То есть каждый шестой безопасный промпт блокируется и каждый шестой вредоносный пропускается.
На ответах LLM картина другая: unsafe-ответы размазаны по шкале от 0.2 до 1.0 без явного пика, recall падает до 0.76 при пороге 0.5. При этом AUC на ответах выше, чем на промптах — 0.927 против 0.921, так что ранжирует модель нормально, но порог 0.5 для ответов подобран неудачно.
Автор подчёркивает: Aegis 2.0 состоит из англоязычных примеров, то есть проверка шла на языке, которого в обучающих данных Jev было больше всего.
Для профиТехнические детали: архитектура, цифры, ссылки
Guard-модель Jev от TypeSafe вышла 15 сентября. Контекстное окно: 32K токенов по данным OpenRouter, 64K по документации TypeSafe. Инференс для бенчмарка автор делал через интеграцию Jev с LangChain.
Метрики на Aegis 2.0 при пороге 0.5:
- Промпты: F1 0.85, recall 0.84, FPR 0.15, AUC 0.921
- Ответы LLM: recall 0.76, AUC 0.927
Политика для бенчмарка задавалась через noul с бинарной классификацией safety. Детекция PII работает на уровне всего текста, без выделения спанов — для маскировки сущностей потребуется дополнительный NER.
Контекст в опенсорсе: в мае 2026 вышли gliner guard, gliguard от fastino (автор Urchade Zaratiana) и guard семейства gliclass. SOTA среди guard-моделей — Xguard, Qwen Guard остаётся дефолтным baseline.
Вопросы и ответы
- Что такое Jev?
- Guard-модель от TypeSafe для задач LLM Guardrails, вышла 15 сентября. Определяет jailbreak, prompt injection и наличие PII в тексте.
- Какой у Jev контекст?
- По данным OpenRouter — 32K токенов, в документации TypeSafe указано 64K на запрос.
- Может ли Jev выделить конкретные персональные данные в тексте?
- Нет, модель только сообщает, содержит ли текст ПДн, но не выделяет спаны именованных сущностей.


