Jev от TypeSafe: guard-модель с контекстом 64K токенов

15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре прогнал её на бенчмарке Aegis 2.0 и разобрал, что она умеет, а что нет.

Главное
  • Jev вышел 15 сентября и позиционируется как guard-модель для LLM Guardrails
  • По данным OpenRouter контекст Jev — 32K токенов, в документации TypeSafe указано 64K
  • На промптах Aegis 2.0 модель показала F1 0.85, recall 0.84 и FPR 0.15 при пороге 0.5
Скриншот страницы документации TypeSafe с описанием сценариев использования LLM Guardrails
Фото: Хабр: Машинное обучение

15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре изучил её возможности и прогнал на бенчмарке Aegis 2.0 от NVIDIA, чтобы понять, насколько она годится для защиты LLM-приложений.

Что такое Jev

Jev — не языковая модель, а классификатор для задач LLM Guardrails. По данным OpenRouter, контекстное окно модели составляет 32K токенов, а в документации TypeSafe указано 64K на запрос. Для энкодерных моделей это нестандартно: большинство из них фиксируют размеры в 512, 2048 или максимум 8192 токена.

Автор обзора отмечает, что не может назвать Jev просто GliClass с особым рецептом тюнинга именно из-за размера контекста. Похожий подход есть у Privacy Filter от OpenAI — открытого энкодера с контекстом 128K токенов и banded attention, где каждый токен видит только ±128 соседей.

Что модель умеет и не умеет

Jev справляется с обнаружением jailbreak и prompt injection: очевидные кейсы вроде «игнорируй предыдущие инструкции» он блокирует. Автор связывает это с тем, что за последние два года накопилось достаточно данных для обучения на таких примерах.

С детекцией PII ситуация сложнее. Jev может сказать, содержит ли текст персональные данные, но не выделит конкретный спан с именованной сущностью. Автор предупреждает: если использовать модель по API, передавать ей ПДн не стоит — это утечка на внешний сервис и нарушение ФЗ-152.

Результаты на Aegis 2.0

Инференс для бенчмарка шёл через интеграцию Jev с LangChain. На промптах распределение ответов бимодальное: safe группируется у нуля, unsafe — у единицы. При пороге 0.5 модель показала F1 0.85, recall 0.84 и FPR 0.15. То есть каждый шестой безопасный промпт блокируется и каждый шестой вредоносный пропускается.

На ответах LLM картина другая: unsafe-ответы размазаны по шкале от 0.2 до 1.0 без явного пика, recall падает до 0.76 при пороге 0.5. При этом AUC на ответах выше, чем на промптах — 0.927 против 0.921, так что ранжирует модель нормально, но порог 0.5 для ответов подобран неудачно.

Автор подчёркивает: Aegis 2.0 состоит из англоязычных примеров, то есть проверка шла на языке, которого в обучающих данных Jev было больше всего.

Для профиТехнические детали: архитектура, цифры, ссылки

Guard-модель Jev от TypeSafe вышла 15 сентября. Контекстное окно: 32K токенов по данным OpenRouter, 64K по документации TypeSafe. Инференс для бенчмарка автор делал через интеграцию Jev с LangChain.

Метрики на Aegis 2.0 при пороге 0.5:

  • Промпты: F1 0.85, recall 0.84, FPR 0.15, AUC 0.921
  • Ответы LLM: recall 0.76, AUC 0.927

Политика для бенчмарка задавалась через noul с бинарной классификацией safety. Детекция PII работает на уровне всего текста, без выделения спанов — для маскировки сущностей потребуется дополнительный NER.

Контекст в опенсорсе: в мае 2026 вышли gliner guard, gliguard от fastino (автор Urchade Zaratiana) и guard семейства gliclass. SOTA среди guard-моделей — Xguard, Qwen Guard остаётся дефолтным baseline.

Вопросы и ответы

Что такое Jev?
Guard-модель от TypeSafe для задач LLM Guardrails, вышла 15 сентября. Определяет jailbreak, prompt injection и наличие PII в тексте.
Какой у Jev контекст?
По данным OpenRouter — 32K токенов, в документации TypeSafe указано 64K на запрос.
Может ли Jev выделить конкретные персональные данные в тексте?
Нет, модель только сообщает, содержит ли текст ПДн, но не выделяет спаны именованных сущностей.