Детекторы ИИ-текста ошибаются: точность падает до 17,4%
Независимые исследования показывают: детекторы ИИ-текста ошибаются массово. Средняя точность шести популярных сервисов — 39,5%, а после минимальной обработки текста падает до 17,4%.
- Средняя точность шести популярных детекторов ИИ-текста составила 39,5%, после обхода защиты — 17,4%
- Turnitin пометил как сгенерированные около 95% студенческих эссе, хотя ИИ использовался лишь в 45% работ
- Модель парафразирования Dipper обрушила точность DetectGPT с 70,3% до 4,6%

Детекторы текстов, написанных нейросетями, массово ошибаются. Об этом говорят независимые исследования, собранные в разборе на Хабре. Средняя точность шести популярных сервисов составила всего 39,5%, а если текст минимально обработать для обхода защиты, показатель падает до 17,4%.
Как работают детекторы
Большинство сервисов опираются на два параметра. Первый — перплексия: насколько предсказуемо следующее слово. У сгенерированного текста она ниже, потому что языковая модель выбирает статистически вероятные последовательности. Второй — бурстинесс: вариативность длины и сложности предложений. ИИ-текст однороден, обычно 15–25 слов на предложение, тогда как человек может написать и три слова, и длинную конструкцию с придаточными.
Кто на рынке
GPTZero создал студент Принстонского университета Эдвард Тян в 2023 году, чтобы помочь преподавателям. Сейчас у сервиса 17 миллионов пользователей. Разработчики заявляют точность 99% для полностью сгенерированных текстов и 96,5% для смешанных, а долю ложноположительных срабатываний на текстах не-носителей английского — 1%. Но на независимых текстах ложные срабатывания колеблются от 1% до 11%, а в отдельных исследованиях достигали 61,3%.
Turnitin считается самым сложным для обхода: он работает внутри институциональных систем и обучен на миллиардах студенческих работ. Originality обновляется чаще конкурентов и использует нейронный классификатор. ZeroGPT и Copyleaks обходятся проще всего — их модели обновляются реже.
Насколько им можно верить
Учёные из Стэнфорда выяснили, что детекторы систематически помечают тексты не-носителей английского языка как сгенерированные, тогда как работы носителей распознают безошибочно. В другом эксперименте Turnitin пометил как «сгенерированные» около 95% студенческих эссе, хотя ИИ использовался лишь в 45% работ.
Модель парафразирования Dipper от Google Research обрушила точность детектора DetectGPT с 70,3% до 4,6%. При этом доля ложных обвинений осталась прежней — 1%. Система перестала видеть ИИ-текст, но продолжала ошибочно штрафовать людей.
Почему детекторы проигрывают
Ахиллесова пята детекторов — опора на хрупкие статистические паттерны, а не на понимание смысла. Исследование группы Creo (2024) показало, что точность резко падает от вставки невидимых Unicode-символов или случайных знаков препинания. По данным команды Perkins (2024), обычное перефразирование снижает эффективность распознавания примерно на 17 процентных пунктов.
Исключение — детектор RADAR, единственная модель, специально обученная противостоять парафразам: она распознаёт изменённый текст на 31,64% точнее аналогов. Но и она не успевает за новыми инструментами обхода. Объединение детекторов в ансамбль тоже не помогает: уязвимость одного алгоритма переносится на другие. Любой злоумышленник с минимальным бюджетом может дообучить нейросеть через LoRA для обхода конкретного детектора.
Создатели GPTZero признают: ни один детектор не даёт 100% точности, а технологии генерации постоянно меняются. Вердикт программы не должен быть окончательным доказательством или поводом для наказания.
Для профиТехнические детали: архитектура, цифры, ссылки
- GPTZero: заявленная точность 99% для полностью сгенерированных текстов, 96,5% для смешанных; ложноположительные на текстах не-носителей — 1% (дебайасинг).
- Turnitin: признаёт текст сгенерированным при итоговой оценке от 20% до 100%; в диапазоне 1–19% фиксируется повышенная частота ложных срабатываний.
- DetectGPT: точность 70,3% на чистом тексте, 4,6% после обработки моделью Dipper (Google Research).
- RADAR: распознаёт парафразы на 31,64% точнее аналогов.
- Creo (2024): падение точности от невидимых Unicode-гомоглифов и случайных знаков препинания. Perkins (2024): перефразирование снижает эффективность примерно на 17 п.п.
Вопросы и ответы
- Насколько точны детекторы ИИ-текста?
- Средняя точность шести популярных сервисов в тесте составила 39,5%, а после минимальной обработки текста для обхода защиты — 17,4%.
- Почему детекторы ошибочно обвиняют людей?
- Они опираются на статистические паттерны, а не на смысл. Стэнфордские учёные выяснили, что тексты не-носителей английского систематически помечаются как сгенерированные.
- Можно ли использовать вердикт детектора как доказательство?
- Нет. Создатели GPTZero признают: ни один детектор не даёт 100% точности, поэтому его вердикт не должен быть поводом для наказания.


