Детекторы ИИ-текста ошибаются: точность падает до 17,4%

Независимые исследования показывают: детекторы ИИ-текста ошибаются массово. Средняя точность шести популярных сервисов — 39,5%, а после минимальной обработки текста падает до 17,4%.

Главное
  • Средняя точность шести популярных детекторов ИИ-текста составила 39,5%, после обхода защиты — 17,4%
  • Turnitin пометил как сгенерированные около 95% студенческих эссе, хотя ИИ использовался лишь в 45% работ
  • Модель парафразирования Dipper обрушила точность DetectGPT с 70,3% до 4,6%
Иллюстрация к новости о работе и ошибках детекторов текстов, написанных искусственным интеллектом
Фото: Хабр: ИИ

Детекторы текстов, написанных нейросетями, массово ошибаются. Об этом говорят независимые исследования, собранные в разборе на Хабре. Средняя точность шести популярных сервисов составила всего 39,5%, а если текст минимально обработать для обхода защиты, показатель падает до 17,4%.

Как работают детекторы

Большинство сервисов опираются на два параметра. Первый — перплексия: насколько предсказуемо следующее слово. У сгенерированного текста она ниже, потому что языковая модель выбирает статистически вероятные последовательности. Второй — бурстинесс: вариативность длины и сложности предложений. ИИ-текст однороден, обычно 15–25 слов на предложение, тогда как человек может написать и три слова, и длинную конструкцию с придаточными.

Кто на рынке

GPTZero создал студент Принстонского университета Эдвард Тян в 2023 году, чтобы помочь преподавателям. Сейчас у сервиса 17 миллионов пользователей. Разработчики заявляют точность 99% для полностью сгенерированных текстов и 96,5% для смешанных, а долю ложноположительных срабатываний на текстах не-носителей английского — 1%. Но на независимых текстах ложные срабатывания колеблются от 1% до 11%, а в отдельных исследованиях достигали 61,3%.

Turnitin считается самым сложным для обхода: он работает внутри институциональных систем и обучен на миллиардах студенческих работ. Originality обновляется чаще конкурентов и использует нейронный классификатор. ZeroGPT и Copyleaks обходятся проще всего — их модели обновляются реже.

Насколько им можно верить

Учёные из Стэнфорда выяснили, что детекторы систематически помечают тексты не-носителей английского языка как сгенерированные, тогда как работы носителей распознают безошибочно. В другом эксперименте Turnitin пометил как «сгенерированные» около 95% студенческих эссе, хотя ИИ использовался лишь в 45% работ.

Модель парафразирования Dipper от Google Research обрушила точность детектора DetectGPT с 70,3% до 4,6%. При этом доля ложных обвинений осталась прежней — 1%. Система перестала видеть ИИ-текст, но продолжала ошибочно штрафовать людей.

Почему детекторы проигрывают

Ахиллесова пята детекторов — опора на хрупкие статистические паттерны, а не на понимание смысла. Исследование группы Creo (2024) показало, что точность резко падает от вставки невидимых Unicode-символов или случайных знаков препинания. По данным команды Perkins (2024), обычное перефразирование снижает эффективность распознавания примерно на 17 процентных пунктов.

Исключение — детектор RADAR, единственная модель, специально обученная противостоять парафразам: она распознаёт изменённый текст на 31,64% точнее аналогов. Но и она не успевает за новыми инструментами обхода. Объединение детекторов в ансамбль тоже не помогает: уязвимость одного алгоритма переносится на другие. Любой злоумышленник с минимальным бюджетом может дообучить нейросеть через LoRA для обхода конкретного детектора.

Создатели GPTZero признают: ни один детектор не даёт 100% точности, а технологии генерации постоянно меняются. Вердикт программы не должен быть окончательным доказательством или поводом для наказания.

Для профиТехнические детали: архитектура, цифры, ссылки
  • GPTZero: заявленная точность 99% для полностью сгенерированных текстов, 96,5% для смешанных; ложноположительные на текстах не-носителей — 1% (дебайасинг).
  • Turnitin: признаёт текст сгенерированным при итоговой оценке от 20% до 100%; в диапазоне 1–19% фиксируется повышенная частота ложных срабатываний.
  • DetectGPT: точность 70,3% на чистом тексте, 4,6% после обработки моделью Dipper (Google Research).
  • RADAR: распознаёт парафразы на 31,64% точнее аналогов.
  • Creo (2024): падение точности от невидимых Unicode-гомоглифов и случайных знаков препинания. Perkins (2024): перефразирование снижает эффективность примерно на 17 п.п.

Вопросы и ответы

Насколько точны детекторы ИИ-текста?
Средняя точность шести популярных сервисов в тесте составила 39,5%, а после минимальной обработки текста для обхода защиты — 17,4%.
Почему детекторы ошибочно обвиняют людей?
Они опираются на статистические паттерны, а не на смысл. Стэнфордские учёные выяснили, что тексты не-носителей английского систематически помечаются как сгенерированные.
Можно ли использовать вердикт детектора как доказательство?
Нет. Создатели GPTZero признают: ни один детектор не даёт 100% точности, поэтому его вердикт не должен быть поводом для наказания.