ЧТО ВООБЩЕ ДЕЛАЕТ ДЕТЕКТОР AI
Начнём с главного заблуждения: детектор AI не «знает», что текст написала нейросеть. Он оценивает вероятность. На вход подаётся текст, на выходе — число вроде «87% AI» или мягче «likely AI-generated». Под капотом это либо статистика распределения токенов, либо отдельная модель-классификатор, обученная отличать человеческую писанину от генерации.
Ключевая идея почти всех детекторов — языковая модель, оставленная «сама с собой», пишет предсказуемо. Она выбирает наиболее вероятные следующие токены, поэтому её текст ровный, без резких перепадов. Человек пишет рвано: странное слово, внезапно длинное предложение, опечатка, разговорный оборот. Детекторы измеряют именно эту неровность.
ПЕРПЛЕКСИЯ И БЕРСТИННЕСС — ДВА КИТА
Перплексия (perplexity) — насколько модель «удивлена» текстом. Формально это экспонента от средней кросс-энтропии по токенам. Низкая перплексия = текст предсказуем для языковой модели = подозрение на генерацию. Высокая = текст «неожиданный», скорее человек.
Берстиннесс (burstiness) — разброс перплексии по предложениям. У людей разброс большой: одно предложение банальное, следующее — с редкой конструкцией. У сырой генерации всё ровно на одном уровне.
Вот минимальный рабочий пример расчёта перплексии на GPT-2 — та самая логика, что лежит в основе классических детекторов:
import torch
from transformers import GPT2LMHeadModel, GPT2TokenizerFast
tok = GPT2TokenizerFast.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("gpt2").eval()
def perplexity(text: str) -> float:
ids = tok(text, return_tensors="pt").input_ids
with torch.no_grad():
loss = model(ids, labels=ids).loss
return torch.exp(loss).item()
human = "слушай ну я вчера реально задолбался с этим деплоем, всё легло"
ai = "Данный процесс развёртывания представляет собой комплексное решение."
print(round(perplexity(human), 1)) # высокая — человек
print(round(perplexity(ai), 1)) # низкая — подозрение на AI
Именно по этому принципу работал первый GPTZero и десятки клонов. Проблема очевидна уже здесь: детектор эталонной моделью GPT-2 оценивает текст, который мог написать человек в официально-деловом стиле. И такой человек словит «AI» ни за что.
ЛОЖНЫЕ СРАБАТЫВАНИЯ — ГЛАВНАЯ БОЛЬ
Это не абстрактная угроза. По множеству независимых замеров сообщества и академических групп, детекторы систематически ошибаются на:
- Неносителях языка. Тексты людей, для которых язык неродной, пишутся проще и предсказуемее — детекторы массово метят их как AI. Это документированная дискриминация, из-за которой ряд университетов США откатили использование детекторов.
- Технической и юридической прозе. Шаблонные формулировки, устойчивые обороты — низкая перплексия по определению.
- Коротких текстах. На отрывке в 2-3 предложения статистики просто не хватает, доверять числу нельзя.
- Классике и Библии. Известный мем: детекторы уверенно объявляют AI-текстом Конституцию США и религиозные тексты, потому что модели их видели миллионы раз и они «предсказуемы».
Практический вывод: одиночный процент детектора — не доказательство. Любое серьёзное решение (отчисление, увольнение, отклонение статьи) на основе только детектора — юридически и этически хрупко.
ВОДЯНЫЕ ЗНАКИ — ЕДИНСТВЕННЫЙ ЧЕСТНЫЙ СИГНАЛ
В отличие от post-hoc детекторов, водяные знаки (watermarking) встраиваются в момент генерации. Идея (метод Kirchenbauer и др., развитый в SynthID от Google DeepMind): на каждом шаге генерации токены псевдослучайно делятся на «зелёный» и «красный» списки по хэшу от предыдущих токенов, и модель мягко подталкивается выбирать зелёные. Человек разницы не видит, а зная секретный ключ, можно статистически доказать: зелёных токенов подозрительно много — это наша модель.
Плюс подхода: математически обоснованный p-value, а не «модель так почувствовала». Минусы:
- Работает только если провайдер сам встроил знак. Локальные open-weight модели без вотермарка — мимо.
- Перефраз через другую модель размывает статистику зелёных токенов.
- Смешение с человеческим текстом снижает силу сигнала.
SynthID для текста Google частично открыл в 2024, и это направление в 2026 — самое перспективное. Но покрытие рынка мало́е: большинство генераций проходит без всяких знаков. Свежие релизы детекторов и open-source инструментов вокруг вотермаркинга удобно отслеживать в каталоге REDDYX.
СРАВНЕНИЕ ПОДХОДОВ
| Подход | Как работает | Ложные срабатывания | Обходится | Нужен доступ к модели |
|---|---|---|---|---|
| Перплексия / берстиннесс (GPTZero-стиль) | Статистика предсказуемости токенов | Высокие | Легко (редактура, перефраз) | Нет |
| Обученный классификатор | Отдельная модель да/нет | Средние, деградируют на новых LLM | Средне | Нет |
| Стилометрия | Анализ стиля, n-граммы, ритм | Средние | Средне | Нет |
| Водяные знаки (SynthID и т.п.) | Сигнал вшит при генерации | Очень низкие | Только перефразом | Да, на этапе генерации |
КАК ДЕТЕКТОРЫ ОБХОДЯТСЯ (И ПОЧЕМУ ЭТО ТРИВИАЛЬНО)
Раздел не инструкция «как списать», а объяснение, почему на детектор нельзя опираться как на защиту. Статистические детекторы бьются по своей же метрике — надо просто поднять перплексию и берстиннесс:
- Ручная редактура. Пара переписанных фраз, разбавленный ритм предложений, живой оборот — и «гладкость» рушится.
- Перефраз другой моделью. Прогон через второй LLM или специализированный «гуманайзер» меняет распределение токенов.
- Смешивание. Абзац сгенерирован, абзац дописан руками — усреднённая метрика уплывает в серую зону.
- Промпт на «человечность». Просьба писать нарочито неровно, с разной длиной предложений, повышает перплексию на выходе.
Вот почему гонка «детектор против генератора» — это классическая adversarial-игра, в которой атакующий всегда на шаг впереди: детектор публичен, его метрику видно, оптимизировать под неё легко.
ЧТО ДЕЛАТЬ ПРАКТИКУ В 2026
Если вы проверяете чужие тексты
- Не выносите вердиктов по одному проценту. Требуйте контекст: история правок, черновики, устная защита работы.
- Помните про ложные срабатывания на неносителях и технической прозе.
- Если критично юридически — ищите водяной знак у провайдера, а не гоняйте текст через случайный веб-детектор.
Если вы пишете с помощью AI
- Редактируйте руками не ради обхода, а ради качества — гладкий безликий текст плохо читается и людьми, и Google.
- Раскрывайте использование AI там, где этого требует политика площадки. Это дешевле, чем разбирательство.
ГЛАВНЫЙ ВЫВОД
Детекторы AI 2026 — полезный, но слабый эвристический сигнал. Они дают ориентир «стоит присмотреться», а не приговор. Единственная статистически строгая технология — водяные знаки, но её покрытие мало́е и она уязвима к перефразу. Строить на детекторах карательные процессы — значит наказывать невиновных и пропускать умелых. Инструменты вокруг детекции и вотермаркинга быстро эволюционируют — новые проекты собираются в каталоге REDDYX.
Частые вопросы
Насколько точен GPTZero и подобные детекторы?
Заявленная точность высока на «чистой» сырой генерации, но резко падает на отредактированном тексте и даёт заметный процент ложных срабатываний на живых людях — особенно на неносителях языка и технической прозе. Один результат детектора нельзя считать доказательством.
Что такое перплексия в детекции AI-текста?
Перплексия — мера того, насколько текст предсказуем для языковой модели. Низкая перплексия означает «слишком гладкий, ожидаемый» текст и повышает подозрение на AI. Но её же легко поднять редактурой, поэтому метрика обходится.
Можно ли обмануть детектор AI?
Статистические детекторы обходятся тривиально: ручная правка, перефраз через другую модель, смешивание сгенерированного и написанного вручную. Именно поэтому детектор — не защита, а лишь вероятностный ориентир.
Водяные знаки надёжнее детекторов?
Да, водяные знаки дают математически обоснованный сигнал с низким процентом ложных срабатываний. Но они работают только если провайдер встроил знак при генерации и размываются перефразом через другую модель.
Тема детекции и обхода мутирует буквально по неделям — новые классификаторы, гуманайзеры, схемы вотермаркинга. Чтобы не читать это раз в квартал, а видеть релизы по мере выхода — залетай в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.