Гонка вооружений детекторов ИИ
- title
- Гонка вооружений детекторов ИИ
- type
- concept
- summary
- Детекция ИИ по форме ошибается в обе стороны, маркеры меняются с каждым релизом моделей, а авторы вынуждены ухудшать тексты, чтобы пройти проверку.
- tags
- llm-skepticism, writing, ai-disclosure
- created
- 2026-07-21
- updated
- 2026-09-14
- lang
- ru
- translation_of
- ai-detector-arms-race
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
И автоматическая, и человеческая детекция сгенерированного ИИ текста опираются на поверхностные признаки - форматирование, пунктуацию, беглость слога, структуру. Каждый из этих признаков - либо то, от чего модель можно отучить промптом, либо то, что внимательный человек делает сам по себе. В итоге детектор ошибается в обе стороны, а обратная связь наказывает за хороший текст.
Актуальны оба типа ошибок
Ложные срабатывания задокументированы лучше. Джеймс Чжань рассказывает, как его комментарии на Reddit называли текстом из ChatGPT только за грамотность и хорошее форматирование, а коммерческие детекторы оценивали его собственную прозу как "на 80% написанную ИИ". Паника вокруг длинного тире (em dash) - хрестоматийный пример: на протяжении 2025-2026 годов наличие тире считалось достаточным доказательством генерации, что автоматически клеймило любого автора с нормальным знанием пунктуации.
Ложноотрицательные срабатывания привлекают меньше внимания, хотя их масштаб больше. Сабреддит r/isthisAI собирает миллионы посетителей в неделю именно потому, что люди не могут отличить текст сами. Смешанный текст человека и модели ("AI-assisted") попадает в серую зону, с которой поверхностные правила не справляются вовсе.
Маркеры устаревают
Каждый релиз новой модели убирает часть сигналов, оставшихся от предыдущего поколения. Читатель, запомнивший маркеры 2025 года, откалиброван под модель, которую больше никто не запускает. Поэтому детекция - не разово освоенный навык, а постоянная подстройка под цель, которая движется быстрее, чем большинство успевает следить. Причём за эту подстройку никто не платит. claude-vocabulary-clusters отслеживает появление нового набора маркеров в публичном пространстве, замеряя их неделя за неделей в описаниях pull request'ов на GitHub.
Отсюда возникают две стратегии адаптации. Часть читателей меняет исходную презумпцию на "считать сгенерированным, пока не заявлено обратное". Это рациональный ответ на ненадёжность детектора, но он обвиняет любого честного автора, который не догадался прикрепить дисклеймер. Другие полагаются на программы-детекторы, что лишь переносит проблему на следующий уровень.
Порочное равновесие
Главное неприятное следствие и причина, почему этой теме нужна отдельная страница: когда детектор использует качество как индикатор машинного авторства, единственный способ доказать человечность - писать хуже.
Наглядный пример Чжаня: подробный, хорошо оформленный пост на сабреддите был автоматически удалён как сгенерированный ИИ. Восстановить его удалось только после того, как автор снизил детализацию, убрал списки, заголовки и курсив и переписал всё так, "будто кто-то на скорую руку вывалил поток мыслей с телефона". Каждое из этих действий - намеренное снижение пользы текста в угоду машине. Если эта практика станет повсеместной, детекция ИИ приведёт к тому, что публичные тексты людей станут более плоскими, короткими и неструктурированными, тогда как выдача моделей, которой ничто не мешает быть вылизанной, сохранит всё форматирование.
Это обратная сторона проблемы из llm-as-average-democratizer. Там дешёвый правдоподобный текст поднимает нижнюю планку, из-за чего вложенные усилия перестают быть заметны. Здесь же попытка восстановить сигнал об усилиях по внешним признакам активно опускает верхнюю планку.
Почему выход - в раскрытии, а не в улучшении детекции
Обе стороны кластера страниц о раскрытии авторства в этой вики приходят к одному и тому же выводу с противоположных сторон: интересующее вас свойство (как это было сделано?) отсутствует в самом артефакте, поэтому никакое вычитывание текста не позволит его восстановить. slop-marker-convention опирается на то, что автор открыто заявляет о машинном происхождении, human-made-disclosure - на заявление о полностью человеческом авторстве, а credibility-as-slop-test - на репутацию автора. Ни один из этих подходов не пытается чинить детектор, потому что починить его невозможно: он классифицирует текст по признакам, которые не несут информации о процессе создания.
checking-for-human-writing идёт ещё дальше и утверждает, что сам вопрос о детекции изначально был неверным. Набирал ли слова человек своими руками - это проверка тела, а не разума. А свойства, которые действительно важно знать о тексте (кто придумал идеи, кто решил оставить именно эти формулировки, кто способен их защитить), никогда и не были поверхностными признаками.
Связанные страницы
- no-ai-statements - исходный пример и история с сабреддитом
- human-made-disclosure - ответная реакция
- credibility-as-slop-test - та же посылка о неинформативности формы, но другое решение
- readme-not и slop-marker-convention - декларация машинного авторства со стороны создателя
- ai-comment-classifier - откалиброванный детектор для комментариев к коду, демонстрирующий цифрами двусторонний сбой в одном узком жанре: только 73% заведомо написанных человеком комментариев были признаны человеческими
- Agents as first-class identities
- Better AI Code Comment Detector
- Anti-LLM Discourse
- The Whole Premise Of Checking For Human Writing Is Daft
- The Load-Bearing Vocabulary of Claude
- Credibility as the slop test
- Human-made disclosure
- "No AI" Statements Are Necessary and Useful
- READMENOT — a marker for code not meant for humans