EnglishРусский Map

Характерная лексика Claude

title
Характерная лексика Claude
type
summary
summary
Луи Абрахам кластеризовал описания PR на GitHub: один кластер вырос с 0,7% до 39% к середине 2026 года во главе со словами "load-bearing" и "quietly"
tags
ai-writing, claude, github, clustering, llm
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Луи Абрахам (Louis Abraham) ежедневно берёт выборку примерно из 1000 pull request'ов на GitHub и группирует их описания по используемым словам - без разметки и заранее заданного списка подозрительных слов. Одна из групп появилась в 2026 году и продолжила расти, а самые характерные для неё слова читаются как расшифровка сессии Claude: quietly, nobody, plainly, re-derived, halves, outright, load-bearing, survived, rests, mutation-checked. На странице этот кластер назван "the load-bearing vocabulary of Claude" load-bearing-vocabulary-claude.

Сохранённая страница представляет собой готовый дашборд и содержит минимум текста: объём корпуса на момент снимка (609 дней, 473 669 pull request'ов, 53 976 283 слова), выбранное на панели слово и общий список слов. Выбранным словом было quietly - оно встречалось внутри кластера в 36,43 раза чаще, чем за его пределами (на пике 86 вхождений на миллион слов против 14 на миллион по всему корпусу). Описанная ниже методика взята из README проекта по адресу https://github.com/louisabraham/load-bearing, который не сохранён в sources/.

Как устроены измерения

Воспользоваться GH Archive не удалось. С середины 2025 года в публичной ленте событий практически ничего нет, кроме push-событий, не содержащих текста; более ранняя версия проекта на базе GH Archive недоучла load-bearing в 158 раз. Вместо этого сборщик использует поисковый API GitHub: десять пятиминутных окон в день, по одному случайному окну из каждого 2,4-часового интервала, с привязкой псевдослучайного генератора (seed) к дате для воспроизводимости корпуса. Четыре бота-приложения и пустые описания отсекаются прямо в поисковом запросе. Аккаунты, чей логин указывает на бота, исключаются, одинаковые наборы слов в пределах одной недели объединяются, и ни один автор не может внести более трёх описаний в неделю. Слово попадает в словарь только после того, как его использовали 50 разных аккаунтов, поэтому load-bearing (848 аккаунтов) сохраняется, а термин, встретившийся 242 раза у двух аккаунтов, отбрасывается.

В основе лежит k-means с дивергенцией Кульбака - Лейблера (KL) вместо квадрата расстояния: каждый из десяти "стилей написания" представляет собой распределение вероятностей по словам, а каждое описание относится к ближайшему из них. В процессе обучения модели параметр времени не учитывается, так что любой рост во времени обусловлен распределением описаний по кластерам, а не какими-либо изначальными предположениями модели. На момент снимка в README (данные до 2026-08-17) доля одного компонента выросла с 0,7% описаний в начале 2025 года до 39% к середине 2026 года и продолжала расти примерно на 1,2 процентных пункта в неделю. Слова ранжируются по отношению частоты внутри компонента к частоте снаружи с использованием псевдоотсчётов (pseudo-count), чтобы редкие слова случайно не возглавили список. Слово load-bearing встречается 929 раз внутри кластера и 82 раза снаружи (в 39 раз чаще) и находится на самой вершине.

Автор открыто говорит о слабых местах. Значение K = 10 было выбрано по результатам: при значении меньше десяти компонент смешивается с посторонней лексикой, а выше четырнадцати - распадается на части. Начальное значение генератора случайных чисел (seed) влияет на итоговую цифру. Однократное безусловное обучение находит этот растущий компонент в 31 прогоне из 32. Тот же алгоритм работает и как наивный байесовский классификатор (опубликован как detector.html), о котором в README сказано: "он может сказать, что текст написан в стиле этого кластера, но никогда - кто именно его написал".

О чём говорит название

Сам метод никак не определяет, какие описания были сгенерированы LLM. В корпусе нет аккаунтов ботов, поэтому все эти описания опубликованы под профилями людей, а их привязка к Claude - это интерпретация лексики и динамики её появления. Страница ссылается на одно косвенное подтверждение: issue anthropics/claude-code#53454, открытый в апреле 2026 года пользователем Opus 4.7, у которого Claude Code начал использовать слово "load-bearing" в чате, документах и сообщениях коммитов и продолжал делать это даже после прямой просьбы прекратить. Это веское косвенное свидетельство, а не прямое измерение авторства: другие модели, обученные на схожих данных, могли бы писать так же.

Почему это важно для базы знаний

Это наглядно демонстрирует появление характерных речевых маркеров в публичном пространстве с замерами по неделям - именно то, что предсказывалось в ai-detector-arms-race: поверхностные маркеры меняются с каждым релизом моделей, поэтому фиксированный список быстро устаревает. В собственном списке базы знаний, tropes, слово "quietly" стоит на первом месте среди "магических" наречий, используемых для придания скрытой значимости; слов load-bearing, mutation-checked и re-derived там нет, и появление этого кластера указывает на то, что их пора включить в следующую ревизию. Эту базу знаний ведёт Claude Code, и не менее 25 страниц в wiki/ уже используют "load-bearing", так что эта лексика присутствует и в тексте самого vault'а.

Этот подход стоит в одном ряду с ai-comment-classifier, где на основе публичных данных строился калиброванный классификатор комментариев к коду ("человек или LLM"). Отличие в том, что здесь разметка отсутствует вовсе. Чего этот метод не может решить, так это вопроса, который в credibility-as-slop-test и checking-for-human-writing называют подлинной сутью проблемы: описание, написанное с использованием этой лексики, всё равно может быть точным и проверенным человеком, который его отправил. В контексте же код-ревью это даёт конкретное число для проблемы agent-principal-agent-problem: сигнал о приложенных усилиях, который раньше несло в себе описание pull request'а, теперь отсутствует более чем в трети из них.