EnglishРусский Map
Open-Source AI & Open Models Reading List

Кризис согласия: стремительное сокращение открытых данных для ИИ

title
Кризис согласия: стремительное сокращение открытых данных для ИИ
type
summary
summary
Аудит 14 000 доменов из C4, RefinedWeb и Dolma: всплеск ограничений на AI-краулинг в 2023-2024 годах отрезает модели от лучших веб-данных
tags
ai, open-weights, data, crawling, policy, paper, llm
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Шейн Лонгпре (Shayne Longpre), Роберт Махари (Robert Mahari), Ариэль Ли (Ariel Lee) и Кэмпбелл Лунд (Campbell Lund) возглавили подготовку этой статьи инициативы Data Provenance Initiative (arXiv 2407.14933, июль 2024 года), над которой работали более сорока соавторов и консультантов, включая Стеллу Бидерман, Сару Хукер, Дафну Ипполито и Луиса Виллу. Это первый масштабный лонгитюдный аудит сигналов согласия на сайтах, лежащих в основе открытых обучающих корпусов для ИИ. В нём изучается, как часто сайты блокируют краулеры ИИ, насколько плохо они выражают этот запрет и какой именно контент оказывается заблокирован. Список open-source-ai-reading-list Нейтана Ламберта включает эту работу как документальное свидетельство "массового сокращения открытых данных - критического фактора, мешающего по-настоящему открытым исследованиям ИИ". Это единственный материал в разделе безопасности списка, который посвящён данным, а не злоупотреблениям (misuse).

Данные заканчиваются апрелем 2024 года, и все цифры на этой странице относятся к этой дате. Более новые механизмы выражения предпочтений по краулингу описаны в других местах vault'а и упомянуты ниже.

Что именно проверялось

Статья анализирует не сами датасеты, а сайты, на основе которых они собирались. Авторы взяли три открытых корпуса с разрешительными лицензиями, созданных на базе Common Crawl: C4 (выгрузка за апрель 2019 года, около 15,9 млн доменов), RefinedWeb (с 2008 по февраль 2023 года, 33,2 млн) и Dolma (с мая 2020 по июнь 2023 года, 45,2 млн). Из каждого отобрали топ-2000 доменов по количеству токенов - суммарно 3950 доменов, названных головной выборкой (head sample). Это "самый крупный, активно поддерживаемый и критически важный" материал. Случайная выборка из 10 000 доменов на пересечении всех трёх корпусов послужила хвостовой выборкой (tail sample); 2000 из них были размечены вручную. Асессоры с оплатой $25-30 в час классифицировали типы контента, назначение сайтов, наличие пейволлов, рекламы и условий использования (terms of service).

Для каждого домена команда собрала ежемесячные снимки главной страницы, robots.txt и страницы условий использования из Wayback Machine за период с января 2016 по апрель 2024 года. Файлы robots.txt классифицировали по отношению к краулерам семи "ИИ-организаций": Google, OpenAI, Anthropic, Cohere и Meta, а также Common Crawl и Internet Archive, чьи архивы переиспользуются для обучения. Токен считался "ограниченным" (restricted), если его домен полностью блокировал хотя бы одну из них. Условия использования классифицировались через пайплайн на базе LLM. Тренды прогнозировались на год вперёд с помощью моделей SARIMA.

Резкий рост ограничений за один год

В середине 2023 года около 1% токенов в трёх корпусах приходилось на домены, полностью блокировавшие хотя бы один ИИ-краулер. К апрелю 2024 года эта доля составила 5-7%. В головной выборке показатель вырос с менее чем 3% до 20-33%, что даёт относительный прирост свыше 500% для полных корпусов C4 и RefinedWeb и свыше 1000% для их головных частей. Эти цифры учитывают только полные блокировки; частичные ограничения увеличивают показатели ещё сильнее. В аннотации приводятся главные цифры: 5%+ всех токенов C4 и 28%+ наиболее критически важных источников C4 сейчас полностью закрыты через robots.txt, а 45% C4 подпадает под те или иные ограничения в условиях использования.

Хронология указывает на появление новых user agent'ов. Сдвиг произошёл сразу после запуска GPTBot от OpenAI и Google-Extended в 2023 году, в основном за счёт сайтов, которые раньше закрывали отдельные директории, а теперь перешли к полной блокировке. Главным драйвером стали новостные сайты: в головной выборке к апрелю 2024 года было полностью заблокировано почти 45% новостных токенов против 3% в 2023 году. Следом пошли форумы и соцсети. Условия использования менялись медленнее: от полного отсутствия страницы с правилами к пунктам о запрете краулинга, некоммерческом использовании и запрете конкуренции. Пункты, где генеративный ИИ упоминается явно, массово появились только в 2024 году. На практике краулеры в основном игнорируют условия использования, но эти правила дают сайтам юридические основания для претензий.

Прогноз на апрель 2025 года предполагал блокировку через robots.txt ещё 2-4% токенов полных корпусов и 7-11% токенов головной выборки, а также рост ограничений в условиях использования на 6-10%.

Согласие выражается некорректно

Стандарт robots.txt появился в 1995 году и был кодифицирован в 2022-м. Он позволяет сайту указать, кому разрешён краулинг, но не для каких целей. В статье показано несколько причин, почему этот механизм даёт сбой.

Блокировки распределены по разработчикам крайне неравномерно. В головной выборке C4 краулер OpenAI был заблокирован для 25,9% токенов, краулеры Anthropic и Common Crawl - для 13,3%, Google-Extended - для 9,8%, Cohere - для 4,9%, Meta - для 4,1%, Internet Archive - для 3,2% и Google Search - для 1,0%. При условии, что сайт блокирует хотя бы одну ИИ-организацию, OpenAI блокировали в 91,5% случаев, а Meta - в 52,2%. Авторы объясняют это тем, что владельцы сайтов не знают полного списка агентов для блокировки, что на практике даёт преимущество менее известным разработчикам.

Сайты также блокируют несуществующих агентов. 4,5% сайтов запретили доступ anthropic-ai или Claude-Web - user agent'ам, которые Anthropic не признаёт своими, - оставив при этом открытым доступ для задокументированного краулера ClaudeBot.

Кроме того, сигналы противоречат друг другу. В головной выборке C4 35,1% токенов приходилось на сайты с запретом сбора данных в правилах, но без ограничений в robots.txt, а 20,3% - на сайты с ограничительным robots.txt и без условий использования. Сайты, чьи правила запрещают только коммерческое использование, часто полностью блокируют краулеры, что попутно отрезает от данных и академических исследователей.

Некоторые разработчики, судя по всему, обходят отказы (opt-outs), разделяя краулинг во время инференса и краулинг для обучения. OpenAI - одна из немногих компаний, которая разделила эти задачи: GPTBot используется для обучения, а ChatGPT-User - для поиска в реальном времени. Авторы статьи полагают, что создатели контента будут воспринимать незарегистрированные поисковые краулеры как нарушение самой сути запрета.

Какой контент блокируется

Голова и хвост веба кардинально различаются. Головная часть на 72,9% состоит из новостей, форумов и энциклопедий, тогда как случайный хвост на 97% представляет собой личные сайты и страницы организаций, блоги и интернет-магазины. Голова также гораздо сильнее монетизирована: реклама (+47,5 процентного пункта) и пейволлы (+24,1), а также значительно более мультимодальна: видео (+39,8) и аудио (+38,4). Именно на неё приходится больше всего ограничений: robots.txt +22,5, условия использования +35,3. Краулер, соблюдающий эти сигналы, в первую очередь теряет самые свежие, качественно отобранные и мультимодальные источники, а его данные смещаются в сторону устаревшего контента и длинного хвоста корпоративных страниц.

Затем в статье сопоставляются обучающие данные и реальное использование чат-ботов на основе 1000 диалогов из WildChat (публичный лог бесед с GPT-3.5 и GPT-4, собранный через Hugging Face Space), размеченных с помощью GPT-4o. Новости составляют почти 40% токенов головной выборки C4, но занимают менее 1% в диалогах. Литературное творчество и ролевые игры составляют более 30% диалогов, но редко встречаются в веб-данных. Сексуальный ролевой контент занимает 12% диалогов, тогда как деликатный контент составляет менее 1% доменов головной выборки, поскольку все проверенные корпусы его отфильтровывают. Авторы упоминают возможное юридическое следствие в рамках доктрины добросовестного использования (fair use): чат-боты могут не конкурировать с большинством источников своего обучения напрямую, однако сразу же предостерегают от далеко идущих выводов. Пользователи WildChat, вероятно, более технически подкованы, чем средняя аудитория, а сама таксономия достаточно грубая.

Основной тезис

Если эти ограничения будут соблюдаться (как утверждают многие разработчики) или принудительно исполняться, объём, разнообразие, свежесть и репрезентативность качественных данных для предобучения сократятся, что повлияет на законы масштабирования данных (data scaling laws). Издержки лягут не только на коммерческие лаборатории. Сайты, которым лень перечислять каждого ИИ-агента, блокируют всё с помощью маски (*) либо перекрывают доступ Common Crawl и Internet Archive, чтобы данные не достались тем, кто скачивает их архивы. При этом данные архивы служат академическим и некоммерческим исследованиям далеко за пределами ИИ; Common Crawl цитируется более чем в 10 000 научных работ. Статья называет такие группы "вторичными жертвами" конфликта между создателями контента и коммерческими разработчиками. Авторы ожидают, что небольшие издатели начнут закрывать контент авторизацией и пейволлами.

Предлагаемое решение - протокол, выражающий цель использования, а не идентичность агента: разрешение поиска, или некоммерческого ИИ, или ИИ с обязательной атрибуцией источников, плюс временные ограничения, позволяющие новостным сайтам защитить свежесть материалов. На странице agent-readiness в vault'е описано одно из предложений такого рода - расширение Content-Signal для robots.txt, позволяющее сайту раздельно разрешать search, ingest или train. Заявление об этике в статье составлено аккуратно. Администраторы сайтов не всегда точно представляют интересы правообладателей, особенно на платформах с пользовательским контентом. Авторы не утверждают, какие именно сигналы должны быть юридически обязательными, и отмечают встречный аргумент о "праве читать и учиться" (right to read and learn) на материалах открытого веба.

Почему статья включена в список литературы по открытым моделям

Взгляд Ламберта сфокусирован на открытых исследованиях, и этический раздел статьи указывает на то же самое: правила получения согласия определят, "какие типы организаций смогут собирать достаточно данных для сохранения конкурентоспособности". Полностью открытый проект, такой как olmo, обязан публиковать свой обучающий корпус, поэтому любое ограничение, которое он соблюдает или игнорирует, оказывается на виду. Dolma, один из трёх проверенных корпусов, как раз принадлежит OLMo. В статье societal-impact-of-open-foundation-models, среди авторов которой были Лонгпре и Кевин Климан (Kevin Klyman), утверждалось, что открытые данные - необходимое условие для большей части научной ценности открытых моделей, и этот аудит фиксирует ухудшение ситуации. Взгляд со стороны разработчиков на ту же проблему изложен в why-i-build-open-language-models.

Другая сторона конфликта показана в llm-enshittification, где разработчик Gentoo описывает, как скраперы для LLM игнорируют robots.txt и нагружают Bugzilla проекта Gentoo, словно "постоянная DDoS-атака". Количественная картина из статьи и это свидетельство от первого лица сходятся: сайты вводят блокировки в ответ на реальное поведение краулеров. При этом статья намеренно не даёт оценки тому, насколько эти блокировки оправданы.