О влиянии открытых базовых моделей на общество
- title
- О влиянии открытых базовых моделей на общество
- type
- summary
- summary
- Статья Капура, Боммасани и соавторов (2024): 5 свойств open-weight моделей и фреймворк маржинального риска, показавший неполноту исследований злоупотреблений
- tags
- ai, open-weights, ai-safety, policy, paper, llm
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- societal-impact-of-open-foundation-models
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Саяш Капур (Sayash Kapoor, Принстон) и Риши Боммасани (Rishi Bommasani, Стэнфорд) возглавили работу над этим программным докладом (position paper) от 27 февраля 2024 года, опубликованным на ICML вместе с 23 соавторами. Список авторов охватывает научные круги, гражданское общество и индустрию: Перси Лян (Percy Liang) и Арвинд Нараянан (Arvind Narayanan), Стелла Бидерман (Stella Biderman) и Авия Скоурон (Aviya Skowron) из EleutherAI, Ясин Жернит (Yacine Jernite) из Hugging Face, Жоэль Пино (Joelle Pineau) из Meta, Стефано Маффулли (Stefano Maffulli) из Open Source Initiative, Алондра Нельсон (Alondra Nelson). Статья писалась в то время, когда Министерство торговли США готовило отчёт о "базовых моделях с широкодоступными весами", запрошенный президентским указом в октябре 2023 года, а в европейском AI Act для открытых моделей вводилось частичное исключение.
Главный вклад статьи - понятийный аппарат. Споры о том, что лучше - открытые или закрытые модели, зашли в тупик, поскольку стороны принимали за доказательства совершенно разные вещи. Авторы разбивают вопрос на два шага: что именно отличает открытые модели и как эти свойства трансформируются в преимущества и риски.
В списке литературы open-source-ai-reading-list Нейтана Ламберта статья охарактеризована как "ранняя работа о маржинальных рисках, показавшая, что текстовые LLM крайне незначительно увеличивают задокументированные потенциальные риски моделей". Это сформулировано чуть категоричнее, чем в самой статье. Её вывод заключается в том, что существующие исследования были недостаточны для оценки маржинального риска по большинству векторов злоупотреблений. Для одного сценария в сфере кибербезопасности риск был оценён как низкий. Для одного сценария с изображениями - как значительный.
Пять отличительных свойств
В статье открытая базовая модель определяется узко - как модель с широкодоступными весами. Выпуск чего-либо ещё не требуется, а ограничения на использование допускаются. Это соответствует формулировкам президентского указа и оставляет за скобками вопросы данных и лицензирования, которые в gradient-of-generative-ai-release рассматриваются как непрерывный спектр. Такая дихотомия - осознанное упрощение: большинство аргументов о рисках упираются в потерю контроля разработчиком после публикации весов, поэтому граница проведена именно так.
Из этого вытекают пять свойств. Доступ шире, так как ограничения для пользователей трудно контролировать на практике: веса LLaMA 1 быстро утекли после закрытого исследовательского релиза в марте 2023 года. Возможности кастомизации выше: квантование, fine-tuning и прунинг работают напрямую с весами, а дообучение позволяет снять защитные настройки выравнивания (alignment), хотя у закрытых моделей с API для fine-tuning'а есть та же проблема. Инференс может быть локальным, благодаря чему конфиденциальные данные в медицине или финансах не попадают третьим лицам. Доступ невозможно отозвать, поскольку уже скачанные копии остаются на руках, даже если разработчик и платформы хостинга прекратят дистрибуцию. И слабый мониторинг: разработчик по умолчанию не видит инференс, хотя специализированные хостинг-провайдеры моделей могли бы взаимодействовать в вопросах модерации.
Преимущества с оговорками
Каждое преимущество сопровождается указанием на его ограничения, что и отличает статью от неприкрытой агитации.
Открытые веса лишают одного конкретного разработчика монополии на определение допустимого поведения модели, поскольку сторонние разработчики могут её перенастроить. Они способствуют инновациям, позволяя адаптировать модели локально на проприетарных данных. В противовес этому разработчики открытых моделей лишены обратной связи от пользователей и логов взаимодействия, которые собирают создатели закрытых систем, а глубокая кастомизация фрагментирует использование и лишает эффекта масштаба. Они полезны для науки: исследования в области интерпретируемости, безопасности и защищённости требуют доступа к весам, а воспроизводимость страдает, когда разработчики закрытых моделей выводят их из эксплуатации. Но одни лишь веса не отвечают на многие исследовательские вопросы. Изучение распространения смещений (bias) или даже проверка бенчмарка на утечку данных из обучающей выборки (contamination) требуют доступа к обучающим данным, а их включают лишь немногие открытые релизы. pythia-suite-for-analyzing-llms и olmo - исключения, которые авторы имеют в виду. В статье приводится Foundation Model Transparency Index за 2023 год, где создатели открытых моделей оказались прозрачнее разработчиков закрытых, однако подчёркивается: веса делают прозрачность возможной, но не гарантируют её.
Аргумент о конкуренции подан через проблему монокультуры: зависимость множества приложений от одной модели создаёт риск коррелированных сбоев, что авторы иллюстрируют уязвимостями Meltdown и Spectre. Открытые модели снижают концентрацию на уровне самих моделей, хотя и не решают проблему на более ранних этапах цепочки - в вычислительных мощностях и чипах. В статье количественно оценён входной барьер: обучение Llama 2 потребовало 3.3 миллиона GPU-часов A100-80GB, что составляло около 6 миллионов долларов по облачным тарифам февраля 2024 года ($1.80 за GPU-час).
Фреймворк маржинального риска
Основная часть статьи посвящена шестиэтапному фреймворку, адаптированному из моделирования угроз в компьютерной безопасности. Главный вопрос: какой дополнительный риск создают открытые модели по сравнению с тем, что уже существует - закрытыми моделями, веб-поиском и прежними инструментами.
- Идентификация угрозы: определить вектор злоупотребления, способ его реализации и субъекта атаки, поскольку у хакера-одиночки и спецслужбы ресурсы принципиально разные.
- Существующий риск: какой объём подобного вреда уже наносится без участия открытых моделей.
- Существующие механизмы защиты: спам-фильтры, законы против распространения CSAM, экспортный контроль и правила закупок.
- Доказательства маржинального риска: что именно открытые модели добавляют сверх шагов 2 и 3. Открытая модель, пересказывающая Википедию, добавляет мало. Дообучение модели для генерации интимных изображений конкретного человека добавляет много.
- Простота защиты от новых рисков: средства защиты адаптируются, и модели могут помочь в их создании.
- Неопределённость и допущения: динамика роста возможностей, стоимость инференса, скорость адаптации атакующих.
Затем авторы оценили по этому фреймворку семь предшествующих исследований, по одному на каждый вектор злоупотребления: целевой фишинг (Hazell), кибербезопасность (Seger et al.), дезинформация (Musser), биобезопасность (Gopal et al.), клонирование голоса (Ovadya and Whittlestone), несогласованные интимные изображения (Lakatos) и CSAM (Thiel et al.). Шесть из семи оказались неполными. Приложение иллюстрирует повторяющийся пробел. Работа по биобезопасности вообще не проводит сравнения с информацией, уже доступной в сети, и не проверяет, сохраняются ли защитные механизмы закрытых моделей при джейлбрейках или дообучении. В исследовании по кибербезопасности создание вредоносного ПО описывается лишь в общих чертах, без указания конкретного атакующего и без доказательств того, что открытые модели сыграли роль хоть в одном инциденте. В работе по дезинформации оценивается удешевление генерации контента, но игнорируется тот факт, что дистрибуция - создание аккаунтов и обход поведенческой модерации - скорее всего, обходится дороже, чем написание текстов. Лишь исследование CSAM (Thiel et al., 2023) заполнило все шесть шагов. Оно показало, что менее 1% материалов CSAM на изученных форумах было фотореалистичным и сгенерированным на компьютере, что большая часть этого объёма происходила из производных Stable Diffusion, а водяные знаки для открытых весов к тому моменту уже научились обходить.
В статье подчёркивается, что неполнота не означает ошибочность. Просто сами по себе эти работы не доказывают, что открытые модели повышают риски для общества.
Два разобранных примера
В случае автоматизированного поиска уязвимостей авторы оценивают текущий маржинальный риск как низкий и видят несколько путей защиты, включая использование ИИ для обороны (на 5-м шаге фреймворка в качестве примера приводятся фаззеры кода на базе LLM). В приложении показано, как ChatGPT и Llama 2 одинаково успешно находят переполнение буфера в реальном бюллетене безопасности Zephyr USB: открытая модель не давала никаких возможностей, которых не было бы у закрытой. Для сгенерированных интимных изображений маржинальный риск значителен, а защита представляется сложной задачей. В приложении описывается, как пользователи легко обходили NSFW-фильтры Stable Diffusion после её открытого релиза в августе 2022 года и как на базе её производных распространялись созданные без согласия изображения реальных людей. Эти два примера подчёркивают тезис авторов: понятие "риск кибербезопасности" неоднородно. Поиск уязвимостей и создание вредоносного ПО требуют раздельного анализа, а дискуссии, сваливающие их в одну кучу, лишены конструктива.
Авторы прямо указывают на ограничения фреймворка. Он не сопоставляет маржинальный риск с маржинальной выгодой, поэтому не может служить регламентом принятия решений о релизе. Он не способен выявить принципиально неизвестные риски (unknown unknowns). Кроме того, он вскрывает проблемы координации, но не решает их: снижение риска NCII (несогласованных интимных изображений) потребовало бы совместных действий от разработчиков открытых моделей, социальных платформ и хабов вроде Civitai.
Рекомендации
Разработчикам следует прямо указывать, какие практики ответственного ИИ они внедряют сами, а какие оставляют на усмотрение тех, кто развёртывает модель дальше по цепочке, поскольку устоявшихся норм разделения ответственности за безопасность открытых моделей нет. Исследователям рисков стоит моделировать текущее положение дел (status quo) и полную цепочку злоупотреблений. Грантодателям следует обеспечивать независимость таких исследований от разработчиков. Регуляторам стоит воздержаться от вмешательства до тех пор, пока маржинальный риск не будет доказан, а также проверять, выполнимы ли предлагаемые требования для создателей открытых моделей в принципе. Безвиновная ответственность (strict liability) за последующее использование или требование обязательного нанесения водяных знаков к исходному разработчику практически нереализуемы, поскольку тот не может контролировать происходящее после релиза. Антимонопольным органам следует отслеживать, проявляются ли заявленные экономические преимущества на практике; британское ведомство CMA к этому уже приступило.
Как это выглядит в 2026 году
Эта статья стала базовой точкой отсчёта для последующих работ по безопасности. В a-safe-path-to-open-weights модель Inkling проверяется ровно по маржинальному критерию - добавляет ли она риск сверх существующих открытых моделей, - однако кибервозможности уровня Mythos приводятся как повод полагать, что вывод о низком риске поиска уязвимостей может уже не действовать для frontier-моделей. Это суждение на два года новее рассматриваемой статьи и относится к куда более мощным системам. В myth-of-unsafe-open-source-ai 4-й шаг фреймворка наполняется данными реальных инцидентов, показывая, что закрытые модели (которые авторы статьи предостерегали считать заведомо безопасными) как раз и служат источником большей части наблюдаемых злоупотреблений. Вывод по CSAM совпадает с единственным вектором, для которого в этой статье были найдены весомые свидетельства риска открытых моделей. Хелен Тонер (Helen Toner), отмеченная в благодарностях, позже в nonproliferation-is-the-wrong-approach-to-ai-misuse доказывала, что 5-й шаг - адаптация защиты - должен стать вообще единственной стратегией. Аргументы о пользе открытости, зависящие от доступа к обучающим выборкам, объясняют важность последующего аудита consent-in-crisis-ai-data-commons: Шейн Лонгпре (Shayne Longpre) и Кевин Клайман (Kevin Klyman) работали над обеими статьями.
Экзистенциальный риск и риск захвата контроля (takeover risk) авторы выносят в сноску, к тому же статья написана до появления агентных моделей. В ней не рассматривается вариант автономной работы открытой модели на протяжении многих часов - а именно в этом gpt-cyber-vm-escape и openai-huggingface-incident-autonomous-hacking видят основные киберугрозы 2026 года.
- Nathan Lambert on China's AI Ecosystem and the Open Model Gap
- A Safe Path to Open Weights
- The Arguments Against Open Source AI are Very Bad
- Consent in Crisis: The Rapid Decline of the AI Data Commons
- The Myth of unsafe Open Source AI
- We urgently need a coherent national AI cybersecurity policy
- Open Source AI is the Path Forward
- Open-Source AI & Open Models Reading List
- Why I build open language models