EnglishРусский Map
Open-Source AI & Open Models Reading List

Миф о небезопасном open source ИИ

title
Миф о небезопасном open source ИИ
type
summary
summary
Обзор инцидентов от Флориана Бранда: злоупотребления ИИ в 2025-2026 годах шли через закрытые модели, за исключением генерации картинок
tags
ai, open-weights, ai-safety, security, llm
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Флориан Бранд опубликовал этот материал 10 июня 2026 года. Он берёт стандартный аргумент против открытых моделей - о том, что после релиза их невозможно контролировать и можно дообучить под любые задачи, - и принимает его как верный в теории. Но он возражает против скрытой в нём предпосылки: будто закрытые модели безопаснее, их ограничения надёжны, а провайдеры пресекают злоупотребления. Чтобы проверить это, он изучил независимые отчёты по киберугрозам о реальных инцидентах и составил список использованных моделей. Список литературы по открытому ИИ Нейтана Ламберта резюмирует вывод: защитные механизмы закрытых моделей "регулярно обходят, что порождает массу реальных рисков от ИИ задолго до того, как проявились гипотетические риски открытых весов".

Метод

Бранд намеренно отказался от бенчмарков. Злоумышленники обходят ограничения способами, которые бенчмарки не измеряют, а многие тесты по кибербезопасности поощряют новые эксплойты, тогда как "реальный мир работает на устаревшем ПО". Он использовал отчёты компаний по безопасности, не имевших привилегированного доступа к логам какого-либо провайдера, поскольку собственный отчёт лаборатории видит только её платформу. Сам автор прямо называет очевидное ограничение: трудно понять, когда и как применяются открытые модели, так как локальный запуск не оставляет следов у провайдера. Он также указывает, что поиск вёлся через ChatGPT и Gemini на максимальных настройках, а сам отчёт он написал вручную.

Инциденты

В списке кибератак доминируют агентские закрытые инструменты. Во время взлома мексиканского правительства с декабря 2025 по февраль 2026 года один оператор с помощью claude-code и GPT-4.1 через API выгрузил 195 миллионов записей налогоплательщиков. Защиту Claude обошли через файл AGENTS.md, и модели выполнили большую часть связывания эксплойтов в цепочки при минимальных подсказках человека - как во время внедрения Anthropic механизма Constitutional Classifiers++, так и после. Сканер Bissa массово эксплуатировал известные уязвимости вроде React2Shell с помощью Claude Code и OpenClaw на Claude Sonnet 4.6, похищая данные, API-ключи и файлы. Одиночный злоумышленник скомпрометировал сотни плохо настроенных шлюзов FortiGate с помощью Claude и deepseek в связке со скриптами. Вредоносное ПО PromptSpy для Android использовало Gemini как агента управления компьютером, чтобы заблокировать пользователя во вредоносном приложении. Оно требовало установки в обход магазина (sideloading) и не привело к реальному ущербу, но показало вектор развития таких агентов. Patriot Bait - русскоязычный хакер, который использовал Gemini CLI (обошедший защиту через файл GEMINI.md), чтобы выдавать себя за американского ветерана, распространять дезинформацию, устраивать схемы pump-and-dump, взламывать сайты на WordPress и красть учётные данные. Северокорейские хакеры использовали генерацию изображений в ChatGPT для подделки южнокорейских удостоверений личности в целевом фишинге.

Открытые модели встречаются реже. Сервис EvilTokens (фишинг как услуга) использовал GPT-4o-mini для перевода писем, а Llama 3.1 8B и Llama 3.3 70B - для их анализа и выбора уязвимых к социальной инженерии целей. Ограничения Llama обошли через обычный промпт. В кампании LameHug, обнаруженной CERT Украины в середине 2025 года, группировка APT28 использовала Qwen2.5-Coder-32B-Instruct для генерации вредоносных команд прямо во время выполнения на машинах жертв. Модель имеет открытые веса, но злоумышленники вызывали её через API инференса Hugging Face. Так что даже в этом случае с открытой моделью использовался хостинговый эндпоинт, за которым в теории можно было следить.

Что касается дезинформации, сеть Pravda распространяет прокремлёвский и проиранский контент, который затем подхватывают в качестве источников ChatGPT, Claude, Gemini, Grok и DeepSeek. Бранд включил этот пример, несмотря на отказ от бенчмарков, потому что NewsGuard фиксирует рост эффективности этой схемы со временем. Сеть CopyCop (Storm-1516) ведёт сотни сайтов фейковых новостей и, судя по всему, использовала модель Llama 3.1 8B без цензуры. Генератор изображений Grok выдавал откровенные изображения, включая несовершеннолетних, а также нацистскую и игиловскую пропаганду, причём в отчёте Reuters за февраль 2026 года отмечалось, что это продолжалось и после ужесточения правил.

Исключение составляют материалы с сексуальным насилием над детьми (CSAM) и порнография. В этой сфере дообученные открытые модели генерации изображений и видео, а также адаптеры LoRA стали нормой, причём нарушители советуют друг другу избегать закрытых моделей из-за логирования запросов. Бранд называет отчёт Internet Watch Foundation "весьма разоблачающим", а сама IWF отмечает, что видит лишь часть проблемы.

Аргументация

Бранд делает вывод: закрытые модели служат главным инструментом для злоумышленников, если не считать дипфейков и CSAM. Ограничения всех ведущих лабораторий, включая передовые frontier-модели, снимаются одним промптом или файлом конфигурации. Его объяснение кроется в стимулах: "Зачем тайно покупать сотни GPU, собирать кучу данных и нанимать исследователей нужной квалификации для дообучения менее способной модели под одну задачу, если можно просто добавить файл CLAUDE.md к передовой модели и взламывать государственные системы?" Злоумышленники выбирают закрытые модели, потому что те находятся на фронтире возможностей или их проще развернуть.

Он также ставит под сомнение единственное реальное преимущество закрытых моделей - возможность отзыва. Ни одна модель не была отозвана. Тренд направлен на то, чтобы быстрее поставлять более мощные модели большему числу клиентов, а совершённое злоупотребление уже нельзя отменить. Провайдер может лишь задним числом ужесточить классификаторы или тихо ослабить модель.

Он ожидает контраргумент о том, что такой подход смотрит только в прошлое, и называет его "удобной позицией, поскольку её невозможно опровергнуть фактами". Те же предостережения звучали в адрес ChatGPT, GPT-4, o1, Sonnet 3.6 и Opus 4.5. Каждый раз открытые модели догоняли их за малую долю стоимости, а фронтир реальных злоупотреблений оставался за закрытыми системами. Он не видит "никаких признаков того, что с Mythos или Fable всё будет иначе".

Связь с другими материалами

Именно с этой последней фразой напрямую спорит статья a-safe-path-to-open-weights. Спустя месяц Thinking Machines приводит способность Mythos Preview автономно писать эксплойты как причину, по которой бесконтрольный релиз небезопасен. Данные Бранда не могут разрешить этот спор. Они охватывают модели вплоть до начала 2026 года, тогда как аргумент Thinking Machines касается возможностей, которые ещё не успели распространиться в открытые веса. Обе работы также по-разному оценивают уровень злоумышленников: Бранд описывает ленивого атакующего, выбирающего простейший передовой инструмент, тогда как концепция поэтапного релиза строится вокруг возможностей, где защитникам необходимо временное преимущество.

Этот обзор служит эмпирическим четвёртым шагом в рамках оценки маржинального риска из societal-impact-of-open-foundation-models, где предостерегали от предположения, будто закрытые релизы безопасны по умолчанию. Вывод относительно CSAM совпадает с единственным вектором, где статья 2024 года также нашла веские доказательства рисков открытых моделей. В national-ai-cybersecurity-policy аналогичная мысль высказывается со стороны защиты: ущерб зависит от соотношения сил атакующих и защитников, а не от баллов конкретной модели в бенчмарках. Отчёт anthropic-threat-report-september-2026 - пример документа от самой лаборатории, на которые Бранд решил не опираться.

Два ограничения остаются без внимания. Отсутствие в сторонних отчётах - слабый аргумент относительно локального использования открытых моделей, которое расследователи видят реже всего в силу самой его природы. Бранд признаёт эту сложность, но всё равно трактует полученную статистику как показатель распространённости. Кроме того, список просто считает число инцидентов без учёта их масштаба, поэтому концепт приложения, требующего установки в обход магазина, стоит в одном ряду с утечкой 195 миллионов записей. Аргументы против надёжности ограничений закрытых моделей убедительны. Тезис же о безопасности открытых моделей держится в основном на том, как редко они попадают в поле зрения.