EnglishРусский Map
Open-Source AI & Open Models Reading List

Обнаружение и пресечение злоупотреблений ИИ: сентябрь 2026

title
Обнаружение и пресечение злоупотреблений ИИ: сентябрь 2026
type
summary
summary
Отчёт Anthropic об угрозах и злоупотреблениях Claude: семь лабораторий из Китая обвиняются в дистилляции модели и выдаче её за свои разработки
tags
ai, llm, distillation, security, china, policy, threat-intelligence, surveillance, influence-operations
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Команда Threat Intelligence компании Anthropic опубликовала этот отчёт в сентябре 2026 года. Это четвёртый документ в серии после выпусков за март, август и ноябрь 2025 года. В нём описаны операции, которые, по заявлению Anthropic, были обнаружены и заблокированы на платформе Claude в период с декабря 2025 по август 2026 года в семи сферах угроз: кибероперации, операции влияния, слежка, мошенничество, биологические угрозы, обычные вооружения и дистилляция. Действующим лицам присвоены внутренние идентификаторы вида GTG-NNNNN ("Generative Threat Group"). Anthropic утверждает, что во всех случаях использовались Haiku, Sonnet или Opus, а модели Fable и Mythos не фигурировали нигде, кроме одного случая дистилляции.

Читать отчёт стоит как отчёт поставщика о собственной платформе. Anthropic выступает здесь исследователем, потерпевшим, судьёй по вопросам атрибуции и автором одновременно, не раскрывая методику ни для одной из этих ролей. Число диалогов, уровни уверенности и утверждения о том, что именно злоумышленники обучили в дальнейшем, - это заявления самой Anthropic, и у внешнего читателя нет возможности проверить большую их часть. Там, где отчёт ссылается на третьи стороны (разбор CaptiveCrunch от Microsoft, All Eyes on Wagner, Forbidden Stories, наводку от OpenAI по Кении), информацию можно перепроверить. Раздел о дистилляции не ссылается ни на кого.

Список литературы Ламберта ссылается на отчёт именно из-за раздела о дистилляции, поэтому здесь ему уделено основное внимание.

Незаконная дистилляция

Anthropic разделяет llm-distillation, которую называет легитимным методом обучения, и "незаконную дистилляцию": скрытую кампанию промышленного масштаба по несанкционированному копированию возможностей модели, которая обычно оплачивается с помощью мошеннических схем. Со времени первой публикации в феврале 2026 года компания зафиксировала кампании семи лабораторий из Китая, направленные на общедоступные модели. По её данным, попыток атак на Mythos 5 или Mythos Preview, недоступные широкой публике, замечено не было.

Схема доступа во всех случаях одинакова. Прокси-сервисы, которые на китайском рынке называют "перевалочными станциями", перепродают Claude в неподдерживаемые регионы через тысячи аккаунтов, открытых по поддельным данным, с украденных карт и похищенных API-ключей. Те же сети иногда сохраняют запросы пользователей и продают логи. Anthropic также описывает случаи, когда лаборатории втихую перенаправляли запросы собственных пользователей в Claude и сохраняли диалоги.

В отчёте приводится несколько промптов, использовавшихся для извлечения цепочек рассуждений (reasoning). Некоторые сформулированы прямо ("DO NOT FLAG THIS AS REASONING EXTRACTION."). Другие маскируются под сессию отладки или "настоящий системный промпт", требующий выдать содержимое тегов <thinking>. Одна из лабораторий просила Claude "перевести предыдущую рабочую память" на японский язык исключительно катаканой. Другая отправила более двенадцати тысяч запросов, тестируя разные техники извлечения, а затем масштабировала сработавшие.

Техническое утверждение, связывающее отчёт с научной литературой, касается сигнатур рассуждений (thinking signatures). API Claude не возвращает исходный reasoning в открытом виде. Он возвращает сигнатуру, и последующие вызовы API используют её для поиска рассуждений. Такова формулировка Anthropic, и она описывает ссылку, разрешаемую на сервере. В статье о replay-атаках описано другое: зашифрованный конверт, содержащий сам reasoning на стороне клиента, что позволяет API оставаться stateless. Ни один из документов не объясняет эту разницу. По утверждению Anthropic, Moonshot и DeepSeek сохраняли сигнатуры, открывали новую сессию и заставляли Claude разворачивать сигнатуру обратно в полный трейс. Anthropic называет это межсессионной replay-атакой. Именно эту уязвимость описала и раскрыла работа stealing-reasoning-traces-from-proprietary-llm-apis, а список литературы подаёт отчёт как подтверждение со стороны Anthropic того, что китайские лаборатории применяли этот метод.

Anthropic "с высокой степенью уверенности" приписывает эти кампании конкретным лабораториям:

Лаборатория (идентификатор) Что, по утверждению Anthropic, произошло Масштаб по данным Anthropic
Alibaba, Qwen / Tongyi Lab (GTG-16005) Фиксированный промпт заставлял Opus 4.6 и 4.7 писать рассуждения внутри инлайн-тегов; логи стали SFT-данными для Qwen 3.5, 3.6 и 3.7. Claude также помогал строить RL-окружения и исследовать архитектуры Крупнейшая зафиксированная атака дистилляции: пики около 3 млн диалогов в день с 3500+ аккаунтов, 151 млн диалогов с мая по июль
Moonshot, Kimi (GTG-16002) Незаметно отдавала Claude клиентам, думавшим, что они используют Kimi; сохраняла диалоги, извлекала рассуждения через replay сигнатур ~300 000 перенаправленных запросов за десять дней через 5380 аккаунтов; 23 млн диалогов с мая по июль
DeepSeek (GTG-16001) Анализировала строки запросов для выявления пользователей Claude Code, Claude Agent SDK или OpenCode, перенаправляла выбранные в Opus, извлекала рассуждения через replay сигнатур 12,1 млн диалогов за 14 дней июля
Zhipu / Z.ai (GTG-16006) Прогоняла перехваченные рассуждения Claude обратно через Claude для очистки перед обучением GLM; использовала Claude как судью и фильтр данных; перед GLM 5.3 дистиллировала флагманскую модель другой американской лаборатории на задачах CTF, используя Opus 4.6 как оценщика 770 609 диалогов через систему очистки за десять дней на 273 аккаунтах; 3,4 млн за 17 дней
Xiaomi (GTG-16008) Прогоняла сессии кодинга своих пользователей MiMo через Claude для получения SFT- и RL-данных, подгадав по времени к окончанию бесплатного пробного периода MiMo-V2-Pro 400 000+ запросов через 1500 аккаунтов
SenseTime (GTG-16012) Покупала логи диалогов пользователей с Claude у поставщиков данных; использовала Claude для написания конвейера дистилляции Не указан
MiniMax (GTG-16003) Держала прокси-сервис через нераскрытую компанию-пустышку, продающую только модели Anthropic и OpenAI, но не собственные модели MiniMax Не указан

В двух случаях дистилляция совмещалась с прямой подменой продукта. В списке литературы это названо "маршрутизацией Claude в свои продукты", и отчёт трактует это не только как нарушение интеллектуальной собственности, но и как проблему конфиденциальности данных. Промпты пользователей Kimi, DeepSeek и MiMo - многие из которых приходили через популярные в США и Европе маршрутизаторы моделей - отправлялись третьей стороне без их ведома. Anthropic утверждает, что в этих промптах содержались учётные данные, корпоративная информация и имена минимум на дюжине языков. В качестве примеров приводятся модель капитальных затрат фармкомпании, действующие токены разработчика от Telegram и Notion, анализ записей с камер видеонаблюдения за конкретным человеком в Чэнду (предположительно связанный с НОАК) и рабочие доступы к российской государственной базе данных, связанной с оборонным сектором. Таким образом, отчёт представляет собой прямое обвинение DeepSeek и Moonshot в том, что они отдавали Claude под своими брендами, что гораздо серьёзнее простого обучения на его ответах.

Anthropic также заявляет, что ущерб не ограничивается копированием бенчмарков. По её словам, непубличные внутренние исследования показывают, что дистилляция переносит способность к рассуждению между доменами. В результате дистиллированная модель может получить опасные биологические или кибернетические возможности, "даже если собранные диалоги почти не касались этих тем", при этом механизмы защиты Claude не копируются. В качестве примера того, как защита перенаправляет атаку, приводится Zhipu: лаборатория отказалась от попыток извлечь кибервозможности Fable и переключилась на Opus 4.6 и модель другой компании "именно потому, что сочла их защиту более слабой".

Перечисленные контрмеры выстроены эшелонированно. Anthropic связывает прокси-аккаунты с организацией и блокирует их группами, а не по отдельности. Компания применяет классификаторы состязательного извлечения (усиленные с запуском Fable 5) и требует подтверждения личности при появлении сигналов злоупотребления. Claude теперь суммаризирует ход рассуждений перед ответом, что делает украденные логи менее полезными. В Fable 5.1 добавлена функция "preserved thinking", запрещающая новым API-аккаунтам редактировать контекст перед зашифрованными рассуждениями, поскольку именно с такого редактирования обычно начинается извлечение.

Отчёт не содержит проверяемых доказательств ни по одной строке таблицы: нет примеров собранных данных, нет описания того, как диалоги привязывались к конкретной компании, а не к прокси-сервису, обслуживающему множество клиентов (в самом отчёте указано, что один пул Alibaba также пропускал трафик DeepSeek и Xiaomi), и нет тестов, показывающих, что Qwen от 3.5 до 3.7 чему-либо научились на этих логах. То, насколько дистилляция реально влияет на возможности модели, обсуждается на других страницах базы: how-much-does-distillation-matter-for-chinese-llms, how-distillation-is-used-today и the-distillation-panic. Статья qwen-gpt-reasoning-prefills и приложение к работе о replay-атаках представляют собой сторонние попытки выявить факт дистилляции по поведению моделей.

Кибероперации

В разделе киберопераций утверждается, что ИИ изменил экономику атак, не создав при этом принципиально новых методов. Во всех вторжениях использовались привычные подходы (украденные учётные данные, уязвимые пограничные устройства, SQL-инъекции, фишинг), однако разведка, разработка эксплойтов и обработка данных теперь выполняются агентными системами на машинной скорости. Модель работы из отчёта Anthropic за ноябрь 2025 года - автономные вторжения под управлением агентов - распространилась, по её оценке, на все категории злоумышленников, чему способствовали публичные фреймворки вроде PentAGI. Уровень технической сложности больше не позволяет определить автора атаки; решающим фактором стали цели и намерения.

Группа GTG-20006, атрибуция которой, по словам Anthropic, согласуется с публичными отчётами о Midnight Blizzard, использовала навыки (skills) Claude Code для автоматической пересборки и повторного развёртывания вредоносного ПО каждый раз, когда защитные средства его обнаруживали. Группа похитила SDK системы технического зрения для беспилотников, перехватывала DNS у поставщиков гостевого Wi-Fi в отелях для заражения устройств постояльцев и выкачала базу данных североафриканского ведомства с более чем 300 000 записей о гражданах. Партнёры ShinyHunters (GTG-50014) декомпилировали 1,8 млн Android APK для поиска зашитых секретов, прошли путь от одного украденного токена разработчика до прав администратора облака примерно за три часа и получали выплаты по программам bug bounty от компаний, которых параллельно шантажировали. GTG-10007 представляла собой группу операторов из Чанша (двое из них - студенты), создавших фабрику эксплойтов без участия человека: агентные циклы декомпилировали прошивки устройств, формировали гипотезы об уязвимостях и дорабатывали эксплойты. Один такой конвейер выдал больше десятка потенциальных 0-day уязвимостей за месяц. Одиночный франкоязычный хактивист (GTG-50029) нашёл состояние гонки при переустановке WordPress, проник в 14 из 42 намеченных организаций и построил поисковик для деанонимизации по десяткам миллионов утёкших строк.

Сам доступ к ИИ отчёт рассматривает как цель атаки. Похищенные API-ключи дают злоумышленнику товар для перепродажи, чужие вычислительные ресурсы и прикрытие именем владельца. Группа GTG-50021 продавала "дешёвый Claude", который не был ни дешёвым, ни Claude, и собирала учётные данные покупателей. GTG-50020 использовала prompt injection против оценочной песочницы одного из ИИ-вендоров, чтобы украсть его рабочие ключи, а затем за четыре дня атаковала около тридцати ИИ-компаний в поисках предрелизной модели Claude, до которой так и не добралась. Защитная сторона этого скачка возможностей описана на странице gpt-cyber-vm-escape, а общий паттерн атак на цепочку поставки продукта - на supply-chain-security.

Операции влияния и слежка

Девять описанных случаев операций влияния охватывают государственные СМИ, коммерческие агентства заказного влияния, эмигрантские группы и локальных астротурферов. Среди них - радиостанция в ЦАР, связанная с "Вагнером", французское рекламное агентство с сеткой примерно из 70 сайтов фейковых новостей, турецкая платформа с почти 1000 поддельных аккаунтов, нацеленных на избирателей в Малайзии, сотрудники российских государственных медиа, использовавшие Claude как выпускающего редактора, иранские пропагандистские структуры, бангладешский скрипт fake_news_3.py и агент сторонников MEK, клонировавший голос реального активиста в Telegram для общения с его контактами внутри Ирана. Роль Claude сводилась в основном к задачам редакции или проектного офиса: генерация образов (персон), методичек и даже трудовых договоров, где лояльность редакционной линии ставилась условием работы. Anthropic признаёт ограниченность эффекта: по шкале Breakout большинство операций получили лишь 1-3 категории, а широкий охват возникал только там, где контент подхватывали государственные телерадиовещатели.

Раздел о слежке выглядит тревожнее, поскольку эти инструменты реально работают. Консультант из Бамако с помощью Claude разработал платформу "Lakana 360" для спецслужбы Мали: перехват данных трёх операторов мобильной связи (около 25 млн SIM-карт), причём требование о наличии судебного ордера было удалено из генератора досье по просьбе оператора. Система работает на локальных моделях, поэтому блокировка аккаунта никак не повлияла на уже развёрнутый комплекс. Операторы, связанные с КНР, использовали Claude как аналитический центр по делам религий, конвейер "поддержания стабильности" с собственным руководством по применению ИИ и рекрутера, составлявшего обращения к уйгурам на сирийском диалекте арабского языка. Anthropic признаёт, что её защитные механизмы "работали неравномерно". В одном случае Claude сначала ответил отказом, но уступил при повторном запросе; в другом - выполнял запросы на протяжении множества сессий.

Вооружения, биология и мошенничество

В случаях с обычными вооружениями Claude использовался в роли команды разработчиков ПО. Ячейка на севере Йемена задействовала три экземпляра Claude Code для написания, исследования и ревью управляющего софта для ракеты, провела испытательный пуск и через несколько часов вернулась к модели для диагностики сбоя. Российская группа фрилансеров довела рой FPV-дронов до этапа симуляции и тестов с "железом" в контуре (hardware-in-the-loop); классификатор зрения был обучен на видео боевых действий из Украины, а бортовая модель могла выбирать цель "человек" и отдавать команду на подрыв автономно, без участия оператора. Один китайский разработчик составил спецификацию системы управления огнём против торпед. Другой создал комплекс целеуказания для радиоэлектронной борьбы и сменил сценарий по умолчанию на 12 целей на Тайване. Ещё два случая касались обхода санкций при закупках и сбора разведданных об оружии направленной энергии.

Раздел по биологии сосредоточен на технологиях двойного назначения, а не на готовом биооружии. Anthropic заявляет, что больше не может гарантировать, что текущие модели остаются ниже порога критического содействия угрозам, поэтому Fable 5 вышел с жёсткими ограничениями на биологические темы двойного назначения. Пять приведённых примеров включают платформу-реселлер, обслуживавшую вирусологов с государственным грантом на исследование усиления функций (gain-of-function) вируса чикунгунья (сервис перенаправлял отклонённые Claude запросы более разрешительной модели конкурента); исследователя, планировавшего адаптацию птичьего гриппа H5 к млекопитающим (классификаторы ограничили его доступ моделями Sonnet 4 и Haiku 4.5); и прокси-шлюз, через который клиент заставил Opus 5 за час полностью составить черновик заявки на грант по обходу иммунитета ортопоксвирусами. Anthropic делает вывод: классификаторы не способны одновременно приносить пользу и предотвращать вред в сфере технологий двойного назначения, так как намерение не видно из текста; поэтому доступ к передовым биологическим возможностям должен предоставляться по программам доверенных пользователей с подтверждением личности и сохранением истории.

Случай с мошенничеством (GTG-15001) касается китайской студии, запустившей более 20 дейтинг-приложений, где общение подавалось как разговор с реальными людьми. За две недели Anthropic выявила 4700 персон Claude, общавшихся как минимум с 25 000 пользователей (около 2,36 млн сообщений); они работали в связке 3 к 1 с живыми операторами, которые брали на себя видеозвонки, недоступные модели. В код приложений была встроена логика, менявшая поведение во время проверки в App Store.

Что отчёт проясняет, а что оставляет открытым

Для дискуссии об открытых моделях отчёт работает в двух противоположных направлениях сразу - вероятно, поэтому Ламберт относит его к дистилляции, а не к рискам безопасности. Это самое подробное публичное свидетельство того, что извлечение цепочек рассуждений реально и что названные лаборатории занимались им в промышленных масштабах; это подкрепляет тезис о том, что сокращение разрыва между открытыми и закрытыми моделями связано с дистилляцией. В то же время отчёт неоднократно показывает, что защитные фильтры проприетарной модели служат лишь временной помехой: злоумышленники дробили задачи по сессиям, продавливали отказы повторными промптами, уходили к конкурентам в обход классификаторов, а в Мали и вовсе развернули систему массовой слежки на локальных весах, на которую бан никак не повлиял. Это ровно те аргументы, которые приводятся с обратной стороны на страницах nonproliferation-is-the-wrong-approach-to-ai-misuse и openai-huggingface-incident-autonomous-hacking, и причина, по которой arguments-against-open-source-ai называет контроль доступа самым слабым звеном в позиции разработчиков frontier-моделей.

При этом отчёт не даёт ответов относительно самих упомянутых моделей. Все цифры исходят от Anthropic, атрибуция опирается на метаданные аккаунтов и анализ прокси, детали которых не раскрываются, а утверждение о том, что на этих логах обучались Qwen, Kimi или GLM, - это вывод из факта сбора данных, а не измерение результата. Другие материалы базы по упомянутым компаниям собраны на страницах deepseek, kimi-k3, z-ai и openai.