Безопасный путь к открытым весам
- title
- Безопасный путь к открытым весам
- type
- summary
- summary
- Фреймворк Thinking Machines Lab по релизу открытых весов (тестирование, поэтапный доступ, фильтрация опасных знаний) на примере моделей Inkling
- tags
- ai, open-weights, ai-safety, security, policy, llm
- sources
- a-safe-path-to-open-weights
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- a-safe-path-to-open-weights
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Thinking Machines Lab опубликовала эту статью в июле 2026 года, вскоре после релиза Inkling и Inkling-Small - двух своих языковых моделей с открытыми весами. Лаборатория считает, что открытые веса полезны: они распространяют опыт обучения и развёртывания за пределы горстки лабораторий, а также позволяют исследовать и корректировать заложенные в модель допущения. В статье описано, как совместить эту позицию с рисками неправомерного использования (misuse). В списке open-source-ai-reading-list Натан Ламберт называет её "четким описанием того, как совместить публикацию мощных моделей с открытыми весами и серьёзное отношение к безопасности", помещая во главу подборки материалов по безопасности. Это единственный текст в группе, написанный лабораторией, которая сама выпускает открытые веса.
Главный тезис: безопасность релиза зависит от двух составляющих - самой модели и экосистемы, в которую она попадает. Большинство публикаций по безопасности рассматривают только первое.
Риск, к которому здесь относятся всерьёз
Текст начинается без привычных успокаивающих заверений. В качестве примера приводится отчет Anthropic за апрель 2026 года о том, что Claude Mythos Preview обнаружил тысячи ранее неизвестных уязвимостей во всех основных операционных системах и браузерах и без участия человека написал рабочие эксплойты. Если открытые веса дадут такие возможности каждому, станет ли общество безопаснее? Лаборатория утверждает, что итоговый баланс нападения и защиты (offense-defense balance) остаётся абсолютно неясным. Одни и те же возможности помогают защитникам закрывать бреши, а атакующим - эксплуатировать незащищённые системы; в химии и биологии ситуация аналогична. Вывод звучит прямо: "беспорядочный релиз весов - это небезопасный путь".
Эта позиция противоречит двум другим статьям из списка Ламберта. В myth-of-unsafe-open-source-ai на основе отчётов об инцидентах доказывается, что реальные злоупотребления происходят почти исключительно через закрытые модели, и релизы уровня Mythos этого не изменят. В openai-huggingface-incident-autonomous-hacking утверждается, что у атакующих уже есть передовые открытые веса, поэтому сдержанность лишь тормозит защитников. Thinking Machines прямо не называет ни один из этих аргументов, но её программа поэтапного релиза - это прямая ставка против второго тезиса: ставка на то, что окно доступа только для защитников имеет ценность.
Безопасна ли модель?
Тестирование безопасности названо "несовершенным, но необходимым приближением". Вопросы заключаются в том, какие вредоносные задачи модель способна решать, насколько доступными она их делает и что происходит, когда защитные барьеры (guardrails) сняты. Последний вопрос важнее всего именно для открытых весов, поскольку обучение отказам (refusal training) счищается файнтюнингом и "не может считаться надёжной защитой".
Inkling - не frontier-модель, поэтому лаборатория оценивала прирост риска: создаёт ли её публикация ощутимую опасность сверх того, что уже доступно для скачивания? Нахождение ниже рубежа опасных возможностей сочли необходимым, но недостаточным условием. Лаборатория также проверяла, не сделают ли мультимодальность, простота адаптации или лёгкость доступа уже существующие опасные навыки более удобными в применении.
Тестирование шло по трём направлениям. Внутренние оценки охватывали CBRN (ХБРЯ-угрозы) и наступательные кибероперации (как знания, так и способность применить их на практике), широкий набор сценариев misuse, включая агентное использование инструментов, и мультимодальный бенчмарк вредоносного контента на 17 языках (текст, изображения, аудио). До релиза четыре сторонние организации провели red-teaming: Scale AI тестировала общий misuse по спецификации модели, Handshake AI проверяла взаимодействие с уязвимыми пользователями (суицид, селфхарм, расстройства пищевого поведения, детская безопасность), FAR.AI занималась CBRN и кибербезопасностью, а Apollo Research исследовала риски потери контроля вроде скрытного планирования (scheming), понимания факта тестирования (evaluation awareness) и саботажа. Третьим направлением был состязательный файнтюнинг: лаборатория обучила варианты "helpful-only", которые соглашаются вместо отказа, и прогнала их по тестам на технологии двойного назначения. По всем трём трекам Inkling показала результаты на уровне существующих открытых моделей, а очищенные от ограничений варианты не дали нового прироста в сфере CBRN или киберугроз. Лаборатория прямо заявляет, что этот баланс изменится, когда её модели приблизятся к frontier-уровню.
Исследовательская ставка заключается в вопросе: можно ли отделить опасные возможности от общего интеллекта? Обычно предполагается, что они возникают сами по себе в процессе обучения и растут вместе с общими способностями, из-за чего результаты на киберполигонах воспринимаются просто как ещё один бенчмарк для взятия высоты. Лаборатория выдвигает гипотезу, что часть опасных знаний, особенно в биологии, опирается на конкретные эмпирические факты (протоколы, реагенты, условия), усвоенные из отдельных документов, а не выведенные путём рассуждений. Если это так, их можно отфильтровать из претрейна без ущерба для обычного применения. Авторы приводят ранние свидетельства того, что фильтрация документов по CBRN-тематике снижает оценки опасных возможностей, сохраняя остальные навыки (O'Brien et al., "Deep Ignorance", 2025). Также указаны пути, где подход может дать сбой: сильная модель рассуждений способна заново вывести удалённые данные, а граница между опасными и обычными техническими знаниями может оказаться слишком размытой.
Готова ли экосистема?
Готовность означает эшелонированную оборону: организации способны заблаговременно ставить патчи или перехватывать атаки на лету, а исследования позволяют моделям масштабно усиливать защиту. Сложность в том, что защитникам нужен доступ к способным моделям для выстраивания этих рубежей, а любое расширение доступа одновременно расширяет и возможности для злоупотреблений. Ответ статьи - поэтапность, где у каждого этапа своя задача.
Сначала идёт ранний доступ к инференсу для защитников по образцу Project Glasswing от Anthropic, в рамках которого доверенным организациям предоставили Mythos Preview до публичного релиза. В статье это сравнивается с практикой ответственного раскрытия уязвимостей (responsible disclosure), когда вендоры получают закрытое временное окно на выпуск патчей. Следующий этап - доступ к файнтюнингу для проверенных защитников. В качестве примеров приведены победившая команда DARPA AI Cyber Challenge, которая дообучила модель для поиска и исправления уязвимостей, и классификаторы gpt-oss-safeguard от OpenAI, дообученные на открытых весах gpt-oss. Затем - доступ по принципу белого ящика (white-box) для проверенных исследователей безопасности. Здесь статья озвучивает довод сторонников открытых весов: понимание поверхностности отказов появилось именно благодаря изучению открытых весов. Отказы обходятся состязательной оптимизацией на уровне токенов (Zou et al., 2023), удаляются вдоль единичного направления активации (Arditi et al., 2024) и сконцентрированы в первых нескольких токенах ответа (Qi et al., 2024). Последний этап - контролируемый публичный доступ перед полным релизом, чтобы отследить паттерны misuse, пока ограничения ещё действуют.
API для файнтюнинга, подобные собственной платформе Tinker от лаборатории, находятся между доступом к инференсу и открытыми весами. Провайдер сохраняет веса у себя, может вести мониторинг, поддерживать защитные барьеры и отзывать доступ, пока пользователи используют собственные данные, функции потерь и циклы обучения. В статье утверждается, что это даёт большую часть преимуществ открытости при более низком потолке рисков. Это также коммерческий продукт лаборатории, на чём статья отдельно не акцентирует внимание.
Этапы не являются конвейером, неизбежно ведущим к открытию весов. Каждое расширение доступа должно происходить только при наличии подтверждающих данных, а модель, придержанная сегодня, может быть открыта позже, когда защита подтянется. При этом этапы должны сменяться быстро, иначе опыт защитников устареет до следующего скачка возможностей.
Что статья оставляет открытым
Авторы называют публикацию "высокоуровневым фреймворком, а не полным стандартом релиза" и перечисляют нерешённые вопросы: какие именно свидетельства оправдывают переход на следующий этап, как неопределённость должна влиять на это решение, что должно ставить процесс на паузу и как измерять готовность экосистемы. В будущем обещаны подробный фреймворк с бенчмарками, критериями доступа и условиями остановки, а также анонсированы гранты Tinker на исследования безопасности.
Сама идея поэтапного релиза появилась раньше этой статьи. OpenAI выпускала GPT-2 этапами ещё в 2019 году, о чём напоминает исторический экскурс в societal-impact-of-open-foundation-models, а gradient-of-generative-ai-release рассматривает выпуск моделей как градиент, а не бинарный выбор. Вклад Thinking Machines - это схема с приоритетом для защитников, привязанная к конкретным программам 2026 года, плюс фильтрация данных на этапе претрейна как способ сделать финальный этап открытых весов менее опасным. Позиция лаборатории перекликается со взглядом Хелен Тонер в nonproliferation-is-the-wrong-approach-to-ai-misuse: задержка перед открытым релизом имеет смысл только тогда, когда защитники успевают ею воспользоваться. Работа Джошуа Сакса national-ai-cybersecurity-policy критикует как раз фильтрацию по порогам возможностей, на которую опирается предложенная здесь схема тестирования. Аргумент о безопасности, от обсуждения которого отказались в arguments-against-open-source-ai, здесь разбирается с позиции сторонников открытости - и с большей технической детализацией, чем обычно получают критики frontier-лабораторий.
- The Arguments Against Open Source AI are Very Bad
- From Open Source Software to Open Source Strategy
- GLM-5.3: How Chinese labs keep stride with the frontier
- The Myth of unsafe Open Source AI
- We urgently need a coherent national AI cybersecurity policy
- Nonproliferation is the wrong approach to AI misuse
- Open Source AI is the Path Forward
- Open-Source AI & Open Models Reading List
- The OpenAI/Huggingface incident; how we should manage the imminent arrival of autonomous hacking too cheap to meter
- 6 months to live for open models
- On the Societal Impact of Open Foundation Models
- Some Simple Economics of Open versus Closed AI