EnglishРусский Map
Open-Source AI & Open Models Reading List

GLM-5.3: как китайские лаборатории не отстают от фронтира

title
GLM-5.3: как китайские лаборатории не отстают от фронтира
type
summary
summary
Ламберт о GLM-5.3: почему лаборатории Китая не отстают от США без упора на дистилляцию, и поэтапный релиз Z.ai для кибербезопасности
tags
ai, open-weights, china, llm, reinforcement-learning, security, distillation
created
2026-09-14
updated
2026-09-14
lang
ru
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

Нейтан Ламберт опубликовал этот текст в interconnects 14 августа 2026 года, в день, когда z-ai анонсировала GLM-5.3. На старте модель была доступна только по тарифу для написания кода от Z.ai. Доступ к API обещали открыть в скором времени, а веса с открытым исходным кодом выложить на Hugging Face через две недели. Скачок в бенчмарках оказался большим. Во многих тестах GLM-5.3 обошла Kimi K3 от Moonshot, а в некоторых опередила Claude Fable 5 и GPT-5.6-Sol. Это ставит её примерно на уровень фронтира в задачах агентного написания кода при размере около 750B параметров - трети от размера kimi-k3.

Запись в блоге Z.ai открывается одним предложением: "Масштабирование post-training - это всё, что мы сделали для GLM-5.3". Это та же базовая модель, что и GLM-5.2, с гораздо более длительным post-training, в котором использовались, по выражению Z.ai, "больше сред, более разнообразные задачи и больше вычислительных ресурсов, потраченных на обучение на них". Ламберт формулирует разницу между двумя ведущими китайскими лабораториями так: Z.ai сильна в post-training, тогда как Kimi - "в большей степени шедевр pretraining'а".

Очевидный вопрос: как столь небольшая модель держится наравне с ведущими публичными американскими моделями, и реальны ли эти результаты. Ламберт признаёт, что и сам задавался этим вопросом: "Модели точно не могут быть настолько хороши, как кажутся". Его беспокоит, что американские компании с огромным преимуществом в ресурсах не могут оторваться. Это эссе - его попытка найти ответ.

Долгая история развития

Первый довод Ламберта: Z.ai занимается этим дольше почти кого бы то ни было. Zhipu AI была основана в 2019 году. Первая GLM вышла из группы THUDM Университета Цинхуа в марте 2021 года, за ней последовали GLM-130B в 2022 году, три чат-релиза ChatGLM в 2023 году, GLM-4 в январе 2024 года и GLM-5 в феврале 2026 года. Полная хронология приведена на странице сущности. Оглядываясь на GLM-5.2, Ламберт отмечает, что модель оправдала ожидания. Спустя недели после релиза знакомые исследователи всё ещё использовали её из-за скорости - некоторые запускали её на внутренних кластерах быстрее, чем публичные провайдеры, - и из-за простоты при работе с фронтирными системами. В источнике датой релиза GLM-5.2 указано 22 июня, однако в собственной заметке Ламберта glm-5-2-step-change-for-open-agents развёртывание датировано 13 июня, а публикация весов - 16 июня. 22 июня - это дата публикации самой заметки.

Дистилляция - не главное объяснение

Обычно всё объясняют дистилляцией. Ламберт писал об этом в the-distillation-panic и how-much-does-distillation-matter-for-chinese-llms, и он по-прежнему считает, что это не основной фактор. Часть опасений он принимает. Недавняя статья, разобранная в stealing-reasoning-traces-from-proprietary-llm-apis, показала простые способы извлечения цепочек рассуждений (reasoning traces) из API фронтирных моделей, и китайские лаборатории наверняка могли использовать их в больших масштабах. Его удивляет, что лаборатории США не устранили эту утечку и вместо этого просят правительство о регуляторной помощи. Его контраргумент опирается на собственное описание процесса обучения от Z.ai. Лаборатория, масштабирующая RL, не может просто дистиллировать свои среды, инфраструктуру для их масштабного запуска или объединяющие их алгоритмы. В how-distillation-is-used-today описано, где именно дистилляция действительно полезна в пайплайне с сильным упором на RL.

Если дело не в дистилляции, следующее подозрение падает на benchmaxxing - подгонку обучения под тестовые наборы, из-за чего в реальном использовании результаты оказываются хуже заявленных баллов. Ответ Ламберта - перечень факторов более общего порядка. Технические детали, по его словам, тоже важны, но по ним лаборатории сложнее сопоставлять между собой.

Шесть причин, почему китайские лаборатории не отстают

Главным фактором он считает скорость релизов. У Z.ai путь от готовой модели до релиза, вероятно, занимает считаные дни, тогда как у OpenAI и Anthropic уходят месяцы. Ламберт полагает, что у обеих американских лабораторий с высокой вероятностью есть внутренние модели заметно лучше, чем у Z.ai или Moonshot. Однако они тратят месяцы на предрелизное тестирование, а китайские лаборатории используют это время, чтобы продолжать улучшать показатели в бенчмарках. SpaceXAI, по его мнению, в этом плане ведёт себя ближе к китайским лабораториям. Для американских лабораторий такой подход пока оставался приемлемым, поскольку спрос на их модели по-прежнему огромен. Ситуация может измениться, если циклы самообучения моделей начнут опираться на пользовательские данные: тогда более быстрые циклы релизов дадут накопительный эффект. Ламберт называет это гоночной динамикой, которая беспокоит многих в индустрии.

Что касается бенчмарков, он признаёт, что Z.ai, вероятно, чуть больше заботится о публичных оценках, чем OpenAI или Anthropic. Рейтинги вроде Artificial Analysis Intelligence Index напрямую влияют на стоимость акций, привлечение инвестиций и мотивацию команды: образ аутсайдера, выступающего наравне с американскими гигантами, отлично работает на репутацию. Неявный benchmaxxing к тому же стал нормой для всей индустрии. Многие компании целенаправленно закупают данные под те бенчмарки, где они отстают.

Он не думает, что Z.ai переобучила GLM-5.3 до потери работоспособности, во всяком случае намеренно, и рассчитывает, что Z.ai проведёт проверки. Каждая лаборатория сталкивается с шероховатостями масштабирования RL. У Opus 5 и Sonnet 5 от Anthropic смешанная репутация, несмотря на отличные баллы (в benchmarking-opus-5-slopcodebench описана одна из попыток измерить Opus 5 по качеству кода). По его мнению, с весами одних моделей работать проще, чем с другими, но цифры в анонсах релизов соответствуют действительности.

GLM-5.3, вероятно, более узкоспециализированная модель, чем Claude Fable или GPT Sol. OpenAI и Anthropic обслуживают гигантских клиентов с бесконечным набором сценариев, тогда как компания на более ранней стадии внедрения может сосредоточиться на самых ценных сценариях и упростить post-training, снизив охват задач. Флагманские модели GLM от Z.ai к тому же не поддерживают обработку изображений (vision), что идёт на пользу их баллам. Ламберт уравновешивает это ссылкой на материал Bloomberg о том, что Z.ai достигла $1 млрд регулярной годовой выручки (ARR), в основном за счёт локальных (on-premises) развёртываний.

Пятый фактор был добавлен уже после рассылки письма. В Китае растёт индустрия данных для RL, во многом благодаря американским компаниям данных, продающим их китайским лабораториям. Китайские лаборатории могут покупать те же среды RL, что используют американские фронтирные лаборатории, и быстрее выпускать полученные модели. Ламберт отмечает, что объём этого рынка пока крайне неопределён.

Последний фактор: Z.ai попросту очень сильна и, вероятно, расходует вычислительные ресурсы гораздо эффективнее, чем OpenAI или Anthropic. Она тесно связана с Университетом Цинхуа и имеет доступ к большому пулу мотивированных специалистов, что для неё так же важно, как таланты для любой западной лаборатории. Ламберт резюмирует, что стратегия линейки GLM - "вполне удачная", и планирует протестировать веса через американских провайдеров инференса вроде Fireworks или Baseten.

Поэтапный релиз для задач кибербезопасности

Заключительный раздел посвящён безопасности, и здесь Z.ai сама изменила подход к выпуску моделей. Она назвала GLM-5.3 своей наиболее мощной моделью для кибербезопасности на текущий момент, отметив заметный прогресс в поиске уязвимостей, анализе эксплойтов и выполнении многошаговых задач безопасности, и признала "явные риски двойного назначения". Компания объявила о поэтапном релизе. Отобранные партнёры по безопасности сначала оценят модель в контролируемых условиях, затем последует более широкий доступ и запуск API, а полные веса будут опубликованы "как только завершатся необходимые проверки безопасности и подготовка к релизу". Для собственной платформы компания описала классификатор запросов и мониторинг цепочек рассуждений поверх базового alignment'а модели. Это условие расходится с фиксированным двухнедельным сроком публикации весов в начале той же публикации, и в источнике не уточняется, вышли ли веса по графику.

Ламберт скептически относится к тому, насколько такой подход к безопасности полезен. Если GLM-5.3 не выйдет с открытыми весами для этих задач, это сделает другая модель. Модели с подобными возможностями становятся всё компактнее, а значит, их проще модифицировать и развёртывать без защитных ограничений. Скорость распространения определяется наименее осторожной лабораторией. Он отдаёт должное удачным решениям Z.ai, включая упор на превентивный поиск уязвимостей, но подчёркивает, что ни одна отдельная компания с этим не справится, и призывает к выработке масштабных рекомендаций на уровне правительств или отраслевых коалиций, чтобы подготовить всё программное обеспечение к грядущим изменениям.

Программа поэтапного выпуска напоминает схему, описанную Thinking Machines в a-safe-path-to-open-weights: специалисты по защите получают ранний доступ до публикации весов. Возражение Ламберта совпадает с мыслью из openai-huggingface-incident-autonomous-hacking: у атакующих уже есть сопоставимые открытые модели. Это также заметно отличается от позиции Z.ai образца 2025 года, чей руководитель по продукту в zai-playbook утверждал, что компания выкладывает модель в открытый доступ "в течение нескольких часов" после завершения обучения.

Связанные страницы

В intelligence-vs-cost-linear стоимость GLM-5.3 оценивается по тарифам OpenRouter. Она набирает 60 баллов в индексе Artificial Analysis при стоимости $0.49 за задачу против 66 баллов у Fable 5.1 при $3.69. В qwen3-8-flash-next зафиксирован релиз более компактной GLM-5.3-Flash (320B всего, 18B активных), вышедшей параллельно с предварительной версией Qwen. kimi-k3-open-weights-escalation - более раннее эссе Ламберта об эффективности использования капитала, а этот материал расширяет его выводы с масштабирования pretraining'а на масштабирование post-training'а.