Стратегия Z.ai
- title
- Стратегия Z.ai
- type
- summary
- summary
- Интервью ChinaTalk с Цзысюанем Ли из Z.ai о GLM: почему Zhipu открывает веса, тарифы на кодинг, ролевые игры, перевод и релизы за пару часов
- tags
- ai, open-weights, china, ai-lab, llm, interview
- sources
- zai-playbook
- created
- 2026-09-14
- updated
- 2026-09-14
- lang
- ru
- translation_of
- zai-playbook
- source_updated
- 2026-09-14
- translated
- 2026-09-14
- translator
- lllm/antigravity/gemini-3.7-flash-medium
"The Z.ai Playbook" - выпуск подкаста ChinaTalk, вышедший 21 ноября 2025 года. Ведущий - Джордан Шнайдер, соведущие - Айрин Чжан и Нейтан Ламберт (Лили Оттингер указана в описании, но в записи не участвует). Гость выпуска - Цзысюань Ли, директор по продукту и стратегии генеративного ИИ в z-ai, также известной как Zhipu AI. Ли отвечает за международные партнёрства, оценку диалоговых моделей, направление API и тарифный план GLM Coding Plan; ранее он изучал применение ИИ в науке и безопасность ИИ в MIT. Беседа состоялась примерно во время релиза GLM-4.6, после того как Ламберт назвал выход GLM-4.5 "ещё одним моментом DeepSeek". В своём списке open-source-ai-reading-list Ламберт цитирует одну фразу оттуда как пример того, насколько быстро выпускают релизы китайские лаборатории: "Выкатывай быстрее. Мы выкладываем код в открытый доступ буквально через несколько часов".
От AMiner к агентам для кодинга
По словам Ли, Zhipu была основана в 2019 году с целью достичь AGI через графовые вычисления, а не языковые модели. Первым продуктом компании стал AMiner - аналог Google Scholar с картой исследователей и научных публикаций. На LLM компания переключилась в 2020 году, а статью о GLM опубликовала в 2021-м, что, по оценке Ли, на год опередило появление GPT-3.5. В 2024 году главной задачей было качество диалогов, и GLM занимала с шестого по девятое место на Chatbot Arena. В 2025 году примеры Manus и Claude Code убедили руководство, что кодинг и агентные задачи дают гораздо больше экономической отдачи, после чего чаты перестали быть главным приоритетом. Ли отмечает, что Z.ai стала узнаваемой благодаря работе GLM-4.5 и 4.6 внутри таких инструментов, как claude-code и Kilo Code: "Чтобы получить известность, нам нужно встраиваться в эти ведущие продукты".
Как устроена лаборатория
Ли рассказывает, что команды предварительного обучения (pre-training) и дообучения (fine-tuning) сидят рядом и работают над общей целью - единой моделью, способной рассуждать, применять инструменты в агентном режиме и писать код. Для GLM-4.5 они обучили три отдельные teacher-модели и дистиллировали их в одну, что, по его словам, и позволило собрать архитектуру эффективно (см. llm-distillation). Он подчёркивает, что руководители направлений обязаны сами ставить эксперименты: новая версия Claude или GPT может выйти прямо посреди цикла обучения, и этот сдвиг нужно ощутить лично. Даже основатель компании читает статьи и сам запускает эксперименты.
Многие аспиранты работают над GLM и считают её своим главным достижением. Найм подчиняется строгой иерархии: ByteDance и Alibaba платят больше и забирают лучших первыми, поэтому стартапы вроде Z.ai привлекают тех, кто готов бороться. Основная исследовательская команда насчитывает от 100 до 200 человек - по оценке Ламберта, примерно как в OpenAI. В крупных корпорациях, по мнению Ли, в каждой группе обычно 10-20 ключевых специалистов и ещё 80-100 человек на обучении и подготовке данных. Сам Ли работает по 18 часов в сутки из-за переговоров с американскими партнёрами в их часовом поясе (иногда в 2-3 часа ночи), но отмечает, что исследователи продуктивно работают около восьми часов, после чего им нужен отдых. Ламберт в ответ шутит про кремниеводолинский график "002".
Зачем китайской лаборатории открывать модели
Ли называет две причины по порядку. Первая - вклад в исследования, как это делают Llama, Qwen и Kimi. Вторая - коммерческая. Американские компании не станут обращаться к китайскому API. Они запустят модель на Fireworks, Groq или на собственных серверах, поскольку данные должны оставаться в США. Поэтому открытый формат - единственный способ вообще попасть на этот рынок. Ламберт подтверждает: в Ai2 он не мог оформить подписку на китайский корпоративный API, но использует дистилляцию из нескольких китайских моделей. Флагманская модель Z.ai в 2024 году была закрытой, но релиз DeepSeek R1 переломил ситуацию: он показал, что лаборатория может прославиться на открытых весах и при этом зарабатывать на своём API. Вывод Ли: "Сначала нужно вырастить пирог, а потом уже отрезать от него кусок".
Популярность в США важна, так как местное сообщество разработчиков и исследователей задаёт повестку. Китайские СМИ ориентируются на американских инфлюенсеров, поэтому китайские корпоративные заказчики тоже следят за глобальной репутацией продуктов. Когда Карпати, Альтман или Маск пишут в X о модели, об этом узнают оба рынка. Шнайдер называет эту цепочку "рекурсивной": китайские медиа пишут о китайских моделях, которые обсуждают в США. При этом Ли признаёт, что по части брендинга Z.ai пока отстаёт: немецкий профессор, с которым он общался, знал Llama, Qwen и Mistral, но ничего не слышал о GLM; на Reddit до сих пор спрашивают, что такое GLM, а на аккаунт Z.ai в X подписано всего 20 000 человек против примерно миллиона у DeepSeek.
Монетизация открытых весов
Ли делит китайских корпоративных клиентов на две группы. Первые не могут никому передавать свои данные (даже Z.ai или Alibaba) и нанимают интеграторов, которые разворачивают DeepSeek на их собственных чипах, настраивая поверх RAG и рабочие процессы. Вторые (в основном технологические и медийные компании) выбирают API по соотношению цены и качества; на этом рынке, по его мнению, доминирует ByteDance. Команда Qwen оставляет закрытой Qwen 3 Max, чтобы сохранить коммерческий продукт. Поскольку флагман Z.ai полностью открыт, клиенты задаются вопросом, зачем за него платить. В итоге Z.ai конкурирует с другими хостинг-провайдерами GLM на уровне инженерии: ускоренное декодирование, поиск, поддержка MCP.
Модель подписок показала себя успешной. Тарифный план GLM Coding Plan избавляет пользователей от подсчёта токенов. Ли не гонится за большинством: если удастся переманить хотя бы 5% пользователей Claude, "это уже гигантский рынок". Z.ai также продаёт доступ под сценарии ролевых игр: GLM популярна на SillyTavern и Janitor AI. GLM-4.5 справлялась с этим плохо, но благодаря данным для пост-обучения GLM-4.6 научилась удерживать характер персонажа при длинном системном промте и не забывать свою роль. В качестве примера он приводит настроенного Стьюи из Гриффинов.
Z.ai поддерживает две платформы: BigModel.cn внутри Китая и Z.ai для зарубежных клиентов с хостингом в Сингапуре (сам Ли оформлен в сингапурском юрлице). Международный инференс работает за пределами Китая из соображений локализации данных, а обучение остаётся в Китае, где сосредоточены вычислительные мощности. Больше всего зарубежных пользователей приходит из Индии, но 50% международной выручки обеспечивают США, где охотно покупают тарифы Pro и Max. Основной приток аудитории идёт через X, Reddit и YouTube.
Перевод, закрытые платформы и поиск
По оценке Ли, китайско-английский перевод у GLM находится на одном уровне с Gemini 2.5 Pro, а интернет-мемы он называет "одним из наших главных орудий". Модель считывает контекст: эмодзи кита в предложении об ИИ переводится как DeepSeek, а в тексте о животных - буквально как "whale". Закрытые платформы не стали непреодолимым барьером, вопреки ожиданиям Шнайдера. Z.ai не может выгружать данные из WeChat напрямую, поэтому генерирует синтетические данные, анализирует открытые комментарии в Xiaohongshu и TikTok, собирает danmu и распознаёт графические мемы с помощью мультимодальной модели. Эпизод с "беженцами из TikTok" сыграл на руку, подстегнув спрос на автоперевод. Всего GLM качественно поддерживает около 20 языков. Что касается поиска, Ли отмечает, что у Google нет нормального поискового API, Bing сворачивает свой сервис, а парсинг через перекупщиков нестабилен, поэтому агенты всё чаще выходят на веб-страницы напрямую через браузер.
Чипы, страхи и технологический тупик
Z.ai использует как чипы Huawei, так и Nvidia, распределяя их по задачам в зависимости от требуемой скорости: 30 токенов в секунду для одного заказчика и 80 для другого. Говоря о страхах, Ли отмечает, что в Китае они беспокоят в основном программистов и аналитиков данных: те регулярно работают с кодинг-агентами, видят их возможности и боятся потерять работу, а не восстания машин. В самой Z.ai о сокращениях никто не думает, лаборатории постоянно не хватает людей. Вопросы эмоциональной привязанности и "ИИ-психозов" пока не стоят на повестке: Ли считает, что бороться с цифровой зависимостью имеет смысл только тогда, когда модель дорастёт до уровня GPT-5, поскольку с каждой новой версией поведение всё равно меняется. Ламберт сравнивает это с ситуацией в США, где заметное меньшинство опасается гораздо более серьёзных последствий, чем потеря работы, а Ли вспоминает, что во время его учёбы в MIT пессимистично настроены были буквально все.
В области исследований Z.ai уверенно владеет off-policy RL и продолжает эксперименты с on-policy RL и мультиагентными системами. Последние жертвуют полным контекстом одного агента ради сжатых контекстов нескольких участников, и вся цепочка может рассыпаться из-за галлюцинаций хотя бы одного из них. Модели с заявленным окном в миллион токенов стабильно работают лишь на дистанции до 60-100 тысяч. Ли считает, что текущая архитектура упёрлась в стену, которую нельзя пробить простым добавлением данных. Сама GLM насчитывает 355 миллиардов параметров, эксперименты ставятся на версиях 9B и 30B, и 90% из них заканчиваются неудачей. Следующим релизом стала GLM-4.6 Air размером около 30B (он не был уверен, не назовут ли её Mini), а идеи, проверенные в 2026 году, попадут в прод заметно позже. Последующие поколения GLM разобраны в glm-5-2-step-change-for-open-agents и glm-5-3-how-chinese-labs-keep-stride.
Z.ai публикует веса буквально через несколько часов после завершения оценки, без предварительного тестирования на LM Arena и без анонимных тизеров, поскольку "сам факт открытия исходников - это и есть главное событие". Ли предпочёл бы иметь неделю запаса, чтобы заранее договориться с провайдерами инференса, авторами бенчмарков и разработчиками сред для кодинга, но вместо этого вынужден звонить партнёрам посреди ночи за два часа до релиза. На внутреннем рынке даже студенты Университета Цинхуа не всегда знают о Z.ai, а школьники искренне не понимают, зачем нужна ещё какая-то модель, если уже есть DeepSeek.
В сопоставлении с другими страницами
Взгляд Ли на причины открытости моделей - самый прагматичный и коммерческий среди материалов подборки: закрытый флагман в 2024 году и переход к открытым весам как единственный способ закрепиться на американском рынке. Это выглядит куда более узко, чем академическая традиция из статьи Кевина Сюя chinas-structural-advantage-in-open-source-ai и двадцатилетняя культура open source из его же текста chinese-open-source-a-definitive-history, хотя и согласуется с тезисом Сюя о том, что открытость - базовое условие для зарубежной экспансии. Заметки Ламберта notes-from-inside-chinas-ai-labs, написанные после визита в Z.ai полгода спустя, подтверждают наблюдения: команды сформированы в основном из студентов, а к открытости там относятся без лишней романтики, исключительно практически. Тезис Ли об обучении на синтетических данных из-за недоступности закрытых платформ служит практической иллюстрацией к проблеме данных, которую поднимает Сюй.
В расшифровке аудиозаписи встречаются ошибки распознавания речи: "Cloud Code" вместо Claude Code, "graphic network or graphic compute", скорее всего, означает графовые сети, а "manuscript" в ответе про поиск - вероятно, искажённое название одного из поисковых агентов. В опубликованном исправлении уточнили одну неверную ссылку (Kimi K2 вместо Manus и Claude Code). Ответ о нейминге моделей 4.6 Air и Mini звучит путано уже в самом первоисточнике.