Релизы и изменения моделей
Z.ai: инференс GLM на 100 тысячах своих ускорителей
Z.ai опубликовала разбор того, как подняла продакшен-инференс GLM-5.3-Flash с нуля на кластере более чем из 100 тысяч ускорителей китайского производства: меньше двух недель от первого запуска до готовности к бою и рост сквозной пропускной способности примерно втрое. Значительную часть работы сделал агент на базе самой GLM-5.3 — модель оптимизировала систему, на которой работает. Самое полезное в тексте не железо, а инженерный приём, который переносится на любого агента.
Это первоисточник по семейству, которое стоит у нас в каталоге тремя позициями. Разберём, что там сказано, что из этого проверяемо и что можно забрать себе.
Что произошло
Коротко по фактам из публикации. Компания построила с нуля продакшен-инференс на кластере более чем из 100 тысяч ускорителей китайского производства. Весь боевой инференс GLM-5.3-Flash идёт на этой системе. Такого масштаба на этом железе, по их словам, до них никто не разворачивал.
Условия были неудобными: ограниченный объём и пропускная способность памяти чипов, новая архитектура модели, контекстное окно на миллион токенов, мультимодальные запросы, незрелая экосистема и неполная поддержка ядер. Часть того, что должно было быть в документации, приходилось угадывать.
Результат: меньше двух недель до продакшена, рост сквозной пропускной способности примерно втрое относительно исходного уровня. Утилизация железа и стоимость токена, по утверждению компании, вышли на уровень, сопоставимый с массовыми GPU NVIDIA.
Отдельная деталь для тех, кто следит за рынком: модель обкатывали анонимно под именем Ox-Alpha на OpenCode и OpenRouter, и за неделю после запуска она стала самой используемой на обеих площадках, обработав больше 62 триллионов токенов за шесть дней.
Главная идея текста: плотная обратная связь
Здесь начинается часть, которую стоит забрать себе независимо от того, есть ли у вас кластер.
Постановка задачи такая. Агент меняет код и получает сквозную метрику: «тест точности не прошёл», «время до первого токена выросло на 30 %», «пропускная способность упала на 20 %». Этого достаточно, чтобы понять, что стало хуже, и недостаточно, чтобы понять почему. Проблема в инференсе рождается из взаимодействия слоёв — ядра, стратегия параллелизма, поведение коммуникаций, управление памятью, оркестрация обслуживания. Сквозная метрика не показывает, какой слой виноват.
Авторы формулируют требование к обратной связи через три свойства:
| Свойство | Что означает | Практический смысл |
|---|---|---|
| Локальность | сигнал привязан к конкретному ядру, параметру запуска, входным условиям, потоку, интервалу выполнения | агент сужает область поиска, а не гадает по всей системе |
| Дешевизна и своевременность | на гипотезу есть способ проверки, не требующий полного развёртывания | короткий цикл проверки, меньше сил на пустые гипотезы |
| Объективная проверяемость | вывод подтверждается эталонной реализацией, тестом, контролируемым экспериментом | корреляция наблюдений не считается причиной |
И отдельно оговаривают: «плотная» не значит «побольше логов». Большой объём неструктурированных логов, наоборот, прячет важный сигнал.
Два случая, которые показывают механику
В публикации разобраны конкретные баги, и они полезнее общих слов.
Точность в параллельном пути. При сравнении результатов с разбиением по контексту и без него всплыло расхождение. Причина: операция перемножения по умолчанию считала в пониженной точности, даже когда на входе были числа полной точности, и ошибка накапливалась на длинном контексте. Исправление — явно задать режим повышенной точности, который собирает результат из трёх операций. Правка отправлена в апстрим Flash Linear Attention отдельным пул-реквестом.
Конкуренция при передаче кэша. Инженеры задали проверку: разрыв между режимом «предзаполнение плюс передача кэша» и чистым предзаполнением не должен превышать 5 %. Агент обнаружил, что в части сценариев разрыв больше 20 %, и по временной шкале увидел, что передача кэша никогда не перекрывается с вызовами диспетчеризации. Дальше по цепочке вызовов нашлось, что на границе Python и C++ не освобождалась глобальная блокировка интерпретатора, из-за чего поток передачи не мог вовремя получить управление. После исправления разрыв упал ниже 1 %.
Обратите внимание на структуру обоих случаев: сначала заданное инженером ограничение превращает «работает хуже ожидаемого» в измеримое расхождение, потом локальное наблюдение сужает область, потом анализ кода указывает точное место.
Что из этого переносится на обычный проект
Не кластер, а способ работы с агентом. Если у вас агент что-то чинит, оптимизирует или дописывает, спросите себя:
Что он получает после изменения? Если только «тесты упали» — это редкая обратная связь, и агент будет перебирать гипотезы вслепую, сжигая токены.
Может ли он проверить гипотезу дёшево? Если любая проверка требует полного прогона, цикл длинный, и большая часть расхода уходит на ожидание.
Привязан ли сигнал к месту? «Ответ стал хуже» бесполезно. «На запросе номер 12 поле даты извлеклось неверно, раньше верно» — уже рабочая зацепка.
Это ровно то же самое, что делает разницу между дорогим и дешёвым агентом на практике. Про то, почему агенты ломаются и куда уходит расход, мы писали в материале почему ИИ-агент не работает.
Почему анонимная обкатка — отдельный сюжет
Деталь, которую легко пропустить: модель выкатили на публику под чужим именем.
Логика понятная. Под своим названием модель получает оценки, смешанные с отношением к бренду: одни ждут провала, другие заранее готовы хвалить. Анонимное имя убирает этот слой и даёт замер отношения к результату, а не к вывеске.
Для читателя отсюда следует практическая вещь. Когда вы видите рейтинг моделей на публичной площадке, полезно знать, под каким именем позиция там жила. Свежая модель под новым именем и та же модель под именем вендора собирают разную статистику использования, и сравнивать их напрямую некорректно.
И вторая сторона: 62 триллиона токенов за шесть дней — это показатель объёма, а не качества. Самая используемая модель на площадке не означает лучшую на вашей задаче; чаще это означает удачное сочетание цены и доступности в тот момент.
Какие оптимизации перечислены
Для полноты приведём список, который компания называет сама, — без попытки его пересказывать своими словами и без оценок.
Параллелизм тензоров внутри узла для линейного внимания и выходного слоя, техника воспроизведения состояния, квантование весов и активаций в восемь бит, смешанная точность квантования кэша, разделение слоёв и разнесённая архитектура, где кодирование, предзаполнение и декодирование разведены по разным ресурсам. Совокупно это дало примерно трёхкратный рост сквозной производительности обслуживания.
Отдельно отмечена работа с конкретным ядром декодирования: сначала изменение ради экономии памяти увеличило время выполнения, затем оптимизация деления срезала почти десятую часть, а затем агент обнаружил, что исходная реализация разбивала вычисление так, что одни и те же нормализация и гейтинг считались четырежды. Устранение этого повтора дало ускорение в 1,71 раза относительно предыдущей версии.
Зачем это читателю без кластера: как иллюстрация того, что крупный выигрыш чаще складывается из устранения повторной работы, чем из «более быстрого железа».
Причём здесь ставка за токен
Связь прямая, и публикация её показывает лучше любых объяснений. Утроение пропускной способности на том же железе означает втрое меньшую себестоимость обработки запроса. Цена, которую платит пользователь, — это следствие инженерии на стороне, где крутится модель, а не жест доброй воли.
Отсюда практический вывод при выборе позиции. Разрыв в ставках между лёгкими и тяжёлыми моделями в каталоге измеряется десятками раз, и за ним стоит разная стоимость вычисления, а не разная наценка. KeyDealer даёт один ключ на 55 позиций каталога, 42 из которых доступны сейчас, с оплатой российской картой в рублях и ставками от 1 ₽ за миллион токенов. Семейство GLM представлено тремя позициями: glm-5-3 по 15 ₽, glm-5-3-flash по 5 ₽ и glm-4-6v по 3 ₽ за миллион.
То есть речь в разборе идёт про инфраструктуру модели, которая у нас в каталоге стоит 5 ₽ за миллион токенов. Как считается сам счёт, разобрано в материале сколько стоит миллион токенов в рублях.
Чего мы не утверждаем
Три оговорки.
Все числа в публикации — замеры вендора о себе. Утроение пропускной способности, две недели, сопоставимость с массовыми GPU по стоимости токена — это его собственные цифры в его конфигурации. Независимой проверки нет, и мы её не проводили.
Мы не утверждаем, что модель оптимизировала систему сама. В тексте прямо сказано обратное: инженеры ставили цели, определяли границы системы, строили среду обратной связи и проверяли критичные изменения, затрагивающие численную семантику, асинхронность и риск для продакшена. Авторы сами пишут, что до рекурсивного самоулучшения не дошли и что выбор целей и оценка риска остаются за людьми.
Мы не переносим выводы про железо на выбор модели. То, что вендор построил эффективную инфраструктуру, не говорит ничего о том, подойдёт ли его модель вашей задаче. Это проверяется замером на своих данных — механика в материале как сравнивать модели.
Что нужно, чтобы проверить GLM у себя
Ключ на keydealer.ru/login и три десятка своих реальных запросов. Прогоните их на glm-5-3-flash и на той позиции, что стоит у вас сейчас, и сравните по своим критериям приёмки. Если разницы нет, а ставка ниже — вы только что нашли экономию. Если есть — вы знаете, за что платите.
Что держать в голове
Первое. Самое ценное в этой публикации — не масштаб, а формулировка требования к обратной связи. Локально, дёшево, проверяемо: три слова, которые определяют, будет ли ваш агент чинить систему или перебирать гипотезы за ваши деньги.
Второе. Дешёвый токен — это чья-то инженерная работа, а не аттракцион невиданной щедрости. И наоборот: дорогая позиция дорога потому, что её вычисление стоит дороже, а не потому, что кто-то решил заработать больше.
Третье. Числа вендора о себе остаются числами вендора о себе, как бы убедительно они ни выглядели. Проверять всё равно на своей задаче. Что мы за проект и как проверяем факты — на странице о проекте, ключ заводится на keydealer.ru/login.
Частые вопросы
Что именно описала Z.ai?
Как подняла продакшен-инференс GLM-5.3-Flash с нуля на кластере более чем из 100 тысяч ускорителей китайского производства. Весь боевой инференс этой модели идёт на этой системе. От первого удачного запуска до готовности к продакшену прошло меньше двух недель, за это время сквозная пропускная способность выросла примерно втрое.
Причём тут агент?
Значительную часть работы сделал Infra Agent на базе GLM-5.3 — то есть модель участвовала в оптимизации системы, на которой сама же работает. Инженеры при этом ставили цели, задавали границы и проверяли критичные изменения. Авторы прямо пишут, что до рекурсивного самоулучшения ещё далеко.
Что за «плотная обратная связь»?
Главная инженерная идея текста. Сквозная метрика вроде «пропускная способность упала на 20 процентов» говорит агенту, что стало хуже, но не говорит почему. Плотная обратная связь — это когда сигнал локален (привязан к ядру, параметру запуска, диапазону выполнения), дёшев и быстр в получении и проверяем объективно.
Что это значит для цены токена?
Что низкая ставка — результат инженерии, а не щедрости. Утроение пропускной способности на том же железе напрямую означает втрое меньшую себестоимость обработки запроса. Об этом полезно помнить, когда сравниваешь ставки разных позиций каталога: за разрывом в десятки раз стоит разная стоимость вычисления.
Какие позиции GLM есть в каталоге KeyDealer?
Три: glm-5-3, glm-5-3-flash и glm-4-6v. Ставки смотрите в каталоге, они публикуются в рублях за миллион токенов. Позиция glm-5-3-flash — это и есть та модель, про инфраструктуру которой написан разбор.
Можно ли переносить выводы на свой проект?
Инженерную часть — да. Идея превращать редкие сквозные метрики в частую привязываемую обратную связь работает на любом агенте, который что-то чинит и оптимизирует. Числа про железо и пропускную способность — нет, это замеры вендора в его собственной конфигурации.