Мир ИИ

753 млрд параметров на одной карте — с оговоркой

753 млрд параметров на одной карте — с оговоркой

Исследователи UC Berkeley и UT Austin показали движок FreeToken, который запускает разреженные MoE-модели на персональном оборудовании. Заголовочный результат: GLM-5.2 на 753 млрд параметров работает на одной видеокарте. Цифра впечатляющая, и её стоит сразу уточнить, потому что уточнение меняет картину: «одна карта» в самой крупной конфигурации — это профессиональная видеокарта с 96 ГБ памяти, подпёртая 512 ГиБ системной оперативной памяти, а контрольная точка модели весит 433 ГБ. Скорость получилась 14,9 токена в секунду. При этом в меньших конфигурациях результаты действительно домашние: модель на 35 млрд на ноутбучной карте с 8 ГБ и модель на 284 млрд на игровом настольном компьютере. Разбираем, что тут по существу и кому это применимо.

Что именно сделали

Идея, стоящая за движком, простая по формулировке и сложная в исполнении.

Обычный подход считает видеокарту всем компьютером: веса должны поместиться в видеопамять, иначе модель не запустится. Отсюда и потолок — сколько влезло, то и работает.

FreeToken рассматривает машину целиком: видеокарту, процессор, оперативную память и каналы между ними как единую платформу. Веса живут преимущественно в системной памяти, нужные части подгружаются, часть вычислений идёт на процессоре, а распределение работы подстраивается под доступную пропускную способность.

Заявлена поддержка более двадцати открытых MoE-моделей и работа с потребительскими видеокартами трёх последних поколений.

Почему это работает только на разреженных моделях

Ключевое ограничение, объясняющее и возможности, и границы подхода.

В плотной модели на каждый токен работают все параметры. Их нужно прочитать целиком за каждый шаг генерации, и подгрузка из системной памяти убила бы скорость полностью.

В разреженной архитектуре на токен активируется малая доля экспертов — единицы процентов от общего числа параметров. Мы разбирали это на примерах Kimi K3 и DeepSeek V4 Pro: считать вычисления надо по активным параметрам, а не по заголовочным.

Раньше из этого делался вывод, что MoE удешевляет вычисления, но не память: загружать в видеопамять всё равно надо всё, потому что маршрутизатор заранее не знает, что понадобится. FreeToken атакует именно это допущение — держит большую часть в системной памяти и успевает подтянуть нужное вовремя.

Что скрывается за «одной картой»

Раздел, без которого статья была бы пересказом заголовка.

Конфигурация для самого крупного результата: одна профессиональная видеокарта на 96 ГБ плюс 512 ГиБ системной оперативной памяти. Контрольная точка модели — 433 ГБ. Полученная скорость — 14,9 токена в секунду.

Что из этого следует:

Это не домашний компьютер. Полтерабайта оперативной памяти и профессиональная карта — конфигурация рабочей станции стоимостью как автомобиль, а не игрового ПК.

Скорость — на грани комфорта. Пятнадцать токенов в секунду примерно соответствует скорости чтения человека. Для диалога терпимо, для агентской цепочки из двадцати шагов — очень медленно.

Оперативная память становится главным ресурсом. Подход переносит требование с видеопамяти на системную, а её тоже нужно много.

Честности ради: меньшие конфигурации из работы гораздо ближе к реальности. Модель на 35 млрд на ноутбучной карте с 8 ГБ — это уже действительно «дома», и для многих задач такой модели достаточно.

Как считать память под запуск модели

Раз подход меняет прикидку, разберём её целиком — это пригодится независимо от конкретного движка.

Размер весов. Число параметров умножить на объём одного параметра. В половинной точности это два байта, в четырёхбитной квантизации — половина байта. Отсюда четырёхкратная разница между «полная точность» и «сильно ужато», ценой некоторой потери качества.

Память под контекст. Во время генерации хранится промежуточное состояние по всем токенам контекста. Оно растёт с длиной, и на длинных диалогах занимает сопоставимо с самими весами.

Запас на исполнение. Промежуточные вычисления, буферы, фрагментация. Обычно закладывают заметный запас сверх расчёта.

Классический подход требует, чтобы сумма всех трёх поместилась в видеопамять. Подход из этой работы разносит их: веса преимущественно в системной памяти, активная часть и состояние — в видеопамяти.

Практический вывод для того, кто прикидывает закупку: считать надо два числа, а не одно. И второе — объём системной памяти — в конфигурациях под ИИ традиционно экономят, потому что раньше он ничего не решал.

Кому это действительно нужно

Честный разбор аудитории, потому что заголовок обещает больше, чем применимо.

Исследователям и энтузиастам. Возможность потрогать крупную модель без аренды стойки — сама по себе ценность, даже при скромной скорости.

Компаниям с требованием не выпускать данные. Здесь скорость вторична, а возможность запустить сильную модель внутри периметра решает вопрос целиком.

Тем, у кого ровная постоянная нагрузка. Единственный сценарий, где своё железо честно окупается.

Кому не нужно — всем остальным, и это большинство. При неровной нагрузке рабочая станция простаивает большую часть суток, а платите вы за неё круглосуточно. Мы разбирали эту арифметику применительно к видеомоделям и к музыкальным: вывод везде одинаковый и от типа модели не зависит.

Что это меняет практически

Три следствия, по убыванию значимости.

Порог входа в самостоятельный запуск падает. Не до нуля, но заметно. Раньше разговор про запуск крупной открытой модели упирался в парк серверных карт; теперь появляется промежуточный вариант.

Открытые веса становятся полезнее. Мы много раз писали, что открытые веса влияют на рынок через цены, а не через то, что их разворачивают. Инструменты вроде этого сдвигают баланс: разворачивать начинают чаще.

Требования к памяти надо считать заново. Прежняя прикидка «параметры умножить на байты на параметр» перестаёт быть единственной. Появляется вторая ось — сколько системной памяти вы готовы отдать.

Что не меняется: экономика. Рабочая станция стоит денег каждый день, а не только в часы работы. Простой оборудования — по-прежнему главная статья, которую недооценивают в расчётах окупаемости. Для неровной нагрузки API остаётся дешевле независимо от того, насколько ловко модель помещается в память.

Почему такие заголовки стоит читать до конца

Небольшое замечание о жанре, которое пригодится за пределами этой новости.

Формулировка «модель на 753 млрд параметров работает на одной видеокарте» технически верна. Ни одно слово в ней не является ложью. И при этом она создаёт впечатление, прямо противоположное действительности, — потому что умалчивает про полтерабайта оперативной памяти рядом.

Это не упрёк авторам: в самой работе конфигурация описана честно и подробно. Искажение возникает на этапе пересказа, когда из подробного описания берут одну строку.

Практическая привычка, которая от этого спасает, простая: у любого заголовка про запуск большой модели на скромном железе искать, чем именно скромное железо подпёрто. Обычно ответ находится в первом же абзаце оригинала, и обычно он меняет вывод.

Мы применяем то же правило к ценам — и оно так же регулярно срабатывает. Заявленная ставка часто оказывается вводной ценой со сроком, скидкой площадки-посредника или половиной тарифа, действующей до определённой даты.

Чего мы не утверждаем

Мы не воспроизводили результаты. Все цифры — из работы и публикаций, перечисленных в источниках.

Не проверяли качество на меньших конфигурациях. Заявленные запуски на ноутбуке и игровом компьютере мы не тестировали.

Не оцениваем движок технически. Описываем подход и его границы, а не выносим вердикт о реализации.

Скорость зависит от конфигурации. Приведённые 14,9 токена в секунду относятся к конкретной сборке из работы; на другом железе будет иначе, и предсказать это по числу параметров нельзя.

Что держать в голове

Работа показывает, что персональную машину можно рассматривать как единую платформу для инференса, а не как приложение к видеокарте. Для разреженных моделей это снимает жёсткое требование «всё в видеопамять».

Заголовок про 753 млрд на одной карте верен буквально и обманчив по сути: за этой картой стоит полтерабайта оперативной памяти. Реальная новость скромнее и полезнее — крупные открытые модели становятся запускаемыми на оборудовании, которое можно купить, а не арендовать стойкой.

Как мы отделяем проверенное от предполагаемого — на странице о проекте. Модели GLM и другие семейства доступны по одному ключу: keydealer.ru/login.

Частые вопросы

Что такое FreeToken?

Движок для запуска разреженных MoE-моделей на персональном оборудовании, разработанный исследователями UC Berkeley и UT Austin. Использует совместное исполнение на процессоре и видеокарте с адаптацией под пропускную способность.

Что означает «753 млрд на одной карте»?

В работе GLM-5.2 запускалась на одной видеокарте с 96 ГБ памяти, но при поддержке 512 ГиБ системной оперативной памяти. Контрольная точка весит 433 ГБ, скорость составила 14,9 токена в секунду.

На обычном компьютере это заработает?

В меньших конфигурациях — да. Заявлен запуск модели на 35 млрд параметров на ноутбучной видеокарте с 8 ГБ и модели на 284 млрд на игровом настольном компьютере.

Почему это возможно только для MoE?

В разреженной архитектуре на каждый токен работает малая доля параметров. Это позволяет держать большую часть весов в системной памяти и подгружать нужное.

Есть ли GLM-5.2 в каталоге KeyDealer?

Да, вместе с другими моделями семейства GLM. Актуальные ставки отдаёт GET /v1/models.

Источники