Мир ИИ

ByteDance обучает модель на 10 трлн параметров

ByteDance обучает модель на 10 трлн параметров

7 августа 2026 года Financial Times сообщила со ссылкой на три источника, знакомых с проектом, что ByteDance ведёт предобучение модели величиной до 10 триллионов параметров. Предобучение рассчитано на три-шесть месяцев, дата выпуска не называется, официального анонса компания не делала. Для масштаба: отраслевые оценки помещают Mythos 5 примерно в 8 триллионов, а Fable 5 — около 5 триллионов, и несколько китайских лабораторий работают в диапазоне около пяти. Разработчику, который платит за токены, из этой новости полезно ровно одно: гонка за размером идёт наверху прайса, а не внизу, и на стоимость дешёвых моделей она не влияет.

Разберём, что подтверждено, зачем эта гонка вообще идёт и почему число параметров плохо помогает выбирать модель.

Что именно сообщается

Сначала аккуратно отделим факты от того, что легко додумать.

УтверждениеСтатус
ByteDance ведёт предобучение модели до 10 трлн параметровСообщение Financial Times от 07.08.2026 со ссылкой на три источника
Предобучение занимает от трёх до шести месяцевТам же
Проект нацелен на масштаб уровня MythosТам же, как оценка издания
ByteDance подтвердила проект публичноНет. Официального анонса не было
Известна дата выпускаНет
Известно, будет ли модель доступна через APIНет

Отдельно про цифру. В некоторых пересказах фигурирует 5 триллионов — это относится не к проекту ByteDance, а к масштабу, в котором работают несколько китайских лабораторий, и к оценке Fable 5. Разница между «5» и «до 10» существенная, и она возникает именно при пересказе.

Мы столкнулись с этим на себе: в план темы цифра попала как 5 триллионов со ссылкой на телеграм-канал. Проверка по изданиям показала другое число. Это ровно тот случай, ради которого мы каждый факт проверяем у первоисточника, а не берём из ленты.

Зачем гонка за параметрами

Число параметров — это ёмкость модели, то есть сколько закономерностей она в принципе способна удержать. Больше параметров означает больший потолок качества, но не автоматически лучший результат.

На итог влияют минимум три вещи помимо размера: объём и качество данных, метод обучения и дообучение под конкретные задачи. Модель на 10 триллионов параметров, обученная плохо, проиграет модели на 2 триллионах, обученной хорошо.

Почему тогда все гонятся за числом. Причин две, и обе не про качество напрямую.

Позиционирование. Размер — единственная характеристика, которую можно назвать до выпуска. Бенчмарки появятся потом, а число параметров работает как заявка на серьёзность намерений уже сейчас.

Ставка на масштабирование. Эмпирика последних лет показывала, что качество растёт с размером предсказуемо. Пока эта зависимость держится, крупные лаборатории вкладываются в размер как в наиболее надёжный путь.

Что такое предобучение и почему оно длится месяцами

Короткое пояснение к сроку из новости, потому что он часто вызывает вопросы.

Предобучение — это первый и самый дорогой этап: модель прогоняют по огромному корпусу текста, чтобы она усвоила язык и закономерности в данных. На этом этапе она ещё не умеет следовать инструкциям и вести диалог, это приходит позже, на дообучении.

Три-шесть месяцев — это время работы кластера ускорителей без перерыва. Отсюда две вещи, которые полезно понимать.

Первая: остановиться и переиграть решение посреди предобучения дорого. Поэтому архитектуру и состав данных фиксируют заранее, и модель, которая выйдет через полгода, отражает представления команды о правильном на момент старта.

Вторая: между началом предобучения и доступностью модели в API проходит существенно больше времени, чем длится сам этап. Дообучение, оценки безопасности, инфраструктура для обслуживания — всё это добавляется сверху. Новость про начало обучения не означает скорого появления модели у вас в каталоге.

Почему это не двигает цену вашего токена

Здесь стоит быть точным, потому что связь кажется очевидной, а её нет.

Крупные модели всегда дороже в обслуживании: больше параметров означает больше памяти ускорителя и больше вычислений на каждый токен. Поэтому в любом прайсе они стоят наверху.

Но появление новой большой модели у одного вендора не удешевляет и не удорожает модели других. Цена определяется себестоимостью обслуживания конкретной модели и конкурентной ситуацией в её сегменте, а не рекордами соседей.

Разброс в каталоге на 10 августа 2026 года это хорошо показывает:

МодельСтавка за 1 млн, вход и выход
GLM-4.73 ₽
GPT-OSS 120B5 ₽
Sonnet 530 ₽
GPT-5.6 Sol40 ₽
Opus 530 ₽

Шестнадцатикратный разрыв между краями существует независимо от того, кто и какую модель сейчас обучает. Дешёвый сегмент живёт своей жизнью — подробнее в разборе про то, как позиция вендоров по открытым весам влияет на цену.

Почему число параметров плохо помогает выбирать

Практическая часть, ради которой эту новость вообще стоит читать разработчику.

Число параметров почти никогда не публикуется для закрытых моделей. Оценки, которые ходят по лентам, — это оценки. Строить на них выбор нельзя, потому что сравнивать вы будете не модели, а чужие догадки.

Размер не сообщает ни цены, ни скорости, ни лимитов. А выбирают обычно по ним. Модель, которая отвечает вдвое медленнее, ломает пользовательский сценарий независимо от того, сколько в ней параметров.

Качество на вашей задаче не выводится из общих характеристик. Двадцать реальных запросов через две модели дают ответ, которого не даст ни один обзор.

Полезнее смотреть на три проверяемых числа: ставку за миллион токенов, объём служебного контекста маршрута и статус нужных вам возможностей — подтверждено пробой, не поддерживается или не проверено. Все три возвращает GET /v1/models.

Что смотреть вместо числа параметров

Три характеристики, которые реально влияют на решение и при этом публикуются.

Ставка за миллион токенов. Определяет счёт напрямую и известна до первого запроса. В каталоге она видна в GET /v1/models, у вендоров — на страницах тарифов.

Объём контекста. Сколько текста модель принимает за раз. Здесь важна не только цифра, но и то, как она тарифицируется: у части вендоров ставка удваивается после порога, разбор в материале про то, почему цена удваивается после 200 тысяч токенов.

Статус нужных возможностей. Работают ли инструменты, потоковый режим, структурированный вывод. У нас у каждой возможности есть один из трёх статусов: подтверждено пробой, не поддерживается, не проверено. Третье за первое не выдаём.

Ни одна из трёх не выводится из числа параметров, и все три доступны до того, как вы напишете первую строку кода.

Что это значит для рынка в целом

Осторожное наблюдение, а не прогноз.

Если модель такого масштаба выйдет и окажется удачной, она попадёт в верхний сегмент прайсов — туда, где сейчас Opus 5 и GPT-5.6 Sol. Нижний сегмент от этого не изменится: там работают модели совсем другой размерности, и конкуренция в нём идёт между открытыми весами.

Что действительно может измениться — распределение задач. Каждый раз, когда верхний сегмент становится сильнее, часть сложных задач переезжает туда с середины, а часть задач середины уходит вниз. Так уже происходило: то, для чего два года назад требовалась самая дорогая модель, сегодня решается моделью за 4 ₽ за миллион.

Планировать под это стоит не выбором конкретной модели, а способностью её менять: имя в конфигурации, один слой обращений к API, запасной вариант в другом семействе.

Что держать в голове

Financial Times сообщает, что ByteDance ведёт предобучение модели до 10 триллионов параметров, три-шесть месяцев, без даты выпуска и без официального подтверждения компании.

Цифра 5 триллионов, которая ходит в пересказах, относится к другим проектам. Разница возникла при передаче — хорошее напоминание проверять числа у издания, а не в ленте.

Для практики вывод короткий: гонка за размером идёт в верхнем сегменте прайса и на стоимость дешёвых моделей не влияет. Выбирать модель по числу параметров бессмысленно, потому что для закрытых моделей это число обычно неизвестно, а на результат влияют другие вещи.

Пересчёт официальных ставок в рубли — в опорной статье, сколько стоит 1 млн токенов. Что уходит в модель помимо промпта — в разборе служебного контекста маршрута. Как мы проверяем факты — на странице о проекте.

Один ключ ко всему каталогу, чтобы сравнивать модели на своих задачах, а не по числу параметров: keydealer.ru/login.

Частые вопросы

Сколько параметров у модели ByteDance?

По сообщению Financial Times от 7 августа 2026 года со ссылкой на три источника, знакомых с проектом, речь идёт о предобучении модели на величину до 10 триллионов параметров. Официального анонса ByteDance не делала.

Сколько это займёт времени?

По тому же сообщению предобучение рассчитано на срок от трёх до шести месяцев. Дата выпуска не называется.

Значит ли больше параметров лучше качество?

Не напрямую. Число параметров определяет ёмкость модели, но на итоговое качество влияют данные, метод обучения и дообучение. Сравнивать модели по одному этому числу некорректно.

Как это влияет на цену токена для разработчика?

Крупные модели дороже в обслуживании, поэтому в прайсах они всегда наверху. Но появление новой большой модели у одного вендора не двигает цены у остальных автоматически.

Источники