Мир ИИ

Яндекс открыл веса AliceAI-Foundation: 80B с нуля

Яндекс открыл веса AliceAI-Foundation: 80B с нуля

21 сентября Яндекс выложил на Hugging Face веса AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0: 80 млрд параметров, из них 3 млрд активных на токен, контекст 262 144 токена, обучение полностью с нуля без весов сторонних опенсорс-моделей. По замерам Яндекса модель обходит свою же прошлую закрытую Alice AI LLM 235B по фактам, математике, коду и длинному контексту — при втрое меньшем общем числе параметров. Подключить её по API нельзя: опубликован претрейн — заготовка под дообучение.

Релиз легко принять за очередной пункт в ленте опенсорса. Он важнее: впервые российская компания показала полный цикл обучения большой модели с нуля и выложила результат под разрешительной лицензией вместе с техническим отчётом на сотню страниц.

Что именно открыл Яндекс 21 сентября

Опубликованы веса базовой модели и технический отчёт к ней. Конкретика из карточки на Hugging Face:

ПараметрЗначение
Всего параметров81,29 млрд (BF16)
Активных на токен3 млрд, это 3,8 %
Длина контекста262 144 токена
Слоёв48
Экспертов в MoE512, top-K 10 плюс один общий
Размер словаря129 024
ЛицензияApache 2.0
Этап обученияпредобучение

Архитектура гибридная: блоки KDA чередуются с Gated Attention, между ними MoE-слои. Вместе с весами выложены два фактологических бенчмарка на русском — WikiWebFacts и HardMultiQA — и протоколы их оценки. В репозитории лежит скрипт LoRA-дообучения и шаблон чата, то есть Яндекс сразу предполагает, что модель будут доучивать.

Что значит «обучена с нуля» и почему это важно

«С нуля» здесь означает, что модель не инициализировали чужими весами: корпус, архитектура и гиперпараметры собраны заново. В прошлый раз было иначе — в декабрьском техотчёте Яндекс описывал, что обучение Alice AI LLM начиналось с весов Qwen3-235B-A22B. На весь путь от старта до релиза ушло около полугода.

Это не единичный заход. Незадолго до этого команда Яндекса открыла претрейн Alice AI Search — и он тоже обучен без весов опенсорс-моделей. Обе модели выросли из одного обновлённого корпуса, которому в отчёте отведён отдельный большой раздел.

Разница здесь не репутационная. Модель, выращенная поверх чужого претрейна, наследует его решения: токенизатор, разметку доменов, перекосы корпуса. Своя сборка с нуля означает, что русский язык и русскоязычные факты попали в корпус не остаточным фоном, а по проекту. Цифры это подтверждают.

Что показали бенчмарки Яндекса

Модель выигрывает на русскоязычных задачах и держится вровень на английских. Дальше цифры, но сначала оговорка, которую Яндекс делает сам: все замеры проведены на его внутренней инфраструктуре, инференс в vLLM, сравнение идёт с базовыми чекпоинтами других моделей. Это честная постановка для претрейна, и переносить эти числа на то, что вы получите от API, нельзя.

Соперники в таблице — Qwen3.5-35B-A3B-Base, GLM-4.5-Air-Base (106B-A12B), Nemotron-3-Super-120B-A12B-Base и DeepSeek-V4-Flash-Base (284B-A13B). Выборка из опубликованного:

БенчмаркAliceAI-FoundationQwen3.5-35BDeepSeek-V4-FlashNemotron-3-Super
WikiWebFacts (рус., факты)86,562,483,272,8
HardMultiQA (рус., факты)67,947,265,454,5
EduBench Russian74,242,967,744,0
ExpertFactsQA Law49,627,940,524,3
MATH-50091,181,980,784,8
ЕГЭ, часть А, CoT90,584,790,384,3
LiveCodeBench v5-650,550,438,150,4
MMLU-Pro CoT66,863,266,569,9

На русскоязычной фактологии разрыв огромный: 30,2 пункта над Nemotron в EduBench Russian, 25,3 пункта над ним же в ExpertFactsQA Law. Ближе всех держится DeepSeek — в WikiWebFacts он отстаёт всего на 3,3 пункта. На английских академических тестах преимущество исчезает совсем: в MMLU-Pro впереди Nemotron. На сложных математических задачах с pass@32 Яндекс приводит HMMT 2026 Feb: 96,9 против 87,9 у Qwen и 66,7 у Nemotron.

Модель заточена под русский контекст и на нём выигрывает. Там, где контекст английский, она примерно в группе.

Чем AliceAI-Foundation отличается от Alice AI LLM 235B

Яндекс пишет, что новая модель превосходит его предыдущую закрытую Alice AI LLM 235B по фактологическим знаниям, математике, программированию и работе с длинным контекстом. При этом общих параметров в ней втрое меньше, а активных — примерно в семь раз.

Для того, кто платит за инференс, вторая часть фразы важнее первой. Стоимость обработки токена задают активные параметры; общий размер модели на неё почти не влияет. Схема 80B-A3B — это качество большой модели по цене маленькой, и именно за этот компромисс сейчас идёт гонка у всех, кто выкладывает открытые веса. Мы разбирали, как вендоры относятся к открытым весам и зачем вообще их публикуют.

Почему базовую модель нельзя просто подключить к продукту

Потому что базовая модель не отвечает на вопросы. Она обучена продолжать текст — и всё. Следовать инструкции, держать формат, останавливаться в конце ответа и отказываться от вредного запроса она не умеет: эти навыки появляются на посттрейне.

Яндекс это не скрывает. В карточке указано «этап обучения: предобучение», агентские навыки он замеряет отдельно и только после SFT, а в репозиторий кладёт скрипт LoRA-дообучения. Выложен фундамент, а не дом.

Релиз адресован тем, кто строит свою модель под свою задачу. Если это ваш случай — у нас есть разбор, что реально значит «обучить нейросеть на своих данных» и во что это обходится. Если вам нужен рабочий ответ в проде на этой неделе, эта новость вас не касается напрямую.

Сколько железа нужно, чтобы поднять 80B у себя

Минимум три ускорителя с 80 ГБ памяти — и это только под веса. Считаем по опубликованному: 81 286 433 408 параметров в BF16, по два байта на параметр, итого 162,6 ГБ, разложенные на 49 файлов.

Дальше начинается то, что в таблицах обычно не показывают. Кэш ключей-значений на контексте в 262 тысячи токенов съедает память сопоставимого порядка. Нужен рабочий инференс-стек — карточка называет vLLM, и модель идёт с custom_code, то есть со своим кодом моделирования. Нужен посттрейн, а это отдельный бюджет на данные и на обучение. И нужен человек, который всё это держит.

Ничего из этого не делает релиз бесполезным. Просто «открытые веса» и «доступ к модели» — разные вещи, и расстояние между ними измеряется в месяцах работы команды.

Какие из этих моделей доступны по API за рубли

Все четыре семейства, с которыми Яндекс себя сравнивал, есть в каталоге KeyDealer — Qwen, Nemotron, DeepSeek и GLM. Сравнить претрейн-чекпоинт с продакшен-моделью нельзя, но проверить, как эти семейства ведут себя на ваших русскоязычных задачах, можно за один вечер и почти без денег.

Модель в каталогеСтавка, ₽ за млн токенов
Nemotron 3 Super0
DeepSeek V4 Flash1
Qwen 3.8 Max3
GLM-5.3 Flash5

Ставка одна для входа и выхода, оплата в рублях, вся тарификация собрана в таблице цен за миллион токенов. Nemotron 3 Super — тот самый Nemotron-3-Super из таблицы Яндекса — в каталоге бесплатный; про линейку мы писали в разборе бесплатного Nemotron 3 Ultra. Qwen появился в каталоге недавно, как он подключается — здесь.

Практический сценарий такой. Возьмите двадцать своих реальных запросов на русском — тех, где важны факты, право или медицина, потому что именно там Яндекс показал самый большой отрыв. Прогоните их через бесплатный Nemotron и через Qwen по 3 ₽ за миллион. Посмотрите, где ломается. Это даст вам собственную цифру вместо чужого бенчмарка, и обойдётся дешевле обеда.

Список доступных позиций всегда живой — его отдаёт GET /v1/models, ключ выдаётся на keydealer.ru/login.

Чего в релизе AliceAI-Foundation нет

Нет instruct-версии, нет публичного endpoint и нет внешней проверки цифр.

  1. Нет instruct-версии. Открыт претрейн. Модели, которая отвечает как ассистент, в публичном доступе нет, и Яндекс не обещал сроков.
  2. Нет публичного endpoint. Финальный чекпоинт можно скачать с Hugging Face — это единственный способ его получить. Платного API под эту конкретную модель Яндекс не анонсировал.
  3. Нет внешней проверки цифр. Замеры внутренние. Два бенчмарка Яндекс открыл, и это больше, чем делает большинство, но остальную таблицу пока подтвердить нечем.

Остаётся главное: в России появился полностью свой претрейн такого класса под Apache 2.0, с отчётом, в котором описаны в том числе неудачные подходы — взрыв лосса после пересчёта гиперпараметров по scaling laws, бесполезность лосса на отложенной выборке как предиктора качества. Такие разделы в релизных постах пишут редко, и читать их полезнее, чем таблицу с победителями. Ближайший по смыслу сюжет у нас — что изменил GigaChat 3.5 с рассуждениями.

А пока эта модель дозревает до продукта, работающие модели с сильным русским берутся по ключу на keydealer.ru/login — с оплатой в рублях и без подбора железа.

Частые вопросы

Что именно открыл Яндекс?

Веса базовой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Это 80 млрд параметров в архитектуре MoE, из которых на каждый токен активируются 3 млрд, контекст до 262 144 токенов. Публикация от 21 сентября 2026 года, веса лежат на Hugging Face вместе с техническим отчётом и двумя фактологическими бенчмарками.

Можно ли подключить AliceAI-Foundation по API?

Нет. Яндекс опубликовал веса, а не endpoint. Это финальный чекпоинт претрейна, то есть заготовка для дообучения, а не готовый чат-ассистент. Чтобы получить из неё отвечающую модель, нужен посттрейн и своя инфраструктура инференса.

Чем базовая модель отличается от той, что отвечает в чате?

Базовая модель умеет продолжать текст и больше ничего. Она не обучена следовать инструкции, держать роль и останавливаться там, где ответ закончен. Всё это появляется на этапе посттрейна: SFT, обучение на предпочтениях, работа с инструментами. Именно поэтому веса претрейна интересны тем, кто строит свою модель, и почти бесполезны тем, кому нужен ответ в проде завтра.

Сколько железа нужно, чтобы запустить её у себя?

Веса опубликованы в BF16, это 81,29 млрд параметров и около 162,6 ГБ только под сами веса, разложенные на 49 файлов. На ускорителях с 80 ГБ памяти это минимум три карты, и это до кэша ключей-значений, который на контексте в 262 тысячи токенов будет заметным. Плюс посттрейн, который считается отдельно.

Насколько можно верить опубликованным цифрам?

Это внутренние замеры Яндекса на его инфраструктуре, и он сам об этом пишет. Сравнение идёт с базовыми чекпоинтами других моделей, а не с их продакшен-версиями. Часть бенчмарков — собственные разработки Яндекса, два из них он открыл вместе с весами, так что их можно перепроверить.

Можно ли использовать AliceAI-Foundation в коммерческом продукте?

Лицензия Apache 2.0 это разрешает: коммерческое использование, модификация и распространение допускаются при сохранении текста лицензии и уведомлений. Ограничение не юридическое, а практическое — открыт претрейн, и до продукта его ещё нужно довести посттрейном и инференс-инфраструктурой.

Что делать, если нужен сильный русский язык прямо сейчас?

Брать то, что уже отвечает по API. Модели тех же семейств, с которыми Яндекс себя сравнивал, есть в каталоге KeyDealer: Qwen, Nemotron, DeepSeek и GLM. Ставки в рублях и список доступных позиций смотрите в GET /v1/models, ключ выдаётся на keydealer.ru/login.

Источники