Мир ИИ
Cerebras CS-4: заявка на тридцатикратный отрыв от видеокарт
18 августа Cerebras представила CS-4 — систему на три процессора WSE-3 Turbo с новой архитектурой Nexus. Цифры крупные: 750 петафлопс вычислений, 129,6 петабайта в секунду пропускной способности памяти, 7,2 терабита в секунду ввода-вывода. Сам процессор заявлен как крупнейший из когда-либо построенных для ИИ: 4 трлн транзисторов, 900 тысяч ядер и 44 ГБ памяти прямо на кремниевой пластине площадью около 46 тысяч квадратных миллиметров. Главное заявление — до 30 раз больше токенов в секунду на пользователя, чем у систем на видеокартах, и до 10 раз лучше производительность на ватт по сравнению с предыдущим поколением. Первые поставки обещаны в текущем квартале. Разбираем, что из этого действительно новое и почему это влияет на счёт, который вы получаете за токены.
Что такое процессор размером с пластину
Отличие подхода Cerebras от привычного стоит объяснить, потому что из него следует всё остальное.
Обычные процессоры вырезают из кремниевой пластины десятками. Пластина круглая, чипы прямоугольные, часть выбрасывается по краям, брак отбраковывается. Готовые чипы соединяют между собой платами и кабелями.
Cerebras делает наоборот: чип — это вся пластина целиком. Отсюда и площадь в 46 тысяч квадратных миллиметров против нескольких сотен у обычного ускорителя.
Смысл не в размере ради размера. Когда вычислительные блоки сидят на одном куске кремния, обмен данными между ними идёт по внутренним связям, а не через внешние шины. Это на порядки быстрее и заметно экономичнее по энергии.
Побочный эффект того же решения — память. У CS-4 заявлено 44 ГБ прямо на пластине, и именно это даёт цифру в 129,6 петабайта в секунду. У обычных систем память лежит рядом с чипом, и обращение к ней — главное узкое место.
Почему это важно именно для генерации
Здесь и находится связь с тем, за что вы платите.
Модель генерирует ответ по одному токену за раз. Каждый следующий токен требует прохода по всей сети с учётом того, что уже написано. И на этом проходе узким местом оказывается не скорость счёта, а скорость чтения весов из памяти: вычислительные блоки простаивают в ожидании данных.
Мы это разбирали, когда OpenAI показала ускоренный режим GPT-5.6 Sol — до 750 токенов в секунду. Работает он как раз на железе Cerebras, и выигрыш достигается сдвигом этого ограничения.
Отсюда и характер заявленного превосходства. Тридцатикратный отрыв заявлен по токенам в секунду на одного пользователя — то есть по скорости, с которой конкретный человек получает свой ответ. Это не то же самое, что общая производительность системы: по суммарной пропускной способности при массовой нагрузке картина обычно другая.
Что даёт производительность на ватт
Второе заявленное число — до 10 раз лучше по производительности на ватт против CS-3 — практичнее первого, хотя звучит скучнее.
Электричество входит в себестоимость каждого запроса напрямую. Дата-центр под инференс — это не только стоимость железа, но и счёт за питание с охлаждением, который приходит каждый месяц независимо от загрузки.
Мы вчера разбирали из чего складывается пол цены токена: вычисления, память, простой оборудования и энергия. Улучшение по ваттам бьёт сразу по двум составляющим — и по энергии, и, косвенно, по стоимости мощностей, потому что на ту же подведённую мощность помещается больше работы.
Практический вывод для читателя: снижение цен на токены идёт не рывками, а медленно и вслед за такими улучшениями. Ждать обвала не стоит, но направление устойчивое.
Почему у пластинного подхода есть предел
Раз уж разбираем архитектуру, стоит назвать и её ограничения — иначе картина получится рекламной.
Брак на пластине не отбраковывается. Если чип — это вся пластина, то дефект в любой её точке нельзя обойти выбрасыванием одного кристалла. Приходится закладывать избыточность: часть ядер резервируется, и при обнаружении дефекта работа переносится на запасные. Это работающее решение, но оно означает, что часть кремния всегда простаивает.
Память ограничена площадью. Сорок четыре гигабайта на пластине — много по меркам того, что можно разместить прямо на кристалле, и мало по меркам современных моделей. Веса крупной модели туда целиком не помещаются, а значит нужна либо разбивка между пластинами, либо внешняя память — и часть преимущества теряется.
Гибкость ниже. Видеокарты универсальны: на них учат модели, генерируют картинки, считают физику, майнят что угодно. Специализированное железо под инференс делает одну вещь. Для владельца дата-центра это риск: если профиль нагрузки изменится, универсальное железо переиспользуется, а специализированное нет.
Экосистема меньше. Библиотеки, инструменты, готовые оптимизации и люди, умеющие с этим работать, годами накапливались вокруг одного вендора. Переход на другую архитектуру — это не только закупка, но и переписывание части стека.
Отсюда трезвый прогноз: специализированное железо занимает нишу самых требовательных к скорости сценариев, а основную массу инференса ещё долго будут обслуживать видеокарты. Вытеснения не происходит — происходит расслоение.
Как это выглядит с точки зрения покупателя доступа
Совсем практический разрез, если отвлечься от кремния.
Вам, как покупателю токенов, безразлично, на чём выполняется запрос. Значение имеют три вещи: цена, скорость и доступность. Железо влияет на все три, но по-разному и с разной задержкой.
На цену — медленно и через себестоимость. Улучшение энергоэффективности доходит до прайса через кварталы, пройдя через закупки, амортизацию и конкуренцию.
На скорость — быстро и заметно, но только там, где провайдер этим железом располагает. Сейчас это выборочные режимы для отдельных клиентов, а не общее свойство рынка.
На доступность — непредсказуемо. Дефицит ускорителей уже приводил к ограничениям доступа: Anthropic летом урезала лимиты на своих платных тарифах, когда спрос обогнал мощности. Больше независимых поставщиков железа — меньше вероятность повторения.
Чего в этих цифрах нет
Отделим заявленное от проверенного.
Это заявления производителя. Все числа — из пресс-релиза и материалов Cerebras. Независимых замеров CS-4 на момент публикации нет, и появятся они не сразу.
Сравнение с видеокартами не детализировано в том виде, в каком его можно перепроверить. «До 30 раз» — верхняя граница на определённой конфигурации и определённой нагрузке. Ваша нагрузка может выглядеть иначе.
Поставки только начинаются. Обещаны в текущем квартале, то есть в широком доступе системы окажутся позже.
Цена не объявлена. Ни стоимости системы, ни того, во что обходится токен на этом железе, в доступных материалах нет.
Мы не оценивали архитектуру. Мы описываем событие и его место в общей картине, а не выносим технический вердикт.
Что это значит для рынка железа
Наблюдение, ради которого стоит следить за такими новостями.
Инференс сегодня почти целиком работает на видеокартах Nvidia, и это создаёт зависимость всей отрасли от одного поставщика. Любая альтернатива, даже нишевая, эту зависимость ослабляет.
Показательно, что новость пришла на той же неделе, что и обязательство Nvidia профинансировать до 105 млрд долларов под дата-центр OpenAI в Огайо — со встречным условием использовать там исключительно чипы Nvidia. Два движения в разные стороны за несколько дней: одно закрепляет монополию контрактом, другое подкапывает её архитектурой.
Для вас как для покупателя доступа к моделям исход этой борьбы значит следующее: чем больше конкуренция в железе, тем ниже себестоимость инференса и тем сильнее давление на цены вниз. Монополия в поставках ускорителей отражается на прайсе так же надёжно, как монополия на модели.
Что делать с этой новостью
Практически — ничего срочного, и это честный ответ. Но три вещи стоит держать в голове.
- Скорость ответа — параметр, который скоро станет предметом выбора. Сейчас модели сравнивают по цене и качеству; специализированное железо добавляет третью ось.
- Не планируйте бюджет на резкое удешевление. Улучшения в железе доходят до прайса с задержкой в кварталы, а не недели.
- Проверяйте скорость на своей задаче, а не по анонсам. Как мерить и почему время до первого токена важнее токенов в секунду для интерфейса — в разборе ускоренного режима.
Что держать в голове
Cerebras показала стойку на три пластинных процессора с заявкой на тридцатикратное превосходство по скорости выдачи на пользователя и десятикратное улучшение по энергоэффективности против прошлого поколения.
Для вашего счёта важнее второе число. Скорость меняет круг возможных задач, а энергоэффективность — себестоимость каждого запроса, из которой в конечном счёте и складывается цена токена.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Актуальные ставки по всем позициям каталога отдаёт GET /v1/models: keydealer.ru/login.
Частые вопросы
Что представила Cerebras?
Систему CS-4 на три процессора WSE-3 Turbo с новой архитектурой Nexus. Заявлено 750 петафлопс вычислений, пропускная способность памяти 129,6 петабайта в секунду. Анонс 18 августа 2026 года.
Что за цифра «в 30 раз быстрее»?
Заявленное превосходство по числу токенов в секунду на одного пользователя по сравнению с системами на видеокартах. Это про скорость выдачи ответа, а не про общую производительность.
Что такое WSE-3 Turbo?
Процессор размером с целую кремниевую пластину: 4 трлн транзисторов, 900 тысяч вычислительных ядер и 44 ГБ памяти прямо на пластине. Заявлен как крупнейший процессор для ИИ из когда-либо построенных.
Как это касается цены токена?
Через себестоимость. Заявлено десятикратное улучшение производительности на ватт против предыдущего поколения, а электричество — одна из основных статей расходов на инференс.
Cerebras уже используется в продакшене?
Да. На этом железе работает ускоренный режим GPT-5.6 Sol, показанный OpenAI 13 августа 2026 года.