Релизы и изменения моделей

GPT-5.6 Sol ускорили в 14 раз: 750 токенов в секунду

GPT-5.6 Sol ускорили в 14 раз: 750 токенов в секунду

13 августа OpenAI и Cerebras показали режим Ultrafast для GPT-5.6 Sol: до 750 выходных токенов в секунду, до 14 раз быстрее стандартного режима, и, по заявлению OpenAI, без потери интеллекта модели. Пока это ограниченное превью для отобранных клиентов, доступ расширяется по мере роста мощностей, первым каналом стал API OpenAI. Через посредников такой доступ не передаётся, и в нашем каталоге его нет — обычная gpt-5-6-sol там стоит 40 ₽ за миллион токенов в обе стороны. Но новость стоит разобрать: скорость вывода — единственный параметр, который меняет не цену задачи, а сам список задач, которые вообще имеет смысл ставить.

Что показали

Цифры компактно, потому что их всего две, и обе важные.

ПараметрЗначение
Скорость выводадо 750 токенов в секунду
Ускорениедо 14 раз против стандартного режима
ОборудованиеCerebras
Доступограниченное превью, отобранные клиенты
КаналAPI OpenAI

Слово «до» в обеих строках стоит не случайно — это верхняя граница, а не гарантия. Реальная скорость зависит от длины запроса, нагрузки и того, что именно вы просите сгенерировать.

Откуда берётся ускорение

Дело не в оптимизации кода, а в другой архитектуре железа. И объяснить это стоит, потому что понимание объясняет и границы эффекта.

Обычные ускорители обрабатывают модель по частям: веса лежат в памяти, и на каждый шаг генерации их надо прогонять через вычислительные блоки. При генерации по одному токену за раз это упирается не в скорость счёта, а в скорость доступа к памяти. Процессор простаивает в ожидании данных.

Подход Cerebras — держать модель ближе к вычислительным блокам, за счёт чего узкое место сдвигается. Отсюда и характер прироста: ускоряется именно последовательная генерация, то есть та часть работы, которая на обычном железе хуже всего распараллеливается.

Практическое следствие: выигрыш максимален там, где ответ длинный, и минимален там, где модель отвечает парой слов после огромного контекста. Обработка входа и так шла параллельно и упиралась в другое.

Что скорость меняет на самом деле

Здесь главное не перепутать две вещи, которые часто смешивают.

Скорость не меняет стоимость. Токенов на ту же задачу тратится столько же, тариф от режима не зависит. Быстрее — не значит дешевле.

Скорость меняет список возможных сценариев. И вот это ценно.

При 50 токенах в секунду ответ на 1000 токенов идёт 20 секунд. Пользователь ждёт, смотрит на индикатор, половина уходит, не дочитав. При 750 — тот же ответ приходит за полторы секунды, и это уже другой продукт.

Три класса задач, где разница качественная, а не количественная:

Живой диалог. Голосовые интерфейсы разваливаются на паузах. Задержка в две секунды в разговоре — это провал, а не «немного медленно».

Агентские цепочки. Агент из двадцати шагов при 20 секундах на шаг работает шесть минут. При полутора — двадцать секунд. Первое пользователь не дождётся, второе воспримет как обычную операцию.

Работа с кодом в момент набора. Подсказка, которая приходит после того, как вы дописали строку сами, бесполезна независимо от качества.

Как вообще меряют скорость модели

Раз уж речь о цифрах, стоит разобрать, что именно они означают — иначе сравнивать сообщения разных вендоров бессмысленно.

Скорость описывается двумя разными числами, и путать их дорого.

Время до первого токена. Сколько проходит от отправки запроса до появления первого символа ответа. Сюда входит сеть, очередь на стороне провайдера и обработка всего вашего входного контекста. От длины ответа не зависит вообще.

Токенов в секунду. С какой скоростью идёт генерация после того, как она началась. Именно этот показатель и составляет заявленные 750.

Для интерфейса эти числа значат разное. Пользователь оценивает отзывчивость по первому, а комфорт чтения — по второму. Причём порог по второму ниже, чем кажется: человек читает примерно 15–25 токенов в секунду, и всё, что быстрее, воспринимается как «мгновенно».

Отсюда неочевидное: 750 токенов в секунду нужны не для того, чтобы человек читал быстрее — он не сможет. Они нужны там, где ответ читает не человек, а следующий шаг программы.

Полезно помнить и про третье число, которое в анонсах не приводят: сколько токенов приходится на служебную часть маршрута. Оно влияет на время до первого токена, и разброс тут большой — подробности в отдельном разборе.

Чего в этой новости нет

Отделим факты от того, что легко достроить по заголовку.

Нет общего доступа. Ограниченное превью для отобранных клиентов. Не тариф, который можно оплатить, а список, в который надо попасть.

Нет доступа через посредников. Режим выдаёт OpenAI напрямую. Ни один сервис, включая наш, не может его перепродать, и обещания обратного стоит считать признаком непонимания предмета — ровно как в истории с программой Daybreak и моделями без фильтров.

Нет нашей проверки заявленных цифр. 750 токенов в секунду и 14 раз — из публикаций OpenAI и Cerebras. Своего замера у нас нет и быть не может: режима у нас нет.

Нет данных о цене. Во что обойдётся Ultrafast, когда выйдет из превью, в доступных материалах не описано. Исторически ускоренные режимы стоят дороже обычных, но переносить это ожидание на конкретный случай мы не будем.

Нет обещания, что режим доедет до всех. Формулировка про расширение доступа по мере роста мощностей — это про планы, а не про сроки. Мощности Cerebras конечны, и очередь на них выстроится не только из желающих.

Нет данных о том, как это скажется на остальных. Если часть нагрузки уезжает на отдельное железо, обычной инфраструктуре становится свободнее — но подтверждений этому в анонсе нет, и мы это не измеряли.

Что доступно сейчас

Практическая часть для тех, кому нужна не новость, а решение.

Обычная gpt-5-6-sol в каталоге есть и работает: 40 ₽ за миллион входных и выходных токенов, protocols.chat_completions открыт. Рядом в том же семействе gpt-5-6-terra по 30 ₽ и gpt-5-6-luna по 8 ₽ — разбор различий между ними мы делали, когда расширялся доступ к линейке 5.6.

Если ваша задача упирается именно в скорость, а не в качество рассуждений, порядок действий такой:

  1. Замерьте, где именно теряется время. Часто это не генерация, а ваша собственная обвязка: последовательные запросы там, где можно параллельно.
  2. Попробуйте модель поменьше. Разрыв в скорости между флагманом и лёгкой моделью того же семейства обычно больше, чем разрыв в качестве на простых задачах.
  3. Включите потоковую передачу. Первый токен приходит на порядок раньше полного ответа, и для интерфейса это часто важнее общей длительности.
  4. Сократите то, что генерируется. Просьба ответить короче ускоряет ответ ровно пропорционально — и заодно удешевляет его.
  5. Уберите лишние шаги рассуждения там, где они не нужны. Модель, которая думает перед ответом, тратит на это выходные токены и время. На простых задачах это чистые потери.

Первый пункт стоит развернуть, потому что выигрыш там обычно больше всего. Типичная агентская цепочка выглядит как последовательность: спросили модель, получили ответ, сходили в базу, снова спросили. Половина шагов в таких цепочках не зависит друг от друга и может идти одновременно — но пишутся они последовательно, потому что так проще читать код. Переделка на параллельные запросы часто даёт больше, чем любая смена модели.

Что держать в голове

OpenAI и Cerebras показали режим до 750 токенов в секунду и до 14 раз быстрее обычного, пока в закрытом превью. Скорость вывода — параметр, который не удешевляет задачи, а расширяет их круг: голос, агенты, подсказки в момент набора.

Пока режим недоступен, самый быстрый способ ускорить свою интеграцию лежит не в выборе модели, а в потоковой передаче, в длине ответа и в параллельных запросах вместо последовательных. Эти три вещи доступны сегодня и не требуют ничьего разрешения.

Как мы отделяем проверенное от предполагаемого — на странице о проекте. Вся линейка 5.6 доступна по ключу, который заводится за минуту: keydealer.ru/login.

Частые вопросы

Что такое режим Ultrafast?

Режим ускоренного вывода для GPT-5.6 Sol, работающий на оборудовании Cerebras. Скорость — до 750 выходных токенов в секунду, до 14 раз быстрее стандартного режима.

Кому он доступен?

На 14 августа 2026 года это ограниченное превью для отобранных клиентов OpenAI, доступ расширяется по мере роста мощностей. Первым каналом стал API OpenAI.

Ultrafast доступен через KeyDealer?

Нет. Режим выдаётся OpenAI напрямую отобранным клиентам, через посредников доступ не передаётся. Обычная GPT-5.6 Sol в каталоге есть, ставка 40 ₽ за миллион входных и выходных токенов.

Модель в этом режиме стала хуже?

По заявлению OpenAI ускорение достигнуто без потери интеллекта модели. Самостоятельно мы это не проверяли.

Зачем вообще нужна такая скорость?

Она меняет не стоимость, а то, какие сценарии вообще возможны: живой диалог без пауз, агентские цепочки из десятков шагов, работа с кодом в момент набора.

Источники