Мир ИИ
Чип OpenAI против Nvidia: 1,9× на ватт и 3,6× по задержке
25 августа OpenAI опубликовала первые замеры Jalapeño — своего чипа для инференса. На публичном бенчмарке InferenceX от SemiAnalysis чип показал от 1,5 до 1,9 раза больше работы на ватт при пиковой пропускной способности и от 1,7 до 3,6 раза меньшую сквозную задержку, чем системы на Nvidia GB200 и GB300. Паспортная мощность — 700 Вт против 1200 и 1400 Вт у систем сравнения, измеренное устойчивое потребление держалось на 550 Вт. Развёртывание внутри инфраструктуры OpenAI обещано до конца 2026 года. Оговорка, которую стоит держать рядом с цифрами: замеры провела и опубликовала сама OpenAI, независимой проверки пока нет, а результаты на собственных фронтир-моделях компания не раскрывает. На цену запроса в прайсе это событие сегодня не влияет никак — но влияет на то, из чего эта цена будет складываться через год.
Что показал чип OpenAI в первых замерах
На трёх открытых моделях Jalapeño выдал от 1,5 до 1,9 раза больше токенов на киловатт, чем системы сравнения. Замеры сделаны в режиме 8 тысяч входных токенов на 1 тысячу выходных. Все числа — из приложения к публикации OpenAI.
| Модель | Система сравнения | Пик, смешанных токенов на кВт | Отрыв |
|---|---|---|---|
| GPT-OSS 120B | GB200, 1200 Вт | 85 448 против 44 960 | ≈1,9× |
| DeepSeek R1 670B | GB300, 1400 Вт | 19 641 против 11 781 | ≈1,7× |
| Kimi K2.5 1T | GB300, 1400 Вт | 18 195 против 11 862 | ≈1,5× |
По задержке разрыв шире, и он растёт вместе с размером модели.
| Модель | Сквозная задержка | Отрыв | Минимальное время между токенами | Токенов в секунду на пользователя |
|---|---|---|---|---|
| GPT-OSS 120B | 1,03 с против 1,80 с | ≈1,7× | 0,69 против 1,87 мс | 1459 против 535 |
| DeepSeek R1 670B | 1,65 с против 5,99 с | ≈3,6× | 1,43 против 5,90 мс | 700 против 169 |
| Kimi K2.5 1T | 1,56 с против 5,31 с | ≈3,4× | 1,44 против 5,48 мс | 694 против 182 |
Пересчитал отношения по опубликованным абсолютным числам — сходятся до второго знака. Это не всегда так с корпоративными пресс-релизами, и здесь проверка проходит.
На чём именно замеряли и почему выбор бенчмарка важен
InferenceX — публичный бенчмарк SemiAnalysis, который меряет полный путь обслуживания запроса — от прихода промпта до последнего токена ответа. Выбор внешнего и открытого инструмента — сильная часть публикации: методику можно посмотреть, режимы воспроизвести.
Три модели тоже выбраны небанально: GPT-OSS 120B — своя открытая, DeepSeek R1 670B и Kimi K2.5 1T — чужие. OpenAI отдельно подчёркивает, что архитектура работает на моделях, разработанных и внутри компании, и снаружи. Для чипа, спроектированного под конкретный класс нагрузок, это существенно: легко построить ускоритель, который блестит на одной архитектуре и проваливается на соседней.
Почему считают на ватт, а не на чип
OpenAI прямо оговаривает выбор метрики: производительность иногда сообщают в расчёте на чип, но компания считает более полезным стандартом производительность на единицу мощности.
Позиция понятная. Дата-центр упирается в мегаватты, подведённые к площадке. Ускорителей можно закупить сколько угодно — питать их нечем. Когда энергия становится жёстким потолком, вопрос «сколько ответов в секунду выдаёт один чип» теряет смысл рядом с вопросом «сколько ответов выдаёт стойка на том же электричестве». Механику того, как это доходит до счёта клиента, мы разбирали на примере Cerebras CS-4.
Где в этих цифрах слабое место
Четыре оговорки, которые стоит держать рядом с процентами.
- Замеры провела и опубликовала сама OpenAI. Бенчмарк публичный, результаты — нет. Независимого прогона на том же железе никто пока не показал.
- Нормировка идёт по паспортной мощности. OpenAI пишет об этом открыто: результаты приведены к опубликованному рейтингу мощности каждого ускорителя. При этом измеренное устойчивое потребление Jalapeño держалось на 550 Вт при паспортных 700 — на 21% ниже. Если бы нормировали по фактическому потреблению обеих сторон, картина изменилась бы, и неизвестно в какую сторону: фактическое потребление систем Nvidia в публикации не приводится.
- Самые эффектные множители — узкие. Цифры вроде 53,7× и 104,3× описывают узкий срез: пропускную способность при том же времени между токенами, которого система сравнения раньше достигала на пределе. Это честно подписано в приложении, но легко выдёргивается из контекста.
- Фронтир-модели не показаны. OpenAI сообщает, что во внутреннем тестировании отрыв на её собственных передовых моделях становится больше. Числа не публикуются, проверить это нельзя.
Партнёра по производству публикация не называет. Tom's Hardware и другие издания называют Broadcom, но со ссылкой на свои источники, а не на заявление компании — стадию стоит различать.
Сколько времени заняла разработка и при чём тут сам ИИ
От первого варианта архитектуры до tapeout прошло девять месяцев. Для заказного ускорителя это очень быстро, и OpenAI объясняет скорость тем, что модели участвовали в разработке: перебирали варианты реализации, укорачивали циклы проверки, оптимизировали арифметические блоки.
Вторая часть истории интереснее первой. Чип спроектирован так, чтобы его было удобно программировать не только человеку: работа описывается через локальные тензоры, явную коммуникацию и предсказуемую синхронизацию, а раскладку и планирование берёт на себя модель.
| Что сделали | Результат |
|---|---|
| Три открытые модели вне исходного плана | доведены до высокой производительности за два месяца |
| Отдельные блоки внимания и MoE у GPT-OSS | сгенерированные ИИ реализации в 1,5–1,8 раза быстрее написанных экспертами |
Второй результат OpenAI подписывает честно: цифры относятся к выбранным блокам, а не ко всей модели. Поддержка каждого нового семейства по-прежнему требует новых ядер и ручной работы.
Когда чип доедет до прода и что будет с Nvidia
Развёртывание внутри инфраструктуры OpenAI обещано до конца 2026 года. Второе поколение, по словам компании, находится в глубокой разработке, третье — в стадии проектирования.
При этом OpenAI отдельно проговаривает, что продолжит широко закупать ускорители Nvidia и других партнёров и для обучения, и для инференса. Замены не происходит: добавляется собственный источник мощности. Смотреть на это стоит вместе с вложением Nvidia в OpenAI на 105 млрд долларов — отношения двух компаний устроены сложнее, чем «конкуренты».
Своё железо строит не одна OpenAI. У Anthropic это пока стадия переговоров с Samsung, и разницу в стадиях стоит держать в голове: там переговоры, здесь работающий кремний с опубликованными замерами.
Как производительность на ватт превращается в цену токена
Эффективность на ватт снижает себестоимость ответа, но до прайса доходит не сама собой. Цепочка длиннее, чем кажется. Себестоимость одного ответа складывается из амортизации железа, электричества, охлаждения, площадки и инженеров. Эффективность на ватт бьёт по двум статьям сразу — по электричеству напрямую и по железу через плотность.
Дальше цепочка обрывается. Цена в прайсе — решение компании, а не производная от себестоимости: она зависит от конкуренции, стадии продукта и того, сколько компания готова вложить в захват рынка. Ровно поэтому промо-цена GPT-5.6 Sol живёт своей жизнью и имеет собственную дату окончания.
Есть и второй путь, по которому эффективность доходит до разработчика раньше цены — скорость. Когда ответ приходит за 1,03 секунды вместо 1,80, меняется список сценариев, которые вообще имеет смысл ставить, а смета остаётся прежней. Мы разбирали это на примере ускоренного режима GPT-5.6 Sol: скорость вывода — единственный параметр, который меняет осуществимость задачи, оставляя её стоимость на месте.
Что это меняет для вашего счёта в рублях
Сегодня — ничего, и говорить иначе было бы враньём. Ни одна ставка каталога с этим событием не связана: чип ещё не в проде даже у самой OpenAI.
Что на счёт влияет уже сейчас:
- Ставка каталога на день расчёта. Она публикуется в ответе
GET /v1/modelsв рублях, отдельно вход и выход. Все рублёвые цифры собраны в хабе сколько стоит миллион токенов. - Служебный контекст маршрута. К вашему промпту добавляется системный контекст, и он попадает в
prompt_tokens. Оценка объёма публикуется вместе с датой измерения, а авторитетным для списания остаётсяusageв завершённом ответе. - Отсутствие скидки за кэш. У всех позиций каталога
prompt_cache.statusравенunsupported, поэтому повторная отправка одного и того же контекста считается заново.
Одна конкретная связка всё же есть. GPT-OSS 120B — та самая модель, на которой мерили чип, — лежит в каталоге по 5 ₽ за миллион токенов в обе стороны и относится к нижней части платного прайса. Прогнать на ней свой реальный запрос и посмотреть фактический usage можно сегодня, не дожидаясь конца года. Ключ выдаётся в личном кабинете сразу после регистрации.
Что проверять, когда чип доедет до прода
Три конкретных сигнала, за которыми стоит следить, — они отличают настоящее удешевление от пресс-релиза.
Независимый прогон на InferenceX. Бенчмарк публичный, и рано или поздно кто-то повторит замеры на том же железе. До этого момента корректная формулировка звучит как «по данным OpenAI». Без этой приставки утверждение повисает.
Движение в прайсе, а не в анонсе. Развёртывание до конца года и снижение цены — разные события, и второе может не наступить вовсе. Проверяется одним способом: открыть страницу тарифов вендора. Заголовки тут не считаются.
Фактическое потребление в цифрах. Если OpenAI или независимые тестировщики опубликуют реальные ватты обеих сторон, множители пересчитаются. Пока нормировка идёт по паспортным рейтингам, любой процент здесь остаётся верхней оценкой.
И отдельно то, о чём в подобных новостях думают в последнюю очередь. Выигрыш на ватт достаётся тому, кто владеет железом, а разработчику он передаётся только через решение вендора о цене. За последние полгода этот механизм срабатывал в обе стороны: у одних вендоров цены падали, у других росли на той же самой волне разговоров про эффективность. Планировать бюджет стоит по числу в ответе API, а не по обещанию в блоге производителя чипов.
Частые вопросы
Что такое Jalapeño?
Первый собственный чип OpenAI для инференса — то есть для выдачи ответов уже обученной моделью, не для обучения. Первые замеры опубликованы 25 августа 2026 года, развёртывание в инфраструктуре OpenAI обещано до конца года.
Насколько Jalapeño быстрее решений Nvidia?
По замерам самой OpenAI на трёх открытых моделях — от 1,5 до 1,9 раза больше работы на ватт при пиковой пропускной способности и от 1,7 до 3,6 раза меньше сквозная задержка. На интерактивных нагрузках компания заявляет отрыв от 2,1 до 4,1 раза.
На каком бенчмарке это измерено?
На InferenceX — публичном бенчмарке SemiAnalysis, который меряет весь путь обслуживания запроса. Модели: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T, режим 8k входных на 1k выходных токенов.
В чём слабое место этих цифр?
Замеры сделаны и опубликованы самой OpenAI, независимого подтверждения пока нет. Нормировка идёт по паспортной мощности чипов, хотя измеренное потребление Jalapeño держалось на 550 Вт при паспортных 700. Результаты на своих фронтир-моделях компания не публикует.
Сколько потребляет Jalapeño?
Паспортные 700 Вт против 1200 Вт у GB200 и 1400 Вт у GB300. Измеренное устойчивое потребление на тестовых нагрузках держалось на уровне 550 Вт и ниже.
Кто производит чип?
В публикации OpenAI партнёр по разработке не назван. В отраслевой прессе называют Broadcom — со ссылкой на источники, а не на заявление компании.
Подешевеют ли из-за этого API-запросы?
Прямой связи нет. Чип снижает себестоимость инференса у OpenAI, но цена в прайсе — отдельное решение компании. На 26 августа 2026 года ни одна ставка каталога KeyDealer с этим событием не связана.
Что из бенчмарка есть в каталоге KeyDealer?
GPT-OSS 120B — одна из трёх моделей, на которых мерили чип. В каталоге она идёт по 5 ₽ за миллион токенов в обе стороны.