Релизы и изменения моделей

Gemini 3.8 Live: сколько стоит минута голосового агента

Gemini 3.8 Live: сколько стоит минута голосового агента

15 сентября Google выпустила две модели для живого голосового диалога — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе доступны в Gemini API под идентификаторами gemini-3.8-live и gemini-3.8-live-extended-thinking и помечены как Stable. Прайс у них общий: $3,00 за миллион входных аудиотокенов и $12,00 за миллион выходных, либо поминутная тарификация — $0,005 и $0,018 за минуту. По курсу ЦБ на 16 сентября (84,2362 ₽ за доллар) минута разговора, где по минуте говорят обе стороны, стоит 1,94 ₽. В каталоге KeyDealer этих моделей нет: живой GET /v1/models на 16 сентября не отдаёт ни одной аудиопозиции.

Что именно выпустила Google 15 сентября

Две модели, обе через Live API, обе уже в Google AI Studio:

МодельИдентификаторДля чего
Gemini 3.8 Livegemini-3.8-liveМассовые голосовые сценарии: быстрый диалог без пауз на размышление
Gemini 3.8 Live Extended Thinkinggemini-3.8-live-extended-thinkingСложные задачи: многошаговые рассуждения прямо во время разговора

В списке моделей Gemini API обе помечены как New и Stable. Рядом в том же семействе числится текстовая gemini-3.8-flash — тоже с пометкой New.

Главное отличие от привычной схемы: это audio-to-audio. Модель принимает звук и отдаёт звук, без промежуточной расшифровки в текст на вашей стороне. Из заявленного в анонсе Google: 97 языков с автоматическим переключением посреди разговора, разбор картинки с камеры почти в реальном времени и вызов инструментов в фоне — модель подтверждает запрос и продолжает говорить, пока задача выполняется.

Extended Thinking добавляет к этому то, что Google называет ранними голосовыми сигналами: «Сейчас посмотрю…» вместо мёртвой паузы, пока идёт рассуждение. Весь звук, который порождают модели, помечен водяным знаком SynthID.

Сколько стоит Gemini 3.8 Live по прайсу Google

Аудио стоит $3,00 за миллион входных токенов и $12,00 за миллион выходных — по курсу ЦБ на 16 сентября 2026 года это 252,71 ₽ и 1010,83 ₽. Текст в том же API вчетверо дешевле на входе: $0,75 и $4,50. Тарифы со страницы цен Gemini API.

Одна оговорка: у Google одна таблица на три модели сразу — gemini-3.8-live, gemini-3.8-live-extended-thinking и gemini-3.1-flash-live-preview. Отдельной строки под каждую позицию там нет, то есть более умная Extended Thinking стоит столько же, сколько базовая.

Пересчёт по курсу ЦБ на 16 сентября 2026 года — 84,2362 ₽ за доллар.

Что тарифицируетсяУ GoogleВ рублях
Вход, текст, за 1M$0,7563,18 ₽
Вход, аудио, за 1M$3,00252,71 ₽
Вход, изображение и видео, за 1M$1,0084,24 ₽
Выход вместе с токенами размышления, текст, за 1M$4,50379,06 ₽
Выход, аудио, за 1M$12,001010,83 ₽

Два соотношения, без которых бюджет посчитается неправильно. Аудио на входе ровно вчетверо дороже текста. Выход дороже входа в шесть раз по тексту — и туда же попадают токены размышления, за которые вы платите по ставке выхода, даже если пользователь их не слышал.

Есть и бесплатный уровень: в таблице Google он помечен как Free of charge с отметкой, что данные с него используются для улучшения продуктов. Для прода это дисквалифицирующее условие, для прототипа — нет.

Сколько стоит минута разговора с голосовым агентом

Минута разговора, где обе стороны говорят по минуте, стоит 1,937 ₽ — это $0,023 по прайсу Google на 16 сентября 2026 года. Разговор на десять минут обойдётся в 19,37 ₽, тысяча пятиминутных — в 9687 ₽. Поминутная тарификация удобна тем, что её не нужно переводить в токены.

Что считаемУ GoogleВ рублях
Минута входящего аудио$0,0050,421 ₽
Минута видео или картинки с камеры$0,0020,168 ₽
Минута исходящего аудио$0,0181,516 ₽

Цифра честная только при допущении, что стороны говорят поровну. В реальной поддержке агент обычно говорит больше человека, а раз выход дороже входа в 3,6 раза, реальный счёт съезжает вверх. Считайте по исходящему аудио, а входящее закладывайте как добавку.

Отдельная строка, про которую забывают: заземление на поиск Google. Пять тысяч запросов в месяц бесплатно на все модели Gemini 3.x вместе, дальше $14 за тысячу — это 1179 ₽ за тысячу, или 1,18 ₽ за один поисковый вызов. Голосовой агент, который лезет в поиск на каждой второй реплике, легко удвоит себе стоимость минуты.

Какие результаты Gemini 3.8 Live показала в бенчмарках

Лучший заявленный результат — 82,6 балла и первое место в Artificial Analysis Speech to Speech Quality Index у 3.8 Live Extended Thinking. Все цифры ниже — из анонса Google от 15 сентября 2026 года, то есть замеры вендора о собственной модели. Внешнего подтверждения у нас нет, читать их стоит именно так.

БенчмаркРезультат 3.8 Live Extended Thinking
Artificial Analysis Speech to Speech Quality Index82,6 — первое место
τ-Voice, выполнение агентных задач68,6 %
Sierra τ-Voice-banking35,1 %
Big Bench Audio97,7 %

Базовая 3.8 Live, по словам Google, заняла второе место в Speech Agent Arena. Самая честная строка здесь — банковская. 35,1 % на τ-Voice-banking — это доля доведённых до конца задач: две трети сценариев агент не закрывает. Для голосовой поддержки, где ошибка стоит денег, это аргумент за подтверждение на каждом шаге, который двигает деньги.

Есть ли Gemini 3.8 Live в каталоге KeyDealer

Нет, и не только она. На 16 сентября 2026 года живой GET /v1/models не отдаёт ни одной аудиомодели — ни распознавания речи, ни синтеза, ни audio-to-audio. Каталог состоит из текстовых маршрутов, генерации изображений и одной модели переранжирования.

Семейство Gemini в каталоге представлено текстом:

ИдентификаторСтавка за 1M, вход и выходСтатус
gemini-3-flash6 ₽available
gemini-3-7-flash-tiered6 ₽available
gemini-3-1-flash-lite8 ₽available
gemini-3-7-flash8 ₽available
gemini-3-1-pro17 ₽available
gemini-3-6-flash8 ₽ещё не открыт

Ставки взяты из живой выдачи на день написания и могут меняться. Актуальное значение лежит в GET /v1/models; статья — снимок на свою дату. Полная рублёвая картина по всем семействам собрана в материале про стоимость миллиона токенов. Даты отключения моделей, когда вендоры их публикуют, живут в календаре отключений; для 3.8 Live такой даты в открытой документации нет.

Как собрать голосового агента, если audio-to-audio недоступен

Работающий ответ — трёхслойная схема, та самая, на которой голосовые боты жили до появления сквозного аудио:

  1. Распознавание речи. Звук от пользователя превращается в текст. Берётся отдельным сервисом — в каталоге KeyDealer его нет.
  2. Ядро диалога. Текстовая модель держит контекст, решает, что ответить, и дёргает ваши инструменты. Вот этот слой закрывается ключом KeyDealer полностью.
  3. Синтез речи. Текст ответа превращается обратно в звук. Тоже отдельный сервис.

Чем схема хуже Live API: задержкой и интонацией. Сквозная модель слышит, как человек сказал фразу, и отвечает быстрее, потому что не ждёт полной расшифровки. Трёхслойная слышит только то, что распознаватель написал буквами.

Чем лучше: ядро дешевеет в разы, и его можно поменять, не трогая остальное. По прайсу Google текстовый обмен в Live API стоит $0,75 за миллион входа и $4,50 за выход — вместе 442,24 ₽ за миллион в каждую сторону. Тот же объём на gemini-3-7-flash-tiered в каталоге — 12 ₽. Разница примерно в 36,9 раза, и это сравнение текста с текстом, без аудио.

Дешёвые ядра, на которых имеет смысл начинать:

Идентификатор1M входа + 1M выхода
deepseek-v4-flash2 ₽
qwen-3-7-plus6 ₽
gemini-3-7-flash-tiered12 ₽
haiku-4-516 ₽

Как устроен сам диалоговый слой и что в нём ломается чаще всего, разбирали в материале про сборку ИИ-агента и в расчёте месячной стоимости агента.

Что проверить до того, как считать бюджет

Четыре вещи, которые ломают расчёт чаще всего:

  1. Токены размышления оплачиваются по ставке выхода. У Extended Thinking их много по устройству модели. Пользователь их не слышит, в счёт они попадают.
  2. Кэш промптов у нас не обещан. У всех текстовых моделей каталога prompt_cache стоит в unsupported. Если ваш сценарий — длинная неизменная инструкция, повторяемая на каждой реплике, экономику считайте без скидки за кэш.
  3. Непроверенные возможности — это unknown, а не «не работает». У gemini-3-7-flash-tiered в каталоге подтверждены чат, потоковая выдача и работа с изображениями; остальное в статусе «не проверяли».
  4. Прайс Google на три Live-модели общий. Если Google когда-нибудь разведёт их по цене, ваш расчёт на Extended Thinking изменится без предупреждения.

Что выбрать: Live API или текстовое ядро

Если голос — ядро продукта и задержка решает, придётся идти в Live API напрямую, со всеми вопросами доступа и оплаты из России, которые мы разбирали в материале про Gemini API. Если голос — надстройка над текстовым сценарием, трёхслойная схема закрывает задачу, а самая дорогая её часть — рассуждающее ядро — обходится в рубли по ставке из каталога.

Прикидка, с которой можно идти к калькулятору: 1,94 ₽ за минуту сквозного аудио против 12 ₽ за миллион токенов текстового ядра. Первое число растёт от длины разговора, второе — от объёма контекста. Какое из них больно ударит именно по вашему сценарию, зависит от того, что у вас длиннее — реплики или история диалога.

Ключ для текстового слоя выдаётся на странице входа — тот же OpenAI-совместимый эндпоинт, оплата в рублях, все текстовые семейства каталога под одним токеном.

Частые вопросы

Сколько стоит Gemini 3.8 Live?

По прайсу Google — $3,00 за миллион входных аудиотокенов и $12,00 за миллион выходных, либо поминутно: $0,005 за минуту входящего аудио и $0,018 за минуту исходящего. По курсу ЦБ на 16 сентября 2026 года (84,2362 ₽) это 0,42 ₽ и 1,52 ₽ за минуту соответственно.

Есть ли Gemini 3.8 Live в каталоге KeyDealer?

Нет. На 16 сентября 2026 года живой GET /v1/models не отдаёт ни одной аудиомодели: в каталоге только текстовые позиции, генерация изображений и переранжирование. Семейство Gemini представлено текстовыми маршрутами — от `gemini-3-flash` до `gemini-3-1-pro`.

Чем 3.8 Live отличается от 3.8 Live Extended Thinking?

Первая рассчитана на масштаб и дешевизну — быстрый диалог без пауз на размышление. Вторая добавляет многошаговые рассуждения прямо во время разговора: она рассуждает и говорит одновременно. Прайс-лист у Google на них общий.

Можно ли собрать голосового агента на моделях KeyDealer?

Да, но по классической трёхслойной схеме: распознавание речи, текстовая модель как ядро диалога, синтез речи. Распознавание и синтез придётся брать отдельно — в каталоге их нет. Ядро работает на любой текстовой модели, самые дешёвые начинаются от 1 ₽ за миллион токенов.

Когда Google отключит Gemini 3.8 Live?

Дата отключения в открытой документации не опубликована. В списке моделей обе позиции помечены как Stable, расписания вывода из эксплуатации для них нет.

Сколько языков понимает Gemini 3.8 Live?

По данным Google — 97, причём модель сама определяет смену языка посреди разговора и переключается без отдельной команды.

Источники