Релизы и изменения моделей
Gemini 3.8 Live: сколько стоит минута голосового агента
15 сентября Google выпустила две модели для живого голосового диалога — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе доступны в Gemini API под идентификаторами gemini-3.8-live и gemini-3.8-live-extended-thinking и помечены как Stable. Прайс у них общий: $3,00 за миллион входных аудиотокенов и $12,00 за миллион выходных, либо поминутная тарификация — $0,005 и $0,018 за минуту. По курсу ЦБ на 16 сентября (84,2362 ₽ за доллар) минута разговора, где по минуте говорят обе стороны, стоит 1,94 ₽. В каталоге KeyDealer этих моделей нет: живой GET /v1/models на 16 сентября не отдаёт ни одной аудиопозиции.
Что именно выпустила Google 15 сентября
Две модели, обе через Live API, обе уже в Google AI Studio:
| Модель | Идентификатор | Для чего |
|---|---|---|
| Gemini 3.8 Live | gemini-3.8-live | Массовые голосовые сценарии: быстрый диалог без пауз на размышление |
| Gemini 3.8 Live Extended Thinking | gemini-3.8-live-extended-thinking | Сложные задачи: многошаговые рассуждения прямо во время разговора |
В списке моделей Gemini API обе помечены как New и Stable. Рядом в том же семействе числится текстовая gemini-3.8-flash — тоже с пометкой New.
Главное отличие от привычной схемы: это audio-to-audio. Модель принимает звук и отдаёт звук, без промежуточной расшифровки в текст на вашей стороне. Из заявленного в анонсе Google: 97 языков с автоматическим переключением посреди разговора, разбор картинки с камеры почти в реальном времени и вызов инструментов в фоне — модель подтверждает запрос и продолжает говорить, пока задача выполняется.
Extended Thinking добавляет к этому то, что Google называет ранними голосовыми сигналами: «Сейчас посмотрю…» вместо мёртвой паузы, пока идёт рассуждение. Весь звук, который порождают модели, помечен водяным знаком SynthID.
Сколько стоит Gemini 3.8 Live по прайсу Google
Аудио стоит $3,00 за миллион входных токенов и $12,00 за миллион выходных — по курсу ЦБ на 16 сентября 2026 года это 252,71 ₽ и 1010,83 ₽. Текст в том же API вчетверо дешевле на входе: $0,75 и $4,50. Тарифы со страницы цен Gemini API.
Одна оговорка: у Google одна таблица на три модели сразу — gemini-3.8-live, gemini-3.8-live-extended-thinking и gemini-3.1-flash-live-preview. Отдельной строки под каждую позицию там нет, то есть более умная Extended Thinking стоит столько же, сколько базовая.
Пересчёт по курсу ЦБ на 16 сентября 2026 года — 84,2362 ₽ за доллар.
| Что тарифицируется | У Google | В рублях |
|---|---|---|
| Вход, текст, за 1M | $0,75 | 63,18 ₽ |
| Вход, аудио, за 1M | $3,00 | 252,71 ₽ |
| Вход, изображение и видео, за 1M | $1,00 | 84,24 ₽ |
| Выход вместе с токенами размышления, текст, за 1M | $4,50 | 379,06 ₽ |
| Выход, аудио, за 1M | $12,00 | 1010,83 ₽ |
Два соотношения, без которых бюджет посчитается неправильно. Аудио на входе ровно вчетверо дороже текста. Выход дороже входа в шесть раз по тексту — и туда же попадают токены размышления, за которые вы платите по ставке выхода, даже если пользователь их не слышал.
Есть и бесплатный уровень: в таблице Google он помечен как Free of charge с отметкой, что данные с него используются для улучшения продуктов. Для прода это дисквалифицирующее условие, для прототипа — нет.
Сколько стоит минута разговора с голосовым агентом
Минута разговора, где обе стороны говорят по минуте, стоит 1,937 ₽ — это $0,023 по прайсу Google на 16 сентября 2026 года. Разговор на десять минут обойдётся в 19,37 ₽, тысяча пятиминутных — в 9687 ₽. Поминутная тарификация удобна тем, что её не нужно переводить в токены.
| Что считаем | У Google | В рублях |
|---|---|---|
| Минута входящего аудио | $0,005 | 0,421 ₽ |
| Минута видео или картинки с камеры | $0,002 | 0,168 ₽ |
| Минута исходящего аудио | $0,018 | 1,516 ₽ |
Цифра честная только при допущении, что стороны говорят поровну. В реальной поддержке агент обычно говорит больше человека, а раз выход дороже входа в 3,6 раза, реальный счёт съезжает вверх. Считайте по исходящему аудио, а входящее закладывайте как добавку.
Отдельная строка, про которую забывают: заземление на поиск Google. Пять тысяч запросов в месяц бесплатно на все модели Gemini 3.x вместе, дальше $14 за тысячу — это 1179 ₽ за тысячу, или 1,18 ₽ за один поисковый вызов. Голосовой агент, который лезет в поиск на каждой второй реплике, легко удвоит себе стоимость минуты.
Какие результаты Gemini 3.8 Live показала в бенчмарках
Лучший заявленный результат — 82,6 балла и первое место в Artificial Analysis Speech to Speech Quality Index у 3.8 Live Extended Thinking. Все цифры ниже — из анонса Google от 15 сентября 2026 года, то есть замеры вендора о собственной модели. Внешнего подтверждения у нас нет, читать их стоит именно так.
| Бенчмарк | Результат 3.8 Live Extended Thinking |
|---|---|
| Artificial Analysis Speech to Speech Quality Index | 82,6 — первое место |
| τ-Voice, выполнение агентных задач | 68,6 % |
| Sierra τ-Voice-banking | 35,1 % |
| Big Bench Audio | 97,7 % |
Базовая 3.8 Live, по словам Google, заняла второе место в Speech Agent Arena. Самая честная строка здесь — банковская. 35,1 % на τ-Voice-banking — это доля доведённых до конца задач: две трети сценариев агент не закрывает. Для голосовой поддержки, где ошибка стоит денег, это аргумент за подтверждение на каждом шаге, который двигает деньги.
Есть ли Gemini 3.8 Live в каталоге KeyDealer
Нет, и не только она. На 16 сентября 2026 года живой GET /v1/models не отдаёт ни одной аудиомодели — ни распознавания речи, ни синтеза, ни audio-to-audio. Каталог состоит из текстовых маршрутов, генерации изображений и одной модели переранжирования.
Семейство Gemini в каталоге представлено текстом:
| Идентификатор | Ставка за 1M, вход и выход | Статус |
|---|---|---|
gemini-3-flash | 6 ₽ | available |
gemini-3-7-flash-tiered | 6 ₽ | available |
gemini-3-1-flash-lite | 8 ₽ | available |
gemini-3-7-flash | 8 ₽ | available |
gemini-3-1-pro | 17 ₽ | available |
gemini-3-6-flash | 8 ₽ | ещё не открыт |
Ставки взяты из живой выдачи на день написания и могут меняться. Актуальное значение лежит в GET /v1/models; статья — снимок на свою дату. Полная рублёвая картина по всем семействам собрана в материале про стоимость миллиона токенов. Даты отключения моделей, когда вендоры их публикуют, живут в календаре отключений; для 3.8 Live такой даты в открытой документации нет.
Как собрать голосового агента, если audio-to-audio недоступен
Работающий ответ — трёхслойная схема, та самая, на которой голосовые боты жили до появления сквозного аудио:
- Распознавание речи. Звук от пользователя превращается в текст. Берётся отдельным сервисом — в каталоге KeyDealer его нет.
- Ядро диалога. Текстовая модель держит контекст, решает, что ответить, и дёргает ваши инструменты. Вот этот слой закрывается ключом KeyDealer полностью.
- Синтез речи. Текст ответа превращается обратно в звук. Тоже отдельный сервис.
Чем схема хуже Live API: задержкой и интонацией. Сквозная модель слышит, как человек сказал фразу, и отвечает быстрее, потому что не ждёт полной расшифровки. Трёхслойная слышит только то, что распознаватель написал буквами.
Чем лучше: ядро дешевеет в разы, и его можно поменять, не трогая остальное. По прайсу Google текстовый обмен в Live API стоит $0,75 за миллион входа и $4,50 за выход — вместе 442,24 ₽ за миллион в каждую сторону. Тот же объём на gemini-3-7-flash-tiered в каталоге — 12 ₽. Разница примерно в 36,9 раза, и это сравнение текста с текстом, без аудио.
Дешёвые ядра, на которых имеет смысл начинать:
| Идентификатор | 1M входа + 1M выхода |
|---|---|
deepseek-v4-flash | 2 ₽ |
qwen-3-7-plus | 6 ₽ |
gemini-3-7-flash-tiered | 12 ₽ |
haiku-4-5 | 16 ₽ |
Как устроен сам диалоговый слой и что в нём ломается чаще всего, разбирали в материале про сборку ИИ-агента и в расчёте месячной стоимости агента.
Что проверить до того, как считать бюджет
Четыре вещи, которые ломают расчёт чаще всего:
- Токены размышления оплачиваются по ставке выхода. У Extended Thinking их много по устройству модели. Пользователь их не слышит, в счёт они попадают.
- Кэш промптов у нас не обещан. У всех текстовых моделей каталога
prompt_cacheстоит вunsupported. Если ваш сценарий — длинная неизменная инструкция, повторяемая на каждой реплике, экономику считайте без скидки за кэш. - Непроверенные возможности — это
unknown, а не «не работает». Уgemini-3-7-flash-tieredв каталоге подтверждены чат, потоковая выдача и работа с изображениями; остальное в статусе «не проверяли». - Прайс Google на три Live-модели общий. Если Google когда-нибудь разведёт их по цене, ваш расчёт на Extended Thinking изменится без предупреждения.
Что выбрать: Live API или текстовое ядро
Если голос — ядро продукта и задержка решает, придётся идти в Live API напрямую, со всеми вопросами доступа и оплаты из России, которые мы разбирали в материале про Gemini API. Если голос — надстройка над текстовым сценарием, трёхслойная схема закрывает задачу, а самая дорогая её часть — рассуждающее ядро — обходится в рубли по ставке из каталога.
Прикидка, с которой можно идти к калькулятору: 1,94 ₽ за минуту сквозного аудио против 12 ₽ за миллион токенов текстового ядра. Первое число растёт от длины разговора, второе — от объёма контекста. Какое из них больно ударит именно по вашему сценарию, зависит от того, что у вас длиннее — реплики или история диалога.
Ключ для текстового слоя выдаётся на странице входа — тот же OpenAI-совместимый эндпоинт, оплата в рублях, все текстовые семейства каталога под одним токеном.
Частые вопросы
Сколько стоит Gemini 3.8 Live?
По прайсу Google — $3,00 за миллион входных аудиотокенов и $12,00 за миллион выходных, либо поминутно: $0,005 за минуту входящего аудио и $0,018 за минуту исходящего. По курсу ЦБ на 16 сентября 2026 года (84,2362 ₽) это 0,42 ₽ и 1,52 ₽ за минуту соответственно.
Есть ли Gemini 3.8 Live в каталоге KeyDealer?
Нет. На 16 сентября 2026 года живой GET /v1/models не отдаёт ни одной аудиомодели: в каталоге только текстовые позиции, генерация изображений и переранжирование. Семейство Gemini представлено текстовыми маршрутами — от `gemini-3-flash` до `gemini-3-1-pro`.
Чем 3.8 Live отличается от 3.8 Live Extended Thinking?
Первая рассчитана на масштаб и дешевизну — быстрый диалог без пауз на размышление. Вторая добавляет многошаговые рассуждения прямо во время разговора: она рассуждает и говорит одновременно. Прайс-лист у Google на них общий.
Можно ли собрать голосового агента на моделях KeyDealer?
Да, но по классической трёхслойной схеме: распознавание речи, текстовая модель как ядро диалога, синтез речи. Распознавание и синтез придётся брать отдельно — в каталоге их нет. Ядро работает на любой текстовой модели, самые дешёвые начинаются от 1 ₽ за миллион токенов.
Когда Google отключит Gemini 3.8 Live?
Дата отключения в открытой документации не опубликована. В списке моделей обе позиции помечены как Stable, расписания вывода из эксплуатации для них нет.
Сколько языков понимает Gemini 3.8 Live?
По данным Google — 97, причём модель сама определяет смену языка посреди разговора и переключается без отдельной команды.