LLM API и интеграция

GLM API: как подключить, цены и три позиции

GLM API: как подключить, цены и три позиции

GLM API подключается как OpenAI-совместимый: адрес, ключ, имя модели, код остаётся прежним. В каталоге KeyDealer на 12 сентября 2026 года три позиции, и они не дублируют друг друга: glm-4-6v за 3 ₽ за миллион — понимание изображений и документов с текстовым ответом, glm-5-3-flash за 5 ₽ — быстрый код и извлечение данных, glm-5-3 за 15 ₽ — сложный код и многоязычные агентные задачи. Ставка одинаковая на вход и на выход.

Разброс между младшей и старшей позицией — пятикратный, и это единственная линейка в каталоге, где выбор действительно упирается в деньги. Ниже — подключение, разбор каждой из трёх позиций по отдельности, честная разметка проверенного и непроверенного и правило, по которому стоит переключаться со средней ступени на старшую.

Три позиции, три разные задачи

Обычная линейка — это одна и та же модель в трёх размерах. Здесь не так: позиции отличаются не мощностью, а тем, что они принимают и что отдают.

glm-4-6v — единственная в тройке, куда на вход идут не только буквы. Скан, фотография документа, страница договора, скриншот интерфейса — на выход текст.

glm-5-3-flash — рабочая лошадь для текста: быстрые правки в коде, извлечение полей из неструктурированного ввода, простые преобразования.

glm-5-3 — старшая: длинные цепочки рассуждений, сложный код, агенты, которые работают на нескольких языках.

Ставить их в один ряд «дешёвая — средняя — дорогая» неправильно. Правильнее так: сначала выбираете, какого типа у вас вход, а уже потом — насколько тяжёлая задача.

Подключение

Адрес. https://api.keydealer.ru/v1/chat/completions, формат OpenAI. Библиотеки под OpenAI работают без правок кода.

Ключ. Один на весь каталог. Отдельной регистрации под GLM не требуется.

Имя модели. Символ в символ из каталога: glm-4-6v, glm-5-3-flash, glm-5-3. Буква v в первом имени — часть идентификатора, а не опечатка и не номер версии.

curl https://api.keydealer.ru/v1/chat/completions \
  -H "Authorization: Bearer $KEYDEALER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"glm-5-3-flash","messages":[{"role":"user","content":"Привет"}]}'

Тело стандартное. Если вы переезжаете с другого маршрута, правятся адрес и ключ, остальное не трогается. Разбор первого вызова по шагам — в статье первый запрос к API нейросети.

Ставки в каталоге

На 12 сентября 2026 года, рубли за миллион токенов, одинаково на вход и на выход.

Модель₽ за миллионНазначение по каталогу
glm-4-6v3понимание изображений и документов, ответ текстом
glm-5-3-flash5быстрый код и извлечение данных
glm-5-315сложный код и многоязычные агентные задачи

Ставка рублёвая и не двигается вслед за курсом: для справки, курс ЦБ на 12 сентября 2026 года — 84,2569 ₽ за доллар. Как читать счёт по позициям и откуда в нём берётся расхождение с ожиданием — в статье как читать биллинг в моделях.

glm-4-6v: вход шире, чем текст

Эта позиция решает задачу, которую текстовая модель не решает вообще: у вас есть картинка или документ, а нужен текст — расшифровка, пересказ, поля в структуре, ответ на вопрос по содержимому.

Типичные сценарии: разбор скана накладной, чтение фотографии бумажного акта, снятие данных с формы, описание скриншота в тикете поддержки. Как это выглядит на практике, разобрано в статьях нейросеть распознаёт текст с фото и как обработать PDF через API.

Два уточнения, которые снимают большую часть недоразумений.

Это не генератор картинок. Изображения тут только на входе. Генерация — отдельный класс моделей в каталоге с тарификацией за кадр, а не за токены.

Понимание изображений у этой позиции мы не проверяли. Назначение в каталоге — одно, статус замера — другое, и у glm-4-6v он стоит как unknown. То есть возможность заявлена назначением позиции, но наш собственный замер её не подтверждал. Это честная формулировка, и мы её не смягчаем. Какие позиции каталога проверены на картинках и как именно — в статье vision появился в каталоге.

Две текстовые ступени: flash и старшая

Средняя ступень берёт на себя объём. Две вещи она делает особенно уместно.

Извлечение данных. Письмо, заявка, отзыв, лог — на входе; на выходе объект с полями. Здесь важна не глубина рассуждения, а дисциплина формата, и её задаёт схема ответа, а не длина промпта. Подход описан в статье строгий JSON от нейросети.

Быстрый код. Правки в одном файле, генерация типовых обвязок, тесты по описанию, разбор стека ошибки. Обзор класса задач — в статье нейросеть для написания кода.

Важное ограничение: вызов функций у glm-5-3-flash в каталоге стоит как unknown. Мы его не замеряли. Если вы строите на этой позиции агента с инструментами, проверьте механику на своём сценарии до того, как поставите её в прод, — методика в статье как тестировать нейросеть.

Теперь про старшую. glm-5-3 стоит в три раза дороже средней и в пять раз дороже младшей. Платить эту разницу имеет смысл там, где ошибка дороже токенов.

Три таких места. Первое — код, который трогает несколько файлов сразу и требует держать в голове связи между ними. Второе — агентные сценарии с длинной цепочкой шагов, где ошибка на третьем шаге портит все последующие; вызов функций у этой позиции подтверждён замером, что для агентов обязательное условие — см. какие модели поддерживают вызов функций и что такое ИИ-агент. Третье — многоязычная работа, где нужно не просто перевести, а сохранить смысл и регистр между языками; смежный разбор — в статье нейросеть для перевода текста.

Что проверено, а что стоит unknown

Свести в одно место, чтобы не искать по тексту.

МодельВызов функцийКартинки на вход
glm-4-6vподтверждён замеромне проверяли
glm-5-3-flashне проверялине проверяли
glm-5-3подтверждён замеромне проверяли

unknown означает отсутствие проверки, а не отсутствие возможности. Мы не пишем «работает» там, где не замеряли, и не пишем «не работает» — оба утверждения были бы выдумкой.

Деньги: когда переплата окупается и как сократить счёт

Правило, которое экономит больше всего, звучит скучно: начинать снизу и подниматься по факту, а не по ощущению.

Шаг первый. Соберите двадцать-тридцать реальных примеров задачи, не придуманных. Прогоните через glm-5-3-flash. Посчитайте долю ответов, которые пришлось переделывать.

Шаг второй. Прогоните те же примеры через glm-5-3. Если доля переделок упала незначительно, переплата в три раза не окупается — оставайтесь на средней.

Шаг третий. Если упала заметно, посчитайте стоимость переделки. Ручная правка ответа стоит рабочего времени, и оно почти всегда дороже разницы в ставке.

Есть и промежуточный вариант: развести нагрузку по позициям. Простые запросы уходят на среднюю, сложные — на старшую, решение принимает ваш код по признакам входа. Схемы такого разведения описаны в статье маршрутизация между моделями.

И четыре приёма, которые уменьшают счёт именно на этой линейке.

Не гоняйте документы через старшую позицию. Если вход — скан или фотография, задача решается на glm-4-6v, и она самая дешёвая из трёх. Пропускать картинку через текстовую модель бессмысленно, а разбирать её распознанный текст старшей позицией — переплата за шаг, который уже сделан.

Сокращайте вход, а не выход. На извлечении данных основной объём токенов приходится на исходный текст, а не на ответ. Отрезать шапки писем, подписи и цитирование предыдущей переписки до отправки — это минус половина счёта без единой правки промпта.

Задавайте потолок ответа явно. max_tokens стоит ставить даже там, где ответ ожидается коротким: на нестандартном вводе модель уходит в длинное рассуждение и вы оплачиваете его целиком по той же ставке.

Считайте диалог, а не запрос. В многошаговой сессии вся переписка отправляется заново на каждом ходу, поэтому десятый ход дороже первого при неизменной ставке. Разбор арифметики — в статье как считать токены.

Ошибки при подключении

Ждать от glm-4-6v картинку на выходе. Самая частая путаница в этой линейке. Буква v указывает на вход, а не на выход.

Гнать текстовую рутину через glm-4-6v. Позиция дешёвая, и соблазн есть. Но она заточена под смешанный вход, а не под объём простого текста.

Строить агента на glm-5-3-flash без проверки инструментов. Статус unknown — это не «скорее всего да».

Брать старшую позицию «на всякий случай». Пятикратная разница в ставке на заметном трафике превращается в заметные деньги, а выигрыш в качестве на простых задачах часто нулевой.

Копировать имя модели из чужого примера. Идентификаторы в каталоге записаны через дефис и без подвижных суффиксов вроде latest.

Что работает из России

Консоль вендора регистрацию пропускает, оплату российской картой — нет. Ключ без пополненного баланса существует, но запросы отклоняются, и обойти это настройками нельзя.

Рублёвый маршрут закрывает обе проблемы: пополнение российской картой, ставка зафиксирована в рублях, VPN не нужен. Подробности — в статье как оплатить API нейросети из России.

Отдельная тема — открытые веса: у линейки своя история с публикацией, и она напрямую влияет на то, можно ли поднять модель у себя. Разбор — в заметках GLM 5.3 Flash: MIT и промо и GLM 5.3: веса не вышли.

Чего мы не утверждаем

Мы не публикуем бенчмарки вендора как независимый результат и не заявляем, что старшая позиция «умнее» средней на вашей задаче. Разница в ставке — факт, разница в качестве — предмет замера на ваших данных.

Мы не подтверждаем понимание изображений ни у одной из трёх позиций: назначение glm-4-6v описано в каталоге, но собственного замера у нас нет, и мы пишем это прямо.

Мы не называем вендорских цен. Наша ставка — единственная цена, за которую мы отвечаем, и в таблице она подставляется токеном, а не вбита руками.

Что нужно, чтобы попробовать

Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Один ключ открывает все три позиции GLM и остальной каталог.

Платные текстовые позиции доступны на приветственном бонусе сразу, поэтому сравнение glm-5-3-flash и glm-5-3 на своих примерах можно провести до первого пополнения.

Что держать в голове

Подключение — адрес, ключ, имя модели. Формат совместим с OpenAI, переезд с другого маршрута занимает две строки.

Три позиции решают три разные задачи, а не одну в трёх размерах. Сначала определитесь с типом входа, потом с тяжестью задачи — и только потом смотрите на ставку.

Пятикратный разброс цены внутри линейки стоит отрабатывать замером, а не интуицией: начинать со средней ступени и подниматься, когда доля переделок это оправдывает. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Как подключить GLM API?

Формат совместим с OpenAI: меняются адрес, ключ и имя модели. Адрес — https://api.keydealer.ru/v1/chat/completions, имена позиций — glm-4-6v, glm-5-3-flash и glm-5-3.

Сколько стоит GLM API в рублях?

В каталоге три позиции с разбросом ставки в пять раз между младшей и старшей, одинаково на вход и на выход. Точные числа — в таблице ставок в статье.

Чем glm-4-6v отличается от остальных?

Это позиция под понимание изображений и документов: на вход идут картинки и файлы, на выход — текст. Генерации изображений она не делает, для этого в каталоге отдельные модели.

Поддерживает ли GLM вызов функций?

Вызов функций подтверждён замером у glm-4-6v и glm-5-3. У glm-5-3-flash статус unknown — мы этого не проверяли и не утверждаем.

Какую позицию GLM выбрать под код?

Начинать стоит с glm-5-3-flash: она дешевле старшей в три раза и на типовых правках часто достаточна. Переходить на glm-5-3 имеет смысл там, где flash стабильно ошибается.

Работает ли GLM API из России?

Да, через рублёвый маршрут: пополнение российской картой, один ключ на весь каталог, без зарубежной карты и без VPN.

Источники