LLM API и интеграция
GLM API: как подключить, цены и три позиции
GLM API подключается как OpenAI-совместимый: адрес, ключ, имя модели, код остаётся прежним. В каталоге KeyDealer на 12 сентября 2026 года три позиции, и они не дублируют друг друга: glm-4-6v за 3 ₽ за миллион — понимание изображений и документов с текстовым ответом, glm-5-3-flash за 5 ₽ — быстрый код и извлечение данных, glm-5-3 за 15 ₽ — сложный код и многоязычные агентные задачи. Ставка одинаковая на вход и на выход.
Разброс между младшей и старшей позицией — пятикратный, и это единственная линейка в каталоге, где выбор действительно упирается в деньги. Ниже — подключение, разбор каждой из трёх позиций по отдельности, честная разметка проверенного и непроверенного и правило, по которому стоит переключаться со средней ступени на старшую.
Три позиции, три разные задачи
Обычная линейка — это одна и та же модель в трёх размерах. Здесь не так: позиции отличаются не мощностью, а тем, что они принимают и что отдают.
glm-4-6v — единственная в тройке, куда на вход идут не только буквы. Скан, фотография документа, страница договора, скриншот интерфейса — на выход текст.
glm-5-3-flash — рабочая лошадь для текста: быстрые правки в коде, извлечение полей из неструктурированного ввода, простые преобразования.
glm-5-3 — старшая: длинные цепочки рассуждений, сложный код, агенты, которые работают на нескольких языках.
Ставить их в один ряд «дешёвая — средняя — дорогая» неправильно. Правильнее так: сначала выбираете, какого типа у вас вход, а уже потом — насколько тяжёлая задача.
Подключение
Адрес. https://api.keydealer.ru/v1/chat/completions, формат OpenAI. Библиотеки под OpenAI работают без правок кода.
Ключ. Один на весь каталог. Отдельной регистрации под GLM не требуется.
Имя модели. Символ в символ из каталога: glm-4-6v, glm-5-3-flash, glm-5-3. Буква v в первом имени — часть идентификатора, а не опечатка и не номер версии.
curl https://api.keydealer.ru/v1/chat/completions \
-H "Authorization: Bearer $KEYDEALER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"glm-5-3-flash","messages":[{"role":"user","content":"Привет"}]}'
Тело стандартное. Если вы переезжаете с другого маршрута, правятся адрес и ключ, остальное не трогается. Разбор первого вызова по шагам — в статье первый запрос к API нейросети.
Ставки в каталоге
На 12 сентября 2026 года, рубли за миллион токенов, одинаково на вход и на выход.
| Модель | ₽ за миллион | Назначение по каталогу |
|---|---|---|
glm-4-6v | 3 | понимание изображений и документов, ответ текстом |
glm-5-3-flash | 5 | быстрый код и извлечение данных |
glm-5-3 | 15 | сложный код и многоязычные агентные задачи |
Ставка рублёвая и не двигается вслед за курсом: для справки, курс ЦБ на 12 сентября 2026 года — 84,2569 ₽ за доллар. Как читать счёт по позициям и откуда в нём берётся расхождение с ожиданием — в статье как читать биллинг в моделях.
glm-4-6v: вход шире, чем текст
Эта позиция решает задачу, которую текстовая модель не решает вообще: у вас есть картинка или документ, а нужен текст — расшифровка, пересказ, поля в структуре, ответ на вопрос по содержимому.
Типичные сценарии: разбор скана накладной, чтение фотографии бумажного акта, снятие данных с формы, описание скриншота в тикете поддержки. Как это выглядит на практике, разобрано в статьях нейросеть распознаёт текст с фото и как обработать PDF через API.
Два уточнения, которые снимают большую часть недоразумений.
Это не генератор картинок. Изображения тут только на входе. Генерация — отдельный класс моделей в каталоге с тарификацией за кадр, а не за токены.
Понимание изображений у этой позиции мы не проверяли. Назначение в каталоге — одно, статус замера — другое, и у glm-4-6v он стоит как unknown. То есть возможность заявлена назначением позиции, но наш собственный замер её не подтверждал. Это честная формулировка, и мы её не смягчаем. Какие позиции каталога проверены на картинках и как именно — в статье vision появился в каталоге.
Две текстовые ступени: flash и старшая
Средняя ступень берёт на себя объём. Две вещи она делает особенно уместно.
Извлечение данных. Письмо, заявка, отзыв, лог — на входе; на выходе объект с полями. Здесь важна не глубина рассуждения, а дисциплина формата, и её задаёт схема ответа, а не длина промпта. Подход описан в статье строгий JSON от нейросети.
Быстрый код. Правки в одном файле, генерация типовых обвязок, тесты по описанию, разбор стека ошибки. Обзор класса задач — в статье нейросеть для написания кода.
Важное ограничение: вызов функций у glm-5-3-flash в каталоге стоит как unknown. Мы его не замеряли. Если вы строите на этой позиции агента с инструментами, проверьте механику на своём сценарии до того, как поставите её в прод, — методика в статье как тестировать нейросеть.
Теперь про старшую. glm-5-3 стоит в три раза дороже средней и в пять раз дороже младшей. Платить эту разницу имеет смысл там, где ошибка дороже токенов.
Три таких места. Первое — код, который трогает несколько файлов сразу и требует держать в голове связи между ними. Второе — агентные сценарии с длинной цепочкой шагов, где ошибка на третьем шаге портит все последующие; вызов функций у этой позиции подтверждён замером, что для агентов обязательное условие — см. какие модели поддерживают вызов функций и что такое ИИ-агент. Третье — многоязычная работа, где нужно не просто перевести, а сохранить смысл и регистр между языками; смежный разбор — в статье нейросеть для перевода текста.
Что проверено, а что стоит unknown
Свести в одно место, чтобы не искать по тексту.
| Модель | Вызов функций | Картинки на вход |
|---|---|---|
glm-4-6v | подтверждён замером | не проверяли |
glm-5-3-flash | не проверяли | не проверяли |
glm-5-3 | подтверждён замером | не проверяли |
unknown означает отсутствие проверки, а не отсутствие возможности. Мы не пишем «работает» там, где не замеряли, и не пишем «не работает» — оба утверждения были бы выдумкой.
Деньги: когда переплата окупается и как сократить счёт
Правило, которое экономит больше всего, звучит скучно: начинать снизу и подниматься по факту, а не по ощущению.
Шаг первый. Соберите двадцать-тридцать реальных примеров задачи, не придуманных. Прогоните через glm-5-3-flash. Посчитайте долю ответов, которые пришлось переделывать.
Шаг второй. Прогоните те же примеры через glm-5-3. Если доля переделок упала незначительно, переплата в три раза не окупается — оставайтесь на средней.
Шаг третий. Если упала заметно, посчитайте стоимость переделки. Ручная правка ответа стоит рабочего времени, и оно почти всегда дороже разницы в ставке.
Есть и промежуточный вариант: развести нагрузку по позициям. Простые запросы уходят на среднюю, сложные — на старшую, решение принимает ваш код по признакам входа. Схемы такого разведения описаны в статье маршрутизация между моделями.
И четыре приёма, которые уменьшают счёт именно на этой линейке.
Не гоняйте документы через старшую позицию. Если вход — скан или фотография, задача решается на glm-4-6v, и она самая дешёвая из трёх. Пропускать картинку через текстовую модель бессмысленно, а разбирать её распознанный текст старшей позицией — переплата за шаг, который уже сделан.
Сокращайте вход, а не выход. На извлечении данных основной объём токенов приходится на исходный текст, а не на ответ. Отрезать шапки писем, подписи и цитирование предыдущей переписки до отправки — это минус половина счёта без единой правки промпта.
Задавайте потолок ответа явно. max_tokens стоит ставить даже там, где ответ ожидается коротким: на нестандартном вводе модель уходит в длинное рассуждение и вы оплачиваете его целиком по той же ставке.
Считайте диалог, а не запрос. В многошаговой сессии вся переписка отправляется заново на каждом ходу, поэтому десятый ход дороже первого при неизменной ставке. Разбор арифметики — в статье как считать токены.
Ошибки при подключении
Ждать от glm-4-6v картинку на выходе. Самая частая путаница в этой линейке. Буква v указывает на вход, а не на выход.
Гнать текстовую рутину через glm-4-6v. Позиция дешёвая, и соблазн есть. Но она заточена под смешанный вход, а не под объём простого текста.
Строить агента на glm-5-3-flash без проверки инструментов. Статус unknown — это не «скорее всего да».
Брать старшую позицию «на всякий случай». Пятикратная разница в ставке на заметном трафике превращается в заметные деньги, а выигрыш в качестве на простых задачах часто нулевой.
Копировать имя модели из чужого примера. Идентификаторы в каталоге записаны через дефис и без подвижных суффиксов вроде latest.
Что работает из России
Консоль вендора регистрацию пропускает, оплату российской картой — нет. Ключ без пополненного баланса существует, но запросы отклоняются, и обойти это настройками нельзя.
Рублёвый маршрут закрывает обе проблемы: пополнение российской картой, ставка зафиксирована в рублях, VPN не нужен. Подробности — в статье как оплатить API нейросети из России.
Отдельная тема — открытые веса: у линейки своя история с публикацией, и она напрямую влияет на то, можно ли поднять модель у себя. Разбор — в заметках GLM 5.3 Flash: MIT и промо и GLM 5.3: веса не вышли.
Чего мы не утверждаем
Мы не публикуем бенчмарки вендора как независимый результат и не заявляем, что старшая позиция «умнее» средней на вашей задаче. Разница в ставке — факт, разница в качестве — предмет замера на ваших данных.
Мы не подтверждаем понимание изображений ни у одной из трёх позиций: назначение glm-4-6v описано в каталоге, но собственного замера у нас нет, и мы пишем это прямо.
Мы не называем вендорских цен. Наша ставка — единственная цена, за которую мы отвечаем, и в таблице она подставляется токеном, а не вбита руками.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Один ключ открывает все три позиции GLM и остальной каталог.
Платные текстовые позиции доступны на приветственном бонусе сразу, поэтому сравнение glm-5-3-flash и glm-5-3 на своих примерах можно провести до первого пополнения.
Что держать в голове
Подключение — адрес, ключ, имя модели. Формат совместим с OpenAI, переезд с другого маршрута занимает две строки.
Три позиции решают три разные задачи, а не одну в трёх размерах. Сначала определитесь с типом входа, потом с тяжестью задачи — и только потом смотрите на ставку.
Пятикратный разброс цены внутри линейки стоит отрабатывать замером, а не интуицией: начинать со средней ступени и подниматься, когда доля переделок это оправдывает. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.
Частые вопросы
Как подключить GLM API?
Формат совместим с OpenAI: меняются адрес, ключ и имя модели. Адрес — https://api.keydealer.ru/v1/chat/completions, имена позиций — glm-4-6v, glm-5-3-flash и glm-5-3.
Сколько стоит GLM API в рублях?
В каталоге три позиции с разбросом ставки в пять раз между младшей и старшей, одинаково на вход и на выход. Точные числа — в таблице ставок в статье.
Чем glm-4-6v отличается от остальных?
Это позиция под понимание изображений и документов: на вход идут картинки и файлы, на выход — текст. Генерации изображений она не делает, для этого в каталоге отдельные модели.
Поддерживает ли GLM вызов функций?
Вызов функций подтверждён замером у glm-4-6v и glm-5-3. У glm-5-3-flash статус unknown — мы этого не проверяли и не утверждаем.
Какую позицию GLM выбрать под код?
Начинать стоит с glm-5-3-flash: она дешевле старшей в три раза и на типовых правках часто достаточна. Переходить на glm-5-3 имеет смысл там, где flash стабильно ошибается.
Работает ли GLM API из России?
Да, через рублёвый маршрут: пополнение российской картой, один ключ на весь каталог, без зарубежной карты и без VPN.