LLM API и интеграция
Распознавание изображений нейросетью через API
Пятнадцать текстовых позиций каталога из сорока двух на 12 сентября 2026 года проверены на приём изображений во входном запросе: вы отправляете картинку вместе с вопросом и получаете текстовый ответ. Самая дешёвая из них — llama-3-2-11b-vision со ставкой 0 ₽ за миллион токенов, самая дорогая — gpt-6-astra за 60 ₽. Это не генерация картинок и не OCR: модель отвечает на вопрос о том, что изображено, а не рисует и не переписывает символы.
Ниже — список проверенных позиций с ценой, четыре сценария, которые действительно работают, разница с OCR и честный перечень мест, где всё ломается.
Что делает модель с картинкой на входе
Картинка приходит в запрос вместе с текстом. Модель разбирает её на фрагменты, превращает во внутреннее представление и дальше работает так же, как с текстом: отвечает на вопрос, следует инструкции, возвращает структуру в заданном формате.
Ключевое отличие от привычных инструментов работы с изображением в том, что вы задаёте вопрос, а не запускаете фиксированную операцию. «Сколько людей в кадре», «есть ли на фото печать», «какой ошибкой завершилась сборка на этом скриншоте», «соответствует ли снимок требованию к фону» — всё это один и тот же запрос с разной формулировкой.
Отсюда и главный практический вывод: качество результата зависит от того, насколько точно сформулирован вопрос, почти так же сильно, как от выбора модели. Расплывчатое «опиши фото» даёт расплывчатый ответ; список конкретных полей даёт список конкретных значений.
Пятнадцать позиций, где приём картинок проверен
Статус verified означает, что мы прогоняли через позицию реальный запрос с изображением и получали осмысленный ответ. Ставка указана за миллион токенов и одинакова на вход и на выход.
| Модель | ₽ за 1M токенов | Заметка |
|---|---|---|
llama-3-2-11b-vision | 0 | бесплатная позиция, открывается после первого пополнения |
gemini-3-flash | 6 | быстрая, вызов функций тоже проверен |
gemini-3-7-flash-tiered | 6 | двухуровневый тариф по объёму контекста |
gemini-3-1-flash-lite | 8 | самая недорогая из платных быстрых |
gpt-5-6-luna | 8 | картинки и вызов функций проверены |
haiku-4-5 | 8 | компактная позиция семейства Claude |
kimi-k3 | 10 | открытые веса, длинный контекст |
grok-4-5 | 20 | картинки и вызов функций проверены |
grok-4-6 | 20 | то же поколение, свежее |
gpt-5-5 | 30 | универсальная рабочая позиция |
gpt-5-6-terra | 30 | рассуждающий режим |
opus-5 | 30 | тяжёлая позиция для сложного разбора |
sonnet-5 | 30 | баланс цены и качества разбора |
gpt-5-6-sol | 40 | быстрый ответ на большом объёме |
gpt-6-astra | 60 | самая дорогая позиция с проверенными картинками |
Разброс между бесплатной и самой дорогой позицией здесь такой, что выбор модели стоит начинать снизу. Для «что изображено на фото» дешёвой позиции обычно достаточно; дорогая нужна там, где на картинке мелкие детали, рукописный текст или сложная таблица.
Что значит «не проверяли» у остальных
У остальных двадцати семи текстовых позиций возможность стоит в статусе «не проверяли». Это буквальное утверждение: мы не прогоняли через них запрос с картинкой и не фиксировали результат.
Из этого не следует, что модель откажет. Часть таких позиций почти наверняка принимает изображения — просто у нас нет собственного прогона, а переписывать чужую документацию как факт мы не будем. Проверка занимает один запрос: отправьте картинку с простым вопросом и посмотрите, придёт ли осмысленный ответ или ошибка формата.
Когда мы такую проверку проводим, статус в каталоге меняется. История появления самой возможности — в статье vision появился в каталоге.
Сценарий: описание содержимого
Самый прямолинейный случай — получить текстовое описание того, что на картинке. Применений больше, чем кажется: альтернативный текст для доступности, подписи в каталоге, автоматическая разметка фотоархива, первичная модерация загруженного пользователем контента.
Что работает: просить не «описание», а структуру. «Верни: основной объект, фон, количество людей, есть ли текст в кадре, общее настроение» — и вы получаете набор полей, который можно положить в базу. Свободный текст придётся разбирать потом.
Что не работает: точный подсчёт большого числа объектов. Пять яблок модель сосчитает, сорок семь — нет. Если нужно точное число в толпе, это задача для специализированного детектора, а не для универсальной модели.
Близкие по смыслу задачи мы разбирали в статьях классификация текстов нейросетью и модерация контента нейросетью — подход к структуре ответа там тот же.
Сценарий: данные с фото документа
Сотрудник фотографирует накладную на телефон, бухгалтерия получает структуру. Это самый частый коммерческий сценарий и одновременно самый требовательный к аккуратности.
Правильный запрос здесь выглядит так: перечислите поля, задайте формат каждого (дата в ISO, сумма числом без пробелов, номер строкой), потребуйте строгий JSON и явно разрешите null там, где поле не читается. Последнее важнее всего: без разрешения вернуть пустоту модель склонна дописать правдоподобное значение. Как добиваться предсказуемого формата — в статье JSON от нейросети: строгий формат.
Отдельно про проверку: суммы и реквизиты нужно валидировать кодом, а не доверием. Контрольная сумма счёта, длина расчётного счёта, соответствие даты диапазону — всё это дешёвые проверки, которые ловят большую часть брака. Расширенный разбор документов — в статье нейросеть для документов бизнеса, а работа с многостраничными файлами — в как обработать PDF через API.
Сценарий: проверка фото по требованиям
Задача звучит как «примите или отклоните»: фото на документ с однотонным фоном, снимок товара без посторонних предметов, селфи с документом для верификации, фото объекта для страхового акта.
Здесь модель работает хорошо, потому что вопрос закрытый. Формулировка вида «проверь по списку: фон однотонный — да/нет, лицо в кадре целиком — да/нет, есть блики — да/нет, посторонние объекты — перечисли» даёт стабильный результат, пригодный для автоматического решения.
Практическое правило: не просите вынести итоговый вердикт «годится/не годится». Просите заполнить чек-лист, а решение принимайте своим кодом по своим правилам. Так вы сможете поменять порог строгости, не трогая промпт, и увидите, какой именно пункт провалился.
Второе правило — держите порог неопределённости. Если модель ответила «не могу разобрать», это должно вести к ручной проверке, а не к автоматическому отказу пользователю.
Сценарий: разбор скриншотов
Скриншот — это картинка, но по содержанию текст с интерфейсом вокруг. Модель здесь заменяет пересказ: пользователь присылает снимок экрана с ошибкой, поддержка получает распознанный текст ошибки и предположение о причине.
Работает и обратная задача — разбор интерфейса: «какие поля на этой форме обязательные», «где на скриншоте кнопка отправки», «в каком месте таблицы значение выбивается из ряда». Это удобно для автотестов и для документирования чужих систем.
Ограничение — мелкий текст. Скриншот экрана целиком, сжатый до тысячи пикселей по ширине, теряет читаемость шрифта, и модель начинает угадывать. Лучше присылать фрагмент в оригинальном масштабе, чем весь экран в уменьшенном.
Чем это отличается от OCR
Разница не в качестве, а в природе инструмента, и путать их дорого.
OCR извлекает символы. На выходе — текст и координаты каждого блока, детерминированно и без интерпретации. На чистом скане документа это точнее и дешевле любой универсальной модели, а результат воспроизводим: один и тот же файл всегда даёт один и тот же текст.
Модель понимает изображённое. На выходе — ответ на ваш вопрос. Она справится с фото под углом, с частично засвеченным кадром, с рукописной пометкой на полях и с вопросом «а к какому разделу договора относится этот абзац». Но точного координатного слоя она не даёт, и результат может немного отличаться от запуска к запуску.
Разумная схема для потока документов — комбинация: OCR извлекает текст, модель приводит его к нужной структуре и отвечает на смысловые вопросы. Подробный разбор именно задачи вытащить текст с фотографии — в статье нейросеть распознаёт текст с фото.
Сколько стоит картинка на входе
Изображение не тарифицируется отдельной ставкой за кадр — оно превращается во входные токены и оплачивается по обычной цене модели за миллион токенов. Чем больше разрешение, тем больше токенов.
Отсюда два способа сэкономить, оба безболезненные. Первый — не отправлять картинку в оригинальном разрешении смартфона, если вопрос не требует мелких деталей: уменьшение по длинной стороне до полутора тысяч пикселей режет счёт заметно. Второй — не прикладывать изображение повторно в каждом шаге диалога: если ответ уже получен, дальше достаточно текста.
Общая механика подсчёта — в статьях как считать токены и сколько стоит 1M токенов в рублях.
Где это ломается
Мелкий и плохо освещённый текст. Модель не сообщает «не вижу», она предполагает. Это главный источник тихих ошибок.
Точный подсчёт и измерения. Расстояния, размеры, количество мелких объектов — ненадёжно. Для метрологии нужны метрологические инструменты.
Рукописный текст. Иногда получается хорошо, иногда выдумывается целое слово. Ставить это в автоматический конвейер без проверки человеком нельзя.
Уверенный неверный ответ. Самое неприятное свойство: формулировка ответа одинаково уверенная и когда модель права, и когда ошиблась. Механику явления мы разбирали в статье галлюцинации нейросети.
Защита от всего перечисленного одна и та же: разрешить ответ «не удалось разобрать», валидировать результат кодом и отправлять сомнительные случаи человеку.
Персональные данные на фото
Фотография паспорта, медицинской справки или лица сотрудника — это персональные данные, и отправка их во внешний сервис остаётся обработкой со всеми обязанностями оператора.
Практический минимум: закрывать поля, которые не нужны для задачи, до отправки; не хранить исходные файлы дольше, чем требует процесс; фиксировать в журнале факт обработки. Общий разбор — в статье нейросети и персональные данные.
Чего мы не утверждаем
Мы не ранжируем позиции по точности распознавания. Общей метрики нет, а результат слишком сильно зависит от типа изображения: модель, хорошая на скриншотах, может хуже читать фото под углом.
Мы не говорим, что позиции со статусом «не проверяли» не работают с картинками. Мы говорим ровно то, что написано: у нас нет собственного прогона.
Список и ставки — снимок каталога на 12 сентября 2026 года. Каталог растёт, статусы уточняются по мере проверок, актуальное состояние всегда в живой выдаче списка моделей.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все позиции каталога.
Первый осмысленный тест занимает пять минут: возьмите десять своих реальных картинок — не идеальные сканы, а то, что реально присылают пользователи, — и прогоните их через бесплатную llama-3-2-11b-vision и одну среднюю платную позицию с одинаковым запросом. Разница в ответах сразу покажет, нужна ли вам дорогая модель.
Что держать в голове
Приём картинки на вход — это не отдельный продукт, а обычный текстовый запрос, к которому приложено изображение. Поэтому и правила те же: точный вопрос вместо расплывчатого, строгий формат ответа, разрешение вернуть пустоту.
Выбор позиции начинайте снизу по цене. Пятнадцать проверенных позиций дают разброс ставки в десятки раз, и для описания содержимого или проверки фото по чек-листу дешёвая справляется не хуже дорогой. Дорогую берите под мелкие детали и сложные документы.
И главное — стройте процесс так, чтобы ошибка модели была видна. Валидация кодом, порог неопределённости, ручная проверка сомнительных случаев. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.
Частые вопросы
Какие модели умеют распознавать изображения?
На 12 сентября 2026 года приём картинок на вход проверен у пятнадцати текстовых позиций каталога из сорока двух. У остальных возможность в статусе «не проверяли» — это не отказ, а отсутствие нашей проверки.
Чем распознавание изображений отличается от OCR?
OCR извлекает символы и их координаты, модель понимает смысл изображённого и отвечает на вопрос о картинке. Для чистого скана текста OCR точнее и дешевле, для фото под углом и для смысловых вопросов нужна модель.
Можно ли вытащить данные из фото документа?
Да, это рабочий сценарий: вы просите вернуть заданные поля строгим JSON. Но результат нужно проверять — модель может уверенно выдать правдоподобное неверное значение вместо отказа.
Сколько стоит распознать одну картинку?
Изображение превращается во входные токены и тарифуется по обычной ставке модели за миллион токенов. Одно фото среднего размера — это сотни или тысячи токенов в зависимости от разрешения.
Есть ли бесплатная модель с распознаванием?
Да, llama-3-2-11b-vision со ставкой 0 ₽ за миллион токенов. Бесплатные позиции открываются после первого платного пополнения.
Можно ли отправлять фото с персональными данными?
Технически да, юридически это обработка персональных данных со всеми вытекающими обязанностями. Безопаснее закрывать лишние поля до отправки и не хранить исходники дольше необходимого.