LLM API и интеграция

Распознавание изображений нейросетью через API

Распознавание изображений нейросетью через API

Пятнадцать текстовых позиций каталога из сорока двух на 12 сентября 2026 года проверены на приём изображений во входном запросе: вы отправляете картинку вместе с вопросом и получаете текстовый ответ. Самая дешёвая из них — llama-3-2-11b-vision со ставкой 0 ₽ за миллион токенов, самая дорогая — gpt-6-astra за 60 ₽. Это не генерация картинок и не OCR: модель отвечает на вопрос о том, что изображено, а не рисует и не переписывает символы.

Ниже — список проверенных позиций с ценой, четыре сценария, которые действительно работают, разница с OCR и честный перечень мест, где всё ломается.

Что делает модель с картинкой на входе

Картинка приходит в запрос вместе с текстом. Модель разбирает её на фрагменты, превращает во внутреннее представление и дальше работает так же, как с текстом: отвечает на вопрос, следует инструкции, возвращает структуру в заданном формате.

Ключевое отличие от привычных инструментов работы с изображением в том, что вы задаёте вопрос, а не запускаете фиксированную операцию. «Сколько людей в кадре», «есть ли на фото печать», «какой ошибкой завершилась сборка на этом скриншоте», «соответствует ли снимок требованию к фону» — всё это один и тот же запрос с разной формулировкой.

Отсюда и главный практический вывод: качество результата зависит от того, насколько точно сформулирован вопрос, почти так же сильно, как от выбора модели. Расплывчатое «опиши фото» даёт расплывчатый ответ; список конкретных полей даёт список конкретных значений.

Пятнадцать позиций, где приём картинок проверен

Статус verified означает, что мы прогоняли через позицию реальный запрос с изображением и получали осмысленный ответ. Ставка указана за миллион токенов и одинакова на вход и на выход.

Модель₽ за 1M токеновЗаметка
llama-3-2-11b-vision0бесплатная позиция, открывается после первого пополнения
gemini-3-flash6быстрая, вызов функций тоже проверен
gemini-3-7-flash-tiered6двухуровневый тариф по объёму контекста
gemini-3-1-flash-lite8самая недорогая из платных быстрых
gpt-5-6-luna8картинки и вызов функций проверены
haiku-4-58компактная позиция семейства Claude
kimi-k310открытые веса, длинный контекст
grok-4-520картинки и вызов функций проверены
grok-4-620то же поколение, свежее
gpt-5-530универсальная рабочая позиция
gpt-5-6-terra30рассуждающий режим
opus-530тяжёлая позиция для сложного разбора
sonnet-530баланс цены и качества разбора
gpt-5-6-sol40быстрый ответ на большом объёме
gpt-6-astra60самая дорогая позиция с проверенными картинками

Разброс между бесплатной и самой дорогой позицией здесь такой, что выбор модели стоит начинать снизу. Для «что изображено на фото» дешёвой позиции обычно достаточно; дорогая нужна там, где на картинке мелкие детали, рукописный текст или сложная таблица.

Что значит «не проверяли» у остальных

У остальных двадцати семи текстовых позиций возможность стоит в статусе «не проверяли». Это буквальное утверждение: мы не прогоняли через них запрос с картинкой и не фиксировали результат.

Из этого не следует, что модель откажет. Часть таких позиций почти наверняка принимает изображения — просто у нас нет собственного прогона, а переписывать чужую документацию как факт мы не будем. Проверка занимает один запрос: отправьте картинку с простым вопросом и посмотрите, придёт ли осмысленный ответ или ошибка формата.

Когда мы такую проверку проводим, статус в каталоге меняется. История появления самой возможности — в статье vision появился в каталоге.

Сценарий: описание содержимого

Самый прямолинейный случай — получить текстовое описание того, что на картинке. Применений больше, чем кажется: альтернативный текст для доступности, подписи в каталоге, автоматическая разметка фотоархива, первичная модерация загруженного пользователем контента.

Что работает: просить не «описание», а структуру. «Верни: основной объект, фон, количество людей, есть ли текст в кадре, общее настроение» — и вы получаете набор полей, который можно положить в базу. Свободный текст придётся разбирать потом.

Что не работает: точный подсчёт большого числа объектов. Пять яблок модель сосчитает, сорок семь — нет. Если нужно точное число в толпе, это задача для специализированного детектора, а не для универсальной модели.

Близкие по смыслу задачи мы разбирали в статьях классификация текстов нейросетью и модерация контента нейросетью — подход к структуре ответа там тот же.

Сценарий: данные с фото документа

Сотрудник фотографирует накладную на телефон, бухгалтерия получает структуру. Это самый частый коммерческий сценарий и одновременно самый требовательный к аккуратности.

Правильный запрос здесь выглядит так: перечислите поля, задайте формат каждого (дата в ISO, сумма числом без пробелов, номер строкой), потребуйте строгий JSON и явно разрешите null там, где поле не читается. Последнее важнее всего: без разрешения вернуть пустоту модель склонна дописать правдоподобное значение. Как добиваться предсказуемого формата — в статье JSON от нейросети: строгий формат.

Отдельно про проверку: суммы и реквизиты нужно валидировать кодом, а не доверием. Контрольная сумма счёта, длина расчётного счёта, соответствие даты диапазону — всё это дешёвые проверки, которые ловят большую часть брака. Расширенный разбор документов — в статье нейросеть для документов бизнеса, а работа с многостраничными файлами — в как обработать PDF через API.

Сценарий: проверка фото по требованиям

Задача звучит как «примите или отклоните»: фото на документ с однотонным фоном, снимок товара без посторонних предметов, селфи с документом для верификации, фото объекта для страхового акта.

Здесь модель работает хорошо, потому что вопрос закрытый. Формулировка вида «проверь по списку: фон однотонный — да/нет, лицо в кадре целиком — да/нет, есть блики — да/нет, посторонние объекты — перечисли» даёт стабильный результат, пригодный для автоматического решения.

Практическое правило: не просите вынести итоговый вердикт «годится/не годится». Просите заполнить чек-лист, а решение принимайте своим кодом по своим правилам. Так вы сможете поменять порог строгости, не трогая промпт, и увидите, какой именно пункт провалился.

Второе правило — держите порог неопределённости. Если модель ответила «не могу разобрать», это должно вести к ручной проверке, а не к автоматическому отказу пользователю.

Сценарий: разбор скриншотов

Скриншот — это картинка, но по содержанию текст с интерфейсом вокруг. Модель здесь заменяет пересказ: пользователь присылает снимок экрана с ошибкой, поддержка получает распознанный текст ошибки и предположение о причине.

Работает и обратная задача — разбор интерфейса: «какие поля на этой форме обязательные», «где на скриншоте кнопка отправки», «в каком месте таблицы значение выбивается из ряда». Это удобно для автотестов и для документирования чужих систем.

Ограничение — мелкий текст. Скриншот экрана целиком, сжатый до тысячи пикселей по ширине, теряет читаемость шрифта, и модель начинает угадывать. Лучше присылать фрагмент в оригинальном масштабе, чем весь экран в уменьшенном.

Чем это отличается от OCR

Разница не в качестве, а в природе инструмента, и путать их дорого.

OCR извлекает символы. На выходе — текст и координаты каждого блока, детерминированно и без интерпретации. На чистом скане документа это точнее и дешевле любой универсальной модели, а результат воспроизводим: один и тот же файл всегда даёт один и тот же текст.

Модель понимает изображённое. На выходе — ответ на ваш вопрос. Она справится с фото под углом, с частично засвеченным кадром, с рукописной пометкой на полях и с вопросом «а к какому разделу договора относится этот абзац». Но точного координатного слоя она не даёт, и результат может немного отличаться от запуска к запуску.

Разумная схема для потока документов — комбинация: OCR извлекает текст, модель приводит его к нужной структуре и отвечает на смысловые вопросы. Подробный разбор именно задачи вытащить текст с фотографии — в статье нейросеть распознаёт текст с фото.

Сколько стоит картинка на входе

Изображение не тарифицируется отдельной ставкой за кадр — оно превращается во входные токены и оплачивается по обычной цене модели за миллион токенов. Чем больше разрешение, тем больше токенов.

Отсюда два способа сэкономить, оба безболезненные. Первый — не отправлять картинку в оригинальном разрешении смартфона, если вопрос не требует мелких деталей: уменьшение по длинной стороне до полутора тысяч пикселей режет счёт заметно. Второй — не прикладывать изображение повторно в каждом шаге диалога: если ответ уже получен, дальше достаточно текста.

Общая механика подсчёта — в статьях как считать токены и сколько стоит 1M токенов в рублях.

Где это ломается

Мелкий и плохо освещённый текст. Модель не сообщает «не вижу», она предполагает. Это главный источник тихих ошибок.

Точный подсчёт и измерения. Расстояния, размеры, количество мелких объектов — ненадёжно. Для метрологии нужны метрологические инструменты.

Рукописный текст. Иногда получается хорошо, иногда выдумывается целое слово. Ставить это в автоматический конвейер без проверки человеком нельзя.

Уверенный неверный ответ. Самое неприятное свойство: формулировка ответа одинаково уверенная и когда модель права, и когда ошиблась. Механику явления мы разбирали в статье галлюцинации нейросети.

Защита от всего перечисленного одна и та же: разрешить ответ «не удалось разобрать», валидировать результат кодом и отправлять сомнительные случаи человеку.

Персональные данные на фото

Фотография паспорта, медицинской справки или лица сотрудника — это персональные данные, и отправка их во внешний сервис остаётся обработкой со всеми обязанностями оператора.

Практический минимум: закрывать поля, которые не нужны для задачи, до отправки; не хранить исходные файлы дольше, чем требует процесс; фиксировать в журнале факт обработки. Общий разбор — в статье нейросети и персональные данные.

Чего мы не утверждаем

Мы не ранжируем позиции по точности распознавания. Общей метрики нет, а результат слишком сильно зависит от типа изображения: модель, хорошая на скриншотах, может хуже читать фото под углом.

Мы не говорим, что позиции со статусом «не проверяли» не работают с картинками. Мы говорим ровно то, что написано: у нас нет собственного прогона.

Список и ставки — снимок каталога на 12 сентября 2026 года. Каталог растёт, статусы уточняются по мере проверок, актуальное состояние всегда в живой выдаче списка моделей.

Что нужно, чтобы попробовать

Ключ заводится за минуту на keydealer.ru/login: почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на все позиции каталога.

Первый осмысленный тест занимает пять минут: возьмите десять своих реальных картинок — не идеальные сканы, а то, что реально присылают пользователи, — и прогоните их через бесплатную llama-3-2-11b-vision и одну среднюю платную позицию с одинаковым запросом. Разница в ответах сразу покажет, нужна ли вам дорогая модель.

Что держать в голове

Приём картинки на вход — это не отдельный продукт, а обычный текстовый запрос, к которому приложено изображение. Поэтому и правила те же: точный вопрос вместо расплывчатого, строгий формат ответа, разрешение вернуть пустоту.

Выбор позиции начинайте снизу по цене. Пятнадцать проверенных позиций дают разброс ставки в десятки раз, и для описания содержимого или проверки фото по чек-листу дешёвая справляется не хуже дорогой. Дорогую берите под мелкие детали и сложные документы.

И главное — стройте процесс так, чтобы ошибка модели была видна. Валидация кодом, порог неопределённости, ручная проверка сомнительных случаев. Как мы проверяем факты и почему у каждой цифры стоит дата — на странице о проекте. Завести ключ: keydealer.ru/login.

Частые вопросы

Какие модели умеют распознавать изображения?

На 12 сентября 2026 года приём картинок на вход проверен у пятнадцати текстовых позиций каталога из сорока двух. У остальных возможность в статусе «не проверяли» — это не отказ, а отсутствие нашей проверки.

Чем распознавание изображений отличается от OCR?

OCR извлекает символы и их координаты, модель понимает смысл изображённого и отвечает на вопрос о картинке. Для чистого скана текста OCR точнее и дешевле, для фото под углом и для смысловых вопросов нужна модель.

Можно ли вытащить данные из фото документа?

Да, это рабочий сценарий: вы просите вернуть заданные поля строгим JSON. Но результат нужно проверять — модель может уверенно выдать правдоподобное неверное значение вместо отказа.

Сколько стоит распознать одну картинку?

Изображение превращается во входные токены и тарифуется по обычной ставке модели за миллион токенов. Одно фото среднего размера — это сотни или тысячи токенов в зависимости от разрешения.

Есть ли бесплатная модель с распознаванием?

Да, llama-3-2-11b-vision со ставкой 0 ₽ за миллион токенов. Бесплатные позиции открываются после первого платного пополнения.

Можно ли отправлять фото с персональными данными?

Технически да, юридически это обработка персональных данных со всеми вытекающими обязанностями. Безопаснее закрывать лишние поля до отправки и не хранить исходники дольше необходимого.

Источники