Обзоры и сравнения моделей
Нейросеть распознаёт текст с фото: какие модели
Картинка на входе — тот случай, когда модель заменяет не одну функцию, а связку из двух: распознать и понять. Классический распознаватель отдаёт вам текст как есть, дальше вы сами разбираетесь, где в нём номер счёта. Модель, принимающая изображение, возвращает сразу нужные поля, объясняет схему или отвечает на вопрос по фотографии. В каталоге на 7 сентября 2026 года таких позиций пятнадцать со статусом verified, и это заметное расширение: ещё сутки назад поле поддержки в выдаче не публиковалось вовсе. Разбираем, что реально работает, где ломается и во что обходится.
Какие модели принимают картинку
Из живой выдачи GET /v1/models на 7 сентября 2026 года, поле capabilities.vision со значением verified.
| Семейство | Позиции |
|---|---|
| GPT | gpt-5-6-sol, gpt-5-6-terra, gpt-5-5, gpt-5-4-mini, gpt-6-astra |
| Claude | opus-5, sonnet-5, haiku-4-5 |
| Gemini | gemini-3-flash, gemini-3-1-flash-lite, gemini-3-7-flash-tiered |
| Grok | grok-4-5, grok-4-6 |
| Kimi | kimi-k3 |
| Llama | llama-3-2-11b-vision |
Ещё у 28 текстовых позиций значение unknown — это «проверка не проводилась», а не «не работает». Разница принципиальная: закладывать unknown в обязательства перед клиентом нельзя, но попробовать на своей задаче можно — как читать поля каталога.
Отдельно стоит отметить llama-3-2-11b-vision: это одна из позиций с нулевой ставкой, то есть проверить сценарий можно вообще без расхода — что доступно бесплатно.

Что это даёт на практике
Пять задач, где связка «распознать и понять» экономит целый шаг.
Чек или накладная → поля в учёт. Не текст целиком, а сразу номер, дата, сумма, контрагент, позиции.
Скриншот ошибки от клиента → разбор. Пользователь присылает картинку вместо текста; модель читает сообщение об ошибке и объясняет, что произошло.
Фото товара → черновик описания. Особенно там, где характеристик в базе мало — как это устроено для магазина.
Схема или график из отчёта → текст. Модель описывает, что изображено, и это можно положить в поиск по документам.
Рукописная заметка → структура. Качество зависит от почерка, но черновик обычно получается.
Общее у всех пяти: результат идёт в вашу структуру, а не в буфер обмена. Именно это отличает подход от обычного распознавания.
Где ломается
Четыре типовые проблемы, из-за которых внедрения буксуют.
Числа читаются неверно и уверенно. Самая опасная категория: сумма 1 250 превращается в 1 260, и по стилю ответа этого не видно — почему модель не сигнализирует о сомнении.
Плохой снимок. Блики, наклон, тень поперёк документа, обрезанный край. Модель попробует достроить недостающее, а не откажется.
Таблицы. Связь числа со столбцом теряется так же, как при извлечении из PDF. Многоколоночные документы — самый частый источник тихих ошибок.
Мелкий шрифт и печати поверх текста. Классика бухгалтерских документов.
Отсюда обязательные меры, те же, что и для работы с документами: каждое число из ответа должно встречаться в исходнике, итоги должны сходиться, а документ, где не сошлось, уходит человеку.
Сколько это стоит
Механика отличается от текстовых запросов, и её стоит понимать до расчёта бюджета.
Отдельной платы за распознавание нет. Изображение превращается во входные токены, и вы платите за них по обычной входной ставке модели.
Количество токенов зависит от размера картинки. Чем крупнее и детальнее снимок, тем больше объём. Фотография с телефона в полном разрешении обходится существенно дороже уменьшенной копии.
Практический вывод, который экономит больше всего: уменьшайте картинку до того, как отправить. Для чтения текста с чека редко нужно исходное разрешение камеры; уменьшение вдвое по стороне сокращает объём в разы без потери читаемости.
Второй приём — обрезать до нужной области. Если вам нужен только блок с реквизитами, отправляйте его, а не весь лист.
Как перевести объём в рубли — методика, а общий подход к подсчёту — как считать токены.
Как выбрать модель
Порядок, который занимает вечер.
- Соберите двадцать своих реальных снимков. С разбросом качества: и аккуратные сканы, и кривые фото с телефона.
- Разметьте вручную, что должно извлечься. Это ваш эталон.
- Прогоните на трёх позициях: нулевой, недорогой и сильной. Так видна форма кривой.
- Считайте не общую точность, а долю снимков, где сошлись все критичные поля. Документ с одной неверной суммой бесполезен целиком.
- Отдельно посмотрите на плохие снимки. Разница между моделями проявляется именно там, а не на аккуратных сканах.
Пятый пункт обычно и решает выбор: на хороших изображениях справляются почти все — подробнее о методике.
Что отправляется наружу
Отдельный разговор, потому что фотография документа — это часто персональные данные целиком, а не выборочные поля.
Обрезайте до нужного. Паспорт целиком отправлять не нужно, если задача — прочитать одну строку.
Закрывайте лишнее до отправки. Программное затемнение областей делается один раз и снимает основную часть вопроса.
Решите, какие типы документов вообще обрабатываются. Не «любые вложения», а конкретный перечень.
Прочитайте, что хранит провайдер. У нас это llms.txt; общий разбор темы — что уходит провайдеру.
И специфичный для картинок риск: изображение — это тоже внешний недоверенный ввод. Текст на фотографии может содержать инструкцию, адресованную модели, и она попадёт в контекст наравне с вашими правилами — как защититься.
Три сценария и что в них решает
Полезно разложить по типам, потому что требования различаются радикально.
Разовое чтение человеком. Сотрудник фотографирует документ и спрашивает, что там написано. Требования минимальны: ошибка видна сразу, цена её нулевая. Годится любая позиция с проверенной поддержкой картинок.
Поточная обработка в учёт. Сотни чеков в день с автоматической записью полей. Здесь решает не средняя точность, а доля документов, где сошлись все критичные поля: документ с одной неверной суммой бесполезен целиком. Обязательны сверка итогов и маршрут для несошедшихся.
Ответ клиенту по присланному изображению. Самый рискованный случай: ошибка уходит наружу от вашего имени. Нужен человек в контуре либо жёсткое ограничение — отвечать только по тому, что удалось прочитать однозначно, и честно признаваться в остальном.
Практический признак, по которому стоит выбирать строгость: насколько поздно обнаружится ошибка. В первом сценарии — немедленно, во втором — при сверке, в третьем — от клиента. Чем позже, тем больше проверок нужно поставить заранее.
И отдельно про снимки от пользователей: они всегда хуже, чем внутренние сканы. Если ваш поток — фотографии с телефонов клиентов, замеряйте качество именно на них, а не на аккуратных примерах, иначе на проде цифры окажутся другими.
Чего мы не утверждаем
Не сравниваем модели по точности распознавания. Своих замеров мы не делали; проверять надо на своих снимках.
Не обещаем, что список сохранится. Ещё сутки назад поле поддержки в выдаче отсутствовало вовсе; актуальное значение всегда в живой выдаче.
Не заменяем специализированные решения. Для потоковой обработки строго типовых документов узкоспециализированный распознаватель может оказаться точнее и дешевле.
Не даём юридических советов по обработке изображений документов.
Что нужно, чтобы попробовать
Ключ заводится за минуту на keydealer.ru/login — почта и пароль, без документов и без зарубежной карты. Оплата российской картой в рублях, один ключ на весь каталог: 56 позиций в шестнадцати семействах на 7 сентября 2026 года.
Платные текстовые модели с проверенной поддержкой картинок доступны сразу на приветственном бонусе — прогнать двадцать своих снимков и сравнить три позиции можно без пополнения. Отдельная позиция llama-3-2-11b-vision тарифицируется по нулевой ставке после пополнения от 100 ₽.
Что держать в голове
Модель, принимающая картинку, заменяет не распознаватель, а связку «распознать плюс понять»: результат приходит сразу в нужной вам структуре.
Два правила делают это рабочим, а не демонстрационным: уменьшайте изображение перед отправкой и сверяйте каждое критичное число с оригиналом программно. Модель не сообщит, что засомневалась, — она ответит уверенно в любом случае.
Как мы проверяем факты и что храним из запросов — на странице о проекте и в llms.txt. Проверить на своих снимках: keydealer.ru/login.
Частые вопросы
Может ли нейросеть прочитать текст с фотографии?
Да, если модель принимает изображение на вход. В каталоге KeyDealer на 7 сентября 2026 года таких позиций с проверенным статусом пятнадцать.
Чем это отличается от обычного распознавания текста?
Классический распознаватель возвращает текст как есть. Модель понимает содержимое: может сразу извлечь нужные поля, объяснить схему или ответить на вопрос по изображению.
Как узнать, поддерживает ли модель картинки?
По полю capabilities.vision в ответе GET /v1/models. Значение verified означает проверенную поддержку, unknown — что проверка не проводилась.
Сколько стоит распознавание фото?
Изображение тарифицируется как входные токены, и их количество зависит от размера картинки. Отдельной платы за распознавание нет.
Насколько это точно?
Достаточно для черновой обработки, но не настолько, чтобы принимать числа на веру. Все критичные значения нужно сверять программно.