Обзоры и сравнения моделей
Модель для распознавания документов на 2,4 млрд
12 августа Cohere опубликовала North Micro Vision — зрительно-языковую модель на 2,4 млрд параметров под лицензией Apache 2.0. Внутри две части: кодировщик изображений на 400 млн параметров, работающий с исходным разрешением, и языковая модель на 2 млрд. Заявленная специализация — разбор документов: таблиц, графиков, скриншотов, форм. Ключевое отличие не в размере, а в том, что картинка не сжимается в маленький квадрат перед обработкой: сохраняются пропорции и мелкие детали. Контекст языковой части — 128 тысяч токенов, но проверенный рабочий диапазон для запросов с изображениями заявлен до 8 тысяч. В каталоге KeyDealer разбора изображений на вход нет, и статья не про доступ у нас. Она про то, почему для документов размер модели решает меньше, чем способ обработки картинки.
Почему исходное разрешение важнее параметров
Разберём главное техническое отличие, потому что оно объясняет, как модель на 2,4 млрд обходит более крупные на своей задаче.
Большинство зрительных моделей приводят вход к фиксированному небольшому размеру — например, к квадрату в несколько сотен пикселей по стороне. Это удобно для архитектуры: все изображения одинаковые, обработка предсказуема.
Для фотографии это работает: кошка остаётся узнаваемой и в уменьшенном виде. Для документа — нет. Страница формата A4, сжатая до маленького квадрата, теряет две вещи сразу: пропорции (лист вытянут, квадрат нет — текст искажается) и мелкие детали (шрифт основного текста превращается в неразличимую серость).
Отсюда парадокс, знакомый всем, кто пробовал распознавать документы моделями: крупная универсальная модель отлично описывает, что на картинке изображён счёт, но путается в цифрах — потому что цифр она фактически не видит.
Обработка в исходном разрешении снимает именно это ограничение. Модель получает документ таким, какой он есть, и мелкий шрифт остаётся мелким шрифтом, а не пятном.
Что это даёт на практике
Класс задач, который такой моделью закрывается, довольно узкий и очень распространённый.
Извлечение полей из документов. Счета, накладные, договоры, анкеты. Задача не требует рассуждений — требует аккуратно прочитать то, что напечатано.
Разбор таблиц. Здесь пропорции критичны: строка и столбец определяются расположением, и искажение геометрии ломает соответствие.
Чтение графиков. Подписи осей мелкие, значения читаются по положению точки. Сжатая картинка делает график декоративным.
Скриншоты интерфейсов. Отдельная задача с тем же требованием: мелкий текст, важное расположение.
Общее у всех четырёх — ответ проверяем. Либо номер счёта извлечён верно, либо нет. Это отличает такие задачи от генерации текста, где «лучше» субъективно, и позволяет честно сравнить модели между собой на своих данных.
Почему компактность здесь решает
Мы уже писали про Qwen 3.8 27B — что компактные открытые модели меняют рынок сильнее триллионных, потому что их действительно разворачивают. Здесь тот же аргумент, но на порядок сильнее.
Двадцать семь миллиардов параметров — это серверная видеокарта. Две с половиной — это уже уровень, на котором модель запускается на обычном рабочем компьютере, а в квантизованном виде и на скромном.
Для задачи «разобрать входящие документы» это меняет постановку целиком:
Данные не покидают периметр. Документы часто содержат персональные данные и коммерческую тайну. Модель, работающая на своём железе, снимает вопрос как класс.
Стоимость перестаёт зависеть от объёма. Обработка миллиона страниц стоит столько же, сколько тысячи, — электричество и время.
Задержка предсказуема. Нет сети, нет очереди на стороне провайдера, нет чужих лимитов.
Лицензия Apache 2.0 при этом не ограничивает коммерческое использование, не требует раскрывать производные и не ставит порогов по размеру бизнеса — в отличие от собственных лицензий вендоров, которые мы разбирали на примере музыкальной модели.
Стоит добавить и то, что компактность даёт не только экономию. Модель на 2,4 млрд параметров дообучается на своих данных силами одного человека за разумное время — в отличие от крупных, где это отдельный проект с бюджетом. Для разбора документов это существенно: у каждой компании свои формы, и универсальная модель на них всегда будет слабее дообученной на конкретных бланках.
Про заявленные результаты
Модель показывает высокие проценты на профильных наборах для разбора документов и распознавания текста, и по этим наборам заявлена как лучшая в своём размерном классе.
Три оговорки, без которых цифры вводят в заблуждение.
«В своём классе» — существенное уточнение. Сравнение идёт с моделями сопоставимого размера, а не с флагманами. Крупная закрытая модель на тех же задачах, скорее всего, окажется точнее.
Наборы данных не равны вашим документам. Российские счета, накладные и формы отличаются от того, на чём модель мерили. Кириллица, свои форматы, качество сканов — всё это проверяется только на своих данных.
Проценты не переносятся на бизнес-метрику. Девяносто с лишним процентов на наборе для распознавания не означают, что девять из десяти счетов будут разобраны верно целиком. Документ считается разобранным, когда верны все поля, и точность по документу всегда ниже точности по символам.
Отсюда единственная разумная проверка: взять полсотни своих реальных документов и посмотреть, сколько разобрано без ошибок.
Про контекст в 128 тысяч и рабочие 8 тысяч
Отдельная деталь из описания, на которую стоит обратить внимание, потому что она встречается у мультимодальных моделей постоянно и почти всегда толкуется неверно.
Языковая часть поддерживает 128 тысяч токенов. Проверенный рабочий диапазон для запросов с изображениями — до 8 тысяч. Это не противоречие и не занижение: это два разных числа про разные вещи.
Изображение, попадая в модель, превращается в токены. И тратит их щедро: страница документа в исходном разрешении — это не десяток токенов, а сотни или тысячи, в зависимости от размера. Чем выше разрешение, тем больше токенов, и в этом обратная сторона отказа от сжатия картинки.
Отсюда практический вывод: окно контекста в мультимодальной задаче считается по картинкам, а не по буквам. Заявленные 128 тысяч — это про текст. Как только в запросе появляются страницы, реальный запас сокращается на порядок.
Что из этого следует для архитектуры разбора документов:
Не подавайте документ целиком, если он длинный. Постраничная обработка с последующей сборкой результата работает лучше и предсказуемее, чем попытка уместить всё сразу.
Не увеличивайте разрешение «на всякий случай». Оно прямо конвертируется в токены и во время обработки. Разумный подход — определить минимальное разрешение, при котором мелкий шрифт ещё читается, и работать на нём.
Проверяйте поведение на верхней границе. Модели обычно деградируют не резко, а постепенно: на длинном входе точность падает раньше, чем появляются ошибки. Найти свою границу можно только замером.
Про то, откуда ещё берутся токены, которых вы не отправляли, мы писали в разборе служебного контекста маршрута — в мультимодальных сценариях эта арифметика становится ещё менее очевидной.
Чего мы не утверждаем
Мы не тестировали модель. Характеристики — из публикаций, перечисленных в источниках.
Не проверяли работу с кириллицей. В заявленных результатах это не выделено, а для нас вопрос ключевой.
Разбора изображений на вход в каталоге нет. На 19 августа там 40 позиций: текстовые модели и четыре генератора изображений. Отправить картинку и получить её описание через нас нельзя.
Не даём юридических заключений по лицензии. Отмечаем, что Apache 2.0 — свободная лицензия; условия под вашу задачу смотрит ваш юрист.
Не сравниваем с закрытыми моделями. Заявка «лучшая в своём размерном классе» относится к сопоставимым по размеру моделям, и переносить её шире мы не будем.
Не знаем требований к железу точно. Размер даёт грубый ориентир; реальные требования зависят от квантизации и разрешения обрабатываемых страниц.
Что держать в голове
North Micro Vision — 2,4 млрд параметров, свободная лицензия, специализация на документах, обработка изображения в исходном разрешении вместо приведения к маленькому квадрату.
Практический вывод не про эту модель, а про выбор вообще: для документов способ обработки картинки важнее размера модели. Крупная универсальная модель, которая сжимает вход, проиграет маленькой специализированной, которая этого не делает.
Как мы отделяем проверенное от предполагаемого — на странице о проекте. Текстовые модели и генерация изображений — по одному ключу: keydealer.ru/login.
Частые вопросы
Что такое North Micro Vision?
Зрительно-языковая модель Cohere на 2,4 млрд параметров, опубликованная 12 августа 2026 года под лицензией Apache 2.0. Заточена под разбор документов.
Из чего она состоит?
Из зрительного кодировщика на 400 млн параметров, работающего с исходным разрешением, и языковой части на 2 млрд параметров.
Что значит «исходное разрешение»?
Изображение не приводится к маленькому квадрату перед обработкой. Сохраняются пропорции и мелкие детали — то, без чего таблицы, графики и формы читаются плохо.
Какой у неё контекст?
Языковая часть поддерживает 128 тысяч токенов, но проверенный рабочий диапазон для запросов с изображениями — до 8 тысяч.
Есть ли она в каталоге KeyDealer?
Нет. На 19 августа 2026 года в каталоге 40 позиций: текстовые модели и четыре генератора изображений. Разбор изображений на вход мы не отдаём.