Чтение
Требует концентрации
Распознаём и извлекаем данные из любых документов на базе мультимодальных языковых моделей — без привязки к формату, макету и качеству скана.
Значительная часть документов в реальном бизнесе заполняется вручную и в полевых условиях: у клиента, на выезде, в разъездах. У таких документов нет единого формата, координат полей и стабильного качества скана. Жёсткие OCR-шаблоны на них не масштабируются — под каждый макет нужен свой шаблон, и он ломается при любом изменении формы.
Мы предлагаем другой подход: документ обрабатывает модель, которая понимает его как человек, а не разбирает по координатам. Оператор подключается только там, где распознавание неоднозначно, всё остальное уходит в 1С, СЭД или другую систему автоматически.
Коррекция ориентации и перспективы, оценка качества скана, сегментация на содержательные блоки: текст, таблицы, подписи, отметки.
Печатный текст — в лёгкий OCR. Рукописные и сложные фрагменты — в VLM вместе с контекстом: подписью поля, соседними ячейками, заголовками таблицы.
Модель считывает и интерпретирует сложные и рукописные участки там, где обычный OCR ошибается или сдаётся.
Результаты OCR и VLM собираются в общий набор блоков — с координатами, исходным изображением и признаками качества.
Из блоков формируется заданная бизнесом схема полей и структурированный JSON, с сохранением связи каждого значения с визуальным источником.
5-20 минутТребует концентрации
Ручной ввод не исключает ошибок
Проверка и выявление ошибок
Секунды Модель OCR + VLM
Помощь оператора в редких кейсах
Без участия человека
OCR распознаёт символы, но не понимает смысла — под каждый макет документа нужен свой шаблон, и он рассыпается при любом изменении формы.
Модель работает иначе: она понимает документ целиком и достаёт нужные поля по смыслу, без разметки координат. Поэтому подключение нового вида документа — это в первую очередь настройка схемы полей и промптов, а не разработка нового шаблона.
Данные достаются из документа, а не по жёсткому шаблону — решение не привязано к конкретному формату, макету или виду документа.
Печатный текст — через быстрый и дешёвый OCR, сложные и рукописные фрагменты — через VLM. Критичные поля не уходят в интеграцию без подтверждения оператора.
Поля, правила и промпты бизнес-пользователь настраивает в административной панели самостоятельно, без участия разработчиков.
Контейнеризация, CI/CD, ролевой доступ, аудит, мониторинг SLA и качества, восстановление после сбоев — часть платформы, а не последующая доработка.
Модели разворачиваются в инфраструктуре заказчика. Документы и персональные данные не передаются во внешние API.
На типовом расчёте для отдела из 16 операторов ручной обработки документов платформа снимает до 40% ручных часов. При средней стоимости оператора 100 000 ₽ в месяц это даёт эффект около 7,7 млн ₽ в год, а базовый пакет внедрения окупается примерно за 15 месяцев.
Платформа строится как универсальный контур: подключение новых типов документов и процессов даёт кратный рост эффекта без пересборки ядра системы.
Мы делали похожие проекты для крупного российского бизнеса, включая финансовый, страховой, нефтегазовый и строительный секторы:
Для одной из крупнейших российских страховых компаний — промышленная платформа для документов, изначально заполняемых в полевых условиях: у клиента, на месте страхового случая, в разъездах агента. Каскад OCR + VLM, настройка полей и правил без кода в административной панели, ручная проверка только неоднозначных полей оператором.
OCR/VQA-модуль, настройка бизнес-процессов и промптов без кода, локальные LLM на инфраструктуре заказчика.
RAG-подход, подбор моделей под русский язык, доработка парсера документов, стенд и метрики точности.
Гибридный OCR, автотипизация и версионирование, сверка данных между документами на локальных LLM/VLM.
Автораспознавание типа документа, извлечение данных из сканов, поиск по реестру.