Технический стек проекта сочетал проверенные промышленные компоненты и современные подходы машинного обучения. Модуль использует пять алгоритмов распознавания и поддерживает импортозамещённый технологический стек.
Для предварительного извлечения текста использовались решения
OCR и методы компьютерного зрения, адаптированные под широкий спектр изображений и качества сканирования. Для формального извлечения полей и валидации применялись rule-based механизмы, обеспечивающие предсказуемость на критичных для учёта полях.
На уровне семантики и нетривиальной классификации была задействована подсистема на базе больших языковых моделей (LLM), которая позволила работать с неструктурированными текстами, выделять смысловые сущности и предзаполнять тематики.
Интеграция с
СЭД системой осуществляется через API с синхронизацией со справочниками, а развёртывание производится в защищённом контуре, что обеспечивает соответствие требованиям по обработке ПДн и отказоустойчивости. Все компоненты были интегрированы в единый процесс с логированием, мониторингом распознавания и контролем качества результатов, что обеспечило прозрачность и возможность последующего аудита.