Ключевые слова: метрические книги, OCR, paddleOCR, gigaChat-MAX, LLM, дореформенная орфография, CER, WER, TF‑IDF
УДК 681.3
DOI: 10.26102/2310-6018/2026.59.8.002
Статья посвящена повышению качества распознавания архивных текстов, представленных в виде метрических книг Российской империи конца XIX – начала XX века, являющихся уникальным историческим источником для генеалогии и демографии. Стандартные системы оптического распознавания символов, обученные на современных печатных текстах, демонстрируют на подобных документах точность не более 30 % из-за комплекса факторов: ветхость бумажных носителей, выцветание чернил, наличие дореформенной орфографии (буквы ѣ, і, ѳ, ѵ) и смешение кириллического и латинского начертаний. В работе проведён сравнительный анализ двух подходов к улучшению распознавания: дообучение модели PaddleOCR на исторических данных и использование в связке с большой языковой моделью GigaChat-MAX без дообучения. Для постобработки разработан специализированный запрос для языковой модели, включающий правила замены символов, словарь частотных терминов и правила восстановления дореформенной орфографии. Эксперименты на выборке из 50 разворотов метрической книги показали, что дообучение повышает точность до 48 %, а интеграция с языковой моделью – до 65 %, при этом коэффициент ошибок на символ снижается с 70 % до 35 %. Языковая модель исправляет более половины всех ошибок, особенно эффективно заменяя латиницу на кириллицу и восстанавливая исторические окончания. В результате исследования предложен алгоритм распознавания архивных рукописных документов, отличающийся применением комбинации большой языковой модели и модели OCR, и обеспечивающий снижение затрат на разметку данных и вычислительные ресурсы. Практическая значимость: предложенный подход позволяет автоматизировать распознавание метрических книг с точностью 65 %, сокращая ручной труд по транскрипции более чем вдвое.
1. Левенштейн В.И. Двоичные коды с исправлением выпадений, вставок и замещений символов. Доклады Академии наук СССР. 1965;163(4):845–848.
2. Smith R. An overview of the Tesseract OCR engine. In: Proceedings of the Ninth International Conference on Document Analysis and Recognition (ICDAR 2007), 23–26 September 2007, Curitiba, Brazil. IEEE; 2007. P. 629–633. https://doi.org/10.1109/ICDAR.2007.4376991
3. Li Ch., Liu W., Guo R., et al. PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System. arXiv. URL: https://arxiv.org/abs/2206.03001 [Accessed 23rd March 2026].
4. Курейчик В.В., Родзин С.И., Бова В.В. Методы глубокого обучения для обработки текстов на естественном языке. Известия ЮФУ. Технические науки. 2022;(2):189–199. https://doi.org/10.18522/2311-3103-2022-2-189-199
5. Shen Y., Wei J., Niu X., et al. Efficient ultra-lightweight convolutional attention network for embedded identity document recognition system. Image and Vision Computing. 2026;168:105930. https://doi.org/10.1016/j.imavis.2026.105930
6. Du Y., Li Ch., Guo R., et al. PP-OCR: A practical ultra lightweight OCR system. arXiv. URL: https://arxiv.org/abs/2009.09941 [Accessed 23rd March 2026].
7. Vaswani A., Shazeer N., Parmar N., et al. Attention Is All You Need. In: Advances in Neural Information Processing Systems 30 (NeurIPS 2017), 04–09 December 2017, Long Beach, CA, USA. 2017. P. 5998–6008.
8. Волощук А.С. Метрические книги как исторический источник: характеристика, анализ, поиск и доступ к ним. В сборнике: Документ в современном обществе: коммуникативные модели и технологии: Материалы XVI Всероссийской студенческой научно-практической конференции, 07–08 апреля 2023 года, Екатеринбург, Россия. Екатеринбург: Уральский федеральный университет имени первого Президента России Б.Н. Ельцина; 2023. С. 256–260.
9. Львович Я.Е., Хакназаров И.В., Лямзин И.С. О возможностях поддержки электронного документооборота в организациях. В сборнике: Социально-экономическое развитие России: проблемы, тенденции, перспективы: Сборник научных статей участников 24-й Международной научно-практической конференции, 22 мая 2025 года, Курск, Россия. Курск: Университетская книга; 2025. С. 299–301.
10. Кузнецов А.В. За пределами тематического моделирования: анализ исторического текста с помощью больших языковых моделей. Историческая информатика. 2024;(4):47–65. https://doi.org/10.7256/2585-7797.2024.4.72560
11. Бакулин А.Ю., Гусев П.Ю., Львович Я.Е. Оптимизация развития цифровизированной организационной системы обслуживания заказов на основе интеграции с машинным обучением прогностических моделей. Вестник Российского нового университета. Серия: Сложные системы: модели, анализ и управление. 2026;(1):68–78. https://doi.org/10.18137/RNU.V9187.26.01.P.68
Ключевые слова: метрические книги, OCR, paddleOCR, gigaChat-MAX, LLM, дореформенная орфография, CER, WER, TF‑IDF
Для цитирования: Ковалева В.В., Гусев П.Ю., Сепкин С.С. Разработка алгоритма распознавания архивных текстов на основе интеграции OCR и больших языковых моделей. Моделирование, оптимизация и информационные технологии. 2026;14(8). URL: https://moitvivt.ru/ru/journal/article?id=2581 DOI: 10.26102/2310-6018/2026.59.8.002
© Ковалева В.В., Гусев П.Ю., Сепкин С.С. Статья опубликована на условиях лицензии Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NS 4.0)Поступила в редакцию 03.07.2026
Поступила после рецензирования 31.07.2026
Принята к публикации 10.08.2026