References

moitvivt

Моделирование, оптимизация и информационные технологии

Modeling, Optimization and Information Technology

2310-6018

Издательство

10.26102/2310-6018/2021.32.1.010

912

Обработка текстов и подготовка моделей векторизации для программного комплекса классификации научных текстов

Word processing and preparation of vectorization models for a software package for the classification of scientific texts

0000-0002-3752-0152

Гусев

Павел Юрьевич

Gusev

Pavel Yrievich

gusevpvl@gmail.com aff-1

Воронежский государственный технический университет Voronezh State Technical University

01 01 2026

1 1

10.26102/2310-6018/2021.32.1.010

2026

This work is licensed under a Creative Commons Attribution 4.0 International License

Задача классификации научной специальности представляет собой сложный процесс, в котором, как правило, задействуется команда специалистов по определенному научному направлению. Одна из наиболее частых ситуаций, при которой возникает подобная задача, это определение научной специальности при защите диссертации. При решении подобной задачи можно использовать уже существующие научные тексты по специальностям. Наиболее показательным набором текстов по определенной специальности является набор авторефератов. Перед созданием интеллектуальной системы классификации научной специальности требуется обработка текстов авторефератов и их векторизация, которая обеспечит возможность обучения моделей. Разные способы обработки текстов оказывают разное влияние на конечный результат. В данной работе проведено сравнение разных способов подготовки текстов. При этом особенное внимание уделено возможности применения способов на разных по размеру наборах данных. Исследование способов подготовки текстов на малом наборе данных, а затем масштабирование этих же способов на большой набор данных обеспечит значительное сокращение затрачиваемого машинного времени на работу с текстами. В результате исследования установлена самая эффективная комбинация способов подготовки текстовых данных. Дальнейшая векторизация текстов возможна разными способами. В работе рассмотрена возможность векторизации методом TF-IDF. Для обеспечения наилучшего результата работы моделей машинного обучения проведены эксперименты по выбору оптимальных гиперпараметров векторизатора. В результате проведения экспериментов оценено влияние различных изменений гиперпараметров на конечный результат работы модели машинного обучения.

The task of classifying a scientific specialty is a complex process in which, as a rule, a team of specialists in a certain scientific direction is involved. One of the most common situations in which such a task arises is the definition of a scientific specialty when defending a dissertation. When solving such a problem, you can use existing scientific texts in specialties. The most indicative set of texts on a particular specialty is a set of abstracts. Before creating an intelligent classification system for a scientific specialty, it is necessary to process the texts of abstracts and their vectorization, which will provide the possibility of training models. Different types of word processing have different effects on the final result. This paper compares different methods of preparing texts. At the same time, special attention is paid to the possibility of using the methods on data sets of different sizes. Investigation of ways of preparing texts on a small data set, and then scaling the same methods for a large data set will provide a significant reduction in the computer time spent on working with texts. As a result of the research, the most effective combination of methods for preparing text data has been established. Further vectorization of texts is possible in different ways. The paper considers the possibility of vectorization using the TF-IDF method. To ensure the best result of the machine learning models, experiments were carried out to select the optimal hyperparameters of the vectorizer. As a result of the experiments, the influence of various changes in hyperparameters on the final result of the machine learning model was evaluated.

обработка текста векторизация программный комплекс интеллектуальная система моделирование

word processing vectorization software package intelligent system modeling

Исследование выполнено без спонсорской поддержки.

The study was performed without external funding.

References 1

Иванов Н.Н. Синтаксический разбор предложения для векторизации текста. Вопросы науки и образования. 2017;11(12):45-46.

Спивак А.И., Лапшин С.В., Лебедев И.С. Классификация коротких сообщений с использованием векторизации на основе elmo. Известия Тульского государственного университета. Технические науки. 2019;10:410-418.

Флах, П.. Машинное обучение. Наука и искусство построения алгоритмов, которые извлекают знания из данных. Litres, 2019.

Бородин А.И., Вейнберг Р.Р., Литвишко О.В. Методы обработки текста при создании чат-ботов. Хуманитарни Балкански изследвания. 2019;3(3(5)):108-111. DOI: 10.34671/sch.hbr.2019.0303.0026

Кайбасова Д.Ж. Извлечение статистических данных для определения уникальности документов на основе анализ контента учебных программ дисциплин. The Scientific Heritage. 2020;44-1(44):57-62.

Кротова О.С., Москалев И.В., Хворова Л.А., Назаркина О.М. Реализация эффективных моделей классификации медицинских данных методами интеллектуального анализа текстовой информации. Известия Алтайского государственного университета. 2020;1(111):99-104.

Исаченко В.В., Апанович З.В. Система анализа и визуализации для кросс-языковой идентификации авторов научных публикаций. Вестник Новосибирского государственного университета. Серия: Информационные технологии. 2018;16(2):49-61. DOI: 10.25205/1818-7900-2018-16-2-49-61.

Жеребцова Ю.А., Чижик А.В. Создание чат-бота: обзор архитектур и векторных представлений текста. International Journal of Open Information Technologies. 2020;8(7):50-56.

Попова Е.П., Леоненко В.Н.. Прогнозирование реакции пользователей в социальных сетях методами машинного обучения. Научно-технический вестник информационных технологий, механики и оптики. 2020;20(1):118-124.

Udhayakumar S., Nancy J.S., UmaNandhini D., Ashwin P., Ganesh R. Context Aware Text Classification and Recommendation Model for Toxic Comments Using Logistic Regression. Intelligence in Big Data Technologies—Beyond the Hype. Springer, Singapore. 2021;209-217. DOI: 10.1007/978-981-15-5285-4_20.

De Cock M., Dowsley R., Nascimento A.C., Railsback D., Shen J., Todoki A. (2021). High performance logistic regression for privacy-preserving genome analysis. BMC Medical Genomics. 2021;14(1):1-18. DOI: 10.21203/rs.3.rs-26375/v1.

Kumar V., Subba B. (2020, February). A TfidfVectorizer and SVM based sentiment analysis framework for text data corpus. 2020 National Conference on Communications (NCC). IEEE. 2020;1-6. DOI: 10.1109/ncc48643.2020.9056085.

Subba B., Gupta P. A tfidfvectorizer and singular value decomposition based host intrusion detection system framework for detecting anomalous system processes. Computers & Security. 2021;100. DOI: 10.1016/j.cose.2020.102084.

Абрамов П.С. Извлечение ключевой информации из текста. Новые информационные технологии в автоматизированных системах. 2018;21:217-219.

The authors declare that there are no conflicts of interest present.