Ключевые слова: обработка текста, векторизация, программный комплекс, интеллектуальная система, моделирование
Обработка текстов и подготовка моделей векторизации для программного комплекса классификации научных текстов
УДК 004.622
DOI: 10.26102/2310-6018/2021.32.1.010
Задача классификации научной специальности представляет собой сложный процесс, в котором, как правило, задействуется команда специалистов по определенному научному направлению. Одна из наиболее частых ситуаций, при которой возникает подобная задача, это определение научной специальности при защите диссертации. При решении подобной задачи можно использовать уже существующие научные тексты по специальностям. Наиболее показательным набором текстов по определенной специальности является набор авторефератов. Перед созданием интеллектуальной системы классификации научной специальности требуется обработка текстов авторефератов и их векторизация, которая обеспечит возможность обучения моделей. Разные способы обработки текстов оказывают разное влияние на конечный результат. В данной работе проведено сравнение разных способов подготовки текстов. При этом особенное внимание уделено возможности применения способов на разных по размеру наборах данных. Исследование способов подготовки текстов на малом наборе данных, а затем масштабирование этих же способов на большой набор данных обеспечит значительное сокращение затрачиваемого машинного времени на работу с текстами. В результате исследования установлена самая эффективная комбинация способов подготовки текстовых данных. Дальнейшая векторизация текстов возможна разными способами. В работе рассмотрена возможность векторизации методом TF-IDF. Для обеспечения наилучшего результата работы моделей машинного обучения проведены эксперименты по выбору оптимальных гиперпараметров векторизатора. В результате проведения экспериментов оценено влияние различных изменений гиперпараметров на конечный результат работы модели машинного обучения.
Ключевые слова: обработка текста, векторизация, программный комплекс, интеллектуальная система, моделирование
Для цитирования: Гусев П.Ю. Обработка текстов и подготовка моделей векторизации для программного комплекса классификации научных текстов. Моделирование, оптимизация и информационные технологии. 2021;9(1). URL: https://moitvivt.ru/ru/journal/pdf?id=912 DOI: 10.26102/2310-6018/2021.32.1.010
Опубликована 31.03.2021