Методика семантической кластеризации для выявления признаков экстремизма в текстовой информации
DOI: 10.21293/1818-0442-2024-27-4-141-149
DOI: 10.21293/1818-0442-2024-27-4-141-149
Аннотация: Представлена разработка методики семантической кластеризации текстов для решения задач кибербезопасности. Она может применяться для выявления ложной и вредоносной текстовой информации, запрещенной законодательством РФ, пропаганды экстремизма и терроризма, призывов к розжигу межнациональной, религиозной и другой ненависти и розни. Предложенная методика основана на современной технологии BERTopic с экспериментально подобранными параметрами и алгоритмами. Оценка методики осуществлялась на трех наборах данных. Согласно полученным результатам, в качестве алгоритма кластеризации был выбран HDBSCAN по метрике Евклида, в качестве алгоритма представления текстов – LaBSE, в качестве алгоритма понижения размерности – UMAP по метрике Жаккарда. Такая конфигурация BERTopic позволила добиться средних показателей 0,68 по коэффициенту силуэта, 0,36 по индексу Дэвиса–Болдина и 136,49 по индексу Калински–Харабаза.
Ключевые слова: семантика, кластеризация, информационная безопасность
Сведения о финансировании: Данная работа выполнена при финансовой поддержке Министерства науки и высшего образования РФ в рамках базовой части государственного задания ТУСУРа на 2023–2025 гг. (проект № FEWM2023-0015).
Библиография статьи:
Романов А. С. Методика семантической кластеризации для выявления признаков экстремизма в текстовой информации / А. С. Романов // Доклады Томского государственного университета систем управления и радиоэлектроники. – 2024. – Т. 27, № 4. – С. 141–149. DOI: 10.21293/1818-0442-2024-27-4-141-149
Авторы и правообладатели: