Методика семантической кластеризации для выявления признаков экстремизма в текстовой информации

DOI: 10.21293/1818-0442-2024-27-4-141-149

Скачать текст статьи в формате PDF

Скачать JATS xml

Аннотация: Представлена разработка методики семантической кластеризации текстов для решения задач кибербезопасности. Она может применяться для выявления ложной и вредоносной текстовой информации, запрещенной законодательством РФ, пропаганды экстремизма и терроризма, призывов к розжигу межнациональной, религиозной и другой ненависти и розни. Предложенная методика основана на современной технологии BERTopic с экспериментально подобранными параметрами и алгоритмами. Оценка методики осуществлялась на трех наборах данных. Согласно полученным результатам, в качестве алгоритма кластеризации был выбран HDBSCAN по метрике Евклида, в качестве алгоритма представления текстов – LaBSE, в качестве алгоритма понижения размерности – UMAP по метрике Жаккарда. Такая конфигурация BERTopic позволила добиться средних показателей 0,68 по коэффициенту силуэта, 0,36 по индексу Дэвиса–Болдина и 136,49 по индексу Калински–Харабаза.

Ключевые слова: семантика, кластеризация, информационная безопасность

Сведения о финансировании: Данная работа выполнена при финансовой поддержке Министерства науки и высшего образования РФ в рамках базовой части государственного задания ТУСУРа на 2023–2025 гг. (проект № FEWM2023-0015).

Библиография статьи:
Романов А. С. Методика семантической кластеризации для выявления признаков экстремизма в текстовой информации / А. С. Романов // Доклады Томского государственного университета систем управления и радиоэлектроники. – 2024. – Т. 27, № 4. – С. 141–149. DOI: 10.21293/1818-0442-2024-27-4-141-149

Авторы и правообладатели:

  • Романов А. С. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)

  • 1. Li T. An ensemble agglomerative hierarchical clustering algorithm based on clusters clustering technique and the novel similarity measurement / T. Li, A. Rezaeipanah // Journal of King Saud University. – 2022. – Vol. 34, No. 6. – P. 3828–3842.
  • 2. McInnes L. Accelerated Hierarchical Density Based Clustering / L. McInnes, J. Healy // 2017 IEEE International Conference on Data Mining Workshops (ICDMW). – New Orleans, LA, USA, 2017. – P. 33–42.
  • 3. K-means clustering algorithms: A comprehensive review, variants analysis, and advances in the era of big data / M.I. Abiodun, E. Absalom, A. Laith, A. Belal, H. Jia // Information Sciences. – 2023. – Vol. 622. – P. 178–210.
  • 4. Gaussian Mixture Model clustering algorithm for a probabilistic shaping 64QAM coherent optical communication system / H. Xu, Y. Wang, C. Li, X. Xin // 2021 Asia Communications and Photonics Conference (ACP). – Shanghai, China, 2021. – P. 1–3.
  • 5. Das M. Markov Clustering Algorithms and Their Application in Analysis of PPI Network of Malaria Genes / M. Das, P. Alphonse, S. Kamalanathan // 2021 11th IEEE International Conference on Intelligent Data Acquisition and Advanced Computing Systems: Technology and Applications (IDAACS). – Cracow, Poland, 2021. – P. 855–860.
  • 6. A Brief Review of Nearest Neighbor Algorithm for Learning and Classification / K. Taunk, S. De, S. Verma, A. Swetapadma // 2019 International Conference on Intelligent Computing and Control Systems (ICCS). – Madurai, India, 2019. – P. 1255–1260.
  • 7. Chen L. The research on text clustering based on LDA joint model / L. Chen, Y. Cheng, J. Qin // Journal of Intelligent & Fuzzy Systems. – 2021. – Vol. 32. – P. 3655–3667.
  • 8. Melody K. Extending the Kohonen self-organizing map networks for clustering analysis // Computational Statistics & Data Analysis. – 2001. – Vol. 38. – P. 161–180.
  • 9. Saha R. Influence of various text embeddings on clustering performance in NLP [Электронный ресурс]. – URL: https://arxiv.org/pdf/2305.03144v1.pdf, свободный (дата обращения: 08.12.2023).
  • 10. Author Clustering and Topic Estimation for Short Texts [Электронный ресурс]. – URL: https://arxiv.org/pdf/2106.09533v2.pdf, свободный (дата обращения: 08.12.2023).
  • 11. Samizadeh M. Graph-based Semantical Extractive Text Analysis [Электронный ресурс]. – URL: https://arxiv.org/pdf/2212.09701v1.pdf, свободный (дата обращения: 08.12.2023).
  • 12. How Many Topics? Stability Analysis for Topic Models [Электронный ресурс]. – URL: https://arxiv.org/pdf/1404.4606v3.pdf, свободный (дата обращения: 08.12.2023).
  • 13. Document Clustering based on Topic Maps [Электронный ресурс]. – URL: https://arxiv.org/ftp/arxiv/papers/1112/1112.6219.pdf, свободный (дата обращения: 08.12.2023).
  • 14. Learning Topics using Semantic Locality [Электронный ресурс]. – URL: https://arxiv.org/pdf/1804.04205.pdf, свободный (дата обращения: 08.12.2023).
  • 15. Grootendorst M. BERTopic: Neural topic modeling with a class-based TF-IDF procedure [Электронный ресурс]. – URL: https://arxiv.org/pdf/2203.05794v1.pdf, свободный (дата обращения: 08.12.2023).
  • 16. How ISIS Uses Twitter [Электронный ресурс]. – URL: https://www.kaggle.com/datasets/fifthtribe/how-isis-uses-twitter, свободный (дата обращения: 08.12.2023).
  • 17. Religious Texts Used By [Электронный ресурс]. – URL: https://www.kaggle.com/datasets/fifthtribe/isis-religious-texts, свободный (дата обращения: 08.12.2023).
  • 18. Deep_translator’s documentation [Электронный ресурс]. – URL: https://deep-translator.readthedocs.io/, свободный (дата обращения: 08.12.2023).
  • 19. Dark Web Forums [Электронный ресурс]. – URL: https://www.azsecure-data.org/dark-web-forums.html, свободный (дата обращения: 08.12.2023).
  • 20. Louvain method [Электронный ресурс]. – URL: https://en.wikipedia.org/wiki/Louvain_method, свободный (дата обращения: 08.12.2023).
  • 21. Silhouette score [Электронный ресурс]. – URL: https://scikit-learn.org/stable/modules/generated/sklearn.metrics.silhouette_score.html, свободный (дата обращения: 08.12.2023).
  • 22. Davies-Bouldin score [Электронный ресурс]. – URL: https://scikit-learn.org/stable/modules/generated/sklearn.metrics.davies_bouldin_score.html, свободный (дата обращения: 08.12.2023).
  • 23. Calinski-Harabasz score [Электронный ресурс]. – URL: https://scikit-learn.org/stable/modules/generated/sklearn.metrics.calinski_harabasz_score.html, свободный (дата обращения: 08.12.2023).
  • 24. Sentence Transformers [Электронный ресурс]. – URL: https://huggingface.co/sentence-transformers, свободный (дата обращения: 08.12.2023).
  • 25. UMAP [Электронный ресурс]. – URL: https://umap-learn.readthedocs.io/en/latest/, свободный (дата обращения: 08.12.2023).
  • 26. HDBSCAN [Электронный ресурс]. – URL: https://hdbscan.readthedocs.io/en/latest/how_hdbscan_works.html, свободный (дата обращения: 08.12.2023).
  • 27. LaBSE [Электронный ресурс]. – URL: https://huggingface.co/sentence-transformers/LaBSE, свободный (дата обращения: 08.12.2023).
Адрес редакции

  634050, г. Томск, пр. Ленина, 40, МК, каб. 310/2

  (3822) 701-582, внутр.: 1456

  journal@tusur.ru