Оценка качества синтеза речи с применением попарного сравнения и сиамской нейронной сети

DOI: 10.21293/1818-0442-2026-29-1-144-151

Скачать текст статьи в формате PDF

Скачать JATS xml

Аннотация: Актуальность. Развитие технологий систем синтеза речи по образцу обусловливает необходимость определения надежных методов оценки их реалистичности для обеспечения информационной безопасности. Цель исследования. Сравнительное исследование реалистичности моделей синтеза речи (RVC, Coqui TTS и Fish Speech) на основе комплексного подхода, сочетающего субъективное попарное сравнение аудиторами и объективную классификацию сиамской нейронной сети. Методы. Применены попарное сравнение аудиозаписей группой независимых аудиторов, а также сиамская нейронная сеть с обучаемым классификатором на основе MFCC-спектрограмм, обученная на авторском русскоязычном наборе данных. Научная новизна. Для задачи определения синтезированной речи предложена модифицированная архитектура сиамской нейронной сети, в которой вместо фиксированной метрики расстояния используется конкатенация эмбеддингов с последующей обработкой многослойным персептроном. Результаты. Результаты исследования показали, что модель Fish Speech обладает наивысшим акустическим сходством с оригиналом, вызывая максимальное число ложных идентификаций. Обученная сиамская сеть выявляет синтезированную речь с итоговой точностью 84%. Практическая значимость. Полученные выводы доказывают применимость предложенной архитектуры для независимой автоматизированной оценки качества синтеза и позволяют продолжить исследование в направлении защиты речевых систем от спуффинг-атак с возможностью сравнения с перцептивными способностями человека.

Ключевые слова: синтез речи, нейронные сети, попарное сравнение, экспертная оценка, Retrieval-based Voice Conversion, Text-to-Speech, Fish Speech, сиамская нейронная сеть

Сведения о финансировании: Работа выполнена при поддержке Министерства науки и высшего образования России: FEWM-2026-0009 (ТУСУР).

Библиография статьи:
Шелупанов А. А. Оценка качества синтеза речи с применением попарного сравнения и сиамской нейронной сети / А. А. Шелупанов [и др.] // Доклады Томского государственного университета систем управления и радиоэлектроники. – 2026. – Т. 29, № 1. – С. 144–151. DOI: 10.21293/1818-0442-2026-29-1-144-151

Авторы и правообладатели:

  • Шелупанов А. А. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)
  • Костюченко Е. Ю. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)
  • Погорелов Г. Л. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)
  • Никитин Н. Д. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)
  • Максимов А. В. , Томский государственный университет систем управления и радиоэлектроники (Томск, Россия)

  • 1. Репьюк Н.С. Программный комплекс для исследования речевых сигналов / Н.С. Репьюк, А.А. Конев // Доклады ТУСУР. – 2025. – Т. 28, № 1. – С. 93–99.
  • 2. ГОСТ Р 50840–95. Передача речи по трактам связи. Методы оценки качества, разборчивости и узнаваемости. – М.: Изд-во стандартов, 1996. – 18 с.
  • 3. Kostuchenko E. The evaluation process automation of phrase and word intelligibility using speech recognition systems / E. Kostuchenko et al. // International Conference on Speech and Computer. – Istanbul, Turkey, Cham: Springer, 2019. – P. 237–246.
  • 4. Семенчук К.В. Сущность метода попарного сравнения в функционально-стоимостном анализе / К.В. Семенчук, П.Е. Минкевич, А.А. Пузыревская // Science Time. – 2016. – № 12. – С. 107–109.
  • 5. Оценка качества синтезированной речи: проблемы и решения / А.И. Соломенник, А.О. Таланов, М.В. Соломенник и др. // Известия вузов. Приборостроение. – 2013. – Т. 56, № 2. – С. 38–41.
  • 6. Новохрестова Д.И. Алгоритм и методика количественной оценки схожести речевых сигналов / Д.И. Новохрестова, Е.Ю. Костюченко, И.А. Ходашинский // Доклады ТУСУР. – 2022. – Т. 25, № 3. – С. 45–51.
  • 7. Сорокин В.Н. Распознавание личности по голосу: аналитический обзор / В.Н. Сорокин, В.В. Вьюгин, А.А. Тананыкин // Информационные процессы. – 2012. – Т. 12, № 1. – С. 1–30.
  • 8. A Survey of Audio Classification Using Deep Learning / K. Zaman, M. Sah, C. Direkoglu, M. Unoki // IEEE Access. – 2023. – Vol. 11. – P. 106620–106649.
  • 9. Катаев М.Ю. Методика распознавания речевых команд в школьных информационных системах // Речевые технологии. – 2024. – № 1. – С. 18–34.
  • 10. Оганесян О. Сравнение алгоритмов клонирования голоса в условиях нулевого и малого количества примеров / О. Оганесян, Д. Саргсян, А. Маладжян // Труды ИСП РАН. – 2024. – Т. 36, № 4. – С. 7–16.
  • 11. Coqui TTS Documentation: XTTS [Электронный ресурс]. – URL: https://coqui-tts.readthedocs.io/en/latest/models/xtts.html (дата обращения: 15.01.2025).
  • 12. Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis / S. Liao, Y. Wang, T. Li et al. // arXiv e-prints. – 2024. – Art. No. arXiv:2411.01156.
  • 13. Librosa: Audio and music signal analysis in Python / B. McFee, C. Raffel, D. Liang et al. // Proc. of the 14th Python in Science Conf. (SciPy). – Austin, TX, USA. – 2015. – Vol. 8. – P. 18–25.
  • 14. Voice activity detection algorithm based on long-term pitch information / X.K. Yang, L. He, Q. Dan, W.Q. Zhang // EURASIP Journal on Audio, Speech, and Music Processing. – 2016. – No. 1. – P. 1–9.
  • 15. Comparative analysis of audio classification with MFCC and STFT features using machine learning techniques / M.K. Gourisaria et al. // Discover Internet of Things. – 2024. – Vol. 4, No. 1. – P. 1–23.
Адрес редакции

  634050, г. Томск, пр. Ленина, 40, МК, каб. 310/2

  (3822) 701-582, внутр.: 1456

  journal@tusur.ru