Специфика выявления компрометации обучающих данных систем искусственного интеллекта
DOI: 10.21293/1818-0442-2026-29-1-124-134
DOI: 10.21293/1818-0442-2026-29-1-124-134
Аннотация: Актуальность. В настоящее время большое распространение получили системы искусственного интеллекта, при этом многие из них уязвимы к атакам отравления обучающих данных: атакуя, злоумышленник целенаправленно вводит вредоносные экземпляры записей в датасет, что приводит к снижению точности модели или появлению скрытых бэкдоров. Цель исследования. Разработка подхода к анализу способов негативного воздействия на обучающие наборы, который позволит не только определять наиболее оптимальные воздействия, но и количественно определять степень их серьёзности (предполагается разработка системы метрик для количественной оценки атак отравления и построение модели оптимальных действий злоумышленника на основе марковских процессов принятия решений). Методы. Применены: двусторонний тест Колмогорова–Смирнова и тест хи-квадрат для сравнения распределений признаков, расстояние Дженсена–Шеннона для оценки дрейфа данных, метод Adversarial Validation, а также алгоритм итерации по значениям для нахождения оптимальной политики в марковском процессе принятия решений. Научная новизна. Предложена формальная модель взаимодействия злоумышленника и аналитика как марковского процесса принятия решений с функцией вознаграждения, одновременно учитывающей снижение точности модели, неразличимость отравленных данных и степень их статистического дрейфа относительно контрольного набора. Результаты. Получены зависимости вероятности успешной атаки от её масштаба для различных состояний доверия аналитика. Выявлены оптимальные и суб-оптимальные последовательности атакующих воздействий. Показано, что предложенные метрики количественно характеризуют как эффективность, так и скрытность атаки. Практическая значимость. Предложенный подход позволяет на этапе разработки систем искусственного интеллекта оценить восприимчивость используемых наборов данных к атакам отравления и обосновать превентивные меры защиты: регулярный контроль JS-дивергенции, проверку распределения меток классов и применение нескольких статистических тестов для обнаружения аномалий.
Ключевые слова: сетевая атака, нейросеть, датасет, матрица признаков, функция активации, язык программирования Python, марковский процесс принятия решений
Библиография статьи:
Ветров И. А. Специфика выявления компрометации обучающих данных систем искусственного интеллекта / И. А. Ветров, А. И. Сацута, В. В. Подтопельный // Доклады Томского государственного университета систем управления и радиоэлектроники. – 2026. – Т. 29, № 1. – С. 124–134. DOI: 10.21293/1818-0442-2026-29-1-124-134
Авторы и правообладатели: