Preview

Труды Института системного программирования РАН

Расширенный поиск

AWA: выравнивание весов на основе активаций для повышения устойчивости статических методов маркирования нейронных сетей

https://doi.org/10.15514/ISPRAS-2026-38(4)-28

Аннотация

Рассматривается задача повышения устойчивости статических методов маркирования нейронных сетей в сценарии извлечения «белый ящик», при котором цифровой водяной знак (ЦВЗ) извлекается непосредственно из параметров модели. Основное внимание уделяется атаке согласованной перестановки весов, сохраняющей качество работы нейронной сети, но изменяющей порядок параметров, используемый при извлечении водяного знака. Для противодействия такой атаке предлагается алгоритм выравнивания весов на основе активаций AWA, который сопоставляет структурные элементы исходной и атакованной моделей по картам активаций и восстанавливает порядок весов перед извлечением ЦВЗ. В рамках работы AWA интегрируется в процедуру извлечения метода NeuralMark, поскольку данный метод обладает высокой устойчивостью к ряду атак модификации модели, но остается чувствительным к перестановке параметров. Экспериментальная оценка выполнена на нескольких наборах данных, архитектурах нейронных сетей и при разных атаках модификации модели. Результаты показывают, что применение AWA повышает устойчивость NeuralMark к атакам перестановки и сохраняет высокую устойчивость к другим рассмотренным атакам модификации модели. В частности, при атаке согласованной перестановки весов NeuralMark-AWA снижает значение метрики BER на CIFAR-10 и Caltech-101, а значение TPR@FPR увеличивается.

Об авторах

Александр Андреевич АКИМЕНКОВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Стажер-исследователь ИСП им. В.П. Иванникова РАН, аспирант. Научные интересы: цифровые водяные знаки, обработка цифровых изображений, алгоритмы машинного обучения.



Дмитрий Олегович ОБЫДЕНКОВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Кандидат технических наук, научный сотрудник ИСП им. В.П. Иванникова РАН. Научные интересы: методы сокрытия и защищённой передачи информации, компьютерные сети, технологии анализа сетевого трафика.



Алексей Юрьевич ЯКУШЕВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Научный сотрудник ИСП им. В.П. Иванникова РАН. Научные интересы: цифровые водяные знаки, обработка цифровых изображений, алгоритмы машинного обучения.



Халед Набиль АБУД
Институт искусственного интеллекта МГУ имени М.В. Ломоносова
Россия

Стажер исследователь Института искусственного интеллекта МГУ имени М.В. Ломоносова, аспирант. Научные интересы: состязательная устойчивость, генеративные модели, обработка цифровых изображений, глубокое обучение.



Алиса Андреевна УСТИНОВА
Институт системного программирования им. В.П. Иванникова РАН
Россия

Лаборант ИСП им. В.П. Иванникова РАН. Область научных интересов: информационная безопасность, обработка изображений, алгоритмы машинного обучения.



Юрий Витальевич МАРКИН
Институт системного программирования им. В.П. Иванникова РАН
Россия

Кандидат технических наук, научный сотрудник ИСП им. В.П. Иванникова РАН. Область научных интересов: информационная безопасность, анализ сетевого трафика, обработка изображений, алгоритмы машинного обучения.



Список литературы

1. Yao Y., Song J., Jin J. Hashed Watermark as a Filter: A Unified Defense Against Forging and Overwriting Attacks in Neural Network Watermarking. Proceedings of the AAAI Conference on Artificial Intelligence, 2026, vol. 40, no. № 42, pp. 35994-36002.

2. Kim B. et al. Margin-based neural network watermarking. International Conference on Machine Learning. PMLR, 2023, pp. 16696-16711.

3. Uchida Y. et al. Embedding watermarks into deep neural networks. Proceedings of the 2017 ACM on international conference on multimedia retrieval, 2017, pp. 269-277.

4. Lukas N. et al. Sok: How robust is image classification deep neural network watermarking? 2022 IEEE Symposium on Security and Privacy (SP). IEEE, 2022, pp. 787-804.

5. Wang T., Kerschbaum F. Riga: Covert and robust white-box watermarking of deep neural networks. Proceedings of the web conference 2021, 2021, pp. 993-1004.

6. Tian J., Zhou J., Duan J. Probabilistic selective encryption of convolutional neural networks for hierarchical services. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2021, pp. 2205-2214.

7. Li G. et al. Encryption resistant deep neural network watermarking. ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2022, pp. 3064-3068.

8. Fan L., Ng K. W., Chan C. S. Rethinking deep neural network ownership verification: Embedding passports to defeat ambiguity attacks. Advances in neural information processing systems, 2019, vol. 32.

9. Zhang J. et al. Passport-aware normalization for deep model protection. Advances in Neural Information Processing Systems, 2020, vol. 33, pp. 22619-22628.

10. Liu H. et al. Trapdoor normalization with irreversible ownership verification. International Conference on Machine Learning. PMLR, 2023, pp. 22177-22187.

11. Zhou A. et al. Permutation equivariant neural functionals. Advances in neural information processing systems, 2023, vol. 36, pp. 24966-24992.

12. Yan Y. et al. Cracking white-box dnn watermarks via invariant neuron transforms. arXiv preprint, 2022. DOI: 10.48550/arXiv.2205.00199.

13. Li F. Q., Wang S. L., Zhu Y. Fostering the robustness of white-box deep neural network watermarks by neuron alignment. ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2022, pp. 3049-3053.

14. Ganju K. et al. Property inference attacks on fully connected neural networks using permutation invariant representations. Proceedings of the 2018 ACM SIGSAC conference on computer and communications security, 2018, pp. 619-633.

15. Krizhevsky A. et al. Learning multiple layers of features from tiny images. 2009.

16. Fei-Fei L., Fergus R., Perona P. Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories. 2004 conference on computer vision and pattern recognition workshop. IEEE, 2004, pp. 178-178.

17. Krizhevsky A., Sutskever I., Hinton G. E. Imagenet classification with deep convolutional neural networks. Advances in neural information processing systems, 2012, vol. 25.

18. Simonyan K., Zisserman A. Very deep convolutional networks for large-scale image recognition. arXiv preprint, 2014. DOI: 10.48550/arXiv.1409.1556.

19. He K. et al. Deep residual learning for image recognition. Proceedings of the IEEE conference on computer vision and pattern recognition, 2016, pp. 770-778.

20. Huang G. et al. Densely connected convolutional networks. Proceedings of the IEEE conference on computer vision and pattern recognition, 2017, pp. 4700-4708.

21. Szegedy C. et al. Rethinking the inception architecture for computer vision. Proceedings of the IEEE conference on computer vision and pattern recognition, 2016, pp. 2818-2826.

22. Cheng H., Zhang M., Shi J. Q. A survey on deep neural network pruning: Taxonomy, comparison, analysis, and recommendations. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, vol. 46, no. 12, pp. 10558-10578.

23. Adi Y. et al. Turning your weakness into a strength: Watermarking deep neural networks by backdooring. 27th USENIX security symposium (USENIX Security 18), 2018, pp. 1615-1631.

24. Trias C. D. S. et al. Find the Lady: Permutation and Re-Synchronization of Deep Neural Networks. arXiv preprint, 2023. DOI: 10.48550/arXiv.2312.14182.


Рецензия

Для цитирования:


АКИМЕНКОВ А.А., ОБЫДЕНКОВ Д.О., ЯКУШЕВ А.Ю., АБУД Х., УСТИНОВА А.А., МАРКИН Ю.В. AWA: выравнивание весов на основе активаций для повышения устойчивости статических методов маркирования нейронных сетей. Труды Института системного программирования РАН. 2026;38(4):225-244. https://doi.org/10.15514/ISPRAS-2026-38(4)-28

For citation:


AKIMENKOV A.A., OBYDENKOV D.O., YAKUSHEV A.Yu., ABUD Kh., USTINOVA A.A., MARKIN Yu.V. AWA: Activation-Based Weight Alignment for Robust Static Watermarking of Neural Networks. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):225-244. (In Russ.) https://doi.org/10.15514/ISPRAS-2026-38(4)-28



Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2079-8156 (Print)
ISSN 2220-6426 (Online)