Архитектура машинного обучения EG-TD3: эволюционно-направленный двойной задержанный глубокий детерминированный градиент политики
https://doi.org/10.15514/ISPRAS-2026-38(4)-7
Аннотация
В работе представлена архитектура EG-TD3 (Evolutionary-Guided Twin Delayed Deep Deterministic Policy Gradient) – гибридный конвейер обучения, объединяющий алгоритм TD3 и дифференциальную эволюцию для адаптивного управления буферизацией пакетов в нестационарных условиях. На стандартном тесте непрерывного управления (Pendulum-v1) и синтетическом симуляторе очередей с всплесками трафика показано, что EG-TD3 повышает стабильность обучения (коэффициент вариации 0,005 против 0,258 у TD3) и плавность управляющих воздействий (средняя дельта действий 0,052 против 0,164), сохраняя конкурентоспособную устойчивость к шуму наблюдений и действий. Архитектура использует периодическую замену элитных параметров и исследование, направляемое функцией приспособленности. Помимо результатов обучения описан путь развёртывания в сервисной сети на основе разделённых плоскостей управления и данных. Обучение и вывод EG-TD3 выполняются в пользовательском пространстве рядом с плоскостью управления сервисной сети, поскольку полноценное машинное обучение внутри eBPF ограничено верификатором и набором инструкций. На узловой плоскости данных программы eBPF, подключаемые к точкам перехватка TC или сокетов и работающие совместно с прокси в дополнительном контейнере (например, Envoy), собирают телеметрию буферизации и трафика в BPF-карты и применяют квантованные управляющие решения (целевой размер буфера, таймаут и пороги срочности) с частотой контура управления 10–100 Гц, без обучения на пути пакета. Взаимодействие опосредуется общими BPF-картами: eBPF записывает телеметрию; агент EG-TD3 считывает состояние и записывает параметры управления; eBPF применяет обновлённую политику. Обучение на журналах траекторий (офлайн или в прокси в дополнительном контейнере) не блокирует быстрый путь. Приведены полные спецификации гиперпараметров и открытая реализация для воспроизводимости результатов.
Об авторе
Ханк-Дебэн ДЖАМБОНГ ТЕНКЕРоссия
Магистр программной инженерии, аспирант НИУ “Высшая Школа Экономики”, приглашенный преподаватель на факультет компьютерных наук НИУ “Высшая Школа Экономики”. Сфера научных интересов: инженерия программного обеспечения и компьютерных систем.
Список литературы
1. Fujimoto S., van Hoof H., Meger D. Addressing function approximation error in actor-critic methods. In Proceedings of the 35th International Conference on Machine Learning (ICML). PMLR, 2018, pp. 1587-1596.
2. Storn R., Price K. Differential evolution–a simple and efficient heuristic for global optimization over continuous spaces. In Journal of Global Optimization 11.4 (1997), pp. 341-359.
3. Khadka S., Tumer K. Evolution-guided policy gradient in reinforcement learning. In arXiv preprint, 2018. DOI: 10.48550/arXiv.1805.07917.
4. Zhang W., Liu F., Bo Zhao B. Towards in-kernel machine learning with eBPF: opportunities and challenges. In Proceedings of the ACM SIGCOMM Workshop on eBPF and Kernel Extensions, 2024, pp. 45-52.
5. Winstein K. Balakrishnan H. TCP ex machina: Computer-generated congestion control. In Proceedings of the ACM SIGCOMM Conference, 2013.
6. Valadarsky A., Schapira M., Shahaf D. Learning to route. In Proceedings of the ACM Workshop on Hot Topics in Networks (HotNets). 2017.
7. Xu M., Zhu H., Li Y., Liu J. Deep reinforcement learning for dynamic spectrum access in wireless networks. In IEEE Transactions on Cognitive Communications and Networking, 2020.
8. Mnih V., Kavukcuoglu K., Silver D. et al. Human-level control through deep reinforcement learning. In Nature 518.7540, 2015, pp. 529-533.
9. Lillicrap T.P., Hunt J.J., Pritzel A. et al. Continuous control with deep reinforcement learning. In:International Conference on Learning Representations (ICLR), 2016.
10. Salimans T., Ho J., Chen X. et al. Evolution strategies as a scalable alternative to reinforcement learning. In arXiv preprint, 2017. DOI: 10.48550/arXiv.1703.03864.
11. Awad N., Mallik N., Hutter F. DEHB: Evolutionary hyperband for scalable, robust and efficient hyperparameter optimization. In Proceedings of the International Joint Conference on Artificial Intelligence (IJCAI). 2021, pp. 2147-2153.
12. Pourchot A., Sigaud O. CEM-RL: Combining evolutionary and gradientbased methods for policy search. In International Conference on Learning Representations (ICLR), 2019.
13. Schulze M., Krämer M., Wehrle K. Adaptive buffer management with deep reinforcement learning. In IEEE Conference on Computer Communications (INFOCOM), 2021, pp. 1-10.
14. Jay N., Rotman A., Godfrey P.B. Deep learning for adaptive buffer sizing. In Proceedings of the ACM Workshop on Network Meets AI & ML (NetAI), 2019, pp. 1-7.
15. Tenkeu H.-D. D. EG-TD3: Evolutionary-Guided Twin Delayed Deep Deterministic Policy Gradient. Version 0.1.0. 2026. Available at: https://github.com/14karra/eg-td3, accessed 27.07.2026.
16. Puterman M.L. Markov Decision Processes: Discrete Stochastic Dynamic Programming. John Wiley & Sons, 2014.
17. Brockman G., Cheung V., Pettersson L. et al. OpenAI Gym. In arXiv preprint, 2016. DOI: 10.48550/arXiv.1606.01540.
18. Gleave A., Dennis M., Wild C. et al. Adversarial policies: attacking deep reinforcement learning. In International Conference on Learning Representations (ICLR), 2020.
Рецензия
Для цитирования:
ДЖАМБОНГ ТЕНКЕ Х. Архитектура машинного обучения EG-TD3: эволюционно-направленный двойной задержанный глубокий детерминированный градиент политики. Труды Института системного программирования РАН. 2026;38(4):135-152. https://doi.org/10.15514/ISPRAS-2026-38(4)-7
For citation:
DJAMBONG TENKEU H. The EG-TD3 Machine Learning Architecture: Evolutionary-Guided Twin Delayed Deep Deterministic Policy Gradient. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):135-152. https://doi.org/10.15514/ISPRAS-2026-38(4)-7






