Preview

Труды Института системного программирования РАН

Расширенный поиск

Послойная обобщенная гладкость: единый подход для адаптивных LMO-оптимизаторов

https://doi.org/10.15514/ISPRAS-2026-38(4)-2

Аннотация

Недавно появившиеся алгоритмы, основанные на оракуле линейной минимизации (Linear Minimization Oracle, LMO), такие как Muon и Scion, становятся конкурентоспособной заменой оптимизатору Adam. Они обеспечивают более эффективное использование памяти, лучшую переносимость гиперпараметров и превосходное эмпирическое качество в крупномасштабных задачах, например при обучении больших языковых моделей (LLM). Тем не менее между их практическим успехом и теоретическим пониманием сохраняется существенный разрыв: предшествующий анализ игнорирует послойное применение этих оптимизаторов и опирается на нереалистичные предположения о гладкости, приводящие к непрактично малым шагам. Чтобы устранить эти проблемы, мы предлагаем обобщённый послойный LMO-подход вместе с уточнённой моделью обобщённой гладкости. Такой подход точно учитывает послойную геометрию нейронных сетей и даёт гарантии сходимости с высокой предсказательной силой. Кроме того, в отличие от предыдущих результатов, предсказанные теоретические шаги близко соответствуют тонко настроенным значениям. Эксперименты с NanoGPT и CNN подтверждают, что наше предположение выполняется вдоль траектории оптимизации, что в итоге устраняет разрыв между теорией и практикой.

Об авторе

Артем Александрович РЯБИНИН
Лаборатория фундаментальных исследований искусственного интеллекта
Россия

Специалист лаборатории фундаментальных исследований искусственного интеллекта Московского независимого исследовательского института искусственного интеллекта. Научные интересы включают в себя теоретическую оптимизацию, компьютерное зрение и диффузионные модели



Список литературы

1. Kingma D. P., Ba J. Adam: A method for stochastic optimization. In International Conference on Learning Representations, 2015. DOI: 10.48550/arXiv.1412.6980.

2. Loshchilov I., Hutter F. Decoupled Weight Decay Regularization. In International Conference on Learning Representations, 2019. DOI: 10.48550/arXiv.1711.05101.

3. Wilson A. C., Roelofs R., Stern M., Srebro N., Recht B. The marginal value of adaptive gradient methods in machine learning. Advances in Neural Information Processing Systems, 30, 2017. DOI: 10.48550/arXiv.1705.08292.

4. Zou D., Cao Y., Li Y., Gu Q. Understanding the generalization of Adam in learning neural networks with proper regularization. arXiv preprint, 2021. DOI: 10.48550/arXiv.2108.11371.

5. Jordan K., Jin Y., Boza V., You J., Cesista F., Newhouse L., Bernstein J. Muon: An optimizer for hidden layers in neural networks, 2024. Available at: https://kellerjordan.github.io/posts/muon/, accessed 13.07.2026.

6. Pethick T., Xie W., Antonakopoulos K., Zhu Z., Silveti-Falls A., Cevher V. Training Deep Learning Models with Norm-Constrained LMOs. arXiv preprint, 2025. DOI: 10.48550/arXiv.2502.07529.

7. Frank M., Wolfe P. An algorithm for quadratic programming. Naval Research Logistics Quarterly, 1956, vol. 3(1-2), pp. 95-110. Available at: https://onlinelibrary.wiley.com/doi/abs/10.1002/nav.3800030109, accessed 13.07.2026.

8. Pokutta S. The Frank-Wolfe algorithm: a short introduction. Jahresbericht der Deutschen Mathematiker-Vereinigung, vol. 126(1), pp. 3-35, 2024. DOI: 10.48550/arXiv.abs/2311.05313.

9. Liu J., Su J., Yao X., Jiang Z., Lai G., Du Y., Qin Y., Xu W., Lu E., Yan J. et al. Muon is scalable for LLM training. arXiv preprint, 2025. DOI: 10.48550/arXiv.2502.16982.

10. Crawshaw M., Liu M., Orabona F., Zhang W., Zhuang Z. Robustness to unbounded smoothness of generalized signSGD. Advances in Neural Information Processing Systems, 2022, vol. 35, pp. 9955-9968. DOI: 10.48550/arXiv.2208.11195.

11. Zhang J., He T., Sra S., Jadbabaie A. Why Gradient Clipping Accelerates Training: A Theoretical Justification for Adaptivity. In International Conference on Learning Representations, 2020. DOI: 10.48550/arXiv.1905.11881.

12. Gorbunov E., Tupitsa N., Choudhury S., Aliev A., Richtárik P., Horváth S., Takáč M. Methods for convex (L0, L1)-smooth optimization: Clipping, acceleration, and adaptivity. In The Thirteenth International Conference on Learning Representations, 2025. DOI: 10.48550/arXiv.2409.14989.

13. Vankov D., Rodomanov A., Nedich A., Sankar L., Stich S. U. Optimizing (L0, L1)-Smooth Functions by Gradient Methods. In The Thirteenth International Conference on Learning Representations, 2025. DOI: 10.48550/arXiv.2410.10800.

14. Hübler F., Yang J., Li X., He N. Parameter-agnostic optimization under relaxed smoothness. In International Conference on Artificial Intelligence and Statistics. PMLR, 2024, pp. 4861-4869. DOI: 10.48550/arXiv.2311.03252.

15. Yu D., Jiang W., Wan Y., Zhang L. Mirror descent under generalized smoothness. arXiv preprint, 2025, DOI: 10.48550/arXiv.2502.00753.

16. Nesterov Y. Efficiency of coordinate descent methods on huge-scale optimization problems. SIAM Journal on Optimization, 2012, vol. 22(2), pp. 341-362. Available at: https://epubs.siam.org/doi/10.1137/100802001, accessed 13.07.2026.

17. Richtárik P., Takáč M. Iteration complexity of randomized block-coordinate descent methods for minimizing a composite function. Mathematical Programming, 2014, vol. 144(1), pp. 1-38. DOI: 10.48550/arXiv.1107.2848.

18. Bernstein J., Wang Y.-X., Azizzadenesheli K., Anandkumar A. signSGD: Compressed optimisation for non-convex problems. In International Conference on Machine Learning. PMLR, 2018, pp. 560-569. DOI: 10.48550/arXiv.1802.04434.

19. Jiang R., Maladkar D., Mokhtari A. Convergence analysis of adaptive gradient methods under refined smoothness and noise assumptions. arXiv preprint, 2024. DOI: 10.48550/arXiv.2406.04592.

20. Liu Y., Pan R., Zhang T. AdaGrad under Anisotropic Smoothness, 2024. arXiv:2406.15244 [cs.LG]. DOI: 10.48550/arXiv.2406.15244.

21. Xie S., Mohamadi M. A., Li Z. Adam Exploits ℓ∞-geometry of Loss Landscape via Coordinate-wise Adaptivity. arXiv preprint, 2024. DOI: 10.48550/arXiv.2410.08198.

22. Bernstein J., Newhouse L. Old Optimizer, New Norm: An Anthology. In OPT 2024: Optimization for Machine Learning, 2024. DOI: 10.48550/arXiv.2409.20325.

23. Jaggi M. Revisiting Frank-Wolfe: Projection-free sparse convex optimization. In International Conference on Machine Learning. PMLR, 2013, pp. 427-435.

24. Kovalev D. Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization, 2025. arXiv:2503.12645 [cs.LG]. DOI: 10.48550/arXiv.2503.12645.

25. Li J., Hong M. A Note on the Convergence of Muon and Further, 2025. arXiv:2502.02900 [math.OC]. DOI: 10.48550/arXiv.2502.02900.

26. Shah I., Polloreno A. M., Stratos K., Monk P., Chaluvaraju A., Hojel A., Ma A., Thomas A., Tanwer A., Shah D. J. et al. Practical Efficiency of Muon for Pretraining. arXiv preprint, 2025. DOI: 10.48550/arXiv.

27. Jordan K., Bernstein J., Rappazzo B., Vlado B., Jiacheng Y., Cesista F., Koszarsky B. Modded-nanoGPT: Speedrunning the nanoGPT Baseline. GitHub repository, 2024. Available at: https://github.com/KellerJordan/modded-nanogpt, accessed 13.07.2026.

28. Pethick T., Xie W., Antonakopoulos K., Zhu Z., Silveti-Falls A., Cevher V. Scion. GitHub repository, 2025. Available at: https://github.com/LIONS-EPFL/scion.git, accessed 13.07.2026.

29. Yu A. W., Huang L., Lin Q., Salakhutdinov R., Carbonell J. Block-Normalized Gradient Method: An Empirical Study for Training Deep Neural Network, 2018. Available at: https://openreview.net/forum?id=ry831QWAb, accessed 13.07.2026.

30. Balles L., Pedregosa F., Roux N. L. The Geometry of Sign Gradient Descent, 2020. arXiv:2002.08056 [cs.LG]. DOI: 10.48550/arXiv.2002.08056.

31. Liu C., Zhu L., Belkin M. Loss landscapes and optimization in over-parameterized non-linear systems and neural networks. Applied and Computational Harmonic Analysis, 59, 2022. DOI: 10.1016/j.acha.2021.12.009. Available at: https://arxiv.org/abs/2003.00307, accessed 13.07.2026.

32. Karimi H., Nutini J., Schmidt M. Linear Convergence of Gradient and Proximal-Gradient Methods Under the Polyak-Łojasiewicz Condition, 2020. arXiv:1608.04636 [cs.LG]. DOI: 10.48550/arXiv.1608.04636.

33. Jordan K. Cifar-10 Airbench. GitHub repository, 2024. Available at: https://github.com/KellerJordan/cifar10-airbench, accessed 13.07.2026.


Рецензия

Для цитирования:


РЯБИНИН А.А. Послойная обобщенная гладкость: единый подход для адаптивных LMO-оптимизаторов. Труды Института системного программирования РАН. 2026;38(4):25-48. https://doi.org/10.15514/ISPRAS-2026-38(4)-2

For citation:


RIABININ A.A. Layer-Wise Generalized Smoothness: A Unified Framework for Adaptive LMO Optimizers. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):25-48. (In Russ.) https://doi.org/10.15514/ISPRAS-2026-38(4)-2



Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2079-8156 (Print)
ISSN 2220-6426 (Online)