Preview

Труды Института системного программирования РАН

Расширенный поиск

Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров

https://doi.org/10.15514/ISPRAS-2026-38(4)-12

Аннотация

В работе рассматривается задача адаптивного синтеза изображений высокого разрешения для цифровой патологии. Предложен генеративный конвейер на базе латентного диффузионного трансформера, объединяющий кодирование изображений в латентное пространство, визуальное обусловливание признаками фундаментальной модели UNI2-h, архитектурную оптимизацию слоев внимания за счет KV-компрессии и доменную специализацию с использованием низкоранговых адаптеров LoRA. Описан алгоритм контекстно-ориентированного встраивания объектов, который совмещает пространственно-хроматическое выравнивание, семантически обусловленную диффузию из промежуточного латентного состояния и морфологическое смешивание границ. Программная реализация построена как модульный комплекс из контуров ввода-вывода, латентно-признакового кодирования, генерации и подготовки данных для прикладных моделей. Экспериментальная верификация выполнена на задачах сегментации сосудистых структур и классификации участков лимфоваскулярной инвазии; результаты показывают, что направленное добавление синтетических изображений может повышать качество прикладных моделей в условиях дефицита данных. Эксперименты выполнены с использованием базы из 449 полнослайдовых изображений (WSI), состоящей из выборок DHMC, LCNOV и NLST. Синтетическое расширение выборки включает 5172 изображений для сегментации и 4520 изображений для классификации. Используемые аппаратно-программные оптимизации позволили сократить длительность эпохи обучения и пиковое потребление VRAM, добавление синтетических данных повысило значение метрики IoU модели UNet++ и значение метрики F1-score модели EfficientNet-b1.

Об авторах

Владислав Валерьевич АНАНЬЕВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Научный сотрудник 30-го центра ИСП РАН. Сфера научных интересов: применение нейронных сетей и методов обработки изображений к данным биомедицинского домена, разработка и оптимизация вычислительных конвейеров для предобработки изображений, применение языковых моделей и RAG-систем для обработки и систематизации медицинских данных.



Эдуард Владимирович ЕФИМОВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Лаборант 30-го центра ИСП РАН. Сфера научных интересов: машинное обучение, компьютерное зрение, LLM, прикладная математика, анализ данных.



Егор Сергеевич ЗЕМНУХОВ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Младший научный сотрудник 30-го центра ИСП РАН. Сфера научных интересов: машинное обучение и компьютерное зрение, применяемые в области анализа медицинских изображений, разработка инструментов для работы с биомедицинскими данными.



Анна Алексеевна ТИМАКОВА
Сеченовский Университет
Россия

Научный сотрудник Сеченовского Университета. Сфера научных интересов: анализ биомедицинских изображений при помощи компьютерного зрения.



Евгений Андреевич КАРПУЛЕВИЧ
Институт системного программирования им. В.П. Иванникова РАН
Россия

Кандидат физико-математических наук, заведующий 30-го центра ИСП РАН. Сфера научных интересов: применение алгоритмов анализа данных к биомедицинскому домену, разработка масштабируемых программных конвейеров анализа биомедицинских данных.



Список литературы

1. Goodfellow I. et al. Generative adversarial networks. Communications of the ACM, 2020, vol. 63, no. 11, pp. 139-144.

2. Kingma D. P., Welling M. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114, 2013.

3. Ho J., Jain A., Abbeel P. Denoising diffusion probabilistic models, Advances in neural information processing systems, 2020, vol. 33, pp. 6840-6851.

4. Rombach R. et al. High-resolution image synthesis with latent diffusion models. Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2022, pp. 10684-10695.

5. Peebles W., Xie S. Scalable diffusion models with transformers. Proceedings of the IEEE/CVF international conference on computer vision, 2023, pp. 4195-4205.

6. Chen J. et al. Weak-to-strong training of diffusion transformer for 4k text-to-image generation. European Conference on Computer Vision, pp. 74-91.

7. Yellapragada S. et al. PixCell: A generative foundation model for digital histopathology images. arXiv: 2506.05127 v1, 2025.

8. Chen R. J. et al. Towards a general-purpose foundation model for computational pathology. Nature medicine, 2024, vol. 30, no. 3, pp. 850-862.

9. Vorontsov E. et al. A foundation model for clinical-grade computational pathology and rare cancers detection. Nature medicine, 2024, vol. 30, no. 10, pp. 2924-2935.

10. Hu E. J. et al. Lora: Low-rank adaptation of large language models. Iclr., 2022, vol. 1, no. 2, p. 3.

11. Zhou Z. et al. Unet++: A nested u-net architecture for medical image segmentation. International workshop on deep learning in medical image analysis. Cham: Springer International Publishing, 2018, pp. 3-11.

12. Tan M., Le Q. Efficientnet: Rethinking model scaling for convolutional neural networks //International conference on machine learning. PMLR, 2019, pp. 6105-6114.

13. Heusel M. et al. Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems, 2017, vol. 30.

14. Bińkowski M. et al. Demystifying mmd gans. arXiv preprint arXiv:1801.01401, 2018.

15. Kynkäänniemi T. et al. Improved precision and recall metric for assessing generative models. Advances in neural information processing systems, 2019, vol. 32.

16. Timakova A. et al. Artificial intelligence assists in the detection of blood vessels in whole slide images: practical benefits for oncological pathology. Biomolecules, 2023, vol. 13, no. 9, p. 1327.

17. Timakova A. et al. LVI-PathNet: Segmentation-classification pipeline for detection of lymphovascular invasion in whole slide images of lung adenocarcinoma. Journal of Pathology Informatics, 2024, vol. 15, p. 100395.

18. Timakova A. et al. Computer Vision-Assisted Spatial Analysis of Mitoses and Vasculature in Lung Cancer. Journal of Clinical Medicine, 2025, vol. 14, no. 21, p. 7526.

19. Асатурова А.В., Трегубова А.В., Бадлаева А.С., Рогожина А.С., Ананьев В.В., Карпулевич Е.А., Рогожин Д.В. Возможности цифровой цитопатологии, проблемы ее внедрения в практику и пути их решения. Журнал Современные проблемы науки и образования, 2025, № 3.


Рецензия

Для цитирования:


АНАНЬЕВ В.В., ЕФИМОВ Э.В., ЗЕМНУХОВ Е.С., ТИМАКОВА А.А., КАРПУЛЕВИЧ Е.А. Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров. Труды Института системного программирования РАН. 2026;38(4):225-238. https://doi.org/10.15514/ISPRAS-2026-38(4)-12

For citation:


ANANEV V.V., EFIMOV E.V., ZEMNUKHOV E.S., TIMAKOVA A.A., KARPULEVICH E.A. Adaptive High-resolution Image Synthesis Based on Diffusion Transformers. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):225-238. (In Russ.) https://doi.org/10.15514/ISPRAS-2026-38(4)-12



Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2079-8156 (Print)
ISSN 2220-6426 (Online)