TDM: формальная модель данных для интеграции структурированных и неструктурированных данных
https://doi.org/10.15514/ISPRAS-2026-38(4)-26
Аннотация
Современные информационно-аналитические системы совместно обрабатывают документы, результаты извлечения информации, базы знаний и делают экспертные проверки. Документные форматы сохраняют исходный контент, графы знаний описывают семантические связи, но происхождение данных, статусы проверки и жизненный цикл извлечённых фактов обычно задаются внешними механизмами. Это затрудняет интеграцию источников, повторную обработку документов и сопровождение предметно-ориентированных алгоритмов. В статье предлагается TDM (Talisman Data Model) – формальная модель для совместного представления документов, извлечённых фактов, предметных областей и баз знаний. Документ и база знаний рассматриваются как контейнеры типизированных фактов с указанием происхождения, статуса проверки, структурного положения и предметного контекста. Модель единообразно описывает исходный контент, результаты извлечения, экспертную верификацию, графовую проекцию и перенос знаний между предметными областями. Основной результат работы – математическая модель корректных состояний TDM-контейнера и операций, сохраняющих эти состояния. Показано, что TDM может служить формальным интеграционным слоем для компонентов интеллектуальной информационно-аналитической системы; практическая применимость модели подтверждается её использованием в платформе «Talisman».
Об авторах
Денис Юрьевич ТУРДАКОВРоссия
Кандидат физико-математических наук, заведующий отделом информационных систем, заведующий исследовательским центром доверенного искусственного интеллекта Института системного программирования им. В.П. Иванникова РАН. Сфера научных интересов: машинное обучение, доверенный ИИ, извлечение информации, большие данные, анализ сложных сетей.
Владимир Дмитриевич МАЙОРОВ
Россия
Научный сотрудник Института системного программирования им. В.П. Иванникова РАН. Основные научные интересы: обработка естественного языка, анализ тональности текстов, аспектно-ориентированный анализ мнений, большие языковые модели, агентные системы.
Максим Александрович РЫНДИН
Россия
Научный сотрудник Института системного программирования им. В.П. Иванникова РАН. Научные интересы: MLOps, инфраструктура машинного обучения, автоматизация ML-конвейеров, контроль доступа и инженерия машинного обучения.
Список литературы
1. Турдаков Д. Ю., Аветисян А.И. и др. Доверенный искусственный интеллект: вызовы и перспективные решения. Доклады Российской академии наук. Математика, информатика, процессы управления, 2022, т. 508(0), с. 13-18.
2. Колокольников Ф.А., Орлов В.В., Турдаков Д.Ю. Перспективы использования доверенной информационной аналитической системы на базе платформы Талисман с применением методов искусственного интеллекта для повышения эффективности эксплуатации сложных аппаратных систем. Труды Института системного программирования РАН, 2024, т. 36, вып. 3, с. 106-22.
3. Euzenat J., Shvaiko P. Ontology Matching. Springer Berlin Heidelberg, Berlin, Heidelberg, 2d ed., 2013.
4. Fagin R., Kolaitis P.G., Miller R.J., Popa L. Data exchange: Semantics and query answering. Theoretical Computer Science, 2005, 336(1), pp. 89-124.
5. Hartig O. Foundations of RDF* and SPARQL*. arXiv preprint, 2017. DOI: 10.48550/arXiv.1703.07936.
6. Knublauch H., Kontokostas D. Shapes constraint language (SHACL). W3C Recommendation, 2017.
7. Moreau L., Missier P. PROV-DM: The PROV data model. W3C Recommendation, 2013.
8. Edge D., Trinh H., Cheng N., Bradley J., Chao A., Mody A., Truitt S., Metropolitansky D., Osazuwa Ness R., Larson J. From local to global: A graph RAG approach to query-focused summarization. arXiv preprint, 2024. DOI: 10.48550/arXiv.2404.16130.
9. Peng B., Zhu Y., Liu Y., Bo X., Shi H., Hong C., Zhang Y., Tang S. Graph retrieval-augmented generation: A survey.
10. Lewis P., Perez E., Piktus A., Petroni F., Karpukhin V., Goyal N., Küttler H., Lewis M., Yih W., Rocktäschel T., Riedel S., Kiela D. Retrieval-augmented generation for knowledge-intensive NLP tasks. In Advances in Neural Information Processing Systems, 2020, vol. 33, pp. 9459-9474.
11. Yao S., Zhao J., Yu D., Du N., Shafran I., Narasimhan K.R., Cao Y. ReAct: Synergizing reasoning and acting in language models. In The Eleventh International Conference on Learning Representations, 2023. Thebibliography.
12. Wu Q., Bansal G., Zhang J., Wu Y., Li B., Zhu E., Jiang L., Zhang X., Zhang S., Liu J., Awadallah A.H., White R.W., Burger D., Wang C. AutoGen: Enabling next-gen LLM applications via multi-agent conversation. arXiv preprint, 2023. DOI: 10.48550/arXiv.2308.08155.
13. Guo T., Chen X., Wang Y., Chang R., Pei S., Chawla N.V., Wiest O., Zhang X.. Large language model based multi-agents: A survey of progress and challenges. In Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence, 2024, pp. 8048-8057.
14. Belyaeva O., Bogatenkova A., Turdakov D. Dedoc: A universal system for extracting content and logical structure from textual documents. In 2023 Ivannikov ISPRAS Open Conference, 2023, pp. 20-25.
15. Реализация модели TDM. Доступно по адресу: https://github.com/ispras/tdm, дата обращения 10.08.2026.
Рецензия
Для цитирования:
ТУРДАКОВ Д.Ю., МАЙОРОВ В.Д., РЫНДИН М.А. TDM: формальная модель данных для интеграции структурированных и неструктурированных данных. Труды Института системного программирования РАН. 2026;38(4):193-214. https://doi.org/10.15514/ISPRAS-2026-38(4)-26
For citation:
TURDAKOV D.Yu., MAYOROV V.D., RYNDIN M.A. TDM: A Formal Data Model for Integrating Structured and Unstructured Data. Proceedings of the Institute for System Programming of the RAS (Proceedings of ISP RAS). 2026;38(4):193-214. (In Russ.) https://doi.org/10.15514/ISPRAS-2026-38(4)-26






