В статье усовершенствуется предложенная в предыдущей статье авторов модель кластеризованной распределённой сети с опросом, соответствующая сервис-ориентированной архитектуре. Целью опроса является нахождение ближайшего узла, готового оказать требуемую услугу (сервис) как можно раньше. Предлагаемые алгоритмы обеспечивают достижимость узлов, отсутствие дублирования сообщений, и обмен сообщениями с найденным узлом по кратчайшему пути. Кластеризованность сети означает, что в графе сети выделены подграфы – кластеры, покрывающие все узлы графа. Отсутствие дублирования гарантируется, если двудольный граф кластеров и общих (принадлежащих нескольким кластерам) узлов является деревом. Для поиска ближайшего узла с нужными свойствами опрос выполняется последовательно по раундам: на r-м раунде опрашиваются узлы на концах путей, начинающихся в начальном узле, запрашивающем услугу, и проходящих через r ‑ 1 промежуточных общих узлов. В предыдущей статье авторов рассматривалась кластеризация сети, при которой каждый кластер был кликой, т.е. графом диаметра 1, однако число таких кластеров может получиться достаточно большим. В настоящей статье это требование ослабляется: кластер может быть графом диаметра не более 2. Это существенное ослабление, поскольку, во-первых, как известно, почти все графы имеют диаметр 2, во-вторых, число кластеров уменьшается примерно в 2 раза и также примерно в 2 раза уменьшается число требуемых раундов. Кроме того, показывается, что для кластеров диаметра больше 2 избежать дублирования не всегда возможно.
Недавно появившиеся алгоритмы, основанные на оракуле линейной минимизации (Linear Minimization Oracle, LMO), такие как Muon и Scion, становятся конкурентоспособной заменой оптимизатору Adam. Они обеспечивают более эффективное использование памяти, лучшую переносимость гиперпараметров и превосходное эмпирическое качество в крупномасштабных задачах, например при обучении больших языковых моделей (LLM). Тем не менее между их практическим успехом и теоретическим пониманием сохраняется существенный разрыв: предшествующий анализ игнорирует послойное применение этих оптимизаторов и опирается на нереалистичные предположения о гладкости, приводящие к непрактично малым шагам. Чтобы устранить эти проблемы, мы предлагаем обобщённый послойный LMO-подход вместе с уточнённой моделью обобщённой гладкости. Такой подход точно учитывает послойную геометрию нейронных сетей и даёт гарантии сходимости с высокой предсказательной силой. Кроме того, в отличие от предыдущих результатов, предсказанные теоретические шаги близко соответствуют тонко настроенным значениям. Эксперименты с NanoGPT и CNN подтверждают, что наше предположение выполняется вдоль траектории оптимизации, что в итоге устраняет разрыв между теорией и практикой.
В статье проводится сравнительный анализ форматов XML и JSON как ключевых стандартов для обмена и хранения научных данных. Актуальность исследования обусловлена ростом объемов научной информации и различиями между документо-ориентированными подходами (XML) и практиками веб-разработки (JSON). Цель работы – определить границы эффективного применения каждого формата в современных системах научных коммуникаций и оценить потенциал их интеграции. Методология включает анализ технических характеристик (синтаксис, типизация, метаданные), оценку производительности (объем данных, скорость анализа текста), сравнение инструментальных экосистем (XPath/JSONPath, XSD/JSON Schema, XSLT/jq), а также рассмотрение аспектов безопасности и конкретных примеров использования (JATS/TEI для XML; научные API и большие данные для JSON). Результаты представлены в виде критериев выбора формата для различных задач научных коммуникаций.
Системы эффектов поднимают сведения о вычислительных эффектах программы на уровень типов: они уточняют границы абстракций и позволяют компилятору проверять, что эффектное вычисление выполняется в поддерживающем его контексте. Тем не менее статическое отслеживание эффектов пока не стало повсеместной практикой: ведущие подходы – строки эффектов, возможности (capabilities) и модальные типы – обычно описываются с помощью различного технического аппарата, и проектировщику языка трудно увидеть общую картину пространства решений. Мы предлагаем объединяющий взгляд: система эффектов – это механизм управления контекстными свободными переменными вычисления – зависимостями, которые не передаются обычными аргументами, а должны разрешаться контекстом исполнения. Каждая такая переменная проходит жизненный цикл из двух фаз: она возникает ожидающей – с неразрешённым требованием к контексту; после разрешения зависимость может сохраниться внутри значения – либо буквально, посредством захвата свидетельства, либо в широком смысле, как зависимость от контекста построения. Семейства систем эффектов различаются тем, какие фазы и переходы этого цикла они поддерживают и как отражают их в типах. Классические строковые системы держат переменные ожидающими и не выражают захват. Системы на основе возможностей допускают захват, но удерживают захваченную переменную в предоставившем её контексте средствами escape-анализа. Модальные системы вместо запрета повторно освобождают утёкшую переменную, снова выставляя её в типе как требование к контексту. Сравнение семейств вдоль единой оси жизненного цикла показывает, что выбор поддерживаемых переходов предопределяет остальные черты дисциплины – от необходимого вида полиморфизма до мест сосредоточения аннотаций – и тем самым даёт проектировщику языка карту пространства решений.
Статически связанные библиотеки упрощают распространение и использование программного обеспечения, но усложняют анализ бинарных файлов, поскольку код библиотеки становится неотличимым от кода программы после компиляции. Идентификация встроенных библиотек и их версий имеет важное значение для анализа состава программного обеспечения, оценки уязвимостей и соблюдения лицензионных требований. Несмотря на значительный прогресс существующих решений, достижение точной идентификации библиотек при различных оптимизациях компилятора и нескольких версиях библиотек остается сложной задачей. В данной статье представляется метод нахождения статически связанных библиотек в исполняемых файлах. Предложенный подход строит графы зависимостей программ и графы вызовов функций как для анализируемого исполняемого файла, так и для версий-кандидатов библиотек, после чего сопоставляет соответствующие функции с помощью масштабируемого алгоритма сравнения графов. Метод был реализован и протестирован на исполняемых файлах, содержащих различные версии широко используемых библиотек. Результаты экспериментов показывают, что предложенный подход обеспечивает в среднем 91%-ную точность и 99%-ную полноту идентификации встроенных библиотек, сохраняя при этом практическую масштабируемость.
Глубокие нейронные модели стали передовым подходом в задаче суммаризации кода. До эпохи больших языковых моделей многие специализированные модели применяли различные методы для улучшения базовых моделей преобразования последовательностей, используя структуру кода, за счёт сходства фрагментов кода и их описаний, а также применяя многозадачное обучение. В данном обзоре выделяются ключевые архитектурные компоненты этих методов и предлагается их таксономия. Также описывается, как разные модели используют один и тот же метод или как одна модель сочетает несколько методов. Кроме того, мы обсуждаем текущие недостатки этих моделей, потенциальные направления дальнейших исследований и применимость больших языковых моделей в задаче суммаризации кода, сравнивая их с рассмотренными подходами.
В работе представлена архитектура EG-TD3 (Evolutionary-Guided Twin Delayed Deep Deterministic Policy Gradient) – гибридный конвейер обучения, объединяющий алгоритм TD3 и дифференциальную эволюцию для адаптивного управления буферизацией пакетов в нестационарных условиях. На стандартном тесте непрерывного управления (Pendulum-v1) и синтетическом симуляторе очередей с всплесками трафика показано, что EG-TD3 повышает стабильность обучения (коэффициент вариации 0,005 против 0,258 у TD3) и плавность управляющих воздействий (средняя дельта действий 0,052 против 0,164), сохраняя конкурентоспособную устойчивость к шуму наблюдений и действий. Архитектура использует периодическую замену элитных параметров и исследование, направляемое функцией приспособленности. Помимо результатов обучения описан путь развёртывания в сервисной сети на основе разделённых плоскостей управления и данных. Обучение и вывод EG-TD3 выполняются в пользовательском пространстве рядом с плоскостью управления сервисной сети, поскольку полноценное машинное обучение внутри eBPF ограничено верификатором и набором инструкций. На узловой плоскости данных программы eBPF, подключаемые к точкам перехватка TC или сокетов и работающие совместно с прокси в дополнительном контейнере (например, Envoy), собирают телеметрию буферизации и трафика в BPF-карты и применяют квантованные управляющие решения (целевой размер буфера, таймаут и пороги срочности) с частотой контура управления 10–100 Гц, без обучения на пути пакета. Взаимодействие опосредуется общими BPF-картами: eBPF записывает телеметрию; агент EG-TD3 считывает состояние и записывает параметры управления; eBPF применяет обновлённую политику. Обучение на журналах траекторий (офлайн или в прокси в дополнительном контейнере) не блокирует быстрый путь. Приведены полные спецификации гиперпараметров и открытая реализация для воспроизводимости результатов.
В статье представлен подход к автоматизированному структурированию информации о событиях, извлекаемой из неструктурированных текстовых Интернет-источников, для задач углублённого анализа процессов. Во многих практических случаях сведения о событиях, происходящих в рамках различных процессов, представлены не в виде готовых журналов событий, а распределены по новостным публикациям, отчётам и другим текстовым материалам. Это существенно усложняет применение средств анализа процессов, использующих данные, представленные в определённых форматах (например XES), поскольку требует выполнить поиск релевантных текстов, их интерпретацию и преобразование в структурированное представление, пригодное для анализа с помощью существующих средств Process Mining. Задача ещё более усложняется, если необходимо извлекать дополнительные атрибуты, связанные с описанными событиями, что даёт возможность выявить более глубокие закономерности, характеризующие исследуемые процессы, применять новые методы анализа процессов, учитывающие эти характеристики. Предлагаемый подход основан на сочетании онтологического представления знаний о предметных областях и источниках данных и больших языковых моделей, генеративного искусственного интеллекта. Онтологический слой используется для описания предметных областей исследуемых процессов, открытых источников информации о них, пользовательских запросов и результатов обработки найденной информации, тогда как генеративные модели обеспечивают поиск релевантной информации, извлечение данных о событиях и их первичную обработку и структурирование. Для реализации подхода предложена общая архитектура решения, позволяющего автоматизировать получение текстовых данных из различных источников на основе пользовательских запросов, сформированных с использованием онтологии, предобработку полученных данных с использованием генеративных моделей, структурирование и нормализацию извлечённых данных о событиях, а также подготовку данных для формирования журналов событий в заданных форматах. Для иллюстрации возможностей предложенного подхода рассматривается контролируемый экспериментальный сценарий. Проведённые эксперименты показали, что описанное программное решение позволяет находить релевантные текстовые материалы, выделять события и их атрибуты, а также формировать структурированное представление, пригодное для последующего преобразования в журнал событий. Вместе с тем результаты показали необходимость дополнительной нормализации данных и экспертной интерпретации части извлечённой информации.
В статье исследуется взаимосвязь между экономическими факторами и процессами языковой дивергенции на материале исторически засвидетельствованных распадов праязыков. В качестве теоретической основы используются методы глоттохронологии, разработанные С.А. Старостиным, а также гипотезы о влиянии социально-экономических условий на языковую динамику. Эмпирическую базу составляют данные по прасевернокитайскому и прароманскому языкам, а также по последующим этапам распада дочерних романских языков. В работе применяются прокси-индикаторы экономической активности, включая интенсивность торговли (количество кораблекрушений) и характеристики денежного обращения (содержание металла в монетах, наличие или отсутствие регулярной чеканки, степень монетизации экономики). Показано, что периоды языкового распада систематически коррелируют с фазами экономической дезинтеграции, выражающейся в снижении торговой активности, разрушении денежного обращения и переходе к натуральным формам хозяйства. В противоположность этому, периоды экономической стабильности (например, эпоха Pax Romana и XI–XIII вв.) характеризуются высокой интенсивностью торговли, устойчивостью монетных систем и отсутствием значимой языковой фрагментации. Особое внимание уделяется тому, что содержание серебра в монетах не является универсальным индикатором экономического кризиса: при сохранении высокой пробы могут наблюдаться отказ от денежного обращения, переход на иностранную валюту или снижение роли монет в экономике. Полученные результаты позволяют предположить, что степень экономической интеграции выступает важным фактором, влияющим на скорость и характер языковой дивергенции. Предлагаемый подход может быть использован для уточнения датировок языкового распада и для дальнейшего моделирования взаимодействия экономических и лингвистических процессов.
Современные тенденции развития космических систем (КС) дистанционного зондирования Земли (ДЗЗ) выдвигают самые высокие требования к доступности и оперативности предоставления космической информации потребителям. Для этого разработчиками предлагаются различные информационные системы и программные платформы обработки данных и формирования информационных продуктов ДЗЗ. При этом, несмотря на самое широкое разнообразие прикладных тематических задач дистанционного мониторинга, исследователями определен типовой компонентный состав для создания специализированных информационных систем ДЗЗ. Вместе с тем, выбор конкретной архитектуры информационной системы обработки данных ДЗЗ обуславливается реализуемыми технологическими процессами, а также особенностями используемой информационно-вычислительной инфраструктуры. Учитывая, что до настоящего времени исследователями не разработаны критерии эффективности информационных систем потокового формирования информационных продуктов ДЗЗ, то оценка предлагаемых разработчиками архитектур информационных систем (и их реализаций) допустима преимущественно на качественном уровне. В рамках настоящей работы предлагается подход для количественной оценки эффективности информационных систем обработки данных ДЗЗ, представляющих собой совокупность последовательных технологических процессов, реализованных на базе типовых компонентов. С использованием предлагаемого подхода проанализирована архитектура геоинформационного сервиса, представляющего собой программную платформу потокового формирования высокоуровневых информационных продуктов ДЗЗ. Показаны пути повышения эффективности данной программной платформы, а также определены возможности перераспределения вычислительных ресурсов, при той же эффективности.
В последнее время в российской и зарубежной строительной практике широкое распространение получили программные инструменты спецификации и верификации требований на основе машинно-интерпретируемых форматов, обеспечивающих достоверную и прослеживаемую проверку цифровых информационных моделей (ЦИМ). Наиболее известным среди них является формат IDS, который позволяет представить требования к информационному наполнению ЦИМ, сформированной в соответствии с открытым международным стандартом IFC. Однако на сегодняшний день возможности стандарта IDS крайне ограничены. Чтобы преодолеть имеющиеся ограничения и обеспечить более полную и всестороннюю работу со сложными нормативными требованиями, выражаемыми параметрическими, геометрическими, топологическими, пространственными и иными алгебраическими условиями, разработан машинно-интерпретируемый формат IDS++. В статье описываются концепция и основные конструкции нового формата, а также обсуждаются разработанные программные приложения, предназначенные для спецификации и верификации требований в строительной отрасли.
В работе рассматривается задача адаптивного синтеза изображений высокого разрешения для цифровой патологии. Предложен генеративный конвейер на базе латентного диффузионного трансформера, объединяющий кодирование изображений в латентное пространство, визуальное обусловливание признаками фундаментальной модели UNI2-h, архитектурную оптимизацию слоев внимания за счет KV-компрессии и доменную специализацию с использованием низкоранговых адаптеров LoRA. Описан алгоритм контекстно-ориентированного встраивания объектов, который совмещает пространственно-хроматическое выравнивание, семантически обусловленную диффузию из промежуточного латентного состояния и морфологическое смешивание границ. Программная реализация построена как модульный комплекс из контуров ввода-вывода, латентно-признакового кодирования, генерации и подготовки данных для прикладных моделей. Экспериментальная верификация выполнена на задачах сегментации сосудистых структур и классификации участков лимфоваскулярной инвазии; результаты показывают, что направленное добавление синтетических изображений может повышать качество прикладных моделей в условиях дефицита данных. Эксперименты выполнены с использованием базы из 449 полнослайдовых изображений (WSI), состоящей из выборок DHMC, LCNOV и NLST. Синтетическое расширение выборки включает 5172 изображений для сегментации и 4520 изображений для классификации. Используемые аппаратно-программные оптимизации позволили сократить длительность эпохи обучения и пиковое потребление VRAM, добавление синтетических данных повысило значение метрики IoU модели UNet++ и значение метрики F1-score модели EfficientNet-b1.
Рассматривается задача визуально-инерциальной навигации беспилотных летательных аппаратов в условиях недоступности сигналов глобальных навигационных спутниковых систем. Предложен подход к адаптивному формированию ковариации измерений нейросетевого модуля абсолютной визуальной локализации на основе ЭГО – эвиденциального глубокого обучения (Evidential Deep Learning, EDL) с параметризацией нормально-обратным гамма-распределением. Введено понятие степени объяснимой наблюдаемости как контекстно-зависимой количественной характеристики информативности абсолютных измерений. Доказана теорема о вырождении наблюдаемости при стандартной ковариации процесса и предложена её модификация, обеспечивающая ненулевой коэффициент усиления Калмана между обновлениями. Проведено систематическое экспериментальное исследование, включающее 4 формулировки адаптивной ковариации измерений, 2 режима ковариации процесса и алгоритм автоматического переключения стратегий на двух синтетических и одном полётном наборе данных. Эвиденциальная ковариация превосходит эвристику на всех трёх наборах; величина выигрыша монотонно возрастает с информативностью сцены: снижение средней траекторной ошибки на 7–46% относительно эвристики. На наиболее информативном наборе достигается снижение на 46% и увеличение доли точных кадров с 27% до 66%. Модифицированная ковариация процесса повышает коэффициент усиления Калмана в конфигурациях, где между абсолютными обновлениями накапливается дрейф. Анализ границ применимости показывает, что величина выигрыша определяется корреляцией предсказанной моделью ЭГО ошибки с фактической что задаёт количественный критерий применимости метода.
Элементы принятия решений в роботизированных системах, создаваемые вручную, содержат потенциальные ошибки, которые зачастую остаются незамеченными на этапе разработки и проявляются лишь при реальном развертывании системы. Такие дефекты могут привести к серьезным последствиям, включая повреждение робототехнического оборудования и угрозу безопасности окружающей среды, в том числе людей, находящихся в зоне функционирования робота. Для минимизации издержек на этапе проектирования и одновременного усиления гарантий безопасной эксплуатации беспилотных систем предлагается подход, основанный на моделировании элементов принятия решений на абстрактном концептуальном уровне с последующим автоматическим преобразованием этих моделей в исполняемый программный код. Дополнительно реализуется механизм непрерывного отслеживания корректности работы данных элементов в режиме реального времени. В рамках исследования представлены два специализированных программных инструмента: первый осуществляет компиляцию концептуальных моделей элементов принятия решений в готовый к выполнению код, второй автоматически создает системы мониторинга времени выполнения на основе разработанных моделей. Эффективность предложенных инструментов продемонстрирована в ходе симуляционных экспериментов, подтверждающих преимущества интеграции модельно-ориентированной разработки, автоматической генерации кода и динамического мониторинга.
В статье представлена методика формирования цифрового паспорта сложного промышленного объекта. Цель работы заключается в интеграции разрозненных данных об объекте (проектных, эксплуатационных, технических) в единую информационную систему – «цифровой паспорт», обеспечивающую актуализацию информации на всех этапах жизненного цикла. Для достижения этой цели проведён обзор современного состояния исследований и практики в области цифровых двойников и информационного моделирования, определены требования к структуре и содержанию цифрового паспорта. Разработана поэтапная методика, включающая сбор и оцифровку исходных данных, построение информационной 3D-модели объекта, интеграцию модели с базой данных технической документации и параметров, а также указана необходимость развёртывание цифровой платформы для эксплуатации и обновления паспорта. Ключевыми составляющими методики являются этапы: разметка исходных данных, декомпозиция требований, составления матриц взаимного влияния элементов системы друг на друга, формализация моделей и формирование справочника моделей, формирование системной архитектуры объекта, онтологические модели системы и предметной области.
ISSN 2220-6426 (Online)





