В. А. Жолобов, А. А. Зайцев

Устойчивость ранжирования моделей для различных модальностей

Бенчмарки, включающие несколько наборов данных, широко используются для сравнения методов машинного обучения. Однако итоговый порядок моделей может зависеть от выбора наборов данных, правила агрегирования и состава сравниваемых методов. В работе исследуется устойчивость ранжирования при обучении представлений изображений и классификации временных рядов. Сопоставлены методы агрегирования на основе значений метрик, рангов, профилей качества и попарных сравнений. Устойчивость получаемых ранжирований оценивается при выборе подмножеств наборов данных и изменении состава сравниваемых методов. На бенчмарке изображений DINOv3 занимает первое место при всех рассмотренных правилах агрегирования, тогда как порядок методов в середине рейтинга сильнее зависит от этой процедуры. На бенчмарке временных рядов DepTS2Vec неизменно располагается выше SoftCL и TS2Vec при любом способе агрегирования. Ранжирования на небольших случайных подмножествах архивов UCR и UEA существенно менее устойчивы, чем на бенчмарке изображений. Анализ также показывает, что точность на ImageNet лишь умеренно коррелирует с порядком моделей на разнородных наборах данных для целевых задач и потому не может служить надежным косвенным показателем общего качества представлений. Модель Bayesian Bradley–Terry относится к числу наиболее устойчивых методов агрегирования при рассмотренных изменениях бенчмарка и дополнительно позволяет выполнять попарные сравнения с учетом неопределенности. Полученные результаты показывают, что для надежного сравнения моделей необходимо наряду с агрегированными оценками приводить показатели устойчивости ранжирования и не ограничиваться одним общепринятым набором данных. Код опубликован в открытом доступе: https://github.com/ZVlaDreamer/Performance_robustness.git.

КЛЮЧЕВЫЕ СЛОВА: машинное обучение, оценка качества, сравнительное тестирование, наборы данных, агрегирование рангов.