А. З. Шамсутдинов, А. В. Халин

Комбинация синтетических и реальных видеорядов для улучшения обобщающей способности нейросетевых методов шумоподавления

Шумоподавление видео является важным этапом обработки видеоданных, а современные нейросетевые методы требуют большого объёма парных чистых и зашумлённых последовательностей. Реальных RAW-видео с такими парами крайне мало, поэтому модели обучают на синтетическом шуме, распределение которого не совпадает с реальным. Возникающий доменный сдвиг снижает качество при переносе модели на новый, ранее не наблюдавшийся сенсор. В работе исследуются два взаимодополняющих механизма, повышающих качество одновременно на целевом домене реальных данных и на новых доменах при ограниченном объёме реальных данных. Первый — трансферное обучение на основе адаптивной инстанс-нормализации (AdaIN): модель предобучается на синтетических данных, после чего на небольшом наборе реальных видеопар обновляется лишь часть параметров, отвечающих за подстройку под целевой шум. Второй — аугментации межкадрового движения, расширяющие диапазон видимых моделью смещений за пределы того, что содержится в малочисленных реальных данных. Эксперименты на наборах ReCRVD и CRVD показывают, что сочетание этих механизмов обеспечивает наилучший баланс качества между целевым и отложенным доменами.

КЛЮЧЕВЫЕ СЛОВА: шумоподавление видео, трансферное обучение.