К. С. Кузнецов, Е. В. Бурнаев
Устойчивость методов детекции сгенерированного текста на основе выходных распределений и внутренних представлений
Детекторы сгенерированного текста обычно оцениваются на корпусах, где предметная область, порождающая модель и способ построения запроса смешаны, поэтому их устойчивость к сдвигу распределения изучена недостаточно. В данной работе построен корпус из 26 000 текстов, в котором эти факторы варьируются независимо. На нём по метрике AUROC оценены шесть стандартных детекторов, не требующих обучения: в наихудших предметных областях их AUROC составляет 0,47–0,58, при смене генератора — 0,48–0,58. Средняя норма вклада блока внимания, вычисленная на том же последнем слое, превосходит их во всех шести моделях-судьях. При стилистической маскировке она даёт AUROC 0,869 против 0,600–0,657, то есть выше, чем стандартные детекторы достигают без маскировки.
КЛЮЧЕВЫЕ СЛОВА: распознавание сгенерированного текста, оценочный корпус, сдвиг распределения, устойчивость, внутренние представления, большие языковые модели.