К. С. Кузнецов, Е. В. Бурнаев

Интерпретируемый анализ распознавания текстов, сгенерированных искусственным интеллектом, с помощью разреженных автокодировщиков

Современные детекторы сгенерированного текста достигают высокого качества, однако причины принимаемых ими решений часто остаются неясными. В работе исследуется возможность интерпретируемого распознавания с помощью разреженных автокодировщиков. Остаточный поток Gemma-2-2B представляется в виде разреженного набора признаков, что позволяет оценить вклад каждого из них и выделить универсальные, доменно- и модельно-специфичные признаки. Полученное представление обеспечивает macro-F1 84,65 на Test-подмножестве COLING 2025. Выделенные признаки не только позволяют интерпретировать решение детектора, но и переносятся без переобучения на задачу локализации границы сгенерированного текста, достигая 50,0% точных попаданий на RoFT против 34,5% для перплексии.

КЛЮЧЕВЫЕ СЛОВА: искусственный интеллект, распознавание сгенерированного текста, интерпретируемость, внутренние представления, разреженный автокодировщик, локализация границы.