С развитием генеративных моделей визуально отличить синтетическое изображение от реальной фотографии становится все сложнее. Ученые НГТУ провели сравнение классов алгоритмов и выявили, что лучший результат дает подход на основе Vision Transformer (ViT), который анализирует изображение глобально, сообщила в пятницу пресс-служба вуза.
«Мы не просто обучили нейросеть, а исследовали, как разные модели «видят» картинку. Установили, что сверточные сети фокусируются на локальных текстурах, а трансформеры улавливают взаимосвязи во всем кадре. Это позволяет им замечать и равномерно распределенные артефакты, характерные для генерации. Такой подход оказался особенно эффективным при небольшом объеме обучающей выборки», – рассказал руководитель проекта Егор Антонянц.
Существующие системы обнаружения часто требуют десятков тысяч примеров, теряют точность при сжатии изображений или изменении разрешения. Обученная нейросеть лишена этих недостатков. Предварительное тестирование ViT Tiny показало точность 89%.
По словам разработчиков, метод показывает стабильную работу даже на ограниченных данных. Это особенно важно для задач криминалистики.Технология предназначена для внедрения в системы верификации мультимедиа-контента, которые используют в новостных агентствах, соцсетях, силовых структурах. Ее также можно внедрять в платформы для проверки авторских работ.
