Экспертиза

Почему текст распознают лучше изображений

Разница в природе сигнала и что из неё следует для проверки.

Редакция art-see··2 мин чтения

Коротко

У сгенерированного текста есть статистическая подпись — предсказуемость выбора слов. У изображения такой подписи почти нет, и поэтому детекторы картинок работают заметно хуже.

Иллюстрация к сравнению распознавания текста и изображений

В чём разница

Текст — последовательность выборов из ограниченного словаря. Модель выбирает статистически вероятное слово, и эта предсказуемость сама по себе измерима: человеческий текст менее ровный.

Изображение — миллионы пикселей без такой структуры. Аналога «предсказуемости выбора» здесь нет, и детекторы вынуждены искать косвенные признаки: артефакты конкретных архитектур, характерные частотные паттерны.

Косвенные признаки исчезают при обработке и меняются с каждой новой моделью. Отсюда разрыв в надёжности.

Что это значит на практике

Детекторы текста тоже ошибаются, но их ошибки другой природы: они путают с генерацией сухой, структурированный текст — например, написанный не носителем языка или в формальном стиле.

Детекторы изображений ошибаются на обработанном материале: ретушь, фильтры, пересжатие сдвигают статистику в ту же сторону, что и генерация.

Общее у них одно: цена ложного срабатывания выше цены пропуска, потому что первое означает обвинение человека.

Почему это важно знать

Опыт с текстовыми детекторами создаёт ложное ожидание. Человек, видевший, что текст распознаётся сносно, переносит это доверие на детектор изображений — а там надёжность заметно ниже.

Что работает вместо

Для изображений — цепочка публикаций, а не анализ файла.

Для текста — тоже: первоисточник, авторство, история публикации. Просто там детектор даёт больше полезного сигнала как вспомогательный инструмент.

Про наш замер

Мы измеряем точность детекторов изображений на смешанной выборке, отдельно считая ошибки в обе стороны и отдельно — на обработанном материале.

Гипотеза: на обработанных кадрах точность окажется заметно ниже. Если так, из этого следует практическое правило, которого сейчас нет: детектор применим только к оригиналу файла.

Две разные задачи, а не одна с разной точностью

Детектор текста отвечает на вопрос «как это написано». Детектор изображения — «как сделан этот файл». Вопросы разные, и ломаются они по-разному.

Смесь. Текст правят руками: часть сгенерирована, часть переписана, а вердикт выдаётся один на всё. Изображение правят точечно: снятый кадр с дорисованным фрагментом статистически остаётся снятым, и ответ «настоящее» формально верен, а по существу нет.

Единица анализа. У текста она есть — абзац, предложение, и подозрительный кусок можно указать пальцем. У изображения единицы нет: файл оценивается целиком, локальная вставка размывается в общей статистике кадра.

Отсюда следствие, общее для обоих: инструмент отвечает про файл, а не про то, кто и что с ним сделал.

Частые вопросы

Почему детекторы текста надёжнее?
У текста есть статистическая подпись — предсказуемость выбора слов. У изображения аналога нет, и детекторы ищут косвенные признаки, которые исчезают при обработке.
Какая ошибка опаснее?
Ложное срабатывание: оно означает обвинение человека в подделке. Пропуск означает лишь, что вы чего-то не заметили.
Что работает вместо детекторов?
Цепочка публикаций и поиск первоисточника — и для изображений, и для текста.

Редакция art-see

Общая подпись издания. Ставится на служебных страницах, обзорных материалах и всём, что собрано из данных каталога, а не написано одним автором.

Отвечает за: генерация изображений, генерация видео, методика сравнения моделей