Экспертиза
Почему текст распознают лучше изображений
Разница в природе сигнала и что из неё следует для проверки.
Коротко
У сгенерированного текста есть статистическая подпись — предсказуемость выбора слов. У изображения такой подписи почти нет, и поэтому детекторы картинок работают заметно хуже.

В чём разница
Текст — последовательность выборов из ограниченного словаря. Модель выбирает статистически вероятное слово, и эта предсказуемость сама по себе измерима: человеческий текст менее ровный.
Изображение — миллионы пикселей без такой структуры. Аналога «предсказуемости выбора» здесь нет, и детекторы вынуждены искать косвенные признаки: артефакты конкретных архитектур, характерные частотные паттерны.
Косвенные признаки исчезают при обработке и меняются с каждой новой моделью. Отсюда разрыв в надёжности.
Что это значит на практике
Детекторы текста тоже ошибаются, но их ошибки другой природы: они путают с генерацией сухой, структурированный текст — например, написанный не носителем языка или в формальном стиле.
Детекторы изображений ошибаются на обработанном материале: ретушь, фильтры, пересжатие сдвигают статистику в ту же сторону, что и генерация.
Общее у них одно: цена ложного срабатывания выше цены пропуска, потому что первое означает обвинение человека.
Почему это важно знать
Опыт с текстовыми детекторами создаёт ложное ожидание. Человек, видевший, что текст распознаётся сносно, переносит это доверие на детектор изображений — а там надёжность заметно ниже.
Что работает вместо
Для изображений — цепочка публикаций, а не анализ файла.
Для текста — тоже: первоисточник, авторство, история публикации. Просто там детектор даёт больше полезного сигнала как вспомогательный инструмент.
Про наш замер
Мы измеряем точность детекторов изображений на смешанной выборке, отдельно считая ошибки в обе стороны и отдельно — на обработанном материале.
Гипотеза: на обработанных кадрах точность окажется заметно ниже. Если так, из этого следует практическое правило, которого сейчас нет: детектор применим только к оригиналу файла.
Две разные задачи, а не одна с разной точностью
Детектор текста отвечает на вопрос «как это написано». Детектор изображения — «как сделан этот файл». Вопросы разные, и ломаются они по-разному.
Смесь. Текст правят руками: часть сгенерирована, часть переписана, а вердикт выдаётся один на всё. Изображение правят точечно: снятый кадр с дорисованным фрагментом статистически остаётся снятым, и ответ «настоящее» формально верен, а по существу нет.
Единица анализа. У текста она есть — абзац, предложение, и подозрительный кусок можно указать пальцем. У изображения единицы нет: файл оценивается целиком, локальная вставка размывается в общей статистике кадра.
Отсюда следствие, общее для обоих: инструмент отвечает про файл, а не про то, кто и что с ним сделал.
Частые вопросы
- Почему детекторы текста надёжнее?
- У текста есть статистическая подпись — предсказуемость выбора слов. У изображения аналога нет, и детекторы ищут косвенные признаки, которые исчезают при обработке.
- Какая ошибка опаснее?
- Ложное срабатывание: оно означает обвинение человека в подделке. Пропуск означает лишь, что вы чего-то не заметили.
- Что работает вместо детекторов?
- Цепочка публикаций и поиск первоисточника — и для изображений, и для текста.