Исследование издания
Бенчмарк по фиксированным промптам
Три одинаковых промпта через все модели каталога, слепая оценка по пяти критериям.
Коротко
Существующие сравнения используют разные промпты под каждую модель — это делает их несопоставимыми. Мы даём абсолютно одинаковый вход и оцениваем вслепую.
Цифр здесь пока нет
Замер запланирован на ноябрь 2026. До его проведения на этой странице опубликована только методика — чтобы её можно было оспорить до появления результатов, а не после.
Это осознанная позиция издания: почему мы не публикуем оценок до измерения.
Что именно измеряем
| Вопрос | Как модели справляются с тремя типовыми задачами при абсолютно одинаковом входе |
|---|---|
| Почему этого нет ни у кого | Существующие сравнения используют разные промпты под каждую модель, что делает их несопоставимыми |
| Кому это нужно | Выбор модели под конкретный тип задачи |
| Инструмент | 3 фиксированных промпта: портрет, предметная съёмка, кинокадр |
| Выборка | 3 промпта × 5 генераций × все модели каталога |
| Шкала | 5 критериев по 5 баллов: соответствие промпту, анатомия, свет, кириллица в кадре, артефакты |
| Кто оценивает | Три оценщика вслепую, порядок кадров рандомизирован, названия моделей скрыты |
| Периодичность | квартальный |
Что будет опубликовано
Замер, результаты которого нельзя перепроверить, — не замер. Вместе с выводами выкладывается всё, на чём они построены:
- Сетка всех кадров
- Оценки по каждому критерию
- Промпты и настройки
- Согласованность оценщиков
Что опровергнет нашу гипотезу
Если согласованность оценщиков окажется низкой, шкала непригодна и требует переработки до публикации
Этот пункт зафиксирован до замера намеренно. Исследование, которое невозможно опровергнуть, ничего не измеряет — оно подтверждает то, что автор решил заранее.
В чём дефект существующих сравнений
Типовой обзор берёт под каждую модель свой промпт — тот, на котором она смотрится выгодно. Иногда это делается сознательно, чаще просто потому, что автор подбирает промпт под модель, пока результат не понравится.
В итоге сравниваются не модели, а умение автора подобрать промпт. Такое сравнение выглядит убедительно и не значит ничего.
Как устроен наш
Одинаковый вход. Три промпта, зафиксированные заранее, без адаптации под конкретную модель. Если модель плохо понимает такой промпт — это её свойство, и оно должно попасть в результат.
Пять генераций на промпт. Единичный кадр измеряет удачу.
Слепая оценка. Названия моделей скрыты, порядок рандомизирован. Оценщик не знает, чей кадр перед ним.
Пять критериев по отдельности: соответствие промпту, анатомия, свет, кириллица в кадре, артефакты. Итоговый балл публикуется, но разбивка важнее: модель может выигрывать по свету и проваливаться по тексту.
Про критерий кириллицы
Он есть только у нас, и это не претензия на оригинальность, а следствие аудитории. В англоязычных бенчмарках такого критерия нет и быть не может — там эта задача не стоит.
Для читателя, который делает визуал с русскими надписями, этот критерий часто оказывается решающим, а в общих рейтингах он не учитывается вовсе.
Три промпта
Портрет — анатомия, свет, взгляд, фактура кожи. Предметная съёмка — геометрия, отражения, тень в месте контакта. Кинокадр — композиция, глубина, работа с единственным источником света.
Каждый содержит надпись — так критерий кириллицы проверяется во всех трёх сценариях, а не отдельным заданием.
Где замер может сломаться
Несогласованность оценщиков. Если трое расходятся сильно, шкала непригодна. Это вынесено в условие опровержения: мы опубликуем разброс и, если он велик, переработаем шкалу вместо публикации медианы.
Смещение к привычной эстетике. Оценщик может предпочитать знакомую манеру. Лечится слепым предъявлением и разбивкой по критериям: «нравится» не входит в число пяти.
Фиксированный промпт как недостаток. Модель, требующая своего синтаксиса, покажет результат хуже реального. Мы считаем это честным: пользователь тоже приходит со своим промптом, а не с адаптированным.
Частые вопросы
- Чем ваш бенчмарк отличается от обзоров?
- Одинаковым входом для всех моделей и слепой оценкой. В обзорах промпт обычно подбирается под каждую модель, и сравниваются не модели, а подбор.
- Почему в критериях есть кириллица?
- Потому что для нашего читателя она часто решающая, а в англоязычных бенчмарках такого критерия нет по построению.
- Что если оценщики не сойдутся?
- Тогда шкала непригодна, и мы скажем об этом вместо публикации медианы. Это условие зафиксировано до замера.