Исследование издания

Бенчмарк по фиксированным промптам

Три одинаковых промпта через все модели каталога, слепая оценка по пяти критериям.

Олег Красин· ·Методика опубликована, замер не начат

Коротко

Существующие сравнения используют разные промпты под каждую модель — это делает их несопоставимыми. Мы даём абсолютно одинаковый вход и оцениваем вслепую.

Цифр здесь пока нет

Замер запланирован на ноябрь 2026. До его проведения на этой странице опубликована только методика — чтобы её можно было оспорить до появления результатов, а не после.

Это осознанная позиция издания: почему мы не публикуем оценок до измерения.

Что именно измеряем

Рамка исследования «Бенчмарк по фиксированным промптам». Все поля зафиксированы до начала замера.
ВопросКак модели справляются с тремя типовыми задачами при абсолютно одинаковом входе
Почему этого нет ни у когоСуществующие сравнения используют разные промпты под каждую модель, что делает их несопоставимыми
Кому это нужноВыбор модели под конкретный тип задачи
Инструмент3 фиксированных промпта: портрет, предметная съёмка, кинокадр
Выборка3 промпта × 5 генераций × все модели каталога
Шкала5 критериев по 5 баллов: соответствие промпту, анатомия, свет, кириллица в кадре, артефакты
Кто оцениваетТри оценщика вслепую, порядок кадров рандомизирован, названия моделей скрыты
Периодичностьквартальный

Что будет опубликовано

Замер, результаты которого нельзя перепроверить, — не замер. Вместе с выводами выкладывается всё, на чём они построены:

  • Сетка всех кадров
  • Оценки по каждому критерию
  • Промпты и настройки
  • Согласованность оценщиков

Что опровергнет нашу гипотезу

Если согласованность оценщиков окажется низкой, шкала непригодна и требует переработки до публикации

Этот пункт зафиксирован до замера намеренно. Исследование, которое невозможно опровергнуть, ничего не измеряет — оно подтверждает то, что автор решил заранее.

В чём дефект существующих сравнений

Типовой обзор берёт под каждую модель свой промпт — тот, на котором она смотрится выгодно. Иногда это делается сознательно, чаще просто потому, что автор подбирает промпт под модель, пока результат не понравится.

В итоге сравниваются не модели, а умение автора подобрать промпт. Такое сравнение выглядит убедительно и не значит ничего.

Как устроен наш

Одинаковый вход. Три промпта, зафиксированные заранее, без адаптации под конкретную модель. Если модель плохо понимает такой промпт — это её свойство, и оно должно попасть в результат.

Пять генераций на промпт. Единичный кадр измеряет удачу.

Слепая оценка. Названия моделей скрыты, порядок рандомизирован. Оценщик не знает, чей кадр перед ним.

Пять критериев по отдельности: соответствие промпту, анатомия, свет, кириллица в кадре, артефакты. Итоговый балл публикуется, но разбивка важнее: модель может выигрывать по свету и проваливаться по тексту.

Про критерий кириллицы

Он есть только у нас, и это не претензия на оригинальность, а следствие аудитории. В англоязычных бенчмарках такого критерия нет и быть не может — там эта задача не стоит.

Для читателя, который делает визуал с русскими надписями, этот критерий часто оказывается решающим, а в общих рейтингах он не учитывается вовсе.

Три промпта

Портрет — анатомия, свет, взгляд, фактура кожи. Предметная съёмка — геометрия, отражения, тень в месте контакта. Кинокадр — композиция, глубина, работа с единственным источником света.

Каждый содержит надпись — так критерий кириллицы проверяется во всех трёх сценариях, а не отдельным заданием.

Где замер может сломаться

Несогласованность оценщиков. Если трое расходятся сильно, шкала непригодна. Это вынесено в условие опровержения: мы опубликуем разброс и, если он велик, переработаем шкалу вместо публикации медианы.

Смещение к привычной эстетике. Оценщик может предпочитать знакомую манеру. Лечится слепым предъявлением и разбивкой по критериям: «нравится» не входит в число пяти.

Фиксированный промпт как недостаток. Модель, требующая своего синтаксиса, покажет результат хуже реального. Мы считаем это честным: пользователь тоже приходит со своим промптом, а не с адаптированным.

Частые вопросы

Чем ваш бенчмарк отличается от обзоров?
Одинаковым входом для всех моделей и слепой оценкой. В обзорах промпт обычно подбирается под каждую модель, и сравниваются не модели, а подбор.
Почему в критериях есть кириллица?
Потому что для нашего читателя она часто решающая, а в англоязычных бенчмарках такого критерия нет по построению.
Что если оценщики не сойдутся?
Тогда шкала непригодна, и мы скажем об этом вместо публикации медианы. Это условие зафиксировано до замера.

Олег Красин псевдоним

Псевдоним автора технического раздела. Отвечает за локальный запуск моделей, требования к железу и за замеры, которые издание проводит само.

Отвечает за: локальный запуск, требования к железу, методика замеров