Главная тема издания
Кириллица в кадре: почему модели ломают русский
Механика проблемы, честная картина по моделям и рабочие обходные пути, пока замер не проведён.
Коротко
Большинство генераторов рисует русский текст в кадре хуже английского — сказывается состав обучающих данных. Но справляются не все одинаково плохо: часть моделей задачу закрывает, и сводной карты этого неравенства сегодня не существует.

Задача, которой нет в англоязычных обзорах
Если вы делаете баннер с заголовком, обложку с названием, карточку товара с подписью или кадр с вывеской, вы упираетесь в задачу, которой в англоязычных бенчмарках просто нет. Там текст в кадре давно считается решённой проблемой.
На кириллице он решён не везде.
Почему так происходит
Причина техническая и объясняет всё остальное.
Модель училась на изображениях, содержащих текст. Подавляющее большинство этих изображений англоязычные. Слово SALE она видела тысячи раз: в разных начертаниях, размерах, на разных фонах. Слово РАСПРОДАЖА — на порядки реже.
Дело не в алфавите как таковом, а в плотности примеров. Модель усвоила формы латинских букв, их типичные сочетания и то, как они выглядят на вывеске, в разы плотнее, чем формы кириллических.
Отсюда типовой сбой западных моделей: путаница «и» и «н», дорисовка знаков, которых в русском алфавите нет, и буквы, похожие на кириллические ровно настолько, чтобы с первого взгляда сойти за текст.
Честная картина: «все ломают» — неправда
Здесь легко скатиться в удобное упрощение, и мы его избегаем сознательно.
По оценкам рынка Nano Banana Pro справляется там, где конкуренты выдают случайные символы. Шедеврум и Kandinsky держат русский текст лучше западных моделей — они обучались в том числе на кириллице. И за последние полтора года положение заметно изменилось у всей отрасли: раньше Midjourney рисовал красивые постеры с наборами случайных букв, а Stable Diffusion превращал текст в абстрактные знаки.
Обратите внимание на формулировку: по оценкам рынка. Это чужие наблюдения, а не наше измерение, и мы не выдаём их за результат.
Почему мы не ставим оценки
В каталоге есть столбец «кириллица в кадре». Сегодня он пуст у всех моделей.
Это не недоработка, а позиция. Оценка появится там после того, как мы прогоним фиксированный набор из десяти надписей через каждую модель и опубликуем исходные кадры. До этого в графе стоит текстовая заметка со ссылкой на то, что известно рынку.
Разница принципиальная. Если мы поставим цифры по впечатлениям, а потом проведём замер и цифры не совпадут, ценность всей затеи обнулится. Замер выходит в ноябре 2026 года.
Что делать сейчас: четыре обходных пути
Пока карты нет, работают практические приёмы.
Не просите модель писать текст. Самый надёжный путь: генерируйте кадр с пустым местом под надпись, а текст накладывайте в редакторе. Занимает минуту, результат предсказуем на сто процентов, шрифт под вашим контролем.
Короткие слова вместо длинных. Чем короче надпись, тем выше шанс, что модель не собьётся. Одно слово из пяти букв проходит заметно чаще, чем фраза из трёх слов.
Заглавные буквы. Прописные формы у кириллицы проще и различимее, и в обучающих данных вывесок с заглавными больше. Строчные с выносными элементами модель путает чаще.
Начните с модели, обучавшейся на кириллице. Если текст в кадре обязателен и накладывать его вручную нельзя, разумно сначала проверить те модели, о которых известно, что кириллица им давалась.
Как проверить результат
Прочитайте надпись вслух, а не посмотрите на неё. Взгляд достраивает знакомое слово по общей форме, и вы увидите «РАСПРОДАЖА» там, где написано «РАСПРОДАЖД».
Второй приём: покажите кадр человеку, который не знает, что там должно быть написано. Если он прочитал — текст читаемый.
Что именно мы будем измерять
Методику публикуем заранее, до замера, — так её можно оспорить до того, как появятся цифры, а не после.
Набор надписей. Десять фиксированных строк, одинаковых для всех моделей: короткое слово, длинное слово, два слова, фраза из трёх слов, слово с буквами «и» и «н» рядом, слово с «ъ» и «ь», надпись заглавными, надпись строчными, слово с цифрами, слово на кириллице рядом с латиницей.
Последний пункт важнее, чем кажется: смешанные надписи вроде «SALE — РАСПРОДАЖА» встречаются в реальной работе постоянно, и часть моделей ломается именно на переключении алфавита внутри одного кадра.
Контекст. Каждая надпись запрашивается в трёх сценариях: вывеска на здании, текст на упаковке, заголовок на постере. Модель может уверенно справляться с одним и проваливать другой.
Оценка. По пятибалльной шкале: 5 — надпись читается без усилий и совпадает с заданной посимвольно; 1 — набор знаков, похожих на буквы. Оценивают трое независимо, в результат идёт медиана.
Что публикуем. Все исходные кадры, включая провалы. Таблицу оценок. Промпты целиком. Разброс между оценщиками.
Почему замер придётся повторять
Модели обновляются, и результат августа не описывает положение в феврале. Именно это делает большинство существующих обзоров бесполезными: они не датированы, а значит, читатель не знает, к какому состоянию отрасли они относятся.
Поэтому замер квартальный, и в каждой публикации указано, какие версии моделей проверялись.
Что делать с результатом, когда он выйдет
Ответ на вопрос «какой моделью сделать баннер с русским заголовком» будет выглядеть не как название одной модели, а как короткий список с оговорками: эта справляется с короткими надписями заглавными, эта — с длинными фразами, эта не справляется ни с чем, но хороша всем остальным.
Такой ответ полезнее одного имени. Он позволяет выбрать модель под конкретную надпись, а не надеяться на универсального победителя, которого в этой задаче нет.
Симптом, причина, решение
| Что видите | Почему так | Что делать |
|---|---|---|
| Буквы похожи на русские, но слово не читается | Модель усвоила общую форму кириллицы, но не конкретные буквы | Короче слово, заглавные буквы, либо наложить шрифтом |
| Слово читается, но с одной ошибкой | Накопление на длине | Сократить надпись |
| Строчные хуже заглавных | Выносные элементы «б», «д», «у», «ф» усвоены слабее | Перевести надпись в верхний регистр |
| Латиница чистая, кириллица рядом — нет | Переключение алфавита внутри кадра | Разнести элементы или наложить кириллицу отдельно |
| В одном прогоне вышло, в другом нет | Устойчивости нет, попадание было случайным | Не полагаться на удачу: три прогона подряд как проверка |
Почему это не решается «хорошим промптом»
Требование «чёткий читаемый русский текст» модель не понимает как инструкцию к точности написания. Она воспринимает его как описание желаемого вида — примерно как «красиво».
Отсюда следует, что усиление промпта здесь не работает вовсе, и время, потраченное на переформулировки, потрачено зря. Работают только три вещи: смена модели, сокращение надписи и отказ от генерации текста в пользу наложения.
Что изменится, когда выйдет замер
Появится то, чего сейчас нет ни у кого: список моделей с оценкой по каждому типу надписи. Не «эта хорошо работает с текстом», а «эта держит короткие слова заглавными и разваливается на фразах».
Такой ответ полезнее одного имени, потому что позволяет выбрать модель под конкретную надпись. Универсального победителя в этой задаче, судя по всему, нет — и это тоже будет результатом.
Методика опубликована заранее: протокол замера.
Частые вопросы
- Почему нейросети плохо пишут по-русски на картинках?
- Из-за состава обучающих данных: изображений с англоязычным текстом на порядки больше. Модель усвоила формы латинских букв плотнее, чем кириллических.
- Какая модель лучше всех справляется с кириллицей?
- Подтверждённого ответа сегодня нет ни у кого. По оценкам рынка среди сильных называют Nano Banana Pro, а также Шедеврум и Kandinsky. Наш замер выходит в ноябре 2026 года.
- Что делать, если надпись обязательна?
- Самый надёжный путь — генерировать кадр с пустым местом под текст и накладывать надпись в редакторе. Результат предсказуем, шрифт под вашим контролем.
- Помогают ли заглавные буквы?
- Обычно да. Прописные формы кириллицы проще и различимее, и в обучающих данных их больше.
- Как проверить, что текст на картинке читаемый?
- Прочитайте вслух и покажите человеку, который не знает, что там написано. Взгляд достраивает знакомое слово по форме и скрывает ошибку.