Инструмент
Счётчик длины промпта
Приблизительная оценка, во сколько раз русский промпт длиннее английского в токенах.
Коротко
Приближение, а не измерение, и это указано прямо в инструменте. Точные коэффициенты по моделям даст запланированный замер — тогда оценка будет заменена измеренной.

—
Это приближение, а не измерение. Точная токенизация выполняется токенизатором конкретной модели, и в браузере его нет. Оценка построена на типичном поведении токенизаторов: латиница режется примерно по четыре символа на токен, кириллица примерно по два.
Отклонение на реальных моделях может достигать десятков процентов. Точные коэффициенты по каждой модели даст запланированный замер — тогда эта оценка будет заменена измеренной.
Зачем это знать
У промпта есть лимит длины в токенах. Русское описание достигает его раньше, чем английский перевод той же смысловой длины, потому что кириллица режется на более мелкие куски.
Практическое следствие неприятное: часть промпта отбрасывается молча. Сообщения об ошибке нет, модель просто отрабатывает начало описания и игнорирует хвост. Признак косвенный — результат выглядит так, будто половину промпта не прочитали.
Второе следствие: там, где оплата идёт за токены, русский текст обходится дороже за тот же смысл.
Почему это приближение
Точная токенизация выполняется токенизатором конкретной модели. В браузере его нет, и загружать его ради счётчика означало бы тянуть мегабайты на страницу справочника.
Оценка построена на типичном поведении токенизаторов: латиница режется примерно по четыре символа на токен, кириллица примерно по два. Отклонение на реальных моделях может достигать десятков процентов.
Мы помечаем это прямо в инструменте, а не сноской внизу. Инструмент, выдающий приближение за измерение, хуже отсутствия инструмента — он создаёт ложную уверенность.
Когда появится точность
Замер по токенам — самый быстрый в нашем списке: измерение детерминированное, оценщики не нужны, разброса не бывает. После него здесь будут коэффициенты по каждой модели, а не общая оценка.
Что делать, пока точности нет
Держать русский промпт коротким и ставить главное в начало. Правило работает независимо от языка, но на русском граница наступает раньше.
Если результат выглядит так, будто модель прочитала только начало описания, — вероятно, так и есть.
Где оценка расходится сильнее всего
На числах, знаках пунктуации и латинских названиях внутри русского текста: они режутся по своим правилам, и коэффициент «вдвое» к ним не применяется.
Частые вопросы
- Насколько точен счётчик?
- Это приближение. Отклонение на реальных моделях может достигать десятков процентов. Точные коэффициенты даст запланированный замер.
- Почему русский промпт длиннее в токенах?
- Кириллица режется на более мелкие куски: токенизаторы обучались преимущественно на англоязычных текстах.
- Как понять, что промпт обрезался?
- Сообщения об этом нет. Признак косвенный: модель отрабатывает начало описания и игнорирует конец.