Калькулятор задержки ответа
«Модель выдаёт 200 токенов в секунду» — а сколько это в ожидании для человека? Посчитаем, сколько пользователь смотрит на пустой экран и успевает ли он читать за генерацией.
Для ориентира: крупные облачные модели обычно дают 30–120, ускоренные варианты — до 200 и выше, локальный запуск на скромной видеокарте — единицы.
Пауза до начала ответа. Растёт от длины запроса, «размышлений» модели и сети.
Короткая реплика — 50–150, развёрнутый ответ — 400–800, длинная статья — от 2000.
Потоковая отдача не ускоряет модель — весь ответ готов в одно и то же время. Она сокращает ожидание до первой реакции на —, а это и есть то, что пользователь ощущает как скорость.
Что здесь важно понять
Токены в секунду — не то же самое, что скорость для пользователя. Ответ на 500 токенов при 100 токенах/с формируется 5 секунд, но человек читает его почти две минуты. То есть модель давно закончила, а пользователь ещё в начале.
Время до первого токена важнее скорости генерации. Именно эта пауза ощущается как «тормозит». Три секунды пустого экрана раздражают сильнее, чем медленная, но сразу начавшаяся печать.
Обгонять читателя бессмысленно. Если генерация быстрее чтения, дальнейшее ускорение пользователь не заметит — он всё равно упирается в собственную скорость чтения. Тратить деньги на более быструю модель ради этого не стоит; выгода будет только в сценариях, где текст не читают, а обрабатывают дальше.
Русский текст «дороже» английского. На то же количество слов уходит примерно вдвое больше токенов — отсюда и разница в настройке выше.
Все расчёты идут в браузере. Цифры оценочные: реальная скорость плавает от нагрузки на сервис, длины запроса и качества связи.