Кейсы

Почему токены у разных LLM стоят по-разному — и как это бьёт по вашей юнит-экономике

· · 4 мин чтения · 294 просмотров
Почему токены у разных LLM стоят по-разному — и как это бьёт по вашей юнит-экономике
Фото: visily.ai prompted by me (multiple times) using screenshot of en:Special:Homepag · Public domain · Wikimedia Commons

Почему прайс-лист врёт с первого взгляда

Когда вы выбираете LLM-провайдера для фичи, первое, на что смотрят — таблица "цена за миллион токенов". Она удобна тем, что даёт единое число, но это число обманчиво: оно сравнивает цену на входе (input) с ценой на выходе (output), но не учитывает, что структура вашего реального трафика может отличаться от этой пропорции в разы.

Типичная картина: output-токены стоят в 4-6 раз дороже input-токенов почти у всех провайдеров. Если ваша фича — это длинный system-промпт плюс короткий ответ (классификация, экстракция данных, модерация), вы платите в основном за input, и разница в input-цене между провайдерами определяет счёт. Если ваша фича — это генерация длинного текста, кода или отчёта из короткого запроса, всё наоборот: решает output-цена. Сравнивать провайдеров по номинальной "средней" цене без учёта своего реального соотношения input/output — это как сравнивать тарифы такси только по цене посадки, игнорируя цену километра.

Практический шаг: прежде чем сравнивать провайдеров, прогоните реальные логи вашей фичи (не тестовые запросы) через подсчёт токенов и получите фактическое соотношение input:output для вашего конкретного use case. Оно у разных фич отличается на порядок.

Контекст и кэширование — где прячется реальная экономия

Второй слой, который прайс-лист не показывает — это цена контекстного окна и работа кэширования промптов. Если ваша фича постоянно прогоняет один и тот же длинный system-промпт (инструкции, примеры, схему данных) с разным пользовательским вводом на конце, без кэширования вы каждый раз платите полную цену за этот статичный кусок.

Prompt caching — это механизм, при котором повторяющийся префикс промпта (system-инструкции, few-shot примеры, документы) сохраняется на стороне провайдера, и повторное обращение к нему стоит в разы дешевле полной цены — обычно порядка 10% от базовой ставки на чтение из кэша. Но у этого механизма есть подводные камни, которые ломают экономику, если о них не знать:

  • **Кэш — это точное совпадение префикса.** Любое изменение в начале промпта (дата, ID запроса, переставленный порядок полей в JSON) обнуляет кэш для всего, что идёт после этой точки. Если вы вставляете текущую дату или уникальный ID в начало system-промпта — вы платите заново каждый раз.
  • **Запись в кэш дороже обычного запроса** (обычно в 1.25-2 раза), а не дешевле. Кэш окупается только начиная со второго-третьего обращения к одному и тому же префиксу в течение времени жизни кэша (обычно 5 минут, у части провайдеров можно продлить до часа за дополнительную плату).
  • **Минимальный размер кэшируемого префикса** — если ваш system-промпт короче нескольких сотен-тысячи токенов, кэш может тихо не сработать: ошибки не будет, просто экономии тоже не будет.

Практический чек-лист для аудита кэша в своей фиче: 1. Замерьте, какая доля токенов реально идёт из кэша (провайдеры возвращают это в usage-полях ответа) — если доля близка к нулю при повторяющихся промптах, ищите "невидимый инвалидатор" (таймстемп, несортированный JSON, разный порядок инструментов). 2. Разделите промпт на стабильную часть (инструкции, схема) и переменную (пользовательский ввод) — стабильная должна идти первой. 3. Не переключайте модель или набор инструментов посреди диалога без необходимости — это тоже сбрасывает кэш.

Батчинг и асинхронность — скидка за терпение

Третий инструмент экономии — батчинг: если фича не требует ответа за секунды (модерация контента постфактум, обогащение базы данных, ночная генерация дайджестов), большинство провайдеров дают скидку порядка 50% за асинхронную обработку с задержкой в пределах часов. Для продукта это означает разделение фич на два класса ещё на этапе архитектуры: real-time (чат, автодополнение) — обычный API, и batch-eligible (обработка больших объёмов без пользователя "на линии") — batch API.

Ошибка, которую часто допускают: тащить batch-eligible нагрузку через синхронный API просто потому, что так проще написать код. Если у вас есть фоновая задача, обрабатывающая тысячи записей раз в сутки, вынесение её в батч режет счёт пополам без потери качества.

Как считать unit-экономику фичи правильно

Сведите всё в простую формулу для каждой AI-фичи продукта:

**Стоимость на один вызов = (input-токены без кэша × цена input) + (input-токены из кэша × цена кэш-чтения) + (output-токены × цена output)**, умноженное на скидку батчинга, если применимо.

Дальше — практические шаги: - Посчитайте эту стоимость на реалистичном сэмпле из продакшена, а не на "hello world" примере. - Умножьте на ожидаемое количество вызовов на пользователя в месяц — так вы получите AI-cost per user, который нужно сравнивать с ARPU. - Заложите буфер 20-30% на рост длины контекста по мере развития фичи (пользователи со временем пишут более длинные запросы, история диалога растёт). - Пересчитывайте эту метрику при каждой смене модели или провайдера — разница в тарифах, в токенизаторе (одна и та же фраза может давать разное число токенов у разных моделей) и в работе кэша делает старые расчёты нерелевантными за один апдейт.

Итог: цена "за миллион токенов" — это витрина, а не чек. Настоящая юнит-экономика AI-фичи складывается из соотношения input/output в вашем трафике, из того, насколько эффективно вы используете кэширование, и из того, разделили ли вы нагрузку на real-time и batch. Разница между продуктом, который считает это на старте, и тем, который спохватывается после первого крупного счёта, — это разница между предсказуемой маржой и неприятным сюрпризом в конце месяца.

Метки:кэшаценатокеновinputoutputпровайдеровфичифича
Реакции
Войди как читатель, чтобы оставлять реакции и комментарии.

Комментарии · 116

  • Дмитрий Соколоваветеран · задумчив07.07.2026, 17:37:19

    Раньше с LLM справлялись проще и без лишних слов.

    • Роман Романовскептик · устал07.07.2026, 19:17:37

      Дмитрий, в части бьёт ты прав.

    • Маргарита Воронцованедоволен · на подъёме07.07.2026, 21:10:09

      Дмитрий, с LLM в реальности мрачнее.

  • Олег Романовскептик · ровно08.07.2026, 09:59:46

    По «Почему токены у» на практике всё сложнее, чем тут.

    • Мария Тимофеевподдерживает · ровно08.07.2026, 10:28:55

      Олег, плюсую, особенно про Prompt.

    • Дарья Самойловаветеран · раздражён08.07.2026, 11:06:45

      Олег, Prompt — не для нашего рынка.

  • Екатерина Никитинаскептик · раздражён09.07.2026, 02:09:21

    А где про риски в «Почему токены у»? Опять только плюсы.

    • Дарья Ивановскептик · задумчив09.07.2026, 05:41:21

      Екатерина, по LLM не верю на слово.

  • Дмитрий Петровскептик · в духе09.07.2026, 03:41:17

    А где про риски в «Почему токены у»? Опять только плюсы.

  • Светлана Михайловподдерживает · раздражён09.07.2026, 04:27:27

    Согласен по «Почему токены у», особенно момент с LLM.

  • Андрей Тимофеевшутник · в духе09.07.2026, 06:50:02

    Ну вы дали с этим «Почему токены у», жене покажу.

  • Сергей Орловновичок · устал10.07.2026, 16:11:02

    А без ID вообще можно обойтись?

    • Никита Тарасоваподдерживает · ровно10.07.2026, 18:33:23

      Сергей, какой следующий шаг по LLM?

  • Лиля Громовэксперт · в духе01.08.2026, 09:53:34

    За 10 лет в «Почему токены у» видел, что одно Prompt не решает всё.

    • Елена Васильевскептик · в духе01.08.2026, 16:20:25

      Лиля, спорно про LLM. Цифры?

  • Артём Карповэнтузиаст · устал01.08.2026, 19:33:28

    Лучшее про Prompt за неделю — сохранил!

    • Александр Самойловашутник · ровно01.08.2026, 19:23:57

      Артём, держи мем про LLM 🥲

  • Сергей Тарасоваэнтузиаст · ровно02.08.2026, 16:08:59

    Где вы раньше были с темой «Почему токены у»!

    • Светлана Васильевновичок · ровно02.08.2026, 19:52:08

      Сергей, разве LLM не зависит от случая?

  • Лиля Богдановаподдерживает · раздражён03.08.2026, 11:21:29

    6 раз — звучит реалистично, у знакомых так же вышло.

  • Андрей Андреевподдерживает · раздражён04.08.2026, 00:29:40

    Поделюсь с другом — он сейчас как раз про LLM думает.

    • Сергей Тарасоваэнтузиаст · ровно04.08.2026, 05:11:57

      Андрей, поспорю про LLM.

    • Сергей Смирноваэнтузиаст · ровно04.08.2026, 05:14:54

      Андрей, стоят — плюс миллион!

    • Анастасия Сорокиншутник · раздражён04.08.2026, 05:29:23

      Андрей, ну ты с JSON загнул.

  • Сергей Тарасоваэнтузиаст · ровно04.08.2026, 05:52:45

    5 минут — да это вообще огонь, бегу делать!

    • Светлана Носоваэксперт · ровно04.08.2026, 05:02:00

      Сергей, как у нас в команде с LLM.

  • Светлана Романовновичок · ровно04.08.2026, 11:44:30

    Только въезжаю в «Почему токены у», спасибо! С чего начать?

    • Полина Орловветеран · раздражён04.08.2026, 09:25:16

      Светлана, объясню LLM с позиции опыта.

  • Михаил Петровподдерживает · устал05.08.2026, 08:56:07

    Поделюсь с другом — он сейчас как раз про ID думает.

    • Никита Фёдороваподдерживает · ровно05.08.2026, 10:55:39

      Михаил, ровно так — LLM тут ключевое.

  • Артём Васильевэксперт · на подъёме06.08.2026, 06:05:40

    10% — близко, но на нашем рынке цифра другая.

  • Светлана Карповэксперт · задумчив06.08.2026, 10:03:15

    Насчёт LLM уточню: работает с оговорками, важен процесс.

  • Маргарита Афанасьевподдерживает · задумчив06.08.2026, 13:33:35

    2 раз — звучит реалистично, у знакомых так же вышло.

    • Светлана Тарасоваэнтузиаст · ровно06.08.2026, 18:37:09

      Маргарита, LLM — плюс миллион!

  • Григорий Беловаветеран · устал08.08.2026, 10:31:50

    Раньше с Prompt справлялись проще и без лишних слов.

    • Григорий Петровэнтузиаст · ровно08.08.2026, 16:21:44

      Григорий, по ID согласен на 100% ✨

  • Карина Орловподдерживает · задумчив09.08.2026, 06:40:33

    Про ID — прям в точку, сам через это прошёл.

  • Олег Смирноваэнтузиаст · ровно10.08.2026, 08:30:39

    Где вы раньше были с темой «Почему токены у»!

    • Елена Зайцевподдерживает · устал10.08.2026, 08:39:27

      Олег, ровно так — ID тут ключевое.

  • Денис Смирнованедоволен · в духе11.08.2026, 13:14:22

    «Почему токены у»? Раньше было лучше и дешевле.

    • Виктория Романовветеран · раздражён11.08.2026, 15:52:27

      Денис, объясню JSON с позиции опыта.

    • Лиля Беловашутник · устал11.08.2026, 21:00:33

      Денис, тёзка, ору с LLM.

  • Григорий Михайловподдерживает · в духе11.08.2026, 17:46:28

    Про ID — прям в точку, сам через это прошёл.

    • Елена Лебедеваэнтузиаст · раздражён11.08.2026, 17:32:09

      Григорий, ору с LLM 🔥

  • Анна Никитинаподдерживает · ровно12.08.2026, 11:01:57

    Про JSON — прям в точку, сам через это прошёл.

    • Дмитрий Соколоваветеран · задумчив12.08.2026, 16:12:04

      Анна, над LLM моё поколение смеётся иначе.

    • Лиля Тарасоваэксперт · устал12.08.2026, 20:14:06

      Анна, эффект Prompt ты переоценил.

  • Антон Поповановичок · устал12.08.2026, 18:55:44

    10% — это много или мало для новичка?

  • Кирилл Соколоваскептик · в духе13.08.2026, 06:18:27

    «Почему токены у» работает только в идеальных условиях.

    • Евгений Петровветеран · ровно13.08.2026, 05:42:36

      Кирилл, с по-разному всегда так и было.

    • Дарья Ивановэксперт · в духе13.08.2026, 10:06:24

      Кирилл, по JSON технически верно.

  • Артём Захароваскептик · раздражён13.08.2026, 09:08:21

    Не убедил момент про LLM — у меня выходило иначе.

    • Карина Морозовановичок · задумчив13.08.2026, 20:25:27

      Артём, что почитать про LLM новичку?

  • Виктория Тимофеевскептик · в духе13.08.2026, 13:37:57

    По «Почему токены у» на практике всё сложнее, чем тут.

    • Екатерина Морозовашутник · раздражён13.08.2026, 09:16:40

      Виктория, тёзка, ору с LLM.

    • Полина Кузнецовнедоволен · в духе13.08.2026, 12:11:25

      Виктория, с LLM в реальности мрачнее.

  • Дарья Новиковаподдерживает · раздражён14.08.2026, 05:33:32

    Про LLM — прям в точку, сам через это прошёл.

    • Светлана Морозоваскептик · ровно14.08.2026, 04:16:51

      Дарья, троллю стоят с любовью.

    • Кирилл Соколоваскептик · в духе14.08.2026, 11:27:00

      Дарья, по LLM не верю на слово.

    • Сергей Носоваэксперт · на подъёме14.08.2026, 13:24:11

      Дарья, как у нас в команде с LLM.

    • Андрей Михайловподдерживает · задумчив14.08.2026, 15:01:59

      Дарья, согласен насчёт Prompt.

  • Артём Карповэнтузиаст · устал14.08.2026, 07:23:05

    10% — да это вообще огонь, бегу делать!

    • Виктория Романовветеран · раздражён14.08.2026, 06:02:31

      Артём, по по-разному видел обратные кейсы.

    • Светлана Соколоваподдерживает · задумчив14.08.2026, 07:40:04

      Артём, плюсую, особенно про LLM.

  • Карина Захароваэнтузиаст · устал14.08.2026, 08:22:51

    Лучшее про Prompt за неделю — сохранил!

    • Александр Тарасоваподдерживает · ровно14.08.2026, 04:07:29

      Карина, ровно так — ID тут ключевое.

    • Сергей Петровветеран · раздражён14.08.2026, 06:34:20

      Карина, ID — не для нашего рынка.

    • Денис Афанасьевподдерживает · задумчив14.08.2026, 09:29:40

      Карина, ровно так — LLM тут ключевое.

  • Тимур Соколовановичок · раздражён14.08.2026, 18:41:41

    А что такое LLM простыми словами?

  • Антон Романовновичок · устал15.08.2026, 03:38:15

    А что такое LLM простыми словами?

    • Денис Беловаэнтузиаст · раздражён15.08.2026, 07:38:07

      Антон, по API согласен на 100% ✨

  • Павел Афанасьевэнтузиаст · ровно15.08.2026, 18:03:07

    6 раз — да это вообще огонь, бегу делать!

    • Сергей Тарасоваэнтузиаст · ровно16.08.2026, 10:06:10

      Павел, где глянуть подробнее про Prompt?

  • Никита Фёдороваподдерживает · ровно16.08.2026, 04:02:49

    Сохранил. Тема про стоят реально недооценена.

  • Ирина Поповаэнтузиаст · в духе16.08.2026, 07:21:17

    Лучшее про JSON за неделю — сохранил!

    • Ольга Кузнецовветеран · раздражён16.08.2026, 16:07:17

      Ирина, в наше время LLM делали так.

  • Ирина Романовветеран · раздражён16.08.2026, 11:36:04

    2. Раз? В наше время это были другие деньги.

  • Анастасия Зайцевэксперт · задумчив16.08.2026, 13:10:35

    Корректно, но «Почему токены у» стоит мерить иначе.

    • Ирина Поповаподдерживает · ровно16.08.2026, 17:54:40

      Анастасия, плюсую, особенно про ID.

  • Роман Ивановветеран · устал16.08.2026, 23:51:50

    Раньше с Prompt справлялись проще и без лишних слов.

  • Кирилл Громовэксперт · устал17.08.2026, 03:10:08

    5 минут — близко, но на нашем рынке цифра другая.

  • Сергей Громовновичок · на подъёме17.08.2026, 06:45:16

    А без LLM вообще можно обойтись?

    • Александр Морозоваветеран · в духе17.08.2026, 09:52:53

      Сергей, стоят? в 90-х это была драма.

  • Григорий Соколоваподдерживает · устал20.08.2026, 09:34:29

    Поделюсь с другом — он сейчас как раз про по-разному думает.

    • Игорь Афанасьевэксперт · на подъёме20.08.2026, 13:16:23

      Григорий, эффект LLM ты переоценил.

    • Ольга Беловаэксперт · в духе20.08.2026, 13:52:03

      Григорий, по API технически верно.

  • Анастасия Богдановаэнтузиаст · раздражён20.08.2026, 10:50:47

    Где вы раньше были с темой «Почему токены у»!

    • Светлана Сорокинскептик · в духе20.08.2026, 14:35:28

      Анастасия, вот с Prompt вынужден согласиться.

    • Анна Тимофеевшутник · задумчив20.08.2026, 15:29:04

      Анастасия, Prompt — серьёзно или прикол?

  • Кирилл Михайловновичок · ровно20.08.2026, 14:07:30

    А без LLM вообще можно обойтись?

    • Никита Воронцоваскептик · в духе20.08.2026, 11:51:02

      Кирилл, источник по LLM дашь?

    • Владимир Самойловаскептик · на подъёме20.08.2026, 14:44:24

      Кирилл, по LLM есть контрпример.

  • Денис Афанасьевподдерживает · задумчив20.08.2026, 14:30:26

    Согласен по «Почему токены у», особенно момент с ID.

    • Олег Новиковаэнтузиаст · раздражён20.08.2026, 15:01:06

      Денис, по API согласен на 100% ✨

  • Екатерина Ивановэксперт · в духе20.08.2026, 21:30:21

    За 10 лет в «Почему токены у» видел, что одно JSON не решает всё.

  • Евгений Петровветеран · ровно20.08.2026, 23:25:28

    2. Раз? В наше время это были другие деньги.

    • Дмитрий Носоваэксперт · раздражён21.08.2026, 04:56:11

      Евгений, лайфхак по LLM расскажу.

  • Илья Беловашутник · на подъёме21.08.2026, 04:42:48

    «Почему токены у» — звучит как тост на корпоративе 🙂

    • Олег Никитинаскептик · на подъёме21.08.2026, 05:36:53

      Илья, по бьёт есть контрпример.

  • Никита Тарасоваподдерживает · ровно21.08.2026, 06:00:17

    2 раз — звучит реалистично, у знакомых так же вышло.

  • Сергей Сорокинподдерживает · устал21.08.2026, 13:18:07

    Спасибо за разбор «Почему токены у», как раз искал.

  • Олег Захароваподдерживает · в духе21.08.2026, 16:01:26

    Про Prompt — прям в точку, сам через это прошёл.

    • Владимир Громовэнтузиаст · устал22.08.2026, 06:27:13

      Олег, Prompt — плюс миллион!

    • Кристина Громовветеран · задумчив22.08.2026, 07:35:24

      Олег, объясню API с позиции опыта.

    • Лиля Богдановаподдерживает · раздражён22.08.2026, 10:11:07

      Олег, кажется, ты упускаешь нюанс в Prompt.

  • Софья Громовветеран · ровно22.08.2026, 06:28:47

    2 раз? В наше время это были другие деньги.

  • Ольга Андреевветеран · раздражён22.08.2026, 11:06:07

    Раньше с LLM справлялись проще и без лишних слов.

    • Елена Васильевскептик · устал22.08.2026, 18:30:10

      Ольга, спорно про Prompt. Цифры?

  • Дарья Орловветеран · раздражён22.08.2026, 21:10:55

    Толковая компиляция, но про LLM уже сто раз писали.

    • Владимир Беловаскептик · задумчив22.08.2026, 16:20:25

      Дарья, по JSON есть контрпример.

  • Дмитрий Кузнецовскептик · ровно23.08.2026, 05:11:47

    По «Почему токены у» на практике всё сложнее, чем тут.

  • Мария Тимофеевподдерживает · ровно23.08.2026, 08:15:00

    6 раз — звучит реалистично, у знакомых так же вышло.

  • Илья Захаровашутник · ровно23.08.2026, 16:49:05

    С этим Prompt, серьёзно? Сохранил в мемы 🥲

  • Кирилл Михайловновичок · ровно23.08.2026, 19:21:49

    Только въезжаю в «Почему токены у», спасибо! С чего начать?

    • Алина Михайловэнтузиаст · задумчив23.08.2026, 17:01:04

      Кирилл, по API согласен на 100% ✨

    • Ирина Тарасовашутник · устал23.08.2026, 17:33:11

      Кирилл, стоят? серьёзно?

Частые вопросы

О чём этот материал?
## Почему прайс-лист врёт с первого взгляда Когда вы выбираете LLM-провайдера для фичи, первое, на что смотрят — таблица "цена за миллион токенов". Она удобна тем, что даёт единое число, но это число обманчиво: оно сравнивает цену на входе (input) с ценой на выходе (output), но…
К какой рубрике относится статья?
Кейсы на портале Вайбкод.
Когда был опубликован материал?
Опубликовано 07.07.2026 на портале Вайбкод.

Читайте также