← в блог
ДеньгиЗамерено·28 сентября 2026 г.·5 мин чтения

Сколько стоит один вызов модели: 204 реальных вызова из прода

Мы 90 дней писали в таблицу каждый вызов модели. Интересным оказался не итог, а то, что две операции внутри одного продукта устроены зеркально: совет, который экономит на одной, на другой сжигает деньги.

Максоснователь Sndwich · @SattyEth

Прайс-листы честные и почти бесполезные. Anthropic скажет, что Sonnet стоит $3 за миллион входных токенов и $15 за миллион выходных. Это правда, и это ничего не говорит о цене функции, потому что прайс-лист не знает, сколько токенов она тратит и на какую сторону они лягут.

Поэтому мы прочитали собственный лог. Каждый вызов модели пишется в таблицу в момент, когда он произошёл: название задачи, выбранная роутером модель, число входных и выходных токенов и стоимость, посчитанная тут же. Вот как выглядят 204 настоящих вызова за 90 дней.

Стоимость вызова llm это не одно число

Итог скучный: $1,21 за 204 вызова с 25 июня по 23 сентября 2026 года. Поделить одно на другое — выйдет около половины цента за вызов, и это ровно тот средний показатель, который прячет всё интересное.

Те же данные, разложенные по тому, что вызов на самом деле делал. Столбик — доля стоимости, ушедшая на выход, то есть на текст, который модель написала, а не на тот, что мы ей отправили.

Написать пост в голосе432 вход / 581 выход
87%
Клонировать стиль691 / 758
85%
Переписать под другую сеть303 / 310
84%
Предложить тему280 / 117
68%
Ответить на чужой пост963 / 27
12%
Доля выхода в стоимости, по операциям. Один продукт, одни и те же 90 дней. Ответ выбивается из ряда, и он же запускается чаще всех.
Написать пост стоит $0,0100, и 87% этой суммы — выход. Ответить на чужой пост стоит $0,0011, и 88% — вход. Деньги лежат по разные стороны одного продукта.

Почему форма переворачивается

Это очевидно, когда видишь числа токенов, и незаметно, пока не увидел. Написать пост — значит отправить короткое задание и получить длинный текст: 432 токена туда, 581 обратно. Дорогую работу делает модель, а выход стоит в пять раз дороже входа.

Ответить — наоборот. Чтобы написать одно уместное предложение под чужим постом, надо отправить сам пост, ветку обсуждения, описание голоса и правила о том, чего говорить нельзя. Получилось 963 токена на входе против 27 на выходе, примерно 35 к 1. Вы платите за чтение, а не за письмо.

Работа, тяжёлая на выходеПосты, переписывание, клон стиля. Цена растёт от того, сколько текста вы просите, значит рычаг — число вариантов.
Работа, тяжёлая на входеОтветы, классификация, модерация. Цена растёт от контекста, значит рычаг — то, что вы перестанете отправлять.
Дешёвая модель не всегда дешевлеОтветы идут на Haiku по $1 / $5. Поэтому они стоят десятую часть поста, хотя токенов отправляют вдвое больше.

Что это меняет в экономии на стоимости вызова llm

Стандартный совет — батчить: класть несколько заданий в один вызов и экономить на повторяющемся промпте. Наш прошлый замер по постам говорит, что склейка шести вариантов стиля в один вызов экономит только вход, а это 13% операции. Шесть постов будут написаны в любом случае. Батчинг уменьшил число вызовов и почти не тронул счёт.

На ответах тот же совет верен по обратной причине. Там промпт и есть счёт. Обрезать ветку, выкинуть из описания голоса то, что не нужно для однострочного ответа, переиспользовать закешированный префикс — всё это бьёт прямо в те самые 88%.

Мерить по операциям, а не по моделям.Цена за токен не скажет, где ваши деньги. Пишите задачу, модель, вход и выход на каждый вызов, и ответ найдётся за вечер.
Где тяжёлый выход — резать варианты.Генерируйте то, что человек попросил. Сделать шесть и показать один — значит заплатить впятеро ни за что.
Где тяжёлый вход — резать контекст.Каждый токен инструкции, отправленный с однострочным ответом, оплачивается на каждом ответе, всегда.

Честные границы этих чисел

Это лог одного продукта, а не бенчмарк. 204 вызова достаточно, чтобы увидеть форму, и мало, чтобы спорить о третьем знаке. За ответами стоят 58 вызовов, за клоном стиля — девять. Роутер выбирает модель под задачу, поэтому цена задачи связана с этим выбором, а не является свойством самой работы.

И находка на полях, в виде предупреждения: в той же таблице лежали 99 999 строк от нагрузочного теста квот, сделанного за один июньский день. Это 96% всех записанных расходов. Любая панель, читающая таблицу без фильтра, показала бы сумму в сорок раз больше настоящей. Если пишете каждый вызов — помечайте тестовые строки.

Метод не стоит ничего и не требует вендора. Таблица из пяти колонок, заполняемая в момент вызова, отвечает на вопросы, на которые прайс-лист ответить не может. Как устроена письменная сторона этой работы — в статье про ответы как канал роста.

Это наш собственный счётчик

Sndwich пишет каждый вызов модели, сделанный для вас, с задачей и обоими счётчиками токенов. Числа выше взяты из этой таблицы, а не из оценки.

Цена вызова записана. Задача, модель, вход, выход и стоимость — в момент вызова.
По умолчанию один вариант. Пост пишется в выбранном стиле, а не в шести с выбрасыванием пяти.
Можно со своим ключом. Свой ключ Anthropic — и вызовы перестают считаться по тарифу.
Попробовать бесплатно →
ПоделитьсяTelegramX

Читать дальше