Методика цен · обновлено 26.08.2026

Понимайте стоимость запроса до отправки.

Model.sale использует единый prepaid blended rate для каждой модели. Точная сумма фиксируется в usage ledger после получения terminal usage.

Короткая формула

Для завершённого запроса списывается количество фактически полученных charged tokens, умноженное на цену модели. Reservation floor — только временное удержание и возвращается за вычетом usage:

charge = charged_tokens / 1 000 000 × blended_rate\nfinal_charge = measured_charge\nreleased_reservation = reserved_amount - final_charge

Версия цены фиксируется при допуске запроса. Если terminal usage отсутствует, запись получает billing_pending до reconciliation.

01 · Reserve
Резерв средствДо отправки проверяются баланс, лимиты и оценка output.
02 · Measure
Считывание usageJSON и SSE usage нормализуются в общую запись запроса.
03 · Settle
Точное списаниеСписывается одна idempotent-операция, остаток резерва освобождается.

Как считаются токены

Разные протоколы используют разные имена полей. В ledger они приводятся к единому виду:

ПолеВ ledgerПравило
Input / promptInput tokensУчитывается один раз
Cached inputCached tokensСохраняется отдельно; действует blended price модели
Output / completionOutput tokensУчитывается один раз
ReasoningReasoning tokensДиагностическая часть output, не прибавляется повторно

Если terminal usage отсутствует, запрос получает статус billing_pending, а система не угадывает итоговую сумму.

Пример расчёта

Возьмём ставку $0.09/M. Резерв не меняет итоговое списание:

Charged tokensРасчётИтог
10 000$0.0009$0.0009
100 000$0.009$0.009
1 000 000$0.09$0.09
2 000 000$0.18$0.18

Списание считается по каждому ответу отдельно, только по измеренному usage.

Ошибки

Отклонённый до отправки в модель не расходует inference. Резерв и причина ошибки видны в usage.

Streaming

SSE отдаётся сразу. При terminal event списывается reported usage, а disconnect обрабатывается по policy.

Лимиты

Баланс, лимиты ключа и cap запроса проверяются до отправки. Модель скрытно не подменяется.

Как сравнивать с официальными тарифами

Официальные API часто разделяют input, cached input и output. Поэтому процент экономии корректен только для конкретного workload с одинаковыми правилами токенов, валютой и долей input/output.

  1. Измерьте token mix своих запросов.
  2. Примените к нему официальный тариф.
  3. Примените blended rate Model.sale к фактическому charged-token total.
  4. Учтите retries, ошибки, возврат reservation и округление.

На странице цен указаны текущие ставки, а сравнение содержит дату и ссылки на источники.

Открыть калькулятор workload

Версии цен и приватность

У каждой ставки есть effective version, reservation floor и checked timestamp. Availability отделена от цены: недоступная модель может сохранять цену для прозрачности, но не принимает клиентские запросы.

Prompts и response bodies не сохраняются для биллинга. В операционных данных остаются только метаданные запроса, токены, charge, margin и безопасный класс ошибки.