Перейти к содержанию
Оплата и расходБиллинг

Биллинг

Тарифы за 1M токенов, как считается списание.

Протокол модели

Списание — за фактически использованные токены, отдельно за вход и выход, по тарифу модели. Остаток — на дашборде и в боте.

Тарифы Claude / 1M токенов

МодельInputOutput
claude-haiku-4-5$1.00$5.00
claude-sonnet-5$3.00$15.00
claude-opus-5$5.00$25.00
claude-opus-4-8$5.00$25.00
claude-fable-5 (без применённого серверного промпта)$10.00$50.00
claude-fable-5-1 (без применённого серверного промпта)$10.00$50.00

Тарифы Kimi / 1M токенов

МодельInputCache readOutput
Kimi K3
k3
$3.00$0.30$15.00
Kimi K3-256K
k3-256k
$3.00$0.30$15.00
Kimi K2.7 Code
kimi-for-coding
$0.95$0.19$4.00
Kimi K2.7 Code HighSpeed
kimi-for-coding-highspeed
$1.90$0.38$8.00

USD за 1M токенов. Текущий тариф Guard загружается из конфигурации API.

Таблица выше собирается из каталога биллинга шлюза, поэтому числа не переписываются в текст документации и не расходятся с тем, по чему считается списание. Баланс у ключа один на все семейства.

Чтение из кеша

Часть входа, которую Kimi узнал по своему кешу, считается по отдельной ставке Cache read. У k3 и k3-256k она в десять раз ниже входной, у kimi-for-coding и kimi-for-coding-highspeed — в пять раз. Двойной платы нет: кешированные токены вычитаются из обычного входа. Сколько их было, видно в ответе — usage.prompt_tokens_details.cached_tokens. Записи в кеш Kimi отдельно не тарифицирует.

Предварительный резерв

Перед обращением к модели резервируется оценка стоимости входа плюс стоимость предельного выхода. Для Kimi без max_tokens берётся 32 000 выходных токенов. Подтверждённая скидка PRIVATE 25% учитывается уже в резерве; будущий cache hit не предполагается. Неиспользованный резерв возвращается.

Тарифы Composer и Grok / 1M токенов

МодельInputCache readOutput
Composer 2.5 composer-2.5$0.50$0.20$2.50
Composer 2.5 Fast composer-2.5-fast$3.00$0.50$15.00
Grok 4.6 cursor-grok-4.6-low, -medium, -high, -xhigh$2.00$0.50$6.00
Grok 4.6 Fast cursor-grok-4.6-low-fast, -medium-fast, -high-fast, -xhigh-fast$4.00$1.00$12.00

Предварительный резерв

Перед обращением к модели Guard временно блокирует самую большую возможную стоимость запроса. Входная часть оценивается сверху: берутся байты UTF-8 самого запроса — системного текста, сообщений и описаний инструментов. Это заведомо больше настоящего числа токенов, зато не занижает блокировку на коде, JSON и русском тексте. Выходная часть считается по max_tokens, на поверхности Responses — по max_output_tokens; если предел не задан, берётся 32 000. Подтверждённая скидка PRIVATE 25% учитывается в резерве.

Формула

  • Input — учтённый вход: системный текст, история, текущее сообщение и данные инструментов.
  • Output — учтённый вывод модели.
  • Токенная стоимость рассчитывается по базовым ставкам запрошенной модели; запись и чтение кэша считаются отдельно, без двойного учёта обычного входа.
  • При праве на скидку токенная стоимость после кэша умножается на 0.75, один раз.
  • Итог = токенная стоимость после скидки + фиксированные сборы серверных инструментов.

Скидка Claude и PRIVATE

Claude без фактически применённого серверного промпта — скидка 25%. При применённом промпте действует базовая ставка. Подтверждённый участник PRIVATE получает 25% на все четыре семейства с промптом и без него. Основания не складываются. Скидка действует после учёта кэша; старые финансовые записи не пересчитываются. Полные условия.

Стоимость серверных инструментов

Web search добавляет $0.01 за каждый учтённый платный поисковый запрос. Эта фиксированная плата не уменьшается на 25%, в том числе для PRIVATE. У Web fetch фиксированная плата $0. Полученный контент учитывается как входные токены по обычным правилам кэша и скидки.

Лимиты расходов и разные 429

Для каждого ключа можно задать отдельный лимит в USD за скользящий час и/или 24 часа: @subscribe_ai_bot → Мои API-ключи → выбрать ключ → Управление API-ключом → лимиты. Значение 0 или кнопка снятия лимитов отключает ограничение.

  • 429 с кодом hourly_spend_limit / daily_spend_limit означает установленный вами лимит расходов. Увеличьте или снимите его в боте либо дождитесь освобождения скользящего окна.
  • 429 с hourly_reserve_limit / daily_reserve_limit означает, что максимально возможная стоимость запроса не помещается в остаток лимита. Уменьшите max_tokens / max_output_tokens или увеличьте лимит.
  • Другой 429 означает временный лимит частоты или ёмкости. Используйте Retry-After и повтор с задержкой.
  • Проверка расходного лимита проходит до платного обращения к модели.
http
HTTP/1.1 429 Too Many Requests
Retry-After: 12

Разделы документации

На этой странице