Списание — за фактически использованные токены, отдельно за вход и выход, по тарифу модели. Остаток — на дашборде и в боте.
| Модель | Input | Output |
|---|---|---|
claude-haiku-4-5 | $1.00 | $5.00 |
claude-sonnet-5 | $3.00 | $15.00 |
claude-opus-5 | $5.00 | $25.00 |
claude-opus-4-8 | $5.00 | $25.00 |
claude-fable-5 (без применённого серверного промпта) | $10.00 | $50.00 |
claude-fable-5-1 (без применённого серверного промпта) | $10.00 | $50.00 |
| Модель | Input | Cache read | Output |
|---|---|---|---|
Kimi K3k3 | $3.00 | $0.30 | $15.00 |
Kimi K3-256Kk3-256k | $3.00 | $0.30 | $15.00 |
Kimi K2.7 Codekimi-for-coding | $0.95 | $0.19 | $4.00 |
Kimi K2.7 Code HighSpeedkimi-for-coding-highspeed | $1.90 | $0.38 | $8.00 |
USD за 1M токенов. Текущий тариф Guard загружается из конфигурации API.
Таблица выше собирается из каталога биллинга шлюза, поэтому числа не переписываются в текст документации и не расходятся с тем, по чему считается списание. Баланс у ключа один на все семейства.
Часть входа, которую Kimi узнал по своему кешу, считается по отдельной ставке Cache read. У k3 и k3-256k она в десять раз ниже входной, у kimi-for-coding и kimi-for-coding-highspeed — в пять раз. Двойной платы нет: кешированные токены вычитаются из обычного входа. Сколько их было, видно в ответе — usage.prompt_tokens_details.cached_tokens. Записи в кеш Kimi отдельно не тарифицирует.
Перед обращением к модели резервируется оценка стоимости входа плюс стоимость предельного выхода. Для Kimi без max_tokens берётся 32 000 выходных токенов. Подтверждённая скидка PRIVATE 25% учитывается уже в резерве; будущий cache hit не предполагается. Неиспользованный резерв возвращается.
| Модель | Input | Cache read | Output |
|---|---|---|---|
Composer 2.5 composer-2.5 | $0.50 | $0.20 | $2.50 |
Composer 2.5 Fast composer-2.5-fast | $3.00 | $0.50 | $15.00 |
Grok 4.6 cursor-grok-4.6-low, -medium, -high, -xhigh | $2.00 | $0.50 | $6.00 |
Grok 4.6 Fast cursor-grok-4.6-low-fast, -medium-fast, -high-fast, -xhigh-fast | $4.00 | $1.00 | $12.00 |
Перед обращением к модели Guard временно блокирует самую большую возможную стоимость запроса. Входная часть оценивается сверху: берутся байты UTF-8 самого запроса — системного текста, сообщений и описаний инструментов. Это заведомо больше настоящего числа токенов, зато не занижает блокировку на коде, JSON и русском тексте. Выходная часть считается по max_tokens, на поверхности Responses — по max_output_tokens; если предел не задан, берётся 32 000. Подтверждённая скидка PRIVATE 25% учитывается в резерве.
- Input — учтённый вход: системный текст, история, текущее сообщение и данные инструментов.
- Output — учтённый вывод модели.
- Токенная стоимость рассчитывается по базовым ставкам запрошенной модели; запись и чтение кэша считаются отдельно, без двойного учёта обычного входа.
- При праве на скидку токенная стоимость после кэша умножается на 0.75, один раз.
- Итог = токенная стоимость после скидки + фиксированные сборы серверных инструментов.
Claude без фактически применённого серверного промпта — скидка 25%. При применённом промпте действует базовая ставка. Подтверждённый участник PRIVATE получает 25% на все четыре семейства с промптом и без него. Основания не складываются. Скидка действует после учёта кэша; старые финансовые записи не пересчитываются. Полные условия.
Web search добавляет $0.01 за каждый учтённый платный поисковый запрос. Эта фиксированная плата не уменьшается на 25%, в том числе для PRIVATE. У Web fetch фиксированная плата $0. Полученный контент учитывается как входные токены по обычным правилам кэша и скидки.
Для каждого ключа можно задать отдельный лимит в USD за скользящий час и/или 24 часа: @subscribe_ai_bot → Мои API-ключи → выбрать ключ → Управление API-ключом → лимиты. Значение 0 или кнопка снятия лимитов отключает ограничение.
429с кодомhourly_spend_limit/daily_spend_limitозначает установленный вами лимит расходов. Увеличьте или снимите его в боте либо дождитесь освобождения скользящего окна.429сhourly_reserve_limit/daily_reserve_limitозначает, что максимально возможная стоимость запроса не помещается в остаток лимита. Уменьшитеmax_tokens/max_output_tokensили увеличьте лимит.- Другой
429означает временный лимит частоты или ёмкости. ИспользуйтеRetry-Afterи повтор с задержкой. - Проверка расходного лимита проходит до платного обращения к модели.
HTTP/1.1 429 Too Many Requests
Retry-After: 12