Перейти к содержанию
СтартQwen API

Qwen API

Семь моделей Qwen через Messages, Chat Completions и Responses: запросы, стоимость, очередь, поиск, инструменты и картинки.

Qwen работает с тем же ключом gd-… и общим балансом Guard. Для генерации доступны семь моделей; их точные ID, вход, контекст и цены приведены ниже.

Получите ключ в @subscribe_ai_bot, затем выберите HTTP, Python SDK или Node.js SDK. Покупка даёт один общий ключ; отдельный аккаунт Qwen не нужен.

Быстрый старт

  1. Сохраните ключ в переменной GUARD_API_KEY; не вставляйте его в репозиторий и не печатайте в журнал.
  2. Выберите API: Messages, Chat Completions или Responses. У каждого есть общий путь /v1 и отдельный путь /qwen/v1.
  3. Передайте точный model и бюджет вывода 4096. Для первого запроса используйте обычный JSON-ответ.
  4. Проверьте текст, конечное состояние и usage; затем при необходимости включите stream: true.
bash
export GUARD_API_KEY="gd-ваш-ключ"
curl https://api.guardrelay.ai/qwen/v1/messages \
  -H "Authorization: Bearer $GUARD_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"qwen3.7-plus","max_tokens":4096,"messages":[{"role":"user","content":"Reply with OK"}]}'
powershell
$env:GUARD_API_KEY = "gd-ваш-ключ"
$headers = @{
  Authorization = "Bearer $env:GUARD_API_KEY"
  "anthropic-version" = "2023-06-01"
}
$body = @{
  model = "qwen3.7-plus"
  max_tokens = 4096
  messages = @(@{ role = "user"; content = "Reply with OK" })
} | ConvertTo-Json -Depth 10
Invoke-RestMethod -Method Post `
  -Uri "https://api.guardrelay.ai/qwen/v1/messages" `
  -Headers $headers `
  -ContentType "application/json" `
  -Body $body

Два адреса, три API

APIОбщий путьПуть QwenБюджет вывода
MessagesPOST /v1/messagesPOST /qwen/v1/messagesmax_tokens
Chat CompletionsPOST /v1/chat/completionsPOST /qwen/v1/chat/completionsmax_tokens / max_completion_tokens
ResponsesPOST /v1/responsesPOST /qwen/v1/responsesmax_output_tokens

Оба пространства имён дают один контракт Qwen и один биллинг. Семейный адрес удобен для отдельного клиентского профиля и принимает только модели Qwen; общий адрес удобен, если приложение уже выбирает семейство по model.

Модели, вход и контекст

Model IDВходКонтекстПредел ответа
qwen3.8-maxТекст и картинки1 000 000131 072
qwen3.7-maxТолько текст1 000 000131 072
qwen3.7-plusТекст и картинки1 000 00065 536
qwen3.6-plusТекст и картинки1 000 00065 536
qwen3.5-plusТекст и картинки1 000 00065 536
qwen3.5-omni-plusТекст и картинки262 144, вход до 196 60865 536
qwen3.8-omni-flashТекст и картинки1 000 000131 072

Обычные ответы и SSE

APIОбычный финалФинал SSEUsage
Messagesstop_reason: end_turn, max_tokens, tool_usemessage_delta → message_stopinput_tokens, output_tokens
Chat Completionschoices[].finish_reason: stop, length, tool_callsфинальный блок данных + [DONE]prompt_tokens, completion_tokens, total_tokens
Responsesstatus: completed, incompleteresponse.completedinput_tokens, output_tokens, total_tokens

Цена

МодельВход запроса, токеновВвод / 1MВывод / 1M
qwen3.8-maxдо 1 000 000$2.00$6.00
qwen3.7-maxдо 1 000 000$2.50$7.50
qwen3.7-plusдо 256 000$0.40$1.60
qwen3.7-plusсвыше 256 000$1.20$4.80
qwen3.6-plusдо 256 000$0.50$3.00
qwen3.6-plusсвыше 256 000$2.00$6.00
qwen3.5-plusдо 256 000$0.40$2.40
qwen3.5-plusсвыше 256 000$0.50$3.00
qwen3.5-omni-plusдо 196 608$1.40$8.30
qwen3.8-omni-flashдо 1 000 000$0.15$0.47

Ставки равны официальным ставкам Alibaba Cloud для этих моделей, множитель 1, включая PRIVATE. У Plus-моделей два уровня: если вход запроса больше 256 000 токенов, весь запрос, и ввод, и вывод, считается по второй строке. Если модель хотя бы раз искала в сети, запрос стоит на $0.01 больше; число поисков на цену не влияет. Кеша у Qwen нет.

Пример для qwen3.7-plus: 10 000 входных и 2000 выходных токенов стоят 10000×0.40/1M + 2000×1.60/1M = $0.00720000, а если модель искала в сети, $0.01720000 при любом числе поисков. При 300 000 входных и 2000 выходных токенов действует второй уровень: 300000×1.20/1M + 2000×4.80/1M = $0.36960000.

Бесплатный подсчёт входа

bash
curl https://api.guardrelay.ai/qwen/v1/messages/count_tokens \
  -H "Authorization: Bearer $GUARD_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"qwen3.7-plus","messages":[{"role":"user","content":"Count this input"}]}'

Подсчёт выполняет сам шлюз, без обращения к модели и без списания. Он возвращает ту же оценку входа, по которой считается генерация, и заголовок X-Guard-Usage-Source: estimated.

Сессии, очередь и замена модели

  • Один аккаунт Qwen обслуживает одну клиентскую сессию и выполняет один запрос за раз. Параллельные запросы одной сессии ждут друг друга.
  • Новая сессия того же ключа, например после /clear, получает аккаунт, как только тот закончит текущий запрос. Запросы других ключей ждут свободный аккаунт.
  • Если свободного аккаунта нет, запрос ждёт в очереди до 30 секунд, затем получает 429 queue_timeout с заголовком Retry-After: 30.
  • Генерация одного ответа длится не больше 10 минут, после этого приходит ошибка generation_timeout.
  • После 10 минут без запросов аккаунт освобождается. Следующее сообщение продолжит беседу по истории, которую прислал клиент.

Если запрошенная модель занята у поставщика или её лимит исчерпан, ответит ближайшая свободная модель Qwen, которая принимает такой запрос. Замена происходит до первого символа ответа. Клиент видит в ответе запрошенную модель и платит по её ставке. Если подходящей свободной модели нет, приходит 429 provider_at_capacity с Retry-After: 5, а при временной недоступности Qwen приходит 503 qwen_unavailable с Retry-After: 30.

В личном кабинете Qwen можно поставить на паузу и задать для него часовой и дневной лимит расходов ключа. На паузе запросы Qwen получают 403 api_key_paused, при достигнутом лимите 429 customer_hour_limit или 429 customer_day_limit.

Клиентские функции и поиск в сети устроены по-разному. Функцию исполняет ваше приложение и возвращает результат модели. Поиск Qwen выполняет сам, когда решает, что он нужен; отдельного параметра для включения или запрета поиска нет. Если модель искала хотя бы раз, Guard добавляет к запросу $0.01 один раз, сколько бы поисков ни было.

APIОбъявление клиентской функции
Chat Completions{type: "function", function: {name, description, parameters}}
Messages{name, description, input_schema}
Responses{type: "function", name, description, parameters}

Что читать дальше

MessagesТело, usage, stop_reason, tools и SSE.Chat CompletionsOpenAI-совместимый запрос, инструменты и картинки.ResponsesПолная история в input и финал incomplete.Ошибки QwenКоды, очередь, повтор и действия клиента.Python SDKКороткие примеры для OpenAI и Anthropic SDK.Node.js SDKChat Completions и Responses без скрытых повторов.

Разделы документации

На этой странице