Документация · Надёжность и лимиты

Руководства

Надёжность и лимиты

Запасная модель при сбоях провайдера, параллельные запросы и правила ключей: модели, IP-адреса, уведомления о расходе.

Запасная модель#

Если провайдер модели не ответил — ошибка 5xx, 429 или обрыв связи — flua сначала повторяет запрос сам, а если не помогло, отправляет его похожей модели: той же лаборатории или той же ценовой ступени, но не заметно дороже. Вы получаете ответ вместо ошибки; списание — по цене модели, которая ответила.

Какая модель ответила, видно по заголовкам ответа:

заголовки ответа
x-flua-model: claude-sonnet-5-5
x-flua-fallback-from: claude-opus-5-5

Поле model в теле ответа тоже содержит модель, которая ответила. Запасная модель работает для текстовых моделей в Chat Completions, Responses и Messages; к картинкам и эмбеддингам она не применяется. Если в запросе есть картинки, выбирается только модель, которая их видит.

Как отключить#

Для одного запроса — полем в теле или заголовком:

no_fallback.py
response = client.chat.completions.create(
    model="claude-opus-5-5",
    messages=[{"role": "user", "content": "Привет!"}],
    extra_body={"fallback": False},           # или
    # extra_headers={"x-flua-fallback": "off"},
)

Для всех запросов ключа — переключателем «Запасная модель при сбоях» в настройках ключа.

Какая модель подменяет какую#

МодельЗапасная
claude-opus-5-5claude-sonnet-5-5
claude-sonnet-5-5gpt-6.1-sol
claude-fable-5-1claude-opus-5-5
gpt-6.1-solgemini-3.1-pro-preview
gpt-6-astragpt-6.1-sol
gpt-6-lunaqwen3.8-flash
gemini-3.8-flashdeepseek-v4.1-flash
gemini-3.1-pro-previewgemini-3.8-flash
grok-4.7glm-5.3
deepseek-v4.1-flashqwen3.8-flash
qwen3.8-flashqwen3.8-omni-flash
qwen3.8-maxqwen3.8-flash
qwen3.8-omni-flashqwen3.8-flash
kimi-k3qwen3.8-max
glm-5.3glm-5.3-flash
glm-5.3-flashdeepseek-v4.1-flash
minimax-m3deepseek-v4.1-flash
mimo-v2.6-flashdeepseek-v4.1-flash
mimo-v2.6-promimo-v2.6-flash
hy4-previewdeepseek-v4.1-flash

Доля ошибок каждой модели за сутки и неделю — на странице статуса.

Параллельные запросы#

Одновременно на аккаунт выполняется ограниченное число запросов — по тарифу:

  • Free — 5 одновременно, 60 в минуту на ключ
  • Plus — 10 одновременно, 180 в минуту на ключ
  • Pro — 20 одновременно, 600 в минуту на ключ
  • Max — 50 одновременно, 2000 в минуту на ключ

Кроме того, каждый идущий запрос резервирует на балансе свою примерную стоимость (по max_tokens или 8 192 токенам ответа). Новый запрос начинается, только если баланса хватает на уже идущие, — так пачка долгих запросов к дорогой модели не уведёт баланс в большой минус. Первый запрос, как и раньше, требует лишь положительного баланса.

429 Too Many Requests
{
  "error": {
    "message": "Too many requests in progress: up to 5 at once on the free plan. Wait for one to finish.",
    "type": "rate_limit_error",
    "code": "concurrency_limit"
  }
}

Правила ключа#

В настройках каждого ключа можно ограничить, к каким моделям он обращается и с каких IP-адресов (по одному адресу или подсети CIDR, IPv4 и IPv6), задать лимит трат и уведомление о расходе за день, месяц или всё время — письмом и в Telegram.

Ключ с ограниченным списком моделей в ответе на GET /v1/models показывает только их. Запрос к другой модели получит 403 model_not_allowed, с чужого адреса — 403 ip_not_allowed.