Запасная модель#
Если провайдер модели не ответил — ошибка 5xx, 429 или обрыв связи — flua сначала повторяет запрос сам, а если не помогло, отправляет его похожей модели: той же лаборатории или той же ценовой ступени, но не заметно дороже. Вы получаете ответ вместо ошибки; списание — по цене модели, которая ответила.
Какая модель ответила, видно по заголовкам ответа:
x-flua-model: claude-sonnet-5-5
x-flua-fallback-from: claude-opus-5-5Поле model в теле ответа тоже содержит модель, которая ответила. Запасная модель работает для текстовых моделей в Chat Completions, Responses и Messages; к картинкам и эмбеддингам она не применяется. Если в запросе есть картинки, выбирается только модель, которая их видит.
Как отключить#
Для одного запроса — полем в теле или заголовком:
response = client.chat.completions.create(
model="claude-opus-5-5",
messages=[{"role": "user", "content": "Привет!"}],
extra_body={"fallback": False}, # или
# extra_headers={"x-flua-fallback": "off"},
)Для всех запросов ключа — переключателем «Запасная модель при сбоях» в настройках ключа.
Какая модель подменяет какую#
| Модель | Запасная |
|---|---|
claude-opus-5-5 | claude-sonnet-5-5 |
claude-sonnet-5-5 | gpt-6.1-sol |
claude-fable-5-1 | claude-opus-5-5 |
gpt-6.1-sol | gemini-3.1-pro-preview |
gpt-6-astra | gpt-6.1-sol |
gpt-6-luna | qwen3.8-flash |
gemini-3.8-flash | deepseek-v4.1-flash |
gemini-3.1-pro-preview | gemini-3.8-flash |
grok-4.7 | glm-5.3 |
deepseek-v4.1-flash | qwen3.8-flash |
qwen3.8-flash | qwen3.8-omni-flash |
qwen3.8-max | qwen3.8-flash |
qwen3.8-omni-flash | qwen3.8-flash |
kimi-k3 | qwen3.8-max |
glm-5.3 | glm-5.3-flash |
glm-5.3-flash | deepseek-v4.1-flash |
minimax-m3 | deepseek-v4.1-flash |
mimo-v2.6-flash | deepseek-v4.1-flash |
mimo-v2.6-pro | mimo-v2.6-flash |
hy4-preview | deepseek-v4.1-flash |
Доля ошибок каждой модели за сутки и неделю — на странице статуса.
Параллельные запросы#
Одновременно на аккаунт выполняется ограниченное число запросов — по тарифу:
- Free — 5 одновременно, 60 в минуту на ключ
- Plus — 10 одновременно, 180 в минуту на ключ
- Pro — 20 одновременно, 600 в минуту на ключ
- Max — 50 одновременно, 2000 в минуту на ключ
Кроме того, каждый идущий запрос резервирует на балансе свою примерную стоимость (по max_tokens или 8 192 токенам ответа). Новый запрос начинается, только если баланса хватает на уже идущие, — так пачка долгих запросов к дорогой модели не уведёт баланс в большой минус. Первый запрос, как и раньше, требует лишь положительного баланса.
{
"error": {
"message": "Too many requests in progress: up to 5 at once on the free plan. Wait for one to finish.",
"type": "rate_limit_error",
"code": "concurrency_limit"
}
}Правила ключа#
В настройках каждого ключа можно ограничить, к каким моделям он обращается и с каких IP-адресов (по одному адресу или подсети CIDR, IPv4 и IPv6), задать лимит трат и уведомление о расходе за день, месяц или всё время — письмом и в Telegram.