Zéro downtime, même quand un provider tombe
Panne OpenAI, quota Anthropic dépassé, timeout réseau ? La requête bascule sur le provider suivant en moins de 100 ms. Vos utilisateurs ne voient jamais l’incident — et la tentative échouée reste visible dans vos traces.
- Atout
- <100 ms de bascule
- Atout
- Erreurs 5xx, 429, timeouts
- Atout
- 0 ligne de code
{
"request_id": "req_8f3a2c",
"attempts": [
{ "provider": "openai", "model": "gpt-4o",
"status": "timeout" },
{ "provider": "anthropic", "model": "claude-sonnet-4-5",
"status": "ok", "latency_ms": 412 }
],
"client_status": 200
}Ce que ça change
Failover automatique, en pratique.
Détection instantanée
Erreurs 5xx, timeouts, quotas dépassés : chaque échec est détecté et traité à la volée.
Cascade multi-provider
Le prochain candidat est choisi parmi vos providers actifs, en respectant l’allowlist de la clé.
Tentatives tracées
Chaque bascule apparaît dans la trace de la requête : provider, erreur, latence de chaque tentative.
Zéro impact utilisateur
La bascule est transparente : la réponse arrive du provider de secours sans erreur côté client.
Comment ça marche
Un incident provider, vu depuis la trace
- 1Connectez plusieurs providersLe failover fonctionne dès que deux providers peuvent servir le même type de requête.
- 2Définissez l’allowlistRestreignez les modèles éligibles par clé : la cascade respecte vos contraintes de qualité et de coût.
- 3Laissez Latenza gérerEn cas d’incident, la requête est re-routée automatiquement — l’échec est visible en trace, pas en prod.
Le client reçoit un 200. La trace raconte ce qui s’est vraiment passé — tentative par tentative.
{
"request_id": "req_8f3a2c",
"attempts": [
{ "provider": "openai", "model": "gpt-4o",
"status": "timeout" },
{ "provider": "anthropic", "model": "claude-sonnet-4-5",
"status": "ok", "latency_ms": 412 }
],
"client_status": 200
}Explorez les autres fonctionnalités
Cache sémantique
Latenza compare chaque prompt aux requêtes récentes par similarité d’embeddings. Au-dessus de votre seuil, la réponse est servie depuis le cache — instantanément, sans appel provider facturé. Isolation stricte par organisation.
Observabilité & traces
Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.
Budgets & rate limiting
Plafond mensuel en euros, quota de requêtes par minute et allowlist de modèles — portés par chaque clé API. Le dépassement est bloqué côté gateway, avant que l’appel provider ne soit facturé. Alerte configurable avant le plafond.
Guardrails
Règles par mots, expressions régulières ou longueur maximale, appliquées à l’entrée (avant l’appel provider) et à la sortie (y compris en streaming). Chaque règle bloque la requête ou la signale dans vos traces — configurable sans redéploiement.