Chaque requête au bon modèle, selon vos règles
Chaque clé API porte une stratégie — cheapest, fastest, balanced ou quality — une allowlist de modèles et un budget. Latenza sélectionne le meilleur candidat à chaque appel, sans changer une ligne dans votre code applicatif.
- Atout
- 4 providers unifiés
- Atout
- 4 stratégies de routing
- Atout
- <10 ms d’overhead
{
"name": "Production backend",
"routing_strategy": "balanced",
"model_allowlist": ["gpt-4o", "claude-sonnet-4-5"],
"rate_limit": 120,
"budget_monthly_eur": 250,
"budget_alert_pct": 80
}Ce que ça change
Routing intelligent, en pratique.
cheapest
Minimise le coût par token : le modèle le moins cher capable de servir la requête est choisi.
fastest
Privilégie la latence : les requêtes sensibles partent vers le provider le plus rapide, mesuré en continu.
balanced
Combine coût, latence et score de qualité — le meilleur compromis pour le trafic généraliste.
quality
Priorise la performance du modèle pour les tâches où la qualité de réponse prime sur le reste.
Comment ça marche
Une clé virtuelle, une politique de routing
- 1Connectez vos providersAjoutez vos clés OpenAI, Anthropic, Mistral, Google en quelques clics depuis le dashboard.
- 2Configurez vos clés virtuellesChoisissez la stratégie, l’allowlist de modèles et le budget — par organisation, par assistant ou par clé.
- 3Latenza route chaque appelVotre code appelle une seule API compatible OpenAI — la sélection et le failover sont gérés côté gateway.
La configuration vit sur la clé. Changez de stratégie dans le dashboard : elle s’applique à la requête suivante.
{
"name": "Production backend",
"routing_strategy": "balanced",
"model_allowlist": ["gpt-4o", "claude-sonnet-4-5"],
"rate_limit": 120,
"budget_monthly_eur": 250,
"budget_alert_pct": 80
}Explorez les autres fonctionnalités
Failover automatique
Panne OpenAI, quota Anthropic dépassé, timeout réseau ? La requête bascule sur le provider suivant en moins de 100 ms. Vos utilisateurs ne voient jamais l’incident — et la tentative échouée reste visible dans vos traces.
Cache sémantique
Latenza compare chaque prompt aux requêtes récentes par similarité d’embeddings. Au-dessus de votre seuil, la réponse est servie depuis le cache — instantanément, sans appel provider facturé. Isolation stricte par organisation.
Observabilité & traces
Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.
Budgets & rate limiting
Plafond mensuel en euros, quota de requêtes par minute et allowlist de modèles — portés par chaque clé API. Le dépassement est bloqué côté gateway, avant que l’appel provider ne soit facturé. Alerte configurable avant le plafond.