Aller au contenu

Open Beta— Latenza est disponible dès maintenant.Commencer gratuitement →

Routing

Chaque requête au bon modèle, selon vos règles

Chaque clé API porte une stratégie — cheapest, fastest, balanced ou quality — une allowlist de modèles et un budget. Latenza sélectionne le meilleur candidat à chaque appel, sans changer une ligne dans votre code applicatif.

Atout
4 providers unifiés
Atout
4 stratégies de routing
Atout
<10 ms d’overhead
virtual-key.json
{
  "name": "Production backend",
  "routing_strategy": "balanced",
  "model_allowlist": ["gpt-4o", "claude-sonnet-4-5"],
  "rate_limit": 120,
  "budget_monthly_eur": 250,
  "budget_alert_pct": 80
}

Ce que ça change

Routing intelligent, en pratique.

cheapest

Minimise le coût par token : le modèle le moins cher capable de servir la requête est choisi.

fastest

Privilégie la latence : les requêtes sensibles partent vers le provider le plus rapide, mesuré en continu.

balanced

Combine coût, latence et score de qualité — le meilleur compromis pour le trafic généraliste.

quality

Priorise la performance du modèle pour les tâches où la qualité de réponse prime sur le reste.

Comment ça marche

Une clé virtuelle, une politique de routing

  1. 1Connectez vos providersAjoutez vos clés OpenAI, Anthropic, Mistral, Google en quelques clics depuis le dashboard.
  2. 2Configurez vos clés virtuellesChoisissez la stratégie, l’allowlist de modèles et le budget — par organisation, par assistant ou par clé.
  3. 3Latenza route chaque appelVotre code appelle une seule API compatible OpenAI — la sélection et le failover sont gérés côté gateway.

La configuration vit sur la clé. Changez de stratégie dans le dashboard : elle s’applique à la requête suivante.

virtual-key.json
{
  "name": "Production backend",
  "routing_strategy": "balanced",
  "model_allowlist": ["gpt-4o", "claude-sonnet-4-5"],
  "rate_limit": 120,
  "budget_monthly_eur": 250,
  "budget_alert_pct": 80
}

Prêt à essayer ?

Commencez gratuitement. Aucune carte bancaire. Déployé en 5 minutes.