Comparez deux modèles sur du trafic réel
Sonnet ou GPT-4o pour votre support ? Un nouveau prompt système fait-il mieux ? Répartissez le trafic entre deux variantes, mesurez coût, latence et feedback utilisateur, puis basculez la meilleure — sans déploiement.
- Atout
- Trafic réel, pas benchmark
- Atout
- Coût · latence · feedback
- Atout
- Bascule sans déploiement
{
"name": "Support : sonnet vs gpt-4o",
"variants": [
{ "model": "claude-sonnet-4-5", "traffic_pct": 50 },
{ "model": "gpt-4o", "traffic_pct": 50 }
],
"metrics": ["cost", "latency_p95", "feedback_score"]
}Ce que ça change
A/B testing, en pratique.
Variantes de modèle ou de prompt
Testez gpt-4o contre claude-sonnet, ou deux prompts système sur le même modèle.
Répartition contrôlée
Choisissez le pourcentage de trafic par variante — 50/50 ou canary à 5%.
Métriques côte à côte
Coût par requête, latence p95 et score de feedback, comparés variante par variante.
Le feedback compte
Les notes 👍/👎 de vos utilisateurs (app ou widget) alimentent directement les résultats du test.
Comment ça marche
Un test A/B déclaratif
- 1Définissez les variantesDeux modèles, deux prompts, ou les deux — sur l’assistant ou la clé de votre choix.
- 2Répartissez le traficLe gateway assigne chaque requête à une variante selon vos pourcentages, de façon stable par session.
- 3Tranchez sur les chiffresQuand l’écart est net, basculez 100% du trafic sur la variante gagnante — en un clic.
Déclarez les variantes et les métriques. Le gateway répartit, mesure et agrège.
{
"name": "Support : sonnet vs gpt-4o",
"variants": [
{ "model": "claude-sonnet-4-5", "traffic_pct": 50 },
{ "model": "gpt-4o", "traffic_pct": 50 }
],
"metrics": ["cost", "latency_p95", "feedback_score"]
}Explorez les autres fonctionnalités
Routing intelligent
Chaque clé API porte une stratégie — cheapest, fastest, balanced ou quality — une allowlist de modèles et un budget. Latenza sélectionne le meilleur candidat à chaque appel, sans changer une ligne dans votre code applicatif.
Failover automatique
Panne OpenAI, quota Anthropic dépassé, timeout réseau ? La requête bascule sur le provider suivant en moins de 100 ms. Vos utilisateurs ne voient jamais l’incident — et la tentative échouée reste visible dans vos traces.
Cache sémantique
Latenza compare chaque prompt aux requêtes récentes par similarité d’embeddings. Au-dessus de votre seuil, la réponse est servie depuis le cache — instantanément, sans appel provider facturé. Isolation stricte par organisation.
Observabilité & traces
Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.