Aller au contenu

Open Beta— Latenza est disponible dès maintenant.Commencer gratuitement →

A/B testing

Comparez deux modèles sur du trafic réel

Sonnet ou GPT-4o pour votre support ? Un nouveau prompt système fait-il mieux ? Répartissez le trafic entre deux variantes, mesurez coût, latence et feedback utilisateur, puis basculez la meilleure — sans déploiement.

Atout
Trafic réel, pas benchmark
Atout
Coût · latence · feedback
Atout
Bascule sans déploiement
ab-test.json
{
  "name": "Support : sonnet vs gpt-4o",
  "variants": [
    { "model": "claude-sonnet-4-5", "traffic_pct": 50 },
    { "model": "gpt-4o",            "traffic_pct": 50 }
  ],
  "metrics": ["cost", "latency_p95", "feedback_score"]
}

Ce que ça change

A/B testing, en pratique.

Variantes de modèle ou de prompt

Testez gpt-4o contre claude-sonnet, ou deux prompts système sur le même modèle.

Répartition contrôlée

Choisissez le pourcentage de trafic par variante — 50/50 ou canary à 5%.

Métriques côte à côte

Coût par requête, latence p95 et score de feedback, comparés variante par variante.

Le feedback compte

Les notes 👍/👎 de vos utilisateurs (app ou widget) alimentent directement les résultats du test.

Comment ça marche

Un test A/B déclaratif

  1. 1Définissez les variantesDeux modèles, deux prompts, ou les deux — sur l’assistant ou la clé de votre choix.
  2. 2Répartissez le traficLe gateway assigne chaque requête à une variante selon vos pourcentages, de façon stable par session.
  3. 3Tranchez sur les chiffresQuand l’écart est net, basculez 100% du trafic sur la variante gagnante — en un clic.

Déclarez les variantes et les métriques. Le gateway répartit, mesure et agrège.

ab-test.json
{
  "name": "Support : sonnet vs gpt-4o",
  "variants": [
    { "model": "claude-sonnet-4-5", "traffic_pct": 50 },
    { "model": "gpt-4o",            "traffic_pct": 50 }
  ],
  "metrics": ["cost", "latency_p95", "feedback_score"]
}

Prêt à essayer ?

Commencez gratuitement. Aucune carte bancaire. Déployé en 5 minutes.