Aller au contenu

Open Beta— Latenza est disponible dès maintenant.Commencer gratuitement →

Observabilité

Voyez exactement ce que vos LLMs coûtent

Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.

Atout
Trace par requête
Atout
Métriques temps réel
Atout
Métadonnées custom
request.py
resp = client.chat.completions.create(
    model="gpt-4o",
    messages=messages,
    extra_headers={
        "X-Latenza-Metadata": json.dumps({
            "user_id": "u_42",
            "feature": "support-chat",
        })
    },
)

Ce que ça change

Observabilité & traces, en pratique.

Coût par requête

Le coût réel de chaque appel, ventilé par modèle, par clé API et par assistant.

Latence détaillée

p50, p95 et p99 par provider et par modèle, pour repérer les régressions en un coup d’œil.

Métadonnées custom

Passez un header X-Latenza-Metadata (user_id, session, feature…) et filtrez vos traces dessus.

Alertes budget

Définissez un seuil d’alerte par clé : vous êtes prévenu avant le plafond, par email ou webhook.

Comment ça marche

Des traces qui parlent votre langue métier

  1. 1Rien à instrumenterDès le premier appel via Latenza, toutes les métriques sont collectées automatiquement.
  2. 2Taguez vos requêtesAjoutez vos métadonnées métier dans le header : elles sont stockées avec chaque trace.
  3. 3Pilotez vos coûtsSegmentez, posez des alertes, exportez en CSV/JSON quand vous en avez besoin.

Un header suffit pour rattacher chaque appel à un utilisateur, une session ou une feature.

request.py
resp = client.chat.completions.create(
    model="gpt-4o",
    messages=messages,
    extra_headers={
        "X-Latenza-Metadata": json.dumps({
            "user_id": "u_42",
            "feature": "support-chat",
        })
    },
)

Prêt à essayer ?

Commencez gratuitement. Aucune carte bancaire. Déployé en 5 minutes.