Voyez exactement ce que vos LLMs coûtent
Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.
- Atout
- Trace par requête
- Atout
- Métriques temps réel
- Atout
- Métadonnées custom
resp = client.chat.completions.create(
model="gpt-4o",
messages=messages,
extra_headers={
"X-Latenza-Metadata": json.dumps({
"user_id": "u_42",
"feature": "support-chat",
})
},
)Ce que ça change
Observabilité & traces, en pratique.
Coût par requête
Le coût réel de chaque appel, ventilé par modèle, par clé API et par assistant.
Latence détaillée
p50, p95 et p99 par provider et par modèle, pour repérer les régressions en un coup d’œil.
Métadonnées custom
Passez un header X-Latenza-Metadata (user_id, session, feature…) et filtrez vos traces dessus.
Alertes budget
Définissez un seuil d’alerte par clé : vous êtes prévenu avant le plafond, par email ou webhook.
Comment ça marche
Des traces qui parlent votre langue métier
- 1Rien à instrumenterDès le premier appel via Latenza, toutes les métriques sont collectées automatiquement.
- 2Taguez vos requêtesAjoutez vos métadonnées métier dans le header : elles sont stockées avec chaque trace.
- 3Pilotez vos coûtsSegmentez, posez des alertes, exportez en CSV/JSON quand vous en avez besoin.
Un header suffit pour rattacher chaque appel à un utilisateur, une session ou une feature.
resp = client.chat.completions.create(
model="gpt-4o",
messages=messages,
extra_headers={
"X-Latenza-Metadata": json.dumps({
"user_id": "u_42",
"feature": "support-chat",
})
},
)Explorez les autres fonctionnalités
Budgets & rate limiting
Plafond mensuel en euros, quota de requêtes par minute et allowlist de modèles — portés par chaque clé API. Le dépassement est bloqué côté gateway, avant que l’appel provider ne soit facturé. Alerte configurable avant le plafond.
Guardrails
Règles par mots, expressions régulières ou longueur maximale, appliquées à l’entrée (avant l’appel provider) et à la sortie (y compris en streaming). Chaque règle bloque la requête ou la signale dans vos traces — configurable sans redéploiement.
Assistants & RAG
Uploadez vos documents dans un contexte, liez-le à un assistant : les réponses s’appuient sur vos données. Chaque assistant a son modèle, son prompt système, ses coûts tracés — et peut être exposé en widget de chat sur votre site.
Chatbots embarquables
Exposez n’importe quel assistant en widget de chat sur votre site ou celui de vos clients : une clé publique, une vérification d’origine, un rate limit par visiteur. Le trafic du widget est tracé et facturé comme le reste de votre usage.