Protégez votre budget, avant l’appel provider
Plafond mensuel en euros, quota de requêtes par minute et allowlist de modèles — portés par chaque clé API. Le dépassement est bloqué côté gateway, avant que l’appel provider ne soit facturé. Alerte configurable avant le plafond.
- Atout
- Budget € par clé
- Atout
- Quota req/min
- Atout
- Blocage avant facturation
{
"name": "Squad growth",
"rate_limit": 60,
"budget_monthly_eur": 100,
"budget_alert_pct": 80,
"model_allowlist": ["gpt-4o-mini", "claude-haiku-4-5"]
}Ce que ça change
Budgets & rate limiting, en pratique.
Tout est porté par la clé
Une clé par app, par équipe ou par client : chacune a son budget, son quota et ses modèles autorisés.
Budget mensuel en euros
Quand la dépense du mois atteint le plafond, la clé est bloquée — pas de dérive possible.
Rate limit par minute
Encaissez les pics légitimes, stoppez les boucles infinies et les abus avant qu’ils ne coûtent.
Alerte avant blocage
Définissez un seuil d’alerte (ex. 80%) : vous êtes prévenu avant que la clé ne soit coupée.
Comment ça marche
Une politique de dépense lisible
- 1Créez une clé par usageApp de prod, staging, squad, client final : chaque usage a sa clé et ses limites propres.
- 2Posez budget et quotaPlafond mensuel en euros, requêtes par minute, allowlist de modèles — en trois champs.
- 3Dormez tranquilleLe contrôle est fait à la validation de la clé, avant l’appel provider. Le dépassement ne sera jamais facturé.
Déclarez le plafond, le quota et l’alerte. Latenza applique et compte côté gateway.
{
"name": "Squad growth",
"rate_limit": 60,
"budget_monthly_eur": 100,
"budget_alert_pct": 80,
"model_allowlist": ["gpt-4o-mini", "claude-haiku-4-5"]
}Explorez les autres fonctionnalités
Guardrails
Règles par mots, expressions régulières ou longueur maximale, appliquées à l’entrée (avant l’appel provider) et à la sortie (y compris en streaming). Chaque règle bloque la requête ou la signale dans vos traces — configurable sans redéploiement.
Assistants & RAG
Uploadez vos documents dans un contexte, liez-le à un assistant : les réponses s’appuient sur vos données. Chaque assistant a son modèle, son prompt système, ses coûts tracés — et peut être exposé en widget de chat sur votre site.
Chatbots embarquables
Exposez n’importe quel assistant en widget de chat sur votre site ou celui de vos clients : une clé publique, une vérification d’origine, un rate limit par visiteur. Le trafic du widget est tracé et facturé comme le reste de votre usage.
A/B testing
Sonnet ou GPT-4o pour votre support ? Un nouveau prompt système fait-il mieux ? Répartissez le trafic entre deux variantes, mesurez coût, latence et feedback utilisateur, puis basculez la meilleure — sans déploiement.