Les mêmes questions ne coûtent qu’une fois
Latenza compare chaque prompt aux requêtes récentes par similarité d’embeddings. Au-dessus de votre seuil, la réponse est servie depuis le cache — instantanément, sans appel provider facturé. Isolation stricte par organisation.
- Atout
- Similarité par embeddings
- Atout
- Seuil et TTL par tenant
- Atout
- ~0 ms sur un hit
{
"semantic_cache_enabled": true,
"semantic_cache_threshold": 0.92,
"semantic_cache_ttl_seconds": 3600
}Ce que ça change
Cache sémantique, en pratique.
Sémantique, pas exact
La similarité est évaluée par embeddings — deux formulations proches partagent la même réponse.
Seuil configurable
Ajustez le seuil de similarité (0–1) selon la tolérance de chaque usage : FAQ permissive, prod stricte.
TTL configurable
Définissez la durée de vie du cache, de quelques minutes à plusieurs jours.
Isolation par organisation
Une réponse mise en cache par une organisation ne peut jamais être servie à une autre.
Comment ça marche
Le cache, en trois paramètres
- 1Activez le cacheActivez le cache sémantique pour votre organisation depuis le dashboard.
- 2Réglez seuil et TTLAjustez le seuil de similarité et la durée de vie selon la sensibilité de vos flux.
- 3Économisez en continuLes requêtes proches sont servies depuis le cache — le hit-rate et l’économie s’affichent en temps réel.
Activez, choisissez un seuil et un TTL. Latenza gère l’indexation, l’expiration et l’isolation.
{
"semantic_cache_enabled": true,
"semantic_cache_threshold": 0.92,
"semantic_cache_ttl_seconds": 3600
}Explorez les autres fonctionnalités
Observabilité & traces
Chaque requête laisse une trace complète : coût réel, latence, tokens, provider choisi, fallbacks, métadonnées. Découpez par clé, par assistant, par feature ou par utilisateur final. Fini les mauvaises surprises en fin de mois.
Budgets & rate limiting
Plafond mensuel en euros, quota de requêtes par minute et allowlist de modèles — portés par chaque clé API. Le dépassement est bloqué côté gateway, avant que l’appel provider ne soit facturé. Alerte configurable avant le plafond.
Guardrails
Règles par mots, expressions régulières ou longueur maximale, appliquées à l’entrée (avant l’appel provider) et à la sortie (y compris en streaming). Chaque règle bloque la requête ou la signale dans vos traces — configurable sans redéploiement.
Assistants & RAG
Uploadez vos documents dans un contexte, liez-le à un assistant : les réponses s’appuient sur vos données. Chaque assistant a son modèle, son prompt système, ses coûts tracés — et peut être exposé en widget de chat sur votre site.