Aller au contenu

Open Beta— Latenza est disponible dès maintenant.Commencer gratuitement →

Cache

Les mêmes questions ne coûtent qu’une fois

Latenza compare chaque prompt aux requêtes récentes par similarité d’embeddings. Au-dessus de votre seuil, la réponse est servie depuis le cache — instantanément, sans appel provider facturé. Isolation stricte par organisation.

Atout
Similarité par embeddings
Atout
Seuil et TTL par tenant
Atout
~0 ms sur un hit
cache.config.json
{
  "semantic_cache_enabled": true,
  "semantic_cache_threshold": 0.92,
  "semantic_cache_ttl_seconds": 3600
}

Ce que ça change

Cache sémantique, en pratique.

Sémantique, pas exact

La similarité est évaluée par embeddings — deux formulations proches partagent la même réponse.

Seuil configurable

Ajustez le seuil de similarité (0–1) selon la tolérance de chaque usage : FAQ permissive, prod stricte.

TTL configurable

Définissez la durée de vie du cache, de quelques minutes à plusieurs jours.

Isolation par organisation

Une réponse mise en cache par une organisation ne peut jamais être servie à une autre.

Comment ça marche

Le cache, en trois paramètres

  1. 1Activez le cacheActivez le cache sémantique pour votre organisation depuis le dashboard.
  2. 2Réglez seuil et TTLAjustez le seuil de similarité et la durée de vie selon la sensibilité de vos flux.
  3. 3Économisez en continuLes requêtes proches sont servies depuis le cache — le hit-rate et l’économie s’affichent en temps réel.

Activez, choisissez un seuil et un TTL. Latenza gère l’indexation, l’expiration et l’isolation.

cache.config.json
{
  "semantic_cache_enabled": true,
  "semantic_cache_threshold": 0.92,
  "semantic_cache_ttl_seconds": 3600
}

Prêt à essayer ?

Commencez gratuitement. Aucune carte bancaire. Déployé en 5 minutes.