Vos données dans vos réponses, sans pipeline à coder
Uploadez vos documents dans un contexte, liez-le à un assistant : les réponses s’appuient sur vos données. Chaque assistant a son modèle, son prompt système, ses coûts tracés — et peut être exposé en widget de chat sur votre site.
- Atout
- RAG sans infra
- Atout
- Coûts par assistant
- Atout
- Du dashboard à la prod
resp = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user",
"content": "Comment réinitialiser ma clé ?"}],
extra_body={"assistant_id": "ast_support"},
)
# La réponse s'appuie sur vos documents ingérésCe que ça change
Assistants & RAG, en pratique.
Upload et ingestion
Déposez vos documents : ils sont découpés, vectorisés et indexés automatiquement. Statut d’ingestion visible.
Contextes réutilisables
Un même contexte documentaire peut alimenter plusieurs assistants — mise à jour en un seul endroit.
Assistants configurables
Modèle, prompt système, contextes liés : chaque assistant est une unité métier avec ses propres réglages.
Coûts ventilés
Le coût de chaque assistant apparaît séparément dans vos traces et votre facturation.
Comment ça marche
Le RAG, depuis votre client OpenAI
- 1Créez un contexteUploadez vos documents (docs produit, FAQ, base de connaissances) et laissez l’ingestion tourner.
- 2Liez-le à un assistantChoisissez le modèle et le prompt système, attachez un ou plusieurs contextes.
- 3Appelez-le comme un modèlePassez l’assistant_id dans votre appel : le RAG est appliqué côté gateway, votre code ne change pas.
Un identifiant d’assistant dans l’appel — la recherche documentaire et l’injection de contexte sont gérées par le gateway.
resp = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user",
"content": "Comment réinitialiser ma clé ?"}],
extra_body={"assistant_id": "ast_support"},
)
# La réponse s'appuie sur vos documents ingérésExplorez les autres fonctionnalités
Chatbots embarquables
Exposez n’importe quel assistant en widget de chat sur votre site ou celui de vos clients : une clé publique, une vérification d’origine, un rate limit par visiteur. Le trafic du widget est tracé et facturé comme le reste de votre usage.
A/B testing
Sonnet ou GPT-4o pour votre support ? Un nouveau prompt système fait-il mieux ? Répartissez le trafic entre deux variantes, mesurez coût, latence et feedback utilisateur, puis basculez la meilleure — sans déploiement.
Routing intelligent
Chaque clé API porte une stratégie — cheapest, fastest, balanced ou quality — une allowlist de modèles et un budget. Latenza sélectionne le meilleur candidat à chaque appel, sans changer une ligne dans votre code applicatif.
Failover automatique
Panne OpenAI, quota Anthropic dépassé, timeout réseau ? La requête bascule sur le provider suivant en moins de 100 ms. Vos utilisateurs ne voient jamais l’incident — et la tentative échouée reste visible dans vos traces.