- Exécutions en direct · latence · coût · tokens
- Erreurs et taux d'échec (30 j)
- Par agent, modèle et outil
Observez, notez et prouvez la qualité de chaque exécution d'agent.
Cortex Observability surveille de bout en bout chaque exécution gouvernée — monitoring, notation de la qualité par exécution, portes d'évaluation avant mise en production, laboratoire de simulation, score de fiabilité qui conditionne la publication, file d'amélioration, débogueur d'agents à trace complète, flux d'événements et notifications. Les exécutions en direct renvoient quality { overall: 100 } — et les chiffres remontent à l'exécution qui les a produits.
Notation par exécution · portes d'évaluation · porte de fiabilité · rejeu complet
On ne gouverne pas ce que l'on ne mesure pas.
La plupart des équipes livrent leurs agents à l'instinct — une démo au vert, un prompt plein d'espoir, et aucune idée de la tenue de la qualité face au travail réel. Sans notation par exécution, sans portes d'évaluation et sans seuil de fiabilité à la publication, une régression part en production en silence et c'est le client qui vous l'apprend, pas le tableau de bord. L'observabilité transforme la qualité des agents en un chiffre que vous pouvez suivre, imposer comme condition et présenter à un auditeur.
Neuf façons d'observer, d'évaluer et d'améliorer chaque exécution.
Une seule boîte à outils au-dessus des signaux que Cortex collecte déjà — de la trace d'une exécution isolée jusqu'à un seuil de fiabilité à l'échelle de la flotte, qui décide de ce qui part en production.
- Notation de la qualité par exécution
- Fidélité · couverture des citations
- quality { overall: 100 }
- Suites d'évaluation de référence comme portes de publication
- Le taux de réussite alimente le score
- Bloquez une régression avant le lancement
- Prompts et modèles en A/B
- Simulations sur du trafic réel
- Comparez avant de promouvoir
- 0–100, conditionne la publication (409)
- Pondéré : succès · évaluation · incidents
- Instantanés de tendance dans le temps
- Les exécutions mal notées remontent
- Tri → correction → réévaluation
- Bouclez la boucle qualité
- Trace complète de l'exécution, saut par saut
- prompt → contexte → modèle → outils
- Rejouez n'importe quelle exécution passée
- Flux d'événements en direct de chaque exécution
- Notifications en cas de dépassement de seuil
- Reliez aux incidents et à la supervision
D'une exécution isolée à un score qui conditionne la production.
Le score de fiabilité est un modèle de lecture construit sur des signaux que Cortex enregistre déjà — sa collecte ne coûte donc rien de plus, et il ne bloque jamais l'exploitation lorsque la notation est indisponible.
- 01
Noter chaque exécution
Chaque exécution gouvernée est notée sur la qualité — fidélité, couverture des citations, sûreté — et sa trace est capturée pour rejeu. quality { overall: 100 } signifie que la réponse tient face à sa source.
- 02
Agréger en fiabilité
La fiabilité par agent combine taux de succès (0,5), taux de réussite aux évaluations (0,3) et incidents (0,2) sur une fenêtre de 30 jours, en un score de 0–100 assorti d'un palier : excellent · bon · moyen · faible.
- 03
Conditionner la publication
Le registre refuse de publier un agent qui, avec suffisamment de signal, se situe sous le seuil — 409 RELIABILITY_TOO_LOW. Les nouveaux agents publient librement ; en cas de panne du scoring, le système reste ouvert.
Un seuil de fiabilité qui bloque réellement une mauvaise version.
La fiabilité n'est pas une métrique de façade affichée au mur. agent-registry-service.publish() consulte le score du runtime en direct et refuse la publication lorsqu'un agent dispose d'assez de signal et se situe sous RELIABILITY_MIN_PUBLISH (50 par défaut). Les agents récents ou peu documentés se publient librement ; si la notation est indisponible, le comportement bascule en autorisation par défaut — la disponibilité de la notation ne bloque jamais votre exploitation.
- Publication refusée par 409 RELIABILITY_TOO_LOW lorsque le score passe sous le seuil
- Signal suffisant = signal primaire + totalRuns ≥ 3 (configurable)
- Instantanés de tendance à chaque score — suivez l'évolution de la qualité, pas une mesure isolée
La démo que vous pouvez exécuter vous-même.
Interrogez la fiabilité d'un agent mal noté disposant d'assez d'exécutions, puis essayez de le publier. Le référentiel refuse avec 409 RELIABILITY_TOO_LOW — le même appel renvoie un score et une bande de fiabilité lisibles, à remettre à un relecteur.
Rejouez n'importe quelle exécution, saut par saut.
Quand une exécution dérape, vous ne devinez pas. Le débogueur d'agents reconstitue l'exécution entière — prompt, contexte récupéré, appel au modèle, chaque invocation d'outil, l'approbation et la sortie filtrée — chaque étape estampillée de son coût, de sa latence et de son verdict. Chaque saut renvoie au Trust Ledger : la trace que vous lisez est bien l'exécution qui a eu lieu.
- Chronologie complète : prompt → contexte → modèle → outils → approbation → sortie
- Coût, latence, tokens et verdict pass/hold/block à chaque saut
- Rejouable depuis l'historique ; chaque étape renvoie au Trust Ledger
L'observabilité se superpose à toutes les portes de contrôle.
Elle note, trace et filtre les mêmes exécutions gouvernées que vos agents empruntent déjà — ce que vous mesurez est donc la réalité, et ce que vous prouvez se rattache au registre.
- Fiabilité de toute la flotte dans la vue d'ensemble
- Score moyen · nombre sous le seuil
- Mettez en pause un agent qui se dégrade en un clic
- Chaque trace d'exécution est enregistrée
- Chaînage par hachage, altération détectable
- Les scores remontent aux exécutions qui les ont produits
- Porte de fiabilité à la publication
- Testez en conversation avant de livrer
- La file d'amélioration boucle la boucle
- Une baisse de score peut déclencher des modes plus stricts
- Un plancher de risque qui ne peut que se resserrer
- Les notifications se relient aux incidents
Conçu pour la revue de sécurité en entreprise.
Notation cadrée par locataire, disponibilité en autorisation par défaut, traces d'exécution à détection d'altération et porte de fiabilité à la publication — mises en correspondance avec les référentiels que vos auditeurs utilisent déjà.
Mesurez vos agents. Filtrez ce qui part en production.
Notez chaque exécution, rejouez n'importe laquelle et refusez une mauvaise version avant qu'elle n'atteigne la production — le tout depuis un seul plan d'observabilité.