Observez chaque exécution

Observez, notez et prouvez la qualité de chaque exécution d'agent.

Cortex Observability surveille de bout en bout chaque exécution gouvernée — monitoring, notation de la qualité par exécution, portes d'évaluation avant mise en production, laboratoire de simulation, score de fiabilité qui conditionne la publication, file d'amélioration, débogueur d'agents à trace complète, flux d'événements et notifications. Les exécutions en direct renvoient quality { overall: 100 } — et les chiffres remontent à l'exécution qui les a produits.

Notation par exécution · portes d'évaluation · porte de fiabilité · rejeu complet

Observability
latence (ms)
Fidélité
0.98
Couv. citations
0.95
Sûreté
1.00
promptcontextemodèleoutilsapprobationsortie
ai-insights ▸ qualité { overall: 100 }
Le problème

On ne gouverne pas ce que l'on ne mesure pas.

La plupart des équipes livrent leurs agents à l'instinct — une démo au vert, un prompt plein d'espoir, et aucune idée de la tenue de la qualité face au travail réel. Sans notation par exécution, sans portes d'évaluation et sans seuil de fiabilité à la publication, une régression part en production en silence et c'est le client qui vous l'apprend, pas le tableau de bord. L'observabilité transforme la qualité des agents en un chiffre que vous pouvez suivre, imposer comme condition et présenter à un auditeur.

La fiabilité est une porte, pas un graphique — un agent mal noté est refusé à la publication409 RELIABILITY_TOO_LOW
La pile d'observabilité complète

Neuf façons d'observer, d'évaluer et d'améliorer chaque exécution.

Une seule boîte à outils au-dessus des signaux que Cortex collecte déjà — de la trace d'une exécution isolée jusqu'à un seuil de fiabilité à l'échelle de la flotte, qui décide de ce qui part en production.

Monitoring
  • Exécutions en direct · latence · coût · tokens
  • Erreurs et taux d'échec (30 j)
  • Par agent, modèle et outil
Insights IA
  • Notation de la qualité par exécution
  • Fidélité · couverture des citations
  • quality { overall: 100 }
Évaluation
  • Suites d'évaluation de référence comme portes de publication
  • Le taux de réussite alimente le score
  • Bloquez une régression avant le lancement
Laboratoire de simulation
  • Prompts et modèles en A/B
  • Simulations sur du trafic réel
  • Comparez avant de promouvoir
Score de fiabilité
  • 0–100, conditionne la publication (409)
  • Pondéré : succès · évaluation · incidents
  • Instantanés de tendance dans le temps
File d'amélioration
  • Les exécutions mal notées remontent
  • Tri → correction → réévaluation
  • Bouclez la boucle qualité
Débogueur d'agents
  • Trace complète de l'exécution, saut par saut
  • prompt → contexte → modèle → outils
  • Rejouez n'importe quelle exécution passée
Flux d'événements et alertes
  • Flux d'événements en direct de chaque exécution
  • Notifications en cas de dépassement de seuil
  • Reliez aux incidents et à la supervision
Comment ça fonctionne

D'une exécution isolée à un score qui conditionne la production.

Le score de fiabilité est un modèle de lecture construit sur des signaux que Cortex enregistre déjà — sa collecte ne coûte donc rien de plus, et il ne bloque jamais l'exploitation lorsque la notation est indisponible.

  1. 01

    Noter chaque exécution

    Chaque exécution gouvernée est notée sur la qualité — fidélité, couverture des citations, sûreté — et sa trace est capturée pour rejeu. quality { overall: 100 } signifie que la réponse tient face à sa source.

  2. 02

    Agréger en fiabilité

    La fiabilité par agent combine taux de succès (0,5), taux de réussite aux évaluations (0,3) et incidents (0,2) sur une fenêtre de 30 jours, en un score de 0–100 assorti d'un palier : excellent · bon · moyen · faible.

  3. 03

    Conditionner la publication

    Le registre refuse de publier un agent qui, avec suffisamment de signal, se situe sous le seuil — 409 RELIABILITY_TOO_LOW. Les nouveaux agents publient librement ; en cas de panne du scoring, le système reste ouvert.

La porte qui a des dents

Un seuil de fiabilité qui bloque réellement une mauvaise version.

La fiabilité n'est pas une métrique de façade affichée au mur. agent-registry-service.publish() consulte le score du runtime en direct et refuse la publication lorsqu'un agent dispose d'assez de signal et se situe sous RELIABILITY_MIN_PUBLISH (50 par défaut). Les agents récents ou peu documentés se publient librement ; si la notation est indisponible, le comportement bascule en autorisation par défaut — la disponibilité de la notation ne bloque jamais votre exploitation.

  • Publication refusée par 409 RELIABILITY_TOO_LOW lorsque le score passe sous le seuil
  • Signal suffisant = signal primaire + totalRuns ≥ 3 (configurable)
  • Instantanés de tendance à chaque score — suivez l'évolution de la qualité, pas une mesure isolée
Score de fiabilité/v1/reliability
96/ 100excellent
Taux de succèsw 0.5réussies / total (30 j)
Réussite aux évaluationsw 0.3suite best-effort
Incidentsw 0.2max(0, 1 − 0.25·open)
paliers : excellent ≥85 · bon ≥70 · moyen ≥50 · faible <50
Prouvez-le — ne vous contentez pas de l'affirmer

La démo que vous pouvez exécuter vous-même.

Interrogez la fiabilité d'un agent mal noté disposant d'assez d'exécutions, puis essayez de le publier. Le référentiel refuse avec 409 RELIABILITY_TOO_LOW — le même appel renvoie un score et une bande de fiabilité lisibles, à remettre à un relecteur.

Score de fiabilité/v1/reliability
96/ 100excellent
Taux de succèsw 0.5réussies / total (30 j)
Réussite aux évaluationsw 0.3suite best-effort
Incidentsw 0.2max(0, 1 − 0.25·open)
paliers : excellent ≥85 · bon ≥70 · moyen ≥50 · faible <50
Score faible → publication refusée409
Agent remboursementsscore 41 · 24 exécutions · suffisant
POST /v1/agents/<id>/publish
  ← 409 RELIABILITY_TOO_LOW
     score 41 < RELIABILITY_MIN_PUBLISH (50)

# les agents récents ou peu documentés publient librement ;
# une panne du scoring bascule en mode OPEN — ne bloque jamais l'exploitation
Corrigez les évaluations en échec, le score remonte, la porte s'ouvre — chaque changement fait l'objet d'un instantané
Trace d'exécution · #4471rejouable
01promptsha 0x3a… · 412 tokExécuté
02contexte5 fragments · sourcéExécuté
03modèleclaude-opus · 1.1sExécuté
04outilslookupCase · $0.004Exécuté
05approbationj.lee · versement ≥ $5kEn attente
06sortiegarde-fous ✓ · sourcéExécuté
chaque saut renvoie au Trust Ledger · total $0.012 · 3.0s
Débogage sur trace complète

Rejouez n'importe quelle exécution, saut par saut.

Quand une exécution dérape, vous ne devinez pas. Le débogueur d'agents reconstitue l'exécution entière — prompt, contexte récupéré, appel au modèle, chaque invocation d'outil, l'approbation et la sortie filtrée — chaque étape estampillée de son coût, de sa latence et de son verdict. Chaque saut renvoie au Trust Ledger : la trace que vous lisez est bien l'exécution qui a eu lieu.

  • Chronologie complète : prompt → contexte → modèle → outils → approbation → sortie
  • Coût, latence, tokens et verdict pass/hold/block à chaque saut
  • Rejouable depuis l'historique ; chaque étape renvoie au Trust Ledger
Fonctionne avec tout le runtime

L'observabilité se superpose à toutes les portes de contrôle.

Elle note, trace et filtre les mêmes exécutions gouvernées que vos agents empruntent déjà — ce que vous mesurez est donc la réalité, et ce que vous prouvez se rattache au registre.

Control Tower
  • Fiabilité de toute la flotte dans la vue d'ensemble
  • Score moyen · nombre sous le seuil
  • Mettez en pause un agent qui se dégrade en un clic
Trust Ledger
  • Chaque trace d'exécution est enregistrée
  • Chaînage par hachage, altération détectable
  • Les scores remontent aux exécutions qui les ont produits
Agent Studio
  • Porte de fiabilité à la publication
  • Testez en conversation avant de livrer
  • La file d'amélioration boucle la boucle
Supervision
  • Une baisse de score peut déclencher des modes plus stricts
  • Un plancher de risque qui ne peut que se resserrer
  • Les notifications se relient aux incidents
Sécurité et conformité

Conçu pour la revue de sécurité en entreprise.

Notation cadrée par locataire, disponibilité en autorisation par défaut, traces d'exécution à détection d'altération et porte de fiabilité à la publication — mises en correspondance avec les référentiels que vos auditeurs utilisent déjà.

SOC 2ISO 27001ISO 42001EU AI ActNIST AI RMFFINRA

Mesurez vos agents. Filtrez ce qui part en production.

Notez chaque exécution, rejouez n'importe laquelle et refusez une mauvaise version avant qu'elle n'atteigne la production — le tout depuis un seul plan d'observabilité.

Observabilité et monitoring des agents IA | Cortex AI OS