Score de fiabilité
Un score de qualité de 0–100 par agent qui détermine quelles versions ont le droit d'être publiées.
catégorie ▸ Opérations
Score de fiabilité, en langage clair.
Un score de fiabilité condense la qualité mesurée d'un agent en un seul nombre comparable, pour dire d'un coup d'œil si un agent se comporte bien et s'il est assez bon pour être livré. Il est calculé à partir de signaux que le runtime collecte déjà plutôt qu'à partir d'un benchmark ponctuel, ce qui en fait une lecture vivante plutôt qu'une étiquette périmée.
Tout l'intérêt du score est de le rendre actionnable : au lieu d'un graphique que quelqu'un consulte distraitement, il devient un point de contrôle. Un agent sous le seuil — avec assez de données pour le juger équitablement — est refusé à la publication, si bien qu'une régression ne peut pas se glisser en production en silence.
Comment Cortex l'implémente.
Ici, ce terme n'a rien d'abstrait : il correspond à une capacité réelle du runtime. Voici exactement comment Cortex l'applique ou s'y rattache.
Cortex combine le taux de réussite (0,5), le taux de réussite aux évals (0,3) et les incidents (0,2) sur une fenêtre de 30 jours en un score de 0–100 avec des paliers : excellent ≥85, bon ≥70, correct ≥50, faible <50. Des instantanés de tendance enregistrent l'évolution du score dans le temps.
Le registre refuse de publier un agent jugé suffisamment documenté (assez de signal d'exécution) et dont le score est inférieur à RELIABILITY_MIN_PUBLISH — en renvoyant 409 RELIABILITY_TOO_LOW. Les agents nouveaux ou peu documentés se publient librement, et une panne du calcul de score bascule en fail-open pour que la disponibilité ne bloque jamais les opérations.
Continuez à enrichir le vocabulaire.
Ces termes voisinent celui-ci dans le modèle d'IA gouvernée — suivez le fil pour voir comment les contrôles s'articulent.
Suite d'évaluations
Un ensemble de cas de test notés qui mesurent la qualité d'un agent et protègent les mises en production des régressions.
Agent Studio
L'endroit où les agents gouvernés sont construits, testés en conversation et publiés — derrière un point de contrôle de fiabilité.
Control Tower
La console d'exploitation en temps réel de toute la flotte d'agents — observer, filtrer, mettre en pause ou arrêter.
Niveau de risque
Une classification du caractère conséquent d'un agent ou d'une action, qui détermine les contrôles nécessaires.
Voyez Score de fiabilité appliqué, pas seulement défini.
Inscrivez-vous sur la liste d'attente et voyez les contrôles de ce glossaire renvoyer de vrais verdicts, sceller de vraies preuves et remonter chaque fait jusqu'à sa source.