Suite d'évaluations
Un ensemble de cas de test notés qui mesurent la qualité d'un agent et protègent les mises en production des régressions.
catégorie ▸ Opérations
Suite d'évaluations, en langage clair.
Une suite d'évaluations est à un agent d'IA ce qu'une suite de tests est à un logiciel ordinaire : un ensemble choisi de cas aux résultats attendus connus, exécuté automatiquement pour mesurer la qualité et détecter les régressions avant la mise en production. Pour les agents, les évals notent généralement des dimensions comme la fidélité à la source, la couverture des citations et la sûreté, et pas seulement l'exactitude au mot près.
Les évals sont ce qui empêche la qualité d'une IA de rester une affaire d'opinion. Une démo réussie ne prouve rien sur les mille exécutions suivantes ; une suite d'évaluations passée avec succès, exécutée comme point de contrôle de mise en production, donne une base défendable et reproductible pour affirmer qu'un agent est prêt.
Comment Cortex l'implémente.
Ici, ce terme n'a rien d'abstrait : il correspond à une capacité réelle du runtime. Voici exactement comment Cortex l'applique ou s'y rattache.
Cortex exécute des suites d'évals de référence comme points de contrôle de mise en production et note la qualité de chaque exécution — fidélité, couverture des citations et sûreté — les exécutions en direct renvoyant une lecture quality { overall } qui remonte jusqu'à l'exécution qui l'a produite. Un laboratoire de simulation permet de comparer prompts et modèles en A/B sur du trafic réel avant de promouvoir un changement.
Le taux de réussite aux évals alimente le score de fiabilité : des évals en échec ne s'affichent donc pas seulement sur un graphique — elles tirent le score vers le bas et peuvent retenir une mise en production au point de contrôle de publication.
Continuez à enrichir le vocabulaire.
Ces termes voisinent celui-ci dans le modèle d'IA gouvernée — suivez le fil pour voir comment les contrôles s'articulent.
Score de fiabilité
Un score de qualité de 0–100 par agent qui détermine quelles versions ont le droit d'être publiées.
Agent Studio
L'endroit où les agents gouvernés sont construits, testés en conversation et publiés — derrière un point de contrôle de fiabilité.
Policy-as-Code
Des règles de gouvernance écrites sous forme de code testable et versionné, appliqué directement par le runtime.
Control Tower
La console d'exploitation en temps réel de toute la flotte d'agents — observer, filtrer, mettre en pause ou arrêter.
Voyez Suite d'évaluations appliqué, pas seulement défini.
Inscrivez-vous sur la liste d'attente et voyez les contrôles de ce glossaire renvoyer de vrais verdicts, sceller de vraies preuves et remonter chaque fait jusqu'à sa source.