Suite de evaluaciones
Un conjunto de casos de prueba calificados que puntúa la calidad de un agente y protege los lanzamientos frente a regresiones.
categoría ▸ Operaciones
Suite de evaluaciones, en lenguaje llano.
Una suite de evaluaciones es para un agente de IA lo que una suite de pruebas es para el software convencional: un conjunto curado de casos con expectativas conocidas, ejecutado automáticamente para medir la calidad y detectar regresiones antes de publicar. Para los agentes, las evaluaciones suelen calificar dimensiones como la fidelidad a la fuente, la cobertura de citas y la seguridad, no solo la corrección por coincidencia exacta.
Las evaluaciones son la forma en que la calidad de la IA deja de ser cuestión de opinión. Una demostración exitosa no prueba nada sobre las siguientes mil ejecuciones; una suite de evaluaciones aprobada, ejecutada como puerta de lanzamiento, da una base defendible y repetible para afirmar que un agente está listo.
Cómo lo implementa Cortex.
Aquí este término no es abstracto: se corresponde con una capacidad real del runtime. Esto es exactamente cómo Cortex lo aplica o se relaciona con él.
Cortex ejecuta suites de evaluación gold como puertas de lanzamiento y puntúa la calidad en cada ejecución — fidelidad, cobertura de citas y seguridad — y las ejecuciones en vivo devuelven una lectura quality { overall } que se remonta a la ejecución que la produjo. Un laboratorio de simulación permite hacer A/B de prompts y modelos sobre tráfico real antes de promover un cambio.
La tasa de aprobación de evaluaciones alimenta la puntuación de fiabilidad, de modo que las evaluaciones fallidas no solo aparecen en un gráfico: bajan la puntuación y pueden retener un lanzamiento en la puerta de publicación.
Sigue ampliando el vocabulario.
Estos términos están junto a este en el modelo de IA gobernada: sigue el hilo para ver cómo se conectan los controles.
Puntuación de fiabilidad
Una puntuación de calidad de 0–100 por agente que decide qué versiones pueden publicarse.
Agent Studio
Donde se construyen, se prueban por chat y se publican los agentes gobernados — detrás de una puerta de fiabilidad.
Policy-as-Code
Reglas de gobernanza escritas como código comprobable y versionado que el entorno de ejecución aplica directamente.
Control Tower
La consola de operaciones en vivo de toda la flota de agentes: observar, controlar, pausar o detener.
Ve Suite de evaluaciones aplicado, no solo definido.
Únete a la lista de espera y observa cómo los controles de este glosario devuelven veredictos reales, sellan evidencia real y rastrean cada dato hasta su origen.