Puntuación de fiabilidad
Una puntuación de calidad de 0–100 por agente que decide qué versiones pueden publicarse.
categoría ▸ Operaciones
Puntuación de fiabilidad, en lenguaje llano.
Una puntuación de fiabilidad condensa la calidad medida de un agente en un único número comparable, para saber de un vistazo si el agente rinde bien y si es lo bastante bueno para publicarse. Se calcula a partir de señales que el entorno de ejecución ya recoge y no de una prueba puntual, lo que la convierte en una lectura viva en lugar de una etiqueta caduca.
El sentido de la puntuación es que sea accionable: en lugar de un gráfico que alguien mira de reojo, se convierte en una puerta. Un agente por debajo del umbral — con evidencia suficiente para juzgarlo con justicia — es rechazado al publicar, de modo que una regresión no puede colarse en producción en silencio.
Cómo lo implementa Cortex.
Aquí este término no es abstracto: se corresponde con una capacidad real del runtime. Esto es exactamente cómo Cortex lo aplica o se relaciona con él.
Cortex combina la tasa de éxito (0.5), la tasa de aprobación de evaluaciones (0.3) y los incidentes (0.2) sobre una ventana de 30 días en una puntuación de 0–100 con bandas: excelente ≥85, buena ≥70, aceptable ≥50, deficiente <50. Las instantáneas de tendencia registran cómo evoluciona la puntuación con el tiempo.
El registro se niega a publicar un agente que es suficiente (con bastante señal de ejecución) y puntúa por debajo de RELIABILITY_MIN_PUBLISH — devolviendo 409 RELIABILITY_TOO_LOW. Los agentes nuevos o con pocos datos se publican sin restricción, y una interrupción del cálculo falla abierta para que la disponibilidad nunca bloquee las operaciones.
Sigue ampliando el vocabulario.
Estos términos están junto a este en el modelo de IA gobernada: sigue el hilo para ver cómo se conectan los controles.
Suite de evaluaciones
Un conjunto de casos de prueba calificados que puntúa la calidad de un agente y protege los lanzamientos frente a regresiones.
Agent Studio
Donde se construyen, se prueban por chat y se publican los agentes gobernados — detrás de una puerta de fiabilidad.
Control Tower
La consola de operaciones en vivo de toda la flota de agentes: observar, controlar, pausar o detener.
Nivel de riesgo
Una clasificación de cuán consecuente es un agente o una acción, usada para fijar los controles que necesita.
Ve Puntuación de fiabilidad aplicado, no solo definido.
Únete a la lista de espera y observa cómo los controles de este glosario devuelven veredictos reales, sellan evidencia real y rastrean cada dato hasta su origen.