- Ejecuciones en vivo · latencia · coste · tokens
- Errores y tasa de fallos (30 d)
- Por agente, modelo y herramienta
Observa, puntúa y demuestra la calidad de cada ejecución.
Cortex Observability vigila de extremo a extremo cada ejecución gobernada — monitoreo, puntuación de calidad por ejecución, compuertas de evaluación para cada versión, un laboratorio de simulación, una puntuación de fiabilidad que controla la publicación en producción, una cola de mejoras, un depurador de agentes con traza completa, un flujo de eventos y notificaciones. Las ejecuciones en vivo devuelven quality { overall: 100 } — y los números se remontan a la ejecución que los generó.
Puntuación por ejecución · compuertas de evaluación · compuerta de fiabilidad · reproducción completa
No puedes gobernar lo que no puedes medir.
La mayoría de los equipos lanza agentes por intuición — una demo que sale bien, un prompt esperanzador y ninguna idea de si la calidad se mantuvo al llegar al trabajo real. Sin puntuación por ejecución, compuertas de evaluación y un umbral de fiabilidad al publicar, una regresión llega a producción en silencio y te enteras por el cliente, no por el panel. La observabilidad convierte la calidad de los agentes en un número que puedes vigilar, usar como compuerta y poner delante de un auditor.
Nueve formas de observar, evaluar y mejorar cada ejecución.
Un único conjunto de herramientas sobre las señales que Cortex ya recopila — desde la traza de una sola ejecución hasta un umbral de fiabilidad para toda la flota que decide qué se publica.
- Puntuación de calidad por ejecución
- Fidelidad · cobertura de citas
- quality { overall: 100 }
- Suites de evaluación de referencia como compuertas de versión
- La tasa de aprobación alimenta la puntuación
- Bloquea una regresión antes del lanzamiento
- Prompts y modelos en A/B
- Escenarios hipotéticos sobre tráfico real
- Compara antes de promover
- 0–100, controla la publicación (409)
- Ponderado: éxito · evaluación · incidentes
- Instantáneas de tendencia a lo largo del tiempo
- Las ejecuciones con baja puntuación salen a la superficie
- Triaje → corrección → reevaluación
- Cierra el ciclo de calidad
- Traza completa de la ejecución, salto a salto
- prompt → contexto → modelo → herramientas
- Reproduce cualquier ejecución histórica
- Flujo de eventos en vivo de cada ejecución
- Notificaciones al superar un umbral
- Conecta con incidentes y supervisión
De una sola ejecución a un número que controla el paso a producción.
La puntuación de fiabilidad es un modelo de lectura sobre señales que Cortex ya registra — así que no cuesta nada adicional recopilarla y nunca bloquea las operaciones cuando la puntuación no está disponible.
- 01
Puntuar cada ejecución
Cada ejecución gobernada se puntúa por calidad — fidelidad, cobertura de citas, seguridad — y se captura la traza para reproducirla. quality { overall: 100 } significa que la respuesta se sostuvo frente a su fuente.
- 02
Consolidar en fiabilidad
La fiabilidad por agente combina la tasa de éxito (0.5), la tasa de aprobación de evaluaciones (0.3) y los incidentes (0.2) en una ventana de 30 días para dar una puntuación de 0–100 con una banda: excelente · bueno · aceptable · deficiente.
- 03
Controlar la publicación
El registro se niega a publicar un agente que tiene señal suficiente y puntúa por debajo del umbral — 409 RELIABILITY_TOO_LOW. Los agentes nuevos se publican sin restricción; si el servicio de puntuación cae, se falla en abierto.
Un umbral de fiabilidad que de verdad detiene una mala versión.
La fiabilidad no es una métrica de vanidad en un panel decorativo. agent-registry-service.publish() consulta la puntuación en vivo del entorno de ejecución y se niega a publicar cuando un agente tiene señal suficiente y puntúa por debajo de RELIABILITY_MIN_PUBLISH (50 por defecto). Los agentes nuevos y con pocos datos se publican sin restricción; si la puntuación no está disponible, falla en modo abierto — la disponibilidad de la puntuación nunca bloquea tus operaciones.
- Publicación rechazada con 409 RELIABILITY_TOO_LOW cuando la puntuación queda por debajo del umbral
- Suficiente = señal primaria + totalRuns ≥ 3 (configurable)
- Instantáneas de tendencia en cada puntuación — observa cómo se mueve la calidad, no una sola lectura
La demo que puedes ejecutar tú mismo.
Consulta la fiabilidad de un agente con baja puntuación y suficientes ejecuciones y luego intenta publicarlo. El registro lo rechaza con 409 RELIABILITY_TOO_LOW — la misma llamada devuelve una puntuación y una banda claras que puedes entregar a un revisor.
Reproduce cualquier ejecución, salto a salto.
Cuando una ejecución se descarrila, no adivinas. El depurador de agentes reconstruye la ejecución completa — el prompt, el contexto recuperado, la llamada al modelo, cada invocación de herramienta, la aprobación y la salida protegida — con cada paso sellado con su coste, su latencia y su veredicto. Cada salto enlaza con el trust ledger, de modo que la traza que lees es la ejecución que realmente ocurrió.
- Línea de tiempo completa: prompt → contexto → modelo → herramientas → aprobación → salida
- Coste, latencia, tokens y veredicto pass/hold/block en cada salto
- Reproducible desde el historial; cada paso se remonta al Trust Ledger
La observabilidad se apoya en todas las compuertas.
Puntúa, traza y controla las mismas ejecuciones gobernadas por las que ya pasan tus agentes — así, lo que mides es lo real y lo que demuestras se remonta al registro.
- Fiabilidad de toda la flota en la vista general
- Puntuación media · nº por debajo del umbral
- Pausa con un clic un agente que se degrada
- Cada traza de ejecución queda registrada
- Encadenado por hash, a prueba de manipulaciones
- Las puntuaciones se remontan a las ejecuciones que las generaron
- Compuerta de fiabilidad al publicar
- Prueba en chat antes de lanzar
- La cola de mejoras cierra el ciclo
- Las caídas de puntuación pueden activar modos más estrictos
- Un mínimo de riesgo que solo puede endurecerse
- Las notificaciones se conectan con incidentes
Diseñado para la revisión de seguridad empresarial.
Puntuación acotada por inquilino, disponibilidad que no bloquea ante fallos, trazas de ejecución a prueba de manipulaciones y una compuerta de fiabilidad al publicar — todo mapeado a los marcos que tus auditores ya utilizan.
Mide tus agentes. Controla lo que se publica.
Puntúa cada ejecución, reproduce cualquiera de ellas y rechaza una mala versión antes de que llegue a producción — todo desde un único plano de observabilidad.