Observa cada ejecución

Observa, puntúa y demuestra la calidad de cada ejecución.

Cortex Observability vigila de extremo a extremo cada ejecución gobernada — monitoreo, puntuación de calidad por ejecución, compuertas de evaluación para cada versión, un laboratorio de simulación, una puntuación de fiabilidad que controla la publicación en producción, una cola de mejoras, un depurador de agentes con traza completa, un flujo de eventos y notificaciones. Las ejecuciones en vivo devuelven quality { overall: 100 } — y los números se remontan a la ejecución que los generó.

Puntuación por ejecución · compuertas de evaluación · compuerta de fiabilidad · reproducción completa

Observability
latencia (ms)
Fidelidad
0.98
Cob. de citas
0.95
Seguridad
1.00
promptcontextomodeloherramientasaprobaciónsalida
ai-insights ▸ calidad { overall: 100 }
El problema

No puedes gobernar lo que no puedes medir.

La mayoría de los equipos lanza agentes por intuición — una demo que sale bien, un prompt esperanzador y ninguna idea de si la calidad se mantuvo al llegar al trabajo real. Sin puntuación por ejecución, compuertas de evaluación y un umbral de fiabilidad al publicar, una regresión llega a producción en silencio y te enteras por el cliente, no por el panel. La observabilidad convierte la calidad de los agentes en un número que puedes vigilar, usar como compuerta y poner delante de un auditor.

La fiabilidad es una compuerta, no un gráfico — un agente con baja puntuación es rechazado al publicar409 RELIABILITY_TOO_LOW
El stack de observabilidad completo

Nueve formas de observar, evaluar y mejorar cada ejecución.

Un único conjunto de herramientas sobre las señales que Cortex ya recopila — desde la traza de una sola ejecución hasta un umbral de fiabilidad para toda la flota que decide qué se publica.

Monitoreo
  • Ejecuciones en vivo · latencia · coste · tokens
  • Errores y tasa de fallos (30 d)
  • Por agente, modelo y herramienta
Insights de IA
  • Puntuación de calidad por ejecución
  • Fidelidad · cobertura de citas
  • quality { overall: 100 }
Evaluación
  • Suites de evaluación de referencia como compuertas de versión
  • La tasa de aprobación alimenta la puntuación
  • Bloquea una regresión antes del lanzamiento
Laboratorio de simulación
  • Prompts y modelos en A/B
  • Escenarios hipotéticos sobre tráfico real
  • Compara antes de promover
Puntuación de fiabilidad
  • 0–100, controla la publicación (409)
  • Ponderado: éxito · evaluación · incidentes
  • Instantáneas de tendencia a lo largo del tiempo
Cola de mejoras
  • Las ejecuciones con baja puntuación salen a la superficie
  • Triaje → corrección → reevaluación
  • Cierra el ciclo de calidad
Depurador de agentes
  • Traza completa de la ejecución, salto a salto
  • prompt → contexto → modelo → herramientas
  • Reproduce cualquier ejecución histórica
Flujo de eventos y alertas
  • Flujo de eventos en vivo de cada ejecución
  • Notificaciones al superar un umbral
  • Conecta con incidentes y supervisión
Cómo funciona

De una sola ejecución a un número que controla el paso a producción.

La puntuación de fiabilidad es un modelo de lectura sobre señales que Cortex ya registra — así que no cuesta nada adicional recopilarla y nunca bloquea las operaciones cuando la puntuación no está disponible.

  1. 01

    Puntuar cada ejecución

    Cada ejecución gobernada se puntúa por calidad — fidelidad, cobertura de citas, seguridad — y se captura la traza para reproducirla. quality { overall: 100 } significa que la respuesta se sostuvo frente a su fuente.

  2. 02

    Consolidar en fiabilidad

    La fiabilidad por agente combina la tasa de éxito (0.5), la tasa de aprobación de evaluaciones (0.3) y los incidentes (0.2) en una ventana de 30 días para dar una puntuación de 0–100 con una banda: excelente · bueno · aceptable · deficiente.

  3. 03

    Controlar la publicación

    El registro se niega a publicar un agente que tiene señal suficiente y puntúa por debajo del umbral — 409 RELIABILITY_TOO_LOW. Los agentes nuevos se publican sin restricción; si el servicio de puntuación cae, se falla en abierto.

La compuerta que sí muerde

Un umbral de fiabilidad que de verdad detiene una mala versión.

La fiabilidad no es una métrica de vanidad en un panel decorativo. agent-registry-service.publish() consulta la puntuación en vivo del entorno de ejecución y se niega a publicar cuando un agente tiene señal suficiente y puntúa por debajo de RELIABILITY_MIN_PUBLISH (50 por defecto). Los agentes nuevos y con pocos datos se publican sin restricción; si la puntuación no está disponible, falla en modo abierto — la disponibilidad de la puntuación nunca bloquea tus operaciones.

  • Publicación rechazada con 409 RELIABILITY_TOO_LOW cuando la puntuación queda por debajo del umbral
  • Suficiente = señal primaria + totalRuns ≥ 3 (configurable)
  • Instantáneas de tendencia en cada puntuación — observa cómo se mueve la calidad, no una sola lectura
Puntuación de fiabilidad/v1/reliability
96/ 100excelente
Tasa de éxitow 0.5correctas / total (30 d)
Aprobación de evaluacionesw 0.3suite best-effort
Incidentesw 0.2max(0, 1 − 0.25·open)
bandas: excelente ≥85 · bueno ≥70 · aceptable ≥50 · deficiente <50
Demuéstralo — no te limites a afirmarlo

La demo que puedes ejecutar tú mismo.

Consulta la fiabilidad de un agente con baja puntuación y suficientes ejecuciones y luego intenta publicarlo. El registro lo rechaza con 409 RELIABILITY_TOO_LOW — la misma llamada devuelve una puntuación y una banda claras que puedes entregar a un revisor.

Puntuación de fiabilidad/v1/reliability
96/ 100excelente
Tasa de éxitow 0.5correctas / total (30 d)
Aprobación de evaluacionesw 0.3suite best-effort
Incidentesw 0.2max(0, 1 − 0.25·open)
bandas: excelente ≥85 · bueno ≥70 · aceptable ≥50 · deficiente <50
Puntuación baja → publicación rechazada409
Gestor de reembolsospuntuación 41 · 24 ejecuciones · suficiente
POST /v1/agents/<id>/publish
  ← 409 RELIABILITY_TOO_LOW
     score 41 < RELIABILITY_MIN_PUBLISH (50)

# los agentes nuevos o con pocos datos publican sin restricción;
# una caída del scoring falla en modo OPEN: nunca bloquea las operaciones
Corrige las evaluaciones que fallan, la puntuación se recupera y la compuerta se abre — cada cambio queda en una instantánea
Traza de ejecución · #4471reproducible
01promptsha 0x3a… · 412 tokEjecutado
02contexto5 fragmentos · fundamentadoEjecutado
03modeloclaude-opus · 1.1sEjecutado
04herramientaslookupCase · $0.004Ejecutado
05aprobaciónj.lee · pago ≥ $5kEn espera
06salidaguardrails ✓ · con citaEjecutado
cada salto se remonta al Trust Ledger · total $0.012 · 3.0s
Depuración con traza completa

Reproduce cualquier ejecución, salto a salto.

Cuando una ejecución se descarrila, no adivinas. El depurador de agentes reconstruye la ejecución completa — el prompt, el contexto recuperado, la llamada al modelo, cada invocación de herramienta, la aprobación y la salida protegida — con cada paso sellado con su coste, su latencia y su veredicto. Cada salto enlaza con el trust ledger, de modo que la traza que lees es la ejecución que realmente ocurrió.

  • Línea de tiempo completa: prompt → contexto → modelo → herramientas → aprobación → salida
  • Coste, latencia, tokens y veredicto pass/hold/block en cada salto
  • Reproducible desde el historial; cada paso se remonta al Trust Ledger
Funciona con todo el entorno de ejecución

La observabilidad se apoya en todas las compuertas.

Puntúa, traza y controla las mismas ejecuciones gobernadas por las que ya pasan tus agentes — así, lo que mides es lo real y lo que demuestras se remonta al registro.

Control Tower
  • Fiabilidad de toda la flota en la vista general
  • Puntuación media · nº por debajo del umbral
  • Pausa con un clic un agente que se degrada
Trust Ledger
  • Cada traza de ejecución queda registrada
  • Encadenado por hash, a prueba de manipulaciones
  • Las puntuaciones se remontan a las ejecuciones que las generaron
Agent Studio
  • Compuerta de fiabilidad al publicar
  • Prueba en chat antes de lanzar
  • La cola de mejoras cierra el ciclo
Supervisión
  • Las caídas de puntuación pueden activar modos más estrictos
  • Un mínimo de riesgo que solo puede endurecerse
  • Las notificaciones se conectan con incidentes
Seguridad y cumplimiento

Diseñado para la revisión de seguridad empresarial.

Puntuación acotada por inquilino, disponibilidad que no bloquea ante fallos, trazas de ejecución a prueba de manipulaciones y una compuerta de fiabilidad al publicar — todo mapeado a los marcos que tus auditores ya utilizan.

SOC 2ISO 27001ISO 42001EU AI ActNIST AI RMFFINRA

Mide tus agentes. Controla lo que se publica.

Puntúa cada ejecución, reproduce cualquiera de ellas y rechaza una mala versión antes de que llegue a producción — todo desde un único plano de observabilidad.

Observabilidad y monitoreo de agentes de IA | Cortex AI OS