- ライブ実行 · レイテンシー · コスト · トークン
- エラーと失敗率(30日)
- エージェント · モデル · ツール別
すべてのエージェント実行を可視化し、採点し、品質を証明する。
Cortex Observability は、統制されたすべての実行をエンドツーエンドで監視します — モニタリング、実行単位の品質スコアリング、リリース用の評価ゲート、シミュレーションラボ、本番公開をゲートする信頼性スコア、改善キュー、フルトレースのエージェントデバッガー、イベントストリーム、通知。ライブ実行は quality { overall: 100 } を返し、その数値は、それを生んだ実行までさかのぼれます。
実行単位のスコアリング · 評価ゲート · 信頼性ゲート · 完全な再生
測れないものは、統制できない。
多くのチームは雰囲気でエージェントを出荷します — うまくいったデモ、期待を込めたプロンプト、そして実務に投入したあと品質が保たれたかどうかは分からないまま。実行単位のスコアリング、評価ゲート、公開時の信頼性基準がなければ、リグレッションは静かに本番へ流れ、気づかせてくれるのはダッシュボードではなく顧客です。オブザーバビリティは、エージェントの品質を、監視でき、ゲートにでき、監査人に示せる数値に変えます。
すべての実行を観測し、評価し、改善する9つの手段。
Cortex がすでに収集しているシグナルの上に載る、1つのツールキット — 単一実行のトレースから、何を出荷するかを決める全社規模の信頼性基準まで。
- 実行単位の品質スコアリング
- 忠実性 · 引用カバー率
- quality { overall: 100 }
- ゴールド評価スイートをリリースゲートに
- 合格率がスコアに反映
- リグレッションをリリース前にブロック
- プロンプトとモデルの A/B
- 実トラフィックでの What-if 検証
- 昇格前に比較
- 0–100 で公開をゲート(409)
- 加重: 成功 · 評価 · インシデント
- 推移のスナップショットを時系列で
- 低スコアの実行を抽出
- トリアージ → 修正 → 再評価
- 品質のループを閉じる
- 実行の全トレースをホップ単位で
- プロンプト → コンテキスト → モデル → ツール
- 過去のどの実行も再生
- 全実行のライブイベントフィード
- しきい値超過時に通知
- インシデントと人的監督に連携
1件の実行から、本番出荷を左右する1つの数値へ。
信頼性スコアは、Cortex がすでに記録しているシグナルに対するリードモデルです。追加の収集コストはかからず、スコアリングが利用できないときも運用を止めることはありません。
- 01
すべての実行を採点
統制された各実行は品質 — 忠実性、引用カバー率、安全性 — で採点され、リプレイ用にトレースが記録されます。quality { overall: 100 } は、回答が出典に照らして成立したことを意味します。
- 02
信頼性スコアへ集約
エージェント単位の信頼性は、30日間の成功率(0.5)、評価合格率(0.3)、インシデント(0.2)を合成して 0–100 のスコアとバンド(excellent · good · fair · poor)にまとめます。
- 03
公開をゲートで制御
十分なシグナルがありながら基準を下回るエージェントは、レジストリが公開を拒否します — 409 RELIABILITY_TOO_LOW。新規エージェントは自由に公開でき、スコアリングの停止時はフェイルオープンします。
不良リリースを実際に止める、信頼性の基準。
信頼性は、壁のグラフに飾るための見栄えの指標ではありません。agent-registry-service.publish() はライブのランタイムスコアを参照し、十分なシグナルがありながらスコアが RELIABILITY_MIN_PUBLISH(既定 50)を下回るエージェントの公開を拒否します。新規およびデータの少ないエージェントは自由に公開できます。スコアリングが利用できない場合はフェイルオープンし、スコアリングの可用性が運用を止めることはありません。
- スコアが基準を下回ると 409 RELIABILITY_TOO_LOW で公開を拒否
- 「十分」= 主シグナル + totalRuns ≥ 3(設定可能)
- スコアごとに推移スナップショット — 単発の数値ではなく、品質の動きを追える
自分の手で試せるデモ。
十分な実行数がありながらスコアの低いエージェントの信頼性を照会し、そのうえで公開を試みてください。レジストリは 409 RELIABILITY_TOO_LOW で拒否します — 同じ呼び出しが、レビュー担当者にそのまま渡せる明快なスコアとバンドを返します。
どの実行も、ホップ単位で再生。
実行がおかしな挙動を示したとき、推測は要りません。エージェントデバッガーは実行全体を再構成します — プロンプト、取得したコンテキスト、モデル呼び出し、すべてのツール呼び出し、承認、ガード後の出力 — 各ステップにコスト、レイテンシー、判定が刻まれます。すべてのホップは Trust Ledger にリンクするため、読んでいるトレースは実際に起きた実行そのものです。
- 完全なタイムライン: プロンプト → コンテキスト → モデル → ツール → 承認 → 出力
- ホップごとのコスト、レイテンシー、トークン、および pass/hold/block の判定
- 履歴から再生可能。すべてのステップの追跡先は Trust Ledger
オブザーバビリティは、すべてのゲートの上に載る。
採点、トレース、ゲーティングの対象は、エージェントがすでに通過している統制下の実行そのものです — 測るものは本物であり、証明したことは台帳に紐づきます。
エンタープライズのセキュリティレビューを見据えた設計。
テナント単位のスコアリング、可用性に対するフェイルオープン、改ざん検知可能な実行トレース、公開時の信頼性ゲート — 監査人がすでに用いるフレームワークにマッピングされています。
エージェントを測る。出荷をゲートする。
すべての実行を採点し、どれでも再生し、不良リリースが本番に届く前に拒否する — すべては1つのオブザーバビリティ面から。