すべての実行を観測

すべてのエージェント実行を可視化し、採点し、品質を証明する

Cortex Observability は、統制されたすべての実行をエンドツーエンドで監視します — モニタリング、実行単位の品質スコアリング、リリース用の評価ゲート、シミュレーションラボ、本番公開をゲートする信頼性スコア、改善キュー、フルトレースのエージェントデバッガー、イベントストリーム、通知。ライブ実行は quality { overall: 100 } を返し、その数値は、それを生んだ実行までさかのぼれます。

実行単位のスコアリング · 評価ゲート · 信頼性ゲート · 完全な再生

Observability
レイテンシ (ms)
忠実性
0.98
引用カバー率
0.95
安全性
1.00
プロンプトコンテキストモデルツール承認出力
ai-insights ▸ 品質 { overall: 100 }
課題

測れないものは、統制できない。

多くのチームは雰囲気でエージェントを出荷します — うまくいったデモ、期待を込めたプロンプト、そして実務に投入したあと品質が保たれたかどうかは分からないまま。実行単位のスコアリング、評価ゲート、公開時の信頼性基準がなければ、リグレッションは静かに本番へ流れ、気づかせてくれるのはダッシュボードではなく顧客です。オブザーバビリティは、エージェントの品質を、監視でき、ゲートにでき、監査人に示せる数値に変えます。

信頼性はグラフではなくゲート — スコアの低いエージェントは公開時に拒否されます409 RELIABILITY_TOO_LOW
オブザーバビリティスタック全体

すべての実行を観測し、評価し、改善する9つの手段。

Cortex がすでに収集しているシグナルの上に載る、1つのツールキット — 単一実行のトレースから、何を出荷するかを決める全社規模の信頼性基準まで。

モニタリング
  • ライブ実行 · レイテンシー · コスト · トークン
  • エラーと失敗率(30日)
  • エージェント · モデル · ツール別
AI インサイト
  • 実行単位の品質スコアリング
  • 忠実性 · 引用カバー率
  • quality { overall: 100 }
評価
  • ゴールド評価スイートをリリースゲートに
  • 合格率がスコアに反映
  • リグレッションをリリース前にブロック
シミュレーションラボ
  • プロンプトとモデルの A/B
  • 実トラフィックでの What-if 検証
  • 昇格前に比較
信頼性スコア
  • 0–100 で公開をゲート(409
  • 加重: 成功 · 評価 · インシデント
  • 推移のスナップショットを時系列で
改善キュー
  • 低スコアの実行を抽出
  • トリアージ → 修正 → 再評価
  • 品質のループを閉じる
エージェントデバッガー
  • 実行の全トレースをホップ単位で
  • プロンプト → コンテキスト → モデル → ツール
  • 過去のどの実行も再生
イベントストリームとアラート
  • 全実行のライブイベントフィード
  • しきい値超過時に通知
  • インシデントと人的監督に連携
仕組み

1件の実行から、本番出荷を左右する1つの数値へ。

信頼性スコアは、Cortex がすでに記録しているシグナルに対するリードモデルです。追加の収集コストはかからず、スコアリングが利用できないときも運用を止めることはありません。

  1. 01

    すべての実行を採点

    統制された各実行は品質 — 忠実性、引用カバー率、安全性 — で採点され、リプレイ用にトレースが記録されます。quality { overall: 100 } は、回答が出典に照らして成立したことを意味します。

  2. 02

    信頼性スコアへ集約

    エージェント単位の信頼性は、30日間の成功率(0.5)、評価合格率(0.3)、インシデント(0.2)を合成して 0–100 のスコアとバンド(excellent · good · fair · poor)にまとめます。

  3. 03

    公開をゲートで制御

    十分なシグナルがありながら基準を下回るエージェントは、レジストリが公開を拒否します — 409 RELIABILITY_TOO_LOW。新規エージェントは自由に公開でき、スコアリングの停止時はフェイルオープンします。

実効性のあるゲート

不良リリースを実際に止める、信頼性の基準。

信頼性は、壁のグラフに飾るための見栄えの指標ではありません。agent-registry-service.publish() はライブのランタイムスコアを参照し、十分なシグナルがありながらスコアが RELIABILITY_MIN_PUBLISH(既定 50)を下回るエージェントの公開を拒否します。新規およびデータの少ないエージェントは自由に公開できます。スコアリングが利用できない場合はフェイルオープンし、スコアリングの可用性が運用を止めることはありません。

  • スコアが基準を下回ると 409 RELIABILITY_TOO_LOW で公開を拒否
  • 「十分」= 主シグナル + totalRuns ≥ 3(設定可能)
  • スコアごとに推移スナップショット — 単発の数値ではなく、品質の動きを追える
信頼性スコア/v1/reliability
96/ 100excellent
成功率w 0.5成功数 / 総数(30日)
評価合格率w 0.3ベストエフォートのスイート
インシデントw 0.2max(0, 1 − 0.25·open)
バンド: excellent ≥85 · good ≥70 · fair ≥50 · poor <50
主張ではなく、証明を

自分の手で試せるデモ。

十分な実行数がありながらスコアの低いエージェントの信頼性を照会し、そのうえで公開を試みてください。レジストリは 409 RELIABILITY_TOO_LOW で拒否します — 同じ呼び出しが、レビュー担当者にそのまま渡せる明快なスコアとバンドを返します。

信頼性スコア/v1/reliability
96/ 100excellent
成功率w 0.5成功数 / 総数(30日)
評価合格率w 0.3ベストエフォートのスイート
インシデントw 0.2max(0, 1 − 0.25·open)
バンド: excellent ≥85 · good ≥70 · fair ≥50 · poor <50
低スコア → 公開を拒否409
返金リゾルバースコア 41 · 24 実行 · 十分
POST /v1/agents/<id>/publish
  ← 409 RELIABILITY_TOO_LOW
     score 41 < RELIABILITY_MIN_PUBLISH (50)

# 新規・データの少ないエージェントは制限なく公開できます。
# スコアリング障害時は OPEN でフェイルし、運用を止めません
失敗した評価を直せばスコアは回復し、ゲートが開きます — 変更はすべてスナップショットに記録
実行トレース · #4471再生可能
01プロンプトsha 0x3a… · 412 tok実行済み
02コンテキスト5 チャンク · 根拠あり実行済み
03モデルclaude-opus · 1.1s実行済み
04ツールlookupCase · $0.004実行済み
05承認j.lee · 支払 ≥ $5k保留
06出力ガードレール ✓ · 出典あり実行済み
すべてのホップが Trust Ledger に紐づく · 合計 $0.012 · 3.0s
フルトレースのデバッグ

どの実行も、ホップ単位で再生。

実行がおかしな挙動を示したとき、推測は要りません。エージェントデバッガーは実行全体を再構成します — プロンプト、取得したコンテキスト、モデル呼び出し、すべてのツール呼び出し、承認、ガード後の出力 — 各ステップにコスト、レイテンシー、判定が刻まれます。すべてのホップは Trust Ledger にリンクするため、読んでいるトレースは実際に起きた実行そのものです。

  • 完全なタイムライン: プロンプト → コンテキスト → モデル → ツール → 承認 → 出力
  • ホップごとのコスト、レイテンシー、トークン、および pass/hold/block の判定
  • 履歴から再生可能。すべてのステップの追跡先は Trust Ledger
ランタイム全体と連携

オブザーバビリティは、すべてのゲートの上に載る。

採点、トレース、ゲーティングの対象は、エージェントがすでに通過している統制下の実行そのものです — 測るものは本物であり、証明したことは台帳に紐づきます。

Control Tower
  • フリート全体の信頼性を確認: 概要
  • 平均スコア · しきい値未満の件数
  • 劣化したエージェントをワンクリックで一時停止
Trust Ledger
  • すべての実行トレースを 記録
  • ハッシュ連鎖で改ざん検知可能
  • スコアは、それを生んだ実行までたどれる
Agent Studio
  • 信頼性ゲートが効くのは 公開時
  • 出荷前にチャットでテスト
  • 改善キューがループを閉じる
人的監督
  • スコア低下をきっかけに発動: より厳格なモード
  • リスク下限は厳しくする方向にのみ変更可
  • 通知はインシデントに連携
セキュリティとコンプライアンス

エンタープライズのセキュリティレビューを見据えた設計。

テナント単位のスコアリング、可用性に対するフェイルオープン、改ざん検知可能な実行トレース、公開時の信頼性ゲート — 監査人がすでに用いるフレームワークにマッピングされています。

SOC 2ISO 27001ISO 42001EU AI ActNIST AI RMFFINRA

エージェントを測る。出荷をゲートする。

すべての実行を採点し、どれでも再生し、不良リリースが本番に届く前に拒否する — すべては1つのオブザーバビリティ面から。

AI エージェントのオブザーバビリティと監視 | Cortex AI OS