用語集

信頼性スコア

どのバージョンの公開を許すかを制御する、エージェントごとの 0–100 の品質スコア。

カテゴリ ▸ オペレーション

audit/verify
#101ハッシュ ✓#102ハッシュ ✓#103ハッシュ ✓#104ハッシュ ✓#105ハッシュ ✓
head 0x9f3a…c1ok: true
verifyChain ▸ 連鎖する SHA-256 · 署名付きレシート
用語の意味

信頼性スコア を、平易な言葉で。

信頼性スコアは、エージェントの測定された品質を比較可能な単一の数値に凝縮するため、そのエージェントがうまく機能しているか、出荷に足るかを一目で判断できます。単発のベンチマークではなくランタイムがすでに収集しているシグナルから算出されるため、古びたラベルではなく現在の値になります。

このスコアの狙いは、行動につながるものにすることです — 誰かがちらりと見るグラフではなく、ゲートになります。公平に判断できるだけの根拠がありながら基準を下回るエージェントは公開時に拒否されるため、リグレッションが黙って本番へ紛れ込むことはありません。

Cortex での実装

Cortex はこれをこう実装します。

この用語はここでは抽象概念ではありません — ランタイム上の実際の機能に対応します。Cortex がどのように強制適用し、どう関係するのかを正確に示します。

オペレーション

Cortex は 30 日間のウィンドウにおける成功率(0.5)、評価合格率(0.3)、インシデント(0.2)を混合して 0–100 のスコアを算出し、優良 ≥85、良好 ≥70、可 ≥50、不良 <50 のバンドに分類します。トレンドのスナップショットが、スコアの推移を記録します。

レジストリは、判断に足る実行シグナルがありながら RELIABILITY_MIN_PUBLISH を下回るエージェントの公開を拒否し、409 RELIABILITY_TOO_LOW を返します。新規またはデータの少ないエージェントは制限なく公開でき、スコアリングの障害時はフェイルオープンとなるため、可用性が運用を妨げることはありません。

信頼性スコア を、定義ではなく実際の強制適用で確認。

ウェイトリストにご登録ください。この用語集のコントロールが実際の判定を返し、証拠を封印し、あらゆる事実をその出典までたどる様子をご覧いただけます。

信頼性スコア — 用語解説 | Cortex AI OS