信頼性スコア を、平易な言葉で。
信頼性スコアは、エージェントの測定された品質を比較可能な単一の数値に凝縮するため、そのエージェントがうまく機能しているか、出荷に足るかを一目で判断できます。単発のベンチマークではなくランタイムがすでに収集しているシグナルから算出されるため、古びたラベルではなく現在の値になります。
このスコアの狙いは、行動につながるものにすることです — 誰かがちらりと見るグラフではなく、ゲートになります。公平に判断できるだけの根拠がありながら基準を下回るエージェントは公開時に拒否されるため、リグレッションが黙って本番へ紛れ込むことはありません。
Cortex はこれをこう実装します。
この用語はここでは抽象概念ではありません — ランタイム上の実際の機能に対応します。Cortex がどのように強制適用し、どう関係するのかを正確に示します。
Cortex は 30 日間のウィンドウにおける成功率(0.5)、評価合格率(0.3)、インシデント(0.2)を混合して 0–100 のスコアを算出し、優良 ≥85、良好 ≥70、可 ≥50、不良 <50 のバンドに分類します。トレンドのスナップショットが、スコアの推移を記録します。
レジストリは、判断に足る実行シグナルがありながら RELIABILITY_MIN_PUBLISH を下回るエージェントの公開を拒否し、409 RELIABILITY_TOO_LOW を返します。新規またはデータの少ないエージェントは制限なく公開でき、スコアリングの障害時はフェイルオープンとなるため、可用性が運用を妨げることはありません。
語彙をさらに広げる。
これらは統制されたAIのモデルで隣り合う用語です。つながりをたどれば、各コントロールがどう連携するかがわかります。
信頼性スコア を、定義ではなく実際の強制適用で確認。
ウェイトリストにご登録ください。この用語集のコントロールが実際の判定を返し、証拠を封印し、あらゆる事実をその出典までたどる様子をご覧いただけます。