評価スイート を、平易な言葉で。
評価スイートは、AI エージェントにとって通常のソフトウェアにおけるテストスイートに当たるもので、既知の正解を伴うケースを厳選し、自動実行して品質を測定し、出荷前にリグレッションを捕捉します。エージェントの評価では、完全一致の正誤だけでなく、出典への忠実性、引用の網羅性、安全性といった観点を採点するのが一般的です。
評価は、AI の品質を主観の問題でなくすための手段です。うまくいったデモは次の 1,000 回の実行について何も証明しませんが、リリースゲートとして実行され合格した評価スイートは、そのエージェントが準備できていると言うための、説明可能で再現可能な根拠を与えます。
Cortex はこれをこう実装します。
この用語はここでは抽象概念ではありません — ランタイム上の実際の機能に対応します。Cortex がどのように強制適用し、どう関係するのかを正確に示します。
Cortex はゴールド評価スイートをリリースゲートとして実行し、すべての実行について品質 — 忠実性、引用の網羅性、安全性 — を採点したうえで、稼働中の実行はその値を生んだ実行まで遡れる quality { overall } の値を返します。シミュレーションラボでは、変更を昇格させる前に実トラフィック上でプロンプトとモデルを A/B 比較できます。
評価の合格率は信頼性スコアに反映されるため、評価の失敗はグラフに表示されるだけでは終わりません — スコアを押し下げ、公開ゲートでリリースを保留させることがあります。
語彙をさらに広げる。
これらは統制されたAIのモデルで隣り合う用語です。つながりをたどれば、各コントロールがどう連携するかがわかります。
評価スイート を、定義ではなく実際の強制適用で確認。
ウェイトリストにご登録ください。この用語集のコントロールが実際の判定を返し、証拠を封印し、あらゆる事実をその出典までたどる様子をご覧いただけます。