シミュレーションとゴールデンテストで検証できるポリシールール
ルールは優先度順に評価され、最も厳格な効果が優先されます(deny > require_approval > allow)。リリース前に判断とルール単位のトレースをプレビューでき、変更はゴールデンテスト群でゲートされます。
ガバナンス付きランタイムのすべての機能と、いま改善している点。このログは現在の一般公開リリースを反映しています——領域ごとにグループ化され、各エントリは今日提供されている機能に紐づいており、作り話のバージョン履歴はありません。
領域別 · 提供済み / 改善 · プラットフォームへのリンク
エージェントを作成すれば、すべての実行が同じフェイルクローズドのガバナンスチェーンを通ります——アイデンティティ、予算、ガードレール、レジストリ、Control Tower、実行、出力ガード、監査。既定は拒否です。
ルールは優先度順に評価され、最も厳格な効果が優先されます(deny > require_approval > allow)。リリース前に判断とルール単位のトレースをプレビューでき、変更はゴールデンテスト群でゲートされます。
すべてのアクションは dry-run → propose → approve/deny → execute → compensate を通り、改変不能な呼び出し台帳と証跡パックが残ります。リスクの高いアクションは人による承認インボックスに入り、宣言されたロールバックキーによって補償実行が可能になります。
エージェントごとの自律度を suggest_only から autonomous まで設定できます。監督は判断を厳しくすることしかできず、アクション自体の承認下限を緩めることはありません。管理者のブレークグラスは、監査される理由の入力を必須として強制実行します。
エージェントは自身のアイデンティティ、許可ツール、許可モデル、許可データ、デプロイチャネルを持ちます。存在しない、下書き、未公開、テナントをまたぐ、期限切れ、一時停止中、権限のないエージェントの実行は、ランタイムが拒否します。
MCP サーバーは pending として登録され、承認されるまで呼び出せません。ブロックは即時のキルスイッチです。ガバナンス付きの呼び出しでは、入力を DLP スキャンし、サーバーごとのツール許可リストを適用し、入出力をマスキングしたうえで全呼び出しを記録します。
エージェント、実行、支出、ツール、有効な統制を、テナント単位で集約したビュー。ワンクリックの一時停止とツール無効化はランタイムが実際に適用します(一時停止中のエージェントは 409 AGENT_PAUSED で拒否されます)。
ガバナンス下のすべての成果は、第三者が検証できる形で記録されます。監査台帳はハッシュ連鎖され、成果は署名付きレシートを発行し、来歴グラフが人から成果までの連鎖をつなぎます。
すべての監査イベントはハッシュ連鎖されているため、挿入・編集・削除はいずれも検知できます。verify エンドポイントは指定範囲の整合性を証明し、チェーンが改変されていれば壊れたシーケンスを返します。
エージェントの実行、アクションの実行、承認の判断——ガバナンス下のすべての成果が、第三者がオフラインで検証できるコンパクトな分離署名レシートを発行します。署名鍵は運用者が用意し、本番環境ではフェイルクローズドで動作します。
クエリ可能な系譜グラフが Human → Agent → Skill → Prompt → Policy → Model → Tool → Artifact → Outcome → Approval の連鎖をつなぎ、画面に出るすべての事実が出典の提出書類・ページ・欄までリンクします。
統制されたエージェントを自然言語またはコードで作成し、下書き・テスト・レビュー・公開という実際のライフサイクルを通します。本番に到達するものは、信頼性の基準が決めます。
スキル、ナレッジ、ガードレール、モデルポリシーを備えたエージェントを作成し、draft → test → review → approve → publish → deploy → pause → retire のライフサイクルを進めます。プロンプトと指示のバージョン管理、組み込みの評価ハーネスも利用できます。
0〜100 のスコアが、成功率・評価合格率・インシデントをローリングウィンドウで合成します。十分なシグナルがありながら基準を下回るエージェントの公開は、レジストリが拒否します(409 RELIABILITY_TOO_LOW)。新規エージェントは自由に公開でき、スコアリングが利用できないときはフェイルオープンします。
オブジェクト型・リレーション・検証済みメトリクスを、オブジェクト単位・プロパティ単位・アクション単位の権限とともにモデル化。オントロジーのバージョン管理、プロモーション、ロールバック、マイグレーションにより、モデルを安全に進化させられます。
複数ステップの業務をオーケストレーションし、イベントからガバナンス下のアクションを起動します。ゲートの外に出ることは一度もありません。
複数ステップのワークフローと、イベント・条件・アクション型のオートメーションを構成します。いずれもガバナンス下のアクションを提案し、スケジュールまたはキューで実行され、Real-Time Hub を通じてストリーミングされます。すべてのステップは変わらず同じゲートを通ります。
測れないものは統制できません。実行単位の品質スコアリング、評価ゲート、シミュレーションラボ、フルトレースのデバッガーが、エージェントの品質を、監視でき、ゲートにできる数値に変えます。
統制された各実行は品質 — 忠実性、引用カバー率、安全性 — で採点され、リプレイ用にトレースが記録されます。ゴールドの評価スイートはリリースゲートとして機能し、リグレッションを公開前にブロックします。稼働中の実行は quality { overall: 100 } を返します。
デバッガーは実行全体 — prompt → context → model → tools → approval → output — を再構成します。各ステップにはコスト、レイテンシ、判定が刻まれ、すべてのホップは Trust Ledger にリンクします。
実トラフィックに対してプロンプトとモデルを A/B で試し、変更を昇格させる前に結果を比較。候補は本番の実行に触れる前に実力を証明します。
ランタイムに予算を設定し、1ドルごとにそれが生んだ仕事へ紐づけます。
テナント単位またはエージェント単位で、アラートしきい値と任意のハード上限を備えた予算を設定します。支出は直近 30 日のローリングウィンドウでリアルタイムに集計され、予測支出がハード上限を超える時点で実行はブロックされ、BudgetExceeded イベントを発行します。
エージェントが使用できるモデルを統制し、実行をコンピュートブローカー経由でルーティング。モデル選定はポリシー判断となり、利用状況・採用状況・ROI がコストと並んで集計されます。
テナントのガバナンス付きソリューションを、バージョン管理された署名済みのポータブルな成果物にまとめ、検証して再展開。テナント間でも、エアギャップ環境でも。
パックはオントロジー型・ポリシー・アクション・エージェントのメタデータをまとめ、その内容は正規化・ハッシュ化され、HMAC で署名されます。verifyPack はコンテンツハッシュと署名の両方を検証し、改ざんがあれば hashOk が、シークレットが誤っていれば signatureOk が壊れます。
パックをインポートすると、稼働中の定義との差分がセクション単位で表示され(追加・変更・変更なし)、適用前に検証が実行され、不正なパックは拒否されます(409)。移送は必ず成果物を経由し、テナントをまたぐ直接書き込みは行いません。