暴走するAIエージェントの被害範囲を制限するアーキテクチャ設計に関する技術白書を公開しました
お知らせ
AIエージェントが誤った判断や不適切なツール選択を行った場合に、周囲のシステム設計によって被害範囲をどのように限定できるかを整理した技術白書「暴走するAIエージェントの被害範囲を制限するアーキテクチャ設計」を公開しました。
本白書では、データベース認証情報の直接付与、無制限SQL実行、広範なCRUD・内部API、フィルタリングされない大規模MCPツールカタログ、ロールで絞り込んだツール、ケイパビリティベース方式の6つを比較しています。
特に、実行可能な最大権限、ツールの発見・呼び出し範囲、入力と出力の制限、書き込み操作への露出、レート制御、監査、Gatewayやオンプレミスエージェントが侵害された場合の影響などの観点から、各方式のリスクと運用上のトレードオフを整理しました。
本白書は、AIエージェントの誤動作を完全に防止できるとは仮定せず、認可、入力検証、読み取り専用DB権限、実行時間・行数・データ量の制限、出力項目の許可リスト、レート制御といった決定的な境界をモデルの外側に設けることで、実行可能な権限と最大被害範囲をどこまで抑えられるかを技術的に検討するものです。
詳細は研究ページをご覧ください。