Divyanshu Kumar氏ら5名による論文です。内部構造にアクセスせず、基本的なシステム説明のみを入力としてリスクを洗い出す「ブラックボックス型レッドチーミング」を提案しています。観察可能な行動をリスク分類にマッピングする7領域の分類体系と、領域ごとに120個の敵対的シナリオを自動生成する「SAGE-RT」を組み合わせ、LLMによる判定と人間による検証で評価します。

CrewAIとAutoGenという2つのマルチエージェントアーキテクチャに適用したところ、ガバナンスリスクは平均56.25%、マルチエージェント構成でのプライバシーリスクは65%、エージェント動作の脆弱性は最大85%に達したと報告されています。著者らは、特権的なアクセス権がなくてもこの手法で重大なアーキテクチャ上の脆弱性を発見できると主張しています。

出典が伝えている要点

  • 論文タイトルは『Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery』である。
  • 著者はDivyanshu Kumar、Nitin Aravind Birur、Tanay Baswa、Sahil Agarwal、Prashanth Harshangiの5名である。
  • 提案手法は、基本的なシステム説明のみを入力として機能する黒箱(ブラックボックス)評価フレームワークである。
  • 観察可能な行動をリスク分類にマッピングする7つの領域からなる分類体系(タクソノミー)を導入している。
  • SAGE-RTというレッドチーミング手法により、領域ごとに120個の敵対的シナリオを自動生成する。
  • 評価にはLLMによる判定を用い、人間による検証を組み合わせている。
  • CrewAIとAutoGenという2つのエージェントアーキテクチャで検証を行った。
  • 検証の結果、ガバナンスリスクは平均56.25%であった。
  • マルチエージェント構成におけるプライバシーリスクは65%であった。
  • エージェント動作の脆弱性は最大85%に達した。
  • 著者らは、この黒箱アプローチにより特別なアクセス権なしに重大なアーキテクチャ上の脆弱性を特定できると主張している。

原文より

7つの領域の分類体系(観察可能な行動をリスク分類にマッピング)
SAGE-RT赤チーム手法により、領域ごとに120の敵対的シナリオを自動生成

出典: arxiv.org

← 2026.09.12 の号を通しで読む