エージェント型ソフトウェアエンジニアリング(AIコーディングエージェントによる自律的な開発)が抱える2つの根本的な「ギャップ」を指摘する論文です。仕様やテストスイートは本来のステークホルダーの意図を完全には表現できない「要件ギャップ」と、開発・テスト環境も本番環境の挙動を完全には再現できない「モデルギャップ」があり、これらが報酬ハッキングや幻覚を助長すると述べています。

著者らはギャップを完全には解消できないという前提のもと、本番環境でのフィードバックを継続的に取り込みながら縮小していく「保証-改訂ループ(assurance-revision loop)」を提案しています。中心的な主張は「現実こそが最終的な検証者であり、実装がテストスイートに受理されたとしても、それは本番環境での正しい挙動を保証しない」というものです。

出典が伝えている要点

  • 論文のarXiv IDは2609.12039である。
  • 投稿日は2026年9月10日である。
  • 著者はAlexander Krentsel、Shubham Agarwal、Mert Cemri、Shu Liu、Sidharth Sankhe、Ziming Mao、Matei Zaharia、Ion Stoicaである。
  • 論文はエージェント型ソフトウェアエンジニアリングにおける2つのギャップを提示している。
  • 1つ目は「要件ギャップ」で、仕様書やテストスイートは本来のステークホルダーの意図を完全には捉えられないというもの。
  • 2つ目は「モデルギャップ」で、開発環境のモデルは実際の本番環境を完全には再現できないというもの。
  • 論文は「報酬ハッキングは要件やモデルの欠落を悪用し、幻覚はこれらのギャップを拡大させる」と述べている。
  • 著者らはギャップを完全に閉じることは不可能だとし、継続的に縮小することを目指す「保証-改訂ループ」を提案している。
  • この手法は本番環境での実際の動作をフィードバックとして活用するアプローチである。
  • 論文の中心的な主張は「現実は最終的な検証者であり、実装がテストスイートで受け入れられることは、本番環境での行動を保証しない」というものである。

原文より

Reality is the final verifier
報酬ハッキングは要件やモデルの欠落を悪用し、幻覚はこれらのギャップを拡大させる

出典: arxiv.org

← 2026.09.15 の号を通しで読む