論文「CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents」は、長期にわたるツール呼び出しエージェントの信頼性向上を目指す学習フレームワークを提案しています。タスク結果を行動レベルの教師信号に変換し、エージェントの行動軌跡を分析して部分観測下での各行動の妥当性を説明する構造化された根拠(rationale)を生成、これを批評学習と方策最適化に用います。
Qwen3モデルを微調整して評価したところ、小売業務でGPT-OSS-120Bを10%以上上回り、ドメイン外設定であるテレヘルス分野でもさらに9%の改善が得られたとしています。
出典が伝えている要点
- 論文タイトルは『CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents』
- 著者はAmir Saeidi、Zehua Zhang、Rishitosh Singh、Naman Ahuja、Vivek Gupta、Ali Payani、Gaowen Liu、Jayanth Srinivasa、Chitta Baralである
- CASTはタスク結果を行動レベルの教師信号に変換し、批評学習と方策最適化に利用するフレームワークである
- CASTはエージェントの軌跡を分析し、部分観測下での行動妥当性を説明する構造化された根拠を生成する
- 実験ではQwen3モデルを微調整して評価している
- 小売業務においてGPT-OSS-120Bを10%以上上回る性能を示したとされる
- テレヘルス分野(ドメイン外設定)でさらに9%の改善が得られたとされる