「Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls」という論文(著者: Dheeraj Mohandas Pai、Lu Xian)は、LLMが長期間にわたり多数の依存的なツール呼び出しを実行する際、状態(state)を正確に保持できるかを検証しています。各ステップが前のステップに依存する設定ではエラーが累積しやすいため、検証方法としてMD5(データから固定長の値を求める古典的なハッシュ関数)の計算を段階的に実行させ、64ラウンド・196回の依存的なツール呼び出しを行い、4つの32ビットワード(a, b, c, d)をコンテキスト内で状態として保持させました。
混合専門家モデル(約5.5Bアクティブパラメータ)のgpt-oss-120bは、温度0の設定で196回すべてのツール呼び出しを通じて完全な状態を保持し、完了した実行の大多数で正しいダイジェストを返したと報告されています。成功の要因として、各ターンでモデル自身の推論をコンテキストに保持すること、および思考能力を持つワーカーに投票させることで算術的な誤りを排除することの2点が挙げられています。
出典が伝えている要点
- 論文タイトルは「Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls」である。
- 著者はDheeraj Mohandas PaiとLu Xianである。
- arXiv IDは2609.00012である。
- 研究はLLMが長期タスク実行時に状態を正確に保持できるかを検証している。
- 各ステップが前のステップに依存する設定でエラーが累積する問題を調べている。
- 検証方法としてMD5暗号ハッシュの計算を段階的に実行させている。
- 実験では196回の依存的なツール呼び出しを行っている。
- 実験は64ラウンドで構成されている。
- 4つの32ビットワード(a, b, c, d)をコンテキスト内で状態として保持する設計になっている。
- gpt-oss-120bというモデル(混合専門家モデル、約5.5Bアクティブパラメータ)が、温度0の設定で196回すべてのツール呼び出しを通じて完全な状態を保持したと報告されている。
- gpt-oss-120bは完了した実行の大多数で正しいダイジェストを返したと報告されている。
- 成功の要因として、各ターンでモデル自身の推論をコンテキストに保持すること、および思考能力を持つワーカーに投票させることで算術的な誤りを排除することの2点が挙げられている。