ARC Prize公式ブログ(著者Greg Kamradt氏)は、OpenAIの「GPT-6 Astra」を、抽象的な環境でのエージェント知能を測定するベンチマーク「ARC-AGI-3」で評価した結果を報告しています。
Standard harnessでの成績は62.7%(コスト$26,098)、Provider Adapter harnessでは99.9%(コスト$18,817)を記録。約500人の人間テスト参加者(1セッションあたり約9ゲームをプレイ)と比較すると、GPT-6 Astraは96.0%のレベルでより少ないアクション数を使い、平均して51.7%少ないアクション数でゲームを解決したとしています。
出典が伝えている要点
- 記事は、OpenAIのGPT-6 AstraがARC-AGI-3ベンチマークで評価されたと報じている
- Standard harnessでの成績は62.7%で、コストは$26,098だったとされる
- Provider Adapter harnessでの成績は99.9%で、コストは$18,817だったとされる
- GPT-6 Astraは人間ベースラインと比較して96.0%のレベルでより少ないアクション数を使用したとされる
- GPT-6 Astraは平均して51.7%少ないアクション数でゲームを解決したとされる
- 比較対象の人間テスト参加者は約500人で、1セッション当たり約9ゲームをプレイしたとされる
- 記事の著者はGreg Kamradtである
原文より
Agents must turn raw observations into a generalizable model that can predict future states and outcomes.
出典: arcprize.org