ARC Prize公式ブログ(著者Greg Kamradt氏)は、OpenAIの「GPT-6 Astra」を、抽象的な環境でのエージェント知能を測定するベンチマーク「ARC-AGI-3」で評価した結果を報告しています。

Standard harnessでの成績は62.7%(コスト$26,098)、Provider Adapter harnessでは99.9%(コスト$18,817)を記録。約500人の人間テスト参加者(1セッションあたり約9ゲームをプレイ)と比較すると、GPT-6 Astraは96.0%のレベルでより少ないアクション数を使い、平均して51.7%少ないアクション数でゲームを解決したとしています。

出典が伝えている要点

  • 記事は、OpenAIのGPT-6 AstraがARC-AGI-3ベンチマークで評価されたと報じている
  • Standard harnessでの成績は62.7%で、コストは$26,098だったとされる
  • Provider Adapter harnessでの成績は99.9%で、コストは$18,817だったとされる
  • GPT-6 Astraは人間ベースラインと比較して96.0%のレベルでより少ないアクション数を使用したとされる
  • GPT-6 Astraは平均して51.7%少ないアクション数でゲームを解決したとされる
  • 比較対象の人間テスト参加者は約500人で、1セッション当たり約9ゲームをプレイしたとされる
  • 記事の著者はGreg Kamradtである

原文より

Agents must turn raw observations into a generalizable model that can predict future states and outcomes.

出典: arcprize.org

← 2026.09.05 の号を通しで読む