開発元Cognition自身の発表によれば、新型コーディングモデル「SWE-2」はベンチマーク「FrontierCode 1.1 Main」で50.0%のスコアを記録し、同等性能とされるFable 5.1と比べてコストは64%安いとしています。ベースモデルにはKimi K3(2.8兆パラメータ)を採用しています。

作業効率の面では、FrontierCode 1.1 Mainでの平均ステップ数を127から53に削減、最初の編集に至るまでのステップ数も中央値で前モデルSWE-1.7の48から18へと減らしたとしています。政治的に敏感なトピックに関するトラストワーズネス(信頼性)評価では98.0%の合格率を記録したとのことです。これらの数値はCognition自身の発表によるもので、外部による検証は行われていません。

出典が伝えている要点

  • Cognitionが新型コーディングモデル「SWE-2」を発表した
  • SWE-2はFrontierCode 1.1 Mainで50.0%のスコアを達成した
  • SWE-2は同等性能のFable 5.1と比較してコストが64%安い
  • SWE-2はKimi K3(2.8兆パラメータ)をベースモデルとしている
  • SWE-2はFrontierCode 1.1 Mainにおいて平均ステップ数を127から53に削減した
  • SWE-2は中央値18ステップで初編集を行う(前モデルSWE-1.7は48ステップ)
  • SWE-2は政治的に敏感なトピックのトラストワーズネス評価で98.0%の合格率を記録した

原文より

Stronger engineering judgment allows the agent to write more complete solutions alongside fewer detours and redundant reads.

出典: cognition.com

← 2026.09.11 の号を通しで読む