開発元Cognition自身の発表によれば、新型コーディングモデル「SWE-2」はベンチマーク「FrontierCode 1.1 Main」で50.0%のスコアを記録し、同等性能とされるFable 5.1と比べてコストは64%安いとしています。ベースモデルにはKimi K3(2.8兆パラメータ)を採用しています。
作業効率の面では、FrontierCode 1.1 Mainでの平均ステップ数を127から53に削減、最初の編集に至るまでのステップ数も中央値で前モデルSWE-1.7の48から18へと減らしたとしています。政治的に敏感なトピックに関するトラストワーズネス(信頼性)評価では98.0%の合格率を記録したとのことです。これらの数値はCognition自身の発表によるもので、外部による検証は行われていません。
出典が伝えている要点
- Cognitionが新型コーディングモデル「SWE-2」を発表した
- SWE-2はFrontierCode 1.1 Mainで50.0%のスコアを達成した
- SWE-2は同等性能のFable 5.1と比較してコストが64%安い
- SWE-2はKimi K3(2.8兆パラメータ)をベースモデルとしている
- SWE-2はFrontierCode 1.1 Mainにおいて平均ステップ数を127から53に削減した
- SWE-2は中央値18ステップで初編集を行う(前モデルSWE-1.7は48ステップ)
- SWE-2は政治的に敏感なトピックのトラストワーズネス評価で98.0%の合格率を記録した
原文より
Stronger engineering judgment allows the agent to write more complete solutions alongside fewer detours and redundant reads.
出典: cognition.com