Cognition、コーディングモデルSWE-2を公開しFable 5.1と同等性能を64%低コストで実現

Cognitionが発表したSWE-2は、FrontierCode 1.1 Mainベンチマークで50.0%のスコアを記録し、競合のFable 5.1に1ポイント差まで迫りつつコストを64%削減して…
AIの動向が実務の判断材料になる更新です。 Cognitionが発表したSWE-2は、FrontierCode 1.1 Mainベンチマークで50.0%のスコアを記録し、競合のFable 5.1に1ポイン…
Cognitionは、最新のコーディング特化型エージェントAIモデル「SWE-2」を公開しました。このモデルは、強化学習(RL)を数兆パラメータ規模にまでスケールアップさせた点が特徴で、Kimi K3をベースモデルとしてポストトレーニングが行われています。FrontierCode 1.1 Mainベンチマークにおいて50.0%の正答率を達成しており、これは先行するSWE-1.7やGrok 4.6をスコアとコストの両面で上回る成果です。
従来のフラグシップモデルとの比較では、Fable 5.1やGPT-5.6 Solと同等のパフォーマンスを維持しながら、それらの数分の一の価格帯で推論が可能です。特に、異なる推論工レベルを単一の実行で学習する新しいRLアルゴリズムの導入により、コストパフォーマンスの限界を押し広げています。最上位のGPT-6 Astraとの比較においても、わずか数ポイントの差に留まりつつ、コストを4分の1に抑制しています。
実装面では、2.8兆パラメータを持つKimi K3に対して独自のRLパイプラインを適用することで、ベンチマークスコアを5〜6ポイント向上させました。利用にあたっては、SWE-1.7で構築されたインフラを引き継ぎつつ、エージェントとしての自律的なコード修正能力が強化されています。一方で、大規模なパラメータ数に起因する推論リソースの確保や、特定のベンチマーク環境以外での実効性能については、今後の運用評価が待たれます。
Related tools
この記事に関連するおすすめツール
比較検討しやすい導入候補を優先して表示しています。一部リンクは広告・アフィリエイトを含む場合があります。
出典: Hacker News
要点を短く整理して掲載しています。詳細は出典を確認してください。



