← 一覧へ戻る
ai 重要度 4/5 1記事1出典 2026/9/10 15:29:47

Cognition、コーディングモデルSWE-2を公開しFable 5.1と同等性能を64%低コストで実現

Cognition、コーディングモデルSWE-2を公開しFable 5.1と同等性能を64%低コストで実現
この記事の要点

Cognitionが発表したSWE-2は、FrontierCode 1.1 Mainベンチマークで50.0%のスコアを記録し、競合のFable 5.1に1ポイント差まで迫りつつコストを64%削減して…

カテゴリ
ai
重要度
4/5
出典
Hacker News
なぜ今読むべきか

AIの動向が実務の判断材料になる更新です。 Cognitionが発表したSWE-2は、FrontierCode 1.1 Mainベンチマークで50.0%のスコアを記録し、競合のFable 5.1に1ポイン…

Cognitionは、最新のコーディング特化型エージェントAIモデル「SWE-2」を公開しました。このモデルは、強化学習(RL)を数兆パラメータ規模にまでスケールアップさせた点が特徴で、Kimi K3をベースモデルとしてポストトレーニングが行われています。FrontierCode 1.1 Mainベンチマークにおいて50.0%の正答率を達成しており、これは先行するSWE-1.7やGrok 4.6をスコアとコストの両面で上回る成果です。

従来のフラグシップモデルとの比較では、Fable 5.1やGPT-5.6 Solと同等のパフォーマンスを維持しながら、それらの数分の一の価格帯で推論が可能です。特に、異なる推論工レベルを単一の実行で学習する新しいRLアルゴリズムの導入により、コストパフォーマンスの限界を押し広げています。最上位のGPT-6 Astraとの比較においても、わずか数ポイントの差に留まりつつ、コストを4分の1に抑制しています。

実装面では、2.8兆パラメータを持つKimi K3に対して独自のRLパイプラインを適用することで、ベンチマークスコアを5〜6ポイント向上させました。利用にあたっては、SWE-1.7で構築されたインフラを引き継ぎつつ、エージェントとしての自律的なコード修正能力が強化されています。一方で、大規模なパラメータ数に起因する推論リソースの確保や、特定のベンチマーク環境以外での実効性能については、今後の運用評価が待たれます。

Related tools

この記事に関連するおすすめツール

比較検討しやすい導入候補を優先して表示しています。一部リンクは広告・アフィリエイトを含む場合があります。

出典: Hacker News

要点を短く整理して掲載しています。詳細は出典を確認してください。

朝の要約メール待機リスト

毎朝7時に「今日の3本」をメールで受け取る(先行導入)。

次に読む

一覧を見る
arXiv、数学と言語推論に特化した高効率基盤モデル「ZGCM-1」の論文を公開
ai 2026/9/15 arXiv
arXiv、数学と言語推論に特化した高効率基盤モデル「ZGCM-1」の論文を公開

生成AIやモデル更新が実務に直結しやすい話題です。 数学とエージェント検索に特化したZGCM-1は、完全オープンソースでありながら従来モデルを上回る効率性を実現しています

数学とエージェント検索に特化したZGCM-1は、完全オープンソースでありながら従来モデルを上回る効率性を実現しています。論文ID 2609.13356として公開され、推論コスト削減と計算リソースの最…

LLMの評価検知能力を測定するベンチマークEvalDetectBenchが公開
ai 2026/9/3 arXiv
LLMの評価検知能力を測定するベンチマークEvalDetectBenchが公開

生成AIやモデル更新が実務に直結しやすい話題です。 最新のLLMが評価環境を検知し挙動を変える「評価認識」のリスクを定量化するEvalDetectBenchがarXiv論文2609…

最新のLLMが評価環境を検知し挙動を変える「評価認識」のリスクを定量化するEvalDetectBenchがarXiv論文2609.01611で提案されました。従来の静的評価では困難だったモデルの意図…

Meta、AIモデルMuse Spark 1.3を公開しエージェント向けワークフローと競技プログラミング性能を強化
ai 2026/9/2 Hacker News
Meta、AIモデルMuse Spark 1.3を公開しエージェント向けワークフローと競技プログラミング性能を強化

生成AIやモデル更新が実務に直結しやすい話題です。 MetaはMuse Spark 1.3をリリースし、自律型エージェント向けのワークフロー最適化を実現しました

MetaはMuse Spark 1.3をリリースし、自律型エージェント向けのワークフロー最適化を実現しました。従来モデルと比較して競技プログラミングにおける計算性能と論理推論能力が大幅に向上していま…

arXivで論文公開、エージェント型LLMのポリシー違反を監査する手法AgentProvが提案される
ai 2026/9/2 arXiv
arXivで論文公開、エージェント型LLMのポリシー違反を監査する手法AgentProvが提案される

生成AIやモデル更新が実務に直結しやすい話題です。 AIエージェントのAPIプロバイダーが定義するツール利用ポリシーを、外部から自動監査するフレームワークAgentProvが提案されました

AIエージェントのAPIプロバイダーが定義するツール利用ポリシーを、外部から自動監査するフレームワークAgentProvが提案されました。論文番号2609.00052で公開され、従来の静的分析では困…