
Microsoft、AIベンチマークの限界と独自コードベースでの評価指標を提示
SWE-benchで92%を記録したモデルでも、特定企業のコードベースでは性能が低下する「グッドハートの法則」の課題が指摘されています。モデル選定時は公開スコアではなく、Agent Experien…
1件のニュース

SWE-benchで92%を記録したモデルでも、特定企業のコードベースでは性能が低下する「グッドハートの法則」の課題が指摘されています。モデル選定時は公開スコアではなく、Agent Experien…