タグ

#benchmark に関するニュース

一覧へ戻る

5件のニュースを、関連テーマごとにまとめて確認できます。

化学・材料科学用AIエージェントの安全性評価ベンチマーク「ChemMat-AgentSafetyBench」公開
security 2026/9/14 arXiv
化学・材料科学用AIエージェントの安全性評価ベンチマーク「ChemMat-AgentSafetyBench」公開

脆弱性や権限変更が運用影響を持つ更新です。 化学領域特化型AIエージェントへの長期攻撃を評価するChemMat-AgentSafetyBenchが公開されました

化学領域特化型AIエージェントへの長期攻撃を評価するChemMat-AgentSafetyBenchが公開されました。arXiv 2609.11952として登録された本ベンチマークは、従来の短文攻撃…

LLMの評価検知能力を測定するベンチマークEvalDetectBenchが公開
ai 2026/9/3 arXiv
LLMの評価検知能力を測定するベンチマークEvalDetectBenchが公開

生成AIやモデル更新が実務に直結しやすい話題です。 最新のLLMが評価環境を検知し挙動を変える「評価認識」のリスクを定量化するEvalDetectBenchがarXiv論文2609…

最新のLLMが評価環境を検知し挙動を変える「評価認識」のリスクを定量化するEvalDetectBenchがarXiv論文2609.01611で提案されました。従来の静的評価では困難だったモデルの意図…

arXiv、AIエージェントの信頼性を多端末で測定する「ADeptS-Bench」を公開
security 2026/8/28 arXiv
arXiv、AIエージェントの信頼性を多端末で測定する「ADeptS-Bench」を公開

脆弱性や権限変更が運用影響を持つ更新です。 AIによるコンピュータ操作エージェントの安全性を評価するADeptS-Benchが提案されました

AIによるコンピュータ操作エージェントの安全性を評価するADeptS-Benchが提案されました。論文2608.26204では、デバイスを横断した操作における信頼性の定量的測定手法が確立されています。

Google DeepMind、暗号化技術を用いた世界初のAI二重盲検評価基盤を導入
ai 2026/8/27 DeepMind Blog
Google DeepMind、暗号化技術を用いた世界初のAI二重盲検評価基盤を導入

生成AIやモデル更新が実務に直結しやすい話題です。 Google DeepMindはシンガポールAI安全研究所と協力し、暗号化された隔離環境「ボックス」内で外部評価を実施する手法を開発しました

Google DeepMindはシンガポールAI安全研究所と協力し、暗号化された隔離環境「ボックス」内で外部評価を実施する手法を開発しました。従来手法と異なり、評価データがモデル学習に混入するデータ…

arXivで公開、デジタルフォレンジックにおけるAIエージェントの推論能力を評価する新ベンチマーク「2608.21470」
security 2026/8/25 arXiv
arXivで公開、デジタルフォレンジックにおけるAIエージェントの推論能力を評価する新ベンチマーク「2608.21470」

脆弱性や権限変更が運用影響を持つ更新です。 非公開仕様のモバイルデータベース構造をAIがどこまで推論できるかを測定するベンチマークが提案されました

非公開仕様のモバイルデータベース構造をAIがどこまで推論できるかを測定するベンチマークが提案されました。従来の静的解析とは異なり、デジタルフォレンジックにおけるエージェントの自律的な推論精度を評価し…