ページを読み込み中…
2件の記事
腾讯混元チームと清华大学 AIR、東南大学は、王者荣耀や QQ 音楽など腾讯製品の業務シナリオを原型とした公平な AI 智能体評価ベンチ「E-Bench」を共同で発表した。
Harvey が法務エージェントベンチマークで最前線モデルを評価した結果、Claude Opus 4.7 が 7.1% の最高スコアを獲得したが、これは法務業務が最先端知能によって完全に代替されるには程遠いことを示している。