ページを読み込み中…
ページを読み込み中…
11件の記事
TLDR AI が AI エージェントの推論能力を評価するベンチマーク「Legora Benchmark」を発表した。
ByteDance Seed は、大規模モデルが実世界環境との持続的な相互作用を通じて継続的に学習・改善できるかを測定する超長期ホライズンベンチマーク「EdgeBench」を発表し、新たなスケーリング法則を発見したと報告している。
TLDR AI が、AI の数学的推論能力を評価する「ラマヌジャン・チャレンジ」を発表した。この挑戦は、AI が高度な数理論理や未解決問題の解決を試みることを目的としている。
KDnuggets は、AI システムの最終評価ベンチマーク「Humanity's Last Exam」について解説し、専門家の多様な意見を整理した上で、この取り組みが本質的な課題から目を逸らす気晴らしに過ぎないと結論付けている。
研究者が AI エージェントの遺伝子解析における科学的判断力を測定するベンチマーク「GeneBench-Pro」を発表した。