ページを読み込み中…
ページを読み込み中…
5件の記事
AIモデルの評価・比較プラットフォーム「Arena」は、設立から8ヶ月で累計資金調達額が1億ドルに達した。
Amazon は Amazon SageMaker AI の MLflow Apps にバージョン 3.10 を導入し、生成 AI 開発のワークフローを簡素化し、実験追跡機能を強化したと発表した。
AI 評価のコストが急騰し、トレーニングコストに匹敵する計算リソースのボトルネックとなっている。一部の試行では数万ドルを要し、モデルやタスク間でコスト配分に偏りがあるため、標準化ドキュメントやデータ再利用など効率的な手法が必要とされている。
研究者らは、主要ベンチマークが飽和した現在、AI が実製品開発や科学実験など現実世界でどのように機能するかを評価する「オープンワールド評価」を導入した。この論文は、その定義と手法について詳述している。
ServiceNow Research、Mila、モントリオール大学は、大規模言語モデルの企業実装課題を解決するため、長期計画や状態変化を評価するベンチマーク「EnterpriseOps-Gym」を開発した。