ページを読み込み中…
ページを読み込み中…
6件の記事
MarkTechPost は、多様なタスクや環境で AI エージェントを評価する実用的なベンチマーク「EdgeBench」の分析方法を紹介し、データセットの取得からリーダーボード解析まで解説した。
研究チームが開発した時系列予測モデル「Toto 2.0」は、データ規模の拡大に伴い精度が向上するスケーリング特性を示し、業界における予測技術の新たな基準を確立しました。
本記事は、AI 研究コミュニティが基盤モデルの性能向上においてスケーリング則が果たす役割を分析し、計算資源とデータ量の増加がモデル能力に与える影響について詳述している。
METRの調査によると、最新のClaude Opus 4.6は10時間タスクを50%の確率で完了可能だが、長時間タスクでは各ステップの成功率向上や失敗復帰の仕組みが必要である。
研究チームが、大規模言語モデルの訓練予算からベンチマーク性能のスケーリングを直接モデル化する枠組みを提案し、固定トークン対パラメータ比率では単純なべき法則が複数の下流タスクの精度を正確に記述できることを発見した。
AIサイエンティストが科学的ブレイクスルーを自律的に探索する研究論文がNature誌に掲載された。