ページを読み込み中…
ページを読み込み中…
137件の記事
アリババは Qwen 3.8-Max を発表し Claude Fable 5 に次ぐと主張したが、独立検証では逆の結果も得られ、差は予算依存でスコアのみでは予測不能。
Apple Machine Learning は、検索機能付き LLM が複雑な質問で不完全になりがちな課題に対し、複数の映画や多数の俳優への推論を同時に評価する新ベンチマークを発表した。
Artificial Analysis は開発者向けの有用な合成指標となるよう、評価セットの信頼性を維持するため、知能指数インデックス v4.1.1 にてグラダーモデルと𝜏³-Banking バージョンを更新した。
「最も怠けたいシニアデベロッパー」の役割を指示する Ponytail が、投稿者の挑戦を受け自身のベンチマークを修正した。
Browser Use Blog は、ベンチマーク結果を決定する評価者(Judge)が弱体だと報酬ハック可能になるため、一貫性を高めるための設計に注力したと報告している。