ページを読み込み中…
1件の記事
Apple Machine Learningチームは、複数の大規模言語モデル(LLM)で構成される評価パネルの信頼性について調査した。その結果、9つの最先端モデルからなるパネルでも、相関する誤差により実質的な有効投票数は約2票に過ぎないことが判明した。