評価指標に依存する注釈飽和:ラベル分布からの学習における研究
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
Apple Machine Learning は、注釈者の不一致が信号となり得ることを示し、評価指標によって必要な注釈者数が異なる「注釈飽和」を特定した。NLI モデルの実験により、不一致を検出するエントロピー相関には約 20〜50 人の注釈者が必要であることが明らかになった。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
注釈者がラベルについて合意しない場合、その不一致自体がシグナルとなり、それを捉えるために必要な注釈者の数は評価指標に依存します。ChaosNLI(各項目に対して100件の独立した注釈者判断を提供するデータセット)からサンプリングされたラベル分布を用いて NLI モデルをファインチューニングし、指標依存性の飽和現象を特定しました。3 クラスの NLI 設定において、エントロピー相関(モデルが不一致を引き起こす項目を識別できるかどうか)は、N ≈ 20–50 の注釈者数で収束する一方、分布一致(KL 発散)は N ≈ 10 で飽和します(5 つのモデルにわたる改善の 87–95% が達成されるまで)。
原文を表示
When annotators disagree on a label, the disagreement itself carries signal—and the number of annotators needed to capture it depends on the evaluation metric. We fine-tune NLI models on label distributions subsampled from ChaosNLI, a dataset providing 100 independent annotator judgments per item, and identify metric-dependent saturation. In our 3-class NLI setting, entropy correlation—whether the model identifies which items elicit disagreement—requires N ≈ 20–50 annotators to converge, while distributional match (KL divergence) saturates by N ≈ 10 (87–95% of improvement across five model…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み