トークンで学習、概念で調整:LLMにおける意味的キャリブレーションの出現
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究チームは、大規模言語モデル(LLM)がトークンレベルを超えて回答の意味に対する信頼度を評価できる「意味的キャリブレーション」を発見した。サンプリングベースの手法により、LLMはオープンドメイン質問応答タスクで有意な信頼度推定が可能であることを示した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)は、その出力に対する意味のある信頼性推定を欠いていることが多い。ベースとなる LLM は次単語レベルでの較正を示すことが知られているが、単語レベルを超えて応答の実際の意味に対する信頼性を評価できるかどうかについては依然として不明である。我々は、特定のサンプリングに基づく意味的較正の概念を用いる場合、ベースとなる LLM が驚くほどよく較正されていることを発見した:明示的にそのように訓練されていないにもかかわらず、オープンドメインの質問応答タスクにおいて、意味のある信頼性評価が可能である。我々の主な理論的貢献は、なぜ意味的…
原文を表示
Large Language Models (LLMs) often lack meaningful confidence estimates for their outputs. While base LLMs are known to exhibit next-token calibration, it remains unclear whether they can assess confidence in the actual meaning of their responses beyond the token level. We find that, when using a certain sampling-based notion of semantic calibration, base LLMs are remarkably well-calibrated: they can meaningfully assess confidence in open-domain question-answering tasks, despite not being explicitly trained to do so. Our main theoretical contribution establishes a mechanism for why semantic…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み