ページを読み込み中…
ページを読み込み中…
11件の記事
Stanford NLPのIMDb映画レビューデータセットを用い、TF-IDFベースラインとLoRAによるDistilBERT微調整を比較するエンドツーエンドの感情分析ワークフローを開発し、データ監査や校正、解釈性評価を含む手法を示した。
TLDR AI は、モデルが人間の言うような意識的な推論を行うための領域である「J-Space」について解説しました。これはヤコビアンレンズと呼ばれる解釈手法に基づき、各層における概念の関連性を追跡可能にします。
Apple Machine Learning は、AI の安全出力を定義するポリシーにおいて、アノテーションの不一致が運用ミスや政策の曖昧さ、価値観の多様性など複数の要因に起因することを明らかにし、これらの原因を解釈可能性技術で区別する重要性を説明した。
Anthropicは、大規模言語モデルが感情関連概念を内部でどのように表現し、それらの表現が行動にどのような影響を与えるかをClaude Sonnet 4.5の内部活性化を分析することで検証した。
研究者が、大規模言語モデルにおける感情概念の機能と解釈可能性について分析した。