ProText:長文テキストにおける(誤った)性別表現を測定するためのベンチマークデータセット
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、多様なスタイルの長文英語テキストにおける性別表現と誤った性別表現を測定するデータセット「ProText」を発表した。このデータセットは、要約や書き換えなどのテキスト変換における性別表現の問題を調査するために設計されている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、様式が多様な長文英語テキストにおける性別の付与と誤った性別の付与を測定するためのデータセット「ProText」を紹介します。ProText は3つの次元にわたります:テーマ名詞(名前、職業、肩書き、親族呼称)、テーマカテゴリ(典型的に男性向け、典型的に女性向け、性別中立/無性別)、および代名詞カテゴリ(男性形、女性形、性別中立、なし)。このデータセットは、最先端の大規模言語モデルを用いた要約や書き換えといったテキスト変換における(誤った)性別の付与を調査するために設計されており、従来の代名詞解決ベンチマークを超え、さらに…
原文を表示
We introduce ProText, a dataset for measuring gendering and misgendering in stylistically diverse long-form English texts. ProText spans three dimensions: Theme nouns (names, occupations, titles, kinship terms), Theme category (stereotypically male, stereotypically female, gender-neutral/non-gendered), and Pronoun category (masculine, feminine, gender-neutral, none). The dataset is designed to probe (mis)gendering in text transformations such as summarization and rewrites using state-of-the-art Large Language Models, extending beyond traditional pronoun resolution benchmarks and beyond the…
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み