日本語LLMの評価におけるプロンプトバージョンごとの得意不得意の調査
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
著者がlm-evaluation-harnessとJGLUEデータセットを使用し、FintanPromptやAlpacaPromptなど複数のプロンプトバージョンによる日本語LLMの評価結果を比較し、各プロンプトの特性を分析した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
はじめに
評価対象
評価方法
プロンプトの中身
0.2: FintanPrompt
0.3: AlpacaPrompt
0.4: RinnaInstructionSFT
0.5: RinnaBilingualInstructionSFT
0.6: Llama2
評価結果
おわりに
はじめに
日本語LLMの評価には、JGLUEデータセットを使用する「lm-evaluation-harness」というプログラムがあります(提供してくださった方々、ありがとうございます)。弊社でもこのlm-evaluation-harnessを使用して、ファインチューニング済みLLMの評価や、事後の性能劣化の評価に活用しています。
原文を表示
はじめに 評価対象 評価方法 プロンプトの中身 0.2: FintanPrompt 0.3: AlpacaPrompt 0.4: RinnaInstructionSFT 0.5: RinnaBilingualInstructionSFT 0.6: Llama2 評価結果 おわりに はじめに LLMの日本語に関する評価にはJGLUEデータセットを使用するlm-evaluation-harness というプログラムがあります。(提供してくださった方々、ありがとうございます) 弊社でもこのlm-evaluation-harnessを使用してファインチューニング用のLLMの評価や事後の劣化具合評価に使…
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み