強化学習微調整済み視覚言語モデルの頑健性と思考連鎖の一貫性に関する研究
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
Apple Machine Learning は、強化学習で微調整した視覚言語モデルが、誤ったキャプションや思考連鎖の痕跡といった単純なテキスト摂動に対して脆弱であることを示し、視覚的根拠の弱さやハルシネーションの問題を明らかにしました。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
強化学習(RL)によるファインチューニングは、推論集約型タスクにおける大規模言語モデル(LLM)の強化のための重要な技術となっており、その拡張がビジョンランゲージモデル(VLM)にも行われています。RL で調整された VLM は視覚的推論ベンチマークにおいて改善が見られますが、依然として弱い視覚的グラウンディング、ハルシネーション、テキストの手がかりへの過度な依存に対して脆弱です。私たちは、単純で制御されたテキストの摂動——誤解を招くキャプションや誤った思考連鎖(Chain-of-Thought: CoT)トレース——が、頑健性と信頼性に大きな低下をもたらすことを示し、これらの効果は CoT の一貫性が…
原文を表示
Reinforcement learning (RL) finetuning has become a key technique for enhancing large language models (LLMs) on reasoning-intensive tasks, motivating its extension to vision language models (VLMs). While RL-tuned VLMs improve on visual reasoning benchmarks, they remain vulnerable to weak visual grounding, hallucinations, and over-reliance on textual cues. We show that simple, controlled textual perturbations—misleading captions or incorrect chain-of-thought (CoT) traces—cause substantial drops in robustness and confidence, and that these effects are more pronounced when CoT consistency is…
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み