ページを読み込み中…
ページを読み込み中…
22件の記事
ウェブページやPDFを画像としてレンダリングし、タイル分割後にSigLIPやCLIPなどのマルチモーダル埋め込みを用いてベクトル化する、従来のテキスト抽出に依存しないRAGパイプラインの構築方法を解説する。
Hugging Face は静止画像から連続動画へ拡張した深層調査エージェントを提案し、モダリティバイアスや知識漏洩への対応策を示した。
Moonshotが提供するPerceptionBenchを用いた多モーダル視覚モデルの評価ワークフローを、堅牢なデータ読み込みと自動判定機能を活用して設計・公開した。
Apple Machine Learning は、純粋な視覚的文脈からの推論が苦手な現状に対し、画像セットから共有概念を推論し適用する能力を評価する新タスク「VICIS」を導入したと発表した。
Sakana AI は MIT や NYU と共同で、目的を指定しない環境下での AI エージェントの創造性を検証する「Picbreeder」実験を GECCO 2026 で発表した。