GPTとGeminiのマルチモーダルドキュメント認識能力評価
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
LayerXのR&Dインターン生が、OpenAI GPTとGoogle GeminiのAPI単体を用いて、スライドや図表などのマルチモーダルドキュメント認識能力を評価した結果を紹介する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
はじめに この記事は、LayerX Tech Advent Calendar 2025 の17日目の記事です。 初めまして、LayerXのAi Workforce事業部でR&Dインターン生として勤務しているマツイと申します。 R&Dチームは発足から1年も経っておらず、サマーインターン1期生として、スライドや図表、グラフなどのマルチモーダルドキュメントに関連するR&D業務に取り組んでいます! 本記事では、2025年10月時点でのOpenAI GPTおよびGoogle GeminiのAPI単体を用いた、マルチモーダルドキュメントの認識能力評価の結果をご紹介します。(本調査を行った直後に…
原文を表示
はじめに この記事は、LayerX Tech Advent Calendar 2025 の 17日目の記事です。 初めまして、LayerX Ai Workforce事業部でR&Dインターン生として勤務しているマツイと申します。 R&Dチームは発足から1年も経過しておらず、サマーインターン1期生としてマルチモーダルなドキュメント(スライドや図表、グラフなど)に関連するR&D業務に取り組んでいます! 本記事では、2025年10月時点の OpenAI GPT および Google Gemini のAPI単体を用いた、マルチモーダルドキュメントの認識能力評価の結果を紹介します。 (本調査を行った直後に…
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み