ページを読み込み中…
ページを読み込み中…
6件の記事
LangChain Blog は、データ抽出を効率化する新しいオープンソースサービスの提供を開始したと発表した。
Datalab が開発した 90 億パラメータのビジョンモデル「Lift」が、PDF や画像から直接スキーマ定義に従った JSON を生成する能力を、NuExtract3 や LlamaExtract など既存ツールと比較評価している。
MarkTechPost は、合成された請求書 PDF と構造化 JSON スキーマを活用し、単純な OCR ではなくスキーマ指向の文書理解として請求書情報を抽出するエンドツーエンドのパイプライン構築法を解説している。
MarkTechPost は、16GB GPU でも動作する Lift ベンドエンドを用い、研究 PDF から構造化データへ変換するワークフローと、制御された評価手法を解説している。
Datalab は、PDF や画像からスキーマに基づいて構造化 JSON を抽出する専用ビジョンモデル「lift」を公開した。この 9B パラメータのオープンウェイトモデルは、225 ドキュメントのベンチマークでフィールド精度 90.2% を達成している。