DeepSeek、画像理解機能を追加した実験的モデル「V4-Flash-Vision-Exp」を公開
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Decoder
中国のAI企業Deepseekが画像理解機能を追加した実験的モデル「V4-Flash-Vision-Exp」を公開し、同社ベンチマークではオープンエイトのOpus 4.8に匹敵するエージェント性能を示した。
AI深層分析を開く2026年8月22日 04:22
AI深層分析
キーポイント
高性能な視覚エージェントモデルの登場
Deepseekがテキスト処理能力を維持しつつ画像理解を追加した「V4-Flash-Vision-Exp」を発表し、内部ベンチマークでOpus 4.8にほぼ匹敵するスコアを記録した。
多様なエージェントワークフローへの対応
画像の説明、スクリーンショットからのテキスト抽出、図表分析などを実行可能とし、JPEGやPNGなどの主要フォーマットをファイル名ではなくコンテンツから自動判別する機能を備える。
既存APIとの互換性とフレームワーク連携
OpenAIのChat CompletionsおよびAnthropicのMessagesエンドポイントと互換性を持ち、Deepseekが公開したエージェント用フレームワーク「Harness」のバージョン0.1.1で即座に利用可能である。
柔軟な画像入力とコスト最適化機能
Base64埋め込み、URL参照(最大32 MiB)、および新規無料ファイルAPI(最大64 MiB)の3つの入力をサポートし、「detail」フィールドによる解像度ダウンサンプリングでトークンコストを削減できる。
画像処理の効率化とコスト制限
詳細が必要な場合を除き画像は512x512にダウンスケールされ、各画像あたりのトークン使用量は最大384で固定される。
重要な引用
On Deepseek's own benchmarks, the model nearly matches Opus 4.8 on agent tasks.
Deepseek is positioning the model for agent-based applications.
The Files API lets you upload a file once and reference it by ID across multiple requests.
Regardless of original resolution, each image costs at most 384 tokens.
編集コメントを表示
編集コメント
Deepseekが公開したベンチマーク結果は、中国のAI企業が画像理解分野でも急速に技術的成熟度を高めていることを示唆している。開発者は、OpenAIやAnthropicのモデルと比較してコストパフォーマンスを再評価する機会を得たと言えるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
中国の AI 企業 Deepseek は、テキスト処理能力に画像理解機能を追加した実験的多モーダルモデル「V4-Flash-Vision-Exp」を公開しました。Deepseek 独自のベンチマークでは、このモデルはエージェントタスクにおいて Opus 4.8 にほぼ匹敵する性能を発揮しています。
Deepseek-V4-Flash-Vision-Exp は、推論や世界知識における基本モデルのテキストパフォーマンスを維持したまま画像処理機能を追加しており、これにより Deepseek-V4-Flash の能力が拡張されます。これは Deepseek 側の発表です。同社の内部で実施された多モーダルエージェントベンチマークでは、画像対応版は Opus 4.8 とほぼ同等のスコアを記録しました。
Deepseek が狙うのは視覚エージェントワークフロー
Deepseek はこのモデルを、エージェントベースのアプリケーション向けに位置付けています。異なるエージェントフレームワークと連携し、視覚理解とツール使用を組み合わせて動作するように設計されています。具体的には、画像の説明やスクリーンショットからのテキスト抽出、図表の分析などが可能です。JPEG、PNG、GIF、WebP 形式に対応しており、ファイル名や宣言された MIME タイプではなく、実際のファイルコンテンツからフォーマットを判別します(API ドキュメント 参照)。

このモデルは、OpenAI の Chat Completions および Responses API と、Anthropic の Messages エンドポイントと連携して動作します。Deepseek はまた、新モデルをそのままサポートする Harness フレームワークのバージョン 0.1.1 も公開しました。
料金と画像制限
モデルへの画像送信には3つの方法があります。開発者は、Base64 エンコーディングで画像を直接埋め込むか、パブリックにアクセス可能な URL(最大 32 MiB)を指定するか、新しく無料の Files API を利用できます。Files API を使えば、ファイルを一度アップロードするだけで、その ID を参照して複数回のリクエストで再利用でき、サイズ制限は 64 MiB です。
オプションの "detail" フィールドを使えば、画像を 512 x 512 ピクセルに縮小できます。これにより、細かな視覚的詳細が不要な場合にトークン使用量を節約できます。モデルは処理前に、アスペクト比に応じて自動的に画像を約 800 x 800 ピクセルに正規化します。元の解像度に関わらず、1枚の画像あたりのコストは最大で 384 トークンです。料金は V4-Flash のレートに従います。
単一のリクエストには最大 600 枚の画像を含めることができます。エッジ長(1辺の長さ)の上限は 8,192 ピクセルですが、リクエスト内に 15 枚以上の画像が含まれると、この上限は 4,096 ピクセルに低下します。画像はユーザーメッセージ内でのみ使用可能です。
過剰な hype を排した AI ニュース – 人間が厳選
広告なしで記事を読んだり、週刊の AI ニュースレターを受け取ったり、年に6回発行される独占の「AI Radar」フロンティアレポートにアクセスしたり、アーカイブ全体を閲覧したり、コメント欄を利用したりするには、THE DECODER に購読してください。
原文を表示
Chinese AI company Deepseek has released V4-Flash-Vision-Exp, an experimental multimodal model that adds image understanding to its text capabilities. On Deepseek's own benchmarks, the model nearly matches Opus 4.8 on agent tasks.
Deepseek-V4-Flash-Vision-Exp extends Deepseek-V4-Flash with image processing while keeping the base model's text performance in reasoning and world knowledge, Deepseek says. On the company's internal multimodal agent benchmarks, the vision variant scores close to Opus 4.8.
Deepseek is targeting visual agent workflows
Deepseek is positioning the model for agent-based applications. It's designed to work with different agent frameworks and combine visual understanding with tool use. In practice, it can describe images, extract text from screenshots, and analyze diagrams. It handles JPEG, PNG, GIF, and WebP, and determines the format from actual file content rather than the filename or declared MIME type, per the API docs.

The model works with OpenAI's Chat Completions and Responses APIs and Anthropic's Messages endpoint. Deepseek also released version 0.1.1 of its Harness framework, which supports the new model out of the box.
Pricing and image limits
There are three ways to send images to the model. Developers can embed them directly with Base64 encoding, point to publicly accessible URLs (up to 32 MiB), or use the new, free Files API. The Files API lets you upload a file once and reference it by ID across multiple requests, with a size limit of 64 MiB.
An optional "detail" field downscales images to 512 x 512 pixels, saving tokens when fine visual detail isn't needed. The model automatically normalizes images to roughly 800 x 800 pixels depending on the aspect ratio before processing. Regardless of original resolution, each image costs at most 384 tokens. Pricing follows V4-Flash rates.
A single request can include up to 600 images. Max edge length is 8,192 pixels per side, but that drops to 4,096 pixels once a request contains 15 or more images. Images can only go in user messages.
AI News Without the Hype – Curated by Humans
Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み