DeepSeek、実験的多模態モデル「V4-Flash-Vision-Exp」を API プラットフォームに公開
本文の状態
日本語全文を表示中
詳細モードで約4分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
DeepSeek Blog
中国の AI 企業 DeepSeek は、2026 年 8 月 21 日、テキストと画像理解能力を両立した実験的モデル「DeepSeek-V4-Flash-Vision-Exp」を API に追加し、Agent 応用への展開を促進すると発。
AI深層分析を開く2026年8月21日 23:17
AI深層分析
キーポイント
実験的モデルの公開と性能特性
DeepSeek は「DeepSeek-V4-Flash-Vision-Exp」を公式 API に追加し、純粋なテキスト能力は既存の V4-Flash と同等に保ちつつ、多模態 Agent ベンチマークにおいて Opus-4.8 に迫る性能を実現した。
拡張された Agent 適用事例
同モデルは複雑な指示に基づく西藏旅行 PPT の生成や、特定ビジュアルスタイルでの Web サイト再構築、動的エフェクトの作成など、多様な Agent フレームワークでの実用性を示した。
API 利用と課金体系
ユーザーは model パラメータを指定してアクセス可能で、画像はトークン化され 1 枚あたり最大 384 トークンとして V4-Flash と同価格で課金される。
Files API の新機能追加
新規に開放された Files API は無料で、画像を事前にアップロードして file_id で参照する仕組みを提供し、重複アップロードによる帯域幅の節約を可能にする。
重要な引用
DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8
图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致
Files API 现已开放,该 API 不收费,用户可先将图片上传到平台,再在请求中通过 file_id 引用
編集コメントを表示
編集コメント
DeepSeek がテキストと画像の両方で高い性能を維持しつつ、Agent 応用領域での実用性を明確に示した点は注目される。特に Files API の無料提供は、大規模な画像処理を伴うアプリケーション開発におけるコスト構造を改善する可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
DeepSeek-V4-Flash-Vision-Exp の公開と多モーダル API サービスの開始
2026 年 8 月 21 日 17:12 北京発
視覚理解能力の飛躍的向上が、より多くの Agent 活用シーンを可能にします。
本日、実験的な多モーダル視覚理解モデル「DeepSeek-V4-Flash-Vision-Exp」が DeepSeek API プラットフォームにて公開されました。このモデルへのアクセスには、model='deepseek-v4-flash-vision-exp' と設定する必要があります。
テキストと多モーダルのバランス
- 公開されたベンチマークセットにおける Code Agent のテキストタスクでは、DeepSeek シリーズモデルは「DeepSeek Harness」の簡易モードをフレームワークとして使用し、max レベルでテストを行いました。パラメータは temperature=1.0、topp=0.95 です。
** ApexBench および Agents' Last Exam の評価において、テキストモデルである DeepSeek-V4-Flash は、其中的な多モーダル要素を無視して処理されます。
純粋なテキスト能力(Agent 機能、推論、世界知識など)においては、DeepSeek-V4-Flash-Vision-Exp は正式版の DeepSeek-V4-Flash と同等のパフォーマンスを発揮します。
一方、視覚理解を必要とする Agent Benchmark では、DeepSeek-V4-Flash-Vision-Exp は DeepSeek-V4-Flash に比べて大幅な向上を示し、その多モーダル Agent 能力は Opus-4.8 にほぼ匹敵するレベルに達しています。
多モーダル能力による新たな Agent シーンの開拓
V4-Flash-Vision-Exp は、さまざまな Agent フレームワークにおいて優れた多モーダル適合性を示し、多様な Agent ツールを活用して実用的な業務シーンを切り開くことを可能にします。
事例 1:Agent フレームワークを用いた西藏自驾游(個人旅行)向け PPT の生成
プロンプト:
「西藏の旅行攻略 PPT を作成してください。対象は『南チベット』と『北チベット』を巡る 1 ヶ月の旅程です。目的は高級カスタムツアーであり、他社とは異なる完全なプライベートサービスを提供します。
核となるコンセプトは『野性』『原始』『探求心』です。一般的な観光ルートではなく、未開の地への深入りを体験できるような内容にしてください。
ビジュアルスタイルは、大気感があり、粗削りで力強いものにしてください。小清新やインフルエンサー風のデザインは避けてください。
この PPT は高資産層の顧客向けです。十分かつ大胆で野性的、そして高級感のある美しい仕上がりを目指してください。最終的には 3 つの実在する価格プランを提示します。
すべての画像は、本物の写真のような質感(実写風)を使用してください。」
スワイプして上下にスクロールするか、クリックして拡大すると、PPT の各ページの内容を完全に確認できます。
例 2:DeepSeek Harness 公式サイトに対する二次創作
要求モデルに、黒と青の深海をイメージした背景や、ガラスのような UI、アトムのピクセル表現などを用いた視覚要素を取り入れ、長期間にわたる多段階の対話を経て再構築された、未来主義的な開発者向けウェブサイトの例。
例 3:粘土細工風の怪物をモチーフにした動的エフェクトを実現するフロントエンド用ミニデモ
提示モデルは、「一群の愛らしい 3D クレイ小怪物が、躍動するレトロなダンスフロアのパーティーに参加する」というインスピレーションに基づいて生成されました。
API サポート
ユーザーは model='deepseek-v4-flash-vision-exp' を設定することで、V4-Flash-Vision-Exp モデルの API にアクセスできます。この API サービスでは、画像はトークンに変換され、トークン数に応じて課金されます。1 枚の画像あたり最大 384 トークンを消費し、料金は V4-Flash モデルと同じです。
多模態 API は Chat Completions、Messages、Responses の 3 つの形式で呼び出しをサポートしており、さまざまな Agent ツールへの接続が容易です。テキストと画像を混合した入力に対応し、base64 インライン、外部 URL、Files API という 3 つの方法で画像を入力できます。詳しい利用方法は公式 API ドキュメント「API ガイド - 画像理解」をご覧ください。
Files API の公開
Files API が現在利用可能になりました。この API は無料です。ユーザーはまず画像をプラットフォームにアップロードし、その後リクエスト内で file_id を参照して使用できます。これにより、通信帯域幅の節約が可能になります。同じ画像を複数のリクエストで使用する際も、再度アップロードする必要はありません。詳しい利用方法は公式 API ドキュメント「API ガイド - Files API」をご覧ください。
WeChat で開くにはこちら
原文を表示
原创 深度求索 2026-08-21 17:12 北京
image
视觉理解能力跃升,赋能更多 Agent 应用场景
今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。
平衡文本与多模态能力
*对于公开基准测试集中的 Code Agent 文本任务,DeepSeek 系列模型使用 DeepSeek Harness 极简模式作为框架进行测试,使用 max 档位,temperature=1.0,topp=0.95;
**在 ApexBench 与 Agents' Last Exam 测评中,文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素。
在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
多模态能力解锁更多 Agent 场景
V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。
示例1:在 Agent 框架下生成商业定制西藏自驾游 PPT
Prompt:帮我做个西藏攻略的ppt,藏南+藏北,一个月,自驾游,我是高端定制游,只做私人服务,和别的旅行团不一样,核心调性:野性、原始、探索感——不是常规打卡路线,是深入无人区级别的体验。视觉风格要大气、粗粝、有力量感,拒绝小清新和网红风。ppt要发送给高净值客户,要足够大气、野性、高端美观且最后给到三种真实定价方案,所有配图使用真实摄影图片风格(实拍质感)
上下滑动或点击放大查看 PPT 内页完整内容效果
示例2:对 DeepSeek Harness 官网进行二次创作
要求模型用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,
经过长多轮交互后重构得到的未来主义风格开发者网站
示例3:制作黏土怪物风格动态特效的前端 Mini Demo
提示模型在“一群可爱的 3D 黏土小怪物加入一个跃动的复古舞池派对”的灵感下进行创作
API 支持
用户可以通过设置 model='deepseek-v4-flash-vision-exp' 来访问 V4-Flash-Vision-Exp 模型的 API。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。
多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。使用说明请参考官方 API 文档:API 指南 - 图像理解。
Files API 上线
Files API 现已开放,该 API 不收费,用户可先将图片上传到平台,再在请求中通过 file_id 引用,从而节省请求带宽。同一张图片在多个请求中无需重复上传。详细使用说明请参考官方 API 文档:API 指南 - Files API。
跳转微信打开
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み