Qwen Image Agent(12 分読み)
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
アリババ傘下の通義千問チームが、計画・推論・検索・記憶・フィードバックを活用して画像生成の精度を向上させた Qwen-Image-Agent を発表し、評価指標 IA-Bench も導入した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
著者:Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu
**
抄録:テキストから画像への変換(T2I)モデルは目覚ましい進歩を遂げていますが、しばしば不十分であったり、暗黙的であったり、最新の情報に依存する現実世界の要求には対応が困難です。私たちはこの課題を「コンテキスト・ギャップ」として特定しました。これは、ユーザーの文脈と T2I モデルにとって十分な生成文脈との間の不一致です。このギャップを埋めるために、私たちは Qwen-Image-Agent を提案します。これは、計画、推論、検索、記憶、フィードバックを文脈中心的方式で統合した統一されたエージェントフレームワークです。Qwen-Image-Agent はユーザー入力を部分的な文脈として扱い、文脈認識型プランニングと文脈グラウンディングを通じて生成文脈を段階的に構築します。具体的には、文脈認識型プランニングは不足している文脈を特定し、それをどのように取得して利用すべきかを計画します。一方、文脈グラウンディングは、推論、検索、記憶、フィードバックからこの文脈を集めます。エージェントによる画像生成を評価するために、さらに Image Agent Bench(IA-Bench)を導入しました。これは、プラン、推論、検索、記憶という 4 つのコアな画像エージェントの能力を網羅するベンチマークです。IA-Bench、Mindbench、WISE-Verified における実験により、Qwen-Image-Agent が強力なベースラインを上回り、最先端のパフォーマンスを達成することが示されました。
分野:
コンピュータビジョンとパターン認識(cs.CV)
引用形式:
arXiv:2606.26907 [cs.CV]
(または、このバージョンについては arXiv:2606.26907v2 [cs.CV] を参照してください)
https://doi.org/10.48550/arXiv.2606.26907 arXiv-issued DOI via DataCite
提出履歴
送信者: Zekai Zhang [メールを表示]
[v1]**
木曜日、2026年6月25日 11時40分12秒 UTC (7,967 KB)**
[v2]**
金曜日、2026年6月26日 14時10分09秒 UTC (7,957 KB)
原文を表示
Authors:Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu
Abstract:While text-to-image (T2I) models have achieved remarkable progress, they struggle with real-world requests that are often underspecified, implicit, or dependent on up-to-date knowledge. We identify this challenge as the Context Gap: the mismatch between the user context and the sufficient generation context for T2I models. To bridge this gap, we propose Qwen-Image-Agent, a unified agentic framework that integrates plan, reason, search, memory and feedback in a context-centric manner. Qwen-Image-Agent treats user input as partial context and progressively constructs the generation context through Context-Aware Planning and Context Grounding. Specifically, Context-Aware Planning identifies missing context and plans how it should be acquired and used, while Context Grounding gathers this context from reason, search, memory, and feedback. To evaluate agentic image generation, we further introduce Image Agent Bench (IA-Bench), a benchmark covering four core image agent capabilities: Plan, Reason, Search, and Memory. Experiments on IA-Bench, Mindbench and WISE-Verified show that Qwen-Image-Agent outperforms strong baselines and achieves state-of-the-art performance.
| Subjects: | Computer Vision and Pattern Recognition (cs.CV) |
|---|---|
| Cite as: | arXiv:2606.26907 [cs.CV] |
| (or arXiv:2606.26907v2 [cs.CV] for this version) | |
| https://doi.org/10.48550/arXiv.2606.26907 arXiv-issued DOI via DataCite |
Submission history
From: Zekai Zhang [view email] [[v1]](https://arxiv.org/abs/2606.26907v1)
Thu, 25 Jun 2026 11:40:12 UTC (7,967 KB)**
[v2]**
Fri, 26 Jun 2026 14:10:09 UTC (7,957 KB)
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み