ComfyUI、5月に11モデル追加
ComfyUI Blog は、Netflix の動画除去モデル VOID や Google DeepMind の大規模オープンモデル Gemma 4 など、11 の新機能を統合し、マルチモーダル処理と生成能力を大幅に強化した。
キーポイント
多様な分野での新モデル統合
動画、画像、3D、音声、マルチモーダルを含む 11 の新モデルが ComfyUI に統合され、Krea 2 や Luma UNI-1 など、既存の技術的限界を突破する機能が追加された。
Netflix VOID と BiRefNet の連携
Netflix がオープンソース化した VOID は単なるピクセル消去ではなく物理的な相互作用(影や反射)まで除去し、BiRefNet と組み合わせることで静止画と動画の背景除去が高度に統合される。
大規模オープンモデルとローカル実行
Google DeepMind の Gemma 4 や Anthropic の Claude が ComfyUI に導入され、特に Gemma 4 は単一 GPU やスマホで動作可能ながら高性能を維持し、ローカルでの高度な推論を可能にする。
3D 生成と編集パイプラインの進化
Tripo 3.1 と MoGe の統合により、テキストや画像から 3D モデルおよび幾何学情報を生成するエンドツーエンドのパイラインが完成し、Gaussian スプライト技術との連携も強化された。
重要な引用
Most inpainting tools erase pixels. VOID removes the subject and everything it caused — shadows, reflections, physical interactions.
Not a diffusion model. Luma's Uni-1 is a decoder-only autoregressive transformer — it reasons through your prompt before generating.
Google's best open model family yet... runs on a phone or a single GPU.
影響分析・編集コメントを表示
影響分析
この更新は、ComfyUI のエコシステムを単なるノードの集合体から、Netflix や Google DeepMind などの主要プレイヤーが提供する最先端モデルを実装できる包括的なプラットフォームへと進化させた。特に、オープンソースの高品質モデル(VOID, Gemma 4)とローカル実行環境の強化により、企業や個人開発者がクラウド依存なしで高度な AI 生成・編集ワークフローを構築・運用する可能性が飛躍的に高まった。
編集コメント
Netflix の VOID や Google DeepMind の Gemma 4 など、業界をリードする企業が提供する最新モデルが ComfyUI に直接統合されたことは、ローカル環境での高度な AI 開発のハードルを劇的に下げた画期的な出来事です。特に物理的な相互作用まで考慮した動画除去や、推論能力を備えた画像生成モデルの実装は、クリエイティブワークフローの質と効率を一段階引き上げるものです。
ComfyUI ブログをお読みいただき、ありがとうございます。無料で購読いただければ、新着投稿の受け取りと私の活動への支援が可能です。
見逃した方のために、5 月のまとめをお届けします。
今月は動画、画像、3D、音声、マルチモーダル分野を跨ぐ 11 の新しいモデルを導入しました。
ここからは新機能をご紹介します。
Krea 2 — Krea AI · 画像とスタイル転送
Krea の最初の基盤モデルは、ComfyUI パートナーノードとしてリリース初日から利用可能です。多くの画像生成モデルが「フレーム内に何が含まれるか」で競い合う中、Krea 2 は「どのように見えるか」に焦点を当てています。イラスト、アニメ、フォトリアリズムなど、スタイル参照やムードボードを通じて、幅広い美的表現を実現します。
Void — Netflix · ビデオオブジェクト除去
Netflix がオープンソース化した VOID(Video Object and Interaction Deletion)は、単なるピクセルの消去ではありません。被写体だけでなく、その影、反射、物理的な相互作用など、被写体が引き起こしたすべての要素を削除します。Apache 2.0 ライセンスで、ネイティブサポートも提供されています。
Tripo 3.1 — Tripo AI · 3D 生成
テキストからモデルへ、画像からモデルへ、マルチビューからモデルへと、一つのノードで完結します。TripoSplat と組み合わせれば、画像から 3D ガウシアンまでをエンドツーエンドで処理する完全なパイプラインが構築可能です。
Luma UNI-1 — Luma AI · 画像編集
拡散モデルではありません。Luma の Uni-1 はデコーダー専用自己回帰トランスフォーマーであり、生成前にプロンプトの内容を推論します。参照処理能力が高く、より精密な編集が可能です。作成モードと修正モードに対応し、最大 9 枚の参照画像を使用できます。今年登場したモデルの中で、アーキテクチャ的に最も興味深い画像生成モデルの一つです。
Claude — Anthropic · マルチモーダル
ComfyUI に Claude がついに登場しました。プロンプト作成、ワークフローの推論、多モーダル理解など、言語知能をパイプラインのあらゆる場所で活用できます。
OpenRouter · テキスト
単一のノードで 20 以上の大規模言語モデル(LLM)にアクセス可能です。タスクに適したモデルを、ワークフローから離れることなく自動的に選定・ルーティングできます。
Gemma 4 — Google DeepMind · 多モーダル
Google が提供するオープンモデルファミリーの中で最も優れたもの。テキスト、画像、音声、動画を処理でき、スマートフォンや単一の GPU でも動作します。31B パラメータ版はオープンなアレーナリーダーボードで第 3 位を記録。ライセンスは Apache 2.0 で、コンテキストウィンドウは 256K です。
HidDream-O1-Image — Hidream.ai · 画像生成
推論に基づく画像生成を実現するモデルです。外部の VAE や断片的なテキストエンコーダーに依存せず、ピクセルレベルで統合されたトランスフォーマー(UiT)を基盤としたオープンソースモデル。複雑な構成プロンプトにおいて、多くのモデルが破綻する場面でも高い性能を発揮します。
Stable Audio 3 — Stability AI · オーディオ・効果音
音楽、効果音、そして実制作レベルのオーディオを生成するテキストから音声へのモデルです。サウンドデザインのためのツールキットがついに ComfyUI に搭載されました。
BiRefNet — CAAI AIR · 背景除去
高解像度の背景セグメンテーションを実現します。VOID と相性が良く、静止画は BiRefNet が、動画は VOID がそれぞれ担当する構成が自然に機能します。
MoGe — Microsoft · 3D 幾何学・深度
単一の画像から完全な 3D 幾何情報を取得可能。点マップ、深度、法線ベクトル、カメラの視野角(FOV)を、1 つの前向きパスで同時に出力します。CVPR '25 のオーラル発表モデルが、いよいよあなたのツールキットに加わりました。
ComfyHub の勢いが加速中
登録されたワークフロー数が 500 を突破しました。
最近閲覧していない方は要注意。あなたがこれから作ろうとしているワークフローは、すでに誰かが作成している可能性が高いです。
6 月の更新もお楽しみに!
ComfyUI ブログをお読みいただき、ありがとうございます。新しい投稿を受け取り、私の活動をサポートするために、無料で購読してください。
(注:原文のタイトル「May Wrapped (続き 3/3)」は、本文に該当する記事内容が含まれていないため、リライト対象から除外しました。提供されたテキストはブログへの感謝と購読依頼のみです。)
原文を表示
Thanks for reading ComfyUI Blog! Subscribe for free to receive new posts and support my work.
If you blinked, here’s the catch-up.
In May we integrated 11 new models spanning video, image, 3D, audio, and multimodal.
Here’s what’s new.
Krea 2 — Krea AI · Image & Style Transfer
Krea’s first foundation model, live as a ComfyUI Partner Node on day one. Most image models compete on what’s in the frame. Krea 2 competes on how it looks — style references, moodboards, and aesthetic range across illustration, anime, photorealism, and beyond.
Void — Netflix · Video Object Removal
Netflix open-sourced VOID (Video Object and Interaction Deletion). Most inpainting tools erase pixels. VOID removes the subject and everything it caused — shadows, reflections, physical interactions. Apache 2.0, natively supported.
Tripo 3.1 — Tripo AI · 3D Generation
Text-to-model, image-to-model, and multiview-to-model in one node. Pair it with TripoSplat and you have a full image-to-3D-Gaussian pipeline, end to end.
Luma UNI-1 — Luma AI · Image Editing
Not a diffusion model. Luma’s Uni-1 is a decoder-only autoregressive transformer — it reasons through your prompt before generating. Stronger reference handling, more precise editing. Create and Modify modes, up to 9 reference images. One of the most architecturally interesting image models of the year
Claude — Anthropic · Multimodal
Claude is now accessible inside ComfyUI. Prompt writing, workflow reasoning, multimodal understanding — language intelligence anywhere in your pipeline.
OpenRouter · Text
Access to 20+ LLM models through a single node. Route to the right model for the right task without leaving your workflow.
Gemma 4 — Google DeepMind · Multimodal
Google’s best open model family yet. Text, image, audio, and video — runs on a phone or a single GPU. The 31B model sits at #3 on the open Arena leaderboard. Apache 2.0, 256K context window.
HidDream-O1-Image — Hidream.ai · Image
Reasoning-guided image generation. Open source model built on a Pixel-level Unified Transformer (UiT) without external VAEs or disjoint text encoders. Strong on complex compositional prompts where most models fall apart.
Stable Audio 3 — Stability AI · Audio & SFX
Text-to-audio covering music, sound effects, and production-ready audio. Your sound design toolkit, now in ComfyUI.
BiRefNet — CAAI AIR · Background Removal
High-resolution background segmentation. Pairs naturally with VOID — BiRefNet handles stills, VOID handles motion.
MoGe — Microsoft · 3D Geometry & Depth
Full 3D geometry from a single image — point maps, depth, normals, and camera FOV in one forward pass. A CVPR ‘25 Oral, now in your toolkit.
ComfyHub is gaining momentum
Crossed 500+ workflows on the Hub
If you haven’t browsed lately, there’s a good chance someone already built the workflow you were about to make.
Stay tuned for June!
Thanks for reading ComfyUI Blog! Subscribe for free to receive new posts and support my work.
関連記事
今日のまとめ
AI日報で今日の重要ニュースをまとめ読み