中国のMiniMax、初のオープンAI動画モデルH3がランキング首位に
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Decoder
MiniMax が公開した H3 モデルが Artificial Analysis の評価で動画編集で1位、テキストから動画への変換で2位、画像から動画への変換で3 位となり、初めてオープンモデルがトップに立った。
AI深層分析を開く2026年8月3日 23:28
AI深層分析
キーポイント
オープンモデルによるランキング首位獲得
MiniMax が公開した H3 モデルが Artificial Analysis の評価で動画編集で1位、テキストから動画への変換で2位、画像から動画への変換で3 位となり、初めてオープンモデルがトップに立った。
高度なマルチモーダル処理能力
330億パラメータの H3 モデルはテキスト、画像、動画、音声を同時に処理し、最大 9 枚の写真、3 クリップの動画、3 クリップの音声を含む単一のプロンプトで 4〜15 秒のステレオサウンド付きクリップを生成する。
ローカル実行とライセンス制限
ComfyUI でのローカル実行は 768p に制限され、2K モジュールや H3-Context-IR は非公開だが、カスタム映像やスタイルへのファインチューニングが可能であり、年間収益 2000 万ドル未満の企業に限り商用利用が許可される。
重要な引用
MiniMax releases H3 video model weights, putting an open model at the top of a video ranking for the first time.
The 33-billion-parameter model processes text, images, video, and audio together, generating four- to 15-second clips with stereo sound.
Commercial use is only permitted for companies making under $20 million in revenue.
編集コメントを表示
編集コメント
中国の AI 企業がオープンソース戦略で世界トップクラスの性能を達成し、業界のバランスを変えつつある。商用利用における収益制限は、大規模企業にとって導入判断の重要な要素となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
MiniMax が動画生成モデル「H3」の重みを公開し、オープンソースモデルとして初めて動画評価ランキングで首位に輝きました。AI 評価サイト「Artificial Analysis」によると、H3 は「Video Editing(動画編集)」部門で1位、「Text-to-Video(テキストから動画へ)」で2位、「Image-to-Video(画像から動画へ)」で3位を獲得しています。
このパラメータ数330億のモデルは、テキスト、画像、動画、音声を統合的に処理し、ステレオサウンド付きで4〜15秒のクリップを生成します。モデルカードによると、単一のプロンプトには最大9枚の参照画像、3本の動画クリップ、3本の音声クリップを含めることが可能です。
*MiniMax H3 による動画*
ただし、一部機能はクローズド(非公開)のままです。2K解像度に対応するモジュールや、プロンプトや参照素材を構造化された中間形式に変換する「H3-Context-IR」は含まれていません。ComfyUI で H3 をローカル環境で実行する場合、最高解像度は 768p に制限され、コンテキストの事前準備についてはユーザー自身が MiniMax が公開しているプロンプトガイドを参照して行う必要があります。
オープン化された重みを用いれば、独自の映像素材やキャラクター、特定のビジュアルスタイルに合わせたファインチューニングは可能です。ライセンス面での注意点は、年間収益が 2,000万ドル未満の企業に限って商用利用が認められている点です。
同日、ByteDance もクローズドモデルの「Seedance 2.5」をリリースしました。こちらは内蔵オーディオ機能を備え、30秒間の動画クリップを生成できます。
AI ニュースを過剰な期待なしに – 人間が厳選した情報
広告なしで読んだり、週刊の AI ニュースレターを受け取ったり、年に6回発行される独占の「AI Radar」フロンティアレポートにアクセスしたり、アーカイブ全体を閲覧できたり、コメント欄を利用したりするには、THE DECODER に登録してください。
原文を表示
MiniMax releases H3 video model weights, putting an open model at the top of a video ranking for the first time. Artificial Analysis ranks H3 first in Video Editing, second in Text-to-Video, and third in Image-to-Video. The 33-billion-parameter model processes text, images, video, and audio together, generating four- to 15-second clips with stereo sound. According to the model card, a single prompt can include up to nine reference images, three video clips, and three audio clips.
*Video by **MiniMax H3*
Two pieces remain closed, though. The 2K resolution module and H3-Context-IR, which translates prompts and reference material into a structured intermediate format, aren't included. Running H3 locally in ComfyUI tops out at 768p, and users will need to handle context prep themselves using MiniMax's published prompting guides. The open weights do allow fine-tuning on custom footage, characters, or a specific visual style. One catch on the license side: commercial use is only permitted for companies making under $20 million in revenue.
ByteDance released its closed Seedance 2.5 the same day, which generates 30-second clips with built-in audio.
AI News Without the Hype – Curated by Humans
Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み