私的AI研究会 > ComfyUI9f
画像生成AI「ComfyUI」9(動画編6) == 編集中 ==†
「ComfyUI」を使ってローカル環境でのAI画像生成を検証する
▼ 目 次
▲ 目 次
※ 最終更新:2026/08/14
MinMax H3 による音声付き動画生成†
| 2026年7月発表されたテキスト、画像、動画、音声をひとつの文脈として同時に処理できる最新の汎用マルチモーダル動画生成AIモデルの検証 |
- 「MinMax H3」とは
- 中国の AI企業 MiniMax が2026年7月31日に発表した最新の動画生成AI・汎用オムニモーダルモデル
- テキスト、画像、動画、音声をひとつの文脈として扱い、最大15秒・2K解像度の高品質な動画をワンパス(1回の推論)で出力できるのが特徴
- 主な特徴
- 音声同時生成(ネイティブステレオ): 映像の動きやカメラワーク、セリフ、効果音、BGMなどが完全に同期した32kHzステレオ音声を同時に出力する
- オープンウェイトの公開: 同社として初めてモデルの重み(Baseモデル)がオープン化
Hugging Face などのプラットフォームを通じて ComfyUI などのローカル環境でも利用可能になっている
- 多様な生成・参照機能: テキストから動画を作る「T2V」、画像を動かす「I2V」、人物や画風・声などを参照する「Ref2V(R2V)」などのワークフローに対応
プロジェクトで作成するワークフロー†
| このプロジェクトで作成するワークフローと関連データは下記にアップロードしている(更新されている場合は再度ダウンロードのこと) |
動画生成のための環境構築†
- 必要モデルのダウンロード と配置
Step 1:オフィシャルサイトの標準テンプレートからワークフローを作成†
更新履歴†
参考資料†