私的AI研究会 > ComfyUI9e
「ComfyUI」を使ってローカル環境でのAI音楽生成を検証する
| 「ACE-Step 1.5」を使って音楽を作成してみる |
| 機能 | 詳細 |
| 生成速度 | A100: 0.5〜2秒 / RTX 3090: 10秒以内 |
| 生成時間 | 10秒〜10分(600秒)対応 |
| バッチ生成 | 最大8曲同時生成 |
| 対応言語 | 歌詞50言語以上 |
| スタイル | 1000+の楽器・スタイルに対応 |
| VRAM | 4GB未満で動作 |
| 商用利用 | 可(ライセンス準拠データで学習) |
| クリエイティブモード | ① テキストから音楽生成(Text to Music) ② 既存曲のスタイル変換(Cover) ③ 楽曲の特定セクションの再生成(Repaint) ④ 楽器レイヤーの重ね録り(Lego) ⑤ 音源の楽器分離(Extract) ⑥ ボーカルへのバッキング追加(Complete) |
| このプロジェクトで作成するワークフローと関連データは下記にアップロードしている(更新されている場合は再度ダウンロードのこと) |
📂ComfyUI ├─📂input ← ワークフローに含まれる入力画像 └─📂user └─📂default └─📂workflows ← ワークフローの保存場所 ├─📂_audio :・解凍してできる「ComfyUI/」フォルダを「StabilityMatrix/Data/Packages/ComfyUI」へ上書きコピーする
| ワークフロー | 機 能 | モデル | CPU | CPU | |||||
| RTX 4070 | RTX 4060 | RTX 4060L | RTX 3050 | GTX 1050 | i7-1260P | i7-1185G7 | |||
| 6101_ace_step_1_5_checkpoint | 音楽生成ワークフロー (AIO) | AIO | |||||||
| 6102_ace_step_1_5_split | 音楽生成ワークフロー | 1.7B | |||||||
| 6103_ace_step_1_5_split_4b | 音楽生成ワークフロー(4BのLLM) | 4B | |||||||
| モデル名 | ファイル名(.safetensors) | 配置先(/StabilityMatrix/Data/) | ダウンロード URL | 共通で使用 | |
| checkpoint | ace_step_1.5_turbo_aio | Models/ | StableDiffusion/ | ace_step_1.5_turbo_aio.safetensors | |
| diffusion_models | acestep_v1.5_turbo | DiffusionModels/ | acestep_v1.5_turbo.safetensors | ||
| text_encoders | qwen_0.6b_ace15 | TextEncoders | qwen_0.6b_ace15.safetensors | ||
| qwen_1.7b_ace15 | qwen_1.7b_ace15.safetensors | ||||
| qwen_4b_ace15 | qwen_4b_ace15.safetensors | ||||
| vae | ace_1.5_vae | VAE/ | ace_1.5_vae.safetensors | ||
| フォルダ | ワークフロー名 (.json) | モデル | 機能 (参照ページ) | 特記事項(同じ機能のワークフロー .json) |
| ACE-Step | 6101_ace_step_1_5_checkpoint | All In One | 音楽生成ワークフロー (AIO) | (audio_ace_step_1_5_checkpoint) |
| 6102_ace_step_1_5_split | 1.7B | 音楽生成ワークフロー | (audio_ace_step_1_5_split.json) | |
| 6103_ace_step_1_5_split_4b | 4B | 音楽生成ワークフロー(4BのLLM) | (audio_ace_step_1_5_split_4b.json) |
| 種類 | テンプレートの説明(AI による日本語訳) |
| ③ | ACE-Step 1.5 Music Generation AIOは、スタイルタグや歌詞を完全な曲に変換するテキストから音声へのComfyUIワークフローです。「モダンポップ、女性ボーカル、豊かなシンセ」といった短い説明と歌詞を伝えれば、グラフが残りをサンプリング、デコード、MP3のエクスポートを処理し、消費者向けハードウェアで数秒でアイデアをオーディションできます。明確なグループに整理されています。ステップ1:ロードモデル、ステップ2:持続時間、ステップ3:プロンプトなどで、チェックポイントの設定場所、トラックの長さ、モデルの歌声や音が常にわかります。 内部では、CheckpointLoaderSimpleがACE-Step 1.5のチェックポイント(ace_step_1.5_turbo_aio.safetensors)をロードします。TextEncodeAceStepAudio1.5は、あなたのスタイルタグや歌詞をACE固有の条件付けベクターに変換します。ConditioningZeroOutは、未使用の条件付けチャネルをクリーンに無効化するために使われます(例えば、二次プロンプトやネガティブプロンプトを提供していない場合など)、意図しないバイアスを防ぎます。EmptyAceStep1.5LatentAudioは、あなたが求める正確な期間だけ空の潜在音声キャンバスを作成します。ModelSamplingAuraFlowはACE-Step 1.5に適したサンプラー/スケジューラーの組み合わせを設定し、KSamplerはプロンプトに基づいて潜在要素を反復的に調整して一貫したトラックに仕上げます。VAEDecodeAudioは最終的な潜在音を波形音声に変換し、SaveAudioMP3はその結果をComfyUIの出力フォルダに書き込みます。PrimitiveNodeウィジェットは、ステップ、CFG、シード、秒などの実用的なノブを公開し、速度、品質、再現性を調整できます。 このセットアップは、速いソングライティングデモ、ジャンルの探求、コンテンツの整理に適しています。シードを通じて、持続時間を正確にコントロールでき、繰り返し可能なワークフローが実現します。グラフには合理的なデフォルトが付属しているので、ショートトラックを素早く生成し、ステップを上げたりスタイルタグや歌詞のフレージングを洗練させて品質を上げることができます。 |
| ④ | ACE-Step 1.5 Music Generation Workflowは、消費者向けハードウェアを用いてテキストプロンプトを数秒で高品質な音声曲に変換するよう設計されています。このワークフローはACE-Stepモデル、特に「acestep_v1.5_turbo.safetensors」を活用し、ユーザーが提供した音楽スタイルやオプションの歌詞の説明に基づいて音楽を解釈・合成します。TextEncodeAceStepAudio1.5やVAEDecodeAudioのような主要ノードは、それぞれテキスト入力のエンコードや生成された音声のデコードにおいて重要な役割を果たします。KSamplerノードは潜在空間のサンプリングに使用され、ModelSamplingAuraFlowノードは音声出力を洗練させ、高品質基準を満たすようにします。 このワークフローは効率性と音質の高さから特に有用です。ConditioningZeroOutやEmptyAceStep1.5LatentAudioのようなノードを使用することで、音声生成プロセスが効率化され、ユーザーの入力に集中していることが保証されています。SaveAudioMP3ノードの搭載により、最終製品を広く互換性のある形式で簡単にエクスポートできます。これにより、ワークフローは技術的に堅牢であるだけでなく、さまざまなアプリケーション向けに素早く音楽を生成するユーザーにとって非常に実用的です。 |
| ⑤ | このComfyUIワークフローは、ACE-Step 1.5の音楽生成モデルとその小型バリエーションを比較することに焦点を当てています。主な目的は、4Bモデル版の強化された音声理解と作曲能力を評価することです。テキストプロンプトを使って音楽を生成することで、ユーザーはモデル間の音質、複雑さ、音質の違いを探ることができます。このワークフローでは、KSampler、VAEDecodeAudio、TextEncodeAceStepAudio1.5などの様々なノードが用いられ、この比較を容易にしています。主な違いは、より複雑な作曲を扱う能力と、より豊かな音響テクスチャーを生み出す能力であり、特に長く複雑な音楽作品を生成する際に顕著です。 |
| タグ | 役割 | エネルギー |
| [Intro] | イントロ・雰囲気の設定、多くはインストゥルメンタル | 低〜中 |
| [Verse] / [Verse 1] / [Verse 2] | メインのストーリーテリングセクション | 中 |
| [Pre-Chorus] | コーラス前の緊張感の盛り上がり | 中〜高 |
| [Chorus] | 感情的なピーク・最もエネルギーが高い | 最高 |
| [Bridge] | 異なるメロディ・異なる感情へのシフト | 変化 |
| [Instrumental] / [inst] | ボーカルなし・楽器のみ | 自由 |
| [Outro] | 曲の締めくくり、フェードアウトも | 低下 |
| [Drop] | EDM等のドロップセクション | 爆発 |
| [Build] | 盛り上がりへの構築 | 上昇 |
| タグ | 意味 |
| タグには修飾子を付けてパフォーマンスの方向性を指定できる | |
| [Chorus - anthemic] | 壮大なコーラス |
| [Bridge - whispered] | ウィスパーのブリッジ |
| [Intro - slow acoustic guitar] | ゆったりとしたアコースティックギターのイントロ |
| [Verse 1 - soft and intimate] | 柔らかく、親密な 第1節 |
| [Chorus - anthemic, full band] | コーラス — アンセム風、フルバンド |
| [Bridge - whispered] | ブリッジ ― 囁き |
| [Chorus - big and explosive] | コーラス ― 壮大で爆発的 |
| [Outro - fade out] | アウトロ - フェードアウト |