私的AI研究会 > ComfyUI10
「ComfyUI」を使ってローカル環境でのAI画像生成を検証する
| 今話題の最新モデル『Z-Image』を検証する(VRAM 12GB 以下の小規模環境で実行可能なものに限定) |
| 高速かつ高品質な画像を生成することができると評価の高い最新の画像生成AIモデル『Z-Image-Turbo』を検証する |
| 項目 | 仕様 |
| 必要VRAM | 16GB未満(<16GB VRAM)で動作 |
| 推奨解像度 | 1024×1024(学習時の標準解像度) |
| 対応解像度範囲 | 512×512〜2048×2048まで生成可能 |
| このプロジェクトで作成するワークフローと関連データは下記にアップロードしている(更新されている場合は再度ダウンロードのこと) |
📂ComfyUI ├─📂input ← ワークフローに含まれる入力画像 └─📂user └─📂default └─📂workflows ← ワークフローの保存場所 : ├─📂etc └─📂z_imzge ← この章で作成するワークフロー・解凍してできる「ComfyUI/」フォルダを「StabilityMatrix/Data/Packages/ComfyUI」へ上書きコピーする
| ワークフロー | 機 能 | CPU | CPU | |||||
| RTX 4070 | RTX 4060 | RTX 4060L | RTX 3050 | GTX 1050 | i7-1260P | i7-1185G7 | ||
| 2200_z_image_turbo_t2i | Text to Image 基本フロー(蒸留版) | 00:05.00 | 00:16.47 | 03:15.71 | 22:40.76 | 16:54.70 | ||
| 2201_z_image_turbo_t2i_simple | T2I 基本フロー(蒸留版・展開版) | 00:05.08 | 00:18.81 | 03:24.71 | 19:14.97 | 17:19.41 | ||
| 2202_z_image_turbo_i2i | Image to Image 基本フロー(蒸留版) | 00:05290 | 00:17.66 | 03:14.82 | 23:45.92 | 17:21.00 | ||
| 2203_z_image_turbo_i2i_simple | I2I 基本フロー(蒸留版・展開版) | 00:05.00 | 00:18.38 | 03:24.18 | 24:49.79 | 17:39.75 | ||
| 2210_z_image_base_t2i | Text to Image 基本フロー(通常版) | 01:18.70 | 00:45.10 | 33:42.04 | 05H44:47.87 | 03H14:04.84 | ||
| 2211_z_image_base_t2i_simple | T2I 基本フロー(通常版・展開版) | 00:55.55 | 00:45.39 | 34:38.07 | 04H22:19.14 | 03H13:19.51 | ||
| 2212_z_image_base_i2i | Image to Image 基本フロー(通常版) | 00:33.88 | 01:43.16 | 24:30.88 | 04H33:25.50 | 02H20:25.78 | ||
| 2213_z_image_base_i2i_simple | I2I 基本フロー(通常版・展開版) | 00:44.63 | 02:16.66 | 33:35.73 | 05H46:38.76 | 03H13:01.17 | ||
| image_z_image_turbo | Z-Image-Turbo 標準テンプレート | 00:05.62 | 00:13.96 | 00:21.22 | 00:26.36 | 03:15.97 | 17:20.62 | 17:06.47 |
| 2101_z_image_turbo_simple | Z-Image-Turbo 基本ワークフロー | 00:07.46 | 00:18.99 | 00:27.22 | 00:39.74 | 05:05.45 | 34:09.71 | 27:47.87 |
| 2102_z_image_turbo_controlnet | Z-Image-Turbo コントロールネット | 00:07.22 | 00:21.02 | 00:29.68 | 00:43.61 | 05:38.72 | 41:15.66 | 31:09.73 |
| image_z_image_base | Z-Image-Base 標準テンプレート | 00:44.88 | 01:51.22 | 01:58.97 | 03:06.63 | 32:52.39 | 03H21:29.30 | 02H19:19.53 |
| 2111_z_image_base_simple | Z-Image-Base 基本ワークフロー | 00:48.62 | 01:28.12 | 02:32.88 | 04:10.93 | 22:57.94 | 03H38:58.48 | 03H19:24.86 |
| 2191_z_image_turbo_auto | 日本語プロンプトで画像生成> | 00:56.10 | 01:07.89 | 01:07.94 | 02:55.18 | 07:13.26 | 01H09:50.82 | 01H37:16.25 |
| モデル名 | ファイル名(.safetensors) | 配置先 | ダウンロード URL | |
| Z-Image-Turbo本体 diffusion_models | z_image_turbo_nvfp4 | /StabilityMatrix/Data/ Models/ | diffusion_models/ | https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/diffusion_models |
| z_image_turbo_bf16 | ||||
| テキストエンコーダー text_encoders | qwen_3_4b_fp4_mixed | text_encoders/ | https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/text_encoders | |
| qwen_3_4b_fp8_mixed | ||||
| qwen_3_4b | ||||
| vae | ae | VAE/ | https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/vae | |
| LoRA | Z-Image-Turbo-DistillPatch | Lora/ | https://huggingface.co/Kutches/ImageZ/blob/4d384de2e0993c5e127ea2cb95d57e018e2b52bd/Z-Image-Turbo-DistillPatch.safetensors | |
| ControlNet | Z-Image-Turbo-Fun-Controlnet-Union | ModelPatches/ | https://huggingface.co/alibaba-pai/Z-Image-Turbo-Fun-Controlnet-Union/tree/main | |
| turbo (distilled 蒸留版) | base版 | ||
| nvfp4 | bf16 | bf16 | |
| モデル名 (.savtensors) | z_image_turbo_nvfp4 | z_image_turbo_bf16 | z_image_bf16 |
| サイズ (GB) | 4.19 | 11.4 | 11.4 |
| 生成画像 | ![]() | ![]() | ![]() |
| 生成時間 (分:秒) | turbo (distilled 蒸留版) | base版 | ||
| nvfp4 | bf16 | bf16 | ||
| GPU | RTX-4070 | 00:07.46 | 00:55.01 | 00:35.91 |
| RTX-4060 | 00:18.99 | 01:15.14 | 01:28.12 | |
| RTX-4060L | 00:27.22 | 00:56.61 | 02:27.91 | |
| RTX-3050 | 00:39.74 | 03:30.16 | 04:10.93 | |
| GTX-1050 | 05:05.45 | 05:01.53 | 23:17.65 | |
| CPU | i7-1260P | 34:09.71 | 36:25.75 | 283:57.25 |

| ・テンプレートのオリジナル・ワークフローに対して「① モデルの変更, ② シード値を固定(同じ画像を再現できるように)」を変更する ・生成途中画像表示と生成結果プレビュー画像表示の追加 |
| オリジナルのワークフローを整理して FHD(1920x1080) 画面内に一括表示できるようにする |
| プロンプト |
|
Close-up portrait of a young woman in her 20s, natural makeup, soft expression. 85mm lens, f/1.4, shallow depth of field, bokeh background. Soft window light from the left, golden hour glow, warm skin tones. Cinematic, realistic, high detail, professional photography. NOT: oversaturated, anime style, low resolution, distorted face. |
| 20代の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。 85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。 左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。 映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。 注意点:彩度過度、アニメ調、低解像度、歪んだ顔。 |
| プロンプト |
|
A luxury-style bilingual (Japanease + English) poster advertisement for a minimalist wireless earphone. Show the product on a matte black surface with premium studio lighting, soft highlights on metal edges, deep controlled shadows, and flawless color accuracy. Textures should appear refined and tactile, with micro-detail clarity and a high-end commercial finish. Design the poster in an elegant, high-fashion aesthetic: generous negative space, balanced composition, and minimal visual noise. Use a sophisticated monochrome palette with subtle gold or silver accents to emphasize the premium feel. Include a minimal English headline: “Pure Sound. Perfect Silence.” Add the Japanease counterpart in refined typography: “純粋な音 · 静寂の極み”. Place a small bilingual tagline beneath: “Wireless Crafted Quality · 職人技が宿る仕上り”. Ensure the text integrates naturally with the design without distracting from the product. Background should be a smooth gradient charcoal black with a luxury ambiance. Use centered composition, vertical 3:4 aspect ratio, no logo, no watermark. |
| ミニマルなワイヤレスイヤホンの、高級感あふれるバイリンガル(日本語+英語)ポスター広告です。 マットブラックの表面に、プレミアムスタジオ照明、金属エッジの柔らかなハイライト、深くコントロールされた陰影、そして完璧な色彩精度で製品を映し出します。 テクスチャは洗練され、触感があり、微細なディテールまで鮮明で、高級感のある商業的な仕上がりを実現します。 ポスターは、エレガントでハイファッションな美学に基づき、十分なネガティブスペース、バランスの取れた構成、そして最小限の視覚的ノイズでデザインします。 洗練されたモノクロパレットに、さりげないゴールドまたはシルバーのアクセントを加え、高級感を強調します。 簡潔な英語の見出し「Pure Sound. Perfect Silence.」を記載します。 洗練されたタイポグラフィで日本語の見出し「純粋な音・静寂の極み」を追加します。 その下に、小さなバイリンガルのタグライン「Wireless Crafted Quality・職人技が宿る仕上り」を配置します。 テキストは、製品から気を散らすことなく、デザインに自然に溶け込むようにしてください。 背景は、高級感のある滑らかなグラデーションのチャコールブラックにしてください。 中央配置、縦長の3:4アスペクト比、ロゴや透かしは使用しないでください |
| ワークフロー:「z_image/」2102_z_image_turbo_controlnet_v2.json | 改良点 |
![]() | ・それぞれの「ControlNet」ノード出力を切り替えることで、ワークフローを接続し直す必要がないようにした → ノードをスイッチで切り替える「rgthree-comfy」 ・「Fast Muter」ノードの該当項目をクリックすることで「ControlNet」の各機能を実行することができる |
| モデルによる検証例: → Z-Imageの例 → HiDream-O1の例 → ERNIE-Imageの例 → FLUX.2 kleinの例 |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
| プロンプト → z-image の例 | |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
| プロンプト → z-image の例 | |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
| プロンプト → FLUX.2 の例 | |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
| プロンプト → FLUX.2 の例 | |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
![]() | ![]() |
![]() | ![]() |
| プロンプト → z-image の例 | |
| 英語プロンプト | 日本語プロンプト |
![]() | ![]() |
| プロンプト → FLUX.1 の例 | |
| 英語/日本語プロンプトの違いによる生成画像の違いを検証する |
| いろいろなジャンルの画像で 英語/日本語 のプロンプトの違いによる生成画像変化を検証する |
| 参照画像とプロンプトから画像生成する Image to Image ワークフローは Text to Image ワークフローから簡単にできるようなので検証してみる → krea2 image to image workflow ? |


| モデル名 | ファイル名(.safetensors) | 配置先 | ダウンロード URL | |
| diffusion_models | z_image_turbo_nvfp4 | /StabilityMatrix/Data/ Models/ | DiffusionModels/ | z_image_turbo_nvfp4.safetensors |
| text_encoders | qwen_3_4b_fp4_mixed | TextEncoders/ | qwen_3_4b_fp4_mixed.safetensors | |
| vae | ae | VAE/ | ae.safetensors | |
| LoRA | Z-Image-Turbo-DistillPatch | Lora/ | Z-Image-Turbo-DistillPatch.safetensors | |
| ControlNet | Z-Image-Turbo-Fun-Controlnet-Union | ModelPatches/ | Z-Image-Turbo-Fun-Controlnet-Union.safetensors | |
| 拡張ノード(検索名) | 拡張ノード URL | 主な機能 / 参照ページ | ワークフロー |
| Impact Pack | ComfyUI-Impact-Pack | 顔を修正する | 2101_z_image_turbo_simple |
| ComfyUI-Impact-Subpack | |||
| rgthree | rgthree-comfy | ノードをスイッチで切り替える | 2102_z_image_turbo_controlnet |
| comfyui_controlnet_aux | ComfyUI's ControlNet Auxiliary Preprocessors | ControlNet カスタムノード | |
| ComfyUI_Custom_Nodes_AlekPet | ComfyUI_Custom_Nodes_AlekPet | プロンプトを日本語入力する | 2191_z_image_turbo_auto |
| ComfyUI-Custom-Scripts | ComfyUI-Custom-Scripts | 各種便利機能 | |
| ComfyUI-TextGenerateQwen3Prompt | ComfyUI-TextGenerateQwen3Prompt | プロンプト・エンハンサー (手動配置) |
| フォルダ | ワークフロー名 (.json) | モデル | 機能 (参照ページ) | 特記事項(同じ機能のワークフロー .json) |
| Z-image | 2200_z_image_turbo_t2i | 蒸留版 nvfp4 | Text to Image 基本フロー(蒸留版) | (image_z_image_turbo) 改訂版 |
| 2201_z_image_turbo_t2i_simple | T2I 基本フロー(蒸留版・展開版) | 2200 展開版 | ||
| 2202_z_image_turbo_i2i | Image to Image 基本フロー(蒸留版) | Z-Image-Tuabo Image to Image 基本フロー | ||
| 2203_z_image_turbo_i2i_simple | I2I 基本フロー(蒸留版・展開版) | 2202 展開版 | ||
| 2102_z_image_turbo_controlnet | コントロールネットで画像を制御 | Z-Image-Turbo コントロールネット | ||
| 2191_z_image_turbo_auto | 日本語プロンプトで画像生成> | 2101_z_image_turbo_simple + 日本語プロンプト入力 |
| モデル名 | Krea 2 | コメント | |
![]() | ● 日本語プロンプトは英語とほぼ遜色なく使える ● Turbo 版はわずか 8ステップで生成できて超高速 ● テキスト描画については英語は実用レベル 日本語のテキストは漢字・かなとも正確な描画はできない ● | ||
| パラメータ数 | 6B | ||
| 解像度 | 推奨 | 1024x1024 | |
| 対応範囲 | 512x512 ~ 2048x2048 | ||
| 発表時期 | 2025年11月 | ||
| 開発元 | Tongyi Lab (中国) | ||
| 生成画像品質 | ◎ | ||
| プロンプト追従性 | 英語 | 〇 | |
| 日本語 | 〇 | ||
| 文字描画 | 英語 | 〇 | |
| 日本語 | △ | ||
| 生成速度 | 〇 | ||
| 総合評価 | ・プロンプトは日/英ほぼ同等に使用可 ・テキスト描画は英語のみ実用レベル ・超高速生成 | ||
| 生成結果比較 (リンクページ) | FLUX.2 ① ②, Z-Image ① ②, ERNIE ① ②, HiDream ① ② | ||
| 推奨モデル (.safetensors) | z_image_turbo_nvfp4 | ||
| 推奨ワークフロー (.json) | T2I | 2101_z_image_turbo_simple | |
| I2I | 2102_z_image_turbo_controlnet | ||
| 基本モデル『Z-Image-base』を検証する |
| 特徴 | Z-Image-Base | Z-Image-Turbo |
| サンプリングステップ | 30-50ステップ | 8ステップ |
| 生成速度 | 遅い | 非常に速い |
| 視覚的ディテール | より豊か | 優秀 |
| 芸術的上限 | より高い | 高い |
| 生成多様性 | より強い | 良好 |
| ファインチューニング適性 | 優秀 | 普通 |
| ネガティブプロンプト応答 | 高応答性 | 良好な応答性 |
| 使用ケース | プロフェッショナル創作、ファインチューニング開発 | 迅速なプロトタイピング、日常創作 |
| モデル名 | ファイル名(.safetensors) | 配置先 | ダウンロード URL | |
| Z-Image-Base本体 diffusion_models | z_image_bf16 | /StabilityMatrix/Data/ Models/ | diffusion_models/ | https://huggingface.co/Comfy-Org/z_image/tree/main/split_files/diffusion_models |
| text_encoders | ※ z_image_turbo と同じ | text_encoders/ | ||
| vae | VAE/ | |||

| ・テンプレートのオリジナル・ワークフローに対して「① モデルの変更, ② シード値を固定(同じ画像を再現できるように)」を変更する ・生成途中画像表示と生成結果プレビュー画像表示の追加 |
| オリジナルのワークフローを整理して FHD(1920x1080) 画面内に一括表示できるようにする |
| プロンプト |
|
Close-up portrait of a Japanease young woman in her 20s, natural makeup, soft expression. 85mm lens, f/1.4, shallow depth of field, bokeh background. Soft window light from the left, golden hour glow, warm skin tones. Cinematic, realistic, high detail, professional photography. NOT: oversaturated, anime style, low resolution, distorted face. |
| 20代の日本の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。 85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。 左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。 映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。 注意点:彩度過度、アニメ調、低解像度、歪んだ顔。 |
| 参照画像とプロンプトから画像生成する Image to Image ワークフローは Text to Image ワークフローから簡単にできるようなので検証してみる → krea2 image to image workflow ? |

