私的AI研究会 > ComfyUI10

画像生成AI「ComfyUI」10(実践編Ⅰ)

 「ComfyUI」を使ってローカル環境でのAI画像生成を検証する

▲ 目 次
※ 最終更新:2026/07/13 
 今話題の最新モデル『Z-Image』を検証する(VRAM 12GB 以下の小規模環境で実行可能なものに限定)

『Z-Image-Turbo』を検証する

 高速かつ高品質な画像を生成することができると評価の高い最新の画像生成AIモデル『Z-Image-Turbo』を検証する

概要

プロジェクトで作成するワークフロー

 このプロジェクトで作成するワークフローと関連データは下記にアップロードしている(更新されている場合は再度ダウンロードのこと)

画像生成のための環境構築

  1. 必要モデルのダウンロードと配置
    モデル名ファイル名(.safetensors)配置先ダウンロード URL
    Z-Image-Turbo本体
    diffusion_models
    z_image_turbo_nvfp4/StabilityMatrix/Data/
    Models/
    diffusion_models/https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/diffusion_models
    z_image_turbo_bf16
    テキストエンコーダー
    text_encoders
    qwen_3_4b_fp4_mixedtext_encoders/https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/text_encoders
    qwen_3_4b_fp8_mixed
    qwen_3_4b
    vaeaeVAE/https://huggingface.co/Comfy-Org/z_image_turbo/tree/main/split_files/vae
    LoRAZ-Image-Turbo-DistillPatchLora/https://huggingface.co/Kutches/ImageZ/blob/4d384de2e0993c5e127ea2cb95d57e018e2b52bd/Z-Image-Turbo-DistillPatch.safetensors
    ControlNetZ-Image-Turbo-Fun-Controlnet-Union/StabilityMatrix/Data/
    Packages/ComfyUI/models/
    model_patches/https://huggingface.co/alibaba-pai/Z-Image-Turbo-Fun-Controlnet-Union/tree/main
  2. turbo / base モデルの違い
    turbo (distilled 蒸留版)base版
    nvfp4bf16bf16
    モデル名
    (.savtensors)
    z_image_turbo_nvfp4z_image_turbo_bf16z_image_bf16
    サイズ (GB)4.1911.411.4
    生成画像 comfyui_711a_m.jpg 2101_2026-03-23_00002_m.jpg 2111_2026-02-28_00001_m.jpg
    生成時間
    (分:秒)
    turbo (distilled 蒸留版)base版
    nvfp4bf16bf16
    GPURTX-407000:07.4600:55.0100:35.91
    RTX-406000:18.9901:15.1401:28.12
    RTX-4060L00:27.2200:56.6102:27.91
    RTX-305000:39.7403:30.1604:10.93
    GTX-105005:05.4505:01.5323:17.65
    CPUi7-1260P34:09.7136:25.75283:57.25

Step 1:標準テンプレートによる生成

  1. ワークフローを選ぶ
    ① 左端のメニューから「Template」を選択
    ② 検索欄に「 Z-Image-Turbo 」を入力する
    ③「Z-Image-Turbo Text to Image」を選ぶ
    ④ アラートダイアログが出るが無視して閉じる
    ⑤ ワークフローを拡大して「clip_name」をクリック
    ⑥ 表示されるリストから「qwen_3_4b_fp4_mixed.safetensors」を指定する

  2. ワークフローを実行する
    ①「Run」を押して画像を生成する
    z-image-turbo_00002_m.jpg

  3. オリジナルのワークフローを保存する
    ・テンプレートのオリジナル・ワークフローに対して「① モデルの変更, ② シード値を固定(同じ画像を再現できるように)」を変更する
    ・生成途中画像表示と生成結果プレビュー画像表示の追加
    Text to Image ワークフローText to Image ワークフロー SubGraph
    comfyui_707_m.jpg comfyui_708_m.jpg
    「z_image/」image_z_image_turbo.json

  4. Text to Image ワークフローを整理する
     オリジナルのワークフローを整理して FHD(1920x1080) 画面内に一括表示できるようにする
    2200 基本ワークフロー2200 SubGraph
     Prompt:
    Latina female with thick wavy hair, harbor boats and pastel houses behind. Breezy seaside light, warm tones, cinematic close-up.
    豊かなウェーブヘアのラテン系女性。背景には港のボートやパステルカラーの家々。海辺の爽やかな光と温かみのある色調、映画のようなクローズアップ。
    comfyui_959_m.jpg comfyui_959a_m.jpg
    「z_image/」2200_z_image_turbo_t2i.json
    2201 基本ワークフロー(展開版) 2200_2026-07-09_00001_m.jpg 2201_2026-07-09_00001_m.jpg
     Prompt:
    20代の日本の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。
    85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。
    左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。
    映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。
    注意点:彩度過度、アニメ調、低解像度、歪んだ顔。
    comfyui_960_m.jpg
    「z_image/」2201_z_image_turbo_t2i_simple.json

Step 2:ComfyUI_examples サイト のワークフローによる生成

  1. サイトからワークフローをダウンロード

    ① ダウンロードしたワークフローに「Preview Image」ノードを追加
    ② ネガティブ・プロンプトは不要なので「ConditioningZeroOut」に置き換える
    ③ プロンプトを変更する
    ④ イメージサイズを 1024x768 / 768x1024 / 1024x1024 ピクセル を選択できるようにする
    ⑤ ノード配置を整理する

  2. ワークフローを実行する
    プロンプト
    Close-up portrait of a young woman in her 20s, natural makeup, soft expression.
    85mm lens, f/1.4, shallow depth of field, bokeh background.
    Soft window light from the left, golden hour glow, warm skin tones.
    Cinematic, realistic, high detail, professional photography.
    NOT: oversaturated, anime style, low resolution, distorted face.
    20代の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。
    85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。
    左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。
    映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。
    注意点:彩度過度、アニメ調、低解像度、歪んだ顔。
    ワークフロー:「z_image/」2101_z_image_turbo_simple.json
    comfyui_711_m.jpg
      1024x768

  3. 日本語文字の入ったカタログを生成してみる
    プロンプト
    A luxury-style bilingual (Japanease + English) poster advertisement for a minimalist wireless earphone.
    Show the product on a matte black surface with premium studio lighting, soft highlights on metal edges, deep controlled shadows, and flawless color accuracy.
    Textures should appear refined and tactile, with micro-detail clarity and a high-end commercial finish.
    Design the poster in an elegant, high-fashion aesthetic: generous negative space, balanced composition, and minimal visual noise.
    Use a sophisticated monochrome palette with subtle gold or silver accents to emphasize the premium feel.
    Include a minimal English headline: “Pure Sound. Perfect Silence.”
    Add the Japanease counterpart in refined typography: “純粋な音 · 静寂の極み”.
    Place a small bilingual tagline beneath: “Wireless Crafted Quality · 職人技が宿る仕上り”.
    Ensure the text integrates naturally with the design without distracting from the product.
    Background should be a smooth gradient charcoal black with a luxury ambiance.
    Use centered composition, vertical 3:4 aspect ratio, no logo, no watermark.
    ミニマルなワイヤレスイヤホンの、高級感あふれるバイリンガル(日本語+英語)ポスター広告です。
    マットブラックの表面に、プレミアムスタジオ照明、金属エッジの柔らかなハイライト、深くコントロールされた陰影、そして完璧な色彩精度で製品を映し出します。
    テクスチャは洗練され、触感があり、微細なディテールまで鮮明で、高級感のある商業的な仕上がりを実現します。
    ポスターは、エレガントでハイファッションな美学に基づき、十分なネガティブスペース、バランスの取れた構成、そして最小限の視覚的ノイズでデザインします。
    洗練されたモノクロパレットに、さりげないゴールドまたはシルバーのアクセントを加え、高級感を強調します。
    簡潔な英語の見出し「Pure Sound. Perfect Silence.」を記載します。
    洗練されたタイポグラフィで日本語の見出し「純粋な音・静寂の極み」を追加します。
    その下に、小さなバイリンガルのタグライン「Wireless Crafted Quality・職人技が宿る仕上り」を配置します。
    テキストは、製品から気を散らすことなく、デザインに自然に溶け込むようにしてください。
    背景は、高級感のある滑らかなグラデーションのチャコールブラックにしてください。
    中央配置、縦長の3:4アスペクト比、ロゴや透かしは使用しないでください
    ワークフロー:「z_image/」2101_z_image_turbo_simple.json
    comfyui_712_m.jpg
      768x1024

Step 3:コントロールネットで画像を制御する

  1. ワークフローを作成する
    ワークフロー:「z_image/」2102_z_image_turbo_controlnet.json入力画像プロンプト
    comfyui_713_m.jpg portrait_02_m.jpg Close-up portrait of a young woman in her 20s, natural makeup, soft expression.
    85mm lens, f/1.4, shallow depth of field, bokeh background.
    Soft window light from the left, golden hour glow, warm skin tones.
    Cinematic, realistic, high detail, professional photography.
    NOT: oversaturated, anime style, low resolution, distorted face.
  2. ワークフローを実行する
    種類ワークフロー(変更部分)コントロール画像生成画像 768x1024
    Canny comfyui_714_m.jpg ComfyUI_temp_vpqkh_00001_m.jpg zimage_2026-02-25_00001_m.jpg
    Pose comfyui_715_m.jpg ComfyUI_temp_vpqkh_00002_m.jpg zimage_2026-02-25_00002_m.jpg
    Depyh comfyui_716_m.jpg ComfyUI_temp_vpqkh_00003_m.jpg zimage_2026-02-25_00003_m.jpg
    HED
    LineArt
    comfyui_717_m.jpg ComfyUI_temp_vpqkh_00004_m.jpg zimage_2026-02-25_00004_m.jpg
    MLSD comfyui_718_m.jpg ComfyUI_temp_vpqkh_00005_m.jpg zimage_2026-02-25_00005_m.jpg
  3. ワークフローを改良する(V2)
    ワークフロー:「z_image/」2102_z_image_turbo_controlnet_v2.json改良点
    comfyui_713_v2_m.jpg・それぞれの「ControlNet」ノード出力を切り替えることで、ワークフローを接続し直す必要がないようにした
     → ノードをスイッチで切り替える「rgthree-comfy」

    ・「Fast Muter」ノードの該当項目をクリックすることで「ControlNet」の各機能を実行することができる

Step 4-1:英語/日本語プロンプトによる生成画像の違い

 モデルによる検証例:  → Z-Imageの例   HiDream-O1の例   ERNIE-Imageの例   FLUX.2 kleinの例

Step 4-2:英語/日本語プロンプトによる生成2

 英語/日本語プロンプトの違いによる生成画像の違いを検証する

Step 4-3:様々なジャンルの画像生成

 いろいろなジャンルの画像で 英語/日本語 のプロンプトの違いによる生成画像変化を検証する

Step 4 生成データ詳細

Step 5:Image to Image ワークフロー

 参照画像とプロンプトから画像生成する Image to Image ワークフローは Text to Image ワークフローから簡単にできるようなので検証してみる
  → krea2 image to image workflow ?

『Z-Image-Turbo』まとめ

 

『Z-Image-base』を検証する

 基本モデル『Z-Image-base』を検証する

概要

  1. モデルのダウンロードと配置
    モデル名ファイル名(.safetensors)配置先ダウンロード URL
    Z-Image-Base本体
    diffusion_models
    z_image_bf16/StabilityMatrix/Data/
    Models/
    diffusion_models/https://huggingface.co/Comfy-Org/z_image/tree/main/split_files/diffusion_models
    text_encoders※ z_image_turbo と同じtext_encoders/
    vaeVAE/

Step 1:標準テンプレートによる生成

  1. ワークフローを選ぶ
    ① 左端のメニューから「Template」を選択
    ② 検索欄に「Z-Image」を入力する
    ③「Z-Image Text to Image」を選ぶ
    ④ アラートダイアログが出るが無視して閉じる
    ⑤ ワークフローを拡大して「clip_name」をクリック
    ⑥ 表示されるリストから「qwen_3_4b_fp4_mixed.safetensors」を指定する

  2. ワークフローを実行する
    ①「Run」を押して画像を生成する
    z-image_00002_m.jpg

  3. オリジナルのワークフローを保存する
    ・テンプレートのオリジナル・ワークフローに対して「① モデルの変更, ② シード値を固定(同じ画像を再現できるように)」を変更する
    ・生成途中画像表示と生成結果プレビュー画像表示の追加
    Text to Image ワークフローText to Image ワークフロー SubGraph
    comfyui_720_m.jpg comfyui_721_m.jpg
    「z_image/」image_z_image_base.json

  4. Text to Image ワークフローを整理する
     オリジナルのワークフローを整理して FHD(1920x1080) 画面内に一括表示できるようにする
    2210 基本ワークフロー2210 SubGraph
     Prompt:
    A fashion photography work full of surreal romanticism, using a low-angle upward shooting composition, with a clear light blue sky as the background, and the visual focus concentrated on the fantasy blue vegetation and the model walking through it.

    The vegetation in the picture is processed into varying shades of blue, from light ice blue to deep cobalt blue. The textures of the leaves and branches are delicate and realistic. The warm brown tree trunks form a sharp contrast with the cool blue leaves, resembling a dreamy forest from another world. An African-American model wearing a yellow and white vertical striped long dress walks slowly on the sand. The warm tones of the dress echo with the surrounding cool blue vegetation. The noon sun casts clear shadows on the sand, enhancing the sense of space and reality in the picture.

    The entire scene, with its clean and transparent colors and fantasy settings, not only exudes the vastness of the natural wilderness but also presents a quiet and poetic high-fashion sense due to the surreal vegetation.
    澄み渡る水色の空を背景に、ローアングルから見上げる構図で捉えられた、シュールでロマンチックな雰囲気のファッション写真作品です。視線は、幻想的な青い植物と、その中を歩くモデルへと自然に引き寄せられます。

    画面内の植物は、淡いアイスブルーから深みのあるコバルトブルーまで、様々な色調の青で表現されており、葉や枝の質感は繊細かつリアルに描写されています。温かみのある茶色の幹と、寒色系の青い葉が鮮やかなコントラストを成し、まるで異世界の幻想的な森のような光景を作り出しています。黄色と白の縦縞のロングドレスをまとったアフリカ系アメリカ人のモデルが、砂の上をゆっくりと歩いています。ドレスの温かみのある色調が、周囲の寒色系の青い植物と呼応しています。真昼の太陽が砂の上に鮮明な影を落とし、空間の広がりとリアリティを際立たせています。

    清涼感のある透明な色彩と幻想的な情景が融合したこの作品は、自然の荒野の雄大さを感じさせるだけでなく、シュールな植物の存在によって、静謐で詩的なハイファッションの雰囲気を醸し出しています。
    comfyui_963_m.jpg comfyui_963a_m.jpg
    「z_image/」2210_z_image_base_t2i.json
    2201 基本ワークフロー(展開版) 2210_2026-07-09_00001_m.jpg 2211_2026-07-09_00001_m.jpg
     Prompt:
    20代の日本の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。
    85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。
    左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。
    映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。
    注意点:彩度過度、アニメ調、低解像度、歪んだ顔。.
    comfyui_964_m.jpg
    「z_image/」2211_z_image_base_t2i_simple.json

Step 2:基本ワークフローを作成

  1. Step 1 のワークフローを修正する
    ① Subgraph を展開して元に戻す
    ② Group は不要なので削除する ③ 画像サイズを選択できるようにノードを追加してレイアウト全体を再配置
    ④ 必要なときのみ生成画像を記録できるように変更する

  2. ワークフローを実行する
    プロンプト
    Close-up portrait of a Japanease young woman in her 20s, natural makeup, soft expression.
    85mm lens, f/1.4, shallow depth of field, bokeh background.
    Soft window light from the left, golden hour glow, warm skin tones.
    Cinematic, realistic, high detail, professional photography.
    NOT: oversaturated, anime style, low resolution, distorted face.
    20代の日本の若い女性のクローズアップポートレート。ナチュラルメイク、柔らかな表情。
    85mmレンズ、f/1.4、浅い被写界深度、背景のボケ。
    左から差し込む柔らかな窓の光、ゴールデンアワーの輝き、温かみのある肌色。
    映画のような、リアルな、細部までこだわった、プロフェッショナルな写真。
    注意点:彩度過度、アニメ調、低解像度、歪んだ顔。
    ワークフロー:「z_image/」2111_z_image_base_simple.json
    comfyui_722_m.jpg
      1024x768

    ・シード値を変更した場合 1024x768(z-image-turbo はほとんど同じになる)
    228533163497426965272908476212577359144257283937350415573337
    2111_2026-02-28_00002_m.jpg 2111_2026-02-28_00003_m.jpg 2111_2026-02-28_00004_m.jpg 2111_2026-02-28_00005_m.jpg

Step 3:Image to Image ワークフロー

 参照画像とプロンプトから画像生成する Image to Image ワークフローは Text to Image ワークフローから簡単にできるようなので検証してみる
  → krea2 image to image workflow ?

 

更新履歴

 

参考資料