AI Tools
画像 AI中級

Z-Image

スケーラブルなシングルストリーム DiT アーキテクチャに基づく画像生成モデル

  • S3-DiTアーキテクチャ:スケーラブルなシングルストリーム拡散トランスフォーマー。テキスト、視覚的セマンティックトークン、画像VAE潜在変数を単一のシーケンスに統合し、デュアルストリームと比較してパラメータ効率を最大化。60億パラメータで200億以上の商用モデルレベルの品質を達成。
  • マルチ解像度生成:512×512から2048×2048までの任意の縦横比をサポート。ネイティブの1024×1024がデフォルト。
  • 8ステップ高速生成(Turbo):Decoupled-DMD蒸留アルゴリズム(CFG拡張+分布マッチング)により、8 NFEで生成を完了。エンタープライズGPUで1秒未満の推論が可能。コンシューマー向け16GB VRAMデバイスに対応。
  • 2言語テキストレンダリング:中国語と英語のテキストを画像内に正確にレンダリング。クローズドな商用モデルレベルのテキスト整合性。
  • Image-to-LoRA(i2L):参照画像からLoRA重みを自動的に抽出し、スタイル転送をサポート。
  • CFG精密制御:ベースモデルはネガティブプロンプトを完全にサポート。ガイダンススケールを3.0〜5.0の範囲で調整し、リアリズムから様式化までのスペクトルを細かく制御。
  • 画像編集(Z-Image-Edit):Omni事前学習に基づく指示に従う編集。2言語の編集コマンドをサポート。

💻 必要なスペック

🧠RAM

最低16GB(bf16推論の場合)。stable-diffusion.cppの量子化により、4GBまで軽量化可能。エンタープライズGPU(H800/A100クラス)を使用すると、1秒未満の推論が可能。CPUオフローディングオプションにより、低スペックの環境にも対応可能。

💾ストレージ

モデルチェックポイントは約12GB(bf16の場合)、テキストエンコーダー(Qwen-3 4B)+ VAEを含む場合は約20GB

インストール

4-1. 簡単な始め方

# diffusersの最新ソースをインストール(Z-Imageパイプラインのサポートが必須)
pip install git+https://github.com/huggingface/diffusers

# モデルをダウンロード(高速XET転送)
HF_XET_HIGH_PERFORMANCE=1 huggingface-cli download Tongyi-MAI/Z-Image

4-2. 詳細なインストール(PyTorchネイティブ)

git clone https://github.com/Tongyi-MAI/Z-Image.git
cd Z-Image
pip install -e .
python inference.py

4-3. Turboモデルの推論(8ステップ高速)

import torch
from diffusers import ZImagePipeline

pipe = ZImagePipeline.from_pretrained(
    "Tongyi-MAI/Z-Image-Turbo",
    torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A photorealistic portrait of a scientist in a lab",
    height=1024, width=1024,
    num_inference_steps=9,
    guidance_scale=0.0
).images[0]
image.save("output.png")

4-4. Baseモデルの推論(CFGサポート)

import torch
from diffusers import ZImagePipeline

pipe = ZImagePipeline.from_pretrained(
    "Tongyi-MAI/Z-Image",
    torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="Fluorescence microscopy image of neural cells",
    height=1024, width=1024,
    num_inference_steps=30,
    guidance_scale=4.0
).images[0]

🧬 バイオ活用シナリオ

🔬

合成学習データの大量生成

希少な細胞タイプ(例:循環腫瘍細胞)の顕微鏡画像を、プロンプトに基づいて大量に合成し、細胞分類の深層学習モデルの学習データにおける不均衡問題を解決。ベースモデルのCFG制御(guidance scale 3.0〜5.0)により、形状の多様性とリアリズムのバランスを調整可能。LoRAのファインチューニングにより、特定の染色パターン(H&E、DAPIなど)に特化した画像を大量に生成

🧬

二言語対応の科学ポスター・インフォグラフィックの自動生成

中国語・英語のテキストレンダリング能力を活用し、学会発表ポスターや論文のグラフィカルアブストラクトを、プロンプト1行でドラフトを作成。2048×2048の高解像度で、テキストの乱れなくレンダリングされ、後処理の負担を最小限に。国際学会の多言語ポスター作成に特に有用

💊

ControlNetベースの実験環境シミュレーション

ControlNet Union 2.1のDepth/Canny/Poseモードと組み合わせ、既存の実験室の写真の構図を維持しながら、照明、背景、機器の配置を変更したシミュレーション画像を生成。実験室の設計検討、安全教育資料の作成、機器カタログのビジュアルに活用。Apache-2.0ライセンスで、商用利用に制限なし

FAQ

Z-Imageとは何ですか?

S3-DiTアーキテクチャ:スケーラブルなシングルストリーム拡散トランスフォーマー。テキスト、視覚的セマンティックトークン、画像VAE潜在変数を単一のシーケンスに統合し、デュアルストリームと比較してパラメータ効率を最大化。60億パラメータで200億以上の商用モデルレベルの品質を達成。 マルチ解像度生成:512×512から2048×2048までの任意の縦横比をサポート。ネイティブの1024×1024がデフォルト。 8ステップ高速生成(Turbo):Decoupled-DMD蒸留アルゴリズム(CFG拡張+分布マッチング)により、8 NFEで生成を完了。エンタープライズGPUで1秒未満の推論が可能。コンシューマー向け16GB VRAMデバイスに対応。 2言語テキストレンダリング:中国語と英語のテキストを画像内に正確にレンダリング。クローズドな商用モデルレベルのテキスト整合性。 Image-to-LoRA(i2L):参照画像からLoRA重みを自動的に抽出し、スタイル転送をサポート。 CFG精密制御:ベースモデルはネガティブプロンプトを完全にサポート。ガイダンススケールを3.0〜5.0の範囲で調整し、リアリズムから様式化までのスペクトルを細かく制御。 画像編集(Z-Image-Edit):Omni事前学習に基づく指示に従う編集。2言語の編集コマンドをサポート。

Z-Imageはいつ使いますか?

スケーラブルなシングルストリーム DiT アーキテクチャに基づく画像生成モデル

Z-Imageのバイオ研究での活用例は何ですか?

合成学習データの大量生成: 希少な細胞タイプ(例:循環腫瘍細胞)の顕微鏡画像を、プロンプトに基づいて大量に合成し、細胞分類の深層学習モデルの学習データにおける不均衡問題を解決。ベースモデルのCFG制御(guidance scale 3.0〜5.0)により、形状の多様性とリアリズムのバランスを調整可能。LoRAのファインチューニングにより、特定の染色パターン(H&E、DAPIなど)に特化した画像を大量に生成

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。

BioPlayground

閲覧・リンク・適法な引用は開放し、高速な一括収集と無断再配布は制限します。

別途表示がない限り、コンテンツの権利はBioPlaygroundまたは正当な権利者に帰属します。