AI Tools
画像 AI中級

Z-Image

スケーラブルなシングルストリーム DiT アーキテクチャに基づく画像生成モデル

- S3-DiTアーキテクチャ:スケーラブルなシングルストリーム拡散トランスフォーマー。テキスト、視覚的セマンティックトークン、画像VAE潜在変数を単一のシーケンスに統合し、デュアルストリームと比較してパラメータ効率を最大化。60億パラメータで200億以上の商用モデルレベルの品質を達成。 - マルチ解像度生成:512×512から2048×2048までの任意の縦横比をサポート。ネイティブの1024×1024がデフォルト。 - 8ステップ高速生成(Turbo):Decoupled-DMD蒸留アルゴリズム(CFG拡張+分布マッチング)により、8 NFEで生成を完了。エンタープライズGPUで1秒未満の推論が可能。コンシューマー向け16GB VRAMデバイスに対応。 - 2言語テキストレンダリング:中国語と英語のテキストを画像内に正確にレンダリング。クローズドな商用モデルレベルのテキスト整合性。 - Image-to-LoRA(i2L):参照画像からLoRA重みを自動的に抽出し、スタイル転送をサポート。 - CFG精密制御:ベースモデルはネガティブプロンプトを完全にサポート。ガイダンススケールを3.0〜5.0の範囲で調整し、リアリズムから様式化までのスペクトルを細かく制御。 - 画像編集(Z-Image-Edit):Omni事前学習に基づく指示に従う編集。2言語の編集コマンドをサポート。

💻 必要なスペック

🧠RAM

最低16GB(bf16推論の場合)。stable-diffusion.cppの量子化により、4GBまで軽量化可能。エンタープライズGPU(H800/A100クラス)を使用すると、1秒未満の推論が可能。CPUオフローディングオプションにより、低スペックの環境にも対応可能。

💾ストレージ

モデルチェックポイントは約12GB(bf16の場合)、テキストエンコーダー(Qwen-3 4B)+ VAEを含む場合は約20GB

インストール

### 4-1. 簡単な始め方

```bash
# diffusersの最新ソースをインストール(Z-Imageパイプラインのサポートが必須)
pip install git+https://github.com/huggingface/diffusers

# モデルをダウンロード(高速XET転送)
HF_XET_HIGH_PERFORMANCE=1 huggingface-cli download Tongyi-MAI/Z-Image
```

### 4-2. 詳細なインストール(PyTorchネイティブ)

```bash
git clone https://github.com/Tongyi-MAI/Z-Image.git
cd Z-Image
pip install -e .
python inference.py
```

### 4-3. Turboモデルの推論(8ステップ高速)

```python
import torch
from diffusers import ZImagePipeline

pipe = ZImagePipeline.from_pretrained(
    "Tongyi-MAI/Z-Image-Turbo",
    torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A photorealistic portrait of a scientist in a lab",
    height=1024, width=1024,
    num_inference_steps=9,
    guidance_scale=0.0
).images[0]
image.save("output.png")
```

### 4-4. Baseモデルの推論(CFGサポート)

```python
import torch
from diffusers import ZImagePipeline

pipe = ZImagePipeline.from_pretrained(
    "Tongyi-MAI/Z-Image",
    torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="Fluorescence microscopy image of neural cells",
    height=1024, width=1024,
    num_inference_steps=30,
    guidance_scale=4.0
).images[0]
```

🧬 バイオ活用シナリオ

🔬

合成学習データの大量生成

希少な細胞タイプ(例:循環腫瘍細胞)の顕微鏡画像を、プロンプトに基づいて大量に合成し、細胞分類の深層学習モデルの学習データにおける不均衡問題を解決。ベースモデルのCFG制御(guidance scale 3.0〜5.0)により、形状の多様性とリアリズムのバランスを調整可能。LoRAのファインチューニングにより、特定の染色パターン(H&E、DAPIなど)に特化した画像を大量に生成

🧬

二言語対応の科学ポスター・インフォグラフィックの自動生成

中国語・英語のテキストレンダリング能力を活用し、学会発表ポスターや論文のグラフィカルアブストラクトを、プロンプト1行でドラフトを作成。2048×2048の高解像度で、テキストの乱れなくレンダリングされ、後処理の負担を最小限に。国際学会の多言語ポスター作成に特に有用

💊

ControlNetベースの実験環境シミュレーション

ControlNet Union 2.1のDepth/Canny/Poseモードと組み合わせ、既存の実験室の写真の構図を維持しながら、照明、背景、機器の配置を変更したシミュレーション画像を生成。実験室の設計検討、安全教育資料の作成、機器カタログのビジュアルに活用。Apache-2.0ライセンスで、商用利用に制限なし

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。