Z-Image
スケーラブルなシングルストリーム DiT アーキテクチャに基づく画像生成モデル
- S3-DiTアーキテクチャ:スケーラブルなシングルストリーム拡散トランスフォーマー。テキスト、視覚的セマンティックトークン、画像VAE潜在変数を単一のシーケンスに統合し、デュアルストリームと比較してパラメータ効率を最大化。60億パラメータで200億以上の商用モデルレベルの品質を達成。 - マルチ解像度生成:512×512から2048×2048までの任意の縦横比をサポート。ネイティブの1024×1024がデフォルト。 - 8ステップ高速生成(Turbo):Decoupled-DMD蒸留アルゴリズム(CFG拡張+分布マッチング)により、8 NFEで生成を完了。エンタープライズGPUで1秒未満の推論が可能。コンシューマー向け16GB VRAMデバイスに対応。 - 2言語テキストレンダリング:中国語と英語のテキストを画像内に正確にレンダリング。クローズドな商用モデルレベルのテキスト整合性。 - Image-to-LoRA(i2L):参照画像からLoRA重みを自動的に抽出し、スタイル転送をサポート。 - CFG精密制御:ベースモデルはネガティブプロンプトを完全にサポート。ガイダンススケールを3.0〜5.0の範囲で調整し、リアリズムから様式化までのスペクトルを細かく制御。 - 画像編集(Z-Image-Edit):Omni事前学習に基づく指示に従う編集。2言語の編集コマンドをサポート。
💻 必要なスペック
最低16GB(bf16推論の場合)。stable-diffusion.cppの量子化により、4GBまで軽量化可能。エンタープライズGPU(H800/A100クラス)を使用すると、1秒未満の推論が可能。CPUオフローディングオプションにより、低スペックの環境にも対応可能。
モデルチェックポイントは約12GB(bf16の場合)、テキストエンコーダー(Qwen-3 4B)+ VAEを含む場合は約20GB
⚡ インストール
### 4-1. 簡単な始め方
```bash
# diffusersの最新ソースをインストール(Z-Imageパイプラインのサポートが必須)
pip install git+https://github.com/huggingface/diffusers
# モデルをダウンロード(高速XET転送)
HF_XET_HIGH_PERFORMANCE=1 huggingface-cli download Tongyi-MAI/Z-Image
```
### 4-2. 詳細なインストール(PyTorchネイティブ)
```bash
git clone https://github.com/Tongyi-MAI/Z-Image.git
cd Z-Image
pip install -e .
python inference.py
```
### 4-3. Turboモデルの推論(8ステップ高速)
```python
import torch
from diffusers import ZImagePipeline
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A photorealistic portrait of a scientist in a lab",
height=1024, width=1024,
num_inference_steps=9,
guidance_scale=0.0
).images[0]
image.save("output.png")
```
### 4-4. Baseモデルの推論(CFGサポート)
```python
import torch
from diffusers import ZImagePipeline
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image",
torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="Fluorescence microscopy image of neural cells",
height=1024, width=1024,
num_inference_steps=30,
guidance_scale=4.0
).images[0]
```🧬 バイオ活用シナリオ
合成学習データの大量生成
希少な細胞タイプ(例:循環腫瘍細胞)の顕微鏡画像を、プロンプトに基づいて大量に合成し、細胞分類の深層学習モデルの学習データにおける不均衡問題を解決。ベースモデルのCFG制御(guidance scale 3.0〜5.0)により、形状の多様性とリアリズムのバランスを調整可能。LoRAのファインチューニングにより、特定の染色パターン(H&E、DAPIなど)に特化した画像を大量に生成
二言語対応の科学ポスター・インフォグラフィックの自動生成
中国語・英語のテキストレンダリング能力を活用し、学会発表ポスターや論文のグラフィカルアブストラクトを、プロンプト1行でドラフトを作成。2048×2048の高解像度で、テキストの乱れなくレンダリングされ、後処理の負担を最小限に。国際学会の多言語ポスター作成に特に有用
ControlNetベースの実験環境シミュレーション
ControlNet Union 2.1のDepth/Canny/Poseモードと組み合わせ、既存の実験室の写真の構図を維持しながら、照明、背景、機器の配置を変更したシミュレーション画像を生成。実験室の設計検討、安全教育資料の作成、機器カタログのビジュアルに活用。Apache-2.0ライセンスで、商用利用に制限なし
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。