AI Tools
音声 AI中級

Qwen3-TTS

超低遅延ストリーミングTTS — 最初のオーディオパケットが97msで出力されるQwen3音声合成モデル

- 超低遅延ストリーミング合成:デュアルトラックハイブリッドストリーミングアーキテクチャにより、最初のオーディオパケットの遅延は97ms(0.6B)/101ms(1.7B)。文字を1つ入力するだけで、音声の出力を開始。 - 3秒のゼロショット音声クローニング:3秒間の参照オーディオのみを使用して、話者の音色、リズム、イントネーションを複製し、新しいテキストをその声で合成。 - 自然言語による音声デザイン(Voice Design):「緊張した10代の男性の声」のような自然言語による説明のみで、完全に新しい音声を生成。生成された音声は、ベースモデルで再利用可能。 - 10言語に対応した多言語TTS:中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語に対応。クロスリンガル合成も可能。 - 独自の12Hzトークナイザー:16層マルチコードブック設計により、1秒あたり12.5フレームという極限の圧縮率を達成。2048エントリのコードブックにより、音響情報を完全に保存(PESQ 3.21、STOI 0.96、UTMOS 4.16)。 - 9種類のプリセット話者(CustomVoice):Vivian、Serena、Ryan、Aiden、Ono_Anna、Soheeなど、中国語、英語、日本語、韓国語のネイティブ話者9名を搭載。 - 5種類のモデルラインナップ:0.6B Base/CustomVoice、1.7B Base/CustomVoice/VoiceDesign。リソースや用途に応じて選択可能。

💻 必要なスペック

🧠RAM

0.6BモデルBF16の場合、約2〜4GB、1.7BモデルBF16の場合、約4〜8GB。NVIDIA GPU FlashAttention 2との互換性を推奨(RTX 3060以上)。CPUのみでの実行も可能だが、リアルタイムストリーミングは不可。

💾ストレージ

モデル1つあたり約1〜3GB(BF16 safetensors)、全5種類とトークナイザーで約10〜15GB

インストール

### 4-1. 簡単な始め方

```bash
pip install -U qwen-tts
pip install -U flash-attn --no-build-isolation  # オプション、GPUアクセラレーション
```

### 4-2. ソースコードのインストール

```bash
git clone https://github.com/QwenLM/Qwen3-TTS.git
cd Qwen3-TTS
pip install -e .
```

### 4-3. 基本的な使用方法(音声クローニング)

```python
import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel

model = Qwen3TTSModel.from_pretrained(
    "Qwen/Qwen3-TTS-12Hz-1.7B-Base",
    device_map="cuda:0",
    dtype=torch.bfloat16,
    attn_implementation="flash_attention_2",
)

wavs, sr = model.generate_voice_clone(
    text="Hello, this is a voice cloning demo.",
    language="English",
    ref_audio="reference.wav",
    ref_text="Reference audio transcript"
)
sf.write("output.wav", wavs[0], sr)
```

### 4-4. 自然言語による音声デザイン

```python
model = Qwen3TTSModel.from_pretrained(
    "Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign",
    device_map="cuda:0",
    dtype=torch.bfloat16,
    attn_implementation="flash_attention_2",
)

wavs, sr = model.generate_voice_design(
    text="これは音声デザインのデモです。",
    language="Chinese",
    instruct="A warm, gentle female voice with a slow speaking pace"
)
sf.write("designed_voice.wav", wavs[0], sr)
```

### 4-5. Web UIデモの実行

```bash
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --ip 0.0.0.0 --port 8000
```

🧬 バイオ活用シナリオ

🔬

多言語臨床試験音声ガイダンスの自動化

グローバルな臨床試験において、10言語の患者向け同意書(インフォームドコンセント)を標準化された音声で自動生成。CustomVoiceプリセットを使用して、言語ごとにネイティブスピーカーの音声をを選択し、各患者コホートに合わせたガイダンスオーディオを一括合成。従来のナレーター録音と比較して、制作時間を大幅に短縮(数十分の1)し、発音の正確性(WER 1.24%以下)を維持

🧬

医療教育コンテンツの多言語ナレーション

医学講義やプロトコルビデオに、Voice Design機能を使用して「落ち着いていて威厳のある中年男性医師の声」のような自然言語指示でカスタムナレーターを生成。1.7B-VoiceDesignモデルを使用して、韓国語のオリジナル講義を英語、日本語、ドイツ語などにクロスコス言語合成し、国際的な教育に展開。97msストリーミングにより、リアルタイム字幕との同期が可能

💊

実験室プロトコルの音声アシスタント

ウェットラボでの実験中、両手が使えない研究者に対して、実験プロトコルを音声で案内。3秒の参照音で研究室のPI(Principal Investigator)の声をクローニングし、親しみやすい音声で段階的な指示をストリーミング合成。0.6B軽量モデルでワークステーションGPU上でリアルタイム実行し、ピペッティングや遠心分離などのハンズフリー環境で効率を最大化

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。