Qwen3-TTS
超低遅延ストリーミングTTS — 最初のオーディオパケットが97msで出力されるQwen3音声合成モデル
- 超低遅延ストリーミング合成:デュアルトラックハイブリッドストリーミングアーキテクチャにより、最初のオーディオパケットの遅延は97ms(0.6B)/101ms(1.7B)。文字を1つ入力するだけで、音声の出力を開始。 - 3秒のゼロショット音声クローニング:3秒間の参照オーディオのみを使用して、話者の音色、リズム、イントネーションを複製し、新しいテキストをその声で合成。 - 自然言語による音声デザイン(Voice Design):「緊張した10代の男性の声」のような自然言語による説明のみで、完全に新しい音声を生成。生成された音声は、ベースモデルで再利用可能。 - 10言語に対応した多言語TTS:中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語に対応。クロスリンガル合成も可能。 - 独自の12Hzトークナイザー:16層マルチコードブック設計により、1秒あたり12.5フレームという極限の圧縮率を達成。2048エントリのコードブックにより、音響情報を完全に保存(PESQ 3.21、STOI 0.96、UTMOS 4.16)。 - 9種類のプリセット話者(CustomVoice):Vivian、Serena、Ryan、Aiden、Ono_Anna、Soheeなど、中国語、英語、日本語、韓国語のネイティブ話者9名を搭載。 - 5種類のモデルラインナップ:0.6B Base/CustomVoice、1.7B Base/CustomVoice/VoiceDesign。リソースや用途に応じて選択可能。
💻 必要なスペック
0.6BモデルBF16の場合、約2〜4GB、1.7BモデルBF16の場合、約4〜8GB。NVIDIA GPU FlashAttention 2との互換性を推奨(RTX 3060以上)。CPUのみでの実行も可能だが、リアルタイムストリーミングは不可。
モデル1つあたり約1〜3GB(BF16 safetensors)、全5種類とトークナイザーで約10〜15GB
⚡ インストール
### 4-1. 簡単な始め方
```bash
pip install -U qwen-tts
pip install -U flash-attn --no-build-isolation # オプション、GPUアクセラレーション
```
### 4-2. ソースコードのインストール
```bash
git clone https://github.com/QwenLM/Qwen3-TTS.git
cd Qwen3-TTS
pip install -e .
```
### 4-3. 基本的な使用方法(音声クローニング)
```python
import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel
model = Qwen3TTSModel.from_pretrained(
"Qwen/Qwen3-TTS-12Hz-1.7B-Base",
device_map="cuda:0",
dtype=torch.bfloat16,
attn_implementation="flash_attention_2",
)
wavs, sr = model.generate_voice_clone(
text="Hello, this is a voice cloning demo.",
language="English",
ref_audio="reference.wav",
ref_text="Reference audio transcript"
)
sf.write("output.wav", wavs[0], sr)
```
### 4-4. 自然言語による音声デザイン
```python
model = Qwen3TTSModel.from_pretrained(
"Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign",
device_map="cuda:0",
dtype=torch.bfloat16,
attn_implementation="flash_attention_2",
)
wavs, sr = model.generate_voice_design(
text="これは音声デザインのデモです。",
language="Chinese",
instruct="A warm, gentle female voice with a slow speaking pace"
)
sf.write("designed_voice.wav", wavs[0], sr)
```
### 4-5. Web UIデモの実行
```bash
qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --ip 0.0.0.0 --port 8000
```🧬 バイオ活用シナリオ
多言語臨床試験音声ガイダンスの自動化
グローバルな臨床試験において、10言語の患者向け同意書(インフォームドコンセント)を標準化された音声で自動生成。CustomVoiceプリセットを使用して、言語ごとにネイティブスピーカーの音声をを選択し、各患者コホートに合わせたガイダンスオーディオを一括合成。従来のナレーター録音と比較して、制作時間を大幅に短縮(数十分の1)し、発音の正確性(WER 1.24%以下)を維持
医療教育コンテンツの多言語ナレーション
医学講義やプロトコルビデオに、Voice Design機能を使用して「落ち着いていて威厳のある中年男性医師の声」のような自然言語指示でカスタムナレーターを生成。1.7B-VoiceDesignモデルを使用して、韓国語のオリジナル講義を英語、日本語、ドイツ語などにクロスコス言語合成し、国際的な教育に展開。97msストリーミングにより、リアルタイム字幕との同期が可能
実験室プロトコルの音声アシスタント
ウェットラボでの実験中、両手が使えない研究者に対して、実験プロトコルを音声で案内。3秒の参照音で研究室のPI(Principal Investigator)の声をクローニングし、親しみやすい音声で段階的な指示をストリーミング合成。0.6B軽量モデルでワークステーションGPU上でリアルタイム実行し、ピペッティングや遠心分離などのハンズフリー環境で効率を最大化
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。