AI Tools
音声 AI中級

TADA (Text-Acoustic Dual Alignment)

テキストと音声を1対1で対応付けるトークンアライメント方式を用いた高品質TTSモデル

- テキストと音響のデュアルアラインメント(1:1トークンアラインメント):テキストトークンと音声ベクトルを1:1で同期させ、従来のTTSの構造的な問題である単語の欠落、繰り返し、幻覚をアーキテクチャレベルで解消。1,000件以上のLibriTTSRテストでコンテンツ幻覚ゼロを達成。 - 5倍高速な推論速度:リアルタイムファクター(RTF)0.09で、同等のLLMベースのTTSと比較して約5倍高速。従来のシステムが1秒あたり12.5〜75個のオーディオトークンを処理するのに対し、TADAは2〜3フレーム/秒で動作しながらも高品質な音声合成を実現。H100でキャッシュを活用するとRTFは約0.12x。 - 10倍効率的なコンテキストウィンドウ:2,048トークンで約700秒(約11.7分)のオーディオをカバー。従来のシステムの約70秒と比較して10倍の効率。長文の朗読、オーディオブック、長時間の会話生成に有利。 - 多言語サポート(10言語):3B-MLモデルを基準に、英語、アラビア語、中国語、ドイツ語、スペイン語、フランス語、イタリア語、日本語、ポーランド語、ポルトガル語をサポート。言語ごとにアライナーモジュールを拡張。 - デュアルストリーム生成:テキストと音声を同時に生成し、Speech Free Guidance(テキストのみのガイダンス)を通じて、logitブレンディングにより発話品質を制御可能。 - プロンプトキャッシュ:`EncoderOutput.save()/load()`を使用して、参照音声のエンコーディング結果をキャッシュすることで、反復推論時にVRAMを約2.5GB削減し、速度を向上。 - フローマッチングベースのデコーディング:LLMの隠れ状態に基づいて条件付けられたフローマッチングヘッドにより、高忠実度のオーディオを復元。フローマッチングステップを20から10に削減することで、品質を低下させずに約1.3倍の速度向上を実現。

💻 必要なスペック

🧠RAM

3B-MLモデルの場合、bf16精度で約9GB。NVIDIA GPU CUDA互換が必須。RTX 3060(12GB)以上であれば、bf16で3Bモデルを動作可能。1Bモデルはより少ないVRAMで動作。

💾ストレージ

3B-MLモデルの重みは約8GB、1Bモデルは約2GB、コーデック(tada-codec)は約500MB。全体のパッケージは約10〜12GB

インストール

### 4-1. 簡単な始め方

```bash
pip install hume-tada
```

### 4-2. ソースのビルド

```bash
git clone https://github.com/HumeAI/tada.git
cd tada
pip install -e .
```

### 4-3. 基本的な使用方法 (Python)

```python
from tada.modules.encoder import Encoder
from tada.modules.tada import TadaForCausalLM
import torch, torchaudio

# モデルのロード (3B多言語、bf16精度)
encoder = Encoder.from_pretrained("HumeAI/tada-codec",
    subfolder="encoder").to("cuda")
model = TadaForCausalLM.from_pretrained("HumeAI/tada-3b-ml",
    torch_dtype=torch.bfloat16).to("cuda")

# 参照音声で話者スタイルプロンプティング
audio, sr = torchaudio.load("reference.wav")
prompt = encoder(audio, text=["reference text"], sample_rate=sr)

# 新しいテキストで音声合成
output = model.generate(prompt=prompt, text="合成するテキスト")
```

> **注記**: HuggingFaceでMeta Llama 3.2 Community Licenseを事前に承認しないと、モデルの重みをダウンロードできません。
📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。