AI Tools
音声 AI中級

TADA (Text-Acoustic Dual Alignment)

テキストと音声を1対1で対応付けるトークンアライメント方式を用いた高品質TTSモデル

  • テキストと音響のデュアルアラインメント(1:1トークンアラインメント):テキストトークンと音声ベクトルを1:1で同期させ、従来のTTSの構造的な問題である単語の欠落、繰り返し、幻覚をアーキテクチャレベルで解消。1,000件以上のLibriTTSRテストでコンテンツ幻覚ゼロを達成。
  • 5倍高速な推論速度:リアルタイムファクター(RTF)0.09で、同等のLLMベースのTTSと比較して約5倍高速。従来のシステムが1秒あたり12.5〜75個のオーディオトークンを処理するのに対し、TADAは2〜3フレーム/秒で動作しながらも高品質な音声合成を実現。H100でキャッシュを活用するとRTFは約0.12x。
  • 10倍効率的なコンテキストウィンドウ:2,048トークンで約700秒(約11.7分)のオーディオをカバー。従来のシステムの約70秒と比較して10倍の効率。長文の朗読、オーディオブック、長時間の会話生成に有利。
  • 多言語サポート(10言語):3B-MLモデルを基準に、英語、アラビア語、中国語、ドイツ語、スペイン語、フランス語、イタリア語、日本語、ポーランド語、ポルトガル語をサポート。言語ごとにアライナーモジュールを拡張。
  • デュアルストリーム生成:テキストと音声を同時に生成し、Speech Free Guidance(テキストのみのガイダンス)を通じて、logitブレンディングにより発話品質を制御可能。
  • プロンプトキャッシュ:EncoderOutput.save()/load()を使用して、参照音声のエンコーディング結果をキャッシュすることで、反復推論時にVRAMを約2.5GB削減し、速度を向上。
  • フローマッチングベースのデコーディング:LLMの隠れ状態に基づいて条件付けられたフローマッチングヘッドにより、高忠実度のオーディオを復元。フローマッチングステップを20から10に削減することで、品質を低下させずに約1.3倍の速度向上を実現。

💻 必要なスペック

🧠RAM

3B-MLモデルの場合、bf16精度で約9GB。NVIDIA GPU CUDA互換が必須。RTX 3060(12GB)以上であれば、bf16で3Bモデルを動作可能。1Bモデルはより少ないVRAMで動作。

💾ストレージ

3B-MLモデルの重みは約8GB、1Bモデルは約2GB、コーデック(tada-codec)は約500MB。全体のパッケージは約10〜12GB

インストール

4-1. 簡単な始め方

pip install hume-tada

4-2. ソースのビルド

git clone https://github.com/HumeAI/tada.git
cd tada
pip install -e .

4-3. 基本的な使用方法 (Python)

from tada.modules.encoder import Encoder
from tada.modules.tada import TadaForCausalLM
import torch, torchaudio

# モデルのロード (3B多言語、bf16精度)
encoder = Encoder.from_pretrained("HumeAI/tada-codec",
    subfolder="encoder").to("cuda")
model = TadaForCausalLM.from_pretrained("HumeAI/tada-3b-ml",
    torch_dtype=torch.bfloat16).to("cuda")

# 参照音声で話者スタイルプロンプティング
audio, sr = torchaudio.load("reference.wav")
prompt = encoder(audio, text=["reference text"], sample_rate=sr)

# 新しいテキストで音声合成
output = model.generate(prompt=prompt, text="合成するテキスト")

注記: HuggingFaceでMeta Llama 3.2 Community Licenseを事前に承認しないと、モデルの重みをダウンロードできません。

FAQ

TADA (Text-Acoustic Dual Alignment)とは何ですか?

テキストと音響のデュアルアラインメント(1:1トークンアラインメント):テキストトークンと音声ベクトルを1:1で同期させ、従来のTTSの構造的な問題である単語の欠落、繰り返し、幻覚をアーキテクチャレベルで解消。1,000件以上のLibriTTSRテストでコンテンツ幻覚ゼロを達成。 5倍高速な推論速度:リアルタイムファクター(RTF)0.09で、同等のLLMベースのTTSと比較して約5倍高速。従来のシステムが1秒あたり12.5〜75個のオーディオトークンを処理するのに対し、TADAは2〜3フレーム/秒で動作しながらも高品質な音声合成を実現。H100でキャッシュを活用するとRTFは約0.12x。 10倍効率的なコンテキストウィンドウ:2,048トークンで約700秒(約11.7分)のオーディオをカバー。従来のシステムの約70秒と比較して10倍の効率。長文の朗読、オーディオブック、長時間の会話生成に有利。 多言語サポート(10言語):3B-MLモデルを基準に、英語、アラビア語、中国語、ドイツ語、スペイン語、フランス語、イタリア語、日本語、ポーランド語、ポルトガル語をサポート。言語ごとにアライナーモジュールを拡張。 デュアルストリーム生成:テキストと音声を同時に生成し、Speech Free Guidance(テキストのみのガイダンス)を通じて、logitブレンディングにより発話品質を制御可能。 プロンプトキャッシュ:EncoderOutput.save()/load()を使用して、参照音声のエンコーディング結果をキャッシュすることで、反復推論時にVRAMを約2.5GB削減し、速度を向上。 フローマッチングベースのデコーディング:LLMの隠れ状態に基づいて条件付けられたフローマッチングヘッドにより、高忠実度のオーディオを復元。フローマッチングステップを20から10に削減することで、品質を低下させずに約1.3倍の速度向上を実現。

TADA (Text-Acoustic Dual Alignment)はいつ使いますか?

テキストと音声を1対1で対応付けるトークンアライメント方式を用いた高品質TTSモデル

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。

BioPlayground

閲覧・リンク・適法な引用は開放し、高速な一括収集と無断再配布は制限します。

別途表示がない限り、コンテンツの権利はBioPlaygroundまたは正当な権利者に帰属します。