AI Tools
音声 AI中級

Hume AI TADA

テキストと音声を1対1で対応付けるトークンアライメント方式を用いた感情表現TTSモデル — Hume AI

Hume AI TADAは、感情認識AIの研究機関であるHume AIが2026年3月に公開した、オープンソースのLLMベースのTTSモデルです。一言で表すと、「読み上げたいテキストを正確に読み上げ、単語を省略したり、幻覚を起こしたりしないLLM-TTS」です。 従来のLLMベースのTTSの大きな問題点は、**コンテンツの幻覚**でした。これは、モデルが単語を省略したり、同じ単語を繰り返したり、元のテキストにない音を作り出したりする現象です。TADAは、テキストトークンと音声トークンを1:1で対応付けるText-Acoustic Dual Alignment構造を採用することで、この問題をアーキテクチャレベルで解決し、1,000件以上のLibriTTSRテストで幻覚を0件に抑えました。同時に、RTF 0.09というスコアで、同等のLLM-TTSと比較して5倍高速であり、正確さと速度を両立した珍しいモデルです。 実務的な観点から見ると、(1)オーディオブックやナラティブコンテンツのように、単語の省略を絶対に許さない長文の読み上げにおいて信頼性が高く、(2)2,048トークンで約11分間のコンテンツを一度に処理し、従来のシステム(約70秒)の10倍の効率で長い会話を生成し、(3)10言語(英語、中国語、日本語、アラビア語など)に対応した多言語モデルであり、グローバルコンテンツパイプラインを単一のモデルで運用できます。

💻 必要なスペック

🧠RAM

3Bモデルの場合、bf16精度で約9GB、標準精度で約11.5GB。NVIDIA GPU CUDA互換が必須。RTX 3060(12GB)以上であれば、bf16で3Bモデルを動作可能。1Bモデルは、より少ないVRAMで動作。

💾ストレージ

3Bモデルの重みは約8GB、1Bモデルは約2GB、コーデック(tada-codec)は約500MB。全体のパッケージは約10〜12GB

インストール

### 4-1. 簡単な始め方

```bash
pip install hume-tada
```

### 4-2. ソースのビルド

```bash
git clone https://github.com/HumeAI/tada.git
cd tada
pip install -e .
```

### 4-3. 基本的な使い方(Python)

```python
from tada.modules.encoder import Encoder
from tada.modules.tada import TadaForCausalLM
import torch, torchaudio

# モデルのロード(3B多言語、bf16精度)
encoder = Encoder.from_pretrained("HumeAI/tada-codec",
    subfolder="encoder").to("cuda")
model = TadaForCausalLM.from_pretrained("HumeAI/tada-3b-ml",
    torch_dtype=torch.bfloat16).to("cuda")

# 参照音声で話者スタイルプロンプティング
audio, sr = torchaudio.load("reference.wav")
prompt = encoder(audio, text=["reference text"], sample_rate=sr)

# 新しいテキストで音声合成
output = model.generate(prompt=prompt, text="合成するテキスト")
```

> **注記**: HuggingFaceでMeta Llama 3.2 Community Licenseを事前に承認しないと、モデルの重みをダウンロードできません。
📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。