TADA
オープンソースのLLMを基盤とするテキスト読み上げ(TTS)モデル — Hume AI開発
TADAは、Hume AIが2026年3月に公開したオープンソースのLLMベースのテキスト読み上げ(Text-to-Speech)モデルであり、その名の通り、テキストトークンと音響ベクトルを1対1で同期させるアーキテクチャを中核としている。MetaのLlama 3.2をベースの言語モデルとして採用し、独自開発のエンコーダー・アライナー(Encoder-Aligner)を用いて、入力オーディオから各テキストトークンに対応する音響特徴を抽出し、LLMの隠れ状態に基づいて条件付けられたフローマッチングヘッドが連続的な音響ベクトルを生成し、デコーダーが最終的な波形に復元するパイプラインに従う。10億パラメータ(英語専用)と30億パラメータ(10言語の多言語)の2つのモデルをHugging FaceとGitHubに同時に公開しており、コードはMITライセンスで自由に修正・配布できる。 従来のLLMベースのTTSシステムは、テキストトークン1つに対して12.5〜75個の固定フレームのオーディオトークンを生成するという構造的な不整合(mismatch)を抱えており、モデルが長いオーディオシーケンスを自己回帰的にデコードする過程で、単語を飛ばしたり、繰り返し挿入したりするコンテンツの幻覚(hallucination)が避けられない。TADAは、この問題を学習や後処理ではなく、アーキテクチャ自体で解決する。GPSナビゲーションが経路上の各地点と実際の道路座標を1対1で対応させ、経路からの逸脱を根本的に防ぐように、TADAは各LLMステップで正確に1つのテキストトークンと1つのオーディオフレームのみを処理するため、単語の欠落や挿入が物理的に発生することはありえない。LibriTTSRの1,000件以上のテストで、コンテンツの幻覚は0件を記録し、リアルタイム係数(RTF)0.09で、同等のLLM-TTSと比較して約5倍、リアルタイム再生と比較して約11倍の高速な生成速度を達成した。同じ2,048トークンのコンテキストウィンドウで、従来のシステムが約70秒を処理するのに対し、TADAは約700秒(約11.7分)を処理できるため、長文の朗読や長い会話の合成においても、文脈が途切れることはない。 生命科学研究環境において、TADAの幻覚ゼロという特性は特に価値が高い。例えば、臨床試験の患者向け教育資料を3B-MLモデルで10言語の音声に変換する場合、薬の名前や投与量などの定量的な情報が歪みなく正確に発話される。オーディオブックや学術論文の朗読パイプラインでは、1つの参照音声で話者のスタイルをプロンプト(Speaker Similarity 4.18/5.0)し、プロンプトキャッシュ(EncoderOutput.save/load)でチャンク間のエンコーディングを再利用することで、Naturalness 3.78/5.0レベルの自然さを維持できる。モデルの重みとコードがすべて公開されているため、機密性の高い医療・研究データを外部APIに送信することなく、オンプレミスで処理できる点も、研究機関にとって実質的な利点となる。
💻 必要なスペック
TADA-1B bf16 推論時 10-12GB、TADA-3B-ML bf16 推論時 約9GB(エンコーダーを別々にロードすることで約2.5GB 削減可能)。NVIDIA CUDA 互換 GPU 必須
3B-ML モデルの重みは約8GB、1B モデルは約2GB、コーデック(tada-codec)は約500MB。全体のパッケージは約10-12GB
⚡ インストール
### 4-1. 簡単な始め方
```bash
pip install hume-tada
```
### 4-2. ソースのビルド
```bash
git clone https://github.com/HumeAI/tada.git
cd tada
pip install -e .
```
### 4-3. 基本的な使い方 (Python)
```python
from tada.modules.encoder import Encoder
from tada.modules.tada import TadaForCausalLM
import torch, torchaudio
encoder = Encoder.from_pretrained("HumeAI/tada-codec",
subfolder="encoder").to("cuda")
model = TadaForCausalLM.from_pretrained("HumeAI/tada-3b-ml",
torch_dtype=torch.bfloat16).to("cuda")
audio, sr = torchaudio.load("reference.wav")
prompt = encoder(audio, text=["reference text"], sample_rate=sr)
output = model.generate(prompt=prompt, text="合成するテキスト")
```
> HuggingFaceでMeta Llama 3.2 Community Licenseを事前に承認しないと、モデルの重みをダウンロードできません。🧬 バイオ活用シナリオ
多言語対応の患者向け教育音声の自動生成
臨床試験や病院環境において、患者向け教育スクリプトを3B-MLモデルで10言語の音声に変換。1対1のトークンアライメントにより、薬の名前や投与量などの定量的な情報を欠落や歪みなく正確に発話することで、正確性を保証。RTF 0.09により、数百件の教育スクリプトをバッチ処理することが可能で、オンプレミスで動作するため、患者データを外部に送信する必要はありません。
学術論文やオーディオブックの長文朗読パイプライン
2,048トークンで約700秒分のコンテンツを一度に処理できるため、論文1編(約8,000語)を2〜3つのチャンクに分割して連続合成することが可能。参照音声1件で話者スタイルを固定(話者類似度4.18/5.0)し、プロンプトキャッシュによりチャンク間のエンコーディングを再利用。従来の固定フレームTTSと比較して10倍長いコンテキストで、文脈の自然さを維持。
実験室の自動化におけるリアルタイム音声ガイダンス
実験プロトコルの各段階における音声指示を、RTF 0.09(リアルタイムの約11倍の速度)で遅延なく合成。 「試薬Aを50μLピペットしてください」のような定量的な指示において、幻覚ゼロアーキテクチャが数値の歪みを根本的に防止。1B軽量モデルを使用する場合、12GB VRAMのコンシューマーGPUでも動作可能。
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。