Chatterbox Multilingual V3
0.5BパラメータのLlamaをベースにした多言語オープンソースTTSモデル
Resemble AIが2026年6月10日に公開したChatterbox Multilingual V3は、0.5BパラメータのLlamaをベースとしたオープンソースのテキスト読み上げ(Text-to-Speech)モデルである。GPTがどのようなテキストでも理解し応答するように、Chatterboxはどのようなテキストでも25言語の自然な音声に変換する。5〜20秒の短い音声サンプルだけで話者の声を複製(Zero-shot voice cloning)し、Classifier-Free Guidance(CFG)と感情の強さ調整(Exaggeration)パラメータを通じて、単調な朗読から劇的な演技まで、音声表現力を精密に制御できる。
従来の商用TTSサービスは高品質を提供するが、クラウドへの依存、使用量に応じた課金、データプライバシーの制約という根本的な限界がある。Chatterbox V3はMITライセンスによる完全なオープンソースとして、これらの障壁を取り除く。ブラインドテストでElevenLabsと比較して63.75%の好感度を獲得し、ロイヤリティ、収益分配、使用量制限なしに商用展開が可能である。さらに注目すべき点は、PerTh(Perceptual Threshold)ウォーターマーキングが標準装備されていることである。心理音響学の原理を活用し、人間の耳には聞こえないが、MP3圧縮、電話コーデック、オーディオ編集後にも残る神経ウォーターマークを挿入し、2026年8月に施行予定のEU AI Act Article 50のAI生成コンテンツ表示義務を事前に満たす。
V3は、21の基本言語に6つの言語パック(中国語マンダリン、ヒンディー語、ブラジルポルトガル語、ヨーロッパポルトガル語、ラテンアメリカスペイン語、ヨーロッパスペイン語)を追加し、合計25言語をサポートする。イタリア語のCER(Character Error Rate)は0.20%、ドイツ語は0.20%未満、英語は0.65%で、主要言語で実用レベルの精度を達成した。単一のH100 GPUでTTFB(Time-to-First-Byte)300ms未満、リアルタイム係数(RTF)約5倍を記録し、NVIDIA NIMによる展開時には、最適化されていないPyTorchと比較して2〜39倍の処理能力の向上が可能である。36,700時間の学習データを用いて、V2と比較してプロンプトからの逸脱、繰り返し、アクセントのずれ、話者類似性の問題を改善した。ただし、韓国語(CER 70.90%)とベトナム語(75.21%)は、まだ実用展開のために追加の作業が必要である。
💻 必要なスペック
NVIDIA GPU 4GB以上を推奨(RTX 3060以上でリアルタイム生成が可能)。CPU/Apple MPSにも対応しているが、推論速度が低下する。H100ではTTFB 300ms未満、RTFが約5倍になる。
モデル1つあたり約500MB(0.5Bパラメータ)。パッケージ全体と言語パックを含むと、約4〜5GB。
⚡ インストール
4-1. 簡単な始め方
pip install chatterbox-tts
4-2. 基本的な使用方法(多言語V3)
from chatterbox.mtl_tts import ChatterboxMultilingualTTS
model = ChatterboxMultilingualTTS.from_pretrained(device="cuda", t3_model="v3")
wav = model.generate(
"Bonjour, comment allez-vous aujourd'hui?",
language_id="fr",
audio_prompt_path="ref_speaker.wav"
)
4-3. ターボモデル(低遅延英語)
from chatterbox.tts_turbo import ChatterboxTurboTTS
model = ChatterboxTurboTTS.from_pretrained(device="cuda")
wav = model.generate(
"Hi there [chuckle], have you got a minute?",
audio_prompt_path="ref_clip.wav"
)
4-4. ソースのインストール
git clone https://github.com/resemble-ai/chatterbox.git
cd chatterbox
pip install -e .
🧬 バイオ活用シナリオ
多言語音声エージェントの構築
顧客サービスチャットボットにChatterbox Multilingual V3を統合し、フランス語、ドイツ語、スペイン語など、主要な市場向けにカスタマイズされた音声応答を生成。NVIDIA NIMでデプロイすることで、同時に数百のセッションを処理でき、PerThウォーターマーキングにより、AI生成音声のトレーサビリティを確保。
オーディオブック・ポッドキャストの自動化
5〜20秒のナレーターサンプルを使用して、ゼロショット音声複製を行い、長編テキストを自然な音声に変換。Exaggerationパラメータを0.7以上に設定して劇的な表現を加え、CFGウェイトを0.3に設定して、コンテンツの性質に合わせた精密なチューニングを行うことで、話者のペースを調整。
EU AI Act規制に準拠した音声コンテンツの制作
2026年8月のArticle 50施行に備え、すべてのAI生成音声にPerThウォーターマークを自動的に挿入。MP3圧縮、電話コーデック、編集後も、ほぼ100%の検出率を維持し、検出ライブラリをGitHubで緩やかなライセンスで提供することで、検証パイプラインを自社で構築可能。
FAQ
Chatterbox Multilingual V3とは何ですか?
Resemble AIが2026年6月10日に公開したChatterbox Multilingual V3は、0.5BパラメータのLlamaをベースとしたオープンソースのテキスト読み上げ(Text-to-Speech)モデルである。GPTがどのようなテキストでも理解し応答するように、Chatterboxはどのようなテキストでも25言語の自然な音声に変換する。5〜20秒の短い音声サンプルだけで話者の声を複製(Zero-shot voice cloning)し、Classifier-Free Guidance(CFG)と感情の強さ調整(Exaggeration)パラメータを通じて、単調な朗読から劇的な演技まで、音声表現力を精密に制御できる。 従来の商用TTSサービスは高品質を提供するが、クラウドへの依存、使用量に応じた課金、データプライバシーの制約という根本的な限界がある。Chatterbox V3はMITライセンスによる完全なオープンソースとして、これらの障壁を取り除く。ブラインドテストでElevenLabsと比較して63.75%の好感度を獲得し、ロイヤリティ、収益分配、使用量制限なしに商用展開が可能である。さらに注目すべき点は、PerTh(Perceptual Threshold)ウォーターマーキングが標準装備されていることである。心理音響学の原理を活用し、人間の耳には聞こえないが、MP3圧縮、電話コーデック、オーディオ編集後にも残る神経ウォーターマークを挿入し、2026年8月に施行予定のEU AI Act Article 50のAI生成コンテンツ表示義務を事前に満たす。 V3は、21の基本言語に6つの言語パック(中国語マンダリン、ヒンディー語、ブラジルポルトガル語、ヨーロッパポルトガル語、ラテンアメリカスペイン語、ヨーロッパスペイン語)を追加し、合計25言語をサポートする。イタリア語のCER(Character Error Rate)は0.20%、ドイツ語は0.20%未満、英語は0.65%で、主要言語で実用レベルの精度を達成した。単一のH100 GPUでTTFB(Time-to-First-Byte)300ms未満、リアルタイム係数(RTF)約5倍を記録し、NVIDIA NIMによる展開時には、最適化されていないPyTorchと比較して2〜39倍の処理能力の向上が可能である。36,700時間の学習データを用いて、V2と比較してプロンプトからの逸脱、繰り返し、アクセントのずれ、話者類似性の問題を改善した。ただし、韓国語(CER 70.90%)とベトナム語(75.21%)は、まだ実用展開のために追加の作業が必要である。
Chatterbox Multilingual V3はいつ使いますか?
0.5BパラメータのLlamaをベースにした多言語オープンソースTTSモデル
Chatterbox Multilingual V3のバイオ研究での活用例は何ですか?
多言語音声エージェントの構築: 顧客サービスチャットボットにChatterbox Multilingual V3を統合し、フランス語、ドイツ語、スペイン語など、主要な市場向けにカスタマイズされた音声応答を生成。NVIDIA NIMでデプロイすることで、同時に数百のセッションを処理でき、PerThウォーターマーキングにより、AI生成音声のトレーサビリティを確保。
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。