AI Tools
音声 AI中級

VoxCPM2

連続音響空間で自然な音声を生成するオープンソースの次世代音声合成モデル

OpenBMBが2026年4月に正式に公開したVoxCPM2は、連続的な音響空間内で、人が直接話すように自然な音声を生成するオープンソースベースの革新的な次世代音声合成システムです。従来の音声モデルが、微細な音の単位を機械的なトークンに分割して処理することで、演算のボトルネックや不自然な単語の結合を引き起こしていた問題を克服するために、大規模言語モデルであるMiniCPMをバックボーンとし、改良された高解像度オーディオエンコーダー構造を有機的に接続しました。テキストを機械的な音の断片に変換して出力する従来の不連続オーディオトークン変換のプロセスから脱却し、連続的な音の波形と質感をそのまま再構成するトークナイザーフリーアーキテクチャ(Tokenizer-free architecture)を導入することで、48kHzのスタジオレベルの高音質オーディオ出力をローカル環境でも実現しました。

従来のテキスト読み上げ方式が、テキストの単語を細かく分割し、機械的な発音記号や不連続なトークンに変換した後、再びオーディオとして合成する形式であったのに対し、VoxCPM2は連続的な音響空間(Continuous acoustic space)を直接推論し、音の途切れや人工的なトーンの歪みが全くない自然な波形を形成します。これは、大規模言語モデルが以前の文脈の流れを読み取り、自然に文章を繋ぎ合わせるように、VoxCPM2も音の開始点から終了点までの微細な呼吸とアクセントの流れを有機的に織り上げていきます。ユーザーがテキストで感情や声の傾向を記述するだけで、新しい音声ペルソナを作成するボイスデザイン(Voice Design)や、短いオーディオクリップ1つで独自の音色を複製するゼロショット音声クローニング(Zero-shot voice cloning)機能を提供します。

このモデルは、多言語環境を必要とするグローバルサービスや、人工知能ボイスエージェントを構築する研究者に対して、強力な性能と柔軟性を同時に提供します。研究者は、VoxCPM2がサポートする30以上の主要な多言語データセット環境で、自然に言語を越えて合成音声をリアルタイムストリーミング形式で送信できます。ローカルGPUリソースを活用して、わずか数秒でテキストスクリプトから感情が込められたオーディオを大量に生成したり、LoRAのような効率的な微調整技術を活用して、特定の話し手の微細な言語習慣まで精密に学習させるカスタムパイプラインの開発にまで幅広く活用できます。

💻 必要なスペック

🧠RAM

最低8GB(NVIDIA RTX 3060などのコンシューマー向けGPUを推奨)、CPU専用/MPS対応

💾ストレージ

約10GB以上(モデルの重みと依存関係パッケージを含む)

インストール

4-1. 簡単な始め方

pip install voxcpm

4-2. 詳細なインストール

# リポジトリのクローンと依存関係のインストール
git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -r requirements.txt

# (オプション) LoRAの微調整のためのWebインターフェースの実行
python lora_ft_webui.py

FAQ

VoxCPM2とは何ですか?

OpenBMBが2026年4月に正式に公開したVoxCPM2は、連続的な音響空間内で、人が直接話すように自然な音声を生成するオープンソースベースの革新的な次世代音声合成システムです。従来の音声モデルが、微細な音の単位を機械的なトークンに分割して処理することで、演算のボトルネックや不自然な単語の結合を引き起こしていた問題を克服するために、大規模言語モデルであるMiniCPMをバックボーンとし、改良された高解像度オーディオエンコーダー構造を有機的に接続しました。テキストを機械的な音の断片に変換して出力する従来の不連続オーディオトークン変換のプロセスから脱却し、連続的な音の波形と質感をそのまま再構成するトークナイザーフリーアーキテクチャ(Tokenizer-free architecture)を導入することで、48kHzのスタジオレベルの高音質オーディオ出力をローカル環境でも実現しました。 従来のテキスト読み上げ方式が、テキストの単語を細かく分割し、機械的な発音記号や不連続なトークンに変換した後、再びオーディオとして合成する形式であったのに対し、VoxCPM2は連続的な音響空間(Continuous acoustic space)を直接推論し、音の途切れや人工的なトーンの歪みが全くない自然な波形を形成します。これは、大規模言語モデルが以前の文脈の流れを読み取り、自然に文章を繋ぎ合わせるように、VoxCPM2も音の開始点から終了点までの微細な呼吸とアクセントの流れを有機的に織り上げていきます。ユーザーがテキストで感情や声の傾向を記述するだけで、新しい音声ペルソナを作成するボイスデザイン(Voice Design)や、短いオーディオクリップ1つで独自の音色を複製するゼロショット音声クローニング(Zero-shot voice cloning)機能を提供します。 このモデルは、多言語環境を必要とするグローバルサービスや、人工知能ボイスエージェントを構築する研究者に対して、強力な性能と柔軟性を同時に提供します。研究者は、VoxCPM2がサポートする30以上の主要な多言語データセット環境で、自然に言語を越えて合成音声をリアルタイムストリーミング形式で送信できます。ローカルGPUリソースを活用して、わずか数秒でテキストスクリプトから感情が込められたオーディオを大量に生成したり、LoRAのような効率的な微調整技術を活用して、特定の話し手の微細な言語習慣まで精密に学習させるカスタムパイプラインの開発にまで幅広く活用できます。

VoxCPM2はいつ使いますか?

連続音響空間で自然な音声を生成するオープンソースの次世代音声合成モデル

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。