AI Tools
音声 AI中級

Moonshine v2

Whisperと比較して5倍高速な、超軽量のエッジデバイス専用音声認識エンジン

Moonshine v2は、アメリカのUseful Sensorsが2026年2月にリリースしたオープンソースの音声認識(ASR、Automatic Speech Recognition)エンジンです。一言で表すと、「Whisperの軽量版。Raspberry Pi、ウェアラブル、モバイルでもリアルタイムに動作するSTT」と言えるでしょう。

従来のOpenAI Whisperは正確ですが、サイズが大きく(tinyモデルでも39M+)、エッジデバイスでのリアルタイム処理が困難でした。Moonshine v2は、「Ergodic Streaming Encoder」アーキテクチャを採用し、スライディングウィンドウによる自己注意メカニズムを適用することで、27MのパラメータでWhisperと同等の精度を維持しながら、5倍高速な推論速度を実現しています。RoPE(Rotary Position Embedding)によりゼロパディングを排除し、メモリと計算の無駄を最小限に抑えています。まるで「WhisperがクラウドGPU用のSUVであるなら、MoonshineはエッジIoT用の電動自転車」と言えるでしょう。

生命工学・医療研究者の視点から見ると、(1)患者へのインタビューや臨床試験の議事録をクラウドに送信することなく、ローカルでリアルタイムに文字起こし(HIPAA・GDPR保護)、(2)ライブセルイメージング中に「3分後に薬剤を投与」などの音声メモを自動的にタイムスタンプとともに保存、(3)Raspberry Piベースの実験用ノートパソコンの補助デバイスを構築することが可能です。moonshine-voice SDKは、STT + 意図認識 + TTSを統合的に提供し、「手を触れずにマイクで実験コマンド」のような音声エージェントを作成することもできます。

💻 必要なスペック

🧠RAM

最小2GB(Tiny 27Mモデル)、推奨4GB(Base 61Mモデル)、8GB以上(マルチチャネルまたは韓国語のファインチューニング)

🎮VRAM

0(CPU専用も可能、Raspberry Pi 4からリアルタイム処理)/ NVIDIA GPU 2GB以上で10倍の高速化 / Apple Silicon Metal対応

💾ストレージ

Tinyは約26MB / Baseは約61MB / 全パッケージ250MB以内。学習データは別途

インストール

簡単な始め方 (Python pip)

pip install moonshine-voice

Python API — 基本的な文字起こし

import moonshine text = moonshine.transcribe("audio.wav", model="moonshine/tiny") print(text)

リアルタイムストリーミング (マイク入力)

from moonshine_voice import StreamingTranscriber stt = StreamingTranscriber(model="moonshine/base") for chunk in stt.stream_from_microphone(): print(chunk.text, end="", flush=True)

エッジデバイス (Raspberry Pi 5) 要件: Python 3.10以上、sounddevice、numpy

pip install moonshine-voice[edge] python -m moonshine_voice.pi --model tiny --language ko

🧬 バイオ活用シナリオ

🎙️

臨床インタビュー・診療記録のローカルSTT

Moonshine tiny(27M)モデルをMac mini M2に搭載し、患者のインタビューをリアルタイムで文字起こし。クラウドへの送信は行わず(HIPAA・GDPRに準拠)、30分のインタビューを約6秒の待ち時間で文字起こし完了。moonshine-voice SDKに「患者ID」「症状の発症時期」などの意図認識ルールを追加することで、構造化されたEMR入力の自動生成が可能。

🔬

ライブセルイメージングの音声アノテーション

顕微鏡の横にRaspberry Pi 5とMoonshine + マイクモジュールを配置。"3分後にEGF 100ng/mLを処理"などの音声メモを自動タイムスタンプとともに.jsonlログとして記録。ImageJ/Fijiマクロが時間同期メタデータとして取り込む。手がかかるライブ実験に即座に適用可能。

🤖

エッジボイスエージェント(実験室アシスタント)

moonshine-voice SDK + Llama.cpp + Pi 4(4GB)で実験室アシスタントを構築。"OD600が0.6に達したらアラームを鳴らす" "PCRマスターミックスのレシピを表示する"などのコマンドを100ms以下のレイテンシーで認識し、MQTTで実験機器をトリガー。クラウドへの依存はゼロ、消費電力は5W未満。

FAQ

Moonshine v2とは何ですか?

Moonshine v2は、アメリカのUseful Sensorsが2026年2月にリリースしたオープンソースの音声認識(ASR、Automatic Speech Recognition)エンジンです。一言で表すと、「Whisperの軽量版。Raspberry Pi、ウェアラブル、モバイルでもリアルタイムに動作するSTT」と言えるでしょう。 従来のOpenAI Whisperは正確ですが、サイズが大きく(tinyモデルでも39M+)、エッジデバイスでのリアルタイム処理が困難でした。Moonshine v2は、「Ergodic Streaming Encoder」アーキテクチャを採用し、スライディングウィンドウによる自己注意メカニズムを適用することで、27MのパラメータでWhisperと同等の精度を維持しながら、5倍高速な推論速度を実現しています。RoPE(Rotary Position Embedding)によりゼロパディングを排除し、メモリと計算の無駄を最小限に抑えています。まるで「WhisperがクラウドGPU用のSUVであるなら、MoonshineはエッジIoT用の電動自転車」と言えるでしょう。 生命工学・医療研究者の視点から見ると、(1)患者へのインタビューや臨床試験の議事録をクラウドに送信することなく、ローカルでリアルタイムに文字起こし(HIPAA・GDPR保護)、(2)ライブセルイメージング中に「3分後に薬剤を投与」などの音声メモを自動的にタイムスタンプとともに保存、(3)Raspberry Piベースの実験用ノートパソコンの補助デバイスを構築することが可能です。moonshine-voice SDKは、STT + 意図認識 + TTSを統合的に提供し、「手を触れずにマイクで実験コマンド」のような音声エージェントを作成することもできます。

Moonshine v2はいつ使いますか?

Whisperと比較して5倍高速な、超軽量のエッジデバイス専用音声認識エンジン

Moonshine v2のバイオ研究での活用例は何ですか?

臨床インタビュー・診療記録のローカルSTT: Moonshine tiny(27M)モデルをMac mini M2に搭載し、患者のインタビューをリアルタイムで文字起こし。クラウドへの送信は行わず(HIPAA・GDPRに準拠)、30分のインタビューを約6秒の待ち時間で文字起こし完了。moonshine-voice SDKに「患者ID」「症状の発症時期」などの意図認識ルールを追加することで、構造化されたEMR入力の自動生成が可能。

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。