600以上の言語をゼロショットで喋らせる無料の音声合成「OmniVoice」(ElevenLabsのOSS代替)
30秒でわかる
- テキストを入力すると音声を作る無料・オープンソースのTTS(文章読み上げAI)。開発は音声認識で知られるk2-fsa
- 600以上の言語に対応し、ゼロショット学習なしのお手本音声3〜10秒だけで声を再現(ボイスクローン)できる。作者いわく対応言語の広さはゼロショットTTSで最大級
- 性別・年代・声の高さ・なまりなどを指定して声を作る、[laughter](笑い)などの効果音タグ、読み間違いの発音修正にも対応。Apache 2.0で商用も可
何が変わった
OmniVoiceは、文章を入れると人の声で読み上げる音声合成モデルです。特徴は対応言語が600以上と多く、そのうえゼロショットで動く点です。ゼロショットとは、話者ごとの事前学習をしなくても、3〜10秒ほどのお手本音声を渡すだけでその声色をまねて読み上げられる仕組みのことです。声のお手本が無くても、性別・年代・声の高さ・なまり・ささやき声といった特徴を指定して声そのものを設計することもできます。文中に[laughter](笑い)や[sigh](ため息)のようなタグを書くと、その部分に非言語の反応を差し込めます。中国語のピンインや英語の発音記号を使った読み間違いの修正にも対応します。生成の速さは実時間比0.025(1秒の音声を約0.025秒で作る計算)と速く、出力は24kHzの音声です。
誰に関係する
ElevenLabsのような有料の音声AIを、無料かつ自分のPCで動かしたい人や、多言語のナレーション・読み上げを作りたい人に向いています。NVIDIA・Apple Silicon・Intel Arcで動き、Python・Webの操作画面・コマンド、HuggingFaceやGoogle Colabからも試せます。動かすにはPyTorch(AIを動かす土台ソフト)の環境が要るため、ある程度の下準備は必要です。