Google、文章を読み上げる「Gemini 3.8 TTS」を公開。言葉で指示して声を一から作れる
30秒でわかる
- Googleが文章を読み上げる音声AI(TTS)「Gemini 3.8 Flash TTS」と軽量版「Flash-Lite TTS」を公開
- 役柄やなまり、声の特徴を言葉で説明するだけで、新しい声を一から作れる。100以上の言語に対応
- すぐ使える声は2,000種類以上。作った音声には、AIが作ったと後で判別できる透かしが入る
何が変わった
TTS(テキスト読み上げ=文章を人の声にする技術)のGoogleの新モデルです。上位のGemini 3.8 Flash TTS ↗は、ゲームのキャラクターやオーディオブックのように声の演技を細かく作り込みたい用途向けです。役柄・なまり・声の特徴を文章で指示すると、その場で新しい声を作れます。セリフごとに話す速さや感情、笑い声やため息まで指定できます。30秒の音声サンプルからその人の声を再現する機能もあり、本人の同意を確認するしくみが付いています。あらかじめ用意された声は2,000種類以上で、メキシコのスペイン語やカナダのケベック州のフランス語のような地域ごとの話し方も含まれます。軽量版のFlash-Lite TTSは、吹き替えや電話応対のように大量に音声を作る用途に向け、費用を抑えたモデルです。作った音声には、Googleの透かし技術SynthIDが必ず入ります。
誰に関係する
開発者はGoogle AI Studio(Googleのブラウザ上の開発ツール)とGemini APIで使えます。一般向けには、Gemini NotebookでFlash TTS、Google VidsでFlash-Lite TTSが誰でも使えると公式は説明しています。料金は発表内で示されていません。