Google「Gemini 3.8 Live」公開:AIと自然に会話できる音声モデル、聞き取り精度の高い文字起こしも

30秒でわかる

  • Googleが、声で話すと声で答える会話用の音声AI「Gemini 3.8 Live」を公開
  • 会話を続けながら裏側でツールを呼び出したり、番号や記号を正確に聞き取ったりでき、97以上の言語に対応
  • あわせて、話し声をとても正確に文字にする「Gemini 3.5 Transcribe」も提供。85以上の言語に対応

何が変わった

Googleが、リアルタイムで会話できる音声AIGemini 3.8 Live ↗を公開しました。これは話しかけると声で返してくれる「音声どうしのやり取り」用のモデルで、たとえばしゃべりながら裏で予約やデータ検索などの作業(ツール呼び出し)を進める、電話番号や商品コードといった英数字を正確に聞き取る、といったことができます。97以上の言語に対応し、じっくり考えて答える「Extended Thinking」版も用意されています。あわせて、話し声を高い精度で文字に起こす専用モデルGemini 3.5 Transcribe ↗も提供されます。文章に「えー」「あのー」といった言いよどみを除いて整える機能や、覚えさせたい専門用語の登録(最大1,000語)に対応し、85以上の言語を扱えます。いずれも開発者がAPI(外部から呼び出して使う仕組み)経由で使うもので、自分のPCで動かせる公開モデルではありません。

誰に関係する

音声で操作するアプリや、電話対応・議事録の自動化を作りたい開発者に関係します。一般の人が直接触るものではありませんが、今後こうした音声AIを組み込んだサービスが増えるとみられます。料金は音声入力が1分あたり0.005ドル、出力が0.018ドルと案内されています。

公式情報

公式ブログ(Google) ↗