xAI、音声を文字にする「Grok Voice Transcribe 2.0」を公開。精度2倍で料金は据え置き

30秒でわかる

  • 音声を文字に起こすxAIの新モデル「Grok Voice Transcribe 2.0」が登場(文字起こし=録音や通話の声を自動でテキストにすること)
  • 精度が前のバージョンの2倍になったのに、値段は同じ(まとめて処理する方式で1時間0.10ドル)
  • このモデルを使っているアプリは、開発者が何もしなくても自動で精度が上がる

何が変わった

「Grok(グロック)」はxAIのAIで、これまでは主にチャットで知られていました。今回出たのは、その音声を文字にする専用モデルの新版です。xAIによると、公開されている第三者の精度ランキング(Artificial Analysisのリアルタイム部門)で32モデル中1位とのことです。機能面では、話し手ごとに誰が話したかを分けて表示(追加料金なし)、「あー」「えーと」といった不要な言葉を自動で削除、数字・日付・金額・電話番号などを読みやすい形に整える、といった点に対応しています。すでに画面録画ツール「Loom」を持つアトラシアン社が、全動画の文字起こしにこのモデルを使い始めたと紹介されています。

誰に関係する

音声の文字起こしを使うアプリやサービスの開発者に関係します。会議の議事録、通話の記録、字幕づくりなどを自動化したい場面が対象です。一般の人が直接触るものではありませんが、自分が使っているアプリがこのモデルを採用していれば、文字起こしの精度が自然に上がる可能性があります。料金や対応言語は用途で変わるため、使う前に公式で確認してください。

公式情報

公式(xAI: Introducing Grok Voice Transcribe 2.0) ↗