Microsoft、音声認識モデル「MAI-Transcribe-2」を発表。60言語対応で高速・1時間$0.10

30秒でわかる

  • Microsoft AIの新しい音声認識モデル(話し言葉を文字に起こすAI)「MAI-Transcribe-2」
  • 60言語に対応し、他社の音声モデルより高速/料金は1時間あたり$0.10(年末までの期間限定)
  • 誰の発言かを分ける話者分離、単語ごとの時間記録(タイムスタンプ)なども搭載(Microsoft AI ↗)

何が変わった

MAI-Transcribe-2は、Microsoft AIが公開した話し言葉を文字に起こす(音声認識)モデルです。多言語の精度テスト「FLEURS」では60言語の平均で単語誤り率(WER=聞き取りを間違えた単語の割合。低いほど正確)が5.2%で1位とされます(Artificial AnalysisのWERランキングでは2位)。速度は、OpenAIのGPT-Transcribeより最大10倍、ElevenLabsのScribe v2より7倍、GoogleのGemini 3.5 Transcribeより5倍速いとMicrosoftは説明しています。誰の発言かを分ける話者分離、単語ごとの時間の記録(タイムスタンプ)、雑音への強さなども備えます。料金は1時間あたり$0.10(年末までの期間限定)で、Microsoft Foundry・MAI Playground・Open Routerから使えます。「世界で最速・最高精度・最安」という表現はMicrosoft自身の主張です。

誰に関係する

会議・動画・通話などの音声を安く大量に文字起こししたい人や開発者に関係します。議事録・字幕・アクセシビリティ用途を想定しており、60言語に対応します。実際の精度や速度は用途・環境で変わる可能性があります。

公式情報

Microsoft AI(公式発表) ↗