10月3日、Michal Sutterが「Microsoft AI Releases MAI-Transcribe-2-Streaming: #1 Real-Time Speech-to-Text Model on Artificial Analysis」と題した記事を公開した。Microsoftが2026年10月1日にリリースしたストリーミング型STTモデル「MAI-Transcribe-2-Streaming」が、独立評価機関の計測で38モデル中1位を獲得した。精度・遅延ともに競合を上回るという内容で、ボイスエージェント開発者にとって注目に値する発表だ。
WER 2.5%、0.13秒——ベンチマーク首位の数字
リアルタイム音声認識(STT)の精度と遅延は、ボイスエージェントや字幕生成の実用性を左右する。独立評価機関のArtificial Analysisが38モデルを対象に測定したAA-WER Streamingインデックスでは、MAI-Transcribe-2-Streamingが最終トランスクリプト・最初の部分トランスクリプト(パーシャル)の両部門で1位を獲得した。
評価の内訳は以下の通りだ:
| モデル | 最終WER | 最終確定までの時間 |
|---|---|---|
| MAI-Transcribe-2-Streaming(Microsoft) | 2.5% | 0.13秒 |
| Grok Voice Transcribe 2.0(xAI) | 2.7% | 0.49秒 |
| Muse Voice Transcribe(Meta) | 3.1% | 0.16秒 |
| Gemini 3.5 Transcribe Live(Google) | 4.0% | 非公表 |
| Whisper Large v3 Turbo(OpenAI) | 6.8% | 非対応(バッチ処理) |
(WER=単語誤り率。数値が低いほど精度が高い)
Whisperはリアルタイムストリーミングに対応しないバッチ処理モデルであるため、遅延の直接比較はできないが、WERの観点ではMAI-Transcribe-2-StreamingはWhisper Large v3 Turboの6.8%に対して2.5%と大幅に上回っている。タイトルで「Whisperを抑えて」と表現しているのはこの精度差を指している。
ベンチマークは約8時間の音声を使用し、AA-AgentTalk(50%)、VoxPopuli(25%)、Earnings22(25%)の3種類を混合。発話終了の検出にはSileroVADを使用している。
一点補足しておくと、「最も速い」モデルはCartesia Ink-2(外部エンドポイント)で最終確定が0.07秒だが、WERは4.0%と精度で劣る。MAI-Transcribe-2-Streamingは精度と遅延のバランスでPareto最適に位置するとMicrosoftは説明している。
パーシャルトランスクリプトが「最終と同精度」の意味
このモデルが特徴的なのは、話者がまだ話している途中から高精度なテキストを返す点だ。
最初のパーシャルは音声受信から約100ms後に出力される。このパーシャルのWERは2.5%(確定までの時間:0.12秒)で、最終トランスクリプトのWER 2.5%(0.13秒)と同水準だ。パーシャルと最終で0.01秒の差があるのは計測タイミングの違いによるもので、精度自体はほぼ同等である。ボイスエージェントは発話終了を待たずに処理やツール呼び出しを開始できるため、体感的な応答速度の改善に直結する。Microsoftは内部テストとして、テキスト表示速度が最も近い競合の2倍速という数字も示している。
対応言語は60言語で、連続的な自動言語検出機能を備える。話者が言語を切り替えても追従する。
開発者向けの統合方法と価格
統合経路は2つ用意されている:
- Realtime API:OpenAIのRealtime互換WebSocketを使うアプリ向け
- Azure Speech SDK:接続管理・リトライ・音声ストリーミングを自動処理
MAI Playground、Vercel、Azure Voice Liveからも利用可能。LiveKitサポートは近日提供予定とされている。
価格は**$0.54/時間(2026年末までのイントロダクトリー価格)。Artificial Analysisの換算では$9.00/1,000分**に相当する。xAI($0.20/時間)やMeta($0.18/時間)と比べると割高だ。なお、Googleの価格については元記事中で「推定レート」と記載されており、公式発表に基づく数字ではないため本稿では比較対象から除外している。
バッチ処理版の「MAI-Transcribe-2」は$0.10/時間と大幅に安い。リアルタイム性が不要な用途ではバッチ版が現実的な選択肢になる。
なお現時点ではパブリックプレビューでSLAなし、オープンウェイトなしの状態だ。
テキスト読み上げモデルとのボイスループ構築
同日、テキスト読み上げ(TTS)モデルのMAI-Voice-2.1とMAI-Voice-2.1-Flashも公開された。本記事の主題はSTTモデルだが、これらのTTSモデルとの組み合わせにより、音声入力から音声出力までを一貫してMicrosoft AIのAPIで完結させるボイスループが構築できる点は、システム設計の観点で触れておく価値がある。
- MAI-Voice-2.1-Flash:$15/100万文字、45秒の音声を150msで生成
- MAI-Voice-2.1:$22/100万文字、23言語・26ロケール対応
MAI-Transcribe-2-StreamingとMAI-Voice-2.1-Flashを組み合わせれば、STTの低遅延とTTSの高速生成が揃い、エンドツーエンドの音声エージェント構築が現実的な選択肢となる。
詳細はMicrosoft AI Releases MAI-Transcribe-2-Streaming: #1 Real-Time Speech-to-Text Model on Artificial Analysisを参照していただきたい。