10月2日、The Decoderが「Microsoft AI releases new transcription and text-to-speech models for voice agents」と題した記事を公開した。Microsoftが新たに発表した音声エージェント向けモデル群は、文字起こし開始まで100ミリ秒強というレイテンシを実現し、TTSについては約4,000人を対象にしたテストで参加者の約半数が合成音声を実在の人物の声と誤認したという。精度・速度・自然さの三拍子を揃えた今回のリリースは、音声エージェント開発の実務に直結する内容だ。
100ミリ秒で最初の文字起こし結果を返す「MAI-Transcribe-2-Streaming」
今回リリースされたMAI-Transcribe-2-Streamingは、リアルタイム文字起こし向けのモデルだ。Microsoftによれば、音声AIモデルの精度・速度・コストを横断的にベンチマークする評価サービス「Artificial Analysis」において1位にランクインしているという。
最大の特徴は応答速度で、最初の部分的な文字起こし結果を100ミリ秒強で返す。これにより、ユーザーがまだ話している途中の段階で音声エージェントが処理を開始できる。音声エージェントにおいて、文字起こしのレイテンシはエンドツーエンドの応答遅延を左右する無視できないボトルネックになりやすい。OpenAIのWhisperに代表される既存の文字起こしモデルは高精度で知られる一方、リアルタイムストリーミングへの最適化は各社の差別化ポイントとなっており、100ミリ秒強という数値は実用上の意味が大きい。
対応言語は60言語。価格は年内の導入価格として1時間あたり0.54ドルとなっている。
23言語をネイティブアクセントで話す「MAI-Voice-2.1」
テキスト読み上げ(TTS)では2つのモデルが登場した。
MAI-Voice-2.1は、同一の声で23言語をそれぞれネイティブアクセントで話すことができる設計だ。多言語対応の音声エージェントを構築する際、言語ごとに声が変わってしまう問題を回避できる。グローバル展開を前提としたコンタクトセンターや多言語カスタマーサポートへの適用が想定される。
軽量版のMAI-Voice-2.1-Flashはレイテンシ150ミリ秒を実現しており、価格は100万文字あたり15ドル(通常版は22ドル)だ。応答速度を優先するリアルタイム会話用途では、Flashの150ミリ秒は体感上の自然さに直結する。
両モデルとも、数秒の参照音声からボイスクローニングが可能だ。前述のとおり、テストでは約半数が合成音声を本物と誤認するレベルの自然さを示している。その一方で、こうした高精度なクローニング技術は詐欺や無断模倣などの悪用リスクを伴う。Microsoftはこの点を認識しており、モデルに悪用防止のためのセーフガードを内蔵していると説明している。具体的な実装の詳細は明かされていないが、類似の取り組みとして、OpenAIはVoice Engineにおいてウォーターマーキングや話者の同意確認フローを採用しており、業界全体でボイスクローニングのガバナンスが課題となっている。
提供プラットフォーム
各モデルは以下の経路から利用できる。
- MAI-Foundry(Azure AI Foundry上で提供されるMicrosoft独自モデルのハブ。Azure AI Foundryはモデルのデプロイ・評価・管理を統合的に行うプラットフォームで、MAI-Foundryはその中でMicrosoftファーストパーティモデルを提供する窓口にあたる)
- MAI Playground
- **OpenRouter**(音声2モデルのみ)
OpenRouterでの提供は、Azure環境に限らずMicrosoft以外のエコシステムからもアクセスしやすくする狙いがある。サードパーティのアプリケーションやエージェントフレームワークから直接呼び出せる点は、Azure依存度を下げたい開発者にとって実用的な選択肢となる。
音声エージェント市場における位置づけ
音声エージェントの市場は急速に拡大しており、コンタクトセンターの自動化から音声UIを持つAIアシスタントまで、低レイテンシかつ高精度な音声処理への需要が高まっている。この領域ではOpenAIのRealtime APIやGoogleのChirpなど競合モデルも存在するが、Microsoftは今回、文字起こし・TTS・ボイスクローニングを一度に揃え、Azure AIのエコシステムに統合する形で投入した。音声インターフェースを構築しているエンジニアにとって、レイテンシ・精度・価格のバランスを自社要件と照らし合わせる価値があるリリースだ。
詳細はMicrosoft AI releases new transcription and text-to-speech models for voice agentsを参照していただきたい。