Microsoftのリアルタイム音声認識モデルが38モデル中1位 — WER 2.5%・0.13秒でベンチマーク首位に
DRANK

10月3日、Michal Sutterが「Microsoft AI Releases MAI-Transcribe-2-Streaming: #1 Real-Time Speech-to-Text Model on Artificial Analysis」と題した記事を公開した。Microsoftが2026年10月1日にリリースしたストリーミング型STTモデル「MAI-Transcribe-2-Streaming」が、独立評価機関の計測で38モデル中1位を獲得した。精度・遅延ともに競合を上回るという内容で、ボイスエージェント開発者にとって注目に値する発表だ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning