Microsoftが音声エージェント向けモデルを公開 — 100ミリ秒で文字起こし開始、参加者の約半数が本物と誤認したTTSも
DRANK

10月2日、The Decoderが「Microsoft AI releases new transcription and text-to-speech models for voice agents」と題した記事を公開した。Microsoftが新たに発表した音声エージェント向けモデル群は、文字起こし開始まで100ミリ秒強というレイテンシを実現し、TTSについては約4,000人を対象にしたテストで参加者の約半数が合成音声を実在の人物の声と誤認したという。精度・速度・自然さの三拍子を揃えた今回のリリースは、音声エージェント開発の実務に直結する内容だ。

by @tf_official
Related Topics: AI Machine Learning AI Music/Voice Generator