ElevenLabsの新音声モデルv4、笑い・ウィスパーをタグで制御可能に — 応答速度150msで最速クラスを主張
DRANK

9月29日、The Decoderが「ElevenLabs' new v4 speech model makes AI voices more expressive and consistent」と題した記事を公開した。ElevenLabsの新しい音声合成モデル「Eleven v4」は、<nervous laugh> や <long pause> といったタグ一行で笑い声・沈黙・効果音を制御できる感情表現の精緻化、そして初音声出力まで150ミリ秒という低レイテンシを最大の売りとする。スマートスピーカーや電話応答ボットなど、遅延が致命的なリアルタイム用途を強く意識したアップデートとなっている。

by @tf_official
Related Topics: AI AI Music/Voice Generator