AlibabaのリアルタイムAI音声モデルがGPT-Realtime-2の5分の1の価格で登場 — 「いつ話すか」を自律判断する262Kコンテキストのフルデュプレックス設計
DRANK

9月29日、MarkTechPostが「Alibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speak」と題した記事を公開した。AlibabaのQwenチームが発表したフルデュプレックス音声モデル「Qwen-Audio-3.1-Realtime」の技術的な詳細と競合比較について詳しく紹介されている。GPT-Realtime-2と比べて入力は約5分の1、出力は約3分の1——262Kコンテキストのフルデュプレックス音声エージェントAlibabaのQwenチームがQwen-Audio-3.1をリリースした。ASR・TTS・リアルタイムインタラクションをカバーする5モデル構成のオーディオスタックで、その中核が**Qwen-Audio-3.1-Realtimeだ。スタックにはリアルタイム会話向けのRealtimeモデルのほか、オフラインの長時間文字起こし向けのQwen-Audio-3.1-ASR-Flash-Filetr...

by @tf_official
Related Topics: AI Machine Learning AI Music/Voice Generator