ByteDanceが「見て・聞いて・話す」を1モデルで実現するリアルタイムAI「SeedRealtime」を発表 — 音声認識・翻訳・合成を別々につなぐ構成を丸ごと廃止
DRANK

8月9日、Michal Sutterが「ByteDance Seed Introduces SeedRealtime: a Native Audio-Visual Full-Duplex LLM That Watches, Listens and Speaks in One Model」と題した記事を公開した。エスプレッソを淹れる手元を見ながら間違いに割り込み、美術館で「特定の展示品が映ったら教えて」という指示を黙って保持し続け、対象物が映った瞬間に自発的に声をかける——ByteDanceのSeedチームが発表したリアルタイムLLM「SeedRealtime」は、音声・映像・テキストを1つのモデルで統合処理することで、こうした従来のリアルタイム音声AIが苦手としてきた動作を実現している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning