AlibabaのQwen3.8-Omni-Flashが動画・音声・テキストを100万トークンで一括処理 — エージェント型動画知覚で精度向上とコスト削減を同時達成
DRANK

9月18日、MarkTechPostが「Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use」と題した記事を公開した。AlibabaのQwenチームが新たにリリースした「Qwen3.8-Omni-Flash」は、テキスト・画像・音声・動画を100万トークンのコンテキストウィンドウで処理できるオムニモーダルモデルだ。最大の特徴は「エージェント型動画知覚」と呼ばれるアプローチで、長尺動画の処理精度を高めながらトークン消費量を約46%削減する。音声入力コストは旧モデル比で98%以上削減されており(音声入力に限定した数値)、APIとして今すぐ利用できる。※本記事中の「Gemini 3.8 Flash」はMarkTechPost記事における元の表記をそのまま踏襲している。2026年9月現在、同名モデルの公式発表は確認できていないため、読者は元記事の記述を参照のうえご判断いただきたい。

by @tf_official
Related Topics: AI Machine Learning Deep Learning