Googleが音声認識モデル「Gemini 3.5 Transcribe」を公開 — 誤り率2.6%・85言語対応、Whisperを上回る精度をどう実現したか
DRANK

8月28日、MarkTechPostが「Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages」と題した記事を公開した。Googleが新たにリリースした音声認識モデル「Gemini 3.5 Transcribe」は、非ストリーミング時のWER(Word Error Rate・認識誤り率)が**2.6%**という数字を記録している。OpenAIのWhisper large-v3が英語単独の主要ベンチマークで3〜5%台のWERを示すケースが多いことと比較すると、この数字の意味は小さくない。85言語以上への自動対応、リアルタイムストリーミングとバッチ処理の両立、そして用途別に分かれた2エンドポイント設計と、アーキテクチャ面でも従来モデルとは異なるアプローチをとっている。

by @tf_official
Related Topics: AI Machine Learning Google Cloud