9月19日、Michal Sutterが「SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hour」と題した記事を公開した。イーロン・マスク率いるxAI(X.AI Corp)が音声認識API「Grok Voice Transcribe 2.0」をリリースし、前バージョン比で精度2倍・価格据え置きを主張している。本番環境の実音声データで訓練されたモデルが公開ベンチマークの首位を取ったとする内容は、競合ひしめくSTT市場で注目に値する。
補足:xAI(X.AI Corp)はイーロン・マスクが2023年に設立したAI企業で、SpaceXとは別法人である。Grokはxが運営するXプラットフォーム(旧Twitter)に統合されたAIアシスタントとして広く知られているが、今回のAPIはxAIが独自に提供する開発者向けサービスだ。
精度2倍、価格据え置き——何が変わったのか
Grok Voice Transcribe 2.0は、xAIが公開した音声認識(STT: Speech-to-Text)APIの最新版だ。モデルIDはgrok-voice-transcribe-2.0で、元記事公開日(9月18日)よりAPIとして利用可能。オープンウェイトの公開はなく、APIとしてのみ提供される。
最大の変更点は多言語の短文認識精度だ。19言語を対象とした短フレーズ(車内コマンドなど)のWER(Word Error Rate:単語誤り率)が、20.6%から6.8%へと約67%改善されている。xAIはこれを「1.0からの最大の改善点」と位置づけている。
ベースとなるモデルは、すでにGrok音声アシスタントとしてテスラ車内で稼働しており、1日数万件のカスタマーサポート通話と数百万時間のビデオ書き起こしをこなしているという。テスラとxAIは別企業だが、GrokはテスラのAIアシスタント機能として車内に統合されており、そこで蓄積された本番環境のノイズの多い実音声データで訓練されている点がこのモデルの特徴だ。研究室で整備されたデータセットではなく、現実の通話や車内音声で鍛えられたという背景は、実用精度の面で重要な差別化ポイントとなりうる。
ベンチマーク結果
xAIは、公開ベンチマークArtificial Analysis Leaderboardのストリーミング部門で、32モデル中1位を報告している。このベンチマーク(AA-WER Streaming)は約8時間の音声データを使用し、AA-AgentTalk 50%・VoxPopuli 25%・Earnings22 25%の配分で集計される。
内部ベンチマークでは以下の4カテゴリを測定している:
- Telephony(8 kHz):英語のカスタマーサポート通話
- Conversational:Grokとの英語会話
- Credentials:電話番号・メールアドレス・住所などの認証情報
- Short phrases:19言語の音声アシスタント発話
全4カテゴリでバージョン1.0を上回り、特にTelephony分野では「テスト済みの全モデルをリードする」としている。ただし、内部結果はベンダー自己申告であり、第三者による独立検証は行われていない点は留意が必要だ。
STT市場にはOpenAI WhisperやDeepgram、AssemblyAIといった競合が存在するが、元記事ではこれらとの直接比較は示されていない。公開ベンチマークでの順位はあくまで参考指標として受け取るのが妥当だろう。
開発者向け機能一覧
同一APIに以下の機能がすべて含まれる(追加料金なし):
- バッチ処理とリアルタイムストリーミング:ファイル・URLの書き起こし、またはWebSocket(
wss://api.x.ai/v1/stt)経由のストリーミング - 単語レベルのタイムスタンプ:開始・終了時間と信頼スコア付き
- 話者分離(Speaker Diarization):追加コストなし
- マルチチャンネル対応:最大8チャンネルを独立して処理
- キーワードバイアス:リクエストごとに最大100語・各50文字のドメイン固有語を指定可能
- テキスト整形:数字・日付・通貨・電話番号・メールアドレスを整形済みで返却
- フィラー除去:「um」「uh」などをデフォルトで除去
- スマートターン検出:音声エージェント向けに発話終端をMLで予測
バッチエンドポイントは500 MBまでのファイルを12フォーマットで受け付ける。ストリーミングではOpusコーデックを使用することで、生PCM(24 kHz・約48 KB/s)に対して約4 KB/sに帯域を抑えられる。
料金体系
料金はバージョン1.0から変更なし。
| モード | 料金 |
|---|---|
| バッチ | $0.10/時間(約$1.67/1,000分) |
| ストリーミング | $0.20/時間(約$3.33/1,000分) |
話者分離・タイムスタンプ・キーワードバイアスはすべて料金に含まれる。
実装例
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F format=true \
-F language=en \
-F file=@audio.mp3
採用事例:Atlassian Loom
Atlassian LoomはGrok Voice Transcribe 2.0を採用し、全動画の書き起こしに使用している。xAIが紹介するワークフローは「録音→書き起こし→コード生成」の流れで、LoomでアクションプランをレコーディングしたあとトランスクリプトをCursorに流し込み、コード変更まで自動化するというものだ。AtlassianのSVP Sanchan Saxenaは「コンテキストからコードへのループを閉じる」と表現している。
詳細はSpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hourを参照していただきたい。