9月24日、The Decoderが「Google's new Flash TTS models let you design AI voices from scratch using text descriptions」と題した記事を公開した。ElevenLabsやOpenAI TTSが先行する音声AI市場に、Googleがテキスト記述だけでAI音声をゼロから設計できる新TTSモデル群を投入した。プリセット音声を選ぶだけでなく、声質・アクセント・発声スタイルを自分で指定して新しい声を作れる点が従来のTTSサービスとの大きな違いだ。
テキスト記述だけで声を作る——Gemini 3.8 Flash TTS
GoogleがGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSという2つの音声生成モデルを発表した(※本稿執筆時点での正式名称。以下同)。
最大の特徴は、Flash TTSで「テキストプロンプトだけで声を設計できる」点だ。声の役割、アクセント、発声の特徴などをテキストで指定すれば、既存の音声サンプルを用意しなくても新しい声を生成できる。100以上の言語と方言に対応しており、メキシコ系スペイン語、ケベック・フランス語、スコティッシュ英語といった地域バリアントも含む2,000種類以上のプリセット音声ライブラリも用意されている。プリセットとゼロからの設計は排他的な選択肢ではなく、プリセットをベースにテキストで特性を上書きする使い方も可能だ。
記事の著者自身もプリセット音声にスタイルプロンプトを与え、「ドイツ訛りの強いベルリン人が英語を話す」という声を生成するテストを実施した。アクセントやイントネーションは説得力のある結果が得られたものの、一部に高音のノイズが混入し、1回のテストではクリップ終盤で声質が変化したという。現時点では品質にばらつきが残る。
音声クローンと「Voice Remixing」
音声クローン機能では、30秒の音声サンプルから声のプロファイルを構築できる。ただし、クローン対象者が同意の声明を録音し、その録音と音声サンプルの声が一致していることが条件となる。生成された音声には、AIが作成したと判別するための不可聴の電子透かし「SynthID」が自動的に埋め込まれる。
また、ライブラリ音声の音色・ピッチ・テンポ・アクセントを後から調整できる「Voice Remixing」も発表されているが、現時点ではまだ利用できない。
台本制作・長尺音声生成の実用機能
両モデルとも、台本の各行に対して読み方の指示(ステージディレクション)を書き込める。長時間の音声を生成しても声の特性が変わりにくい「スピーカードリフトの最小化」をGoogleは訴求している。
実用的な機能として以下がある:
- 2声モード:1つの台本から2人の声を生成し、声を区別したまま対話形式の音声を出力
- 感情・反応の明示的指定:笑い声、ため息、「うんうん」といった相槌を台本に直接記述してタイミングを制御
- 自動スクリプト解釈:モデルが台本の文脈から読み方を自律的に判断するモードも選択可能
Googleは、感情音声AIを専門とするスタートアップ・Hume AIが公開しているTTSベンチマークにおいて、ほとんどのカテゴリでリードしていると発表している。

GoogleはHume AIのTTSベンチマークでほとんどのカテゴリでトップと主張している。| 画像: Google
提供状況と料金
両モデルはGemini APIおよびGoogle AI Studio経由でロールアウト中だ。Flash TTSはGemini Notebookでも利用可能で、Flash-Lite TTSはGoogle Vidsに組み込まれている。Agora、LiveKit、Pipecat、VercelはすでにGemini API経由での統合をサポートしている。エンタープライズAPIへの対応も近く予定されている。
料金は1トークン単位で、音声1秒=25トークン、1時間=9万トークンという換算になる。下表の期間区分は元記事の原文表現("until end of 2026" / "from 2027")に対応している。
| 課金対象 | Flash TTS(2026年末まで) | Flash TTS(2027年以降) | Flash-Lite TTS(2026年末まで) | Flash-Lite TTS(2027年以降) |
|---|---|---|---|---|
| テキスト入力 | $0.50 / 100万トークン | $1.00 | $0.50 | $1.00 |
| 音声出力 | $9.00 / 100万トークン | $18.00 | $6.00 | $12.00 |
1時間の音声出力コストに換算すると、2026年末まではFlash TTSで約$0.81、Flash-Lite TTSで約$0.54。2027年1月1日以降はそれぞれ$1.62、$1.08に倍増する。なお、無料枠のデータはGoogleの製品改善に使用されるが、有料枠のデータは使用されない。
詳細はGoogle's new Flash TTS models let you design AI voices from scratch using text descriptionsを参照していただきたい。