Google Gemini 3.8 Flash TTSとFlash-Lite TTS発表!表現力豊かな音声生成モデルで何が変わる?

Gemini 3.8 Flash TTSとFlash-Lite TTSが登場
Googleは2026年9月23日、Geminiファミリーに新たなテキスト読み上げ(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。これにより、音声生成が従来の静的なプリセットから、よりダイナミックなクリエイティブスタジオへと進化します。これらのモデルは、Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsといった製品で利用可能となり、開発者や企業がより豊かで表現力豊かなオーディオ体験を構築できるようになります。
何ができるようになるのか?
カスタム音声の作成とカスタマイズ
- 生成的な音声デザイン: Gemini 3.8 Flash TTSを使用すると、役割、アクセント、音声特性を100以上の言語と方言でカスタマイズし、自然言語プロンプトを使ってゼロから新しい音声を作成できます。例えば、ドラマチックなドラゴンや、独特の地域訛りを持つカリスマ的なナレーターの声を生成できます。
- 豊富な音声ライブラリ: メキシコスペイン語、ケベックフランス語、スコットランド英語などの地域バリエーションを含む、2,000以上のプロダクション対応音声にアクセスできます。
- 音声複製: 30秒の音声サンプルから一貫したボーカルプロファイルを複製できます。これには、同意確認、SynthIDウォーターマーキング、C2PA認証などの安全ツールが組み込まれています。
- 音声のリミックス(近日公開): 音声ライブラリから選択した音声の音色、ピッチ、ペース、アクセントを微調整できます。例えば、「微妙な南米アクセントを追加」や「話し方を柔らかくする」といったプロンプトを使用できます。
パフォーマンスの行ごとのディレクション
両方のTTSモデルは、各行の話し方を正確に制御できます。
- 行ごとのパフォーマンスディレクション: 独自の舞台指示を記述したり、Geminiに自然なスクリプトキュー(落ち着いたカスタマーサービスエージェントからささやくようなサスペンスシーンまで)で話し方を指示させたりできます。
- 長尺生成: ポッドキャストやオーディオブックに最適な、数時間の連続オーディオにわたって高い音声品質、自然なペース、キャラクターの音色を維持できます。
- ネイティブな二話者シーン演出: 単一のスクリプトから、ポッドキャストやドラマチックなストーリーテリングのための複数ターンの会話をシームレスに指示し、両方の声を明確に分離し、自然な会話のやり取りを維持できます。
- スクリプト化されたボーカルバーストとバックチャネリング: <laughs>、<sigh>、<gasp>などの非言語的キューや、|mhm|や|yeah|などの能動的な聞き取りの挿入句を使用して、リアルな会話の質感を加えることができます。
グローバルスケールに対応した高品質な音声生成
Gemini 3.8 Flash TTSは、Hume AIのVoice Design Benchmarkで総合1位(71.4)、アクセントモデリングで1位(60.8)を獲得しています。また、Gemini 3.8 Flash TTSとFlash-Lite TTSは、Hume AIのOverall Quality Indexでそれぞれ1位と2位を獲得し、信頼性を損なうことなく表現力豊かなパフォーマンスを実現します。日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)、メキシコスペイン語、ヒンディー語などの主要なグローバル言語において、競合他社の中でトップの評価を得ています。100以上の言語をサポートし、高品質な多言語音声体験を世界中で構築できます。
信頼、同意、透明性を持って構築
音声作成および複製機能は、音声タレントを保護し、アイデンティティを尊重し、コンテンツの透明性を確保するための厳格な安全対策を講じて構築されています。音声複製の場合、ユーザーは音声所有者からの口頭での同意記録を提供する必要があります。また、Gemini Audioモデルによって生成されたすべてのオーディオクリップには、SynthIDによるウォーターマークが埋め込まれており、AI生成された音声が検出可能であることを保証し、誤情報の拡散を防ぎます。
提供時期と利用方法
Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、本日より順次展開されます。
- 開発者向け: Gemini APIおよびGoogle AI Studioで利用可能。
- 企業向け: Gemini EnterpriseのAPIを通じて近日中に提供予定。
- 一般ユーザー向け: Gemini Notebook(Flash TTS)およびGoogle Vids(Flash-Lite TTS)で利用可能。
Google AI Studioでは、新しい音声生成機能を試すことができます。音声デザインワークスペースのように、ゼロから新しいボーカルアイデンティティをプロンプトで作成したり、自分の声を複製したりして、デュアルスピーカーの脚本エディターに直接取り込み、行ごとの話し方を指示できます。


