
昨日、GoogleはGeminiファミリーにGemini 3.8 Flash TTSおよびGemini 3.8 Flash‑Lite TTSの2つのテキスト音声変換モデルを追加すると発表しました。これにより、音声生成は従来の静的なプリセットから動的なクリエイティブスタジオへと進化し、クリエイターや開発者、企業がより豊かで表現力に富むオーディオ体験を構築できるようになります。同時に、Gemini NotebookやGoogle Vidsなどの製品も改善されます。
両モデルはそれぞれ異なる用途を想定しています。Flash TTSは高度なクリエイティビティやキャラクターデザインに適しており、自然言語によるプロンプト入力によってゼロから新しい音声を生成できます。ゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディアなどに最適で、演技、テンポ、方言の切り替えを細かく制御可能です。一方、Flash‑Liteは大規模かつコスト効率の高いシナリオを主眼に据えており、大量の吹き替えや音声コンテンツ制作、表現力豊かな音声アシスタントの構築に最適化されています。音調、テンポ、表現力を微調整することも可能です。ユーザーは既存の30種類の音声から無限の音声ライブラリへ拡張でき、100以上の言語・方言に対応する2,000種類以上の既成音声を利用できます。その中にはメキシコスペイン語、ケベックフランス語、スコットランド英語といった地域変種も含まれます。
機能面では、新モデルは生成型音声デザイン、音声複製、保存拡張、そして近日公開予定の音声ミキシングをサポートします。わずか30秒の音声サンプルで一貫した声を再現可能で、同意確認、SynthID透かし、C2PA証憑も標準搭載されています。音声を選択後は、各行ごとに演技を指示し、数時間に及ぶ長尺の音声でも自然なテンポやキャラクターの声色を維持できます。さらに、二人の声による対話を編集したり、笑い声やため息などの非言語的フィードバックを挿入してリアリティを高めることも可能です。
性能面では、Gemini 3.8 Flash TTSがHume AIの音声デザインベンチマークテストで総合71.4点を記録し、全体トップとなりました。アクセントモデリングでは60.8点で首位に立ちます。また、両モデルは総合品質指数においてそれぞれ1位と2位を占めており、Gemini 3.1 Flash TTSと比較して、長文コンテンツや二人のスピーカーを用いた台本制御などの場面で顕著な改善が見られます。