Google、2,000種類以上のボイスを備えた「Gemini 3.8 Flash」「Flash-Lite」TTSを発表
Googleは、表現力豊かなキャラクター音声設計向けの「Gemini 3.8 Flash TTS」と、コスト効率重視の大量利用向けの「Gemini 3.8 Flash-Lite TTS」という2つの新しいテキスト読み上げモデルを発表しました。これまでで最も表現力豊かな音声生成モデルだとしています。
詳細
- 音声作成とライブラリ: 自然言語のプロンプトから100以上の言語でカスタムボイスを生成でき、地域ごとのバリエーションを含む2,000種類以上のすぐに使えるボイスライブラリも用意
- 音声の複製: 30秒の音声サンプルから、同意確認を経て音声を再現可能
- 表現力の制御: ト書きや自然な台本の手がかりを踏まえた行ごとの読み上げ制御、数時間に及ぶ連続音声の長尺生成、2人の話者によるシーン演出、笑い声やため息といった相槌を含むボーカルバーストにも対応
- ベンチマーク: Flash TTSはHume AIのVoice Design Benchmarkで総合71.4を記録し、アクセント再現では60.8で首位。Hume AIのOverall Quality Indexでも1位・2位を独占。日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語を含む言語でのブラインド選好テストでも両モデルが上位を占めた
- 提供状況: 開発者向けにはGemini APIおよびGoogle AI Studioですでに利用可能。Gemini Enterpriseへの対応も近日予定で、一般ユーザー向けにはGemini NotebookおよびGoogle Vidsで順次展開中
その後
今回のリリースは、Geminiの新しい「Connected Apps」展開やstudy notebooksの拡大と同じ週に行われたもので、音声・外部連携・教育という複数の領域にわたるGeminiラインナップ全体への幅広い取り組みを、1週間のうちに集中させる形になっています。