ニュース

Google、100言語対応の音声AI「Gemini 3.8 Flash TTS」発表

 Googleは9月23日(米国時間)、Gemini AudioファミリのTTS(テキスト読み上げ)モデル「Gemini 3.8 Flash TTS」、「Gemini 3.8 Flash-Lite TTS」を発表し、Google AI StudioとGemini APIで提供を順次開始した。価格は明らかにしていない。

 いずれも、音声の生成からセリフごとの演出まで対応する音声合成AI。100以上の言語や方言に対応し、話し方や感情、相づちや笑い声などの非言語音を制御できる。

 Gemini 3.8 Flash TTSは、ゲームやオーディオブック、ポッドキャストなどの制作に向けたモデル。自然言語の指示で役柄、アクセント、声質を指定し、声を一から作れる。

 2,000種類以上の音声ライブラリも用意し、30秒の声サンプルから再現する機能も搭載する。セリフ単位で演技や発話のテンポ、方言の変化を指示でき、1つの台本から2人の話者による対話も生成可能。長時間の音声制作にも対応する。

 Gemini 3.8 Flash-Lite TTSは、大規模な吹き替えや大量の音声コンテンツ制作、音声エージェント向けに処理効率とコストを重視したモデル。トーンやテンポ、細かなニュアンスを調整できる。

 Flash TTSはGemini Notebook、Flash-Lite TTSはGoogle Vidsでも利用でき、両モデルともGemini EnterpriseのAPIでは近日中に提供する予定だ。生成した音声には、識別用の電子透かし「SynthID」が埋め込まれる。