Google 發表 Gemini 3.8 文字轉語音模型,支援 2000 種聲音與 30 秒快速自訂語音
Simon Willison 製作的 Gemini 3.8 TTS 互動測試工具,示範如何自訂語音與快速上手。
• Google 於今日正式推出 Gemini 3.8 Flash TTS 與 gemini-3.8-flash-lite-tts 兩款全新的文字轉語音模型。 • 內建超過 2,000 種聲音 庫,使用者僅需提供 30 秒的語音樣本 即可輕鬆建立客製化聲音。 • 該 API 具備優秀的 CORS 開放政策,讓開發者能透過自帶金鑰(BYOK)的方式快速打造專屬的互動操作介面。 • API 支援輕鬆定義 多角色對話,並能為每個角色設定不同的聲音與風格指令。 • 作者使用 AI 快速生成了一段鵜鶘對話的測試音訊,花費約 20 秒 產出近 80 秒的音訊,成本僅約 2.74 美分。
「藉由 Gemini 3.8 Flash TTS 的強大功能,我們能以極低的成本與時間,快速生成高品質的多角色語音對話。」
來源:Simon Willison
閱讀原文 ↗另見:Hacker News、Google DeepMind