Gemini 3.8 TTS Playground:可编排多角色对话的语音生成工具

Simon Willison3 天前

Google 发布了两个新的 Gemini 文本转语音模型:gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts。

这两个模型配套了一个包含 2000 多种声音的语音库,并支持使用“仅 30 秒的本人声音样本,或你有权使用的声音样本”来创建自定义声音。

围绕这些能力,有人做了一个自带 API Key 的浏览器端 TTS Playground。该工具利用 Gemini API 的开放 CORS 策略,允许用户直接在网页中调用自己的 Gemini API 账户与额度。

工具界面与功能

这个 Playground 主要面向文本转语音的组合与调试,界面包含:

  • 单一声音与对话模式切换
  • 多角色配置
  • 每个角色可设置不同声音
  • 可为每句台词设置说话风格
  • 支持查看请求 JSON 与响应细节
  • 组合设置可保存在 URL 中,便于书签保存或分享
  • API Key 仅保存在当前页面内存中,不写入浏览器存储

界面中显示已加载 2089 个声音,用户可以在声音字段中按 voice ID、名称或语言搜索。

多角色对话是一个亮点

这个 API 一个值得注意的能力是:它可以很方便地定义一段完整的多角色对话。每个角色都能拥有不同声音,并附带不同的语音风格指令。

示例中创建了一段两只鹈鹕讨论是否搬去 Pacifica Pier 的对话:

  • 角色 Gus 使用 Puck 声音
  • 角色 Pearl 使用 Kore 声音
  • 每行台词都可以单独指定表达方式,例如“兴奋且八卦”或“冷静且不以为然”

脚本由 Claude 4.5 Opus 编写,并生成了一个可在工具中渲染的配置 URL。

生成速度与成本示例

在一次测试中,使用 gemini-3.8-flash-tts 生成一段 1 分 18 秒的音频大约耗时 20 秒。

这次生成没有使用更便宜的 Flash-Lite 模型,成本为 2.74 美分。

适合关注的点

对于开发者来说,这类 TTS API 的意义不只是“把文字读出来”,而是更接近可编排的语音剧本系统:

  • 可按角色分配不同音色
  • 可为每句台词设置情绪和表达风格
  • 可用 JSON 描述完整对话
  • 可快速生成播客、旁白、语音原型或交互式角色对话

如果后续模型在稳定性、延迟、成本和声音授权方面继续完善,多角色 TTS 可能会成为 AI 应用中的一个常用基础能力。

评论

请登录后发表观点

暂无数据