资讯动态 · 消息 · 语音生成
Gemini 3.8 TTS 正式可用:两款语音模型、声音库与输出格式变化
Google 9 月 22 日发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS。解读模型分工、声音定制,以及 WAV 和流式 PCM 的接入差异。
RootFlowAI 内容维护团队 · 发布 · 核对
Google 于 2026 年 9 月 22 日 宣布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 正式可用,并推出 Gemini API Voices 端点。与此前的实时对话模型相比,这次更新聚焦把文本转成可控的语音内容。
对配音、长内容朗读和语音 Agent 开发者,值得关注的既有声音表现,也有声音资源管理和音频返回格式。
两款模型各自面向什么
gemini-3.8-flash-tts 是官方主推的创作型语音模型,强调声音保真、表演细节、地区口音和较长多轮内容的稳定性。gemini-3.8-flash-lite-tts 更侧重速度与成本,面向高吞吐生产和实时语音 Agent 的分段处理流程。
Google 将 Lite 版本定位为旧 gemini-3.1-flash-tts-preview 的替代选择,但替代推荐不能直接解读成旧模型已经关停。实际迁移窗口仍需另查弃用安排和账户可用性。
声音不再只是一个固定名称
此次更新包括 Voice design、Voice replication 和扩展声音库。官方介绍了通过文字设计持久声音、在同意验证流程下复制声音,以及通过 /v1beta/voices 查询声音资源的能力。
这意味着应用除了选择模型,还需要管理声音标识、所属范围与生命周期。用于品牌配音时,应保存具体声音配置;涉及真人声音复制时,按官方的授权与同意验证要求操作,不能把一段网上音频直接当成可使用的授权。
音频格式要跟请求方式一起检查
截至 10 月 2 日,官方语音文档说明:默认的非流式请求返回带标准头的 WAV,规格为 24 kHz、单声道、16 位 PCM;默认流式请求返回不带容器头的原始 PCM 分块。
因此,不能把所有返回内容都当作已封装的 WAV,也不能给已经带头的非流式结果重复添加文件头。接入时应核对 MIME 类型、采样率、声道与播放器处理方式;自定义输出格式时,以请求配置和实际响应为准。
TTS 与 Live API 如何分工
TTS 适合已有文本需要转语音的工作流;Live API 面向实时交互会话。需要边听边答、打断与工具等待的产品,应先判断自己采用哪一种交互结构,再选择接口,不能仅因两者都支持音频就直接替换。
本文未进行付费语音生成,也未确认 RootFlowAI 已开放这些模型。正式选型建议使用固定中文文本对比发音、停顿、长句稳定性、首段等待时间和总费用。