Google推出了Gemini 3.1 Flash TTS文本转语音模型,支持将近70种语言。
谷歌在Gemini 3.1系列里推出了一款全新的文本转语音模型,叫Gemini-TTS。官方说这是他们目前“表现力最强的文本转语音方案”。这个新模型能生成听起来很自然、高保真的语音,还允许开发者通过提示词来控制语音的情感、节奏和风格,比如在旁白或者对话里精确调节语气、停顿和情绪变化。
在多语言支持方面,Gemini-TTS覆盖了大约70种语言,包括中文(普通话)、英语、西班牙语、德语、日语等主流语言。模型可以自动检测输入文本的语言种类,不需要手动标注就能生成对应的语音。这样一来,开发者和企业就能在有声读物、播客、语音助手、客服机器人、教育应用等场景里,通过一套统一的API给全球用户提供多语种的语音内容。
谷歌还强调,Gemini-TTS跟Gemini 3.1系列里的其他音频模型(比如Gemini 3.1 Flash Live)是协同工作的,进一步强化了“实时语音体验”的能力。在实时对话、语音翻译以及多模态交互中,系统可以在保持低延迟的同时,通过文本提示和音频标记精细控制语音输出,让AI在电话、会议、导航等场景里更接近自然的人类语音交互。





