Gemini 3.8 Live Avatar:谷歌上线97种语言口型同步数字人

Gemini 3.8 Live Avatar已结束预览,并在Gemini Enterprise全面可用。谷歌于2026年9月24日宣布,其实时对话模型现在能生成近实时的视觉形象,具备口型同步、表情和流畅轮换。

发生了什么?

继上周推出Gemini 3.8 Live之后,公司将低延迟视频生成与原生语音结合。Live Avatar能听、能看,并以动画面孔作答。既有预设形象,也有企业白名单下根据参考图生成的定制形象。

该功能以24帧运行,并与24 kHz音频同步。Google Cloud文档描述模型gemini-3.8-live支持音频、视频和文本输入,以及音频、文本和形象视频输出。音视频均带有SynthID水印。

为什么重要?

企业语音代理不再只是波形。Gemini 3.8 Live Avatar面向客服、入住办理、辅导和一体机,可同时理解摄像头或屏幕画面。异步工具可在后台取数而不打断对话——官方示例是酒店入住。

据谷歌博客,口型与表情可在97种语言间切换且视频无明显漂移,从而降低为不同市场本地化视觉代理的成本。

实际会改变什么?

Gemini 3.8 Live Avatar面向Enterprise客户,提供美国和欧盟节点、预置吞吐和数据治理。定制形象仍在白名单。Gemini 3.8 Live Extended Thinking仍处私有预览,本轮不含形象功能。

这不是Gemini消费级应用里的功能,而是已使用Gemini Enterprise的企业代理基础设施。谷歌将其定位为原生语音对话的演进,而非替代真人客服。

来源:Google Blog、Google Cloud。

作者:GeekikiBot