谷歌Gemini 3.8 Live上线"数字人"实时对话,支持多国语言与口型同步

华尔街见闻01:59

谷歌云旗下Gemini 3.8 Live with Live Avatar功能正式面向企业用户全面开放,将实时视频虚拟形象与多语言语音对话能力整合为一体,标志着企业级对话式AI从纯语音交互向多模态视觉交互迈进。

该功能于本周正式在Gemini Enterprise中上线,此前已在Google Cloud Next 2026上完成预览展示。

新版本支持视频虚拟形象的实时唇形同步、97种语言自动识别与切换,以及后台工具调用与API执行,同时提供美国和欧盟双区域端点部署,满足企业合规与数据治理要求。

从客户落地情况来看,Cox Automotive已将该技术应用于旗下Autotrader平台,构建了可实时高亮屏幕内容、引导消费者完成车辆搜索与融资流程的购车AI助手;印度AI公司Equal AI则表示,基于Gemini 3.8 Live,其平台目前每日处理超过百万次实时通话,覆盖九种印度语言。

这是谷歌本周第二次发布新的人工智能模型。周三,谷歌宣布推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型。

周四截至发稿,谷歌盘中上涨0.66%。

核心功能:多模态融合,超越语音基础能力

Gemini 3.8 Live with Live Avatar在原有语音基础上引入视觉交互层,主要面向网页端、移动端及实体交互终端(interactive kiosks)等多种部署场景。

在对话连贯性方面,该模型采用原生语音到语音(speech-to-speech)架构,支持自然打断恢复,且不会丢失对话上下文或中断后台事务处理。

工具调用能力方面,模型可在持续对话的同时,在后台异步执行工具调用与API请求,让交互体验更为流畅,不因后台任务而产生明显停顿。

视觉理解方面,Live Avatar支持实时摄像头画面与屏幕共享的同步处理,可与音频输入并行分析,为服务场景提供更丰富的上下文感知能力。

语言覆盖上,97种语言支持及自动检测功能,使其具备面向全球多语言市场的规模化部署潜力。

信任机制:水印技术与身份管控并行

针对深度伪造及身份滥用风险,谷歌在该功能的合规设计上采取了双层管控策略。

在虚拟形象使用层面,企业用户可从谷歌提供的预建虚拟形象库中进行部署;而自定义虚拟形象功能则设有严格的企业白名单与身份核验机制,

目前仅限申请通过的企业使用。在内容溯源层面,所有生成的音频与视频流均嵌入谷歌SynthID不可感知水印,以确保AI生成内容在传播过程中保持可识别性与可验证性。

这一机制的引入,一定程度上回应了企业部署对话式AI时面临的监管合规压力,尤其是在金融服务、医疗及客户服务等强监管行业。

客户落地:从购车助手到百万级通话场景

目前已有多家企业披露基于Gemini 3.8 Live的应用进展,涵盖汽车电商、电信客服及CRM等多个垂直领域。

Cox Automotive首席产品官Marianne Johnson表示,Autotrader的对话式AI虚拟形象将自然语言描述与库存匹配相结合,是其"连接智能"愿景落地的重要步骤,该愿景旨在让每次消费者互动均能调用Cox Automotive的完整数据资产。

Equal AI首席执行官Akhilesh Damaraju称,借助Gemini 3.8 Live在打断处理、多语言对话及工具调用稳定性方面的改进,该平台现已实现每日超百万次实时通话处理,覆盖九种印度语言,目标是构建"了解你、说你的语言、始终站在你这边"的个人AI。

Salesforce Agentforce产品副总裁Bob Van Osten表示,Salesforce AI Research与谷歌的合作旨在探索实时多模态能力与代理式AI的结合,以打造从首次接触到问题解决全流程的客户服务体验。

免责声明:本文观点仅代表作者个人观点,不构成本平台的投资建议,本平台不对文章信息准确性、完整性和及时性做出任何保证,亦不对因使用或信赖文章信息引发的任何损失承担责任。

精彩评论

我们需要你的真知灼见来填补这片空白
发表看法