Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人

它能同时听语音、看画面,并用同步的声音和动态形象回应;后台工具调用让接待、导览等对话持续进行。

Google 发布的 Gemini 3.8 Live Avatar,是一种能在对话中看、听、说的动态数字人能力。它把实时语音对话与低延迟视频结合起来,让头像的声音、口型和表情跟着交流变化;遇到查询或业务请求时,还能在后台调用工具。接待、导览和客服因此有了一个可以持续交谈的可视化入口。

核心技术升级了什么

Google 将这次升级描述为把实时对话能力与流式视频原生结合。系统同时接收声音和画面,再持续输出语音与动态形象;嘴型、表情和说话节奏随回答变化。这一升级的关键是让动态形象跟上用户的实时提问、展示物品和话题转换,保持自然的对话节奏。

另一项升级是异步工具调用。AI 可以在对话过程中发起外部查询或操作,并在等待结果时继续与用户交流。它改变的是前台体验:查房态、取订单信息一类请求不必让头像停住等候。但业务结果仍由企业接入的系统返回,视频中的对话流畅不能代替实际执行成功的回执。

主要功能特点

  • 边听边看,结合现场回答 用户可以说话,也可以把物品或环境展示给摄像头;AI 将语音问题和视觉线索放在一起理解,再用带表情的声音与视频回应。
  • 边聊边调用工具。 工具请求可在后台运行,适合把问答接到接待、查询等服务流程。具体能办什么事,取决于企业接入哪些接口、赋予哪些权限。
  • 跨语言保持形象同步。 Google 称 Live Avatar 能在 97 种语言之间切换,并让口型和表情跟随语音变化、保持视频稳定。这是官方能力声明;目标语言的实际效果仍需在具体场景中测试。
  • 使用预设形象或品牌形象。 企业可选用角色库,也可用高质量参考图定制动态形象。自定义形象目前有企业白名单条件。

四段官方演示说明了什么

看见画面里没被问到的风险。 用户把布偶猫 Kai 抱到镜头前,问怎样让它在办公室待得舒服。头像先给出猫窝和休息建议,随后注意到桌上的绿萝,提醒用户把植物移到猫够不到的地方。这段演示说明视觉输入的价值:回答可以参考问题之外的环境线索;它不等于对识别准确率的独立测试。

Google 官方演示:用户问如何照顾办公室里的猫,头像随后提醒桌上的绿萝风险。原声英文,中文字幕,约 51 秒。

对话和业务请求同时推进。 酒店演示中,虚拟前台与客人谈提前入住,随后说已免费升级房型、房号是 509,数字钥匙已送到手机;客人接着要芝士汉堡,画面又出现餐饮请求。它展示的是异步调用下的连续交流,视频本身无法证明这些操作接入了真实酒店系统,也不能把免费升房当成产品默认政策。

Google 官方演示:提前入住、升房、数字钥匙与客房餐饮串成一次对话。原声英文,中文字幕,约 67 秒。

切换语言时继续对话。 旅行日语练习中,用户用英语提问,头像教他用日语问“这个多少钱”,听到发音偏差后再用英语解释并示范。视频具体呈现的是英语与日语之间的切换。

Google 官方演示:头像在英语讲解和日语跟读之间切换。原声英日语,中文字幕,约 44 秒。

选择角色外观。 最后一段展示多种外观、声音和表情的预设头像,帮助企业判断可视形象的风格范围;视频没有演示用参考图制作自定义头像的过程。

Google 官方展示的不同角色形象;这段视频没有展示自定义头像的制作过程。原声英文,中文字幕,约 21 秒。

现在适合用在哪里

Live Avatar 已面向 Gemini Enterprise 企业客户开放,开发者可通过 Gemini Live API 接入。当前更适合短时、需要视听反馈的接待、导览与客服对话。Google DeepMind 模型卡写明连续交互可支持“几分钟”,而非数小时;偶发变慢、超时和回答错误仍是已知限制。

企业若要把它用于实际服务,需要确认目标语言与延迟、工具权限和业务回执。自定义头像须进入企业白名单;Google 表示生成的音视频带有 SynthID 隐形水印,用来帮助识别 AI 生成内容。水印提供识别线索,实际部署仍需要核验每项业务操作的结果。

来源
Introducing Gemini 3.8 Live with Live AvatarShuo-yiin Chang、CJ Zheng·2026-09-24·查看主材料
本站说明
四段视频来自 Google 原文;解读站根据原声转录添加中文字幕,并保留可选的中英双语文字轨。