Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人
它能同时听语音、看画面,并用同步的声音和动态形象回应;后台工具调用让接待、导览等对话持续进行。
Google 发布的 Gemini 3.8 Live Avatar,是一种能在对话中看、听、说的动态数字人能力。它把实时语音对话与低延迟视频结合起来,让头像的声音、口型和表情跟着交流变化;遇到查询或业务请求时,还能在后台调用工具。接待、导览和客服因此有了一个可以持续交谈的可视化入口。
核心技术升级了什么
Google 将这次升级描述为把实时对话能力与流式视频原生结合。系统同时接收声音和画面,再持续输出语音与动态形象;嘴型、表情和说话节奏随回答变化。这一升级的关键是让动态形象跟上用户的实时提问、展示物品和话题转换,保持自然的对话节奏。
另一项升级是异步工具调用。AI 可以在对话过程中发起外部查询或操作,并在等待结果时继续与用户交流。它改变的是前台体验:查房态、取订单信息一类请求不必让头像停住等候。但业务结果仍由企业接入的系统返回,视频中的对话流畅不能代替实际执行成功的回执。
主要功能特点
- 边听边看,结合现场回答 用户可以说话,也可以把物品或环境展示给摄像头;AI 将语音问题和视觉线索放在一起理解,再用带表情的声音与视频回应。
- 边聊边调用工具。 工具请求可在后台运行,适合把问答接到接待、查询等服务流程。具体能办什么事,取决于企业接入哪些接口、赋予哪些权限。
- 跨语言保持形象同步。 Google 称 Live Avatar 能在 97 种语言之间切换,并让口型和表情跟随语音变化、保持视频稳定。这是官方能力声明;目标语言的实际效果仍需在具体场景中测试。
- 使用预设形象或品牌形象。 企业可选用角色库,也可用高质量参考图定制动态形象。自定义形象目前有企业白名单条件。
四段官方演示说明了什么
看见画面里没被问到的风险。 用户把布偶猫 Kai 抱到镜头前,问怎样让它在办公室待得舒服。头像先给出猫窝和休息建议,随后注意到桌上的绿萝,提醒用户把植物移到猫够不到的地方。这段演示说明视觉输入的价值:回答可以参考问题之外的环境线索;它不等于对识别准确率的独立测试。
对话和业务请求同时推进。 酒店演示中,虚拟前台与客人谈提前入住,随后说已免费升级房型、房号是 509,数字钥匙已送到手机;客人接着要芝士汉堡,画面又出现餐饮请求。它展示的是异步调用下的连续交流,视频本身无法证明这些操作接入了真实酒店系统,也不能把免费升房当成产品默认政策。
切换语言时继续对话。 旅行日语练习中,用户用英语提问,头像教他用日语问“这个多少钱”,听到发音偏差后再用英语解释并示范。视频具体呈现的是英语与日语之间的切换。
选择角色外观。 最后一段展示多种外观、声音和表情的预设头像,帮助企业判断可视形象的风格范围;视频没有演示用参考图制作自定义头像的过程。
现在适合用在哪里
Live Avatar 已面向 Gemini Enterprise 企业客户开放,开发者可通过 Gemini Live API 接入。当前更适合短时、需要视听反馈的接待、导览与客服对话。Google DeepMind 模型卡写明连续交互可支持“几分钟”,而非数小时;偶发变慢、超时和回答错误仍是已知限制。
企业若要把它用于实际服务,需要确认目标语言与延迟、工具权限和业务回执。自定义头像须进入企业白名单;Google 表示生成的音视频带有 SynthID 隐形水印,用来帮助识别 AI 生成内容。水印提供识别线索,实际部署仍需要核验每项业务操作的结果。
Google 发布 Gemini 3.8 Live Avatar:打造实时对话的数字人
Google 发布的 Gemini 3.8 Live Avatar 是一套能够在对话中同时看、听、说的动态数字人能力。Google 将实时对话与低延迟流式视频原生结合;异步工具调用让查询与交流可以并行。
Google 介绍了两项相互配合的能力:画面和语音随对话持续更新;查询或操作在后台执行时,前台仍可交流。
系统结合语音与摄像头画面理解现场,再持续输出语音和动态形象;口型与表情随回答变化。
AI 可在后台发起外部查询或操作,并在等待结果时继续对话;实际业务是否办成仍要看系统回执。
通过将实时感知与业务能力嵌入流式视频,数字人从单纯的“信息播报员”转型为具备环境理解力与办事能力的业务前台。
用户将猫抱到镜头前询问照顾建议,AI 不仅解答猫的休息需求,还主动注意到桌上未被提及的绿萝,提醒移开有毒植物。
酒店演示把提前入住、升房、数字钥匙和点餐串成一次对话;视频不能证明操作已接入真实酒店系统。
在日语练习演示中,头像使用英语拆解句意与发音要点,引导用户日语跟读,并在识别发音偏差后自如切回英语辅导。
官方演示了不同外观与风格的预设形象;自定义形象需进入企业白名单。
技术升级显著改善了感官交互,但企业要将其投入实际生产系统,必须清醒区分“演示效果”与“工程边界”。
- 口头流畅不等于业务执行:视频中头像承诺“已为您免费升房”,仅是前台会话表达;真实的房态、钥匙和餐饮请求要以对应业务系统回执核验。
- 会话时长受模型卡约束:Google DeepMind 模型卡明确指出连续交互可支持“几分钟”而非数小时;偶发变慢、超时和回答错误仍是模型卡列出的限制。
- 可信溯源与品牌合规:Google 称生成的音视频带有 SynthID 隐形水印,帮助识别 AI 内容;自定义形象需企业白名单。