阿里巴巴发布 Qwen3.8-LiveTranslate实时语音翻译模型:实时同传,而且能区分多位说话人

它还能让原文译文同步出现,并结合长上下文和画面处理歧义。本文讲清架构、语种、评测、API 接入与实际价格。

一场多人参与的跨语言会议里,翻译得快只是起点。听众还要知道每句话是谁说的,遇到人名和专业术语时能对照原文,后面的对话也不能忘记前面已经交代的背景。实时同传要把这些信息一起传过去,才更接近可用的交流工具。

Qwen 团队推出了面向实时语音同传的大模型 Qwen3.8-LiveTranslate,并在阿里云百炼平台上线了流式接入接口 qwen3.8-livetranslate-flash-realtime。

Qwen3.8-LiveTranslate 由两个部分协作:Thinker 一边听、一边结合画面和前文理解内容,Talker 再把译文说出来。在官方 FLEURS 多语言测试中,译文进度平均落后原话 2.3 秒;这项指标的英文缩写是 LAAL,用来比较实时翻译系统跟上说话人的速度。

这次升级集中在四项能力:

  • 分清谁在说话:流式区分多位说话人,并让译文语音尽量保留各自音色;
  • 原文译文同步出现:同一条数据流同时返回源语言识别结果与目标语言译文,便于字幕核对与内容整理;
  • 用前文和画面消歧:结合长上下文与静态图像帧,处理指代、专名和同音词;
  • 减少流式等待:把音频和文字交替放进同一条处理流,复用已经听过的音频和已经生成的译文;在 FLEURS 测试中,译文平均落后原话的时间从上一代的 2.8 秒降到 2.3 秒。
Qwen3.8-LiveTranslate 官方主图
Qwen 官方主图:展示同传的应用场景与本次升级的三项能力。

它怎样一边听、一边译、一边说

常见的语音同传系统分三步工作:先把语音识别成文字,再翻译文字,最后把译文合成为语音。三步前后相接,前一步听错了,错误容易传到后面;说话人的音色也很难穿过这条以文字为中心的链路。

Qwen3.8-LiveTranslate 改用 Thinker–Talker 双模块。底层的 Hybrid MoE 是一种“按任务选择部分专家模块参与计算”的架构;Interleave 则表示音频、原文和译文不再分批排队处理,而是按时间顺序交替进入同一条处理流。

Qwen3.8-LiveTranslate 模型架构图
Thinker–Talker 双模块架构:Thinker 负责音视频与双语文本交织推理,Talker 结合译文与源音频合成保留原音色的译文语音。

系统的核心运作由两个模块协作完成:

Thinker 负责“听懂”。它把画面、声音、识别出的原文和正在生成的译文按时间顺序放在一起处理。系统可以继续利用已经听过的音频和已经译出的内容,不必每次从头计算,因此能更快接着往下翻译。

Talker 负责“把译文说出来”。它同时参考译文和原始声音,让合成的目标语言语音尽量保留原说话人的音色。

四项能力怎样用在真实对话里

为了应对多人交流与复杂语境,Qwen3.8-LiveTranslate 引入了针对性的流式处理能力:

Qwen3.8-LiveTranslate 核心特性展示
官方功能图(静态帧):实时说话人区分、双语对齐输出与长上下文消歧能力。

区分说话人,并保留各自音色

在多人轮流发言或交替对话时,模型会用 spk1、spk2、spk3 这样的标签区分每句话是谁说的,并让对应的译文语音保留各自的音色。

演示视频:多角色交替对话演示,片中唐僧、老者与孙悟空以 spk1/spk2/spk3 标记发言归属并呈现中英字幕。

原文和译文同步出现

模型在返回译文的同时,也会给出识别出的原文。应用可以把两种文字同步显示,读者既能直接看翻译,也能随时对照原话;双语字幕、内容整理和信息检索也因此有了可以直接使用的数据。

用前文理解人名和指代

结合前文对话与历史语境,缓解流式翻译中代词指代、人名与专有名词的歧义。在官方演示片段中,对话呈现了围绕火焰山、四季常热与庄稼无法生长的前后脉络,并在末尾演示了模型结合上下文将“铁山郡/Tieshan Country”纠正为“铁扇仙/Iron Fan Fairy”(按片中文字显示)的过程。

演示视频:长上下文语境消歧演示,展示围绕火焰山、四季常热到庄稼无法生长的对话脉络,片尾演示将“铁山郡/Tieshan Country”纠正为“铁扇仙/Iron Fan Fairy”。

用画面判断同音词

当声音里出现同音词,仅靠前后文仍难以判断时,模型还可以参考摄像头画面。官方演示用了 pear/pair、leek/leak、sail/sale 三组读音相同、含义不同的词:画面里出现哪件实物,模型就据此选择对应的意思。

演示视频:模型参考实物画面,区分 pear/pair、leek/leak、sail/sale 等同音词。

翻译速度、质量和说话人区分表现

Qwen 团队在 FLEURS 多语言测试集上比较了 19 种语言之间的 70 个翻译方向,例如“中文译英文”和“英文译中文”会算作两个方向。衡量译文质量的自动评分 xCOMET-XXL 越高越好:Qwen3.8-LiveTranslate 得到 85.7 分,上一代 Qwen3.5 为 83.0 分,Seed LiveInterpret 2.0 为 79.4 分,Gemini 3.5 Live Translate 为 73.5 分,GPT-Realtime-Translate 为 65.2 分。

FLEURS 多语言评测结果
FLEURS 评测结果:涵盖 19 语言 70 语向下的翻译质量、字均延迟、语音识别错误率与语音合成自然度(结果由 Qwen 团队报告)。

速度方面,LAAL 衡量译文平均落后原话多久,越低代表跟得越快。Qwen3.8 的结果为 2.3 秒,Gemini 为 2.5 秒,Seed 与 Qwen3.5 为 2.8 秒,GPT 为 3.1 秒。听写准确度用 WER(词错误率)衡量,越低越好:Qwen3.8 为 6.6%,Seed 为 7.0%,Gemini 为 11.4%。合成语音的自然程度用 UTMOS 评分衡量,满分 5 分,越高越自然;Qwen3.8 得到 4.0 分。Seed 的语音自然度只测试了其支持语音输出的 26 个翻译方向,其余系统覆盖 70 个方向。

在 Omnilingua-MSpeaker 这项多人长音频测试中,Qwen 团队把 Qwen3.8 与其他模型的译文两两比较,分别观察内容是否忠实、表达是否流畅、句子是否简洁:

  • 忠实度:面对 Seed、GPT、Gemini,Qwen3.8 胜率分别为 81.0%、79.3%、79.9%(对手胜率为 15.4%、17.3%、15.0%,其余为平局);
  • 流畅度:胜率分别为 87.2%、74.6%、95.6%(对手胜率为 9.9%、20.9%、3.4%);
  • 简洁度:面对 Seed 时,Qwen3.8 有 20.3% 的样本更好、70.0% 持平、9.7% 较差;面对 GPT 与 Gemini 时,胜率分别为 39.2% 与 83.2%。
Omnilingua-MSpeaker 多说话人长音频评测结果
多说话人评测结果:展示了翻译成对比较胜率以及流式与离线系统间的说话人分离错误率(结果由 Qwen 团队报告)。

区分说话人是否准确,可以看 DER(说话人分离错误率),数值越低越好。Qwen3.8 一边接收声音一边处理时,错误率为 9.7%;同样采用实时处理的 Seed-asr-2.0 为 30.6%。另外两项对照是在拿到完整录音后再处理:GPT-4o-transcribe-diarize 为 18.0%,Gemini-3.5-transcribe-preview 为 26.7%。

把这组数字收成产品判断,Qwen3.8 的优势并不平均。翻译质量的领先较明显,延迟的领先较小,多说话人分离是最值得实测的差距。xCOMET 比上一代高 2.7 分;LAAL 只比 Gemini 快 0.2 秒、比 Seed 与 Qwen3.5 快 0.5 秒;实时 DER 则是 9.7% 对 Seed 的 30.6%。GPT 和 Gemini 的 DER 是完整录音到手后的离线处理结果,可以帮助了解数值范围,但不能当成同样实时条件下的正面对比。

语种支持与覆盖范围

系统对不同语种提供三种能力:

  • 音频输入 · 60 种:可以把这些语言作为源语音送入模型;
  • 文字输出 · 60 种:可以返回这些目标语言的翻译文本;
  • 语音输出 · 29 种:只有这个子集可以进一步合成目标语言语音。

例如,粤语可以作为输入语音,也可以输出粤语文字,但目前不能合成粤语语音。下面按能力分组列出全部语种,也可以直接搜索某一种语言。

60 种可翻译 · 29 种可发声

查一个语种能用在哪一步

中文音频输入文字输出语音输出

可输出语音

29 种

同时支持音频输入、文字输出与语音输出。

  • 中文
  • 英语
  • 德语
  • 意大利语
  • 葡萄牙语
  • 西班牙语
  • 日语
  • 韩语
  • 法语
  • 俄语
  • 泰语
  • 印度尼西亚语
  • 阿拉伯语
  • 越南语
  • 土耳其语
  • 芬兰语
  • 波兰语
  • 印地语
  • 荷兰语
  • 捷克语
  • 乌尔都语
  • 菲律宾语
  • 瑞典语
  • 丹麦语
  • 希伯来语
  • 冰岛语
  • 马来语
  • 挪威语
  • 波斯语

仅输入与文字输出

31 种

可以翻译文字,未列入当前语音合成输出清单。

  • 南非荷兰语
  • 阿斯图里亚斯语
  • 阿塞拜疆语
  • 白俄罗斯语
  • 孟加拉语
  • 波斯尼亚语
  • 保加利亚语
  • 粤语
  • 加泰罗尼亚语
  • 宿务语
  • 克罗地亚语
  • 爱沙尼亚语
  • 加利西亚语
  • 古吉拉特语
  • 希腊语
  • 匈牙利语
  • 爪哇语
  • 卡纳达语
  • 哈萨克语
  • 柯尔克孜语
  • 拉脱维亚语
  • 马其顿语
  • 马拉雅拉姆语
  • 马拉地语
  • 旁遮普语
  • 罗马尼亚语
  • 斯洛伐克语
  • 斯洛文尼亚语
  • 斯瓦希里语
  • 塔吉克语
  • 乌克兰语

选择上方任一语言,即可查看它能否作为语音输入、文字输出和语音输出。

开发者接入:用 WebSocket 持续发送和接收

在百炼平台上,客户端通过 WebSocket 保持一条不断开的网络连接,边发送音频边接收译文,无需等整段录音上传结束。接入地址格式如下:

wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime

上述地址为华北 2(北京)地域接入端点,其中 {workspace_id} 为百炼业务空间 ID;不同地域(如新加坡国际服务)的接入地址不同。鉴权通过 WebSocket 连接建立时的 HTTP 请求头 Authorization: Bearer <DASHSCOPE_API_KEY> 传递。

一次同传连接分四步

建立连接后,客户端要完成四件事:告诉服务端译成什么语言,持续发送声音或画面,接收翻译结果,最后等待剩余内容处理完再关闭连接。

1. 设定目标语言和输出形式(session.update)

客户端连接建立后,首个发往服务端的事件应为 session.update。根据官方最新文档,qwen3.8-livetranslate-flash-realtime 的最小配置示例如下:

{
  "type": "session.update",
  "session": {
    "output_modalities": [
      "text",
      "audio"
    ],
    "translation": {
      "language": "en"
    }
  }
}

几个字段分别控制这些内容:

  • 要文字还是语音:session.output_modalities 设为 ["text", "audio"] 时同时返回译文文字和语音;设为 ["text"] 时只返回文字。
  • 同时返回原文:Qwen3.8 会一直进行语音识别,也就是把听到的声音转成原文文字;这项结果免费返回,不需要像 Qwen3.5 那样用 input_audio_transcription 手动开启。
  • 译成哪种语言:在 translation.language 中填写目标语言。还可以用 translation.corpus.phrases 提供术语对照,例如 {"人工智能": "Artificial Intelligence"},帮助模型稳定翻译行业词汇和专有名词。

2. 持续发送声音,需要时加入画面

  • 发送声音(input_audio_buffer.append):把麦克风采集的声音切成小段,使用 16000Hz、单声道的 PCM 格式,再转成便于网络传输的 Base64 文本并持续发送。服务端会自动判断一句话何时开始、何时结束,然后触发翻译。
  • 发送画面(input_image_buffer.append):需要模型参考画面时,可以把静态图片转成 Base64 文本后发送。图片需满足以下条件:
    • 图像格式必须为 JPG 或 JPEG,建议分辨率为 480p 或 720p(最高不超过 1080p);
    • 单张图片大小在 Base64 编码前不得超过 500KB;
    • 图像推流频率不得超过每秒 2 张;
    • 发送 input_image_buffer.append 之前,会话中必须至少发送过一次 input_audio_buffer.append 音频事件。

3. 接收原文、译文和译文语音

服务端不会等整段对话结束才一次返回结果,而是用不同事件逐小段发送:

  • 译文语音(response.audio.delta):每次返回一小段 24000Hz、单声道的 PCM 音频,客户端按顺序放进播放队列。
  • 译文文字:同时输出语音时,通过 response.audio_transcript.delta 逐段返回;只输出文字时,通过 response.text.delta 返回。客户端按接收顺序把片段拼起来。
  • 识别出的原文:conversation.item.input_audio_transcription.text 持续返回已经确认的原文;这一段话识别完成后,conversation.item.input_audio_transcription.completed 给出完整原文和语种。
  • 本轮结束(response.done):表示这一轮翻译已经生成完,也会带回本轮使用的 Token 数量。Token 是 API 计算用量和费用的单位。

4. 等剩余内容处理完再关闭

录音结束时,客户端先发送 session.finish,告诉服务端“声音已经发完”。服务端把剩余声音处理完后会返回 session.finished。收到这个事件、并且本地播放队列也播完后,再断开连接,就不会截掉最后一句话。

客户端参考实现存档说明

官方博客此前提供过一份基于 Python 的全双工客户端示例代码,包含麦克风推流采集与后台多线程播放逻辑。该代码已原样存档供参考:official-client.py。

这份代码保留了博客发布时的原始注释,其中部分内容与当前 API 文档不同;实际接入时按当前文档调整。

API 价格与免费额度

这项 API 把声音、图片、文字和合成语音换算成 Token,再分别计费。根据阿里云百炼截至 2026 年 9 月 19 日公布的价格,华北 2(北京)地域中,qwen3.8-livetranslate-flash-realtime 每百万 Token 的原价为:

  • 音频输入:40 元;
  • 图片输入:3.3 元;
  • 文字输出:100 元;
  • 语音输出:160 元。

华北 2(北京)提供 100 万 Token 免费额度,有效期为开通百炼、模型发布或申请通过之日起 90 天内,以三者中较晚的日期为准;其他地域没有这项免费额度。新加坡地域的四项单价分别为 54.688 元、4.01 元、145.835 元和 218.752 元/百万 Token。

如果产品要同时返回译文语音,语音输出的单价最高;只需要字幕时,把 output_modalities 设为 ["text"] 就能避免这项输出。音频、图片、文字与语音各有不同的 Token 换算方式,所以价格表不能直接换算成“每分钟多少钱”。正式接入前,用一段典型会议同时试跑纯字幕与语音输出两种模式,再在百炼模型价格页和控制台账单中对比总用量。

接入后重点测试三件事

接入实时同传后,可以围绕说话人、术语和等待时间做三组测试:

能否分清每个人说了什么

  • 测试问题:多人交替发言或快速接话时,系统能否稳定区分说话人归属并在译文中保持各自声线?
  • 观察什么:spk 说话人标签是否跟着发言者正确切换;译文语音是否保留各人的音色;多人快速接话时是否出现角色混淆或声音变化。
  • 不通过影响:听众无法凭字幕或声音分辨发言者身份,造成多人研讨或商务洽谈场景下的表达归属错乱。

人名和专业词能否前后一致

  • 测试问题:领域专有名词、机构简称与同音词在长会话跨轮次交流中能否保持翻译一致?
  • 观察什么:添加术语对照表前后,关键词的译法是否改善;对话进行一段时间后,同一个名字是否仍使用同一种译法,代词是否指向正确的人或事物。
  • 不通过影响:专业词汇被误译为常见生活词汇,破坏专业会议的准确性,增加人工二次校正与核对成本。

声音切多长一段最合适

  • 测试问题:每次发送多长的声音,才能既让译文尽快出现,又保持播放连贯?
  • 观察什么:调整每段声音的长度(例如约 100 毫秒)后,第一段译文语音多久返回;网络不稳定时,播放是否断续或越积越多。
  • 不通过影响:每段太长,模型要等更久才开始处理;每段太短,发送次数会增多。应在实际使用的网络中找到两者的平衡。

Qwen 团队接下来还计划继续缩短等待时间、探索跨会话的长期记忆,并覆盖更多小语种和区域方言。

开发者若需体验或接入该模型,可通过官方提供的 Demo 体验入口 进行试用,或查阅百炼官方 API 文档 获取最新的接入规范。

来源
Qwen3.8-LiveTranslate:知其人,传其义Qwen Team·2026-09-18·查看主材料
本站说明
评测数字与演示来自 Qwen 团队;价格来自阿里云百炼官方价格页,核对日期为 2026-09-19。