AI 日报hiw3c.com

阿里巴巴Qwen团队发布Qwen 3.8-LiveTranslate:实时翻译模型,将60种语言的平均延迟缩短至2.3秒

原文标题 · Alibaba Qwen Team Releases Qwen3.8-LiveTranslate: A Real-Time Interpretation Model That Cuts Average Lag to 2.3 Seconds Across 60 Languages
MarkTechPost www.marktechpost.com RSS 全文

以下为 AI 机器翻译(保留原文图片与链接),仅供参考,请以原文为准。

Qwen发布了Qwen3.8-LiveTranslate,其下一代实时同传模型。它通过可选的视频帧收听现场语音,并在说话者仍在说话时返回翻译的文本和语音。核心变化是新的Interleave架构。Qwen报告说,在忠实性、流畅性和简洁性方面有所提高,平均滞后(LAAL)从2.8秒下降到2.3秒。的释放还增加了实时发言人日记,同步双语显示,和长期上下文消歧。

可部署?是的,作为托管API。正在直播阿里云模型工作室QwenCloud作为qwen3.8-livetranslate-flash-realtime通过Webocket。

引擎盖下发生了什么

同声传译是一种权衡。等待更长时间可以为模型提供更多背景信息。早点说话可以减少听众的延迟。Qwen 3.8-LiveTranslate使用Interleave架构重建了这个循环。

这里的延迟度量是LAAL或长度自适应平均滞后.它衡量翻译平均落后于源语音的程度。它还避免奖励过度产生产出的系统。从2.8秒下降到2.3秒,平均滞后大约减少了18%。

QwenCloud团队将该模型描述为Qwen3.8的实时版本-LiveTranslate-Flash。它建立在Qwen-Omni堆栈、大规模多模式数据、跨语言和跨模式对齐以及视觉增强之上。Flash模型还支持离线音频和视频翻译。

三种新能力

  • 实时扬声器日记化:该模型区分多方演讲中的发言者。它还通过更稳定的语音克隆来保留每个说话者的声音。API暴露克隆模式,包括always在多扬声器会话的每次响应之前重新克隆的模式。
  • 同步双语展示:源文本和翻译一起出现在屏幕上。在API中,源转录流作为其自身的事件与翻译流相邻。
  • 长上下文歧义消除:该模型使用对话历史记录来解析名称和术语。会议早期引入的名称在翻译后期保持一致。

尝试下面的解释。它会经历交织流、说话者标记、上下文歧义消除、语言覆盖和会话成本。

语言、投入和愿景

该模型可以理解60种语言。它可以说出其中的29个,并返回音频和文本。其余31个仅返回文本。语音输出涵盖中文、英语、阿拉伯语、德语、法语、西班牙语、日语、韩语、印地语等。

输入是音频和可选图像。输出是文本和音频。嘴唇运动、手势和屏幕文本等视觉线索在嘈杂的房间和模棱两可的词语中有所帮助。文档建议每秒发送不超过2张图像。

团队也可以设置热词。这些将源术语映射到固定的目标翻译。文档建议配置不超过1,000个热词。

API、定价和限制

开发人员通过Webocket实时API带有型号IDqwen3.8-livetranslate-flash-realtime.默认转弯检测类型为speaker_detection.客户端连续传输音频并接收服务器生成的响应。

默认音频为16 GHz PCM输入和24 GHz PCM输出。默认声音是Tina。设置session.output_modalities到纯文本或文本和音频。总是派session.finish在关闭之前,否则最后一段丢失。

新加坡每100万代币的定价:

  • 音频输入:7.50美元
  • 图片输入:0.55美元
  • 文本输出:20美元
  • 音频输出:30美元

北京定价较低,按美元计算为5.653美元、0.466美元、14.133美元和22.613美元。音频输入每秒消耗7个令牌。音频输出每秒消耗12.5个令牌。在新加坡,一小时的演讲和演讲费用约为1.54美元,不包括文本和图像代币。

上下文窗口有53,248个令牌,其中49,152个用于输入,4,096个用于输出。默认速率限制为每分钟10个请求和100,000个代币。Model Studio将函数调用、结构化输出、批量推理和微调列为不受支持的。

关键要点

  • Qwen 3.8-LiveTranslate将平均滞后(LAAL)从2.8秒降至2.3秒。
  • 新的Interleave架构提高了忠实性、流畅性和简洁性。
  • 它增加了发言人日记,双语显示,和长上下文消歧。
  • 它能理解60种语言,会说29种语言。
  • 通过阿里云模型工作室和QwenCloud访问仅限API。


查看技术细节.所有功劳都归功于该项目的研究人员。另外,请随时关注我们 Twitter 不要忘记加入我们的 15万+ML SubReddit 并订阅 我们的通讯.等等!你在打电报吗? 现在您也可以通过电报加入我们。

需要与我们合作推广您的GitHub Repo或Hugging Face Page或产品发布或网络研讨会等? 与我们联系

年后阿里巴巴Qwen团队发布Qwen 3.8-LiveTranslate:实时翻译模型,将60种语言的平均延迟缩短至2.3秒appeared first onMarkTechPost.