

自动语音翻译的新功能和改进使我们能够完成更多任务,涵盖更多语言,并且能够处理更多输入格式。然而,相较于人际交流,目前大规模自动语音翻译系统缺少使机器中介沟通自然的关键能力。
Meta AI的一项新研究提出了一系列模型,可以实现从头到尾的表达和多语言翻译。研究人员首先提出了SeamlessM4T v2,这是SeamlessM4T模型的升级版本,它是多模态的,支持几乎所有语言。这个改进的模型使用了更近期版本的UnitY2框架,其训练使用了资源较少的语言数据。通过扩展SeamlessAlign,将自动对齐了76种语言的数据,总计114,800小时。最近的两个模型,即SeamlessExpressive和SeamlessStreaming,基于SeamlessM4T v2。使用SeamlessExpressive,用户可以在保留所有语调和风格的同时进行翻译。
Meta的研究保留了用户声音的风格,同时解决了韵律(prosody)的一些尚未充分研究的特征,例如说话速度和停顿,这些特征在以前的表达性语音研究尝试中被忽视了。关于SeamlessStreaming,该提议模型不需要等待源话语完全结束才能生成延迟较低的目标翻译,而是使用了效率高的单调多头注意力(EMMA)技术。利用SeamlessStreaming,可以同时完成多种源语言和目标语言的语音转文本翻译。
团队根据一组新的和更新的现有自动度量标准来评估这些模型的韵律、延迟和稳定性。为进行人工评估,他们修改了现有的协议,以衡量对于意思保留、真实性和表达力最重要的品质。他们对性别偏见进行了全面评估,这是已知的第一个为多模态机器翻译进行红队评估的努力,也是第一个已知的检测和缓解毒性添加的系统,并使用不可听见的本地水印技术来缓解深度伪造的影响,以确保他们的模型能够负责任且安全地使用。
Seamless是第一个公开可用的能够实现表达性跨语言实时交流的系统。它结合了SeamlessExpressive和SeamlessStreaming,汇集了各个重要组成部分。总体而言,Seamless为我们提供了转变通用语音翻译器从科幻理念变为现实所需的基础技术的关键洞察。
研究人员强调,模型的准确性可能会因性别、种族或口音而有所不同,尽管我们在各种公平性角度上对我们的凭据进行了彻底测试,并在可行的情况下加入了安全保障。进一步的研究应该继续努力提高语言覆盖范围,并缩小低资源语言和高资源语言之间的性能差距,以实现通用语音翻译器。