跳到正文
原文
Google Research·· 2025-11-19精选AI 评分60

Google 发布实时语音到语音翻译模型,延迟降至 2 秒并保留原说话人音色

Real-time speech-to-speech translation

AI 导读

Google 描述一个端到端语音到语音翻译(S2ST)模型,将传统级联方案 4–5 秒的延迟降至 2 秒,并以原说话人音色直接输出翻译音频。

推荐理由

原文给出了模型架构、延迟数据与部署位置,读者可以了解端到端语音翻译与级联方案的差异及落地方式。

来源:Google Research · research.google