Google Research·· 2025-11-19精选AI 评分60
Google 发布实时语音到语音翻译模型,延迟降至 2 秒并保留原说话人音色
Real-time speech-to-speech translation
AI 导读
Google 描述一个端到端语音到语音翻译(S2ST)模型,将传统级联方案 4–5 秒的延迟降至 2 秒,并以原说话人音色直接输出翻译音频。
推荐理由
原文给出了模型架构、延迟数据与部署位置,读者可以了解端到端语音翻译与级联方案的差异及落地方式。
来源:Google Research · research.google