Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 与声音克隆
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源、多语言的 TTS 模型和声音克隆能力。评估采用 Qwen3 ASR 计算的 WER/CER 衡量可懂度、H200 GPU 上的 RTFx 与 TTFA 衡量速度、WavLM 嵌入余弦相似度衡量说话人相似度,使单个模型评估从数周缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源、多语言的 TTS 模型和声音克隆能力。评估采用 Qwen3 ASR 计算的 WER/CER 衡量可懂度、H200 GPU 上的 RTFx 与 TTFA 衡量速度、WavLM 嵌入余弦相似度衡量说话人相似度,使单个模型评估从数周缩短到数小时。
AWS 在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现文本流式输入、语音边生成边播放的实时输出。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与原生实时对话结合,让模型具备唇形同步、自然表情和流畅轮次切换的动态视觉形象。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在 100 多种语言和方言中定制角色声音,可从 30 秒音频样本复刻声音,并提供 2000 多个现成声音。
推荐理由:官方介绍了两款 TTS 模型的定制能力、基准成绩和开放渠道,开发者可以据此评估语音生成方案的选型。
Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音对话模型。
推荐理由:官方公布了两个语音模型的能力定位、多项基准成绩和可用入口,读者可以据此评估是否接入自己的语音应用。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为更精确的智能语音转写模型,能清除填充词、自动排版、支持自定义词表和 85 种以上语言。
推荐理由:官方发布文给出模型的能力细节、两项 API 入口和与 Chirp 3 的 WER 与延迟对比,开发者可据此评估语音转写方案选型。
Hugging Face 发布新研究,用三项探针测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转录,甚至在相关词被静音时恢复被删除的数字,或按基准期望切换拼写变体;部分模型还能借助声学线索识别测试集。
推荐理由:研究用三种探针量化了 ASR 模型对公开基准的过拟合,并给出选用模型与设计基准的具体建议。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
OpenAI 介绍了 GPT-Live 的实时语音系统构建过程,耗时六个月完成。GPT-Live 支持与 AI 的连续语音交互,采用 turnless 语音模型和低延迟架构,使对话更快速、更自然。
avatarin 利用 OpenAI 的 GPT-Realtime 为 Yamada Denki 购物者提供 24/7 多语言客服支持。上线两周内该智能体已服务 30,000 名用户,92% 的调查反馈为正面评价。
Hume 推出 Real World VoiceEQ 基准,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解,含 15+ 维度、60+ 指标。
Deutsche Telekom 正借助 OpenAI 成为 AI 原生电信运营商,将 AI 用于客户服务、员工工作流和网络运营,并探索语音的未来。
Hugging Face 与 Cerebras 发布开源级联语音到语音管线,语音识别用 Nvidia Parakeet,语言模型为 Google DeepMind Gemma 4 31B 并在 Cerebras 上推理,语音合成用 Qwen3TTS。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,提供 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者数秒。
推荐理由:官方发布正文给出了 70+ 语言、延迟表现和多端开放入口,读者可据此评估它在通话、会议和翻译场景的可用性。
Hugging Face 发布教程,教 Reachy Mini 用户用 speech-to-speech 库跑通完全本地的语音对话管线,音频不再上传服务器,无需云端和 API key。
Parloa 利用 OpenAI 模型构建可规模化的语音驱动 AI 客服智能体,帮助企业设计、模拟并部署可靠的实时交互服务。该方案让企业能够运行客户愿意与之对话的服务智能体。
OpenAI 在 API 中发布新的 realtime 语音模型,支持推理、翻译和语音转写。官方称这些模型可支撑更自然、更智能的语音体验。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入 10 个高质量私有 ASR 数据集,涵盖朗读与对话风格及澳、加、印、美、英等多种口音,以防范 benchmaxxing 和测试集污染。
Uber 使用 OpenAI 驱动 AI 助手和语音功能,帮助司机更聪明地赚钱,并让乘客更快完成订车。这些能力覆盖 Uber 的全球实时交易平台,是其与 OpenAI 合作落地的核心场景。
OpenAI 重构了其 WebRTC 技术栈,以支持低延迟、全球规模的实时语音 AI,并实现流畅的对话轮换。这套架构让语音智能体在生产环境中可以稳定运行。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Google DeepMind 推出文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分,支持原生多说话人对话和 70+ 种语言。
推荐理由:官方发布新 TTS 模型,给出 Elo 分数、多说话人和音频标签等具体能力与开放入口,便于评估语音应用场景。
Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。
推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
Mistral AI 发布首款文生语音模型 Voxtral TTS,4B 参数,支持 9 种语言,仅需约 3 秒参考音频即可适配自定义音色,并支持零样本跨语言音色迁移。
推荐理由:原文给出 9 语言、3 秒参考音色、70ms 延迟等可核验细节与人类评测对比,读者可据此评估其语音智能体方案。
Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。
Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户输入文字或上传照片即可生成 30 秒带歌词曲目。
推荐理由:官方介绍了 Lyria 3 的三项能力改进和 SynthID 音频验证入口,读者可据此了解 Gemini 音乐生成与识别 AI 内容的新玩法。
Mistral 发布 Voxtral Transcribe 2 系列,包含批处理转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime。
推荐理由:官方发布了两个语音转写模型的具体性能、价格和开放权重信息,读者可以据此对比现有转写方案的成本与延迟。
Tolan 基于 GPT-5.1 构建了语音优先的 AI 伴侣。它结合低延迟响应、实时上下文重建和基于记忆的个性化,实现自然对话。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转写赛道,目前对比 18 个机构的 60 多个开源与闭源模型,覆盖 11 个数据集。
Google 描述一个端到端语音到语音翻译(S2ST)模型,将传统级联方案 4–5 秒的延迟降至 2 秒,并以原说话人音色直接输出翻译音频。
推荐理由:原文给出了模型架构、延迟数据与部署位置,读者可以了解端到端语音翻译与级联方案的差异及落地方式。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
OpenAI 发布新一代视频与音频生成模型 Sora 2。相较初代 Sora,新模型具备更准确的物理表现、更强的真实感、同步音频、更高的可控性和更广的风格范围。
推荐理由:官方说明列出 Sora 2 在物理准确性、音画同步和可控性上的能力变化,可帮助读者比较视频模型迭代方向。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:官方公布了语音到语音模型与 API 能力更新,读者可据此了解语音方向的新入口。
Mistral 为 Le Chat 推出一批新功能,包括预览版 Deep Research 研究报告模式、基于 Voxtral 模型的语音模式、由 Magistral 驱动的多语言推理 Think 模式、按上下文组织对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。新功能已在 chat.mistral.ai 和移动应用开放使用,无需信用卡。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源,可通过 Hugging Face 下载或 API 调用。
推荐理由:官方发布了模型规格、基准对比和价格,读者可以据此评估它在语音理解和成本上相对现有方案的定位。
Genspark 基于 GPT-4.1 和 OpenAI Realtime API 构建了无代码个人智能体产品,在 45 天内实现 3600 万美元 ARR。