跳到正文

#语音

今日 0 条
8月21日周五
  1. Hugging Face Blog61

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布新研究,用三项探针测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转录,甚至在相关词被静音时恢复被删除的数字,或按基准期望切换拼写变体;部分模型还能借助声学线索识别测试集。

    推荐理由:研究用三种探针量化了 ASR 模型对公开基准的过拟合,并给出选用模型与设计基准的具体建议。

7月15日周三
6月24日周三
5月6日周三
3月24日周二
3月7日周六
  1. Google Research50

    Google Research 发布非洲语言开放语音语料库 WAXAL

    Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。

12月4日周四
  1. Google Research37

    Google 发布 Massive Sound Embedding Benchmark(MSEB):面向听觉智能的新基准

    Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。

11月21日周五
12月20日周五