跳到正文

#语音

今日 0 条
10月28日周二
  1. Hugging Face Blog58

    Hugging Face 提出语音同意门机制,让语音克隆须先获得说话人同意

    Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。

9月30日周二
  1. OpenAI News74

    OpenAI 发布 Sora 2 视频与音频生成模型

    OpenAI 发布新一代视频与音频生成模型 Sora 2。相较初代 Sora,新模型具备更准确的物理表现、更强的真实感、同步音频、更高的可控性和更广的风格范围。

    推荐理由:官方说明列出 Sora 2 在物理准确性、音画同步和可控性上的能力变化,可帮助读者比较视频模型迭代方向。

9月22日周一
8月28日周四
7月17日周四
  1. Mistral AI59

    Mistral Le Chat 上线 Deep Research、语音模式、Projects 等多项新功能

    Mistral 为 Le Chat 推出一批新功能,包括预览版 Deep Research 研究报告模式、基于 Voxtral 模型的语音模式、由 Magistral 驱动的多语言推理 Think 模式、按上下文组织对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。新功能已在 chat.mistral.ai 和移动应用开放使用,无需信用卡。

7月15日周二
7月1日周二
6月26日周四
5月13日周二
4月9日周三
3月20日周四
2月27日周四
2月25日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Python 实时通信库 FastRTC

    Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。

    推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。

12月20日周五
10月22日周二
10月1日周二
6月8日周六
5月20日周一
5月1日周三
3月29日周五
2月27日周二
1月19日周五
12月20日周三
8月9日周三
6月19日周一
6月2日周五
  1. Hugging Face Blog47

    如何在 Unity 中用 Hugging Face Unity API 实现语音识别

    这篇教程讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可将语音转文本用于指令输入、NPC 对话或无障碍功能。步骤包括搭建含开始/停止按钮的 UI 场景、用 Microphone.Start() 录制最长 10 秒、44100 Hz 的音频,并将录音编码为 WAV 格式供 API 调用,最终把识别结果显示在 TextMeshPro 文本中。

2月8日周三
12月15日周四
11月3日周四
  1. Hugging Face Blog66

    Hugging Face 发布使用 🤗 Transformers 微调 Whisper 的多语言 ASR 实战教程

    Hugging Face 发布分步教程,讲解如何用 🤗 Transformers、Datasets 和 Hub 对 Whisper 做多语言 ASR 微调,涵盖模型原理、Common Voice 数据准备、WhisperProcessor、Seq2SeqTrainer 训练与 WER 评估。

    推荐理由:教程展示了仅用 8 小时 Common Voice 印地语数据微调 Whisper small,把 WER 从 63.5% 降到 32.0%,方法可迁移到其他低资源语言。

9月21日周三
2月1日周二
1月12日周三
11月15日周一
  1. Hugging Face Blog34

    用 🤗 Transformers 微调 XLS-R(Wav2Vec2)实现低资源语音识别

    这篇 Hugging Face 教程讲解如何用 CTC 微调 Wav2Vec2-XLS-R-300M 做低资源 ASR。XLS-R 于 2021 年 11 月发布,用约 50 万小时、128 种语言的音频做自监督预训练,提供 300M 至 2B 参数的 checkpoint。教程以仅约 4 小时验证数据的 Common Voice 土耳其语数据集为示例,并用词错误率(WER)评估微调后的模型。

3月12日周五