跳到正文

#语音

今日 0 条
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在 100 多种语言和方言中定制角色声音,可从 30 秒音频样本复刻声音,并提供 2000 多个现成声音。

    推荐理由:官方介绍了两款 TTS 模型的定制能力、基准成绩和开放渠道,开发者可以据此评估语音生成方案的选型。

9月16日周三
8月11日周二
6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,提供 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者数秒。

    推荐理由:官方发布正文给出了 70+ 语言、延迟表现和多端开放入口,读者可据此评估它在通话、会议和翻译场景的可用性。

5月7日周四
4月28日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型,覆盖文档、语音、视频与 GUI 智能体

    NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。

    推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。

3月26日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。

    推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。

3月24日周二
  1. Mistral AI62

    Mistral AI 发布 Voxtral TTS 语音生成模型

    Mistral AI 发布首款文生语音模型 Voxtral TTS,4B 参数,支持 9 种语言,仅需约 3 秒参考音频即可适配自定义音色,并支持零样本跨语言音色迁移。

    推荐理由:原文给出 9 语言、3 秒参考音色、70ms 延迟等可核验细节与人类评测对比,读者可据此评估其语音智能体方案。

2月5日周四
12月13日周六
  1. Google DeepMind66

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,推出实时语音翻译

    Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。

    推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。

9月30日周二
  1. OpenAI News74

    OpenAI 发布 Sora 2 视频与音频生成模型

    OpenAI 发布新一代视频与音频生成模型 Sora 2。相较初代 Sora,新模型具备更准确的物理表现、更强的真实感、同步音频、更高的可控性和更广的风格范围。

    推荐理由:官方说明列出 Sora 2 在物理准确性、音画同步和可控性上的能力变化,可帮助读者比较视频模型迭代方向。

7月15日周二
9月21日周三