跳到正文

全部动态

今日 37 条
3月10日周二
  1. Hugging Face Blog67

    Hugging Face Hub 推出 Storage Buckets 可变对象存储

    Hugging Face 在 Hub 上推出 Storage Buckets,一种不版本控制的可变、类 S3 对象存储,用于存放 checkpoints、处理后的数据、Agent traces 等中间产物。

    推荐理由:官方发布后明确解释了为什么中间产物不适合放 Git 仓库,并给出 CLI、Python、fsspec 的完整上手路径,便于迁移现有训练和数据流程。

3月9日周一
3月7日周六
  1. Google Research50

    Google Research 发布非洲语言开放语音语料库 WAXAL

    Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。

  2. Google Research50

    谷歌开源模型 SpeciesNet 如何识别野生动物相机陷阱影像

    Google 开发的开源 AI 模型 SpeciesNet 可对相机陷阱图像中约 2,500 类(2,498 类)动物进行分类,训练数据超过 6500 万张标注图像。模型在留出测试集上能找出 99.4% 含动物的图像,可识别到物种级的预测中 94.5% 正确,标准笔记本每天约可处理 3 万张图像。过去一年,全球研究团队已用它在坦桑尼亚塞伦盖蒂、哥伦比亚、澳大利亚等地分析数百万张野生动物影像。

3月6日周五
3月5日周四
  1. OpenAI News79

    OpenAI 发布 GPT-5.4:面向专业工作的前沿模型

    OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。

    推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。

  2. Hugging Face Blog66

    Hugging Face 推出 Modular Diffusers,用可组合积木构建扩散流水线

    Hugging Face 发布 Modular Diffusers,将扩散流水线拆成文本编码、去噪、解码等可独立运行、自由增删互换的可复用块,作为现有 DiffusionPipeline 的灵活补充。

    推荐理由:原文展示了用可组合积木搭建扩散流水线的完整用法,包括自定义块、模块化仓库和 Mellon 可视化集成,方法可直接复用。

  3. Google Research48

    Google Research:教 LLM 像贝叶斯派一样推理

    Google Research 通过“Bayesian teaching”监督微调,让 LLM 模仿 Bayesian Assistant 的最优贝叶斯推理预测,弥补其默认简单启发式的不足。在简化航班推荐任务中,各系列 LLM 原本表现明显差于 Bayesian Assistant,且常在单轮交互后停滞;训练后不仅显著提升推荐任务表现,还能泛化到其他任务。

3月4日周三
2月28日周六
2月27日周五
2月26日周四
2月25日周三
2月24日周二
2月23日周一