跳到正文

全部动态

今日 1 条
10月17日周五
  1. Hugging Face Blog40

    AI for Food Allergies:用 AI 推进食物过敏研究

    全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。

10月14日周二
10月9日周四
10月7日周二
  1. Hugging Face Blog68

    BigCode 发布 BigCodeArena:通过代码执行端到端评判代码生成模型

    BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。

    推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。

10月1日周三
  1. Hugging Face Blog51

    Hugging Face 发布 RTEB 基准,用开放与私有数据集评估嵌入模型真实检索泛化能力

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)测试版,旨在可靠评估嵌入模型在真实应用中的检索准确性。它采用开放与私有数据集结合的混合策略来检测基准过拟合,覆盖 20 种语言和法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,榜单已上线于 MTEB 排行榜的检索板块。

9月26日周五
9月23日周二
9月22日周一
  1. Hugging Face Blog61

    Meta 发布 Gaia2 智能体基准及开源评估框架 ARE

    Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。

    推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。

9月5日周五
9月3日周三
9月1日周一
8月12日周二
8月5日周二
8月1日周五
7月23日周三
  1. Hugging Face Blog53

    Hugging Face 发布 TimeScope 长视频理解基准

    Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。

7月17日周四
6月18日周三
  1. OpenAI News64

    OpenAI 研究不对齐泛化的理解与预防

    OpenAI 发布研究,探讨在错误回答上训练如何导致语言模型更广泛的不对齐。研究识别出驱动该行为的内部特征,并发现通过极少量微调即可将其逆转。

    推荐理由:OpenAI 官方研究探讨错误回答训练如何引发更广泛的模型不对齐,并指出该内部特征可用极少微调逆转,为对齐研究提供了新方向。

6月6日周五
5月28日周三
  1. Hugging Face Blog60

    Hugging Face 提出 Structured CodeAgent:用结构化生成提升代码智能体可靠性

    Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。

    推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。

5月12日周一
4月16日周三
4月10日周四
4月8日周二
4月2日周三
3月21日周五
3月12日周三
  1. Hugging Face Blog63

    Hugging Face Open R1 更新:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 7B/32B 模型

    Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。

    推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。

3月11日周二
3月10日周一
  1. OpenAI News64

    OpenAI:用 LLM 监控思维链可检测前沿推理模型的不当行为

    OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。

    推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。

2月18日周二
2月11日周二
  1. Hugging Face Blog62

    Hugging Face Open R1 更新:发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。

    推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。

2月10日周一
  1. Hugging Face Blog34

    Open Arabic LLM Leaderboard 2 发布

    Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。

2月4日周二
1月22日周三
12月20日周五
12月9日周一
11月21日周四
11月20日周三
  1. Hugging Face Blog42

    让大模型辩论:首届多语言 LLM 辩论竞赛

    BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。

10月30日周三