跳到正文

#评测/基准

今日 0 条
8月1日周五
7月23日周三
  1. Hugging Face Blog53

    Hugging Face 发布 TimeScope 长视频理解基准

    Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。

7月17日周四
7月4日周五
6月6日周五
5月12日周一
4月16日周三
4月8日周二
2月18日周二
2月14日周五
  1. Hugging Face Blog63

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。

    推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。

2月10日周一
  1. Hugging Face Blog34

    Open Arabic LLM Leaderboard 2 发布

    Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。

2月4日周二
1月9日周四
12月20日周五
12月4日周三
  1. Hugging Face Blog30

    用 3C3H 重新思考 LLM 评测:AraGen 基准与排行榜

    Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。

11月20日周三
  1. Hugging Face Blog42

    让大模型辩论:首届多语言 LLM 辩论竞赛

    BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。

11月19日周二
10月30日周三
10月23日周三
10月10日周四
10月4日周五
  1. Hugging Face Blog28

    Hugging Face 推出 Open FinLLM Leaderboard 金融大模型评测榜单

    Hugging Face 推出 Open FinLLM Leaderboard,一个专为金融领域设计的大模型评测榜单,填补通用 NLP 基准难以评估金融任务的空白。榜单覆盖信息提取、文本分析、问答、文本生成、预测、风险管理和决策七大类任务,采用 Accuracy、F1、ROUGE、MCC 等指标。评测采用 zero-shot 方式,测试模型在未见过的金融任务上的泛化能力。

10月1日周二
  1. Hugging Face Blog34

    BenCzechMark:评测你的 LLM 能否理解捷克语

    Hugging Face 推出 BenCzechMark,这是首个也是目前最全面的捷克语大语言模型评测套件,包含覆盖 9 个类别的 50 个任务,其中 90% 为原生非翻译内容,涵盖阅读理解、事实知识、语法、语言建模、数学推理等维度。评测同时配套上线 BenCzechMark 排行榜,收录了超过 25 个不同规模的开源模型,并使用 Acc、EM、AUROC 和词级 Ppl 四类指标进行评分。

8月13日周二
6月18日周二
6月6日周四
5月14日周二
5月5日周日
5月3日周五
4月30日周二
4月23日周二
  1. Hugging Face Blog38

    Hugging Face 推出 Open CoT Leaderboard 链式推理排行榜

    Hugging Face 推出 Open CoT Leaderboard,追踪 LLM 生成有效链式推理的能力。榜单不评绝对准确率,而是计算有无 CoT 提示的准确率差值 Δ,以检验 CoT 对准确率的实际影响,并对训练数据污染更稳健。评测采用 LogiQA 和 LSAT 数据集(多数属于 AGIEval),任务以选择题形式呈现,目前已实现 Classic 和 Reflect 两种提示策略。

4月19日周五
4月16日周二
3月5日周二
2月27日周二
2月20日周二
2月2日周五
1月31日周三
1月29日周一
1月26日周五