跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–3 条 · 共 3 条
6月18日周四
  1. Hugging Face Blog66

    Hugging Face 实测多款 PEFT 技术:LoRA 表现良好但未必是最佳选择

    Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。

    推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。

10月7日周二
  1. Hugging Face Blog68

    BigCode 发布 BigCodeArena:通过代码执行端到端评判代码生成模型

    BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。

    推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。

2月14日周五
  1. Hugging Face Blog63

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。

    推荐理由:原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。