跳到正文
原文
Hugging Face Blog·· 2025-02-14精选AI 评分63

Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

Fixing Open LLM Leaderboard with Math-Verify

AI 导读

Hugging Face 用 Math-Verify 重新评测了 Open LLM Leaderboard 上全部 3751 个模型,修复旧评测器的格式、SymPy 解析和比较缺陷。模型平均多解对 61 题、整体提升 4.66 分,Qwen 分数翻倍以上、DeepSeek 接近三倍,MATH-Hard 榜首被 Nvidia AceMath 占据。

推荐理由

原文给出了旧评测器三类具体缺陷与修复后的排名变化,读者可以借此判断自己模型的数学评测结果是否被低估。

来源:Hugging Face Blog · huggingface.co