Hugging Face Blog·· 2026-09-02AI 评分43
Hugging Face 发布 BenchMIRT:审计 LLM 基准实际测的是什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。
来源:Hugging Face Blog · huggingface.co