Hugging Face Blog·· 2024-02-02AI 评分36
NPHardEval 排行榜上线:用复杂度类与动态更新测大语言模型推理能力
NPHardEval Leaderboard: Unveiling the Reasoning Abilities of Large Language Models through Complexity Classes and Dynamic Updates
AI 导读
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
来源:Hugging Face Blog · huggingface.co