跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分47

HELMET 发布:全面评测长上下文语言模型

Introducing HELMET: Holistically Evaluating Long-context Language Models

AI 导读

Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。

来源:Hugging Face Blog · huggingface.co