Hugging Face Blog·· 2025-04-16AI 评分47
HELMET 发布:全面评测长上下文语言模型
Introducing HELMET: Holistically Evaluating Long-context Language Models
AI 导读
Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。
来源:Hugging Face Blog · huggingface.co