跳到正文
原文
Hugging Face Blog·· 2026-06-18AI 评分52

Hugging Face 发布 agent-eval:用自建基准评测开源模型对 transformers 的智能体使用

Is it agentic enough? Benchmarking open models on your own tooling

AI 导读

Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。

来源:Hugging Face Blog · huggingface.co