跳到正文
原文
Hugging Face Blog·· 2026-04-15AI 评分48

VAKRA 解析:AI 智能体的推理、工具使用与失败模式

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

AI 导读

Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。

来源:Hugging Face Blog · huggingface.co