跳到正文
原文
Hugging Face Blog·· 2024-03-05AI 评分38

UCLA 团队推出 ConTextual 基准:评估多模态模型在富文本图像场景中的联合推理能力

Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?

AI 导读

UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。

来源:Hugging Face Blog · huggingface.co