Hugging Face Blog·· 2024-11-20AI 评分42
让大模型辩论:首届多语言 LLM 辩论竞赛
Letting Large Models Debate: The First Multilingual LLM Debate Competition
AI 导读
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
来源:Hugging Face Blog · huggingface.co