Hugging Face Blog·· 2023-06-12AI 评分59
Hugging Face 实验:GPT-4 能否像人类标注员那样为模型输出打分
Can foundation models label data like humans?
AI 导读
Hugging Face 扩展 Open LLM Leaderboard,用 Scale AI 人类标注与 GPT-4 对 Koala-13B、Vicuna-13B、OpenAssistant-12b、Dolly-12b 在 327 条提示的盲测集上做偏好对比,并构建带误差估计的 Elo 排名。
来源:Hugging Face Blog · huggingface.co