跳到正文
原文
Hugging Face Blog·· 2023-02-24AI 评分40

Hugging Face 解析大语言模型红队测试

Red-Teaming Large Language Models

AI 导读

红队测试是一种激发 LLM 漏洞、诱导其生成有害内容的评估方法,与自然语言提示形式的越狱(jailbreaking)同义,区别于人类不可读的对抗性攻击。文中以 GPT3 的性别歧视与偏见输出、Tay 和 Sydney 聊天机器人事故为例,并提到可用 GeDi、PPLM 引导 GPT3 生成,对经 RLHF 或 SFT 安全微调的模型则需角色扮演等攻击手段。

来源:Hugging Face Blog · huggingface.co