OpenAI News·· 2024-04-20精选AI 评分62
OpenAI 提出指令分层:训练 LLM 优先处理特权指令
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
AI 导读
OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。
推荐理由
原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。
来源:OpenAI News · openai.com