跳到正文

#安全/对齐

今日 3 条
7月17日周三
7月10日周三
  1. Hugging Face Blog41

    Hugging Face 在 Dataset Hub 上试验基于 Presidio 的 PII 自动检测

    Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。

6月27日周四
6月20日周四
6月13日周四
  1. OpenAI News67

    OpenAI 任命美国陆军退役上将 Paul M. Nakasone 进入董事会

    OpenAI 宣布任命美国陆军退役上将 Paul M. Nakasone 进入董事会,其将为不断扩大的董事会带来网络安全经验,并将加入董事会的安全与保障委员会。

    推荐理由:官方宣布美国陆军退役上将 Paul M. Nakasone 加入董事会并进入安全与保障委员会,读者可据此关注其网络安全背景对公司安全方向的影响。

5月31日周五
  1. Hugging Face Blog62

    Hugging Face 通报 Spaces 平台密钥未授权访问事件并启动整改

    Hugging Face 通报其 Spaces 平台遭未授权访问,部分 Spaces 秘钥可能被读取,官方已撤销相关 HF token 并邮件通知受影响用户。官方建议用户刷新密钥或改用细粒度访问 token,已移除 org token、为 Spaces 秘钥部署 KMS,并计划在功能对齐后弃用经典读写 token,同时已报警并向数据保护机构报告。

    推荐理由:官方通报了 Spaces 秘钥未授权访问事件、已撤销的 token 范围和 KMS 等整改措施,受影响用户可据此排查自身密钥。

5月30日周四
5月24日周五
  1. Hugging Face Blog44

    CyberSecEval 2:Meta 推出的大语言模型网络安全风险与能力综合评测框架

    Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。

5月21日周二
5月8日周三
5月7日周二
5月1日周三
4月20日周六
  1. OpenAI News62

    OpenAI 提出指令分层:训练 LLM 优先处理特权指令

    OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。

    推荐理由:原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。

4月4日周四
3月21日周四
2月26日周一
  1. Hugging Face Blog56

    Hugging Face 讲解 AI 水印技术:工具与方法入门

    Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。

2月14日周三
2月1日周四
  1. Hugging Face Blog64

    Hugging Face 发布开源模型 Constitutional AI 完整配方及 llm-swarm 工具

    Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。

    推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。

1月31日周三
1月26日周五
1月16日周二
1月15日周一
1月8日周一
12月14日周四
10月26日周四
10月25日周三
9月29日周五
9月19日周二
8月15日周二
  1. OpenAI News65

    OpenAI 介绍如何用 GPT-4 辅助内容审核

    OpenAI 发布文章说明其使用 GPT-4 进行内容政策制定和内容审核决策。文章指出这一做法带来更一致的标注、更快的政策修订反馈循环,并减少人工审核员的参与。

    推荐理由:OpenAI 官方说明用 GPT-4 做内容审核的具体做法,展示了加快政策迭代与降低人工审核量的可借鉴路径。

7月26日周三
7月21日周五
6月26日周一
6月15日周四