跳到正文

#安全/对齐

今日 3 条
4月28日周二
4月27日周一
4月21日周二
  1. Hugging Face Blog60

    Hugging Face 谈 AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。

    推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。

4月14日周二
4月3日周五
3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布衡量 AI 有害操纵的实证评估工具包

    Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。

    推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。

3月25日周三
3月19日周四
3月16日周一
3月13日周五
  1. Berkeley AI Research47

    SPEX 与 ProxySPEX:如何大规模识别 LLM 的关键交互

    Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。

3月9日周一
3月5日周四
2月27日周五
2月25日周三
2月19日周四
2月18日周三
2月13日周五
2月6日周五
2月5日周四
2月1日周日
1月28日周三
1月20日周二
12月23日周二
12月22日周一
12月18日周四
12月16日周二
12月11日周四
  1. Google DeepMind39

    Google DeepMind 深化与英国 AI Security Institute 的合作

    Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。

  2. Google Research36

    Google 发布 Urania:面向 AI 聊天机器人使用洞察的差分隐私框架

    Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。

12月10日周三