跳到正文

#安全/对齐

今日 0 条
2月1日周日
1月28日周三
1月20日周二
12月23日周二
12月22日周一
12月18日周四
12月16日周二
12月11日周四
  1. Google DeepMind39

    Google DeepMind 深化与英国 AI Security Institute 的合作

    Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。

  2. Google Research36

    Google 发布 Urania:面向 AI 聊天机器人使用洞察的差分隐私框架

    Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。

12月10日周三
12月3日周三
12月1日周一
11月19日周三
11月13日周四
11月12日周三
  1. Google Research51

    Google 发布 JAX-Privacy 1.0,简化大规模差分隐私训练

    Google 发布 JAX-Privacy 1.0,一套构建和审计差分隐私(DP)模型的开源工具包,提供 DP-SGD、DP-FTRL、DP 矩阵分解等算法和基于 JAX 的原生并行扩展能力。库内含 per-example 梯度裁剪、噪声注入、微批处理等组件,并附 Keras 下微调 Gemma 系列模型的完整示例,此前曾用于训练 VaultGemma。

11月7日周五
11月6日周四
10月30日周四
10月29日周三
  1. OpenAI News63

    OpenAI 发布 gpt-oss-safeguard-120b 与 gpt-oss-safeguard-20b 开放权重模型及技术报告

    OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。

    推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。

10月28日周二
  1. Hugging Face Blog58

    Hugging Face 提出语音同意门机制,让语音克隆须先获得说话人同意

    Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。

10月27日周一
10月22日周三
  1. Hugging Face Blog48

    Hugging Face 与 VirusTotal 合作加强 AI 安全

    Hugging Face 与威胁情报平台 VirusTotal 合作,对 Hub 上 220 万个以上的公开模型和数据集仓库进行持续安全扫描。访问仓库或文件页面时会自动比对文件哈希与 VirusTotal 威胁情报数据库,返回检测结果和威胁情报元数据,且不共享文件原始内容以保护隐私。用户可在下载前查看文件是否被标记,企业也能将检测集成到 CI/CD 流程中。

10月14日周二
10月9日周四
10月7日周二
10月1日周三