跳到正文

#安全/对齐

今日 0 条
10月1日周四
9月29日周二
  1. Simon Willison25

    OpenAI Agent 安全负责人 @joedaroo 谈 AI 能力突跳对组织安全准备的挑战

    OpenAI 从事 Agent 安全工作的 @joedaroo 表示,模型在“cyber”、"swarming"、“message boards”等能力上的跳升速度之快出乎意料,而安全态势的建立需要时间,必须融入公司文化。他呼吁各组织反思:人员、系统和流程是否能应对 AI 能力的突然跳升,是否具备相应的事件响应与沟通机制。

9月23日周三
9月22日周二
  1. MIT Technology Review · AI49

    别被这个夏天的 AI 炒作迷惑

    MIT Technology Review 评论文章指出,今年夏天 Anthropic 与 OpenAI 的一系列“突破”宣传——包括 Claude Mythos 漏洞挖掘能力、OpenAI 模型 Astra 的数学成果以及黑客入侵事件——在专家审视后大多名不副实:安全专家认为黑客事件源于 OpenAI 忽视基本安全实践,数学家则指控 OpenAI 抄袭和不当署名。

9月21日周一
  1. NVIDIA Blog47

    NVIDIA:AI 安全是一个工程问题——如何在 Agent 技术栈的每一层解决它

    NVIDIA 提出 AI 安全应作为工程问题来对待,需要明确的防护要求、可执行的控制措施、指定负责人和防护有效的证据。安全防护应覆盖模型、harness 和运行环境的完整 Agent 技术栈,NVIDIA 开源的 OpenShell 提供了在 Agent 之外执行策略的沙箱运行时,Cisco 的 DefenseClaw 和 JFrog 在其上构建治理与技能扫描能力。

  2. Import AI47

    Import AI 473:美国的超级智能战略;鼠颅中的人脑组织;机器诠释学

    RAND 发布长篇报告,认为美国在通往超级智能的不确定路径上应采取"行动自由"(Freedom of Action)策略,先花钱保留选择权。报告归纳出共存、拒止、加速三大类七种原型战略,并提出危险临近度、共存可行性等五项关键不确定性。作者评论认为美国当前实际执行的主要是"加速"路线。

8月31日周一
6月8日周一
6月1日周一
5月26日周二
5月11日周一
4月28日周二
4月21日周二
  1. Hugging Face Blog60

    Hugging Face 谈 AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。

    推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。

3月25日周三
8月26日周二
6月18日周三
5月2日周五
3月26日周三
1月13日周一
  1. Hugging Face Blog46

    AI 智能体已经到来,下一步怎么办?

    Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。

1月8日周一
9月29日周五
6月26日周一
5月22日周一
3月30日周四
  1. Hugging Face Blog28

    Hugging Face 伦理与社会通讯 #3:Hugging Face 的伦理开放之道

    Hugging Face 阐述其在开放机器学习中的伦理实践:通过逐案分析风险、识别高风险模型,在开放开发与风险控制之间寻求平衡。平台已推出 flagging 举报功能、模型卡文档、“Not For All Audiences” 标签,并推广 RAIL 开放责任许可(如 BLOOM、BigCode),同时基于社区 Spaces 总结出 6 个伦理分类标签。

3月2日周四
2月24日周五
2月16日周四
12月15日周四
  1. Hugging Face Blog45

    聊聊机器学习中的偏见:Hugging Face 伦理与社会通讯 #2

    Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。

9月22日周四
8月31日周三
8月24日周三
  1. OpenAI News45

    OpenAI 的对齐研究方法

    OpenAI 正在改进其 AI 系统从人类反馈中学习以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,用它来帮助解决其他所有对齐问题。

6月2日周四
5月19日周四
  1. Hugging Face Blog19

    Hugging Face 多模态项目将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习小组发布了一份伦理章程,将伦理原则作为机器学习研究生命周期的核心,并由伦理落地、数据治理与个人隐私领域专家参与撰写。章程明确了希望防止的滥用场景,包括生成可识别个人身份的信息、针对性别的偏见、在医疗和法律等高风险领域的鲁莽使用等。团队同时承诺保持透明、开放可复现、公平和自我批判,并承认部分价值观之间可能存在冲突,需逐案权衡风险与收益。

3月23日周三
2月24日周五