OpenAI 发布 deep research 系统卡:安全评估与风险缓解措施概览
OpenAI 在发布 deep research 前公布系统卡,说明相关安全工作。内容包括外部红队测试、依据 Preparedness Framework 开展的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
OpenAI 在发布 deep research 前公布系统卡,说明相关安全工作。内容包括外部红队测试、依据 Preparedness Framework 开展的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。
OpenAI 封禁了在加纳 2024 年总统大选期间滥用 AI 的账号。这些账号利用 AI 生成文章、帖子和虚假互动,开展隐蔽的影响力操作。
OpenAI 封禁了一批疑似来自中国的账号,这些账号利用 AI 生成英文社交媒体帖子和西班牙语文章,从事影响活动。
OpenAI 发起 "Peer Review" 行动,封禁了疑似源自中国、利用 AI 起草监控工具推介材料、分析文档和调试代码的账号。该通报由 OpenAI 官方发布,属于对其平台恶意使用行为的处置披露。
OpenAI 封禁了可能与公开报道的朝鲜(DPRK)关联威胁行为体有关的账号,这些账号曾利用 AI 研究入侵工具、网络钓鱼、恶意软件和加密货币攻击目标。
OpenAI 封禁了疑似被用于实施欺骗性就业计划的账号,该计划具有此前公开报道的与朝鲜关联的 IT 工人活动的特征。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号使用 AI 翻译并生成婚恋诱导投资骗局(romance baiting/杀猪盘)的对话。
OpenAI 封禁了一批与伊朗关联、利用 AI 生成文章和社交媒体帖子的账号。这些账号的活动与 IUVM 及 STORM-2035 影响力行动有关,且横跨多个平台。
OpenAI 封禁了疑似源自柬埔寨的账号,这些账号利用 AI 翻译消息,实施要求受害者支付费用的假刷评工作诈骗。
OpenAI 发布 o3-mini 系统卡,说明围绕该模型开展的安全工作,包括安全评估、外部红队测试以及 Preparedness Framework 评估。
OpenAI 发布 Operator 的 System Card,说明基于既有安全框架的多层防护方法。文档涵盖针对提示词注入和越狱的模型与产品层缓解措施、隐私与安全保护,以及外部红队测试、安全评估和后续持续完善安全措施的工作。
OpenAI 发布研究,探讨通过增加推理时计算来提升模型对抗鲁棒性的方法。研究分析了更多推理计算与对抗攻击防御之间的关系。
Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。
OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。
推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。
OpenAI 发文回应 Elon Musk 最新的法律文件,指出这是他在不到一年内第四次重新包装诉讼主张。OpenAI 称,Musk 在 2017 年不仅希望、而且实际创建了一个营利性架构,作为 OpenAI 当时拟采用的新组织结构。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前完成的安全工作。内容涵盖外部红队测试,以及依据 Preparedness Framework 开展的前沿风险评估。
推荐理由:这是 OpenAI 官方对 o1 系列发布前安全工作的系统说明,涵盖外部红队测试和前沿风险评估框架的具体执行。
OpenAI 发布了关于结合人员与 AI 推进红队测试的内容,介绍了将人工与 AI 方法结合用于红队测试的方向。
Mistral AI 发布内容审核 API,与 Le Chat 的审核服务使用同一 API。该模型是基于 LLM 的分类器,可将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,原生支持阿拉伯语、中文、英语、法语等 11 种语言。API 可帮助用户针对具体应用场景定制安全标准,政策类别涵盖不合格建议和 PII 等模型生成危害。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 集成为第三方扫描器,自动扫描所有公开模型仓库。Guardian 可捕获 pickle 序列化和 Keras Lambda 层等格式中的任意代码执行漏洞,扫描结果已在新版前端展示,示例见 mcpotato/42-eicar-street;目前因超过 100 万模型仓库,部分模型可能暂未显示扫描结果。
OpenAI 发布了对 ChatGPT 公平性的评估,分析其如何根据用户姓名作出不同回应。为保护隐私,OpenAI 使用 AI 研究助手开展这项分析,避免使用真人数据。
Hugging Face 委托 Trail of Bits 对 Gradio 5 进行独立安全审计,发现的漏洞已在 Gradio 5.0 发布前全部修复,完整报告已公开。
OpenAI 封禁了一批使用 AI 批量生成评论、批评某俄罗斯反腐基金会及相关人物的账号。
OpenAI 封禁了 A2Z 行动相关账号,这些账号利用 AI 生成涉及选举、乌克兰和政治议题的多语言影响内容,并在多个平台传播。
OpenAI 封禁了与伊朗关联的 STORM-0817 账号。这些账号曾使用 AI 调试 Android 恶意软件、抓取社交平台数据,并翻译相关工具。
OpenAI 封禁了疑似属于被追踪为 SweetSpecter 的中国背景威胁行为者的账号,该组织利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼活动。
OpenAI 封禁了多个源自卢旺达的账户,这些账户在大选前利用 AI 批量生成带有党派倾向的评论内容。此举是 OpenAI 打击选举相关政治操纵行为的措施之一。
OpenAI 封禁了与伊朗相关的 STORM-2035 账号,这些账号利用 AI 生成针对美国和英国选举的内容,并跨多个网站发布。
OpenAI 封禁了疑似属于 CyberAv3ngers 的账号,该组织涉嫌利用 AI 研究工业控制系统、默认凭据及攻击目标。CyberAv3ngers 是与伊朗关联的网络研究活动主体。
OpenAI 封禁了一个疑似源自美国、使用 AI 伪造 ChatGPT 报错信息的账号,该报错误称检测到“俄罗斯巨魔”活动。
OpenAI 封禁了一批利用 AI 起草辱骂性举报和投诉的账号,这些举报针对越南公众人物和平台。
OpenAI 封禁了一批账号,这些账号通过一家以色列初创公司访问其模型,批量生成对话并在 X 上发送赌博网站链接。OpenAI 表示此举旨在打击滥用其模型的垃圾信息网络。
OpenAI 封禁了源自俄罗斯的 Stop News 行动相关账号,这些账号使用 AI 生成多语言文章和帖子,针对乌克兰和西方国家开展影响力活动。
OpenAI 升级 Moderation API,推出一款基于 GPT-4o 构建的新多模态审核模型,能更准确地检测有害文本和图像。该模型面向开发者开放,用于构建更稳健的内容审核系统。
OpenAI 发布了关于其安全与安保实践的更新说明,介绍相关安全措施的最新进展。该更新来自 OpenAI 官方新闻渠道,面向关注其模型安全实践的用户与研究者。
Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描集成到平台。
OpenAI 宣布破坏一个隐蔽的伊朗影响力行动,本次抓取仅标题可用,正文细节缺失。
Zico Kolter 加入 OpenAI 董事会,并将加入安全与安保委员会(Safety & Security Committee)。此举旨在以 AI 安全与对齐领域的专业能力强化 OpenAI 的治理。
Hugging Face 盘点截至 2024 年 8 月 6 日 Hub 上的主要安全功能。所有用户可用细粒度 token、双因素认证(2FA)、GPG commit signing、组织级访问控制,以及自动安全扫描流水线(ClamAV 恶意软件扫描、picklescan 扫描 pickle 文件、trufflehog 扫描密钥)。
Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。
推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。
OpenAI 开发并应用了一种基于规则的奖励(Rule-Based Rewards,RBRs)新方法,用于对齐模型的安全行为,无需大量人工数据收集。该方法已在 OpenAI 的模型上落地应用。