如何用 OpenAI Privacy Filter 构建可扩展的 Web 应用
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
OpenAI 发布 Privacy Filter,一个开放权重(open-weight)模型,用于检测并脱敏文本中的个人身份信息(PII),准确率达到当前最先进水平。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
多家领先安全公司和企业在 OpenAI 的 Trusted Access for Cyber 计划中加入合作,使用 GPT-5.4-Cyber 强化全球网络防御。OpenAI 同时提供 1000 万美元 API 资助($10M in API grants)支持该生态建设。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的网络安全防御者提供 GPT-5.4-Cyber。随着 AI 网络安全能力提升,OpenAI 同步加强了安全保障措施。
OpenAI 发布 AI 负责任使用指南,围绕使用 ChatGPT 等工具时的安全性、准确性与透明度给出最佳实践。
OpenAI 就 Axios 供应链攻击作出回应,轮换了 macOS 代码签名证书并更新相关应用。OpenAI 确认没有用户数据被泄露。
推荐理由:OpenAI 官方回应 Axios 供应链攻击,说明证书轮换和应用更新的处置措施,并确认用户数据未受影响。
OpenAI 推出儿童安全蓝图(Child Safety Blueprint),为负责任地构建 AI 提供路线图。该蓝图涵盖安全防护措施、适龄设计,以及协作机制,旨在保护并赋能网络上的青少年。
OpenAI 宣布推出 Safety Fellowship 试点项目,支持独立的安全与对齐研究。该项目旨在培养下一代 AI 安全领域人才。
Google Research 发布评估 LLM 行为倾向对齐的研究,基于 IRI、ERQ 等标准化心理问卷生成情境判断测试(SJT),在职业沉着、冲突解决、订旅行等现实场景中比较模型与 550 名参与者的人类偏好分布。
Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。
推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。
OpenAI 介绍其 Model Spec 作为模型行为的公开框架,在安全、用户自由和问责之间取得平衡,以应对 AI 系统的持续演进。Model Spec 界定了模型应如何表现,是 OpenAI 规范模型行为的核心公开文档。
OpenAI 推出安全漏洞赏金计划(Safety Bug Bounty),征集 AI 滥用与安全风险线索。覆盖范围包括智能体漏洞、提示词注入和数据外泄。
OpenAI 发布了一套基于提示词的青少年安全策略,供开发者在 gpt-oss-safeguard 中使用,帮助审核 AI 系统中的年龄特定风险。该策略面向开发者,用于构建更安全的青少年 AI 体验。
OpenAI 表示,Sora 2 视频模型和 Sora 社交创作应用在开发之初就以安全为基础设计,以应对最先进视频模型和全新社交创作平台带来的新型安全挑战。其安全方案依托具体、明确的保护措施构建。
OpenAI 使用链式思维(chain-of-thought)监控方法,研究内部编码智能体的对齐偏差问题。该方法通过分析真实部署中的智能体行为来检测潜在风险,并据此强化 AI 安全保障措施。
OpenAI Japan 发布 Japan Teen Safety Blueprint,为使用生成式 AI 的青少年引入更强的年龄保护、家长控制和身心健康保障措施。该方案明确将青少年安全放在首位。
OpenAI 的 Codex Security 不依赖传统 SAST 报告,而是通过 AI 驱动的约束推理和验证来发现真实漏洞,从而减少误报。
Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。
ChatGPT 通过约束智能体工作流中的高风险操作、保护敏感数据,来防御提示词注入和社工攻击。文章说明了 OpenAI 在 AI 智能体安全设计上的具体做法,帮助降低智能体被恶意指令利用的风险。
OpenAI 的 IH-Challenge 训练模型优先遵循可信指令,以改进前沿 LLM 的指令层级。该方法同时提升了安全可操纵性,并增强了对提示词注入攻击的抵抗力。
OpenAI 宣布收购 Promptfoo,该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。材料为官方简讯,仅提供收购事实,未披露交易金额或后续整合安排。
OpenAI 推出 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修复复杂漏洞,从而提供更高的置信度和更少的噪音。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 官方发布与美国战争部合同的说明,内容涵盖安全红线、法律保护,以及 AI 系统在涉密环境中的部署方式。
OpenAI 公布心理健康安全工作的多项更新,包括家长控制、可信联系人功能以及改进的心理困扰检测能力。公司同时提及近期相关诉讼的进展情况。
OpenAI 发布最新威胁报告,分析恶意行为者如何将 AI 模型与网站和社交平台结合实施攻击。报告还探讨了这对检测与防御工作的影响。
OpenAI 向 The Alignment Project 承诺出资 750 万美元,用于资助独立的 AI 对齐研究。该举措旨在加强全球范围内应对 AGI 安全风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 风险标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
OpenAI 介绍了其 AI 本地化方法,说明全球共享的前沿模型如何在不牺牲安全性的前提下适配当地语言、法律和文化。
OpenAI 推出 Trusted Access for Cyber,这是一个基于信任的框架,在扩展前沿网络安全能力访问的同时,强化防止滥用的安全防护措施。
OpenAI 封禁了一个与中国执法人员相关联的个人账号,该账号利用 AI 策划影响力活动、骚扰行为和网络行动。封禁针对的是这一与其活动相关的账号。
OpenAI 封禁了疑似源自中国的账号,这些账号使用其 AI 调查美国人员、地点及社会工程学攻击战术。OpenAI 将此事称为“银色 lining playbook”的一部分,并披露了相关威胁情报活动。
OpenAI 封禁了很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友人群进行诈骗外联,包括翻译和互动环节。
OpenAI 封禁了与一个此前未被报道、疑似源自俄罗斯的行动相关的账号,OpenAI 将其命名为 "No Bell"。该行动使用 AI 生成针对美国及其盟友的批评内容,面向非洲多地受众。
OpenAI 封禁了与一个此前未披露、代号“Trolling Stone”的行动相关的账号,该行动利用 AI 生成有关一名俄罗斯教派领袖在阿根廷被捕的评论内容。OpenAI 将这一行动与俄罗斯关联的影响力活动联系起来。
OpenAI 封禁了一批极可能源自柬埔寨的账号,这些账号利用 AI 冒充追损服务、律所和官方机构,专门针对曾遭受诈骗的人群实施二次欺诈。OpenAI 将此次行动命名为“伪证人”(False Witness)。
OpenAI 封禁了利用 AI 支撑婚恋诈骗工作流的账号。这些账号将 AI 用于触达潜在受害者、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了与 Rybar 网络相关的一批账号,这些账号可能源自俄罗斯,利用 AI 在多个网站和社交平台开展多语言影响力活动。此举旨在遏制借助生成式 AI 进行的内容农场式传播。