OpenAI 阐述其在 ChatGPT 社区安全上的承诺
OpenAI 介绍了其保障 ChatGPT 社区安全的整体做法,涵盖模型安全防护、滥用检测、政策执行以及与安全专家的协作。该内容说明 OpenAI 如何通过多层面措施保护用户社区安全。
OpenAI 介绍了其保障 ChatGPT 社区安全的整体做法,涵盖模型安全防护、滥用检测、政策执行以及与安全专家的协作。该内容说明 OpenAI 如何通过多层面措施保护用户社区安全。
OpenAI 本周在 Hub 上开源发布 Privacy Filter,一个 PII 检测模型,1.5B 参数、50M 激活参数,Apache 2.0 许可,支持 128k 上下文单次前向识别 8 类个人信息,在 PII-Masking-300k 基准上达到 SOTA。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的网络安全防御者提供 GPT-5.4-Cyber。随着 AI 网络安全能力提升,OpenAI 同步加强了安全保障措施。
Google Research 发布评估 LLM 行为倾向对齐的研究,基于 IRI、ERQ 等标准化心理问卷生成情境判断测试(SJT),在职业沉着、冲突解决、订旅行等现实场景中比较模型与 550 名参与者的人类偏好分布。
Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。
推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。
OpenAI 介绍其 Model Spec 作为模型行为的公开框架,在安全、用户自由和问责之间取得平衡,以应对 AI 系统的持续演进。Model Spec 界定了模型应如何表现,是 OpenAI 规范模型行为的核心公开文档。
OpenAI 使用链式思维(chain-of-thought)监控方法,研究内部编码智能体的对齐偏差问题。该方法通过分析真实部署中的智能体行为来检测潜在风险,并据此强化 AI 安全保障措施。
OpenAI 的 Codex Security 不依赖传统 SAST 报告,而是通过 AI 驱动的约束推理和验证来发现真实漏洞,从而减少误报。
Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。
OpenAI 宣布收购 Promptfoo,该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。材料为官方简讯,仅提供收购事实,未披露交易金额或后续整合安排。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 公布心理健康安全工作的多项更新,包括家长控制、可信联系人功能以及改进的心理困扰检测能力。公司同时提及近期相关诉讼的进展情况。
OpenAI 发布最新威胁报告,分析恶意行为者如何将 AI 模型与网站和社交平台结合实施攻击。报告还探讨了这对检测与防御工作的影响。
OpenAI 向 The Alignment Project 承诺出资 750 万美元,用于资助独立的 AI 对齐研究。该举措旨在加强全球范围内应对 AGI 安全风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 风险标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
OpenAI 介绍了其 AI 本地化方法,说明全球共享的前沿模型如何在不牺牲安全性的前提下适配当地语言、法律和文化。
OpenAI 推出 Trusted Access for Cyber,这是一个基于信任的框架,在扩展前沿网络安全能力访问的同时,强化防止滥用的安全防护措施。
OpenAI 封禁了一个与中国执法人员相关联的个人账号,该账号利用 AI 策划影响力活动、骚扰行为和网络行动。封禁针对的是这一与其活动相关的账号。
OpenAI 封禁了疑似源自中国的账号,这些账号使用其 AI 调查美国人员、地点及社会工程学攻击战术。OpenAI 将此事称为“银色 lining playbook”的一部分,并披露了相关威胁情报活动。
OpenAI 封禁了很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友人群进行诈骗外联,包括翻译和互动环节。
OpenAI 封禁了与一个此前未被报道、疑似源自俄罗斯的行动相关的账号,OpenAI 将其命名为 "No Bell"。该行动使用 AI 生成针对美国及其盟友的批评内容,面向非洲多地受众。
OpenAI 封禁了与一个此前未披露、代号“Trolling Stone”的行动相关的账号,该行动利用 AI 生成有关一名俄罗斯教派领袖在阿根廷被捕的评论内容。OpenAI 将这一行动与俄罗斯关联的影响力活动联系起来。
OpenAI 封禁了一批极可能源自柬埔寨的账号,这些账号利用 AI 冒充追损服务、律所和官方机构,专门针对曾遭受诈骗的人群实施二次欺诈。OpenAI 将此次行动命名为“伪证人”(False Witness)。
OpenAI 封禁了利用 AI 支撑婚恋诈骗工作流的账号。这些账号将 AI 用于触达潜在受害者、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了与 Rybar 网络相关的一批账号,这些账号可能源自俄罗斯,利用 AI 在多个网站和社交平台开展多语言影响力活动。此举旨在遏制借助生成式 AI 进行的内容农场式传播。
OpenAI 推出 EMEA Youth & Wellbeing Grant,一项总额 50 万欧元的资助计划,面向在 AI 时代推进青少年安全与福祉的 NGO 和研究人员。
OpenAI 说明了其内置防护机制如何在 AI 智能体打开链接时保护用户数据,防范基于 URL 的数据外泄与提示词注入攻击。
OpenAI 正在 ChatGPT 中推出年龄预测,用于估计账户用户是否年满 18 岁。系统会对疑似未成年用户施加青少年保护措施,并随时间推移持续提升预测准确率。
ServiceNow AI 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险以及提示注入、越狱、记忆投毒等对抗攻击,并支持独立提示、多轮对话和含工具调用与推理轨迹的 agentic 工作流输入。
OpenAI 正利用基于强化学习训练的自动化红队持续加固 ChatGPT Atlas,对抗提示词注入攻击。这种主动的"发现—修补"循环可提前识别新型攻击手法,随着 AI 越来越智能体化,不断强化该浏览器智能体的防御能力。
OpenAI 更新其 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应如何基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险场景下的预期行为,是其改善 ChatGPT 青少年安全工作的延续。
OpenAI 发布新的 AI 素养资源,帮助青少年和家长审慎、安全、有信心地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持遇到情绪化或敏感话题的青少年。
Google DeepMind 发布开源可解释性工具套件 Gemma Scope 2,覆盖 Gemma 3 从 270M 到 27B 的全部模型尺寸,结合稀疏自编码器(SAE)与 transcoder 分析模型内部行为。
OpenAI 推出一个真实世界评测框架,衡量 AI 能否加速湿实验室中的生物研究。团队用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的潜力与风险。
Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。
OpenAI 发布 GPT-5 系统卡更新,介绍 GPT-5 系列最新模型 GPT-5.2。该模型的安全缓解方案与 GPT-5 及 GPT-5.1 系统卡所述基本一致。训练数据涵盖公开互联网信息、第三方合作数据以及用户和人类训练员提供或生成的信息。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
OpenAI 表示,随着 AI 模型在网络安全领域的能力增强,公司正在投入更强的防护与防御能力。其做法包括评估风险、限制滥用,并与安全社区合作以增强网络韧性。