OpenAI 推出 EMEA 青少年与心理健康资助计划
OpenAI 推出 EMEA Youth & Wellbeing Grant,一项总额 50 万欧元的资助计划,面向在 AI 时代推进青少年安全与福祉的 NGO 和研究人员。
OpenAI 推出 EMEA Youth & Wellbeing Grant,一项总额 50 万欧元的资助计划,面向在 AI 时代推进青少年安全与福祉的 NGO 和研究人员。
OpenAI 说明了其内置防护机制如何在 AI 智能体打开链接时保护用户数据,防范基于 URL 的数据外泄与提示词注入攻击。
OpenAI 正在 ChatGPT 中推出年龄预测,用于估计账户用户是否年满 18 岁。系统会对疑似未成年用户施加青少年保护措施,并随时间推移持续提升预测准确率。
ServiceNow AI 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险以及提示注入、越狱、记忆投毒等对抗攻击,并支持独立提示、多轮对话和含工具调用与推理轨迹的 agentic 工作流输入。
OpenAI 正利用基于强化学习训练的自动化红队持续加固 ChatGPT Atlas,对抗提示词注入攻击。这种主动的"发现—修补"循环可提前识别新型攻击手法,随着 AI 越来越智能体化,不断强化该浏览器智能体的防御能力。
OpenAI 更新其 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应如何基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险场景下的预期行为,是其改善 ChatGPT 青少年安全工作的延续。
OpenAI 发布新的 AI 素养资源,帮助青少年和家长审慎、安全、有信心地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持遇到情绪化或敏感话题的青少年。
Google DeepMind 发布开源可解释性工具套件 Gemma Scope 2,覆盖 Gemma 3 从 270M 到 27B 的全部模型尺寸,结合稀疏自编码器(SAE)与 transcoder 分析模型内部行为。
OpenAI 推出一个真实世界评测框架,衡量 AI 能否加速湿实验室中的生物研究。团队用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的潜力与风险。
Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。
OpenAI 发布 GPT-5 系统卡更新,介绍 GPT-5 系列最新模型 GPT-5.2。该模型的安全缓解方案与 GPT-5 及 GPT-5.1 系统卡所述基本一致。训练数据涵盖公开互联网信息、第三方合作数据以及用户和人类训练员提供或生成的信息。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
OpenAI 表示,随着 AI 模型在网络安全领域的能力增强,公司正在投入更强的防护与防御能力。其做法包括评估风险、限制滥用,并与安全社区合作以增强网络韧性。
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
OpenAI 宣布提供最高 200 万美元资助,支持 AI 与心理健康交叉领域的研究。该计划资助研究 AI 在真实世界中的风险、收益与应用的项目,以改善安全性和身心健康。
OpenAI 与独立专家合作评估前沿 AI 系统。第三方测试可强化安全、验证安全防护措施,并提升其评估模型能力与风险的透明度。
OpenAI 发布 GPT-5.1-CodexMax 系统卡,介绍其配套安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练;产品层面包括 agent 沙箱和可配置的网络访问权限。
OpenAI 正在探索机制可解释性,以理解神经网络的推理方式。其新的稀疏模型方法有望让 AI 系统更透明,支持更安全、更可靠的行为。
Google 发布 JAX-Privacy 1.0,一套构建和审计差分隐私(DP)模型的开源工具包,提供 DP-SGD、DP-FTRL、DP 矩阵分解等算法和基于 JAX 的原生并行扩展能力。库内含 per-example 梯度裁剪、噪声注入、微批处理等组件,并附 Keras 下微调 Gemma 系列模型的完整示例,此前曾用于训练 VaultGemma。
OpenAI 正在抵制《纽约时报》索取 2000 万条私密 ChatGPT 对话的要求,并加速推出新的安全与隐私保护措施来保护用户数据。此举旨在防止用户私人对话被用于诉讼,强化数据隐私保障。
OpenAI 发布 GPT-5 系统卡附录,更新 GPT-5.1 Instant 与 GPT-5.1 Thinking 的安全指标。附录新增了针对心理健康和情感依赖的评估。
提示词注入是 AI 系统面临的前沿安全挑战。OpenAI 介绍了这类攻击的运作方式,并说明其如何通过推进相关研究、训练模型和构建安全防护来保护用户。
OpenAI 推出青少年安全蓝图,为负责任地构建 AI 提供路线图。该方案涵盖安全防护措施、适龄设计以及多方协作,旨在保护并赋能线上青少年群体。
OpenAI 推出 Aardvark,一个能自主发现、验证并协助修复软件漏洞的 AI 安全研究员。该系统目前处于 private beta 阶段,用户可报名参加早期测试。
OpenAI 发布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型,由 gpt-oss 模型后训练而来,可根据给定策略推理并对内容进行标注。技术报告描述了其能力,并以底层 gpt-oss 模型为基线提供了安全评估结果。
推荐理由:原文给出两个安全审核模型的训练思路和基线安全评估来源,读者可以据此了解其按策略标注内容的能力定位。
OpenAI 发布 gpt-oss-safeguard,是用于安全分类的开源权重推理模型。开发者可以在其上应用并迭代自定义安全策略。
推荐理由:原文说明这是面向安全分类的开源权重推理模型,开发者可自定义安全策略并迭代,适合关注安全工程的人参考。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别心理困扰、做出共情回应并引导用户寻求现实支持的能力。此举将不安全回应减少最多 80%。
OpenAI 发布 GPT-5 系统卡附录,说明 GPT-5 在敏感对话处理上的改进。新增针对情感依赖、心理健康和越狱抵抗力的基准。
Hugging Face 与威胁情报平台 VirusTotal 合作,对 Hub 上 220 万个以上的公开模型和数据集仓库进行持续安全扫描。访问仓库或文件页面时会自动比对文件哈希与 VirusTotal 威胁情报数据库,返回检测结果和威胁情报元数据,且不共享文件原始内容以保护隐私。用户可在下载前查看文件是否被标记,企业也能将检测集成到 CI/CD 流程中。
OpenAI 成立 Well-Being and AI 专家委员会,汇集心理学家、临床医生和研究人员,指导 ChatGPT 如何支持情绪健康,尤其是青少年群体。其见解将帮助塑造更安全、更有关怀的 AI 体验。
OpenAI 介绍了其评估 ChatGPT 政治偏见的新方法,采用贴近真实使用场景的测试来提升客观性、降低模型偏见。该方法聚焦于如何定义和衡量 LLM 的政治倾向,旨在改进评测的客观性。
OpenAI 发布 2025 年 10 月报告,介绍其如何检测并阻断对 AI 的恶意使用。报告涵盖相关滥用行为的处置、政策执行,以及保护用户免受现实世界伤害的措施。
OpenAI 封禁了多组违规账号,其活动与公开报道的威胁组织重叠,并呈现出与 PRC 情报需求一致的特征。这些账号利用 AI 支持网络钓鱼和脚本编写工作流。
OpenAI 封禁了一批与中国(PRC)关联的账号,这些账号使用 AI 支持监控相关规划、针对性画像,以及针对批评者和其他个人的调查。
OpenAI 封禁了与其命名为 “Stop News” 的俄罗斯来源影响行动相关的账号。该行动利用 AI 生成重复违规(recidivist)的影响内容,目标针对非洲和英国。
OpenAI 封禁了疑似与俄语犯罪组织关联的账号,这些账号利用 AI 开发恶意软件加载器、规避层、凭据窃取脚本及 C2 基础设施。
OpenAI 封禁了利用 AI 支持恶意软件开发的韩语账号,涉及调试、钓鱼及凭证窃取工作流。此举针对将模型用于网络攻击辅助的行为,显示平台对滥用行为的处置措施。
OpenAI 封禁了与网络诈骗团伙关联的账号。这些账号使用 AI 支持诈骗话术、身份冒充、翻译以及与受害者的互动。
OpenAI 封禁了与一个此前未被报告、被其命名为「Nine-emdash Line」的行动相关的账号。该行动源自 PRC,利用 AI 生成涉及南海、香港和美国政治的地区性影响内容。