OpenAI 网络安全资助计划
OpenAI 推出网络安全资助计划,通过赠款及其他支持,帮助防御者开发由 AI 驱动的网络安全能力。
OpenAI 推出网络安全资助计划,通过赠款及其他支持,帮助防御者开发由 AI 驱动的网络安全能力。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
OpenAI, Inc. 启动 Democratic inputs to AI 资助计划,将颁发十笔 100,000 美元 grant,资助建立民主程序、决定 AI 系统应遵循哪些规则的实验。这些实验需在法律界定范围内开展,目标是探索公众如何参与 AI 治理规则的制定。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库完成外部安全审计,报告全文公开。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题。文章将超级智能定义为能力远超 AGI 的未来 AI 系统,认为眼下是启动相关治理思考的合适时机。
Hugging Face 宣布入选法国数据保护机构 CNIL 的增强支持计划。该计划从 40 多家候选企业中选出 3 家具有经济发展潜力的公司,帮助其理解和落实数据保护义务。Hugging Face 曾在 BigScience 和与 ServiceNow 共同主持的 BigCode 项目中重视隐私保护,并计划借助 CNIL 的专业支持推动 GDPR 合规。
OpenAI 为 ChatGPT 推出新的数据管理方式,用户现在可以关闭聊天记录,并自行选择哪些对话可用于训练 OpenAI 的模型。
OpenAI 宣布推出 Bug Bounty 漏洞赏金计划,邀请外部人员帮助发现其技术与服务的安全漏洞。OpenAI 表示该举措是其开发安全、可靠、可信的先进 AI 承诺的重要一环。
OpenAI 阐述其 AI 安全方法,强调安全地构建、部署和使用 AI 系统对实现其使命至关重要。原文仅简要表态,未提及具体模型、版本或技术细节。
Hugging Face 阐述其在开放机器学习中的伦理实践:通过逐案分析风险、识别高风险模型,在开放开发与风险控制之间寻求平衡。平台已推出 flagging 举报功能、模型卡文档、“Not For All Audiences” 标签,并推广 RAIL 开放责任许可(如 BLOOM、BigCode),同时基于社区 Spaces 总结出 6 个伦理分类标签。
Hugging Face 为 Diffusers 库发布伦理框架,以透明、一致、简洁、可及、可复现、责任六项价值观指导维护者对社区贡献的技术决策。
OpenAI 发文阐述其对 AGI 及其后续发展的规划。OpenAI 的使命是确保通用人工智能——即普遍比人类更聪明的 AI 系统——造福全人类。
红队测试是一种激发 LLM 漏洞、诱导其生成有害内容的评估方法,与自然语言提示形式的越狱(jailbreaking)同义,区别于人类不可读的对抗性攻击。文中以 GPT3 的性别歧视与偏见输出、Tay 和 Sydney 聊天机器人事故为例,并提到可用 GeDi、PPLM 引导 GPT3 生成,对经 RLHF 或 SFT 安全微调的模型则需角色扮演等攻击手段。
OpenAI 澄清了 ChatGPT 行为的塑造方式,并公布改进计划,包括允许用户进行更多自定义,以及在相关决策中引入更多公众意见。
OpenAI 与 Georgetown University 安全与新兴技术中心、Stanford Internet Observatory 合作,研究大语言模型可能被滥用于虚假信息活动的风险。双方于 2021 年 10 月举办了一场汇聚 30 名虚假信息研究者、机器学习专家和政策分析师的工作坊,并在一年多研究基础上共同发布报告。报告概述了语言模型对信息环境的威胁,并提出分析缓解措施的框架。
Hugging Face 发布 Model Card Creator 工具、更新版模型卡模板及指南手册,让用户无需编程即可创建模型卡。本次发布还包括标注版模板、Hugging Face 内部用户研究,以及模型文档现状的文献综述。团队未来计划将 Evaluate on the Hub 等工具的自动评估结果导入模型卡工作流。
Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。
Hugging Face 在 🤗 Evaluate 库中新增偏见评估指标,用于探究 GPT-2、BLOOM 等因果语言模型(CLM)编码的社会偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词驱动模型生成,再用 Evaluate 的指标评估,涵盖毒性、语言极性、伤害性三类任务。示例中仅改变代词 he/she,GPT-2 补全的女性代词毒性比例为 0.333,男性为 0.0。
Hugging Face 的 Evaluation on the Hub 功能升级,任何 Hub 上的 causal language model 现在都能免代码进行零样本分类评估,由 AutoTrain 驱动且免费。
Hugging Face 推出 Ethics and Society Newsletter,由公司内跨团队的"Ethics and Society regulars"开放小组编写,计划每季度在春分、夏至、秋分、冬至发布。
Hugging Face 支持的 RAIL Initiative 推出 OpenRAIL(开放且负责任的 AI 许可证),旨在让 AI 模型在开放获取、使用和再分发的同时约束负责任使用。
OpenAI 正在改进其 AI 系统从人类反馈中学习以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,用它来帮助解决其他所有对齐问题。
OpenAI 推出全新升级的内容审核工具 Moderation endpoint,是对此前 content filter 的改进。该工具即日起面向 OpenAI API 开发者免费提供。
OpenAI 实施了一项新技术,使 DALL·E 生成的人物图像更准确地反映世界人口的多样性,以此减少偏差、提升安全性。
OpenAI 公布为 DALL·E 2 设置的多项防护措施,以降低强大图像生成模型带来的风险。这些 guardrails 用于防止生成图像违反其内容政策,从而让 DALL·E 2 能面向更广泛的受众开放。
OpenAI 训练了“批评写作”模型,用于指出 AI 总结中存在的缺陷。人类评估者在看到模型批评后,能更频繁地发现总结中的问题,且模型规模越大自我批评能力越强,批评写作能力的提升比总结写作更明显。这一结果表明 AI 系统有望辅助人类监督 AI 完成困难任务。
Cohere、OpenAI 和 AI21 Labs 共同制定了一套初步的大语言模型部署最佳实践,适用于任何开发或部署 LLM 的组织。
Hugging Face 多模态学习小组发布了一份伦理章程,将伦理原则作为机器学习研究生命周期的核心,并由伦理落地、数据治理与个人隐私领域专家参与撰写。章程明确了希望防止的滥用场景,包括生成可识别个人身份的信息、针对性别的偏见、在医疗和法律等高风险领域的鲁莽使用等。团队同时承诺保持透明、开放可复现、公平和自我批判,并承认部分价值观之间可能存在冲突,需逐案权衡风险与收益。
当一个度量指标成为优化目标时,它就不再是好的度量——这正是 OpenAI 在优化那些难以或高成本测量的目标时必须面对的 Goodhart 定律难题。
Hugging Face 播客「Machine Learning Experts」采访了曾创立并联合领导 Google Ethical AI 团队的 Margaret Mitchell,她已发表超过 50 篇论文。
OpenAI 发布语言模型安全与滥用防范方面的最新思考,旨在帮助其他 AI 开发者应对已部署模型的安全与滥用问题。文章分享了相关经验教训与应对思路。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
OpenAI 最新研究发现,通过在一个小规模精选数据集上进行微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。
OpenAI 发布 Safety Gym,这是一套环境和工具,用于衡量强化学习智能体在训练过程中遵守安全约束的进展。该套件面向强化学习安全研究,为相关进展提供统一的度量基准。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。
OpenAI 开发了一种评估神经网络分类器能否可靠抵御训练时未见的对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness)。该指标用于衡量单个模型面对未预期攻击的鲁棒性,并强调需要在更多样化的未知攻击上测量模型性能。
OpenAI 发布政策研究论文,提出四种可立即采用的策略以促进 AI 行业在安全规范上的长期合作:沟通风险与收益、技术协作、提高透明度和激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司在安全上投入不足。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。
OpenAI 提出一项名为 iterated amplification 的 AI 安全技术,通过演示如何把任务分解为更简单的子任务,来指定超越人类规模的复杂行为和目标,而无需提供标注数据或奖励函数。目前该想法仍处早期阶段,实验仅在简单的玩具算法领域完成,但 OpenAI 认为其可能成为可扩展的 AI 安全方法。