OpenAI 成立 Red Teaming Network,公开招募领域专家
OpenAI 宣布成立 OpenAI Red Teaming Network,并发出公开招募,邀请领域专家加入,帮助改进 OpenAI 模型的安全性。
OpenAI 宣布成立 OpenAI Red Teaming Network,并发出公开招募,邀请领域专家加入,帮助改进 OpenAI 模型的安全性。
OpenAI 发布文章说明其使用 GPT-4 进行内容政策制定和内容审核决策。文章指出这一做法带来更一致的标注、更快的政策修订反馈循环,并减少人工审核员的参与。
推荐理由:OpenAI 官方说明用 GPT-4 做内容审核的具体做法,展示了加快政策迭代与降低人工审核量的可借鉴路径。
OpenAI 宣布组建行业组织 Frontier Model Forum,推动前沿AI系统的安全与负责任开发。该组织将推进AI安全研究、识别最佳实践与标准,并促进政策制定者与行业间的信息共享。
OpenAI 与其他领先实验室宣布自愿承诺,以强化 AI 的安全性、安保与可信度。材料仅提供摘要,未给出承诺的具体条款与细节。
Hugging Face 在伦理与社会通讯第 4 期中探讨文生图模型的偏见来源,包括训练数据(如 LAION-5B)、预训练数据过滤、CLIP 推理、隐空间及事后过滤等环节。
Hugging Face 宣布更新其内容政策(Content Policy),以应对机器学习内容审核带来的新挑战。新政策将“同意”作为核心价值,关注用户所见内容以及个人身份和形象的表达方式,并禁止针对用户或 Hugging Face 员工的攻击性语言。
OpenAI 推出网络安全资助计划,通过赠款及其他支持,帮助防御者开发由 AI 驱动的网络安全能力。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
OpenAI, Inc. 启动 Democratic inputs to AI 资助计划,将颁发十笔 100,000 美元 grant,资助建立民主程序、决定 AI 系统应遵循哪些规则的实验。这些实验需在法律界定范围内开展,目标是探索公众如何参与 AI 治理规则的制定。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库完成外部安全审计,报告全文公开。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题。文章将超级智能定义为能力远超 AGI 的未来 AI 系统,认为眼下是启动相关治理思考的合适时机。
Hugging Face 宣布入选法国数据保护机构 CNIL 的增强支持计划。该计划从 40 多家候选企业中选出 3 家具有经济发展潜力的公司,帮助其理解和落实数据保护义务。Hugging Face 曾在 BigScience 和与 ServiceNow 共同主持的 BigCode 项目中重视隐私保护,并计划借助 CNIL 的专业支持推动 GDPR 合规。
OpenAI 为 ChatGPT 推出新的数据管理方式,用户现在可以关闭聊天记录,并自行选择哪些对话可用于训练 OpenAI 的模型。
OpenAI 宣布推出 Bug Bounty 漏洞赏金计划,邀请外部人员帮助发现其技术与服务的安全漏洞。OpenAI 表示该举措是其开发安全、可靠、可信的先进 AI 承诺的重要一环。
OpenAI 阐述其 AI 安全方法,强调安全地构建、部署和使用 AI 系统对实现其使命至关重要。原文仅简要表态,未提及具体模型、版本或技术细节。
Hugging Face 阐述其在开放机器学习中的伦理实践:通过逐案分析风险、识别高风险模型,在开放开发与风险控制之间寻求平衡。平台已推出 flagging 举报功能、模型卡文档、“Not For All Audiences” 标签,并推广 RAIL 开放责任许可(如 BLOOM、BigCode),同时基于社区 Spaces 总结出 6 个伦理分类标签。
Hugging Face 为 Diffusers 库发布伦理框架,以透明、一致、简洁、可及、可复现、责任六项价值观指导维护者对社区贡献的技术决策。
OpenAI 发文阐述其对 AGI 及其后续发展的规划。OpenAI 的使命是确保通用人工智能——即普遍比人类更聪明的 AI 系统——造福全人类。
红队测试是一种激发 LLM 漏洞、诱导其生成有害内容的评估方法,与自然语言提示形式的越狱(jailbreaking)同义,区别于人类不可读的对抗性攻击。文中以 GPT3 的性别歧视与偏见输出、Tay 和 Sydney 聊天机器人事故为例,并提到可用 GeDi、PPLM 引导 GPT3 生成,对经 RLHF 或 SFT 安全微调的模型则需角色扮演等攻击手段。
OpenAI 澄清了 ChatGPT 行为的塑造方式,并公布改进计划,包括允许用户进行更多自定义,以及在相关决策中引入更多公众意见。
OpenAI 与 Georgetown University 安全与新兴技术中心、Stanford Internet Observatory 合作,研究大语言模型可能被滥用于虚假信息活动的风险。双方于 2021 年 10 月举办了一场汇聚 30 名虚假信息研究者、机器学习专家和政策分析师的工作坊,并在一年多研究基础上共同发布报告。报告概述了语言模型对信息环境的威胁,并提出分析缓解措施的框架。
Hugging Face 发布 Model Card Creator 工具、更新版模型卡模板及指南手册,让用户无需编程即可创建模型卡。本次发布还包括标注版模板、Hugging Face 内部用户研究,以及模型文档现状的文献综述。团队未来计划将 Evaluate on the Hub 等工具的自动评估结果导入模型卡工作流。
Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。
Hugging Face 在 🤗 Evaluate 库中新增偏见评估指标,用于探究 GPT-2、BLOOM 等因果语言模型(CLM)编码的社会偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词驱动模型生成,再用 Evaluate 的指标评估,涵盖毒性、语言极性、伤害性三类任务。示例中仅改变代词 he/she,GPT-2 补全的女性代词毒性比例为 0.333,男性为 0.0。
Hugging Face 的 Evaluation on the Hub 功能升级,任何 Hub 上的 causal language model 现在都能免代码进行零样本分类评估,由 AutoTrain 驱动且免费。
Hugging Face 推出 Ethics and Society Newsletter,由公司内跨团队的"Ethics and Society regulars"开放小组编写,计划每季度在春分、夏至、秋分、冬至发布。
Hugging Face 支持的 RAIL Initiative 推出 OpenRAIL(开放且负责任的 AI 许可证),旨在让 AI 模型在开放获取、使用和再分发的同时约束负责任使用。
OpenAI 正在改进其 AI 系统从人类反馈中学习以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,用它来帮助解决其他所有对齐问题。
OpenAI 推出全新升级的内容审核工具 Moderation endpoint,是对此前 content filter 的改进。该工具即日起面向 OpenAI API 开发者免费提供。
OpenAI 实施了一项新技术,使 DALL·E 生成的人物图像更准确地反映世界人口的多样性,以此减少偏差、提升安全性。
OpenAI 公布为 DALL·E 2 设置的多项防护措施,以降低强大图像生成模型带来的风险。这些 guardrails 用于防止生成图像违反其内容政策,从而让 DALL·E 2 能面向更广泛的受众开放。
OpenAI 训练了“批评写作”模型,用于指出 AI 总结中存在的缺陷。人类评估者在看到模型批评后,能更频繁地发现总结中的问题,且模型规模越大自我批评能力越强,批评写作能力的提升比总结写作更明显。这一结果表明 AI 系统有望辅助人类监督 AI 完成困难任务。
Cohere、OpenAI 和 AI21 Labs 共同制定了一套初步的大语言模型部署最佳实践,适用于任何开发或部署 LLM 的组织。
Hugging Face 多模态学习小组发布了一份伦理章程,将伦理原则作为机器学习研究生命周期的核心,并由伦理落地、数据治理与个人隐私领域专家参与撰写。章程明确了希望防止的滥用场景,包括生成可识别个人身份的信息、针对性别的偏见、在医疗和法律等高风险领域的鲁莽使用等。团队同时承诺保持透明、开放可复现、公平和自我批判,并承认部分价值观之间可能存在冲突,需逐案权衡风险与收益。
当一个度量指标成为优化目标时,它就不再是好的度量——这正是 OpenAI 在优化那些难以或高成本测量的目标时必须面对的 Goodhart 定律难题。
Hugging Face 播客「Machine Learning Experts」采访了曾创立并联合领导 Google Ethical AI 团队的 Margaret Mitchell,她已发表超过 50 篇论文。
OpenAI 发布语言模型安全与滥用防范方面的最新思考,旨在帮助其他 AI 开发者应对已部署模型的安全与滥用问题。文章分享了相关经验教训与应对思路。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
OpenAI 最新研究发现,通过在一个小规模精选数据集上进行微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。