Prover-Verifier Games 如何提升语言模型输出的可读性
OpenAI 探讨了 prover-verifier games(证明者-验证者博弈)如何提升语言模型输出的可读性。该方法使 AI 给出的解决方案更清晰、更易验证,对人类和机器而言都更值得信赖。
OpenAI 探讨了 prover-verifier games(证明者-验证者博弈)如何提升语言模型输出的可读性。该方法使 AI 给出的解决方案更清晰、更易验证,对人类和机器而言都更值得信赖。
OpenAI 与洛斯阿拉莫斯国家实验室宣布建立研究合作关系,双方将共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,它能对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:基于 GPT-4 的 CriticGPT 为 ChatGPT 回复写批评意见,帮助人类训练员在 RLHF 中发现错误。
OpenAI 推出网络安全资助计划,支持网络安全领域的创新研究及 AI 技术在其中的应用。该计划面向防御者,旨在推动 AI 与网络安全的融合。
OpenAI 提出一种整体化方法,用于构建健壮且实用的自然语言分类系统,服务真实世界的内容审核场景。该方案聚焦undesired content(不良内容)检测的实际落地,兼顾系统稳健性与可用性。
OpenAI 宣布任命美国陆军退役上将 Paul M. Nakasone 进入董事会,其将为不断扩大的董事会带来网络安全经验,并将加入董事会的安全与保障委员会。
推荐理由:官方宣布美国陆军退役上将 Paul M. Nakasone 加入董事会并进入安全与保障委员会,读者可据此关注其网络安全背景对公司安全方向的影响。
Hugging Face 通报其 Spaces 平台遭未授权访问,部分 Spaces 秘钥可能被读取,官方已撤销相关 HF token 并邮件通知受影响用户。官方建议用户刷新密钥或改用细粒度访问 token,已移除 org token、为 Spaces 秘钥部署 KMS,并计划在功能对齐后弃用经典读写 token,同时已报警并向数据保护机构报告。
推荐理由:官方通报了 Spaces 秘钥未授权访问事件、已撤销的 token 范围和 KMS 等整改措施,受影响用户可据此排查自身密钥。
OpenAI 终止了与隐蔽影响力行动相关的账号。这些行动试图利用其服务进行欺骗性内容生成,但未因使用 OpenAI 服务而获得显著的受众增长。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
OpenAI 表示,AGI 有潜力惠及生活的几乎各个方面,因此必须以负责任的方式开发和部署。
OpenAI 发布 Model Spec,一份定义其模型期望行为的规范文档。材料抓取失败,仅标题可用,具体内容细节以原文为准。
OpenAI 推出新工具,帮助研究人员识别由其工具生成的内容,同时宣布加入内容来源与真实性联盟(C2PA)指导委员会,以推动行业标准。
OpenAI 封禁了与伊朗起源的行动 IUVM 相关的账号,该行动利用 AI 生成并翻译支持伊朗、反对以色列和反对美国的网站内容。
OpenAI 封禁了与中国相关的 "Spamouflage" 影响力行动所使用的账号。该行动利用 AI 研究社交媒体活动、生成帖子,并调试一个此前未被报道的网站。
OpenAI 封禁了与一个此前未报告、源自以色列的影响行动相关的账号,该行动被 OpenAI 命名为 Zero Zeno。行动使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党(BJP)以及亲以色列总工会 Histadrut 的内容。
OpenAI 封禁了一批此前未被披露、来自俄罗斯的“Bad Grammar”行动相关账号。该行动利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海国家及美国政治话题。
OpenAI 封禁了与俄罗斯来源影响力行动 "Doppelganger" 相关的账号。该行动利用 AI 生成针对乌克兰的反乌社交媒体评论、翻译及多种语言的网站文案。
OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。
推荐理由:原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。
Hugging Face 宣布与云安全公司 Wiz 合作,已集成 Wiz 用于漏洞管理和云安全态势管理,并自动修复 Spaces 中的问题。Wiz 研究人员通过 pickle 发现其沙箱计算环境的缺陷,相关漏洞已全部修复。官方建议用户在生产环境弃用 pickle、改用 Safetensors,并警告 pickle 未来可能不再受支持。
Lighthouz AI 与 Hugging Face 合作推出 Chatbot Guardrails Arena,让用户与两个匿名、带 guardrails 的聊天机器人对话,尝试套取虚构银行 XYZ001 客户的姓名、SSN、账号、余额等敏感信息并投票,结果将以 Elo 评分汇入公开排行榜。
Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。
OpenAI 宣布破除国家关联威胁行为者对 AI 的恶意使用,正文抓取失败,仅标题可用。
Hugging Face 发布了用开源模型实现 Anthropic Constitutional AI 的端到端配方,并开源了基于 TGI 和 vLLM、在 Slurm 集群上做规模化合成数据生成的工具 llm-swarm。
推荐理由:原文给出了开源模型跑通 Constitutional AI 的完整配方与实验数据,读者可以照着复现自己的对齐流程。
OpenAI 正在开发一套评估大语言模型可能助力生物威胁创建风险的框架,在包含生物学专家和学生的评测中,GPT-4 对生物威胁创建准确率的提升最多仅为轻微(mild uplift)。该提升幅度尚不足以得出确定性结论,但这一发现为后续研究和社区讨论提供了起点。
Secure Learning Lab 在 Hugging Face 上发布了新的 LLM Safety Leaderboard,专注于大语言模型安全评估,由 HF leaderboard template 驱动。
OpenAI 资助了来自全球的 10 支团队,设计集体治理 AI 的想法与工具。OpenAI 总结了这些创新成果和经验教训,并呼吁研究者和工程师加入继续推进这项工作。
OpenAI 围绕 2024 全球选举开展工作,重点包括防止滥用、提升 AI 生成内容的透明度,以及改善准确投票信息的获取。
OpenAI 表示支持新闻业,并与多家新闻机构建立了合作关系。OpenAI 同时认为《纽约时报》对其提起的诉讼没有法律依据。
OpenAI 推出 1000 万美元的 Superalignment Fast Grants,资助针对超人类 AI 系统对齐与安全的技术研究。资助方向包括 weak-to-strong generalization、可解释性、可扩展监督等。
OpenAI 提出 superalignment 新研究方向,探讨能否利用深度学习的泛化性质,用弱监督者控制强模型。官方表示已获得有希望的初步结果,该方向指向未来超人类水平模型的对齐问题。
OpenAI 宣布推进针对高能力 AI 系统的灾难性风险防范工作,将组建 Preparedness 团队并发起一项挑战赛,以支持前沿 AI 安全。
OpenAI 与 Anthropic、Google、Microsoft 共同宣布 Frontier Model Forum 的新任执行董事人选,并设立 1000 万美元的 AI 安全基金(AI Safety Fund)。该基金旨在支持 AI 安全领域相关工作,是四大公司推动前沿模型安全治理的最新举措。
Hugging Face 伦理与社会团队发布夏季通讯,披露其 CEO Clem 在美国国会作证、出席美国参议院 AI Insight Forum,并对 E.U. AI Act 和 NTIA 的 AI 问责议题提出意见。
OpenAI 宣布成立 OpenAI Red Teaming Network,并发出公开招募,邀请领域专家加入,帮助改进 OpenAI 模型的安全性。
OpenAI 发布文章说明其使用 GPT-4 进行内容政策制定和内容审核决策。文章指出这一做法带来更一致的标注、更快的政策修订反馈循环,并减少人工审核员的参与。
推荐理由:OpenAI 官方说明用 GPT-4 做内容审核的具体做法,展示了加快政策迭代与降低人工审核量的可借鉴路径。
OpenAI 宣布组建行业组织 Frontier Model Forum,推动前沿AI系统的安全与负责任开发。该组织将推进AI安全研究、识别最佳实践与标准,并促进政策制定者与行业间的信息共享。
OpenAI 与其他领先实验室宣布自愿承诺,以强化 AI 的安全性、安保与可信度。材料仅提供摘要,未给出承诺的具体条款与细节。
Hugging Face 在伦理与社会通讯第 4 期中探讨文生图模型的偏见来源,包括训练数据(如 LAION-5B)、预训练数据过滤、CLIP 推理、隐空间及事后过滤等环节。
Hugging Face 宣布更新其内容政策(Content Policy),以应对机器学习内容审核带来的新挑战。新政策将“同意”作为核心价值,关注用户所见内容以及个人身份和形象的表达方式,并禁止针对用户或 Hugging Face 员工的攻击性语言。