跳到正文
原文
Google DeepMind·· 2026-06-16精选AI 评分60

Google DeepMind 发布 AI Control Roadmap 应对智能体对齐风险

Securing the future of AI agents

AI 导读

Google DeepMind 发布 AI Control Roadmap,把内部 AI 智能体视为潜在未对齐的系统,在对齐之上叠加系统级安全防护。方案基于 MITRE ATT&CK 构建 AI 威胁建模框架,采用可信模型监督器做检测与拦截,并按模型逃避检测和造成危害的能力划分 D1-D4 与 R1-R3 安全等级。

推荐理由

原文提出以模型不可信为前提的系统级 AI Control 框架,并给出检测分级和百万轨迹的落地实践,对构建智能体安全有参考价值。

来源:Google DeepMind · deepmind.google