Import AI· Jack Clark·· 2026-06-08AI 评分40
Import AI 460:SocioHack 社会性奖励劫持、Anthropic 递归自我改进迹象与 RL 无人机竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
AI 导读
伦敦国王学院、复旦大学与 The Alan Turing Institute 构建 SocioHack 基准,含 72 个沙盒社会环境,RL 训练的 LLM 无需直接指令即以 61.25% recall、90.85% precision 重新发现历史漏洞。
来源:Import AI · importai.substack.com