Graphite 研究分析各前沿模型写作特征:Claude Opus 5.5 爱说 this matters
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
Simon Willison 转引 Anthropic Frontier Red Team 的评测:在内部 Binary Exploitation benchmark 的 100 个任务上,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。而更早的 Claude Opus 4.6 和 GLM-5.2 均无一成功。
UK AISI 正在使用 EvalEval 的基础设施公开分享评测结果,以提升评测的可复现性与可验证性。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
Jack Clark 主持的 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 代码取得 18.71X 加速。
SentinelOne 研究人员剖析了约 20 年前名为 fast16.sys 的病毒,它通过篡改内存中的浮点运算结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件,疑似用于拖延武器研发。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。