Graphite 研究分析各前沿模型写作特征:Claude Opus 5.5 爱说 this matters
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
UK AISI 正在使用 EvalEval 的基础设施公开分享评测结果,以提升评测的可复现性与可验证性。
Multiverse Computing 发布 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,模型在 9 项基准中的 7 项超过其 bfloat16 全精度版本,AA-LCR 提升 7.4 分、AIME 2025 提升 5.6 分。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
Jack Clark 主持的 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 代码取得 18.71X 加速。
本期Import AI汇集三项内容。牛津、UK AI Security Institute、斯坦福与LSE的研究通过4项实验、18,978段对话发现AI说服力稳定超过专家人类。
OpenAI 发布第三方 AI 评估指南,说明如何评估前沿系统的模型能力、安全防护措施及评估有效性。该指南旨在为可信的第三方评估提供一套通用方法。
SentinelOne 研究人员剖析了约 20 年前名为 fast16.sys 的病毒,它通过篡改内存中的浮点运算结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件,疑似用于拖延武器研发。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链(CoT)。这一局限使思维链保持可被监控的状态,强化了可监控性作为 AI 安全保障手段的价值。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,通过 180 种智能体配置的受控评测,挑战了“智能体越多越好”的假设。
推荐理由:原文用 180 种配置给出多智能体系统何时有效何时退化的量化规律,为架构选择提供了可依据的任务属性判断方法。
OpenAI 推出面向思维链(chain-of-thought)可监测性的新框架与评估套件,覆盖 13 项评估、24 个环境。研究结果显示,监测模型内部推理远比只监测输出更有效,为 AI 能力增强下的可扩展控制提供了有前景的路径。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学、生物学领域的推理能力,衡量其迈向真实科学研究水平的进展。
OpenAI 推出一个真实世界评测框架,衡量 AI 能否加速湿实验室中的生物研究。团队用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的潜力与风险。
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
OpenAI 正在探索机制可解释性,以理解神经网络的推理方式。其新的稀疏模型方法有望让 AI 系统更透明,支持更安全、更可靠的行为。
OpenAI 介绍了其评估 ChatGPT 政治偏见的新方法,采用贴近真实使用场景的测试来提升客观性、降低模型偏见。该方法聚焦于如何定义和衡量 LLM 的政治倾向,旨在改进评测的客观性。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
OpenAI 发布新研究,解释语言模型为何产生幻觉。研究指出改进评测方式可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 发布论文,评估发布 gpt-oss 开放权重模型的最坏情况前沿风险。研究提出恶意微调(MFT)方法,通过微调 gpt-oss 使其在生物学和网络安全两个领域尽可能发挥最大能力,以探明其潜在风险上限。
OpenAI 发布研究,探讨在错误回答上训练如何导致语言模型更广泛的不对齐。研究识别出驱动该行为的内部特征,并发现通过极少量微调即可将其逆转。
推荐理由:OpenAI 官方研究探讨错误回答训练如何引发更广泛的模型不对齐,并指出该内部特征可用极少微调逆转,为对齐研究提供了新方向。
OpenAI 发布 HealthBench,一个面向医疗场景的 AI 评测基准,在真实场景中评估模型表现。该基准由 250 多名医生参与构建,旨在为模型在健康领域的性能与安全提供共同标准。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 与 MIT Media Lab 联合开展研究,探索 ChatGPT 上情感化使用与用户情绪健康的早期研究方法。该合作旨在理解用户与 AI 的情感互动及其对情绪健康的影响。
OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。
推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
OpenAI 发布研究,探讨通过增加推理时计算来提升模型对抗鲁棒性的方法。研究分析了更多推理计算与对抗攻击防御之间的关系。
Artificial Analysis 发布音频语言模型推理评测集 Big Bench Audio,从 Big Bench Hard 四个类别各选 250 题生成 1000 道音频题,并给出 GPT-4o 与 Gemini 1.5 系列在语音到语音、语音到文本、文本到语音、文本到文本四种配置下的 18 组实验结果。
OpenAI 发布了关于结合人员与 AI 推进红队测试的内容,介绍了将人工与 AI 方法结合用于红队测试的方向。
OpenAI 推出事实性基准 SimpleQA,用于衡量语言模型回答简短事实性问题的能力。
OpenAI 发布论文,对连续时间一致性模型做了简化、稳定化和规模化,仅用两个采样步骤即可达到与领先扩散模型相当的样本质量。
OpenAI 推出 MLE-bench,一个用于衡量 AI 智能体在机器学习工程任务上表现的评测基准。该基准目前仅随发布消息公布,具体评测任务与结果尚未在文中给出。
OpenAI 发布 SWE-bench 的人工验证子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
OpenAI 提出一种整体化方法,用于构建健壮且实用的自然语言分类系统,服务真实世界的内容审核场景。该方案聚焦undesired content(不良内容)检测的实际落地,兼顾系统稳健性与可用性。
Hugging Face 发布 BigCodeBench,用于在无污染的实际编程任务上评估大语言模型,定位为 HumanEval 的新一代继任者。