ScarfBench:评测 AI 智能体在企业级 Java 框架迁移上的表现的开源基准
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Hugging Face 团队提出 DiScoFormer,单个 Transformer 模型经一次前向传播即可同时估计任意数据集分布的密度和 score,无需针对新分布重训练。
NVIDIA 研究人员开发 ENPIRE 框架,让物理机器人像编码智能体一样自主实验与迭代改进策略。系统用两台 YAM 机械臂和 RTX 5090 工作站组成闭环,自动评估与重置场景,GPT-5.5(Codex)和 Opus 4.7(Claude Code)表现最佳,在 PushT 等灵巧操作任务上达到 99% 成功率,8 个智能体并行有时获得更高分数。
Google Research 在 CIDR 发表 linear elastic caching,将缓存页淘汰建模为 ski rental 问题,用轻量级机器学习动态调整缓存大小以最小化 TCO。
Google Research 在 COLM 2026 发表论文,发现开启推理后模型能召回原本无法给出的简单单跳事实,实验覆盖 Gemini-2.5 Flash/Pro 与 Qwen3-32B,使用 SimpleQA Verified 和 EntityQuestions 数据集。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
本期Import AI汇集三项内容。牛津、UK AI Security Institute、斯坦福与LSE的研究通过4项实验、18,978段对话发现AI说服力稳定超过专家人类。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
Google Research 分享了关于 AI 皮肤健康工具的消费者研究,其中发表于 JAMA Dermatology 的大规模实验让 2,345 名参与者分三组研究皮肤病例。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘。
Google DeepMind 发布在塞拉利昂开展的预注册 RCT 结果,使用 Guided Learning 的学生数学成绩较对照组提升 +0.258 个标准差,约合 1.2 至 1.7 年常规学习进度;教师将 Gemini 融入约半数课时(目标 12 小时)的班级提升更高,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册 RCT 的量化结果和交互数据,读者可以据此评估 AI 辅助教学在真实课堂中的效果与局限。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
OpenAI 发布第三方 AI 评估指南,说明如何评估前沿系统的模型能力、安全防护措施及评估有效性。该指南旨在为可信的第三方评估提供一套通用方法。
Google Research 提出一种零信任隐私分析方案,用新型格密码协议让设备通过单条消息完成安全聚合,无需多轮在线交互,并结合 TEE 远程证明形成多层防御。该方案将用于 Android SafetyCore,在不接触用户原始内容的情况下度量安全模型的真实准确率,帮助优化分类器阈值。
SentinelOne 研究人员剖析了约 20 年前名为 fast16.sys 的病毒,它通过篡改内存中的浮点运算结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件,疑似用于拖延武器研发。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入 10 个高质量私有 ASR 数据集,涵盖朗读与对话风格及澳、加、印、美、英等多种口音,以防范 benchmaxxing 和测试集污染。
Google Research 介绍自 9 月预印本发布 Empirical Research Assistance(ERA)以来,其科学家与学术合作者将其应用于真实科研的四个成果。
推荐理由:文章展示了 ERA 在疫情预测、宇宙学、气候遥感和神经回路四个真实科研场景的应用结果,可了解 LLM 辅助科研的具体形态。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的“岛屿”(learner units),可在全球分布的数据中心间训练 LLM。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体框架,并开源了代码。它以检索、提取、整合的闭环运行,把失败案例转化为预防性经验;配合记忆感知的测试时扩展(MaTTS)进一步提效。
Hugging Face 推出 QIMMA(قِمّة,意为“峰顶”),先对基准做质量校验再评估模型,确保分数反映真实的阿拉伯语能力。QIMMA 整合 14 个基准的 109 个子集、超 52,000 样本,覆盖文化、STEM、法律、医疗、安全、文学和代码 7 个领域,99% 为原生阿拉伯语内容。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
Google Research 推出 Simula,一个推理优先的合成数据生成框架,无需种子数据,将数据集构建分解为全局多样性、局部多样性、复杂化和质量检查四个可控维度。
Google Research 的 MoGen 模型基于 PointInfinity point cloud flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经元形态,扩充 PATHFINDER 重建模型的训练数据。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。
Google Research 发布 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的“真实感差距”。
Google Research 发布评估 LLM 行为倾向对齐的研究,基于 IRI、ERQ 等标准化心理问卷生成情境判断测试(SJT),在职业沉着、冲突解决、订旅行等现实场景中比较模型与 550 名参与者的人类偏好分布。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了 AI 评测中每题标注数(K)与标注条目数(N)之间的可复现性权衡,模拟器已开源在 GitHub。
Google DeepMind 发布关于 AI 有害操纵的新研究,称建立了首个经实证验证的评估工具包,用于测量 AI 以负面和欺骗性方式改变人类思想与行为的能力,并公开运行人类被试研究所需的全部材料。
推荐理由:原文给出覆盖三国万余名参与者的实验设计和效能与倾向双维度框架,为理解和测量 AI 有害操纵风险提供了可复用的方法入口。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过 PolarQuant 高质量压缩与仅 1 bit 的 QJL 零开销纠错两步,实现大幅模型压缩且零精度损失,同时支持 KV cache 压缩与向量搜索。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,基于心理学与认知科学研究提出包含感知、学习、推理、元认知等 10 项认知能力的分类框架,并给出对照人类基线的三阶段评估协议。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导专家出 67 道题并盲评 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统的回答。
Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化洪水事件,生成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
Google 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 的前瞻性单中心可行性研究,100 名成人患者在门诊就诊前与 AMIE 进行问诊对话,由医生实时监督,全程未触发任何安全中止。
推荐理由:原文给出真实门诊环境下的安全性、诊断与患者反馈数据,读者可以据此评估对话式医疗 AI 落地临床的现状与局限。
Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。