AI for Food Allergies:用 AI 推进食物过敏研究
全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。
全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口分布的开源合成人物数据集,采用 CC BY 4.0 许可。数据集包含 2100 万个人物(3M 记录 × 7 人物),共 7.7 billion tokens,支持英语和印地语(天城文与拉丁字母),覆盖全部 36 个邦和 640 个地区。
OpenAI 介绍了其评估 ChatGPT 政治偏见的新方法,采用贴近真实使用场景的测试来提升客观性、降低模型偏见。该方法聚焦于如何定义和衡量 LLM 的政治倾向,旨在改进评测的客观性。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)测试版,旨在可靠评估嵌入模型在真实应用中的检索准确性。它采用开放与私有数据集结合的混合策略来检测基准过拟合,覆盖 20 种语言和法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,榜单已上线于 MTEB 排行榜的检索板块。
NVIDIA 发布首个面向日本人口统计、地理与文化特征的开源合成人设数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 许可。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。
推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。
OpenAI 发布新研究,解释语言模型为何产生幻觉。研究指出改进评测方式可以提升 AI 的可靠性、诚实性与安全性。
SandboxAQ 发布开源数据集 SAIR,提供超过 500 万(5.24 million)个 AI 生成的蛋白-配体 3D 共折叠结构,每个结构均配有来自 ChEMBL 或 BindingDB 的实测 IC₅₀ 数据,以 CC BY 4.0 许可免费开放。
Berkeley AI Research 提出理论证明,在从接近零的小初始化等温和近似条件下,word2vec 的学习问题可归约为无加权最小二乘矩阵分解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
Hugging Face 团队推出 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种语言,包含 Cultural Knowledge、Classical NLP、Reading Comprehension 和 Generation 四大类共 12 项任务,并据此评估了 20 多个主流 LLM。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏评估 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 发布论文,评估发布 gpt-oss 开放权重模型的最坏情况前沿风险。研究提出恶意微调(MFT)方法,通过微调 gpt-oss 使其在生物学和网络安全两个领域尽可能发挥最大能力,以探明其潜在风险上限。
NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench「LLM with Search」榜单登顶,总分为 40.52(截至 2025 年 8 月),是目前完全开源授权方案中的第一名。
Hugging Face 推出 3LM,首个针对阿拉伯语 LLM 评测 STEM 与代码生成的多组件基准,包含 865 道原生 STEM 选择题、1,744 道合成高难度题,以及由 HumanEval+ 和 MBPP+ 翻译的阿拉伯语代码数据集。
Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。
Hugging Face 提出 FutureBench,通过真实世界事件评测 AI 智能体预测未来的能力。该基准从新闻和 Polymarket 预测市场采集题目:基于 smolagents 的智能体用 DeepSeek-V3 生成预测问题,每次抓取约生成 5 道题、时间范围为一周,另有每周约 8 道来自 Polymarket 的问题。
OpenAI 发布研究,探讨在错误回答上训练如何导致语言模型更广泛的不对齐。研究识别出驱动该行为的内部特征,并发现通过极少量微调即可将其逆转。
推荐理由:OpenAI 官方研究探讨错误回答训练如何引发更广泛的模型不对齐,并指出该内部特征可用极少微调逆转,为对齐研究提供了新方向。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
OpenAI 发布 HealthBench,一个面向医疗场景的 AI 评测基准,在真实场景中评估模型表现。该基准由 250 多名医生参与构建,旨在为模型在健康领域的性能与安全提供共同标准。
Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
Inception 联合 MBZUAI 在 Hugging Face 推出 Arabic-Leaderboards Space,整合阿拉伯语 AI 评测,目前包含 AraGen-03-25 和基于 Arabic IFEval 的指令遵循榜单。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 与 MIT Media Lab 联合开展研究,探索 ChatGPT 上情感化使用与用户情绪健康的早期研究方法。该合作旨在理解用户与 AI 的情感互动及其对情绪健康的影响。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。
推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。
OpenAI 推出 SWE-Lancer 基准,将真实自由职业软件工程任务转化为 LLM 评测,总价值 100 万美元,考察前沿模型能否赚取这笔报酬。该基准用真实 Upwork 工程任务衡量模型的实际编程能力。
Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。
推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。
Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。
Adyen 与 Hugging Face 联合发布 DABstep(Data Agent Benchmark for Multi-step Reasoning),包含 450 多个源自 Adyen 真实工作负载的数据分析任务,用于评估 LLM 和 AI 智能体。
OpenAI 发布研究,探讨通过增加推理时计算来提升模型对抗鲁棒性的方法。研究分析了更多推理计算与对抗攻击防御之间的关系。
Artificial Analysis 发布音频语言模型推理评测集 Big Bench Audio,从 Big Bench Hard 四个类别各选 250 题生成 1000 道音频题,并给出 GPT-4o 与 Gemini 1.5 系列在语音到语音、语音到文本、文本到语音、文本到文本四种配置下的 18 组实验结果。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本生成图像偏好数据集 open-image-preferences-v1,包含 10K 偏好对、超 30K 标注响应,由 250 多名社区成员在不到两周内完成。
OpenAI 发布了关于结合人员与 AI 推进红队测试的内容,介绍了将人工与 AI 方法结合用于红队测试的方向。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
OpenAI 推出事实性基准 SimpleQA,用于衡量语言模型回答简短事实性问题的能力。