Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 与声音克隆
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源、多语言的 TTS 模型和声音克隆能力。评估采用 Qwen3 ASR 计算的 WER/CER 衡量可懂度、H200 GPU 上的 RTFx 与 TTFA 衡量速度、WavLM 嵌入余弦相似度衡量说话人相似度,使单个模型评估从数周缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源、多语言的 TTS 模型和声音克隆能力。评估采用 Qwen3 ASR 计算的 WER/CER 衡量可懂度、H200 GPU 上的 RTFx 与 TTFA 衡量速度、WavLM 嵌入余弦相似度衡量说话人相似度,使单个模型评估从数周缩短到数小时。
Basis 使用 GPT-6 Astra 完成 50 个工作表(tab)的报税工作簿,速度是 GPT-5.6 Sol 的 2 倍。GPT-6 Astra 对用户意图的理解更强,让 Basis 在实际使用中更有信心。
UK AISI 正在使用 EvalEval 的基础设施公开分享评测结果,以提升评测的可复现性与可验证性。
NVIDIA Vera Rubin NVL72 首次参加 MLPerf Inference v6.1 预览提交即取得领先性能:在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上使用 TensorRT-LLM 最高达 2.5 倍。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,用于在题目层面审计 LLM 基准的真实测量内容。该方法基于 100 个 LLM、16 个基准和超过 34K 道题的结果训练,未事先标注即独立恢复出安全与通用推理两个维度。分析发现 BBQ 和 WMDP 得分与通用推理的关联强于安全,HarmBench 的版权类题目也更偏向通用推理。
Google DeepMind 推出针对专有前沿模型的首个双盲评测,将外部评测限制在密码学安全的“盒子”环境中,防止模型提前看到测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,对一个 Gemini Flash Lite 模型在隐私保护环境下测试机密基准。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Hume 推出 Real World VoiceEQ 基准,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解,含 15+ 维度、60+ 指标。
OpenAI 发布分析,指出流行的编码评测基准 SWE-Bench Pro 存在问题,引发对 AI 模型评估可靠性与准确性的担忧。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Hugging Face 宣布 Every Eval Ever(EEE)与 Community Evals 互通,支持交叉发布评测结果并链接完整 EEE 记录,官方账号提交的结果在 EvalEval 显示认证标记。
OpenAI 推出 GeneBench-Pro,一个测试 AI 在基因组学、生物学和科研领域表现的全新基准测试。该基准使用复杂的真实世界数据集来评估 AI 性能。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。
推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
OpenAI 推出 LifeSciBench,这是一个由领域专家撰写并审阅的基准,用于评估 AI 系统在真实世界生命科学研究任务和决策中的表现。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入 10 个高质量私有 ASR 数据集,涵盖朗读与对话风格及澳、加、印、美、英等多种口音,以防范 benchmaxxing 和测试集污染。
Hugging Face 推出 QIMMA(قِمّة,意为“峰顶”),先对基准做质量校验再评估模型,确保分数反映真实的阿拉伯语能力。QIMMA 整合 14 个基准的 109 个子集、超 52,000 样本,覆盖文化、STEM、法律、医疗、安全、文学和代码 7 个领域,99% 为原生阿拉伯语内容。
Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了 AI 评测中每题标注数(K)与标注条目数(N)之间的可复现性权衡,模拟器已开源在 GitHub。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
OpenAI 宣布不再使用 SWE-bench Verified 评测前沿编程能力,分析显示该基准存在测试缺陷与训练数据泄漏,污染日益严重,无法准确衡量前沿编程进展。OpenAI 推荐改用 SWE-bench Pro。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Hugging Face 推出 AssetOpsBench,一个面向工业资产运维(如冷水机组、空气处理机组)的智能体评测基准,从异常检测、故障诊断、KPI 预测、工单摘要等任务评估智能体。
NVIDIA 以开放评测方式发布 Nemotron 3 Nano 30B A3B,并公开其完整的评测 recipe。该 recipe 基于 NeMo Evaluator 开源库构建,任何人都可以重跑评测流水线、查看配置与产物并独立验证结果。NeMo Evaluator 将多个评测 harness 统一在同一接口下,评测流程与推理后端解耦,并可生成结构化结果与日志以便审计。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学、生物学领域的推理能力,衡量其迈向真实科学研究水平的进展。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转写赛道,目前对比 18 个机构的 60 多个开源与闭源模型,覆盖 11 个数据集。
OpenAI 推出 IndQA,一个用于评测 AI 系统在印度语言表现的基准。该基准由领域专家参与构建,覆盖 12 种语言和 10 个知识领域,考察模型的文化理解与推理能力。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)测试版,旨在可靠评估嵌入模型在真实应用中的检索准确性。它采用开放与私有数据集结合的混合策略来检测基准过拟合,覆盖 20 种语言和法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,榜单已上线于 MTEB 排行榜的检索板块。
OpenAI 推出新评测基准 GDPval,用于衡量模型在真实世界中有经济价值的任务上的表现。该评测覆盖 44 种职业,旨在更贴近实际工作场景检验模型能力。
Hugging Face 团队推出 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种语言,包含 Cultural Knowledge、Classical NLP、Reading Comprehension 和 Generation 四大类共 12 项任务,并据此评估了 20 多个主流 LLM。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏评估 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 发布 GPT-5 首次上手视频,展示多位领先开发者首次使用 GPT-5 的过程与反应。
NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench「LLM with Search」榜单登顶,总分为 40.52(截至 2025 年 8 月),是目前完全开源授权方案中的第一名。