ScarfBench:评测 AI 智能体在企业级 Java 框架迁移上的表现的开源基准
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Hugging Face 推出开源基准 ScarfBench,用 Spring、Jakarta EE、Quarkus 间的迁移任务评测 AI 智能体,包含 34 个应用、102 个框架实现、204 个迁移任务、约 151K 行代码和 1,331 个专家编写测试。
Google Research 将建筑级屋顶反照率数据扩展至 9 个国家的 50 多座城市,包括伦敦、里约热内卢和纽约,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:官方同时给出两款模型的定价、延迟数字和已知限制,开发者可以直接据此评估是否替换现有图像与视频工作流。
Dharma AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 2026 年的论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,论证专业化是 AI 系统的必然方向。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
OpenAI Signals 数据显示 ChatGPT 在全球范围内持续增长,用户使用频率提升,并探索更多功能。增长跨越多个地区和语言。
Hugging Face 宣布 Every Eval Ever(EEE)与 Community Evals 互通,支持交叉发布评测结果并链接完整 EEE 记录,官方账号提交的结果在 EvalEval 显示认证标记。
OpenAI 推出 GeneBench-Pro,一个测试 AI 在基因组学、生物学和科研领域表现的全新基准测试。该基准使用复杂的真实世界数据集来评估 AI 性能。
Hugging Face 团队提出 DiScoFormer,单个 Transformer 模型经一次前向传播即可同时估计任意数据集分布的密度和 score,无需针对新分布重训练。
OpenAI 发布新报告,描绘 AI 如何重塑欧盟就业格局,指出哪些职业可能面临自动化、增长或工作流程变化。
HP Inc. 与 OpenAI 建立 Frontier 战略合作关系,将 AI 部署到客户体验、软件开发和企业运营中。该合作由 HP Inc. 推动扩展,覆盖其核心业务环节。
Google 将 Multi-Token Prediction(MTP)头附加到冻结权重的 Gemini Nano v3 模型上,已面向 Pixel 9 和 10 系列推出,可开箱即用地加速端侧 AI。
OpenAI 预览下一代模型 GPT-5.6 Sol,在编程、科学和网络安全方面能力更强。该模型同时配备了 OpenAI 迄今最先进的安全栈。
Hugging Face 发布教程,用一条 hf jobs run 命令即可在 HF 基础设施上启动私有 OpenAI 兼容的 vLLM 端点,无需配置服务器或 Kubernetes,按秒计费(a10g-large 为 $1.50/hour)。
推荐理由:官方教程给出一条命令在 HF Jobs 上起 vLLM 服务的完整路径,含定价、权限、SSH 调试和接 coding agent 等可复用细节。
Google Research 在 CIDR 发表 linear elastic caching,将缓存页淘汰建模为 ski rental 问题,用轻量级机器学习动态调整缓存大小以最小化 TCO。
OpenAI 发布新研究论文,展示 AI 智能体如何改变工作,让更长、更复杂的任务得以完成,并提升各类岗位的生产力。
Google Research 在 COLM 2026 发表论文,发现开启推理后模型能召回原本无法给出的简单单跳事实,实验覆盖 Gemini-2.5 Flash/Pro 与 Qwen3-32B,使用 SimpleQA Verified 和 EntityQuestions 数据集。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型转为 Gemini 3.5 Flash 内置工具,并给出 API 入口和企业级安全防护选项。
NVIDIA NeMo AutoModel 构建在 HuggingFace Transformers v5 之上,只需更改一行 import 即可微调 MoE 模型,相比最优的 v5 配置训练吞吐提升 3.4-3.7x、GPU 显存降低 29-32%。
Mistral 推出多项 Connectors 新功能:管理员可按 workspace 或 org 设置连接器访问权限并逐个开关工具,API keys 支持 connector scope 防止自动化任务冒充用户身份,多账号连接器支持一个连接器绑定多个登录账号。
OpenAI 与 Broadcom 发布定制 AI 芯片 Jalapeño,专为 LLM 推理设计,目标是提升 AI 系统的性能、效率与规模。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 破解了一项悬置 3 年的免疫学谜题,揭示了 T 细胞行为的关键机制。这一突破有望支持癌症和自身免疫疾病研究。
OpenAI 支持 Appia Foundation,通过评估框架、安全实践和全球合作推动构建高级 AI 的共享标准。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
Google Chrome 团队的 Thomas Steiner 在 Transformers.js 中实验了尚处早期提案阶段的 Cross-Origin Storage API。
Hugging Face 在官方博客详解如何把 huggingface_hub 的发布节奏从每 4 到 6 周一次提升到每周一次,整条流程跑在一个 GitHub Actions 工作流里,使用开源工具、开源权重模型(当前为 Z.ai 的 GLM-5.2)和 HF Inference Providers,单次发布的模型成本约 $0.25。
推荐理由:Hugging Face 官方复盘自身发布流水线,给出可复用的确定性校验加人工把关模式,其他开源维护者可以照搬适配。
旅行平台 Omio 使用 OpenAI 构建对话式旅行体验,并加速产品开发。公司正借助 OpenAI 转型为 AI 原生企业。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
OpenAI 推出 Daybreak 系列安全工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模查找、验证并修补漏洞。这些工具面向全球企业的安全防护场景。
OpenAI 推出 Patch the Planet,这是 Daybreak 旗下的一项计划,旨在帮助开源维护者借助 AI 和专家评审来发现、验证并修复安全漏洞。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 部署之一。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
OpenAI 为 ChatGPT Enterprise 推出全新的支出管控与用量分析功能。此次更新帮助企业更好地管理成本,更有信心地规模化部署 AI。
OpenAI 通过 GPT-5.5 Instant 改进 ChatGPT 的健康与养生类回答,带来更强的推理能力和更好的上下文理解。改进还包括更清晰的沟通表达,以及基于医生参与评估的评测方式。
研究人员使用 OpenAI 推理模型辅助诊断罕见遗传病,在以往未解决的病例中识别出 18 个新诊断。该成果针对的是影响儿童的罕见遗传疾病。
Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。
推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。