Graphite 研究分析各前沿模型写作特征:Claude Opus 5.5 爱说 this matters
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
营销公司 Graphite 对比 1 万篇 ChatGPT 发布前的文章与各前沿模型改写版本,找出 1.3 万个在 AI 内容中出现频率至少是人写两倍的短语。
研究人员开发的 Ataraxos AI 以 85% 的有效胜率击败四届世界冠军、公认史上最强 Stratego 玩家 Niemeijer,结束了一个人类对 AI 的最后堡垒。
推荐理由:研究以约八千美元算力战胜最强人类 Stratego 玩家,正则化和信念网络方法可迁移到其他不完全信息博弈。
Google Research 在 ACL 2026 提出 ToolGrad,先生成真实工具调用链再标注用户查询的“answer-first”范式,替代传统 DFS 探索式数据生成,通过 propose、execute、select、update 四个模块迭代构建 API 工作流。
Google Research 评估了将 UK Biobank 欧洲人群 GWAS 训练的多基因风险评分(PRS)迁移到 Biobank Japan 近 20 万日本人群样本的效果,涵盖 BMI、血压、HDL、LDL、血糖等 8 个临床性状。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S 视觉 transformer 的框架,可自动检测、量化和定位 EMIT 高光谱数据中的甲烷羽流。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,覆盖 4,888 名说话人,印地语是该多语言榜单上首个非欧洲语言。
推荐理由:原文给出 Monsoon 四个评测集的采集设计与区域误差分析样例,读者可以了解带说话人元数据的 ASR 评测能揭示什么。
Multiverse Computing 发布 Quantization-Aware Healing(QAH)方法,将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,模型在 9 项基准中的 7 项超过其 bfloat16 全精度版本,AA-LCR 提升 7.4 分、AIME 2025 提升 5.6 分。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
UC Berkeley BAIR 团队提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为 LLM 智能体的工作上下文,并通过 belief grading 监督摘要内容。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
SentinelOne 研究人员剖析了约 20 年前名为 fast16.sys 的病毒,它通过篡改内存中的浮点运算结果,定向破坏 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件,疑似用于拖延武器研发。
OpenAI 举办 Parameter Golf 活动,汇聚 1000+ 参与者和 2000+ 提交作品,探索 AI 辅助机器学习研究。活动在严格约束下覆盖 coding agents、量化和新型模型设计等方向。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的“岛屿”(learner units),可在全球分布的数据中心间训练 LLM。
Google Research 推出 Simula,一个推理优先的合成数据生成框架,无需种子数据,将数据集构建分解为全局多样性、局部多样性、复杂化和质量检查四个可控维度。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Google Research 发布 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的“真实感差距”。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了 AI 评测中每题标注数(K)与标注条目数(N)之间的可复现性权衡,模拟器已开源在 GitHub。
Berkeley AI Research 提出可在大规模下识别关键交互的 SPEX 与 ProxySPEX 算法,通过消融实验解释 LLM 行为。SPEX 利用稀疏性和低度性将交互发现转化为稀疏恢复问题,规模较此前方法提升数个数量级;ProxySPEX 进一步利用层级结构,以约 10x 更少的消融达到与 SPEX 相当的性能。二者可用于特征归因、数据归因和模型组件归因。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化洪水事件,生成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
Google Research 推出大规模开放语音数据集 WAXAL,覆盖撒哈拉以南非洲 27 种语言、超过 1 亿使用者。首批包含约 1,846 小时转写自然语音(WAXAL-ASR,采用图像提示引发自发话语)和 565 小时以上高保真 TTS 录音,以 CC-BY-4.0 许可发布,由 Makerere 大学、加纳大学等非洲机构主导采集,后续计划持续扩展语言。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。
Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。
推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。
Google Research 在 NeurIPS 2025 上提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,兼顾数据多样性与效用。它将问题分解为一系列最大独立集近似问题,并首次为多样性-效用权衡提供可证明的强保证:所得子集的价值至少为最优解的一半。GIST 在图像分类等任务上超越现有 SOTA 基准。
Google Research 在两篇新论文中推出 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合。Titans 用多层感知机作为神经长期记忆模块,通过“惊喜度量”(surprise metric)在运行时选择性存储意外信息,并辅以动量和自适应遗忘机制,实现无需离线重训练的测试时记忆。
Google Research 在 NeurIPS 2025 发表 Nested Learning 论文,将机器学习模型视为多层嵌套的优化问题,统一模型架构与优化算法两个层面。
推荐理由:原文提出把模型架构与优化算法统一为嵌套优化问题的新范式,并给出 Hope 架构的实验验证,对持续学习方向有方法层面的参考价值。
这篇 Berkeley AI Research 博客介绍一种基于分治而非 TD learning 的 off-policy RL 价值学习范式。
全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口分布的开源合成人物数据集,采用 CC BY 4.0 许可。数据集包含 2100 万个人物(3M 记录 × 7 人物),共 7.7 billion tokens,支持英语和印地语(天城文与拉丁字母),覆盖全部 36 个邦和 640 个地区。
NVIDIA 发布首个面向日本人口统计、地理与文化特征的开源合成人设数据集 Nemotron-Personas-Japan,采用 CC BY 4.0 许可。
Berkeley AI Research 提出理论证明,在从接近零的小初始化等温和近似条件下,word2vec 的学习问题可归约为无加权最小二乘矩阵分解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。
推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。
Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。
推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。
Hugging Face 联合 2A2I、TII 推出的 Open Arabic LLM Leaderboard 即将升级为第二版。第一版上线不到 7 个月吸引超 46,000 访客、提交超 700 个模型(1B 至 70B+ 参数),覆盖 180 多个组织;其中 70% 以上为 chat 和微调模型,超 50% 的模型小于 7B。新版将针对社区反馈,加强阿拉伯语特定任务评测与基准透明度。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本生成图像偏好数据集 open-image-preferences-v1,包含 10K 偏好对、超 30K 标注响应,由 250 多名社区成员在不到两周内完成。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。