Google 发布 Earth AI 技术论文,详解基础模型与跨模态地理空间推理
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
全球约 2.2 亿人受食物过敏困扰,Hugging Face 发起 AI for Food Allergies 项目,打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。该项目计划以开放协作的方式桥接 AI 与生物医学,涵盖过敏原预测、药物靶点建模、临床诊断与标签识别等方向,让研究者、临床医生和患者共同受益。
OpenAI 介绍了其评估 ChatGPT 政治偏见的新方法,采用贴近真实使用场景的测试来提升客观性、降低模型偏见。该方法聚焦于如何定义和衡量 LLM 的政治倾向,旨在改进评测的客观性。
OpenAI 发布迄今最大规模 ChatGPT 使用研究,展示该工具如何通过个人与工作用途创造经济价值。研究显示使用范围正扩展到早期用户之外,缩小差距,使 AI 融入日常生活。
OpenAI 发布新研究,解释语言模型为何产生幻觉。研究指出改进评测方式可以提升 AI 的可靠性、诚实性与安全性。
SandboxAQ 发布开源数据集 SAIR,提供超过 500 万(5.24 million)个 AI 生成的蛋白-配体 3D 共折叠结构,每个结构均配有来自 ChEMBL 或 BindingDB 的实测 IC₅₀ 数据,以 CC BY 4.0 许可免费开放。
Berkeley AI Research 提出理论证明,在从接近零的小初始化等温和近似条件下,word2vec 的学习问题可归约为无加权最小二乘矩阵分解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
OpenAI 发布论文,评估发布 gpt-oss 开放权重模型的最坏情况前沿风险。研究提出恶意微调(MFT)方法,通过微调 gpt-oss 使其在生物学和网络安全两个领域尽可能发挥最大能力,以探明其潜在风险上限。
Hugging Face 推出 3LM,首个针对阿拉伯语 LLM 评测 STEM 与代码生成的多组件基准,包含 865 道原生 STEM 选择题、1,744 道合成高难度题,以及由 HumanEval+ 和 MBPP+ 翻译的阿拉伯语代码数据集。
Mistral AI 与 Carbone 4、ADEME 合作,完成了首个针对大语言模型的全生命周期环境影响分析。数据显示训练 Mistral Large 2 产生 20,4 ktCO₂e、281 000 m³ 水耗和 660 kg Sb eq;Le Chat 生成 400 token 回复的边际影响为 1,14 gCO₂e、45 mL 水和 0,16 mg Sb eq。
推荐理由:Mistral 公布了自家 LLM 从训练到推理的环境足迹数据和三项报告指标,为 AI 环境影响标准化披露提供了参考方法。
Arc Institute 推出 Virtual Cell Challenge,参赛者需训练模型预测 CRISPR 沉默基因在部分未见细胞类型中的效果,即"上下文泛化"任务。
Hugging Face 提出 FutureBench,通过真实世界事件评测 AI 智能体预测未来的能力。该基准从新闻和 Polymarket 预测市场采集题目:基于 smolagents 的智能体用 DeepSeek-V3 生成预测问题,每次抓取约生成 5 道题、时间范围为一周,另有每周约 8 道来自 Polymarket 的问题。
OpenAI 发布研究,探讨在错误回答上训练如何导致语言模型更广泛的不对齐。研究识别出驱动该行为的内部特征,并发现通过极少量微调即可将其逆转。
推荐理由:OpenAI 官方研究探讨错误回答训练如何引发更广泛的模型不对齐,并指出该内部特征可用极少微调逆转,为对齐研究提供了新方向。
Princeton 团队推出长上下文语言模型评测基准 HELMET,已入选 ICLR 2025,共评测 59 个模型,发现合成任务(如 NIAH)与真实下游表现相关性差,前沿长上下文模型在复杂任务上仍受限。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 与 MIT Media Lab 联合开展研究,探索 ChatGPT 上情感化使用与用户情绪健康的早期研究方法。该合作旨在理解用户与 AI 的情感互动及其对情绪健康的影响。
OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。
推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。
OpenAI 发布研究,探讨通过增加推理时计算来提升模型对抗鲁棒性的方法。研究分析了更多推理计算与对抗攻击防御之间的关系。
OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。
推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。
Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。
OpenAI 推出事实性基准 SimpleQA,用于衡量语言模型回答简短事实性问题的能力。
OpenAI 发布论文,对连续时间一致性模型做了简化、稳定化和规模化,仅用两个采样步骤即可达到与领先扩散模型相当的样本质量。
Hugging Face 等团队发布长视频问答数据集 CinePile 2.0,核心改进来自其提出的对抗式数据精炼方法。初代 CinePile 于 2024 年 5 月上线,含约 300,000 训练样本和 5,000 测试样本,人类成绩曾领先最佳商业视觉模型 25%、开源模型 65%。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
OpenAI 开发并应用了一种基于规则的奖励(Rule-Based Rewards,RBRs)新方法,用于对齐模型的安全行为,无需大量人工数据收集。该方法已在 OpenAI 的模型上落地应用。
OpenAI 探讨了 prover-verifier games(证明者-验证者博弈)如何提升语言模型输出的可读性。该方法使 AI 给出的解决方案更清晰、更易验证,对人类和机器而言都更值得信赖。
Hugging Face 报告其基于 Transformers Agents 构建的 ReactCodeAgent 在 GAIA 基准上取得佳绩:验证集得分 44.2%,排名第一,领先第二名 4 分;测试集得分 33.3%,排名第二,超过 Microsoft Autogen 的提交,并在最难的 Level 3 题目上拿到最佳平均分。
OpenAI 介绍了一致性模型训练的改进技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步生成高质量数据样本。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
OpenAI 提出一种整体化方法,用于构建健壮且实用的自然语言分类系统,服务真实世界的内容审核场景。该方案聚焦undesired content(不良内容)检测的实际落地,兼顾系统稳健性与可用性。
OpenAI 使用新的稀疏自编码器扩展技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。
推荐理由:OpenAI 用稀疏自编码器扩展技术从 GPT-4 中提取 1600 万个模式,关注可解释性方向的读者可以了解其规模化路径。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。
推荐理由:原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
Secure Learning Lab 在 Hugging Face 上发布了新的 LLM Safety Leaderboard,专注于大语言模型安全评估,由 HF leaderboard template 驱动。
OpenAI 提出 superalignment 新研究方向,探讨能否利用深度学习的泛化性质,用弱监督者控制强模型。官方表示已获得有希望的初步结果,该方向指向未来超人类水平模型的对齐问题。
Hugging Face 扩展 Open LLM Leaderboard,用 Scale AI 人类标注与 GPT-4 对 Koala-13B、Vicuna-13B、OpenAssistant-12b、Dolly-12b 在 327 条提示的盲测集上做偏好对比,并构建带误差估计的 Elo 排名。