Google Research 推出 AI 视频 Co-Director 多智能体框架,生成连贯的分钟级长视频
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
Google Research 发布 AI 视频 Co-Director 研究,在 Gemini 与 Veo 之上构建统一多智能体框架,通过全局优化与世界状态追踪生成连贯的分钟级多镜头视频。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合的移动模式与文本嵌入融合,帮助语言模型捕捉地点的时间活动节奏。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型在连通性、包围、顺序、分离与绳结五类拓扑概念上的推理与规划能力。测试显示,各类专有和开源模型在静态推理上明显优于交互式规划任务,且均远低于人类水平,错误多出现在多步规划中丢失结构关系或提出违反物理约束的动作。该基准可为机器人和交互环境中需要保持拓扑结构的智能体研究提供诊断工具。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新发布的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),分别高出约 13 分和 16 分以上。
Google Research 提出 SensorFM,一种大型传感器基础模型,基于 500 万名参与者、超过一万亿分钟的多模态可穿戴数据自监督预训练。
Google Research 分享了关于 AI 皮肤健康工具的消费者研究,其中发表于 JAMA Dermatology 的大规模实验让 2,345 名参与者分三组研究皮肤病例。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
Google Research 的 MoGen 模型基于 PointInfinity point cloud flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经元形态,扩充 PATHFINDER 重建模型的训练数据。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。
Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。
Google Research 发布 MapTrace,这是面向多模态大语言模型(MLLM)地图路径追踪任务的新任务、数据集与合成数据生成管线。
Google Research 与 Google DeepMind 在 NeurIPS 2025 工作坊论文中展示,以鸟类等陆生动物声音训练的生物声学基础模型 Perch 2.0,虽未使用水下音频,仍能通过嵌入向量迁移学习对鲸类发声进行分类。
Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。
推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。
Google Research 在 EMNLP 2025 发表的论文提出一种两阶段分解方法,让小型多模态 LLM 在设备端理解用户 UI 交互轨迹:先逐屏总结交互,再从总结序列提取意图。
Google Research 发布年度回顾,介绍 2025 年在 AI、量子计算与科学发现方面的研究进展。Gemini 3 成为其迄今最强、事实性最好的 LLM,在 SimpleQA Verified 与新发布的 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入可动态生成交互界面的 generative UI;Gemma 多语言扩展至 140+ 种语言。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。
密苏里大学研究人员结合冷冻电镜与 AlphaFold,解析了'坏胆固醇'LDL 核心蛋白 apoB100 的结构,该蛋白困扰科学界约 50 年。模型显示 apoB100 形成包裹 LDL 颗粒的笼状外壳和维持颗粒完整性的带状结构,为高胆固醇和动脉粥样硬化性心血管疾病(ASCVD)的预防、诊断与治疗提供新方向。
Google DeepMind 在 Nature 发表论文,分析 AI 视觉模型组织视觉世界的方式与人类不同,并提出一种对齐方法。该方法基于预训练模型 SigLIP-SO400M 和包含数百万条人类“找出不同项”判断的 THINGS 数据集,训练教师模型后生成百万图像规模的新数据集 AligNet,再用其微调学生模型。对齐后的模型内部表征按类别清晰组织,鲁棒性和泛化能力得到提升。
Google DeepMind 发布三项生物圈研究:与 World Resources Institute 合作建立基于 vision transformers 的森林砍伐风险预测模型,分辨率达 1km²、预测可细至 30 米,覆盖 2000-2024 年,并发布预测基准数据集。
Google Research 与 World Resources Institute 合作发布 ForestCast,一个基于纯卫星数据、用 vision transformers 预测森林砍伐风险的深度学习模型,准确度可持平或超过依赖道路等专用输入的现有方法。
Google Research 在 UIST'25 上发布 StreetReaderAI,一个基于 Gemini 的无障碍街景概念验证原型,可为盲人和低视力用户提供实时 AI 场景描述与对话导航。
Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。
推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口分布的开源合成人物数据集,采用 CC BY 4.0 许可。数据集包含 2100 万个人物(3M 记录 × 7 人物),共 7.7 billion tokens,支持英语和印地语(天城文与拉丁字母),覆盖全部 36 个邦和 640 个地区。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Hugging Face 团队推出 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种语言,包含 Cultural Knowledge、Classical NLP、Reading Comprehension 和 Generation 四大类共 12 项任务,并据此评估了 20 多个主流 LLM。
Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
Hugging Face 等团队发布长视频问答数据集 CinePile 2.0,核心改进来自其提出的对抗式数据精炼方法。初代 CinePile 于 2024 年 5 月上线,含约 300,000 训练样本和 5,000 测试样本,人类成绩曾领先最佳商业视觉模型 25%、开源模型 65%。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 开发出 Sparse Transformer,一种在文本、图像和声音等序列预测任务上创造新纪录的深度神经网络。它通过对注意力机制的算法改进,可从比以往长 30 倍的序列中提取模式。