更新的模型同样的优势:DharmaOCR 仍领先 Mistral OCR4 与 Unlimited-OCR
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新发布的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),分别高出约 13 分和 16 分以上。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新发布的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),分别高出约 13 分和 16 分以上。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
Google DeepMind 在印度推出 ATL Saathi 试点,这是一款基于 Gemini 的教育 Web 应用,为 Atal Tinkering Labs 教师提供 24/7 的备课与培训助手。
Google Research 提出 SensorFM,一种大型传感器基础模型,基于 500 万名参与者、超过一万亿分钟的多模态可穿戴数据自监督预训练。
Mistral AI 发布首款具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机加自然语言指令即可自主导航,R2R-CE validation unseen 成功率 76.6%,validation seen 为 79.4%,比最佳单相机方案高 9.7 分,比最佳深度或多相机系统高 4.5 分。
Google Research 将建筑级屋顶反照率数据扩展至 9 个国家的 50 多座城市,包括伦敦、里约热内卢和纽约,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。
Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。
推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
Google 发布 Farmscapes 的矢量化数据集,将英格兰高分辨率地图转化为可操作的树篱、石墙和小片林地清单,用于英国景观修复与碳核算。
Google Research 分享了关于 AI 皮肤健康工具的消费者研究,其中发表于 JAMA Dermatology 的大规模实验让 2,345 名参与者分三组研究皮肤病例。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,提供 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者数秒。
推荐理由:官方发布正文给出了 70+ 语言、延迟表现和多端开放入口,读者可据此评估它在通话、会议和翻译场景的可用性。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,通过深度学习在后台估计心率,相比 ECG 的 MAPE 为 6.09%,日静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm。研究覆盖近 700 名不同肤色参与者,是迄今最大规模的 rPPG 研究,并公开发布数据集与预训练 PHRM-mini 模型供合格研究者申请使用。
推荐理由:原文给出跨肤色验证数据与免费开放的数据集和模型入口,研究者可以据此评估rPPG方法的可复用性。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、12 种语言显式训练覆盖、自定义策略执行和可审计推理轨迹统一到一次推理调用中。
Hugging Face 在 DharmaOCR 训练中把 DPO 用于聊天对齐之外的场景:用模型自身失败产生的退化循环构建拒绝对,作为第二训练阶段降低结构化 OCR 的文本退化率。
Google Research 在 I/O 2026 上发布 Gemini for Science,包含基于 ERA 和 AlphaEvolve 构建的 Computational Discovery。
Hugging Face 发布 OlmoEarth v1.1,新一代对地观测模型家族,计算成本最高降低 3x,同时在研究基准和合作任务上保持 v1 的性能。效率提升来自减少 token 序列长度:将 Sentinel-2 三个分辨率的 token 合并为单个 token,并通过修改预训练方法避免性能下降。新家族提供 Base、Tiny、Nano 三种规格,权重和训练代码已开放获取。
PaddleOCR 3.5 通过新增 engine 参数让支持的模型(如 PP-OCRv5、PaddleOCR-VL 1.5)可用 Hugging Face Transformers 作为推理后端,并提供 engine_config 配置 dtype、设备与 attention 实现等选项。
Google DeepMind 在 Project Genie 中推出 Street View 街景落地能力,用户可选美国地点并套用 Ocean World、B&W film 等风格生成可交互世界,底层由 Maps Imagery Grounding 支撑。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并支持自然语言多轮编辑。
推荐理由:官方说明了视频生成与对话式编辑的具体能力和订阅范围,读者可以据此判断它是否适配现有创作流程。
Google 于 2026 年 5 月宣布扩展内容透明度与验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud。
推荐理由:原文给出 SynthID 验证入口扩展和 C2PA 检测的具体落地范围,读者可以据此了解内容溯源工具在自家产品中的可用变化。
Stanford 大学医学院 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从已有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发布 Gemini 3.5 模型系列,首个型号 3.5 Flash 当天全量开放,3.5 Pro 预计下月推出。
推荐理由:官方正文给出具体基准分数、速度对比和开放渠道,读者可据此评估 3.5 Flash 在智能体与编码场景的实用性。
Google Research 阐述其开放科学理念,通过开源工具、开放数据集与全球科研合作推动科学进步,已服务超过 250,000 名研究者和开发者。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生监督下辅助患者照护的 AI 智能体。在 98 个真实初级诊疗问题的盲评中 97 例零严重错误,在 RxQA 开放式用药问答上超越现有前沿模型;在 120 次远程医疗模拟会诊中,专家医生整体表现仍优于该系统,但在 140 项评估中有 68 项达到或超过初级保健医生水平,目前定位为辅助工具而非替代临床判断。
推荐理由:原文同时给出医生端与患者端的评估设计和结果,读者可以据此了解该系统当前的真实边界与局限。
NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。
推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。
Google Research 的 MoGen 模型基于 PointInfinity point cloud flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经元形态,扩充 PATHFINDER 重建模型的训练数据。
Hugging Face 博客讲解如何用 Sentence Transformers 训练和微调多模态嵌入与重排模型,以 Qwen/Qwen3-VL-Embedding-2B 在 Visual Document Retrieval 任务上微调为例。
推荐理由:作者用 Qwen3-VL 完整走通多模态嵌入微调流程,NDCG@10 从 0.888 提到 0.947,方法可直接迁移到自己的领域数据。
Google DeepMind 发布 Gemini Robotics-ER 1.6,面向机器人的具身推理模型,在指向、计数、成功检测等空间与物理推理上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 明显提升,并新增仪表读取能力,可解读压力表和视镜。
Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。
推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。
Google Research 推出两个学术智能体框架:PaperVizAgent(原 PaperBanana)用于从论文文本生成可发表的学术图表,ScholarPeer 则自动执行严格的同行评审。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。
推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。
TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。
推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。
IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的小型视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 上,主打表格提取、图表理解和语义键值对提取。
Google DeepMind 发布由 Gemini 驱动的 AI 指针实验项目,提出维持心流、展示即告知、善用 this/that、把像素变成可操作实体四项交互原则,让用户通过指向和语音代替复杂提示词。
推荐理由:原文给出了AI指针的四项交互原则和落地场景,读者可以据此了解指向加语音如何替代复杂提示词。
Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。
推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。
Google DeepMind 推出 Lyria 3 Pro,可生成最长 3 分钟的曲目,并支持按前奏、主歌、副歌、桥段等结构元素定制。模型已进入 Vertex AI 公开预览、AI Studio 与 Gemini API、Google Vids、Gemini 应用和 ProducerAI;输出均嵌入 SynthID 水印,且不模仿具名艺术家。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,将建成环境栅格化为多层级特征图像,再用 masked autoencoding 学习通用地理位置嵌入。评测显示 S2Vec 在零样本地理外推任务(如全美人口密度、中位收入预测)上通常是表现最好的单一模型,与图像嵌入做多模态融合后整体优于任一单一模态,但在树冠覆盖、海拔等环境类任务上仍需改进。
Google Research 在 The Check Up 活动上展示其在医疗健康领域的最新 AI 进展。