跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 84 条
4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗协作智能体研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生监督下辅助患者照护的 AI 智能体。在 98 个真实初级诊疗问题的盲评中 97 例零严重错误,在 RxQA 开放式用药问答上超越现有前沿模型;在 120 次远程医疗模拟会诊中,专家医生整体表现仍优于该系统,但在 140 项评估中有 68 项达到或超过初级保健医生水平,目前定位为辅助工具而非替代临床判断。

    推荐理由:原文同时给出医生端与患者端的评估设计和结果,读者可以据此了解该系统当前的真实边界与局限。

4月28日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型,覆盖文档、语音、视频与 GUI 智能体

    NVIDIA 发布 Nemotron 3 Nano Omni(30B-A3B)全模态理解模型,支持文档分析、ASR、长音视频理解和 agentic computer use,并在 Hugging Face 开放 BF16、FP8 和 NVFP4 权重。

    推荐理由:原文给出完整基准对比和架构细节,读者可以据此评估它是否值得替换现有的多模态工作流。

4月16日周四
  1. Hugging Face Blog63

    Sentence Transformers 多模态嵌入与重排模型训练微调教程:以 Qwen3-VL-Embedding-2B 微调视觉文档检索为例

    Hugging Face 博客讲解如何用 Sentence Transformers 训练和微调多模态嵌入与重排模型,以 Qwen/Qwen3-VL-Embedding-2B 在 Visual Document Retrieval 任务上微调为例。

    推荐理由:作者用 Qwen3-VL 完整走通多模态嵌入微调流程,NDCG@10 从 0.888 提到 0.947,方法可直接迁移到自己的领域数据。

4月9日周四
  1. Hugging Face Blog71

    Sentence Transformers v5.4 发布,支持文本、图像、音频和视频的多模态嵌入与重排

    Hugging Face 发布 Sentence Transformers v5.4,用户可用同一套 API 对文本、图像、音频和视频进行嵌入编码与相关性重排。

    推荐理由:官方教程给出 v5.4 多模态嵌入与重排的完整用法、代码示例和支持模型清单,读者可以直接照着搭建跨模态检索或 RAG 流程。

4月3日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 开源模型,E2B/E4B/26B MoE/31B 四尺寸

    Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。

    推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。

4月2日周四
  1. Hugging Face Blog82

    Google DeepMind 发布 Gemma 4 多模态模型系列并登陆 Hugging Face

    Google DeepMind 发布 Gemma 4 多模态模型系列,共五个尺寸(E2B、E4B、12B Unified、31B、26B A4B MoE),采用 Apache 2.0 许可,支持图像、文本和音频输入,上下文窗口最高 256K。

    推荐理由:Hugging Face 官方详解 Gemma 4 架构、多模态能力与全生态部署方式,还覆盖 DiffusionGemma 和推理加速等上手细节。

4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 0.6B 早融合感知模型及 0.3B Falcon OCR

    TII Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早融合 Transformer,用混合注意力掩码处理图像块与文本,做自然语言提示的开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1(SAM 3 为 62.3),但在 presence calibration 上落后(MCC 0.64 vs 0.82)。

    推荐理由:TII 自述用单一早融合 Transformer 做开放词汇感知,读者可以看到架构、数据配方和 SA-Co 与 PBench 上的具体对比依据。

3月29日周日
  1. Google DeepMind60

    Google DeepMind 探索 AI 指针,将指向交互带入 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的 AI 指针实验项目,提出维持心流、展示即告知、善用 this/that、把像素变成可操作实体四项交互原则,让用户通过指向和语音代替复杂提示词。

    推荐理由:原文给出了AI指针的四项交互原则和落地场景,读者可以据此了解指向加语音如何替代复杂提示词。

3月26日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布实时语音模型 Gemini 3.1 Flash Live,称其为迄今最高质量的音频模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%,均领先前代模型。

    推荐理由:官方给出两项音频基准分数和多产品开放入口,读者可以据此评估它对语音智能体开发的实际改进。

3月18日周三
  1. Google Research76

    Google Research 发表两项 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查工作流

    Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。

    推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。

3月17日周二
3月12日周四
  1. Google Research61

    Google Flood Hub 推出 AI 城市山洪预报,可提前 24 小时预警

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,利用新的 AI 方法可提前最多 24 小时预测城市山洪风险。该模型基于 Groundsource 方法,用 Gemini 分析公开新闻报道构建历史山洪事件数据集,并采用 LSTM 架构的 RNN 训练,仅依赖全球天气产品运行。

    推荐理由:原文给出用 Gemini 从新闻构建训练数据并让南半球达到接近发达国家的预报精度,读者可了解 AI 预警如何弥合警告缺口。

3月4日周三
2月19日周四
1月30日周五
1月28日周三
  1. Google Research68

    Google Research 发布 ATLAS 多语言模型缩放定律,将亮相 ICLR 2026

    Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。

    推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。

1月20日周二
1月6日周二
12月17日周三
  1. Mistral AI63

    Mistral 发布 Mistral OCR 3,文档解析胜率较 Mistral OCR 2 达 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。

    推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。