跳到正文

#多模态

今日 2 条
3月18日周三
  1. Google Research76

    Google Research 发表两项 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查工作流

    Google Research 联合多家 NHS 机构开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。

    推荐理由:两项 Nature Cancer 研究同时给出大规模独立性能数据和真实双读工作流对比,读者能看到 AI 替代第二阅片人的收益与人工仲裁推翻 AI 的具体代价。

3月17日周二
3月12日周四
  1. Google Research61

    Google Flood Hub 推出 AI 城市山洪预报,可提前 24 小时预警

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,利用新的 AI 方法可提前最多 24 小时预测城市山洪风险。该模型基于 Groundsource 方法,用 Gemini 分析公开新闻报道构建历史山洪事件数据集,并采用 LSTM 架构的 RNN 训练,仅依赖全球天气产品运行。

    推荐理由:原文给出用 Gemini 从新闻构建训练数据并让南半球达到接近发达国家的预报精度,读者可了解 AI 预警如何弥合警告缺口。

3月7日周六
  1. Google Research50

    谷歌开源模型 SpeciesNet 如何识别野生动物相机陷阱影像

    Google 开发的开源 AI 模型 SpeciesNet 可对相机陷阱图像中约 2,500 类(2,498 类)动物进行分类,训练数据超过 6500 万张标注图像。模型在留出测试集上能找出 99.4% 含动物的图像,可识别到物种级的预测中 94.5% 正确,标准笔记本每天约可处理 3 万张图像。过去一年,全球研究团队已用它在坦桑尼亚塞伦盖蒂、哥伦比亚、澳大利亚等地分析数百万张野生动物影像。

3月4日周三
2月19日周四
2月18日周三
2月10日周二
2月5日周四
2月4日周三
  1. Google Research55

    Google Research 与 Included Health 合作开展全国范围医疗 AI 随机对照研究

    Google Research 宣布与 Included Health 合作,待 IRB 批准后启动一项全国范围、经参与者知情同意的随机对照研究,在真实虚拟诊疗流程中评估其对话式 AI。研究基于 AMIE 诊断推理、个人健康智能体(PHA)和信息导航等前期工作,此前与 Beth Israel Deaconess Medical Center 的单中心可行性研究已观察到安全性方面的积极迹象。

1月30日周五
1月28日周三
  1. Google Research68

    Google Research 发布 ATLAS 多语言模型缩放定律,将亮相 ICLR 2026

    Google Research 发布 ATLAS(Adaptive Transfer Scaling Laws),迄今最大规模公开多语言预训练研究,覆盖 774 次训练、10M–8B 参数模型、400+ 语言数据和 48 语言评测。

    推荐理由:原文给出多语言训练的跨语言迁移矩阵和预训练与微调的token分界点,开发者可据此规划语言混合与算力预算。

1月23日周五
1月22日周四
1月20日周二
1月16日周五
1月14日周三
1月6日周二
12月24日周三
12月19日周五
12月17日周三
  1. Mistral AI63

    Mistral 发布 Mistral OCR 3,文档解析胜率较 Mistral OCR 2 达 74%

    Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。

    推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。

12月12日周五
12月11日周四
  1. OpenAI News74

    OpenAI 发布 GPT-5.2:面向专业工作的前沿模型

    OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。

12月9日周二
12月5日周五
12月4日周四
  1. Google Research37

    Google 发布 Massive Sound Embedding Benchmark(MSEB):面向听觉智能的新基准

    Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。

12月3日周三
  1. Mistral AI82

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3 全系开源

    Mistral 发布 Mistral 3 系列模型,包括 41B 激活、675B 总参数的 MoE 模型 Mistral Large 3,以及 3B/8B/14B 三种尺寸的 Ministral 3 小模型,全部以 Apache 2.0 协议开源。

    推荐理由:官方发布涵盖 Large 3 与 Ministral 3 全系的参数规模、开源协议和部署途径,读者可以据此判断各档模型适合的场景。

11月25日周二
  1. Google DeepMind59

    AlphaFold 助力解析心脏病关键蛋白 apoB100 结构

    密苏里大学研究人员结合冷冻电镜与 AlphaFold,解析了'坏胆固醇'LDL 核心蛋白 apoB100 的结构,该蛋白困扰科学界约 50 年。模型显示 apoB100 形成包裹 LDL 颗粒的笼状外壳和维持颗粒完整性的带状结构,为高胆固醇和动脉粥样硬化性心血管疾病(ASCVD)的预防、诊断与治疗提供新方向。

11月24日周一
11月20日周四
  1. Google DeepMind80

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 的高保真图像生成与编辑模型,已开始在 Google AI Studio 和 Vertex AI 面向付费预览推出。

    推荐理由:官方发布文给出了模型能力细节、2K/4K 分辨率、接入渠道和定价定位,开发者可据此评估是否切换或叠加使用。

11月19日周三
11月14日周五
11月11日周二
  1. Google DeepMind50

    Google DeepMind 研究:让 AI 视觉表征更接近人类的方式看世界

    Google DeepMind 在 Nature 发表论文,分析 AI 视觉模型组织视觉世界的方式与人类不同,并提出一种对齐方法。该方法基于预训练模型 SigLIP-SO400M 和包含数百万条人类“找出不同项”判断的 THINGS 数据集,训练教师模型后生成百万图像规模的新数据集 AligNet,再用其微调学生模型。对齐后的模型内部表征按类别清晰组织,鲁棒性和泛化能力得到提升。

11月6日周四