跳到正文

#多模态

今日 4 条
11月19日周三
11月14日周五
11月11日周二
  1. Google DeepMind50

    Google DeepMind 研究:让 AI 视觉表征更接近人类的方式看世界

    Google DeepMind 在 Nature 发表论文,分析 AI 视觉模型组织视觉世界的方式与人类不同,并提出一种对齐方法。该方法基于预训练模型 SigLIP-SO400M 和包含数百万条人类“找出不同项”判断的 THINGS 数据集,训练教师模型后生成百万图像规模的新数据集 AligNet,再用其微调学生模型。对齐后的模型内部表征按类别清晰组织,鲁棒性和泛化能力得到提升。

11月6日周四
11月5日周三
10月30日周四
10月28日周二
  1. Google Research51

    Google 基于 Gemini 构建 Fitbit 个人健康教练并开启公测

    Google 推出由 Gemini 模型驱动的个人健康教练,从次日起向符合条件的美国 Fitbit Premium Android 用户开放自愿参与的公开预览,并将很快扩展到 iOS。系统采用多智能体框架(对话、数据科学、领域专家子智能体),基于 SHARP 评测框架进行验证,涉及超 100 万条人工标注和超 10 万小时专家评估。

10月23日周四
  1. Google Research62

    Google 发布 Earth AI 技术论文,详解基础模型与跨模态地理空间推理

    Google 发布 Google Earth AI 相关技术论文,介绍新的 Imagery 与 Population 基础模型,以及由 Gemini 驱动的 Geospatial Reasoning 智能体,用于多步地理空间问答。

    推荐理由:官方同步放出技术论文和评测数字,读者可以据此了解跨模态地理空间推理的实际能力边界与应用案例。

10月21日周二
  1. Hugging Face Blog64

    Hugging Face AI Sheets 新增视觉能力,支持图像提取、生成与编辑

    Hugging Face 宣布其开源无代码工具 AI Sheets 新增视觉支持,可在表格中分析图片、提取结构化数据、从文本生成图像并用 Qwen-Image-Edit 等模型编辑图像。

    推荐理由:官方发布带来图像提取、生成与编辑能力,教程演示了手写菜谱数字化等具体用法,便于读者评估是否引入自己的数据工作流。

10月14日周二
10月2日周四
9月23日周二
9月22日周一
9月15日周一
  1. Hugging Face Blog46

    Hugging Face Gradio 新增可见水印功能

    Hugging Face 让 Gradio 中的可见水印变得极其简单:创建 Space 中的应用或 demo 时,用一行命令即可添加水印。图片和视频通过 gr.Image 或 gr.Video 的 watermark 参数指定水印,支持文件名、在线图片或 numpy 数组;AI 生成的文本可通过 gr.Chatbot 的 watermark 参数,在用户复制 AI 回复时自动附上署名。

9月9日周二
8月12日周二
8月7日周四
8月1日周五
7月23日周三
  1. Hugging Face Blog53

    Hugging Face 发布 TimeScope 长视频理解基准

    Hugging Face 发布开源基准 TimeScope,将约 5-10 秒的短视频"针"插入 1 分钟到 8 小时的基础视频中,评测局部检索、信息综合和细粒度时序感知三类能力。测试发现多数先进模型在真实时序任务上仍吃力,Gemini 2.5-Pro 是唯一在超过一小时视频上保持高准确率的模型,而扩大参数量并不能延长模型的有效时序范围。数据集、排行榜和 lmms-eval 评测框架均已开源。

7月17日周四
  1. Mistral AI59

    Mistral Le Chat 上线 Deep Research、语音模式、Projects 等多项新功能

    Mistral 为 Le Chat 推出一批新功能,包括预览版 Deep Research 研究报告模式、基于 Voxtral 模型的语音模式、由 Magistral 驱动的多语言推理 Think 模式、按上下文组织对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。新功能已在 chat.mistral.ai 和移动应用开放使用,无需信用卡。

7月8日周二
6月28日周六
6月26日周四
  1. Hugging Face Blog73

    Gemma 3n 正式登陆开源生态,发布 E2B 与 E4B 两档端侧多模态模型

    Google Gemma 3n 正式开源,发布 E2B 和 E4B 两个尺寸、各含 base 与 instruct 版本,支持图像、文本、音频和视频输入。E2B/E4B 实际参数为 5B/8B,但借助 MatFormer 架构与 Per-Layer Embeddings,仅需 2GB/3GB GPU 内存即可运行,E4B 还在 LMArena 上取得 1300+ 分数。

    推荐理由:原文给出模型的有效参数设计、显存需求和各开源库用法,端侧开发者可以据此选择部署方式。

6月3日周二
5月21日周三
5月12日周一
5月7日周三
4月24日周四
4月23日周三
4月16日周三
4月11日周五
4月5日周六
  1. Hugging Face Blog80

    Meta 发布 Llama 4 Maverick 与 Scout,Hugging Face 同步上线权重与生态支持

    Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。

    推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。

3月17日周一
3月12日周三
3月11日周二