Google 发布视觉语言模型 PaliGemma 2,含 3B、10B、28B 三种规模
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
OpenAI 展示如何通过 GPT-4o 的视觉微调能力构建更智能的地图。文章介绍了利用 GPT-4o vision fine-tuning 提升地图相关视觉任务效果的方法。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
Hugging Face 等团队发布长视频问答数据集 CinePile 2.0,核心改进来自其提出的对抗式数据精炼方法。初代 CinePile 于 2024 年 5 月上线,含约 300,000 训练样本和 5,000 测试样本,人类成绩曾领先最佳商业视觉模型 25%、开源模型 65%。
OpenAI 宣布开发者现在可以在微调 API 中使用图像和文本对 GPT-4o 进行微调,以提升其视觉能力。
Hugging Face 发布教程,讲解如何将顶点着色网格转换为 UV 映射的带贴图网格,并开源了 InstantTexture 库实现一键转换。教程详解用 xatlas 生成 UV 映射、通过重心插值填充 1024 尺寸纹理,再结合 inpainting、中值滤波、高斯模糊和降采样消除纹理孔洞。这类顶点着色网格常见于 InstantMesh 等生成式 3D 模型的输出。
OpenAI 升级 Moderation API,推出一款基于 GPT-4o 构建的新多模态审核模型,能更准确地检测有害文本和图像。该模型面向开发者开放,用于构建更稳健的内容审核系统。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Mistral 发布原生多模态模型 Pixtral 12B,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,以 Apache 2.0 协议开源。
推荐理由:官方披露了架构细节、基准数字和 Apache 2.0 开源协议,读者可以对比同规模开源多模态模型并评估迁移成本。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Mistral AI 发布 Mistral Large 2(版本 24.07,API 名称 mistral-large-2407),参数量 123B,拥有 128k 上下文窗口,MMLU 预训练准确率 84.0%。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
视觉演示软件公司 Prezi 加入了 Hugging Face Expert Support Program,由专属专家协助其将更小、更高效的开源模型整合进 ML 工作流,包括在管线中引入开源 re-ranker 模型,以比 LLM 更便宜、更快、更好地为演示文稿匹配图片与文本。
TII 发布开源模型系列 Falcon 2,包含 11B 基础 LLM 和具备图像理解能力的 11B VLM,训练数据超过 5000B token,支持英语及另外 10 种语言。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Hugging Face 发布视觉语言模型入门教程,介绍其图像编码器、投影层与文本解码器等核心结构,并列出 LLaVA 1.6、KOSMOS-2、Qwen-VL 等开源模型。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名。文章讲解了 IoU、AP、AR 等指标的计算方法,并指出评测中可能导致不同报告结果不一致的偏差与陷阱。开发者可据此在数百个开源模型中挑选最适合自身应用的目标检测模型。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Hugging Face 在 Habana Gaudi2 上对 866M 参数的视觉语言模型 BridgeTower Large 进行微调加速。基于 Optimum Habana v1.7,配合硬件加速数据加载,Gaudi2 微调速度达到 A100 的 2.5 倍、H100 的 1.4 倍,吞吐最高达 768.7 samples/s。这些数据加载优化技术同样适用于其他受数据加载瓶颈约束的视觉模型。
OpenAI 发文介绍 Be My Eyes 应用使用 GPT-4 改善视觉无障碍体验。正文仅给出核心信息,未提供更多细节。
冰岛正使用 OpenAI 的 GPT-4 来保护冰岛语。这一合作旨在让这门使用人数较少的语言在 AI 时代得以传承和延续。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 博客复盘志愿者团队在 2023 年 2 月土耳其地震后开发 afetharita 应用的过程:用 easyocr 加微调 NER 模型从求助推文截图提取姓名、电话和地址,用 bert-base-turkish 系列微调文本分类模型识别庇护、食物、物流等需求,并将地址经地理编码 API 显示在地图上。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。