LlamaIndex 与 Hugging Face 发布多语言视觉文档检索模型 vdr-2b-multi-v1
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
LlamaIndex 与 Hugging Face 发布多语言视觉文档检索嵌入模型 vdr-2b-multi-v1 及英文版 vdr-2b-v1,可直接对文档页截图编码检索,无需 OCR、数据抽取管线或分块。
TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B、7B、10B 和 Mamba-7B 五个基座模型,均低于 10B 参数。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
OpenAI 展示如何通过 GPT-4o 的视觉微调能力构建更智能的地图。文章介绍了利用 GPT-4o vision fine-tuning 提升地图相关视觉任务效果的方法。
BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
Hugging Face 等团队发布长视频问答数据集 CinePile 2.0,核心改进来自其提出的对抗式数据精炼方法。初代 CinePile 于 2024 年 5 月上线,含约 300,000 训练样本和 5,000 测试样本,人类成绩曾领先最佳商业视觉模型 25%、开源模型 65%。
OpenAI 宣布开发者现在可以在微调 API 中使用图像和文本对 GPT-4o 进行微调,以提升其视觉能力。
Hugging Face 发布教程,讲解如何将顶点着色网格转换为 UV 映射的带贴图网格,并开源了 InstantTexture 库实现一键转换。教程详解用 xatlas 生成 UV 映射、通过重心插值填充 1024 尺寸纹理,再结合 inpainting、中值滤波、高斯模糊和降采样消除纹理孔洞。这类顶点着色网格常见于 InstantMesh 等生成式 3D 模型的输出。
OpenAI 升级 Moderation API,推出一款基于 GPT-4o 构建的新多模态审核模型,能更准确地检测有害文本和图像。该模型面向开发者开放,用于构建更稳健的内容审核系统。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Mistral 发布原生多模态模型 Pixtral 12B,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,以 Apache 2.0 协议开源。
推荐理由:官方披露了架构细节、基准数字和 Apache 2.0 开源协议,读者可以对比同规模开源多模态模型并评估迁移成本。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Mistral AI 发布 Mistral Large 2(版本 24.07,API 名称 mistral-large-2407),参数量 123B,拥有 128k 上下文窗口,MMLU 预训练准确率 84.0%。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
视觉演示软件公司 Prezi 加入了 Hugging Face Expert Support Program,由专属专家协助其将更小、更高效的开源模型整合进 ML 工作流,包括在管线中引入开源 re-ranker 模型,以比 LLM 更便宜、更快、更好地为演示文稿匹配图片与文本。
TII 发布开源模型系列 Falcon 2,包含 11B 基础 LLM 和具备图像理解能力的 11B VLM,训练数据超过 5000B token,支持英语及另外 10 种语言。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。
推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。
OpenAI 发布 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。
推荐理由:OpenAI 官方宣布 GPT-4o,并提及免费用户可用性变化,适合想了解该模型基本定位的读者。
OpenAI 宣布推出最新旗舰模型 GPT-4o,并在 ChatGPT 中向免费用户开放更多能力。发布同时带来更多工具供免费用户使用。
推荐理由:OpenAI 官宣新旗舰模型,并说明同步向免费用户开放更多 ChatGPT 能力,适合关注模型可用范围变化。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Hugging Face 发布视觉语言模型入门教程,介绍其图像编码器、投影层与文本解码器等核心结构,并列出 LLaVA 1.6、KOSMOS-2、Qwen-VL 等开源模型。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Hugging Face 发布 AI 水印入门博客,讲解图像、文本和音频内容的加水印方法及优缺点。文中介绍生成时嵌入与生成后添加两大类方法、Nightshade 与 Glaze 等图像防滥用工具、基于红绿 token 的 LLM 文本水印,以及 AudioSeal 语音水印,并列出 Hub 上 IMATAG、Truepic 等相关工具,同时指出文本检测在文本较短或模型未知时可靠性有限。
OpenAI 在 DevDay 发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 Assistants API。GPT-4 Turbo with Vision、DALL·E 3 API 等更多开发者产品一同公布。
推荐理由:官方一次性给出 128K 上下文、降价与多个 API 开放入口,读者可以据此评估是否迁移现有调用与工作流。
Hugging Face 发布教程,介绍如何 fork 并配置 AI Comic Factory,通过 Inference API 部署到自己的私有 Space,避免长时间排队。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。