Mistral 发布 OCR API,文档理解基准领先并可按需自托管
Mistral AI 发布 Mistral OCR 光学字符识别 API,输入图片和 PDF,输出图文交错内容,定位为多模态文档 RAG 系统的解析组件。
推荐理由:官方给出与 Azure OCR、Gemini、GPT-4o 的分项基准对比和定价细节,读者可以据此评估它是否适合替换现有文档解析链路。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Mistral AI 发布 Mistral OCR 光学字符识别 API,输入图片和 PDF,输出图文交错内容,定位为多模态文档 RAG 系统的解析组件。
推荐理由:官方给出与 Azure OCR、Gemini、GPT-4o 的分项基准对比和定价细节,读者可以据此评估它是否适合替换现有文档解析链路。
Hugging Face 发布 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规模,主打让视频理解在手机到服务器等设备上运行。
推荐理由:官方发布三档小尺寸视频理解模型并给出端侧运行方案,读者可以据此评估轻量多模态模型在自己的设备上的可行性。
Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。
推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。
Hugging Face 发布 SmolVLM 家族两款新模型 SmolVLM-256M 和 SmolVLM-500M,各含 base 与 instruct 共 4 个 checkpoint,其中 256M 为迄今最小的 VLM。
推荐理由:官方详述 256M/500M 两款小模型的视觉编码器、数据配比和 tokenization 改动,适合想在受限设备上跑多模态的读者参考选型。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Mistral 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开源权重多模态模型,在 MathVista 达到 69.4%,DocVQA 与 ChartQA 上超过 GPT-4o 和 Gemini-1.5 Pro,LMSys Vision Leaderboard 上领先最近的开放权重模型近 50 ELO。
推荐理由:官方给出关键基准数字和开放下载渠道,读者可以据此判断该多模态模型在图像理解和文本能力上的定位。
OpenAI 宣布开发者现在可以在微调 API 中使用图像和文本对 GPT-4o 进行微调,以提升其视觉能力。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Mistral 发布原生多模态模型 Pixtral 12B,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,以 Apache 2.0 协议开源。
推荐理由:官方披露了架构细节、基准数字和 Apache 2.0 开源协议,读者可以对比同规模开源多模态模型并评估迁移成本。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。