Hugging Face 发布 Idefics2:面向社区的 8B 视觉语言模型,采用 Apache 2.0 许可
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
OpenAI 在 DevDay 发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 Assistants API。GPT-4 Turbo with Vision、DALL·E 3 API 等更多开发者产品一同公布。
推荐理由:官方一次性给出 128K 上下文、降价与多个 API 开放入口,读者可以据此评估是否迁移现有调用与工作流。
OpenAI 发布 GPT-4V(ision) 系统卡,说明其图像输入能力及相关评估情况。抓取内容仅含标题,正文细节不可得。
OpenAI 官方宣布 ChatGPT 新增多模态能力,可以看图、听声音并进行语音对话。正文未能抓取,仅标题信息可用,具体功能细节以原文链接为准。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行零样本分割模型 CLIPSeg。
推荐理由:教程讲清了 CLIPSeg 的零样本分割原理、文本与图像两种提示用法及低分辨率局限,并给出在 Segments.ai 上精修标注的完整流程。
BigScience 项目发布开源多语言大模型 BLOOM,1760 亿参数,可生成 46 种自然语言和 13 种编程语言的文本。训练历时 117 天,在法国 Jean Zay 超算上完成,涉及 70 多国 250 多个机构的 1000 多名研究者。
推荐理由:大语言模型开源和透明训练的代表性案例,说明了开放协作如何让百亿级参数模型走向可研究、可复用。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 发布神经网络 CLIP,可从自然语言监督中高效学习视觉概念。只需提供待识别视觉类别名称,即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,零样本思路可与 GPT 系列对照理解。
OpenAI 推出 Jukebox,一个能以原始音频形式生成多种流派和艺术家风格音乐、包括初阶演唱的神经网络。官方同时发布了模型权重和代码,并提供探索生成样本的工具。
推荐理由:原文说明了模型能以原始音频生成多风格歌曲并开源权重与代码,读者可自行探索生成样本。