Mistral 发布首个代码模型 Codestral,22B 开源权重并支持 80+ 编程语言
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
Mistral AI 推出 Mistral AI 非生产许可(MNPL),允许开发者将技术用于非商业目的和科研工作,Codestral 当日即在该许可下发布。公司表示将继续在 Apache 2.0 下发布模型和代码,逐步形成两个许可家族并行,以在开放原则与商业化之间取得平衡。
推荐理由:官方说明 MNPL 许可的适用范围和与 Apache 2.0 并行的策略,可帮助开发者判断商用与研究的合规边界。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 发布通用多模态模型 Idefics2,参数量 8B,权重以 Apache 2.0 许可开源,支持任意图文序列输入,可回答图像问题、描述视觉内容、从文档提取信息和执行基础算术。
推荐理由:官方发布 8B 开源多模态模型并给出基准对比和训练数据,读者可以直接在 Hub 和 transformers 中上手微调。
Google 与 Hugging Face 合作发布 CodeGemma,包含专注代码填充的 2B 基座、混合代码与自然语言的 7B 基座,以及 7B Instruct 对话版本,均支持 8K 上下文。
推荐理由:原文给出三个模型规格、基准对比与 FIM 提示词格式,读者可以据此选择适合延迟、显存或对话场景的版本。
Hugging Face 博客介绍 embedding 量化方法,展示二值量化可将内存与磁盘占用降至 1/32、检索最快提速 45x,配合 rescoring 可保留约 96% 的检索性能;int8 标量量化占用为 1/4、平均提速 3.66x。
推荐理由:原文给出 embedding 量化的原理、代码与实测数据,读者可以照此在检索场景中权衡内存、速度与精度。
Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。
推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。
推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。
Hugging Face 在 PEFT 中为 LoRA adapter 新增多種合并方法,可通过 add_weighted_adapter() 调用,包括 cat、linear、svd、ties、dare_linear、dare_ties、magnitude_prune 及其 svd 变体。
推荐理由:官方详细介绍 PEFT 新增的多种 LoRA 合并方法及代码示例,还给出不同场景下的实测选择建议,便于直接复用。
Hugging Face 宣布与 Google Cloud 建立战略合作伙伴关系,围绕开放科学、开源和云硬件展开合作。
推荐理由:来自当事方官方公告,讲清了合作的四个方向和具体落地场景,读者可了解 Hugging Face 模型在 Google Cloud 上的可用路径。
Hugging Face 博客介绍社区开发的轻量微调库 Unsloth,与 Hub、transformers、PEFT、TRL 完全兼容,可配合 SFTTrainer、DPOTrainer、PPOTrainer 使用。
推荐理由:原文给出 Unsloth 与 TRL 的完整用法和 59 组基准数据,微调提速与显存收益可直接迁移到自己的 QLoRA 工作流。
Hugging Face 发布 SDXL Dreambooth LoRA 进阶训练社区指南,将 Replicate SDXL Cog trainer 的 Pivotal Tuning 与 Kohya trainer 使用的 Prodigy 优化器等多项优化组合,脚本已在 diffusers 开源并提供 Colab 与 Spaces 入口。
推荐理由:官方博客给出把 Pivotal Tuning 与 Prodigy 优化器组合进 SDXL Dreambooth LoRA 训练的完整做法与实验对比,参数可直接复用。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Mistral 发布 Mixtral 8x7B,一个采用 Mixture of Experts 架构的开放模型,在多数基准上超越 Llama 2 70B 并达到或超过 GPT-3.5,MT-Bench 得分 8.30。
推荐理由:Mixtral 8x7B 以 MoE 架构达到开放模型新高度,本文同时给出生态内的推理、量化、微调与部署路径,方法可直接照做。
Hugging Face 与 LCM 团队发布 LCM LoRA,通过训练少量 LoRA 适配层而非完整蒸馏模型,让 Stable Diffusion 和 SDXL 的推理步数从 25-50 步降到 4-8 步。
推荐理由:LCM LoRA 只训练少量适配层就能让任意 SDXL 微调模型 4 步出图,文中给出 diffusers 代码和多硬件基准,方法可直接复用。
Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。
推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。