Hugging Face 为 tokenizer 引入 chat_template 属性解决聊天格式不匹配问题
Hugging Face 宣布 tokenizers 新增 chat_template 属性,用于保存模型训练时的对话格式,避免因格式不匹配导致难以察觉的性能严重下降。
推荐理由:原文指出对话格式不匹配会导致静默性能下降,并给出将 Jinja 聊天模板随 tokenizer 保存和使用的具体做法。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 宣布 tokenizers 新增 chat_template 属性,用于保存模型训练时的对话格式,避免因格式不匹配导致难以察觉的性能严重下降。
推荐理由:原文指出对话格式不匹配会导致静默性能下降,并给出将 Jinja 聊天模板随 tokenizer 保存和使用的具体做法。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。
Mistral AI 发布首个模型 Mistral 7B,在标准英文和代码基准上超越所有现有 13B 参数以下的开放模型,权重以 Apache 2.0 许可开放。官方称 MMLU 上超过 60% 的最小模型在两年内从 280B 的 Gopher 缩小到 7B,并同步开设 GitHub 仓库和 Discord 频道推进社区协作。
推荐理由:官方阐述开源模型路线并给出 MMLU 演进脉络,读者可借此理解 7B 小模型与专有模型的差距变化。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,为 Stable Diffusion XL 推出 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的 checkpoints。
推荐理由:原文给出 T2I-Adapter-SDXL 与 ControlNet 的参数量对比、训练配置和完整用法代码,读者可以据此评估并直接上手使用。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。
推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。
Hugging Face 发布开源视觉语言模型 IDEFICS,是 DeepMind 未公开的 Flamingo 的开放复现,接受任意图像和文本序列输入并生成文本,在多个图像文本理解基准上与原闭源模型表现相当。
推荐理由:原文说明了 IDEFICS 基于 Flamingo 的复现路线、参数规模与完全公开数据的训练方式,适合关注开源多模态模型生态的读者。
Hugging Face 发布 swift-transformers 等 alpha 工具,帮助 Swift 开发者在 Apple 设备上用 Core ML 运行 Llama 2 等语言模型。
推荐理由:官方一手发布了在 Apple 设备上跑 LLM 的 Swift 工具链,并给出 Core ML 转换、优化和已知坑的实操经验。
Apple 与 Hugging Face 将 Stable Diffusion XL 移植到 Core ML,发布完整 pipeline 和 mixed-bit palettization 量化版本,UNet 以平均 4.5 位压缩后体积从 4.8GB 降至 1.4GB(减少 71%)。
推荐理由:原文给出 Stable Diffusion XL 在 Mac 上的 Core ML 移植细节、压缩到 4.5 位后体积从 4.8GB 降到 1.4GB 的数据,以及可复用的混合位宽量化方法。
Meta 发布 Llama 2 系列开放模型,包含 7B、13B、70B 预训练及微调版本,采用可商用的 Llama 2 许可证,Hugging Face 同步完成集成并上线全部 12 个模型。
推荐理由:官方完整梳理了 Llama 2 的许可、规格与 HF 生态推理微调路径,读者可据此快速上手开源替代方案。
Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。
推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。
Apple 在 WWDC'23 中更新 Core ML 与 coremltools 的压缩优化能力,配合开源仓库 ml-stable-diffusion,支持将 Stable Diffusion 量化为 8/6/4/2-bit palettization,推荐 6-bit 以在精度损失很小的前提下加快推理并节省内存。
推荐理由:作者亲测 6-bit palettization 带来的生成速度提升,并给出完整转换命令和 Hub 模型,读者可按步骤迁移到自己微调的模型。
Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。
推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。
阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布 Falcon-7B 和 Falcon-40B 模型,40B 版当时位列 Open LLM Leaderboard 第一。
推荐理由:原文由 Hugging Face 实测 Falcon 的推理、量化与 QLoRA 微调,并给出显存需求和代码,可直接迁移到自己的部署流程。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持 4bit 量化加载,并集成 Dettmers 等人新提出的 QLoRA 微调方法。
推荐理由:官方详细讲解 transformers 中 4bit 量化和 QLoRA 的用法与配置,附带在消费级 GPU 上微调 Llama 7B/13B 的实测结果。
RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。
推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。